پرش به محتوای اصلی
پرش به محتوای مقاله

انویدیا با DeepStream 9.1 استقرار بینایی سه‌بعدی را عامل‌محور کرد

·۲۸ تیر ۱۴۰۵۵ دقیقه مطالعه
انویدیا دیپ‌استریم ۹.۱ را منتشر کرد: هوش مصنوعی عاملی با ۱۳ مهارت و ردیابی سه‌بعدی چندنمایی
انویدیا دیپ‌استریم ۹.۱ را منتشر کرد: هوش مصنوعی عاملی با ۱۳ مهارت و ردیابی سه‌بعدی چندنمایی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی کامل پیکربندی دستی و کالیبراسیون فیزیکی دوربین‌ها با یک میکروسرویس خودکار (AMC) و امکان مدیریت کل خط‌لوله استنتاج از طریق دستورات زبان طبیعی توسط عامل‌های AI.

تصور کنید می‌خواهید یک فرد را در فضای یک انبار غول‌پیکر با ۲۰ دوربین مختلف ردیابی کنید، اما مجبورید ساعت‌ها وقت صرف تنظیم دستی زوایای هر دوربین کنید تا سیستم دچار خطا نشود. انویدیا (NVIDIA) با معرفی DeepStream 9.1، این کابوس پیکربندی دستی را به پایان داد و استقرار تحلیل‌های ویدئویی را از یک فرآیند پیکربندی دستی به یک استقرار عامل‌محور (Agent-driven) تبدیل کرد.

در تحلیل‌های ویدئویی سنتی، مشکل «تحویل» (Hand-off) همواره یک چالش بوده است. ردیابی یک شخص در ۱۰ دوربین مختلف معمولاً نیازمند کالیبراسیون‌های طاقت‌فرسا با تخته‌های شطرنجی و محاسبات پیچیده مختصاتی است. اگر یک دوربین تنها چند درجه جابه‌جا شود، کل زنجیره ردیابی می‌شکند و سیستم نمی‌تواند تشخیص دهد که فرد در دوربین جدید همان فرد در دوربین قبلی است.

زمینه: تکامل پلتفرم

DeepStream در واقع ابزار تحلیل جریان‌های داده‌ی انویدیا برای درک تصاویر و ویدئوهاست. این پلتفرم یک چارچوب مبتنی بر GStreamer فراهم می‌کند تا استنتاج (Inference) — همان لحظه‌ای که مدل واقعاً جواب تولید می‌کند، شبیه به خودِ آشپزی به جای دوره‌ی آموزش آشپزی — روی چندین مدل و جریان داده به‌صورت هم‌زمان در GPUها (واحد پردازش گرافیکی) انجام شود. این خط‌لوله‌ها (Pipelines) رمزگشایی و رمزگذاری سخت‌افزاری، استنتاج TensorRT، ردیابی اشیا و ادغام با پیام‌رسان‌ها (Message-brokers) را یکپارچه می‌کنند.

طبق گزارش Marktechpost، نسخه ۹.۱ بارِ سنگینِ تنظیمات را به دوش عامل‌ها (Agents) انداخته است. این ابزار اکنون ۱۳ مهارت عامل‌محور (Agentic Skills) دارد که با ابزارهایی مثل Claude Code، Codex و Cursor سازگار است. این یعنی توسعه‌دهندگان می‌توانند خط‌لوله‌های پیچیده را تنها با دستورات زبان طبیعی (Natural Language Prompts) مستقر کنند. این رویکرد تکاملی با استفاده از رابط‌های کد-محور برای ارتقای دقت مکانی هم‌سو است که به جای فراخوانی‌های صلب، انعطاف‌پذیری بیشتری در مدل‌های بینایی-زبانی ایجاد می‌کند.

جزئیات: سازوکار ردیابی سه‌بعدی

قلب تپنده این نسخه، قابلیت «ردیابی سه‌بعدی چندنمایی» (MV3DT) است. این سازوکار با تصویر کردن تشخیص‌های دوبعدی از دوربین‌های کالیبره شده به یک سیستم مختصاتی سه‌بعدی مشترک عمل می‌کند. به این ترتیب، وقتی شخصی از محدوده دوربین A به دوربین B می‌رود، سیستم او را به عنوان یک موجودیت واحد شناسایی کرده و یک شناسه (ID) جهانی و ثابت به او اختصاص می‌دهد.

جریان داده در این سیستم دقیقاً طی چهار مرحله رخ می‌دهد:

  • تشخیص (Detection): هر جریان دوربین یک مدل تشخیص شیء را اجرا می‌کند. MV3DT سه مدل را به‌صورت پیش‌فرض پشتیبانی می‌کند:
    • PeopleNetTransformer: یک مدل تشخیص فرد مبتنی بر ترنسفورمر که گزینه پیش‌فرض برای صحنه‌های پیاده‌رو است.
    • PeopleNet v2.6.3: تشخیص‌دهنده‌ای با بهره‌وری بالا که بر اساس معماری DetectNet_v2 ساخته شده است.
    • RT-DETR 2D: یک تشخیص‌دهنده چندکلاسی که قادر به ردیابی هم‌زمان پیاده‌ها، وسایل ترابری و لیفتراک‌ها است.
  • ادراک سه‌بعدی (3D Perception): هر دوربین از یک ماتریس تصویر ۳×۴ استفاده می‌کند که در یک فایل کالیبراسیون YAML ذخیره شده است. این ماتریس، باکس‌های محدودکننده دوبعدی را با فرض «صفحه زمین» (Ground-plane assumption) به مختصات فضای واقعی سه‌بعدی بازمی‌گرداند.
  • اتصال (Association): ردیاب‌ها «تکه‌های ردیابی» (Tracklets) را از طریق پروتکل MQTT (پروتکل انتقال ارسالی پیام‌های تله‌متری) — که یک پروتکل پیام‌رسانی سبک انتشار/اشتراک (pub/sub) است — به اشتراک می‌گذارند. وقتی دو دوربین یک شخص را مشاهده می‌کنند، سیستم تکه‌های ردیابی را بر اساس نزدیکی در فضای سه‌بعدی تطبیق می‌دهد.
  • خروجی (Output): نتایج در سه قالب جریان می‌یابند: نمایش روی صفحه (OSD) که شبکه‌ای از باکس‌های دوبعدی و سه‌بعدی را نشان می‌دهد، نقشه‌های تراژکتوری از نمای بالا (Bird’s-Eye View) و پیام‌های Kafka که متادیتای Protobuf هر فریم (شامل شناسه حسگر، شناسه شیء و باکس سه‌بعدی) را ارسال می‌کند.

حذف تنظیمات دستی با AutoMagicCalib

برای حذف نیاز به تخته‌های شطرنجی فیزیکی و زمان‌های توقف (Downtime) مربوط به آن، انویدیا سرویس AutoMagicCalib (AMC) را اضافه کرده است. این میکروسرویس با تحلیل اشیای ردیابی شده در ویدئوهای موجود یا جریان‌های زنده، پارامترهای داخلی دوربین (مانند فاصله کانونی، نقطه اصلی و اعوجاج لنز) و پارامترهای خارجی (مانند چرخش، انتقال و موقعیت در جهان واقعی) را به‌طور خودکار تخمین می‌زند.

فرآیند AMC در یک خط‌لوله پنج مرحله‌ای اجرا می‌شود:
۱. استخراج تراژکتوری برای هر دوربین
۲. تصحیح تک‌نمایی (Single-view rectification)
۳. تطبیق تکه‌های ردیابی چندنمایی
۴. تنظیم دسته‌ای (Bundle Adjustment)
۵. اصلاح اختیاری با استفاده از VGGT (ترنسفورمرهای مبتنی بر هندسه بصری) که در محیط‌هایی که حرکت اشیا محدود است، کمک می‌کند.

کاربران تنها نیاز دارند یک تصویر از پلان محیط (Layout image) و چند نقطه تراز را از طریق یک رابط وب ارائه دهند. AMC به‌عنوان یک میکروسرویس با APIهای REST برای ادغام یکپارچه عمل می‌کند.

گردش کار عامل‌محور (Agentic Workflow)

بزرگ‌ترین تغییر در روش تحویل است. توسعه‌دهندگان دیگر نیازی به ویرایش فایل‌های پیچیده پیکربندی ندارند و به جای آن، قصد خود را با زبان طبیعی توصیف می‌کنند. توسعه‌دهنده ابتدا مخزن گیت‌هاب را کلون کرده و مهارت‌ها را در دایرکتوری عامل خود کپی می‌کند (برای مثال با دستور mkdir -p ~/.codex/skills در Codex).

یک دستور ساده مانند «استقرار mv3dt روی مجموعه داده نمونه ۱۲ دوربینه» باعث می‌شود عامل هوشمند مراحل خودکار زیر را طی کند:
۱. اعتبارسنجی پیش‌نیازها
۲. دریافت کانتینر (Container) مورد نیاز
۳. نصب سرویس‌های بروکر Kafka و Mosquitto
۴. دانلود وزن‌های مدل (Model Weights)
۵. تولید پیکربندی خط‌لوله
۶. اجرای فرآیند ردیابی

اگر عامل متوجه شود که فایل‌های کالیبراسیون موجود نیستند، به‌طور خودکار مهارت AMC را برای رفع این مشکل پیش از ادامه مسیر فعال می‌کند.

سخت‌افزار و توزیع

در لایه سخت‌افزاری، DeepStream 9.1 از JetPack 7.2 پشتیبانی می‌کند و این قابلیت‌ها را به دستگاه‌های لبه‌ای Jetson Orin و Thor می‌آورد. همچنین، انویدیا توزیع این ابزار را به یک monorepo یکپارچه و متن‌باز در گیت‌هاب تحت لایسنس‌های CC-BY-4.0 و Apache-2.0 منتقل کرده است.

برای درک بهتر، این نسخه جهشی بزرگ نسبت به نسخه ۹.۰ است. در حالی که نسخه ۹.۰ تنها دو مهارت عامل‌محور داشت و نیازمند کالیبراسیون دستی بود، نسخه ۹.۱ اکنون ۱۳ مهارت، میکروسرویس AMC و مجموعه‌داده‌های نمونه تخصصی برای ۴ و ۱۲ دوربین را معرفی کرده است.

موارد استفاده و مثال‌ها

این ابزار برای محیط‌های حساس که ثبات مکانی در آن‌ها حیاتی است طراحی شده است:

  • ایمنی انبارها: ردیابی فاصله یک کارگر تا لیفتراک‌ها در راهروهای مختلف با استفاده از یک ID واحد و مدل RT-DETR 2D.
  • تحلیل خرده‌فروشی: دنبال کردن یک خریدار بین مناطق مختلف دوربین‌ها برای اندازه‌گیری دقیق زمان توقف (Dwell time) بدون خطای شناسایی مجدد.
  • مانیتورینگ ساختمان‌های هوشمند: شمارش تعداد افراد در طبقات مختلف و ارسال متادیتای آنی Kafka به داشبوردهای مدیریتی.
  • رباتیک و شهرهای هوشمند: اشتراک‌گذاری مختصات جهانی ثابت برای ناوبری خودکار و بررسی تاریخی حوادث.

برای توسعه‌دهنده، این یعنی کاهش شدید «زمان رسیدن به نمونه اولیه» (Time-to-prototype). با تبدیل اجزای خط‌لوله بینایی به «مهارت‌هایی» برای یک عامل مبتنی بر LLM، سد فنی ورود به دنیای AI مکانی سه‌بعدی به‌شدت پایین آمده است. این حرکت نشان می‌دهد انویدیا در حال تبدیل DeepStream از یک ابزار ساده به محیطی برای نسل بعدی AI بینایی عامل‌محور است.

گام بعدی شما

  • مخزن رسمی گیت‌هاب DeepStream را کلون کنید تا مهارت‌های عامل‌محور را در خط‌لوله‌های خود تست کنید.
  • اگر با کالیبراسیون دستی مشکل دارید، میکروسرویس AMC را برای تخمین خودکار پارامترهای دوربین اجرا کنید.
  • برای کاهش تأخیر در استقرار لبه‌ای، مدل‌های RT-DETR 2D را روی سخت‌افزارهای Jetson Orin بهینه‌سازی کنید.

ama تأثیر این تحول بر معماری‌های توزیع‌شده در مراکز داده حتی پیچیده‌تر است؛ به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این به‌روزرسانی با تکیه بر تخصص انویدیا در یکپارچه‌سازی سخت‌افزار و نرم‌افزار، مانع اصلی استقرار گسترده سیستم‌های ردیابی سه‌بعدی (یعنی پیچیدگی کالیبراسیون) را حذف می‌کند. این امر سرعت پیاده‌سازی هوش مصنوعی در لجستیک و شهرهای هوشمند را به‌شدت افزایش می‌دهد.

تأثیر برای ایران

به‌دلیل محدودیت‌های دسترسی به سخت‌افزارهای جدید Jetson و تحریم‌های APIهای ابری، استفاده از این قابلیت‌ها برای توسعه‌دهندگان ایرانی عمدتاً در محیط‌های آزمایشگاهی یا از طریق سخت‌افزارهای وارداتی محدود است.

·نگاه ما
تحریریه دات‌هوش

انویدیا با تبدیل پیکربندی سخت‌افزاری به «مهارت‌های عامل‌محور»، در واقع در حال تبدیل لایه‌ی زیرساختی بینایی ماشین به یک لایه انتزاعی (Abstract) است. این حرکت نشان می‌دهد که رقابت در بینایی ماشین دیگر بر سر دقت مدل‌های تشخیص نیست، بلکه بر سر کاهش زمان «ایده تا استقرار» (Time-to-Prototype) است. انویدیا می‌خواهد توسعه‌دهنده را از نقش یک تکنسین کالیبراسیون به یک مدیر ارکسترا تبدیل کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.