پرش به محتوای اصلی
پرش به محتوای مقاله

انویدیا: حذف واسطه ONNX استنتاج در دستگاه‌های لبه را بهینه می‌کند

·۲۸ مرداد ۱۴۰۵۳ دقیقه مطالعه
معرفی TensorRT Model Connect انویدیا: تبدیل مدل Hugging Face به استنتاج C++ بومی با دو دستور
معرفی TensorRT Model Connect انویدیا: تبدیل مدل Hugging Face به استنتاج C++ بومی با دو دستور
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی زنجیره تبدیل PyTorch $\rightarrow$ ONNX $\rightarrow$ TensorRT با یک باندل واحد که اجازه می‌دهد مدل‌ها بدون نیاز به نصب پایتون در محیط C++ اجرا شوند.

تصور کنید می‌خواهید یک مدل هوش مصنوعی پیشرفته را روی یک بازوی رباتیک یا یک دستگاه پزشکی کوچک اجرا کنید، اما حجم عظیم کتابخانه‌های پایتون اجازه این کار را نمی‌دهد. انویدیا (NVIDIA) برای حذف این مانع، پروژه TensorRT Model Connect (TRTMC) را در حالت پیش‌نمایش عمومی منتشر کرد تا انتقال مدل‌های Hugging Face به محیط‌های native C++ را تنها با دو دستور ساده ممکن کند.

به گزارش Marktechpost، استقرار مدل‌ها در سیستم‌های جاسازی‌شده تا پیش از این یک زنجیره شکننده بود: ابتدا تبدیل PyTorch به ONNX یا TorchScript، سپس تبدیل به TensorRT و در نهایت ادغام در کد C++. این مسیر اغلب با خطاهای تبدیل (Export Gaps)، نیاز به بازنویسی کد برای هر مدل به صورت مجزا و خطاهای اعتبارسنجی در میان آرتیفکت‌های مختلف همراه بود. TRTMC این چرخه را با یک فایل .bundle نسخه‌بندی شده جایگزین می‌کند که فرآیند ساخت (Build) مبتنی بر پایتون را از محیط اجرای (Runtime) بدون پایتون کاملاً جدا می‌کند.

همان‌طور که در تحلیل‌های قبلی ما درباره بهینه‌سازی استنتاج در لبه اشاره کردیم، حذف وابستگی‌های سنگین در محیط‌های عملیاتی، کلید دستیابی به تأخیر پایین است. این سیستم به‌جای استفاده از یک مبدل کلی، از مجموعه‌ای از پیاده‌سازی‌های مرجع اختصاصی برای هر خانواده از مدل‌ها استفاده می‌کند تا پایداری و قابلیت اطمینان بیشتری داشته باشد. طبق مستندات، این پروژه تحت لایسنس Apache-2.0 منتشر شده و با استفاده از عامل‌های OpenAI Codex و تحت نظارت انسانی توسعه یافته است. این رویکرد در توسعه ابزارهای انویدیا با فریم‌ورک NOOA که تبدیل عامل‌های هوش مصنوعی به کلاس‌های پایتون را تسهیل می‌کند، هم‌راستا است تا تجربه توسعه‌دهندگان بهبود یابد.

زمینه و کاربردهای استقرار

این ابزار برای محیط‌هایی طراحی شده که استنتاج (Inference) — یعنی همان لحظه‌ای که مدل واقعاً جواب تولید می‌کند، شبیه به آشپزی نهایی پس از یادگیری دستور پخت — باید درون یک فایل باینری C++ باشد، نه یک سرور پایتونی. این قابلیت برای استارتاپ‌های سخت‌افزاری که از اکوسیستم انویدیا استفاده می‌کنند، شرکت‌های رباتیک، سازندگان دستگاه‌های هوشمند و تیم‌های پلتفرم در سازمان‌های متوسط تا بزرگ ایده‌آل است.

صنایعی مانند رایانش درون‌خودرویی، بازرسی‌های صنعتی، تولیدات صنعتی، تجهیزات پزشکی و سیستم‌های لبه در صنایع دفاعی و هوافضا بیشترین بهره را از این ابزار می‌برند. کاربردهایی مثل تولید متن روی دستگاه، بازشناسی گفتار، نویسه‌خوانی نوری (OCR)، تجزیه و تحلیل اسناد (Document Parsing) و پیش‌بینی سری‌های زمانی اکنون با سرعت بسیار بیشتری قابل پیاده‌سازی هستند.

مشخصات فنی

  • نیازمندی‌های اجرا: لینوکس aarch64 (از طریق wheels)، پایتون ۳.۱۰ یا ۳.۱۲، glibc ۲.۳۹+ و TensorRT ۱۱.۱.۰.۱۰۶.
  • پشتیبانی سخت‌افزاری: پشتیبانی بومی از aarch64 فراهم است؛ اما کاربران x86_64 باید از مسیر ساخت منبع در Docker استفاده کنند. برای بهینه‌سازی حداکثری در سیستم‌های چند-GPU، برتری پهنای باند NVLink در برابر PCIe نقش کلیدی در سرعت انتقال داده‌ها ایفا می‌کند.
  • عملکرد: در یک بررسی مورخی ۲۹ ژوئیه ۲۰۲۶ روی تراشه GB300 که ۱۰۵ پروفایل از ۷۶ خانواده مدل را پوشش می‌داد، ۱۰۲ مدل توانستند بیش از ۵٪ بهتر از بنچمارک‌های مرجع اعلام‌شده خود عمل کنند.
  • دسترسی به API: برنامه‌ها به‌جای نوشتن کدهای رابط (Glue Code) پیچیده و سفارشی، از APIهای استاندارد وظیفه‌محور مانند generate()، transcribe()، generate_image()، embed() و solve() استفاده می‌کنند.

معرفی Dyna-2: مدل جهان-عمل رباتیکی با پیش‌آموزش بر یک میلیون ساعت ویدیوی انسانی

جزئیات پیاده‌سازی

توسعه‌دهندگان می‌توانند مدلی مانند Qwen3-0.6B را با دستوری شبیه به زیر بسازند:
trtmc build Qwen/Qwen3-0.6B --precision bf16 --max-cache-length 16384 --output qwen3-0.6b.bundle.
سپس می‌توان این مدل را با دستور زیر اجرا کرد:
trtmc run ./qwen3-0.6b.bundle --prompt "What is the capital of France? Answer in one word." --chat-template --no-thinking.

باندل حاصل از این فرآیند از طریق دستور trtmc inspect قابل بازرسی است که اطلاعاتی نظیر خانواده مدل، دقت (Precision)، هویت محیط اجرا و موتورها را نمایش می‌دهد. در یک محیط C++، بارگذاری مدل تنها با یک خط کد ساده trtmc::load("./qwen3-0.6b.bundle") انجام می‌شود. در حالی که اکثر پروفایل‌ها کاملاً بدون PyTorch هستند، تعداد کمی از پروفایل‌های ترکیبی (Hybrid) از یک فایل اجرایی کمکی پایتون استفاده می‌کنند که این موضوع صراحتاً در مانیفست آن‌ها ذکر شده است.

این تغییر برای تیم‌هایی که استک استنتاج خود را مدیریت می‌کنند، یک نقطه عطف است. حذف PyTorch از مسیر اجرا، سربار سیستم را به حداقل می‌رساند که برای دستگاه‌های پزشکی و سیستم‌های هوافضا که در آن‌ها کمترین میزان Overhead حیاتی است، ضروری است. البته تیم‌های کوچکی که تنها سرویس‌های ساده پایتونی ارائه می‌دهند، ارزش کمتری در این ابزار می‌بینند، زیرا پیچیدگی ادغام در C++ تنها برای کسانی که محیط‌های با محدودیت سخت‌افزاری را هدف قرار داده‌اند، یک چالش است. سازمان‌های تحت نظارت و رگولاتوری باید تا زمان انتشار نسخه نهایی (Tagged Release)، از این ابزار صرفاً به عنوان یک ابزار ارزیابی استفاده کنند.

این اقدام نشان‌دهنده استراتژی انویدیا برای نزدیک کردن فاصله بین پژوهش‌های مدل در Hugging Face و استقرار صنعتی روی سخت‌افزارهای این شرکت است. در واقع، استقرار مدل از یک «تلاش برای ترجمه» به یک «مرحله کامپایل» تبدیل شده است. توسعه‌دهندگان علاقه‌مند می‌توانند جزئیات پیاده‌سازی و خانواده‌های مدل پشتیبانی‌شده را در مخزن گیت‌هاب پروژه بررسی کنند.

گام بعدی شما

  • اگر روی سخت‌افزارهای ARM یا NVIDIA Jetson کار می‌کنید، مخزن گیت‌هاب TRTMC را برای بررسی مدل‌های پشتیبانی‌شده بررسی کنید.
  • مدل‌های کوچک (SLM) خود را با دقت bf16 باندل کنید تا توازن بین سرعت و دقت را در محیط C++ بسنجید.
  • در صورت استفاده در محیط‌های حساس، تا زمان انتشار نسخه نهایی (Tagged Release) از این ابزار صرفاً به عنوان ابزار ارزیابی استفاده کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با حذف لایه‌های واسط، استقرار مدل‌های هوش مصنوعی در سخت‌افزارهای حساس (پزشکی و نظامی) را به دلیل کاهش سربار و افزایش امنیت، بسیار قابل‌اعتمادتر می‌کند. اعتبار این تغییر در نتایج بنچمارک GB300 نهفته است که بهبود عملکرد را در مقیاس صنعتی تایید می‌کند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی در حوزه رباتیک و اینترنت اشیا (IoT) که با محدودیت منابع سخت‌افزاری روبرو هستند، این ابزار مسیر بهینه‌سازی مدل‌ها را هموار می‌کند.

·نگاه ما
تحریریه دات‌هوش

انویدیا با این ابزار، لایه نرم‌افزاری استقرار را به بخشی از زنجیره سخت‌افزاری خود تبدیل می‌کند. این حرکت عملاً Hugging Face را به یک «کتابخانه قطعات» برای سخت‌افزارهای انویدیا تبدیل می‌کند و وابستگی توسعه‌دهندگان به اکوسیستم‌های واسط مثل ONNX را می‌شکند تا چرخه تبدیل مدل به محصول سریع‌تر شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.