پرش به محتوای اصلی
پرش به محتوای مقاله

گزارش انویدیا: کاهش ۳۳ درصدی زمان استنتاج AI در Unreal Engine 5

·۱۱ اردیبهشت ۱۴۰۵۳ دقیقه مطالعه۱ بازدید
گزارش انویدیا: کاهش ۳۳ درصدی زمان استنتاج AI در Unreal Engine 5
اشتراک‌گذاری

تصور کنید هوش مصنوعی در لحظه و بدون افت فریم، گرافیک بازی را تغییر دهد. برای توسعه‌دهندگان Unreal Engine 5 (UE5)، این دیگر یک رویا نیست، بلکه نتیجه‌ی بهینه‌سازی سخت‌افزاری است.

طبق اعلام انویدیا (NVIDIA) در ۳۰ آوریل ۲۰۲۶، یک پلاگین جدید برای ادغام TensorRT for RTX در موتور شبکه عصبی (Neural Network Engine - NNE) عرضه شده است. به نقل از گزارش developer.nvidia.com، این یکپارچه‌سازی به توسعه‌دهندگان اجازه می‌دهد تا محیط‌های اجرای عمومی را کنار گذاشته و از یک بهینه‌ساز Just-In-Time (JIT) استفاده کنند که موتورهای استنتاج (Inference) را دقیقاً متناسب با GPU کاربر تولید می‌کند.

این بهینه‌سازی برای کارهایی مانند افزایش رزولوشن (Super-resolution)، حذف نویز (Denoising) و رندرینگ عصبی حیاتی است. پلاگین NNERuntimeTRT با کارت‌های گرافیک RTX از نسل Turing (قابلیت محاسباتی ۷.۵) تا نسل Blackwell (۱۰.۰) سازگار است.

برای نمایش این تأثیر، انویدیا یک پروژه پس‌پردازش انتقال سبک (Style Transfer) را پیاده‌سازی کرد.

A screenshot of an Unreal Engine scene, showing a stylized neural post-processing effect applied to a geometric test setup along with real-time performance statistics.

بر اساس مستندات فنی، بنچمارک‌های اجرا شده روی یک NVIDIA GeForce RTX 5090 در رزولوشن ۱۰۸۰p، شکاف عمیقی در بهره‌وری را نشان می‌دهد. هنگام استفاده از DirectML، اجرای تسک مربوطه ۵.۷ میلی‌ثانیه زمان برد.

A screenshot of Unreal Insights showing the timeline of rendered tasks across a frame. Highlighting the DirectML enqueue task named: FModelInstanceORTDmlRDG::EnqueueRDG (5.7 ms).

در مقابل، محیط اجرای TensorRT for RTX همین تسک را در ۳.۸ میلی‌ثانیه به پایان رساند که نشان‌دهنده بهبود عملکرد ۱.۵ برابری است.

Screenshot of Unreal Insights showing the timeline of rendered tasks across a frame. Highlighting the TensorRT for RTX enqueue task named: FModelInstanceTRT_RDG::EnqueueRDG (3.8 ms).

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی معماری تراشه‌های Blackwell اشاره کردیم، هدف انویدیا حذف هرگونه گلوگاه در مسیر داده‌هاست. این پلاگین برای دستیابی به این هدف، دو مسیر اجرای مجزا ارائه می‌دهد:

  • فراخوان‌های همزمان CPU: ایده‌آل برای ویرایشگران و تسک‌های رویداد-محور مانند مدل‌های زبانی بزرگ.
  • RDG نامتقارن (Asynchronous RDG): بهینه‌شده برای پس‌پردازش‌های AI و افزایش مقیاس (Upscaling) از طریق هم‌راستاسازی ارزیابی مدل با منابع رندرینگ.

به توسعه‌دهندگان توصیه شده است تا ابعاد مدل‌های ONNX را (مثلاً به ۱x۳x۷۲۰x۷۲۰) تغییر دهند تا از سربار تایل‌بندی (Tiling) جلوگیری کنند؛ چرا که این موضوع باعث جابه‌جایی‌های مکرر و هزینه‌بر میان CUDA و گرافیک می‌شود.

با گسترش GPUهای Blackwell، صنعت منتظر است ببیند آیا رویکرد بهینه‌سازی JIT به استاندارد اجباری برای تمام محیط‌های اجرای AI در زمان واقعی تبدیل می‌شود یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

گام بعدی شما

  • پلاگین NNERuntimeTRT را در پروژه‌های UE5 خود فعال و جایگزین DirectML کنید.
  • ابعاد مدل‌های ONNX را برای حذف سربار Tiling بهینه‌سازی کنید.
  • برای تسک‌های پس‌پردازش، مسیر اجرای Asynchronous RDG را تست کنید.
چرا این موضوع مهم است؟

این به‌روزرسانی باعث می‌شود بازی‌های نسل جدید بتوانند از مدل‌های پیچیده‌تر هوش مصنوعی زاینده برای گرافیک استفاده کنند بدون اینکه نرخ فریم کاهش یابد. این موضوع به‌طور مستقیم بر تجربه کاربر نهایی و بهره‌وری توسعه‌دهندگان موتور UE5 تأثیر می‌گذارد.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

موضوع‌ها

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.