پرش به محتوای اصلی
پرش به محتوای مقاله

«تثبیت بصری ۲۴ ساعته»؛ دستاورد جدید علی‌بابا در مدل‌های جهانی

·۱۲ مرداد ۱۴۰۵۴ دقیقه مطالعه۱ بازدید
نقشه آموزش جهان آلی‌بابا با یک پردازنده گرافیکی به مدت ۲۴ ساعت اجرا شد
نقشه آموزش جهان آلی‌بابا با یک پردازنده گرافیکی به مدت ۲۴ ساعت اجرا شد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استقرار نخستین مدل دنیای تعاملی با پایداری ۲۴ ساعته روی سخت‌افزار مصرف‌کننده — جایگزینی حجم داده‌های عظیم با تکنیک LongForcing برای حذف رانش بصری.

تصور کنید یک دنیای مجازی ساخته شده با هوش مصنوعی که ساعت‌ها در آن گشت‌وگذار می‌کنید و برخلاف مدل‌های فعلی، محیط پس از چند ثانیه به توده‌ای از نویز و پیکسل‌های به‌هم‌ریخته تبدیل نمی‌شود. Amap، پلتفرم خدمات مکان‌محور علی‌بابا، با معرفی مدل ABot-World-0 ثابت کرد که یک کارت گرافیک دسکتاپ معمولی می‌تواند یک دنیای تعاملی و منسجم را برای ۲۴ ساعت کامل زنده نگه دارد، بدون اینکه صحنه دچار فروپاشی بصری شود. برای اثبات این دستاورد، Amap یک رکورد کامل و قابل جست‌وجو از اجرای ۲۴ ساعته مدل منتشر کرده است تا پایداری سیستم را به صورت شفاف به نمایش بگذارد.

برای اطمینان از شفافیت، رکورد منتشر شده یک نمایش گلچین‌شده یا «هایلایت» نیست. این ویدیو به هر کاربر اجازه می‌دهد به هر ثانیه‌ای از اجرای ۲۴ ساعته دسترسی داشته باشد و برای تسهیل این امر، نقاط ورود ثابتی در ساعت‌های ششم، دوازدهم و هجدهم پیش‌بینی شده است. علاوه بر این، Amap پنج اجرای کامل دیگر را در محیط‌های متنوعی از جمله دشت، کویر، شهر و صحراهای برفی ارائه کرده است تا ثابت کند پایداری مدل به یک محیط خاص محدود نمی‌شود.

این پیشرفت مستقیماً نقطه ضعف بحرانی مدل‌های دنیای تعاملی، یعنی «رانش خودبازگشتی» (Autoregressive Drift) را هدف قرار می‌دهد. در این سیستم‌ها، هر فریم جدید بر اساس فریم‌های قبلی که توسط خود مدل تولید شده‌اند، شرطی می‌شود؛ در نتیجه، خطاهای کوچک به‌سرعت روی هم انباشته می‌شوند و معمولاً باعث می‌شوند محیط در کمتر از ۳۰ تا ۶۰ ثانیه تخریب شود. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی مدل‌های شبیه‌ساز محیطی اشاره کردیم، صنعت به سمت وفاداری بصری پیش می‌رود؛ برای مثال NVIDIA DreamDojo از ۴۴ هزار ساعت ویدیو انسانی برای آموزش مدل‌های دنیای رباتیک استفاده کرد. اما Amap اکنون تمرکز را از حجم داده‌های آموزشی به سمت پایداری زمانی بلندمدت تغییر داده است.

سازوکار LongForcing

طبق گزارش فنی منتشر شده در ۲۱ ژوئیه ۲۰۲۶، این تیم از متدی به نام LongForcing برای حفظ انسجام محیطی استفاده کرده است. این مدل که نخستین بار در ۱۶ ژوئیه ۲۰۲۶ معرفی شد، در ابتدا ادعای پایداری بیش از یک ساعت را داشت، اما اکنون به ۲۴ ساعت رسیده است.

در روش‌های معمول distillation (تقطیر)، یک مدل «معلم» دوطرفه و کندتر که می‌تواند کل یک کلیپ را ببیند، مدل «شاگرد» سریع‌تری را آموزش می‌دهد که فقط به داده‌های گذشته دسترسی دارد. چون این نظارت معمولاً روی کلیپ‌های کوتاه متمرکز است، مدل شاگرد پس از چند ثانیه شروع به تخیل و ارتجال می‌کند. LongForcing این روند را تغییر می‌دهد و نظارت را دقیقاً به نقاطی می‌برد که شکست‌های بصری معمولاً رخ می‌دهند.

در این روش، مدل شاگرد یک اجرای طولانی را به‌تنهایی تولید می‌کند و سپس معلمی با زمینه زمانی گسترده‌تر، بخش‌های انتهایی را — جایی که خطاهای پیش‌بینی انباشته شده‌اند — نظارت و اصلاح می‌کند. بر اساس مستندات فنی، این فرآیند بیشتر شبیه به اصلاح «تغییر توزیع انباشته» و «رانش خودبازگشتی» است تا یک مکانیسم حافظه؛ یعنی مدل فریم‌های قبلی را به یاد نمی‌آورد، بلکه توسط مدل معلم به سمت یک توزیع پایدار جهانی کشیده می‌شود تا از مسیر انحراف خارج نشود.

نتیجه این رویکرد رفتاری متمایز است: مدل در طول اجرا به‌جای اینکه در صحنه اولیه قفل شود، محیط را با صحنه‌های جدید گسترش می‌دهد، بدون اینکه کاربر نیاز به ارسال پرامپت‌های تازه داشته باشد.

عملکرد فنی و سخت‌افزار

بهره‌وری این مدل به گونه‌ای است که روی یک کارت گرافیک Nvidia RTX 5090 دسکتاپ اجرا می‌شود. مشخصات کلیدی عملکرد عبارتند از:

  • وضوح خروجی: 720p با نرخ حداکثری ۱۶ فریم بر ثانیه
  • تأخیر (Latency): ۱.۲ ثانیه بین ورودی کاربر و اولین فریم واکنش‌دهنده
  • مصرف حافظه: حدود ۱۹ گیگابایت VRAM در نقطه اوج
  • کنترل: ورودی مستقیم کیبورد برای گشت‌وگذار در صحنه و حرکت شخصیت سوم‌شخص

برای حفظ ثبات بصری، سیستم از یک حافظه شخصیت مرجع استفاده می‌کند تا ظاهر کاراکتر در تمام طول جلسه ثابت بماند. طبق گزارش تیم، ارزیابی مدل با استفاده از مجموعه WorldRoamBench نشان‌دهنده کنترل‌پذیری رقابتی و تکامل منسجم محیط است. این پروژه پس از انتشار در ۲۲ ژوئیه ۲۰۲۶، با بیش از ۳۰۰ رای مثبت، به عنوان برترین مقاله روز در Hugging Face قرار گرفت.

کاهش نیاز سخت‌افزاری، اقتصاد پژوهش‌های هوش مصنوعی تجسم‌یافته (Embodied AI) را تغییر می‌دهد. پیش از این، تولید تعاملی بلندمدت یک حجم کاری مربوط به مراکز داده بود که تنها برای کسانی با بودجه‌های کلان برای خوشه‌های پردازشی (Clusters) ممکن بود. این رویکرد در راستای تلاش‌های علی‌بابا برای بهینه‌سازی زیرساخت‌هاست، مشابه آنچه در پلتفرم Smart Studio برای کاهش هزینه‌های استقرار مدل‌های MaaS مشاهده کردیم. اما انتقال این قابلیت به GPU دسکتاپ، سد ورود را برای استودیوهای کوچک و گروه‌های پژوهشی می‌شکند.

این دموکراتیزه شدن برای رباتیک حیاتی است. سیاست‌های هوش مصنوعی تجسم‌یافته باید پیش از استقرار روی سخت‌افزار فیزیکی، در محیط‌های متنوع و پایدار تمرین شوند؛ چالشی که Google Gemini Robotics ER 2 نیز برای شبیه‌سازی مدل‌های ویدیو-اکشن رباتیک در کف کارخانه آئودی دنبال می‌کند. توانایی شبیه‌سازی یک دنیای پایدار برای ۲۴ ساعت روی یک کارت گرافیک، تست رفتارهای عامل‌محور (Agentic) را ارزان‌تر و دقیق‌تر می‌کند. در این راستا، درک پایداری زیرساخت‌ها در برابر فشار عملیاتی اهمیت دارد، چرا که بسیاری از سیستم‌های عامل‌محور در مواجهه با ترافیک‌های ناگهانی دچار فروپاشی می‌شوند.

پروژه ABot-World-0 تحت لایسنس Apache 2.0 در گیت‌هاب منتشر شده است. Amap علاوه بر کد استنتاج، یک دموی محلی و چک‌پوینت‌ها در Hugging Face و ModelScope، یک مجموعه داده آموزشی شامل ۳۰,۹۶۹ اپیزود ویدیویی شرطی‌شده با اکشن (به حجم ۲.۷۴ ترابایت) را منتشر کرده است. این مجموعه داده شامل فایل‌های MP4، اکشن‌های کیبورد، کپشن‌ها و بازسازی‌های پراکنده از موقعیت دوربین (Camera-pose) است.

این مدل اکنون در کنار سایر مدل‌های وزن‌های باز (Open Weights) مانند Inkling از Thinking Machines Lab قرار می‌گیرد. این روند انتشار مدل‌های با دسترسی آزاد، مشابه رویکرد مدل GLM-5.2 است که به عنوان یک جایگزین عملی برای توسعه‌دهندگان معرفی شد. توسعه‌دهندگان باید منتظر انتشار مدل معلم دوطرفه باشند که احتمالاً بینش‌های بیشتری درباره کاربرد LongForcing در سایر معماری‌های ویدیویی زاینده ارائه می‌دهد.

گام بعدی شما

  • اگر توسعه‌دهنده رباتیک یا بازی هستید، مدل ABot-World-0 را از Hugging Face دانلود کرده و پایداری محیطی آن را با ورودی‌های پیچیده کیبورد تست کنید.
  • مجموعه داده ۲.۷ ترابایتی Amap را برای تحلیل رابطه بین اکشن‌های کاربر و تغییرات بصری در مدل‌های دنیای تعاملی بررسی کنید.
  • انتشار مدل معلم (Teacher Model) را دنبال کنید تا متوجه شوید چگونه می‌توان نرخ خطای مدل‌های ویدیویی را در بازه‌های زمانی طولانی کاهش داد.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell و بهینه‌سازی استنتاج مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار فنی تیم Amap، هزینه شبیه‌سازی محیط‌های پیچیده برای رباتیک را به‌شدت کاهش می‌دهد. انتقال پردازش از مراکز داده به GPUهای دسکتاپ، سرعت چرخه آزمایش و خطای عامل‌های هوش مصنوعی را افزایش می‌دهد.

تأثیر برای ایران

به دلیل انتشار تحت لایسنس Apache 2.0 و در دسترس بودن وزن‌های مدل در Hugging Face، پژوهشگران رباتیک و گرافیک در ایران می‌توانند بدون نیاز به زیرساخت‌های ابری گران‌قیمت، محیط‌های شبیه‌ساز پایدار را روی سیستم‌های محلی اجرا کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز Amap بر پایداری زمانی به‌جای حجم داده، نشان می‌دهد که گلوگاه فعلی مدل‌های ویدیویی دیگر «تولید تصویر زیبا» نیست، بلکه «حفظ منطق محیطی» است. LongForcing با تبدیل خطای انباشته به فرصتی برای اصلاح، پارادایم آموزش مدل‌های خودبازگشتی را تغییر می‌دهد. این رویکرد احتمالاً مسیر تبدیل مدل‌های ویدیویی از «تولید کلیپ» به «موتورهای بازی زنده» را هموار می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.