یک ویدیو نمایش ۱۲ ثانیهای اکنون برای یادگیری یک مهارت فیزیکی جدید توسط ربات کافی است. شرکت Generalist AI مدل GEN-1.5 را عرضه کرد؛ یک مدل بنیادی (Foundation Model) رباتیک که از مکانیزمی به نام «پرامپت فیزیکی» (Physical Prompting) برای اجرای وظایف دستورزی استفاده میکند، بدون آنکه نیازی به بهروزرسانی گرادیان یا برنامهنویسی اختصاصی برای هر وظیفه باشد.
در پوشش پیشین ما از تلاشهای این شرکت برای استفاده از نمایشهای کوتاه، دیدیم که تمرکز بر کاهش دادههای آموزشی است. این رویکرد در واقع تکامل یافتهی روش یادگیری از تکویدیو است که پیشتر توسط Generalist AI برای آموزش سریع رباتها معرفی شده بود. اما این نسخه جدید، توجه را به قابلیتهای نوظهور در مقیاس بالا جلب میکند. در چشمانداز فعلی رباتیک، انطباق یک سیاست کنترلی معمولاً نیازمند دهها هزار گام گرادیان و مجموعهدادههای عظیم است. GEN-1.5 این رویکرد را به چالش میکشد و با مهارتهای فیزیکی همانگونه برخورد میکند که مدلهای زبانی بزرگ (LLM) با پرامپتهای متنی رفتار میکنند.
معماری مدل و بستر عملیاتی
به نقل از گزارش Marktechpost، مدل GEN-1.5 یک مدل چندوجهی (Multimodal) بزرگ است که ورودیهای ویدیو، حسگر، زبان و دادههای حس عمقی (Proprioceptive) را پردازش میکند. این مدل دارای یک پنجره زمینه (Context Window) ۳۰ ثانیهای است و مسیرهای حرکتی را با فرکانس ۱۰۰ هرتز تولید میکند. طبق مستندات، این مدل به مدت بیش از هشت ماه بهطور مداوم روی دادههای تعامل فیزیکی استخراجشده از کارخانهها، انبارها و خانهها پیشآموزش (Pretraining) دیده است.
مکانیزم اصلی یعنی پرامپت فیزیکی، به کاربر اجازه میدهد ۳ تا ۱۲ ثانیه دادههای حسحرکتی — شامل جریانهای حسگر و مسیر حرکت — را از طریق یک رابط کشیدن و رها کردن (Drag-and-drop) وارد پنجره زمینه کند. فضای باقیمانده از این پنجره ۳۰ ثانیهای را مشاهدات جاری اشغال میکند و ربات بلافاصله و بدون هیچ گام گرادیانی، وظیفه را اجرا میکند.

بنچمارکهای عملکرد
کارایی این مدل در ۱۰ وظیفه متنوع دستورزی که شرکت آنها را «ساده و کوتاهمدت» توصیف کرده، مشهود است:
- پرامپت در بستر متن تکنمونه (One-Shot): با استفاده از مدل پیشآموزشدیده، به طور متوسط ۵۹٪ موفقیت (با انحراف معیار ۱۰٪) به دست آمد.
- تنظیم دقیق (Fine-tuning) سبک: اجرای ده گام گرادیان روی پنج دقیقه داده (حدود ۵۰ نمایش)، نرخ موفقیت را به ۸۳٪ (با انحراف معیار ۹٪) رساند.
- رژیم دادههای بسیار کم: تنها یک گام گرادیان روی یک دقیقه داده، در یک وظیفه خارج از مجموعه آموزش، به صحت ۶۶.۵٪ رسید که بدون نیاز به جستوجوی ابرپارامترهای انطباقی محقق شد.
قابلیتهای انتقال نوظهور
شرکت Generalist AI اشاره میکند که چندین قابلیت حیاتی، نه از طریق طراحی صریح، بلکه بر اثر مقیاس پیشآموزش ظاهر شدهاند. در این مسیر هیچ تغییر معماری، حلقه یادگیری متا یا هدف کمکی برای تشویق به بداهه عمل کردن استفاده نشده است.
این مدل «تعمیم ترکیبی» (Compositional Generalization) را نمایش میدهد؛ به این معنا که دو پرامپت مجزا را میتوان به یک رفتار پیوسته زنجیره کرد. مدل بهطور خودکار حرکات رابط لازم برای تغییر موقعیت، گرفتن مجدد شیء و بازیابی خطا را تولید میکند، در حالی که این حرکات در هیچیک از نمایشهای اصلی وجود نداشتند.
علاوه بر این، مدل قابلیت انتقال Zero-shot از شبیهساز به واقعیت (Sim-to-Real) را دارد. نمایشی که کاملاً در محیط شبیهسازی ضبط شده، بهعنوان پرامپت برای یک ربات فیزیکی عمل میکند، با وجود اینکه دادههای پیشآموزش شامل دینامیک شبیهساز یا ویدیوهای رندر شده نبودند. همچنین، مدل از تقلید انسان به ربات پشتیبانی میکند و اقداماتی را که یک انسان در برابر دوربینهای ربات انجام میدهد، بازتولید میکند.
تعمیم در عمل
تعمیمپذیری پس از یک تنظیم دقیق سبک نیز مشاهده شده است. در یک مثال، مدل به مدت پنج دقیقه روی هل دادن یک بلوک به داخل کاسه آموزش دید. سپس، مدل از یک موز بهعنوان برس موقت استفاده کرد و از یک خاکروب برای بلند کردن و خالی کردن بلوک بهره برد که نشاندهنده یک توالی تماس کاملاً متفاوت است.
همچنین، مدل توانایی برداشتن یک تکه کاغذ که روی کاسه را پوشانده بود تا به هدف برسد، نشان داد. علاوه بر این، قابلیتهای دو-دستی (Ambidextrous) را به نمایش گذاشت و با هر دو دست کار کرد، حتی زمانی که نمایشهای ارائه شده تنها از یک دست استفاده میکردند.
تحلیل فنی
از منظر حوزه رباتیک، مهمترین یافته، بهرهوری محاسباتی در انطباق است. ده گام گرادیان، وزنهای مدل را در وظایف خارج از مجموعه آموزش کمتر از ۰.۱۵٪ تغییر میدهد. این موضوع نشان میدهد که تنظیم دقیق، بازنماییهای جدید را از صفر نمیسازد، بلکه دانش موجود در مدل را بازپیکربندی میکند.
این رویکرد نشاندهنده چرخش به سمت «آموزش در زمان تست» (Test-time Training) در رژیمهای دادههای بسیار کم است. با کاهش چندین مرتبه مقداری در محاسبات مورد نیاز برای انطباق هر وظیفه، GEN-1.5 پیشنهاد میکند که مقیاسبندی دادههای تعامل فیزیکی میتواند به همان نوع پرامپت تکنمونهای منجر شود که در GPT-3 شاهد بودیم. این تلاش برای بهینهسازی دادهها در راستای راهکارهای جدیدی مانند مدلهای جهانی World Labs برای رفع گلوگاه داده در آموزش رباتهاست که سرعت یادگیری را بهطور چشمگیری افزایش میدهند.
با این حال، این نسخه در حال حاضر یک انتشار پژوهشی است. هیچ وزنهای باز، API یا محصولی برای استفاده عمومی در دسترس نیست و Generalist AI مدل را روی ناوگان و موتور دادههای خود اجرا میکند.
گام بعدی شما
- دنبال کنید که آیا آزمایشگاههای دیگر تلاش میکنند «پرامپت فیزیکی» را با مدلهای وزنهای باز (Open Weights) بازتولید کنند یا خیر.
- بررسی کنید که آیا نبود API عمومی، این قابلیت را در موتورهای داده اختصاصی محبوس میکند یا به سمت استانداردهای باز میرود.
- تحلیلهای مربوط به مدلهای چندوجهی در رباتیک را دنبال کنید تا متوجه شوید مرز بین شبیهساز و واقعیت چگونه در حال محو شدن است.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو