پرش به محتوای اصلی
پرش به محتوای مقاله

Generalist AI: آموزش وظایف فیزیکی در ۱۲ ثانیه بدون برنامه‌نویسی

·۲ شهریور ۱۴۰۵۴ دقیقه مطالعه۳ بازدید
ربات هوش مصنوعی GEN-1.5: یادگیری وظایف جدید از یک نمونه ۳ تا ۱۲ ثانیه‌ای
ربات هوش مصنوعی GEN-1.5: یادگیری وظایف جدید از یک نمونه ۳ تا ۱۲ ثانیه‌ای
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی مفهوم «پرامپت فیزیکی» که یادگیری مهارت‌های حرکتی را از آموزش‌های طولانی به یک ورودی کوتاه در پنجره زمینه تبدیل می‌کند و نیاز به به‌روزرسانی گرادیان را برای بسیاری از وظایف حذف می‌کند.

یک ویدیو نمایش ۱۲ ثانیه‌ای اکنون برای یادگیری یک مهارت فیزیکی جدید توسط ربات کافی است. شرکت Generalist AI مدل GEN-1.5 را عرضه کرد؛ یک مدل بنیادی (Foundation Model) رباتیک که از مکانیزمی به نام «پرامپت فیزیکی» (Physical Prompting) برای اجرای وظایف دست‌ورزی استفاده می‌کند، بدون آنکه نیازی به به‌روزرسانی گرادیان یا برنامه‌نویسی اختصاصی برای هر وظیفه باشد.

در پوشش پیشین ما از تلاش‌های این شرکت برای استفاده از نمایش‌های کوتاه، دیدیم که تمرکز بر کاهش داده‌های آموزشی است. این رویکرد در واقع تکامل یافته‌ی روش یادگیری از تک‌ویدیو است که پیش‌تر توسط Generalist AI برای آموزش سریع ربات‌ها معرفی شده بود. اما این نسخه جدید، توجه را به قابلیت‌های نوظهور در مقیاس بالا جلب می‌کند. در چشم‌انداز فعلی رباتیک، انطباق یک سیاست کنترلی معمولاً نیازمند ده‌ها هزار گام گرادیان و مجموعه‌داده‌های عظیم است. GEN-1.5 این رویکرد را به چالش می‌کشد و با مهارت‌های فیزیکی همان‌گونه برخورد می‌کند که مدل‌های زبانی بزرگ (LLM) با پرامپت‌های متنی رفتار می‌کنند.

معماری مدل و بستر عملیاتی

به نقل از گزارش Marktechpost، مدل GEN-1.5 یک مدل چندوجهی (Multimodal) بزرگ است که ورودی‌های ویدیو، حسگر، زبان و داده‌های حس عمقی (Proprioceptive) را پردازش می‌کند. این مدل دارای یک پنجره زمینه (Context Window) ۳۰ ثانیه‌ای است و مسیرهای حرکتی را با فرکانس ۱۰۰ هرتز تولید می‌کند. طبق مستندات، این مدل به مدت بیش از هشت ماه به‌طور مداوم روی داده‌های تعامل فیزیکی استخراج‌شده از کارخانه‌ها، انبارها و خانه‌ها پیش‌آموزش (Pretraining) دیده است.

مکانیزم اصلی یعنی پرامپت فیزیکی، به کاربر اجازه می‌دهد ۳ تا ۱۲ ثانیه داده‌های حس‌حرکتی — شامل جریان‌های حسگر و مسیر حرکت — را از طریق یک رابط کشیدن و رها کردن (Drag-and-drop) وارد پنجره زمینه کند. فضای باقی‌مانده از این پنجره ۳۰ ثانیه‌ای را مشاهدات جاری اشغال می‌کند و ربات بلافاصله و بدون هیچ گام گرادیانی، وظیفه را اجرا می‌کند.

معرفی Dyna-2: مدل جهان-عمل رباتیکی با پیش‌آموزش بر یک میلیون ساعت ویدیوی انسانی

بنچمارک‌های عملکرد

کارایی این مدل در ۱۰ وظیفه متنوع دست‌ورزی که شرکت آن‌ها را «ساده و کوتاه‌مدت» توصیف کرده، مشهود است:

  • پرامپت در بستر متن تک‌نمونه (One-Shot): با استفاده از مدل پیش‌آموزش‌دیده، به طور متوسط ۵۹٪ موفقیت (با انحراف معیار ۱۰٪) به دست آمد.
  • تنظیم دقیق (Fine-tuning) سبک: اجرای ده گام گرادیان روی پنج دقیقه داده (حدود ۵۰ نمایش)، نرخ موفقیت را به ۸۳٪ (با انحراف معیار ۹٪) رساند.
  • رژیم داده‌های بسیار کم: تنها یک گام گرادیان روی یک دقیقه داده، در یک وظیفه خارج از مجموعه آموزش، به صحت ۶۶.۵٪ رسید که بدون نیاز به جست‌وجوی ابرپارامترهای انطباقی محقق شد.

قابلیت‌های انتقال نوظهور

شرکت Generalist AI اشاره می‌کند که چندین قابلیت حیاتی، نه از طریق طراحی صریح، بلکه بر اثر مقیاس پیش‌آموزش ظاهر شده‌اند. در این مسیر هیچ تغییر معماری، حلقه یادگیری متا یا هدف کمکی برای تشویق به بداهه عمل کردن استفاده نشده است.

این مدل «تعمیم ترکیبی» (Compositional Generalization) را نمایش می‌دهد؛ به این معنا که دو پرامپت مجزا را می‌توان به یک رفتار پیوسته زنجیره کرد. مدل به‌طور خودکار حرکات رابط لازم برای تغییر موقعیت، گرفتن مجدد شیء و بازیابی خطا را تولید می‌کند، در حالی که این حرکات در هیچ‌یک از نمایش‌های اصلی وجود نداشتند.

علاوه بر این، مدل قابلیت انتقال Zero-shot از شبیه‌ساز به واقعیت (Sim-to-Real) را دارد. نمایشی که کاملاً در محیط شبیه‌سازی ضبط شده، به‌عنوان پرامپت برای یک ربات فیزیکی عمل می‌کند، با وجود اینکه داده‌های پیش‌آموزش شامل دینامیک شبیه‌ساز یا ویدیوهای رندر شده نبودند. همچنین، مدل از تقلید انسان به ربات پشتیبانی می‌کند و اقداماتی را که یک انسان در برابر دوربین‌های ربات انجام می‌دهد، بازتولید می‌کند.

تعمیم در عمل

تعمیم‌پذیری پس از یک تنظیم دقیق سبک نیز مشاهده شده است. در یک مثال، مدل به مدت پنج دقیقه روی هل دادن یک بلوک به داخل کاسه آموزش دید. سپس، مدل از یک موز به‌عنوان برس موقت استفاده کرد و از یک خاک‌روب برای بلند کردن و خالی کردن بلوک بهره برد که نشان‌دهنده یک توالی تماس کاملاً متفاوت است.

همچنین، مدل توانایی برداشتن یک تکه کاغذ که روی کاسه را پوشانده بود تا به هدف برسد، نشان داد. علاوه بر این، قابلیت‌های دو-دستی (Ambidextrous) را به نمایش گذاشت و با هر دو دست کار کرد، حتی زمانی که نمایش‌های ارائه شده تنها از یک دست استفاده می‌کردند.

تحلیل فنی

از منظر حوزه رباتیک، مهم‌ترین یافته، بهره‌وری محاسباتی در انطباق است. ده گام گرادیان، وزن‌های مدل را در وظایف خارج از مجموعه آموزش کمتر از ۰.۱۵٪ تغییر می‌دهد. این موضوع نشان می‌دهد که تنظیم دقیق، بازنمایی‌های جدید را از صفر نمی‌سازد، بلکه دانش موجود در مدل را بازپیکربندی می‌کند.

این رویکرد نشان‌دهنده چرخش به سمت «آموزش در زمان تست» (Test-time Training) در رژیم‌های داده‌های بسیار کم است. با کاهش چندین مرتبه مقداری در محاسبات مورد نیاز برای انطباق هر وظیفه، GEN-1.5 پیشنهاد می‌کند که مقیاس‌بندی داده‌های تعامل فیزیکی می‌تواند به همان نوع پرامپت تک‌نمونه‌ای منجر شود که در GPT-3 شاهد بودیم. این تلاش برای بهینه‌سازی داده‌ها در راستای راهکارهای جدیدی مانند مدل‌های جهانی World Labs برای رفع گلوگاه داده در آموزش ربات‌هاست که سرعت یادگیری را به‌طور چشمگیری افزایش می‌دهند.

با این حال، این نسخه در حال حاضر یک انتشار پژوهشی است. هیچ وزن‌های باز، API یا محصولی برای استفاده عمومی در دسترس نیست و Generalist AI مدل را روی ناوگان و موتور داده‌های خود اجرا می‌کند.

گام بعدی شما

  • دنبال کنید که آیا آزمایشگاه‌های دیگر تلاش می‌کنند «پرامپت فیزیکی» را با مدل‌های وزن‌های باز (Open Weights) بازتولید کنند یا خیر.
  • بررسی کنید که آیا نبود API عمومی، این قابلیت را در موتورهای داده اختصاصی محبوس می‌کند یا به سمت استانداردهای باز می‌رود.
  • تحلیل‌های مربوط به مدل‌های چندوجهی در رباتیک را دنبال کنید تا متوجه شوید مرز بین شبیه‌ساز و واقعیت چگونه در حال محو شدن است.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار داده‌های مقیاس‌بزرگ، هزینه و زمان استقرار ربات‌ها در محیط‌های متغیر را به‌شدت کاهش می‌دهد. در نتیجه، ربات‌ها از ابزارهای صلب صنعتی به دستیاران منعطفی تبدیل می‌شوند که با یک نمایش ساده، وظایف جدید را می‌آموزند.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران مدل‌های بنیادی و رباتیک در ایران اهمیت دارد تا بازار مصرف؛ چرا که دسترسی به مدل و API آن در حال حاضر محدود به شراکت‌های اختصاصی است.

·نگاه ما
تحریریه دات‌هوش

کاهش تغییرات وزن‌ها به کمتر از ۰.۱۵٪ در هنگام انطباق، این فرضیه را تقویت می‌کند که مدل‌های بنیادی رباتیک در حال دستیابی به یک «گرامر کلی حرکت» هستند. در واقع، مدل دیگر یاد نمی‌گیرد که چگونه یک شیء را بردارد، بلکه یاد می‌گیرد کدام‌یک از مهارت‌های از پیش موجودش را برای این شیء خاص فراخوانی کند. این یعنی رباتیک از عصر «برنامه‌نویسی وظیفه» به عصر «بازیابی مهارت» نقل مکان کرده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.