پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Orca کنترل ربات‌ها را بدون نیاز به داده‌های برچسب‌گذاری‌شده ممکن کرد

·۲۰ تیر ۱۴۰۵۵ دقیقه مطالعه۲ بازدید
مدل جهانی Orca چین بدون دیدن هیچ برچسب عملی، با سیستم‌های تخصصی رباتیک برابری می‌کند.
مدل جهانی Orca چین بدون دیدن هیچ برچسب عملی، با سیستم‌های تخصصی رباتیک برابری می‌کند.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

دستیابی به دقت سیستم‌های تخصصی رباتیک بدون مشاهده حتی یک برچسب عملیاتی در مرحله پیش‌آموزش؛ یعنی یادگیری کنترل فیزیکی صرفاً از طریق تماشای ویدیوهای خام.

تصور کنید رباتی که هرگز آموزش ندیده است چگونه یک وسیله را جابه‌جا کند، تنها با تماشای هزاران ساعت ویدیو از محیط‌های مختلف، متوجه شود که دنیا چگونه تغییر می‌کند. این همان نقطه‌ای است که Orca در آن بازی را عوض می‌کند و ثابت می‌کند برای داشتن هوش فیزیکی، لزوماً به داده‌های گران‌قیمت و برچسب‌دار نیاز نداریم.

طبق گزارش فنی منتشر شده در ۱۱ ژوئیه ۲۰۲۶، تیم BAAI مدلی به نام Orca را توسعه داده که عملکرد سیستم‌های تخصصی رباتیک را تقلید می‌کند، در حالی که در مرحله پیش‌آموزش (Pre-training)، حتی یک برچسب عملیاتی (Action Label) را ندیده است. این دستاورد نشان می‌دهد که کمبود مزمن داده‌های برچسب‌دار در رباتیک، دیگر مانع اصلی در مسیر رسیدن به هوش فیزیکی نیست.

سال‌ها بود که صنعت هوش مصنوعی روی پیش‌بینی کلمه بعدی در یک جمله متمرکز بود. حالا مرز رقابت به سمت مدل‌های جهانی (World Models) — سیستم‌هایی که حالت بعدی محیط فیزیکی را پیش‌بینی می‌کنند — جابه‌جا شده است. این رویکرد در واقع پاسخی به چالش‌های بنیادینی است که در توسعه زیرساخت‌های نرم‌افزاری مبتنی بر شبیه‌سازها وجود داشت. همان‌طور که پیشگامانی چون NVIDIA، DeepMind و جدیدترین پروژه‌های یان لکان (Yann LeCun) برای عبور از مرز زبان در رقابت هستند، Orca وارد میدان می‌شود. این مدل هوش را نه به عنوان مجموعه‌ای از پیش‌بینی‌های تخصصی (مانند مدل‌های زبانی، تولیدکننده‌های ویدیو یا کنترل‌کننده‌های ربات)، بلکه به عنوان درکی کلی از اینکه جهان چگونه تغییر می‌کند، تعریف می‌کند.

Orca از یک هسته ثابت بر پایه مدل بینایی-زبانی Qwen3.5 استفاده می‌کند. به جای ساخت یک کنترل‌کننده یکپارچه و حجیم (Monolithic Controller)، BAAI از ماژول‌های الحاقی قابل تعویض استفاده کرده تا وضعیت داخلی مدل را به متن، تصویر یا حرکات فیزیکی تبدیل کند. این طراحی باعث می‌شود تصویر داخلی جهان که از سیگنال‌های تصویری و زبانی ساخته شده، پایه و اساس تمام وظایف باقی بماند.

مدل جهانی Orca چین بدون دیدن حتی یک برچسب عمل، با سیستم‌های تخصصی رباتیک برابری می‌کند.

این سیستم از دو حالت یادگیری متمایز بهره می‌برد که با یکدیگر تعامل دارند:

  • یادگیری ناخودآگاه: مدل ویدیوهای خام و بدون برچسب را تماشا می‌کند تا فضاهای انتزاعی حالت بعدی را پیش‌بینی کند. مدل به جای پیش‌بینی در سطح پیکسل (که بسیار هزینه‌بر و نویزی است)، در یک فضای انتزاعی عمل می‌کند تا الگوهای حرکتی، پدیده انسداد (Occlusions) و پویایی‌های معمول صحنه را یاد بگیرد.
  • یادگیری خودآگاه: مدل از دستورات کلامی و توصیفات تغییر حالت استفاده می‌کند. در این حالت، ویدیوها به بخش‌های کوچک تقسیم شده و هر بخش با شرحی از تغییر وضعیت برچسب می‌خورد تا مدل بیاموزد وقتی یک اقدام خاص صورت می‌گیرد، وضعیت محیط دقیقاً چگونه تغییر می‌کند.

مدل جهانی Orca چین بدون دیدن حتی یک برچسب عمل، با سیستم‌های تخصصی رباتیک برابری می‌کند.

علاوه بر این، Orca روی وظایف کلاسیک پرسش-وپاسخ تصویری (VQA) آموزش دیده است. این کار به مدل اجازه می‌دهد تا ضمن توسعه مدل جهانی خود، توانایی پاسخ به پرسش‌های زبان طبیعی را حفظ کرده و تعامل متنی خود را ارتقا دهد.

برای ساخت این نقشه داخلی، پژوهشگران مجموعه‌ای عظیم شامل ۱۲۵,۰۰۰ ساعت ویدیو، ۱۶۰ میلیون توصیف رویداد و ۱۱.۵ میلیون جفت پرسش-وپاسخ را گردآوری کردند. داده‌های ویدیو بسیار متنوع هستند و چهار دیدگاه مختلف را پوشش می‌دهند: نماهای اول‌شخص از تعاملات روزمره، نماهای سوم‌شخص از جابه‌جایی اشیا، ضبط‌های رباتیک بدون داده‌های عملیاتی و صحنه‌های طبیعی. نکته جالب این است که نسخه فعلی مدل تنها از یک‌دهم این حجم از داده‌های ویدیو موجود استفاده کرده است.

Orca خروجی‌ها را از سه مسیر موازی پردازش می‌کند که همگی از یک هسته ثابت تغذیه می‌شوند:

  • متن: این مسیر توسط لایه‌ی زبانی موجود در Qwen3.5 مدیریت می‌شود.
  • تصویر: از مدل Stable Diffusion 3.5 استفاده می‌کند که بدون تغییر باقی مانده است. تنها لایه‌های آداپتور (Adapter) کوچک در مسیر بالادستی آموزش دیده‌اند تا وضعیت داخلی Orca را به تولیدکننده تصویر منتقل کنند.
  • اکشن‌های رباتیک: توسط یک ماژول کنترل مجزا به نام «متخصص اکشن» (Action Expert) مدیریت می‌شود که از صفر آموزش دیده است.

مدل جهانی Orca چین بدون دیدن حتی یک برچسب عمل، با سیستم‌های تخصصی رباتیک برابری می‌کند.

مدل جهانی Orca چین بدون دیدن هیچ برچسب عملی، با سیستم‌های تخصصی رباتیک برابری می‌کند.

تیم BAAI تأکید کرده است که هدف آن‌ها دنبال کردن رکوردهای تک‌بعدی در بنچمارک‌های خاص نیست، بلکه می‌خواهند ثابت کنند که یک وضعیت داخلیِ جهان که به خوبی آموزش دیده باشد، می‌تواند به عنوان یک پایه مشترک و جامع برای وظایف بسیار متفاوت عمل کند.

در مقایسه‌ای مستقیم در محک PRICE-V0.1 — ابزاری سفارشی که از صحنه‌های واقعی رباتیک و نماهای اول‌شخص استفاده می‌کند — مدل Orca-4B در تولید تصاویر نتیجه برای دستوراتی مانند «میکروویو را ببند»، امتیاز ۵۹.۸ درصد را کسب کرد. این عدد از مدل‌های تخصصی تولید تصویر مثل FLUX.2 small (۵۶.۱٪)، FLUX.1-context (۴۰.۹٪) و OmniGen2 (۳۹.۶٪) بالاتر است.

مدل جهانی Orca چین بدون دیدن حتی یک برچسب عمل، با سیستم‌های تخصصی رباتیک برابری می‌کند.

Orca در مقایسه با مدل‌های صرفاً تصویری، انسجام بیشتری داشت. مدل‌های تصویری خالص اغلب اشیاء نامربوط اضافه می‌کنند یا دچار توهم (Hallucination) شده و دست‌های اضافی در تصویر می‌سازند. در مقابل، Orca شکل ربات، نقاط تماس آن با اشیاء و ارتباط منطقی با دستور داده شده را بهتر حفظ می‌کند.

در آزمایش‌های ربات‌های انسان‌نما — مانند چیدمان کتاب‌ها در قفسه، چیدن کاسه‌ها روی هم یا برداشتن شکر با ربات‌های دو بازو روی چرخ — Orca با عملکرد مدل π0.5 برابری کرد؛ سیستمی که دقیقاً و به‌طور تخصصی روی داده‌های رباتیک ساخته شده است. نکته کلیدی و شگفت‌انگیز این است که مدل پایه Orca در مرحله پیش‌آموزش هرگز ندید که کدام حرکت با کدام تصویر مرتبط است. برای کنترل واقعی، یک ماژول مجزا در مرحله بعد تنها با استفاده از ۲۰۰ ضبط واقعی برای هر وظیفه آموزش دید.

مدل جهانی Orca چین بدون دیدن حتی یک برچسب عمل، با سیستم‌های تخصصی رباتیک برابری می‌کند.

در حالی که π0.5 اغلب در شکست‌های تکراری گیر می‌افتاد (Looping failures)، Orca توانایی برتری در تلاش مجدد و بازیابی از گرفتن‌های ناموفق (Failed grasps) نشان داد. مدل‌های پایه مثل V-JEPA 2.1 و Qwen3.5 با وجود استفاده از همان ماژول کنترل، بسیار عقب‌تر بودند. نویسندگان مقاله معتقدند این روش یک راهکار بالقوه برای کاهش نیاز صنعت رباتیک به داده‌های عملیاتی برچسب‌دار است.

برای بهینه‌سازی آموزش، BAAI از کتابخانه FlagScale استفاده کرد و چندین اصلاح در مدیریت حافظه و ارتباطات پیاده کرد. این کار باعث شد سرعت آموزش روی کارت‌های H100 به ۲.۹۱ نمونه در ثانیه بر هر GPU برسد؛ رقمی که حدود ۴.۴ برابر سریع‌تر از کدبیس رایج StarVLA است.

مدل Orca در دو اندازه ۰.۸ و ۴ میلیارد پارامتر آموزش دید. نتایج نشان داد که با بهبود وضعیت داخلی جهان در پیش‌آموزش، نتایج در هر سه حالت خروجی (متن، تصویر، اکشن) بهبود می‌یابد. در بنچمارک‌های متنی، مدل Orca-4B میانگین ۵۱.۸ درصد را در مجموع چهار بنچمارک MVBench، TemporalBench, 3DSRBench و SWITCH کسب کرد.

این امتیاز از چندین مدل پایه، از جمله Qwen3.5-4B (هرچند Qwen3.5-4B در MVBench پیشتاست)، Gemma 4-4B و DeepSeek-VL2-3B بهتر است. علاوه بر این، Orca-4B حتی مدل‌های جهانی بسیار بزرگ‌تری مانند Emu3 (۸ میلیارد پارامتر) و Emu3.5 (۳۴ میلیارد پارامتر) را شکست داد.

این تغییر ثابت می‌کند که درک جهان را می‌توان از اجرای عمل جدا کرد. BAAI با این کار نقشه‌ای برای ربات‌هایی ارائه داده است که می‌توانند از هر ویدیوی موجود در اینترنت یاد بگیرند.

با این حال، Orca محدودیت‌هایی دارد. این مدل فعلاً فقط از تصویر و متن یاد می‌گیرد و ورودی‌های حسی حیاتی مثل صدا، نیرو (Force) و لمس را کاملاً نادیده می‌گیرد. همچنین پیش‌بینی‌های بصری در فضای یک رمزگذار تصویر (Image Encoder) پیش‌آموزش‌دیده رخ می‌دهد، نه در فضایی که از صفر یاد گرفته شده باشد. توصیفات رویدادها نیز محدود به پنجره‌های زمانی کوتاهی در حد چند دقیقه هستند.

تیم BAAI معتقد است مدل‌های ۰.۸ و ۴ میلیارد پارامتری هنوز برای مدل‌سازی کامل جهان کوچک هستند. آن‌ها تأکید می‌کنند که هدف نهایی، ساخت یک مدل جهانی بومی (Native World Model) است که تمام سیگنال‌های حسی را از ابتدا و از صفر یاد بگیرد.

این پژوهش به بحث‌های جاری درباره تعریف مدل‌های جهانی دامن می‌زند. در حالی که تیمی از دانشگاه پکن تعریفی واحد از طریق OpenWorldLib ارائه کردند که مدل‌های صرفاً متن‌به-ویدیو مثل Sora را حذف می‌کند، بنچمارکی از دانشگاه تسینگ‌هوا نشان داد که حتی Sora 2 و Veo 3.1 در پیش‌بینی پیشرفت‌های منطقی و فیزیکی صحنه با چالش روبرو هستند. رویکرد Orca به «مدل‌های اکشن جهانی» (World Action Models) با ترکیب پیش‌بینی تغییر حالت و تولید عمل، سعی می‌کند این شکاف را پر کند.

گام بعدی شما

  • اگر توسعه‌دهنده رباتیک هستید، ساختار جداسازی «درک جهان» از «اجرای اکشن» در Orca را برای کاهش وابستگی به داده‌های برچسب‌دار بررسی کنید.
  • برای درک تفاوت پیش‌بینی پیکسل در برابر پیش‌بینی در فضای انتزاعی، مستندات FlagScale را مطالعه کنید.
  • وضعیت رقابتی مدل‌های VLM کوچک (زیر ۵ میلیارد پارامتر) را در تسک‌های استدلال بصری دنبال کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با تکیه بر اعتبار داده‌های ویدیوهای عمومی، وابستگی صنعت رباتیک به داده‌های گران‌قیمت و جمع‌آوری‌شده در آزمایشگاه را کاهش می‌دهد. در نتیجه، سرعت توسعه ربات‌های همه‌منظوره که از اینترنت یاد می‌گیرند، به‌شدت افزایش می‌یابد.

تأثیر برای ایران

این پژوهش بیشتر برای پژوهشگران مدل‌های بنیادی و رباتیک در ایران اهمیت دارد تا بازار مصرف؛ چرا که مسیر جدیدی برای آموزش ربات‌ها با داده‌های عمومی (بدون نیاز به تجهیزات گران‌قیمت جمع‌آوری داده) باز می‌کند.

·نگاه ما
تحریریه دات‌هوش

جداسازی لایه‌ی درک محیط از لایه‌ی اجرای دستور، یک چرخش استراتژیک در رباتیک است. Orca نشان می‌دهد که «شهود فیزیکی» را می‌توان از طریق مشاهده‌ی انبوه ویدیوها استخراج کرد، بدون اینکه لزوماً بدانیم هر حرکت دقیقاً چه نامی دارد. این یعنی ربات‌ها می‌توانند شبیه به انسان‌ها، ابتدا دنیا را «ببینند و بفهمند» و سپس در مراحل بسیار کوتاه‌تری، «کار کردن با آن» را یاد بگیرند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.