تصور کنید رباتی که برای یادگیری نحوه باز کردن یک در، نیازی به هزاران ساعت تمرین در محیط واقعی ندارد و فقط با تماشای ویدیوهای یوتیوب، مهارت لازم را کسب میکند. این رویای «یادگیری از مشاهده»، حالا با معرفی مدل Rho-1 به واقعیت نزدیکتر شده است.
Reka AI در ۵ اکتبر ۲۰۲۶ پیشنمایش پژوهشی این مدل را منتشر کرد. Rho-1 یک شبکه عصبی (Neural Network) — شبیه نقشهٔ مترو که سیگنالها را از ورودی به جواب میرساند — است که متن، تصویر، ویدیو و دستورات کنترلی ربات را بهصورت توکن (Token) — تکههای کوچکی از داده مثل برشهای یک کیک — در یک پنجرهٔ زمینه (Context Window) مشترک پردازش میکند.
بر اساس گزارش وبسایت the-decoder.com، تفاوت اصلی Rho-1 در این است که برخلاف سیستمهای فعلی که مانند یک مرکز توزیع، هر وظیفه را به یک مدل تخصصی میسپارند، تمام قابلیتها را بهصورت بومی (Native) اجرا میکند. این یعنی مدل میتواند همزمان ویدیو تولید کند و به دستورات جدید پاسخ دهد، بدون اینکه نیاز باشد کل فرآیند را از ابتدا شروع کند. این رویکرد در تولید محتوای بصری، یادآور سازوکارهای تبدیل نویز ریاضی به ویدیوهای واقعگرایانه است که در مدلهای زاینده پیشرفتهتر دیده میشود.
همانطور که در تحلیلهای قبلی ما دربارهی مدلهای بنیادی اشاره کردیم، چالش اصلی همواره دسترسی به دادههای باکیفیت بوده است. Rho-1 برای حل این مشکل از یک مدل «دینامیک معکوس» استفاده میکند تا سیگنالهای کنترلی را از ویدیوهای معمولی اینترنت استخراج کند. این تلاش برای حذف آموزشهای محیطی و گرانقیمت، مشابه رویکرد معماری Helix 2.5 در رباتهای انساننما است که هدفش افزایش موفقیت رباتها در وظایف جدید بدون نیاز به تمرینات تکراری است.
طبق مستندات فنی، جزئیات ساختاری این مدل به شرح زیر است:
- مقیاس: دارای ۱۹ میلیارد پارامتر.
- محاسبات: آموزش با ۳۲۰ عدد GPU (واحد پردازش گرافیکی) مدل H100 در بازه زمانی سه ماهه.
- نوآوری داده: جایگزینی دادههای اختصاصی رباتیک با ویدیوهای مقیاسبزرگ وب.
این پیشرفت، گامی بلند به سوی «مدلهای جهان» است؛ هوش مصنوعیهایی که قوانین فیزیکی محیط را درک میکنند. در حالی که Reka Core در آوریل ۲۰۲۴ برای رقابت با GPT-4 معرفی شده بود، Rho-1 حالا از دنیای متن و تصویر فراتر رفته و وارد حوزه تحریکات فیزیکی شده است.
برای مدیران کسبوکارهای اتوماسیون، این یعنی هزینه استقرار هوش مصنوعی زاینده (Generative AI) در سختافزارهای فیزیکی بهشدت کاهش مییابد، زیرا منبع یادگیری از آزمایشگاههای گرانقیمت به یوتیوب منتقل شده است. این کاهش هزینهها میتواند مسیر را برای استقرار سریعتر رباتهای هوشمند در مقیاس صنعتی هموارتر کند.
گام بعدی شما
- بررسی نحوه ادغام این معماری با سختافزارهای رباتیک موجود برای سنجش میزان تأخیر (Latency) در دنیای واقعی.
- تحلیل ویدیوهای آموزشی برای شناسایی الگوهایی که مدلهای دینامیک معکوس بهتر استخراج میکنند.
- دنبال کردن گزارشهای مربوط به انتقال Rho-1 از محیط پژوهشی به استقرار صنعتی.
اما چالش اصلی، تطبیق این مدل با سختافزارهای متنوع رباتیک است — به تحلیل ما دربارهی استانداردهای سختافزاری AI مراجعه کنید.




گفتگو