پرش به محتوای اصلی
پرش به محتوای مقاله

آیا تماشای ویدیوهای اینترنتی می‌تواند جایگزین برچسب‌گذاری داده‌ها شود؟

·۲۴ تیر ۱۴۰۵۱۵ دقیقه مطالعه
مدل هدف‌مند عمومی ماینکرفت - پانتوگراف
مدل هدف‌مند عمومی ماینکرفت - پانتوگراف
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از ۵۰۰ هزار ساعت ویدیو بدون برچسب برای یادگیری «تابع ارزش» پیش از یادگیری «اقدامات»؛ این یعنی مدل ابتدا می‌فهمد چه وضعیتی مطلوب است و سپس یاد می‌گیرد چگونه به آن برسد.

تصور کنید رباتی که بدون هیچ دستورالعمل یا راهنمای انسانی، تنها با تماشای ساعت‌ها فیلم از دیگران، یاد بگیرد چگونه یک سازه پیچیده را بسازد یا در یک محیط ناشناخته بجنگد. این همان دستاوردی است که مدل Pan در دنیای مجازی ماینکرفت به آن رسیده است.

طبق گزارش فنی منتشر شده در ۱۵ ژوئیه ۲۰۲۶، مدل Pan با ۴ میلیارد پارامتر، توانسته است با تحلیل ۵۰۰ هزار ساعت ویدیوهای بدون برچسب از بازی ماینکرفت، مفاهیم «هدف‌مندی» را درک کند. این مدل برخلاف روش‌های سنتی، به جای تکیه بر مجموعه‌های داده گران‌قیمت که توسط انسان برچسب‌گذاری شده‌اند، از اقیانوس وسیع داده‌های ویدئویی اینترنت برای یادگیری استفاده کرده است. سیستم Pan ویدیوهای اینترنتی را به عنوان مسیرهای یادگیری تقویتی (RL) را می‌بیند که حاوی مشاهدات هستند اما فاقد پاداش‌های صریح یا برچسب‌های اکشن می‌باشند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت و آموزش مدل‌های بنیادی اشاره کردیم، گلوگاه اصلی پیشرفت رباتیک، کمبود داده‌های متنوع و باکیفیت است. داده‌های رباتیکی با کیفیت بالا کمیاب هستند و جمع‌آوری آن‌ها بسیار هزینه‌بر است. به همین دلیل پژوهشگران به سراغ محیط‌هایی مانند ماینکرفت می‌روند؛ زیرا این بازی‌ها محیطی امن، باز و تکرارپذیر فراهم می‌کنند که از اهداف بلندمدت (Long-horizon goals) پشتیبانی می‌کنند. این ویژگی‌ها، ماینکرفت را به میدانی ایده‌آل برای اعتبارسنجی مدل‌ها پیش از استقرار در ربات‌های فیزیکی تبدیل می‌کند. تیم توسعه‌دهنده خاطرنشان می‌کند که بازی‌ها بازتولیدپذیر و ایمن‌تر از رباتیک هستند؛ اگر روشی در یک بازی شکست بخورد، بسیار بعید است که در یک مدل رباتیک دنیای واقعی موفق شود. در واقع، ماینکرفت در اینجا به عنوان یک میدان آزمایش با وفاداری بالا (High-fidelity) برای اعتبارسنجی مدل‌ها عمل می‌کند.

سازوکار: پیش‌آموزش شرطی‌شده با هدف

نوآوری اصلی معماری Pan در نحوه مدیریت هدف‌مندی است. اکثر مدل‌ها اهداف را در یک مرحله پس‌آموزش (Post-training) یاد می‌گیرند که این امر اغلب توانایی آن‌ها را در تعمیم دادن به موقعیت‌های جدید محدود می‌کند. اما Pantograph یادگیری هدف را مستقیماً در مرحله پیش‌آموزش (Pretraining) با استفاده از تکنیکی به نام «برچسب‌گذاری مجدد پس‌نگر» (Hindsight Relabeling) ادغام کرده است.

در این روش، مدل یک فریم از اواخر ویدیو را به عنوان «هدف» برای یک فریم در ابتدای ویدیو در نظر می‌گیرد و یک تابع ارزش (Value Function) می‌سازد. این تابع تخمین می‌زند که احتمال رسیدن به آن تصویر هدف خاص در آینده چقدر است. این ترفند، یک مسئله تصمیم‌گیری پیچیده و چندمرحله‌ای را به یک مسئله ساده‌تر تک‌مرحله‌ای تبدیل می‌کند.

جزئیات فنی و رویکرد پیاده‌سازی

  • برچسب‌گذاری مجدد پس‌نگر: این مکانیسم با برچسب‌زدن هر اتفاقی که در ویدیو واقعاً رخ داده است به عنوان «هدف مورد نظر»، شکست‌های احتمالی را به موفقیت تبدیل می‌کند. این امر به مدل اجازه می‌دهد تا از تک‌تک مسیرها، صرف‌نظر از قصد اولیه کاربر، یاد بگیرد و نیاز به تعریف یک تابع پاداش رسمی را از بین می‌برد.
  • یادگیری مستقل از اکشن: مدل توابعی را یاد می‌گیرد که فقط به وضعیت‌ها (States) وابسته هستند. در یادگیری تقویتی شرطی‌شده با هدف، این توابع نشان‌دهنده احتمال دستیابی به فریم هدف و توزیع فریم بعدی برای یک سیاست (Policy) هستند. این فرآیند پیش از معرفی هرگونه برچسب اکشن صورت می‌گیرد.
  • مدل‌سازی احتمالی: محققان در حال بررسی موازنه‌های فنی بین مدل‌های مبتنی بر احتمال (Likelihood-based)، مدل‌های مبتنی بر انرژی (Energy-based) و یادگیری مقابله‌ای (Contrastive Learning) برای این توابع هستند.
  • Sutton and Barto (2018): تیم توسعه‌دهنده با استناد به دیدگاه‌های ساتون و بارتو (۲۰۱۸)، تاکید می‌کند که یک تابع ارزش قوی، یادگیری عمل را به شدت تسهیل کرده و مسئله تصمیم‌گیری چندمرحله‌ای را به صورت مؤثری به یک مسئله تک‌مرحله‌ای ساده می‌کند.
  • سنجش‌های جایگزین (Successor Measures): این کار بر پایه رابطه ریاضی است که در آن ارزش یک وضعیت در RL با پاداش نشانگر (۱ در وضعیت هدف، ۰ در سایر موارد)، برابر است با احتمال اینکه وضعیت آینده، همان وضعیت هدف باشد. این رابطه به صورت فرمول $\sigma_t(s, g) = \sum_{\delta t=1}^{\infty} \mathbb{P}(s_{t+\delta t} = g)$ بیان می‌شود، که در آن $\delta t$ از یک زوال نمایی با نرخ تخفیف $\gamma$ پیروی می‌کند.
  • یادگیری در بستر متن (In-Context Learning): از آنجایی که داده‌های پیش‌آموزش شامل سیاست‌های بسیار متفاوتی در محیط‌های گوناگون است، مدل از یادگیری در بستر متن برای استنباط تمایلات و سطح مهارت سیاست‌های موجود در یک ویدیوی خاص استفاده می‌کند و به عنوان یک تابع ارزش عمومی عمل می‌کند.
  • مودالیته‌ها: اگرچه این روش به عنوان مسیرهای RL برای ویدیو دیده می‌شود، اما تیم معتقد است که احتمالاً برای صوت نیز کاربرد دارد، هرچند برای اکثر داده‌های متنی که ترانسکریپت تعامل یک عامل با محیط نیستند، قابل اعمال نخواهد بود.

مقیاس آموزش و خط لوله

مدل Pan طی یک خط لوله دو مرحله‌ای آموزش دیده است:

۱. پیش‌آموزش: مدل تقریباً ۵۰۰ هزار ساعت ویدیوهای متنوع گیم‌پلی ماینکرفت را پردازش کرد. این مرحله کاملاً مستقل از اکشن بود، به این معنی که هیچ برچسب اکشنی استفاده نشد.
۲. پس‌آموزش: مدل با استفاده از حدود ۲ هزار ساعت مسیرهای پیموده شده توسط پیمانکاران که شامل هر دو توالی ویدیو و اکشن است، پالایش شد. فضای اکشن تنها در این مرحله وارد خط لوله می‌شود.

برای بهینه‌سازی، رزولوشن تصاویر ۱۲۸x۱۲۸ پیکسل با نرخ ۱۰ فریم بر ثانیه انتخاب شده است. پنجره زمینه (Context Window) مدل ۳۰۰ فریم است (حدود ۳۰ ثانیه گیم‌پلی). اگرچه رزولوشن پایین باعث محدودیت در کارهایی مثل ساخت‌وساز (Crafting) می‌شود، اما رفتارهای پیچیده را ممکن می‌کند. برای سادگی، اهداف از داخل همین پنجره ۳۰۰-فریمی نمونه‌برداری شدند. تیم تخمین می‌زند که یک پنجره متنی با ۱ میلیون توکن، معادل حدود ۷ ساعت زمینه (Context) خواهد بود.

مشخصات فضای اکشن

خروجی‌های کنترلی مدل شامل ورودی‌های گسسته و پیوسته زیر است:

  • کلیدهای گسسته: WASD، Space، Shift چپ و راست، کلیک چپ و راست (در مجموع ۹ کلید).
  • دسترسی به Hotbar: در آزمایش‌های خاص، کلیدهای ۱ تا ۹ و یک نمایش چرخ اسکرول (+۱، -۱، ۰) برای تعویض آیتم‌ها به مدل داده شد.
  • حرکت پیوسته: دو بعد پیوسته برای حرکت ماوس در امتداد محورهای X و Y.
  • فرکانس اکشن: مدل با فرکانس ۲۰ هرتز عمل می‌کند.

بنچمارک‌ها و ارزیابی عملکرد

Pantograph مدل Pan-4B را در برابر دو رقیب (Baseline) سنجید: STEVE-1 (یک سیاست متن‌باز مبتنی بر VPT و مدل دینامیک معکوس) و یک مدل VLA که از Gemma 4 (مدل ۲۰۲۶ دیپ‌مایند) مقداردهی اولیه شده بود. هر دو رقیب با همان مجموعه داده پیمانکاران پس‌آموزش دیده بودند. مدل VLA فضای اکشن را با استفاده از موقعیت‌های توالی مجزا برای ۹ کلید گسسته و ۲۵۶ توکن کوانتیل برای محورهای ماوس توکنایز کرد. در مقابل، STEVE-1 به جای تک تصویر، با ویدیوهای هدف ۱۶-فریمی هدایت شد.

در ۱۰۴ محیط ارزیابی (که هر کدام شامل یک دنیای ذخیره شده اولیه و یک دنیای ذخیره شده هدف بود)، Pan-4B برتری چشمگیری در دقت دنبال کردن اهداف داشت. ارزیابان این محیط‌ها ترکیبی از سیستم‌های برنامه‌نویسی شده (Programmatic) و مدل‌های زبانی بودند.

در وظایف پیمایش ساده، Pan-4B امتیاز ۸۵.۷٪ را کسب کرد، در حالی که STEVE-1 و مدل VLA به ترتیب ۱۶.۵٪ و ۱۸.۷٪ امتیاز گرفتند. محققان متوجه رفتاری به نام «رقص هدف» (Goal Dance) شدند؛ جایی که مدل برای تطبیق دقیق دید خود با تصویر هدف، به دور آن نوسان می‌کند که نشان‌دهنده اعتماد بالای مدل به دستیابی به هدف است.

مدل هدف‌مند عمومی ماینکرفت - پانتوگراف

در مواجهه با اهداف غیرمعمول (مانند شنا به سمت یک پنل طلا یا نگاه کردن به یک هدف پشمی)، Pan-4B نرخ موفقیت ۹۹.۴٪ داشت، در حالی که STEVE-1 تنها ۱۱.۰٪ و VLA حدود ۳.۲٪ موفق بود. این نتیجه ثابت می‌کند که پیش‌آموزش شرطی‌شده با هدف برای وظایفی که خارج از توزیع داده‌های آموزش هستند (Off-distribution)، به شدت موثرتر است.

ساخت‌وساز و وظایف پیچیده

ساخت سازه‌ها همچنان یک چالش بزرگ برای عامل‌های هوش مصنوعی است. در تست‌های ساخت‌وساز، Pan-4B با امتیاز ۳۸.۳٪، رقبای خود را (STEVE-1 با ۵.۰٪ و VLA با ۴.۱٪) با اختلاف زیادی شکست داد.

مدل هدف‌مند عمومی ماینکرفت - پانتوگراف

مدل هدف‌مند عمومی ماینکرفت - پانتوگراف

در اینجا مقیاس (Scale) برای این وظایف معنایی حیاتی بود. در خانواده مدل‌های Pan، نسخه ۴ میلیارد پارامتری (۳۸.۳٪) بسیار بهتر از نسخه ۲ میلیارد پارامتری (۲۶.۹٪ با فاصله اطمینان ۹۵٪ [۲۴.۴٪، ۲۹.۴٪]) و نسخه ۲۰۰ میلیون پارامتری (۱۳.۹٪ با فاصله اطمینان ۹۵٪ [۱۲.۱٪، ۱۵.۸٪]) عمل کرد. برای Pan-4B، فاصله اطمینان ۹۵٪ برای ساخت‌وساز [۳۲.۰٪، ۳۷.۴٪] بود.

با این حال، مدل‌ها همچنان در «بازیابی از خطا» مشکل دارند؛ برای مثال، ممکن است تصادفاً بلوک‌هایی را که قرار بود قرار دهند بشکنند و کارایی لازم برای اصلاح آن‌ها در بازه ۳۰ ثانیه‌ای را نداشته باشند. حالت شکست دیگر شامل پرسه زدن مدل برای بررسی اینکه آیا سازه در جای دیگری از دنیا ساخته شده است یا خیر. این موضوع نشان می‌دهد که نیاز به پنجره‌های زمینه طولانی‌تر وجود دارد تا به مدل کمک کند جست‌وجو را رها کرده و شروع به ساختن کند.

مدل عمومی ماینکرفت با هدف مشخص‌شده - پانتوگراف

نبرد، مکانیسم‌ها و اکتشاف

در سناریوهای رزمی، Pan-4B یک استراتژی کلی توسعه داد: ضربه زدن به هیولا، عقب‌نشینی و سپس ضربه مجدد. این روش به مدل اجازه داد تا کریپرها و زامبی‌ها را در راهروهای تنگ با موفقیت ۴۵.۳٪ شکست دهد، اگرچه در مواجهه با اسکلت‌ها و استفاده از سپر مشکل دارد. STEVE-1 در این محیط‌ها ۴۴.۹٪ و VLA امتیاز ۲۱.۰٪ گرفتند.

مدل هدف‌مند عمومی ماینکرفت - پانتوگراف

در مورد مکانیسم‌های بازی، Pan-4B با موفقیت از سطل‌ها، چخماق و ابزار ماهیگیری استفاده کرد، اما در مورد اهرم‌ها، اندر پرل‌ها (Ender Pearls) و رام کردن حیوانات شکست خورد. در مجموع ۳۰ محیط مکانیکی متنوع، Pan-4B امتیاز ۲۴.۴٪ (فاصله اطمینان ۹۵٪ [۲۲.۳٪، ۲۶.۵٪]) گرفت، در حالی که Pan-2B امتیاز ۱۵.۱٪ (فاصله اطمینان ۹۵٪ [۱۳.۵٪، ۱۶.۹٪]) را کسب کرد که حاشیه اختلاف ۹.۳٪ (فاصله اطمینان ۹۵٪ [۶.۵٪، ۱۲.۱٪]) را نشان می‌دهد.

نتایج اکتشاف و Hotbar

  • اکتشاف: Pan-4B در جست‌وجوی درختان، گل‌ها یا استخرهای گدازه خاص، موفقیت ۴۰.۹٪ داشت، در حالی که STEVE-1 و VLA به ترتیب ۱۲.۳٪ و ۹.۳٪ امتیاز گرفتند. اختلاف Pan-4B با STEVE حدود ۲۰.۸٪ (فاصله اطمینان ۹۵٪ [۱۵.۴٪، ۲۶.۸٪]) و با VLA حدود ۲۰.۳٪ (فاصله اطمینان ۹۵٪ [۱۴.۱٪، ۲۶.۴٪]) بود. تیم معتقد است مدل از نشانه‌های بصری ظریف برای هدایت جست‌وجوی خود استفاده می‌کند.
  • تعویض آیتم (Hotbar): مدل‌هایی که به کلیدهای عددی دسترسی داشتند، ۸۷.۵٪ در تعویض آیتم موفق شدند. با این حال، آن‌ها در تعویض سریع بین یک بلوک ساختمانی و ابزاری برای شکستن بلوک‌های اشتباه قرار داده شده، مشکل دارند.

محیط‌های دشوار و سوءاستفاده از پاداش

برای تست توانایی‌های خارج از توزیع، تیم از محیط «گانتلت» (Gauntlet) با سازه‌های دست‌ساز استفاده کرد. تنها Pan-4B توانست این مراحل را با موفقیت ۵۱.۲٪ به پایان برساند (در مقابل ۲۱.۴٪ STEVE-1 و ۶.۴٪ VLA).

محققان همچنین مواردی از سوءاستفاده از پاداش آفلاین (Offline Reward Hacking) مشاهده کردند. در یک مورد، مدل به جای سوار شدن بر اسب برای عبور از حصار، می‌پرید و دور می‌زد تا دقیقاً همان زاویه دید با زاویه بالای تصویر هدف را بازسازی کند. در موردی دیگر، مدل از شکاف یک پل سقوط کرد اما از سمت دیگر دره بالا رفت تا به هدف برسد. این اتفاقات در محیط‌هایی رخ داد که مدل هرگز در آموزش ندیده بود و در این موارد هکینگ امتیاز ۸.۳٪ ثبت شد.

تحلیل: تعریف مجدد خط لوله رباتیک

این پژوهش اساساً تکیه بر مجموعه‌های داده برچسب‌دار اکشن را به چالش می‌کشد. با اثبات اینکه یک مدل می‌تواند قصد و ارزش یک وضعیت را تنها از طریق داده‌های مشاهده‌محور یاد بگیرد، Pantograph در حال خلق نقشه‌ای برای یک «مدل بنیادی برای اکشن» است.

برخلاف مدل‌هایی که برای به حداکثر رساندن یک امتیاز عددی خاص آموزش می‌بینند (مانند Dreamer که محدود به توابع پاداش تعریف‌شده است)، عامل‌های شرطی‌شده با هدف یک‌بار آموزش می‌بینند و می‌توانند هر هدف جدیدی را در زمان استنتاج، بدون نیاز به آموزش مجدد، به دست آورند. این مفهوم مشابه پیش‌بینی توکن بعدی در مدل‌های زبانی (LLM) است. تیم خاطرنشان می‌کند که در حالی که یادگیری مدل جهانی برای یک مکعب روبیک ساده است (پیش‌بینی وضعیت بعدی)، آموزش شرطی‌شده با هدف بسیار سخت‌تر است زیرا نیازمند دانستن حرکات دقیق برای انتقال بین هر دو وضعیت است.

توسعه‌های آتی می‌تواند شامل استفاده از مدل‌های زبانی برای تولید توصیف‌های متنی از پیش‌-ویدیوها باشد که سپس به عنوان هدف عمل کنند. کلید این موضوع آن است که توصیفات هدف باید تنها از روی ویدیو قابل استنباط باشند. برخی الگوریتم‌ها مانند CRL حتی اجازه ترکیب خطی اهداف را می‌دهند.

برای جامعه فنی، تغییر مسیر روشن است: پیش‌آموزش برای هدف‌مندی برتر از پس‌آموزش برای آن است. اگر این رویکرد مقیاس‌پذیر باشد، ممکن است مدل‌هایی ببینیم که روی مجموعه‌های عظیم ویدیوهای اینترنتی مقداردهی اولیه شده و سپس تنها با چند ساعت داده‌های اکشن خاص، برای ربات‌های فیزیکی «باز» (Unlock) می‌شوند. این دقیقاً مشابه انتقال LLMها از پیش‌آموزش عمومی به تنظیم دستورالعمل (Instruction Tuning) است.

مسیر رسیدن به رباتیک عمومی

Pantograph قصد دارد این مدل‌ها را با گسترش توزیع آموزش بهC-computer use (استفاده از کامپیوتر)، ویدیوهای عمومی دنیای واقعی و داده‌های واقعی رباتیک مقیاس‌پذیرتر کند. آن‌ها همچنین قصد دارند از این مدل‌های شرطی‌شده با هدف به عنوان مقداردهی اولیه برای یادگیری تقویتی آنلاین استفاده کنند، زیرا انتظار دارند پس از اینکه مدل به توانایی متوسطی رسید، عملکرد آن به شدت بهبود یابد.

آن‌ها همچنین در حال طراحی سخت‌افزارهای تخصصی بهینه شده برای RL در دنیای واقعی هستند. هدف نهایی، ایجاد مدل‌های رباتیک کاملاً عمومی است که قادر باشند برای ساعت‌ها به صورت خودکار در هر محیط بصری عمل کنند.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص در یادگیری تقویتی، گلوگاه داده در رباتیک را می‌شکند و امکان آموزش مدل‌های بنیادی برای عمل (Action) را فراهم می‌کند. اعتبار این روش با موفقیت چشمگیر در وظایف خارج از توزیع (Off-distribution) به اثبات رسیده است.

تأثیر برای ایران

این رویکرد برای پژوهشگران ایرانی در حوزه رباتیک و هوش مصنوعی که با محدودیت دسترسی به مجموعه‌های داده گران‌قیمت و برچسب‌دار مواجه‌اند، یک جایگزین استراتژیک بر پایه داده‌های بصری در دسترس فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی داده‌های اکشن برچسب‌دار با داده‌های مشاهده‌ای (ویدیو) در مقیاس میلیونی، پارادایم آموزش عامل‌ها را از «تقلید از انسان» به «درک ارزش وضعیت» تغییر می‌دهد. این رویکرد عملاً مدل را به یک «سنگ‌بنای عملیاتی» تبدیل می‌کند که به جای یادگیری یک مهارت خاص، منطق رسیدن به هدف را می‌آموزد. اگر این متدولوژی در دنیای فیزیکی مقیاس‌پذیر شود، عصر جمع‌آوری دستی داده‌های رباتیک به پایان می‌رسد و جای خود را به تحلیل ویدیوهای محیطی می‌دهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.