تصور کنید یک بازیکنی که با بیدقتی دستههای بازی را فشار میدهد، در واقع در حال آموزش دادنِ قوانین جهان به یک ماشین است. استارتاپ بریتانیایی Worldmodeldata معتقد است همین توالیهای ورودی، کلید یادگیری هوش مصنوعی برای پیمایش در دنیای واقعی است. این شرکت با بستهبندی ورودیهای کنترلر و دادههای بصری بازیها، قصد دارد آموزش «علت و معلول» را فراهم کند؛ چیزی که مدلهای زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن کتابها جواب میدهد — بهشدت در آن ضعف دارند.
بیشتر مدلهای فعلی در دنیای کلمات زندگی میکنند و برای کارهایی که نیاز به ظرافت فیزیکی دارند، مثل هدایت یک بازوی رباتیک یا پرواز یک پهپاد، ابزار مناسبی نیستند. به همین دلیل، پژوهشگرانی چون Fei-Fei Li و Yann LeCun در حال توسعه «مدلهای جهانی» (World Models) هستند؛ مدلهایی که برای درک فیزیک و استدلال فضایی طراحی شدهاند.
شکاف فیزیکی (The Physicality Gap)
برای اینکه یک مدل در فیزیک دنیای واقعی مسلط شود، به ترکیبی از دادههای بصری و عملیاتی نیاز دارد. برای مثال، مدلی که یاد میگیرد یک بازوی رباتیک را حرکت دهد، به ویدئوهای محیط کارخانه نیاز دارد که با دادههای دقیقی از میزان فشار روی شیء و گشتاور (Torque) مورد نیاز برای جابهجایی همراه باشد تا بداند هر حرکت چه نتیجهای در دنیای مادی دارد.
بر اساس مستندات فنی، برخلاف متن که در اینترنت فراوان است، دادههای باکیفیتی که صحنههای بصری را با اقدامات فیزیکی جفت کنند، بسیار کمیاب هستند. Xiatian Zhu، استادیار دانشگاه سوری، اشاره میکند که اینترنت پر از کلمات است، اما دادههای بسیار کمی داریم که به طور مستقیم «علت و معلول» را به تصویر بکشند و نشان دهند که یک عمل خاص دقیقاً چه تغییری در محیط ایجاد میکند.
برخی آزمایشگاهها سعی میکنند با نصب حسگر روی انسانها و رباتها در محیطهای تست، این دادهها را جمع کنند، اما مجموعههای حاصل برای پوشش دادن «موارد خاص» (Corner Cases) یا سناریوهای هرجومرج دنیای واقعی بسیار کوچک هستند. Nicole Fraenkel از شرکت Khosla Ventures استدلال میکند که پرداخت پول به افراد برای نمایش کارهای سادهای مثل برداشتن و گذاشتن اشیاء (Pick-and-place)، نمیتواند بینظمی ذاتی و پیشبینیناپذیر جهان واقعی را شبیهسازی کند.
شرکت Worldmodeldata که تحت نظارت و مشاوره Yann LeCun فعالیت میکند، در اینجا نقش یک واسطه را ایفا میکند. این شرکت دادههای «پسماند» (Exhaust Data) استودیوهای بازی را جمعآوری و سازماندهی میکند تا آزمایشگاههای AI مجبور نباشند برای دسترسی به دادهها، با دهها توسعهدهنده مختلف به صورت انفرادی مذاکره کنند.
استراتژی دادهای
به گزارش WIRED، این استارتاپ تاکنون نزدیک به ۱ میلیون ساعت داده را از استودیوهای مختلف بازیهای محبوب لایسنس کرده است. Rhea Loucas، مدیرعامل شرکت، معتقد است چون میلیونها بازی مدرن بهشدت به دنیای واقعی شبیه شدهاند، این تجربیات متنوع و گسترده میتوانند برای آموزش AI استفاده شوند.
جزئیات استراتژی دادهای این شرکت به شرح زیر است:
- حجم داده: نزدیک به ۱ میلیون ساعت گیمپلی لایسنسشده از استودیوهای مختلف.
- سازوکار: جفت کردن نمایشهای بصری سهبعدی با ورودیهای دقیق کنترلر — مثل چرخش استیک شست (Thumbstick)، فشار دادن تریگرها و دکمهها — که باعث ایجاد آن حرکت خاص در محیط بازی شده است.
- هدف: ایجاد یک «لحظه GPT» برای مدلهای جهانی از طریق مقیاسدهی عظیم دادهها. لوکاس معتقد است این حجم از داده در ابتدا بخش اعظم مواد آموزشی را تشکیل میدهد و سپس برای کارهای خاص دنیای واقعی بهینهسازی میشود.
- مشوقهای آینده: این استارتاپ قصد دارد در آینده مسیرهایی ایجاد کند که در آن بازیکنان عادی نیز بتوانند در ازای ارائه دادههای خود، پاداش یا دستمزد دریافت کنند.
شرکتهای دیگری مثل General Intuition و Niantic نیز در حال حرکت در همین مسیر هستند و دادهها را از پلتفرمهای خود جمعآوری میکنند تا مدلهای جهانی مشابهی بسازند.
بحث بر سر فیزیک (The Physics Debate)
با این حال، همه رهبران صنعت با این رویکرد موافق نیستند. شرکت Nvidia که مدلهای جهانی خود را برای تراشههایش بهینه میکند، ترجیح میدهد از موتورهای فیزیک سفارشی استفاده کند که به طور خاص برای بازسازی قوانین واقعی جهان طراحی شدهاند، نه اینکه به دادههای بازی تکیه کند. این رویکرد انویدیا در راستای تلاش گستردهتر این شرکت برای بهینهسازی سختافزارهای حافظهمحور جهت رفع گلوگاههای استنتاج است تا پردازش مدلهای پیچیده سریعتر صورت گیرد.
Ming-Yu Liu، مدیر توسعه مدلهای جهانی در انویدیا، هشدار میدهد که فیزیک بازیها اغلب «عجیب» (Eccentric) است. توسعهدهندگان بازیها مکرراً از میانبرها برای ایجاد توهم واقعگرایی استفاده میکنند؛ مثلاً کاراکتری که دستش را دراز میکند تا سیبی را بردارد، بدون اینکه فشار دقیق هر انگشت برای جلوگیری از لیز خوردن سیب کدنویسی شده باشد. در واقع، جزئیات ریز فیزیکی در بازیها نادیده گرفته میشوند.
به دلیل همین تقریبها، Liu استدلال میکند که دادههای بازی برای تولید ویدئوهای هایپررئالیست یا محیطهای سهبعدی مناسباند، نه برای کنترل دقیق حرکتی (Fine-grained motor control). او معتقد است فیزیک مربوط به دستورزی و جابهجایی اشیاء بسیار پیچیدهتر از آن چیزی است که بازیها ارائه میدهند. Xiatian Zhu نیز با تایید این موضوع، شبیهسازهای بازی را «ناقص» و «تقریبی» مینامد.
برای یک سرمایهگذار یا صاحب کسبوکار، این یک قمار بزرگ روی ماهیت هوش است. اگر دادههای بازی جواب دهند، هزینه آموزش AI فیزیکی بهشدت کاهش مییابد چون دادهها از قبل در حجم انبوه وجود دارند و نیاز به جمعآوری گرانقیمت نیست.
اما اگر شکاف فیزیکی بیش از حد عمیق باشد، صنعت همچنان وابسته به جمعآوری دستی و گرانقیمت دادهها یا محیطهای شبیهسازی شدهی بینقص خواهد بود. برنده کسی است که زودتر مشکل «موارد خاص» را حل کند. همانطور که Nicole Fraenkel اشاره میکند، هزینه خطا برای یک خودرو، هواپیما، پهپاد، لیفتراک کارخانه یا یک ربات چهارپای خودکار بسیار بالاست و نمیتوان با دادههای تقریبی ریسک کرد.
در نهایت، همانطور که Nicole Fraenkel از Khosla Ventures اشاره میکند، هنوز مشخص نیست کدام مسیر به «سرزمین موعود» هوش مصنوعی فیزیکی و خودکار منجر میشود و هیئت منصفه هنوز رای نهایی را نداده است.
گام بعدی شما
- اگر در حوزه رباتیک یا اتوماسیون فعال هستید، تفاوت بین دادههای «شبیهسازی شده» (Synthetic) و دادههای «رفتاری» (Behavioral) را در مدلهای خود بررسی کنید.
- گزارشهای مربوط به پیشرفت مدلهای جهانی (World Models) را دنبال کنید تا متوجه شوید چه زمانی این مدلها از محیطهای مجازی به سختافزارهای واقعی منتقل میشوند.
- بررسی کنید که آیا دادههای تعاملی پلتفرم شما میتواند به عنوان منبع آموزش برای مدلهای استدلالی فیزیکی استفاده شود یا خیر.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو