پرش به محتوای اصلی
پرش به محتوای مقاله

آیا آموزش از طریق ویدئو جایگزین برچسب‌های متنی در مدل‌های استدلالی می‌شود؟

·۴ مرداد ۱۴۰۵۵ دقیقه مطالعه۲ بازدید
دستگاه Photon-1 شرکت Induction Labs با یک آموزش اولیه، دسکتاپ شبیه‌سازی می‌کند، دمبل بازی می‌کند و فیزیک بیلیارد مدل‌سازی می‌
دستگاه Photon-1 شرکت Induction Labs با یک آموزش اولیه، دسکتاپ شبیه‌سازی می‌کند، دمبل بازی می‌کند و فیزیک بیلیارد مدل‌سازی می‌
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

حذف نیاز به داده‌های جفت‌شده (ویدئو-اکشن) و جایگزینی آن با پیش‌بینی توکن‌های نهان آینده؛ این اولین بار است که یک مدل با این حجم از بهینه‎‌سازی محاسباتی در بنچمارک‌های کامپیوتری از مدل‌های گوگل پیشی گرفته است.

باید بدانید که دوران وابستگی عامل‌های هوش مصنوعی به داده‌های برچسب‌گذاری شده توسط انسان در حال پایان است. تصور کنید سیستمی که بدون اینکه به او بگویید «این یک کلیک است»، تنها با تماشای ویدئو می‌فهمد چگونه باید یک نرم‌افزار پیچیده را مدیریت کند.

به گزارش marktechpost.com، مدل Photon-1 با ۱۰۶ میلیارد پارامتر و معماری ترکیب خبره‌ها (Mixture of Experts)، در محک‌های عملیاتی استفاده از رایانه، مدل Gemini 3.1 Flash-Lite را شکست داد؛ آن هم در حالی که برای پیش‌آموزش (Pretraining) به ۲۷ برابر محاسبات (Compute) کمتری نیاز داشت. این سیستم که هفته‌ی گذشته توسط Induction Labs منتشر شد، اثبات می‌کند که پیش‌بینی فریم‌های آینده‌ی ویدئو می‌تواند جایگزین برچسب‌های صریح عملیاتی شود. این رویکرد یادگیری بدون برچسب، یادآور موفقیت‌های اخیر در حوزه‌های دیگر است؛ برای مثال مدل Orca نیز پیش‌تر توانست کنترل ربات‌ها را بدون نیاز به داده‌های برچسب‌گذاری‌شده ممکن سازد.

اکثر عامل‌های فعلی به داده‌های جفت‌شده نیاز دارند؛ یعنی هر فریم ویدئویی باید به یک اکشن مشخص (مثل کلیک موس) متصل باشد. این پیش‌نیاز، گلوگاه اصلی مقیاس‌پذیری هوش مصنوعی عامل‌محور (Agentic AI) بوده است. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، کاهش وابستگی به داده‌های انسانی، مسیر را برای مدل‌های خودگردان هموارتر می‌کند. Induction Labs با تبدیل این مسئله به یک задача پیش‌بینی بصری، مدل را می‌آموزد تا وضعیت بعدی محیط دسکتاپ را «تخیل» کند و از این طریق یک سیاست ضمنی برای رسیدن به هدف ایجاد نماید.

مکانیزم مدل‌های تخیلی

یک مدل تخیلی، فریم‌های آینده را به‌صورت خودبازگشتی (Autoregressive) و با هدف پیش‌بینی توکن‌های نهان بعدی تخمین می‌زند. نکته کلیدی این است که در مرحله‌ی پیش‌آموزش، پیکسل‌ها تولید نمی‌شوند؛ بلکه تمام پردازش‌ها در یک فضای نمایش آموخته‌شده صورت می‌گیرد.

با پیش‌بینی وضعیت‌های آینده، مدل مفاهیم مربوط به رفتار کاربر را درک می‌کند. این امر منجر به ایجاد یک «سیاست ضمنی» می‌شود که در آن عامل بدون دیدن هیچ برچسبی برای کلیک‌های موس، هدف و توالی اتفاقات را می‌شناسد.

به نقل از مستندات این پروژه، بهره‌وری بالای این مدل مدیون یک رمزگذار بینایی با فشار زیاد است که از کوانتاسیون اسکالار محدود (Finite Scalar Quantization - FSQ) استفاده می‌کند. این روش هر فریم را تنها به ۹۶۰ توکن گسسته (حدود ۲.۲ کیلوبایت برای هر فریم) فشرده می‌کند. این تمرکز بر بهینه‌سازی سرعت و کارایی، در راستای توسعه‌های پیشین در خانواده مدل‌های Photon است که موتور آن توانست تأخیر استنتاج مدل‌های بینایی-زبانی را ۳۵٪ کاهش دهد.

ترفند فشرده‌سازی FSQ

برای رسیدن به این سطح از کارایی، معماری مدل از استراتژی کوانتاسیون زیر بهره می‌برد:

  • ساختار توکن: هر یک از ۹۶۰ توکن، یک بردار ۸-بعدی است.
  • کوانتاسیون: هر بعد یکی از پنج مقدار (۱، ۱/۲، ۰، ۱/۲-، ۱-) را می‌گیرد.
  • کتاب کدها: این ساختار اجازه دسترسی به ۵ به توان ۸ کد احتمالی را می‌دهد.
  • رمزگذاری تفاضلی: Photon-1 فریم‌ها را به صورت جفت پردازش کرده و به‌جای تمام محتوا، تفاوت بین فریم‌ها را توصیف می‌کند.

تیم توسعه گزارش داده‌اند که این متد، ۱۰۰ برابر بهتر از OCR یا نمایش‌های چندوجهی (Multimodal) استاندارد عمل می‌کند و در عین حال، داده‌های حیاتی مربوط به چیدمان، متن و تغییر وضعیت را حفظ می‌کند.

معماری فنی و آموزش

  • مقیاس مدل: یک ترنسفورمر (Transformer) پراکنده ۱۰۶B-A5B از نوع MoE.
  • منشأ داده‌ها: مجموعه‌ای شامل ۲ میلیارد ویدئوی عمومی که به ۲ میلیون ضبط صفحه نمایش فیلتر شد.
  • حجم داده: مدل تشخیص فریم‌های کلیدی، مجموعه‌ای از ۵۷۵ میلیون فریم با نرخ ۱ فریم در ثانیه تولید کرد (حدود ۱۸ سال ویدئو یا ۵۵۲ میلیارد توکن).
  • محاسبات: پیش‌آموزش برای یک Epoch با استفاده از ۳۰,۰۰۰ ساعت GPU مدل H200 (معادل ۴.۴×۱۰²² FLOPs).
  • پیاده‌سازی: ساخته شده با PyTorch و کرنل‌های ادغام‌شده برای لایه‌های MoE و رمزگذار بینایی، با حفظ ۴۰٪ MFU.
  • هزینه استنتاج (Inference): تقریباً ۰.۱۱ دلار برای هر یک میلیون توکن، در حالی که هزینه تخمینی برای Gemini 3.1 Flash-Lite حدود ۰.۳۶ دلار است.

از تخیل تا اجرا

برای تبدیل «تخیل» به اجرا، پژوهشگران Photon-1 را روی کمتر از ۳۵,۰۰۰ مسیر (Trajectory) استفاده از رایانه تنظیم دقیق (Fine-tuning) کردند. توکن‌های ویژه‌ی کاربرد رایانه به مدل اجازه می‌دهند تا اکشن‌ها را صادر کند. در لحظه استنتاج، Photon-1 ابتدا وضعیت فریم بعدی را پیش‌بینی کرده و سپس اکشن لازم برای رسیدن به آن وضعیت را خروجی می‌دهد.

سپس مرحله‌ی یادگیری تقویتی آنلاین (Online RL) اجرا شد. این عملیات به‌صورت لحظه‌ای روی ماشین‌های مجازی در پنج محیط دسکتاپ (LXQt, Xfce, MATE, GNOME, Plasma) انجام شد. این VMها شامل حساب‌های گوگل برای برنامه‌های وب و یک کلون داخلی از ChatGPT بدون محدودیت نرخ درخواست بودند. نتایج به‌صورت برنامه‌نویسی‌شده تأیید شده و پاداش‌ها تولید شدند.

به‌طور غافلگیرکننده‌ای، مدل فراتر از رایانه تعمیم یافت. با وجود اینکه فقط ضبط‌های دسکتاپ را دیده بود، نسخه تنظیم‌شده‌ی Photon-1 در شبیه‌سازی فیزیک بیلیارد و بازی تخته (Checkers)، هر دو خط مبنای LLM و رمزگذار بینایی را شکست داد.

تعمیم فرامرزی

تست روی حوزه‌هایی که در پیش‌آموزش نبودند، توانایی‌های بالای شبیه‌سازی جهان را نشان داد:

  • تخته (Checkers): در ۲۰,۰۰۰ بازی از آرشیو Open Checkers 2.0، مدل در کیفیت حرکات و شبیه‌سازی برتر بود.
  • بیلیارد: در ۱۰,۰۰۰ بازی مصنوعی، میانگین خطای مطلق مدل ۰.۴۷ بود، در حالی که این عدد برای LLM برابر با ۱.۱۵ و رمزگذار بینایی ۱.۴۴ بود.
  • پیش‌فرض‌های انسانی: پس از RL، مدل یاد گرفت از کلون ChatGPT برای پیش‌نویس متون و پاسخ به سوالات استفاده کند، دقیقاً همان‌طور که یک انسان هدایت می‌کند.

این نتایج این فرض را که عامل‌ها برای اثربخشی به مجموعه‌های عظیم داده‌های برچسب‌گذاری شده نیاز دارند، به چالش می‌کشد. Induction Labs پیشنهاد می‌کند که «مدل جهان» و «سیاست اکشن» می‌توانند به‌طور همزمان از مشاهدات خام آموخته شوند.

برای صنعت، این یک چرخش به سمت آموزش‌های بهینه از نظر محاسباتی است. اگر عامل‌های باکیفیت بتوانند از ویدئوهای بدون برچسب ساخته شوند، مانع ایجاد عامل‌های تخصصی برای نرم‌افزارهای خاص به‌شدت کاهش می‌یابد. همچنین، این موضوع نشان می‌دهد که شهود بصری، یک میان‌بر کارآمد برای استدلال در محیط‌های دیجیتال است.

به‌دلیل منتشر نشدن وزن‌ها، API یا لایسنس، Photon-1 فعلاً یک نقطه عطف پژوهشی است تا ابزاری برای توسعه‌دهندگان. باید نظاره‌گر باشیم که آیا Induction Labs مدل را باز می‌کند یا تکنیک فشرده‌سازی FSQ توسط دیگر آزمایشگاه‌های چندوجهی برای کاهش هزینه AI ویدئو-محور پذیرفته می‌شود.

گام بعدی شما

  • بررسی مقالات مرتبط با کوانتاسیون اسکالار محدود (FSQ) برای درک نحوه کاهش حجم داده‌های تصویری بدون از دست دادن جزئیات.
  • دنبال کردن منتشر شدن احتمالی وزن‌های مدل Photon-1 برای تست روی محیط‌های دسکتاپ شخصی.
  • تحلیل مقایسه‌ای هزینه‌های استنتاج مدل‌های MoE در برابر مدل‌های متراکم (Dense) برای بهینه‌سازی بودجه‌های استقرار.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص در فشرده‌سازی داده‌ها، سد هزینه محاسباتی برای ساخت عامل‌های هوشمند را می‌شکند. کاهش ۲۷ برابری محاسبات پیش‌آموزش به این معناست که ایجاد عامل‌های تخصصی برای نرم‌افزارهای نیچ (Niche) اکنون از نظر اقتصادی توجیه‌پذیر است.

تأثیر برای ایران

به دلیل عدم انتشار وزن‌ها و API، دسترسی مستقیم برای توسعه‌دهندگان ایرانی ممکن نیست. با این حال، تکنیک FSQ برای پژوهشگران داخلی که با محدودیت منابع GPU مواجه‌اند، راهکاری جذاب برای کاهش هزینه آموزش مدل‌های چندوجهی است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی برچسب‌های متنی با پیش‌بینی وضعیت بصری، پارادایم آموزش عامل‌ها را از «تقلید از دستورات» به «درک منطق محیط» تغییر می‌دهد. این رویکرد ثابت می‌کند که استدلال در محیط‌های دیجیتال لزوماً به زبان نیاز ندارد و شهود بصری می‌تواند جایگزینی سریع‌تر و ارزان‌تر برای زنجیره‌های تفکر متنی باشد. نکته کلیدی، موفقیت در تعمیم به فیزیک بیلیارد است که نشان می‌دهد مدل یک درک عمیق از روابط علی‌ومعلولی (Causality) پیدا کرده، نه صرفاً یک تکرارکننده ویدئو است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.