پرش به محتوای اصلی
پرش به محتوای مقاله

Odyssey-3 چگونه رباتیک واقعی را با دنیای مجازی پیوند می‌زند؟

·۱۹ مهر ۱۴۰۵۴ دقیقه مطالعه
مدل جهان مولد Odyssey-3 رایگان در دسترس است
مدل جهان مولد Odyssey-3 رایگان در دسترس است
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

توانایی انتقال مهارت (Transfer Learning) بین محیط‌های مجازی مختلف و ایجاد دنیایی که قوانین فیزیک را بدون موتور بازی‌سازی درک می‌کند، سیگنال اصلی این خبر است.

تصور کنید محیطی را بسازید که نه تنها شبیه به واقعیت است، بلکه دقیقاً مانند آن رفتار می‌کند؛ جایی که جاذبه و نور بدون نیاز به موتور بازی‌سازی، توسط خودِ هوش مصنوعی مدیریت می‌شوند. با این رویکرد، شرکت Odyssey پیش‌نمایش پژوهشی Odyssey-3 را منتشر کرد. این یک مدل دنیای مولد (Generative World Model) است که به کاربران اجازه می‌دهد محیط‌های تعاملی را تنها با دستورات متنی ساده خلق کنند و در لحظه در آن‌ها گشت‌وگذار کنند. دنیای هوش مصنوعی دیگر به ویدیوهای ایستای ساده محدود نیست؛ اکنون شما می‌توانید به درون این دنیاها قدم بگذارید.

زمینه و بستر فناوری

مدل‌های دنیا (World Models) با هدف ایجاد درکی بنیادین از روابط فضایی و فیزیکی در هوش مصنوعی طراحی شده‌اند. این فناوری در حالی معرفی می‌شود که رقابتی شدید بین آزمایشگاه‌های پیشرو در جریان است. در حالی که گوگل دیپ‌مایند (Google DeepMind) مسیر مشابهی را با مدل Genie 3 دنبال می‌کند، شرکت World Labs به رهبری فی‌فی لی (Fei-Fei Li) نیز در حال توسعه فناوری‌های رقیب است. نکته قابل توجه این است که World Labs در سپتامبر ۲۰۲۶ با مبلغ ۸.۲ میلیارد دلار توسط شرکت AMD خریداری شد.

شرکت Odyssey در سال ۲۰۲۳ توسط اولیور کمرون (Oliver Cameron) و جف هاوک (Jeff Hawke) تأسیس شد. در ژوئن ۲۰۲۶، این شرکت توانست ۳۱۰ میلیون دلار سرمایه از سرمایه‌گذارانی از جمله آمازون و AMD Ventures جذب کند. هدف آن‌ها خلق شبیه‌سازی است که نیازی به موتورهای بازی‌سازی سنتی نداشته باشد، زیرا خودِ هوش مصنوعی درک می‌کند که نور و جاذبه چگونه عمل می‌کنند.

از نظر معماری، Odyssey-3 بر پایه یک ترنسفورمر انتشار خودبازگشتی (Autoregressive Diffusion Transformer) ساخته شده است. این مدل به طور مداوم فریم‌های ویدیویی جدید را بر اساس فریم‌های قبلی و اقدامات کاربر تولید می‌کند. برای دستیابی به عملکرد در لحظه (Real-time)، شرکت تکنیک آموزشی خاصی را پیاده‌سازی کرد تا گام‌های محاسباتی را کاهش دهد. این تلاش برای کاهش تأخیر در پاسخ‌دهی، یادآور پیشرفت‌های اخیر در زیرساخت‌های پردازشی است، مانند پلتفرم Reactor که توانست تأخیر مدل‌های دنیای مجازی را به زیر ۵۰ میلی‌ثانیه برساند. دمو آنلاین و رایگان این مدل روی نسخه Odyssey-3 Flash اجرا می‌شود و به کاربران اجازه می‌دهد بین زاویه دید اول‌شخص و سوم‌شخص جابه‌جا شوند تا رویدادها را فعال کرده و در محیط حرکت کنند.

جزئیات فنی

مشخصات فنی این مدل به شرح زیر است:

  • اندازه مدل: مدل پایه دارای ۱۴ میلیارد پارامتر است، در حالی که نسخه Odyssey-3 Pro کیفیت و دقت بصری بالاتری را ارائه می‌دهد.
  • وضوح تصویر: مدل پایه تصاویر را در رزولوشن ۸۳۲ در ۴۸۰ پیکسل تولید می‌کند، اما نسخه Pro از رزولوشن ۱۲۸۰ در ۷۲۰ پیکسل پشتیبانی می‌کند.
  • داده‌های آموزشی: این مدل روابط فیزیکی و مفاهیم علت و معلولی را از سه منبع اصلی آموخته است: ویدیوهای اینترنتی همراه با توصیفات رویدادها، تصاویر بازی‌های ویدئویی که با ورودی‌های کیبورد و ماوس جفت شده بودند، و تعاملات فیزیکی شبیه‌سازی شده.

فیزیک و بنچمارک‌ها

بر اساس اعلام شرکت، نسخه Odyssey-3 Pro در بنچمارک ویدیو-به-ویدیو Physics-IQ امتیاز ۶۶.۱ را کسب کرده است. این آزمون رفتار فیزیکی را در حوزه‌های مکانیک سیالات، اپتیک، مکانیک جامدات، مغناطیس و ترمودینامیک می‌سنجد. این کار از طریق مقایسه ویدیوهای ادامه یافته توسط هوش مصنوعی از آزمایش‌های دنیای واقعی با نتایج واقعی انجام می‌شود.

با این حال، این رکورد با یک نکته مهم همراه است: این امتیاز حاصل یک اجرای واحد بود که در آن یک روش انتخاب، یکی از هشت ویدیوی تولید شده را برگزید. طبق قوانین بنچمارک، باید چهار بار تست انجام شود و انحراف معیار گزارش گردد. بدون این روش انتخاب، میانگین امتیاز مدل در چهار اجرا ۶۳.۳۷ بوده است.

در بنچمارک WorldMark که دستورات کنترلی، کیفیت تصویر و ثبات زمانی (Temporal Consistency) را می‌سنجد، Odyssey بر اساس ارزیابی‌های خود در سه دسته از چهار دسته رتبه اول را دارد:

  • سوم‌شخص واقعی: ۷۹.۰
  • سوم‌شخص استایل‌دار: ۷۶.۳
  • اول‌شخص استایل‌دار: ۷۷.۲
  • اول‌شخص واقعی: ۸۰.۶ (که در این دسته رتبه سوم را دارد)

از دنیای مجازی تا سخت‌افزار

هدف Odyssey این است که این مدل به عنوان یک ستون فقرات جهانی برای کنترل‌کننده‌های مختلف عمل کند. در آزمایش‌های اخیر، یک هوش مصنوعی ساخته شده بر پایه Odyssey-3 توانست تنها با چند ده ساعت داده‌های نمایشی، چندین بازوی رباتیک را کنترل کند. این ربات‌ها حتی بدون آموزش خاص برای شکست در گرفتن اشیاء، توانستند پس از لغزش، دوباره شیء را بگیرند.

برای رباتیک انسان‌نما، Odyssey با شرکت سوئیسی Flexion همکاری می‌کند. گفته می‌شود کنترل‌کننده‌های ساخته شده بر پایه Odyssey-3 حتی در شرایط متغیر، پایدارتر از مدل‌های مشابه عمل می‌کنند. آن‌ها همچنین یک کنترل‌کننده پهپاد توسعه داده‌اند که با داده‌های پرواز شبیه‌سازی شده آموزش دیده و می‌تواند در محیط‌های داخلی مجازی از موانع دوری کرده و به اهداف برسد.

در بخش گیمینگ، شرکت دموئی از یک هوش مصنوعی در بازی GTA V ارائه کرد که می‌توانست وسایل نقلیه را هدایت کرده و با دشمنان بجنگد. جالب اینجاست که کنترل‌کننده‌ای که روی حدود دو ساعت فیلمبرداری از GTA آموزش دیده بود، توانست مهارت‌های خود را بدون هیچ آموزش اضافه‌ای به بازی Red Dead Redemption 2 منتقل کند و شخصیتی را روی اسب حرکت دهد.

این تغییر رویکرد نشان می‌دهد که آینده آموزش هوش مصنوعی ممکن است از مجموعه‌داده‌های ایستا به سمت عامل‌های «خودآموز» (Self-learning Agents) حرکت کند. در یک دمو، یک عامل هوش مصنوعی تسکی را به زبان طبیعی دریافت کرد و سعی کرد از طریق اقدامات خود در محیط Odyssey-3 آن را به پایان برساند. با فعالیت در این فضای مجازی، یک عامل می‌تواند پیش از استقرار روی سخت‌افزار فیزیکی، از نتایج اقدامات خود درس بگیرد.

در حال حاضر توسعه‌دهندگان می‌توانند برای دسترسی به API درخواست دهند تا این قابلیت‌ها را در سیستم‌های خود ادغام کنند. باید منتظر اولین استقرار ربات‌های شخص ثالث با این مدل بود تا مشخص شود آیا فیزیکِ بنچمارک شده در دنیای واقعی نیز قابل تکرار است یا خیر.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، برای دسترسی به API این مدل درخواست بفرستید تا قابلیت‌های شبیه‌سازی فیزیکی را در پروژه‌های خود تست کنید.
  • نتایج استقرار اولین ربات‌های شخص ثالث را دنبال کنید تا ببینید آیا فیزیکِ بنچمارک‌ها در دنیای واقعی هم صادق است یا خیر.
  • مدل‌های رقیب مانند Genie 3 را با خروجی‌های Odyssey-3 مقایسه کنید تا تفاوت در ثبات زمانی را بسنجید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این فناوری با ایجاد محیط‌های آموزشی دقیق، ریسک و هزینه استقرار ربات‌ها در دنیای واقعی را به شدت کاهش می‌دهد. اعتبار این ادعا با همکاری شرکت‌های سخت‌افزاری مثل AMD و Flexion تقویت شده است.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم توسعه‌دهندگان ایرانی به این مدل دشوار است؛ اما نتایج پژوهشی آن برای دانشجویان رباتیک و گرافیک کامپیوتر در ایران بسیار ارزشمند است.

·نگاه ما
تحریریه دات‌هوش

انتقال مهارت از یک محیط (GTA V) به محیطی کاملاً متفاوت (RDR2) بدون آموزش مجدد، نشان‌دهنده ظهور «درک مفهومی فیزیک» است. این یعنی مدل‌ها دیگر فقط پیکسل‌ها را پیش‌بینی نمی‌کنند، بلکه قواعد کلی جهان را می‌فهمند. این رویکرد می‌تواند نیاز به داده‌های عظیم دنیای واقعی را حذف کرده و آموزش ربات‌ها را به محیط‌های ایمن و سریع مجازی منتقل کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.