تصور کنید محیطی را بسازید که نه تنها شبیه به واقعیت است، بلکه دقیقاً مانند آن رفتار میکند؛ جایی که جاذبه و نور بدون نیاز به موتور بازیسازی، توسط خودِ هوش مصنوعی مدیریت میشوند. با این رویکرد، شرکت Odyssey پیشنمایش پژوهشی Odyssey-3 را منتشر کرد. این یک مدل دنیای مولد (Generative World Model) است که به کاربران اجازه میدهد محیطهای تعاملی را تنها با دستورات متنی ساده خلق کنند و در لحظه در آنها گشتوگذار کنند. دنیای هوش مصنوعی دیگر به ویدیوهای ایستای ساده محدود نیست؛ اکنون شما میتوانید به درون این دنیاها قدم بگذارید.
زمینه و بستر فناوری
مدلهای دنیا (World Models) با هدف ایجاد درکی بنیادین از روابط فضایی و فیزیکی در هوش مصنوعی طراحی شدهاند. این فناوری در حالی معرفی میشود که رقابتی شدید بین آزمایشگاههای پیشرو در جریان است. در حالی که گوگل دیپمایند (Google DeepMind) مسیر مشابهی را با مدل Genie 3 دنبال میکند، شرکت World Labs به رهبری فیفی لی (Fei-Fei Li) نیز در حال توسعه فناوریهای رقیب است. نکته قابل توجه این است که World Labs در سپتامبر ۲۰۲۶ با مبلغ ۸.۲ میلیارد دلار توسط شرکت AMD خریداری شد.
شرکت Odyssey در سال ۲۰۲۳ توسط اولیور کمرون (Oliver Cameron) و جف هاوک (Jeff Hawke) تأسیس شد. در ژوئن ۲۰۲۶، این شرکت توانست ۳۱۰ میلیون دلار سرمایه از سرمایهگذارانی از جمله آمازون و AMD Ventures جذب کند. هدف آنها خلق شبیهسازی است که نیازی به موتورهای بازیسازی سنتی نداشته باشد، زیرا خودِ هوش مصنوعی درک میکند که نور و جاذبه چگونه عمل میکنند.
از نظر معماری، Odyssey-3 بر پایه یک ترنسفورمر انتشار خودبازگشتی (Autoregressive Diffusion Transformer) ساخته شده است. این مدل به طور مداوم فریمهای ویدیویی جدید را بر اساس فریمهای قبلی و اقدامات کاربر تولید میکند. برای دستیابی به عملکرد در لحظه (Real-time)، شرکت تکنیک آموزشی خاصی را پیادهسازی کرد تا گامهای محاسباتی را کاهش دهد. این تلاش برای کاهش تأخیر در پاسخدهی، یادآور پیشرفتهای اخیر در زیرساختهای پردازشی است، مانند پلتفرم Reactor که توانست تأخیر مدلهای دنیای مجازی را به زیر ۵۰ میلیثانیه برساند. دمو آنلاین و رایگان این مدل روی نسخه Odyssey-3 Flash اجرا میشود و به کاربران اجازه میدهد بین زاویه دید اولشخص و سومشخص جابهجا شوند تا رویدادها را فعال کرده و در محیط حرکت کنند.
جزئیات فنی
مشخصات فنی این مدل به شرح زیر است:
- اندازه مدل: مدل پایه دارای ۱۴ میلیارد پارامتر است، در حالی که نسخه Odyssey-3 Pro کیفیت و دقت بصری بالاتری را ارائه میدهد.
- وضوح تصویر: مدل پایه تصاویر را در رزولوشن ۸۳۲ در ۴۸۰ پیکسل تولید میکند، اما نسخه Pro از رزولوشن ۱۲۸۰ در ۷۲۰ پیکسل پشتیبانی میکند.
- دادههای آموزشی: این مدل روابط فیزیکی و مفاهیم علت و معلولی را از سه منبع اصلی آموخته است: ویدیوهای اینترنتی همراه با توصیفات رویدادها، تصاویر بازیهای ویدئویی که با ورودیهای کیبورد و ماوس جفت شده بودند، و تعاملات فیزیکی شبیهسازی شده.

فیزیک و بنچمارکها
بر اساس اعلام شرکت، نسخه Odyssey-3 Pro در بنچمارک ویدیو-به-ویدیو Physics-IQ امتیاز ۶۶.۱ را کسب کرده است. این آزمون رفتار فیزیکی را در حوزههای مکانیک سیالات، اپتیک، مکانیک جامدات، مغناطیس و ترمودینامیک میسنجد. این کار از طریق مقایسه ویدیوهای ادامه یافته توسط هوش مصنوعی از آزمایشهای دنیای واقعی با نتایج واقعی انجام میشود.
با این حال، این رکورد با یک نکته مهم همراه است: این امتیاز حاصل یک اجرای واحد بود که در آن یک روش انتخاب، یکی از هشت ویدیوی تولید شده را برگزید. طبق قوانین بنچمارک، باید چهار بار تست انجام شود و انحراف معیار گزارش گردد. بدون این روش انتخاب، میانگین امتیاز مدل در چهار اجرا ۶۳.۳۷ بوده است.
در بنچمارک WorldMark که دستورات کنترلی، کیفیت تصویر و ثبات زمانی (Temporal Consistency) را میسنجد، Odyssey بر اساس ارزیابیهای خود در سه دسته از چهار دسته رتبه اول را دارد:
- سومشخص واقعی: ۷۹.۰
- سومشخص استایلدار: ۷۶.۳
- اولشخص استایلدار: ۷۷.۲
- اولشخص واقعی: ۸۰.۶ (که در این دسته رتبه سوم را دارد)
از دنیای مجازی تا سختافزار
هدف Odyssey این است که این مدل به عنوان یک ستون فقرات جهانی برای کنترلکنندههای مختلف عمل کند. در آزمایشهای اخیر، یک هوش مصنوعی ساخته شده بر پایه Odyssey-3 توانست تنها با چند ده ساعت دادههای نمایشی، چندین بازوی رباتیک را کنترل کند. این رباتها حتی بدون آموزش خاص برای شکست در گرفتن اشیاء، توانستند پس از لغزش، دوباره شیء را بگیرند.
برای رباتیک انساننما، Odyssey با شرکت سوئیسی Flexion همکاری میکند. گفته میشود کنترلکنندههای ساخته شده بر پایه Odyssey-3 حتی در شرایط متغیر، پایدارتر از مدلهای مشابه عمل میکنند. آنها همچنین یک کنترلکننده پهپاد توسعه دادهاند که با دادههای پرواز شبیهسازی شده آموزش دیده و میتواند در محیطهای داخلی مجازی از موانع دوری کرده و به اهداف برسد.
در بخش گیمینگ، شرکت دموئی از یک هوش مصنوعی در بازی GTA V ارائه کرد که میتوانست وسایل نقلیه را هدایت کرده و با دشمنان بجنگد. جالب اینجاست که کنترلکنندهای که روی حدود دو ساعت فیلمبرداری از GTA آموزش دیده بود، توانست مهارتهای خود را بدون هیچ آموزش اضافهای به بازی Red Dead Redemption 2 منتقل کند و شخصیتی را روی اسب حرکت دهد.
این تغییر رویکرد نشان میدهد که آینده آموزش هوش مصنوعی ممکن است از مجموعهدادههای ایستا به سمت عاملهای «خودآموز» (Self-learning Agents) حرکت کند. در یک دمو، یک عامل هوش مصنوعی تسکی را به زبان طبیعی دریافت کرد و سعی کرد از طریق اقدامات خود در محیط Odyssey-3 آن را به پایان برساند. با فعالیت در این فضای مجازی، یک عامل میتواند پیش از استقرار روی سختافزار فیزیکی، از نتایج اقدامات خود درس بگیرد.
در حال حاضر توسعهدهندگان میتوانند برای دسترسی به API درخواست دهند تا این قابلیتها را در سیستمهای خود ادغام کنند. باید منتظر اولین استقرار رباتهای شخص ثالث با این مدل بود تا مشخص شود آیا فیزیکِ بنچمارک شده در دنیای واقعی نیز قابل تکرار است یا خیر.
گام بعدی شما
- اگر توسعهدهنده هستید، برای دسترسی به API این مدل درخواست بفرستید تا قابلیتهای شبیهسازی فیزیکی را در پروژههای خود تست کنید.
- نتایج استقرار اولین رباتهای شخص ثالث را دنبال کنید تا ببینید آیا فیزیکِ بنچمارکها در دنیای واقعی هم صادق است یا خیر.
- مدلهای رقیب مانند Genie 3 را با خروجیهای Odyssey-3 مقایسه کنید تا تفاوت در ثبات زمانی را بسنجید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو