پرش به محتوای اصلی
پرش به محتوای مقاله

«درک بومی فضای فیزیکی»؛ رویکرد جدید World Labs در شبیه‌سازی

·۱۰ شهریور ۱۴۰۵۱۲ دقیقه مطالعه۱ بازدید
جهان‌نمای اطلس: مدل جهانی برای هوش مکانی
جهان‌نمای اطلس: مدل جهانی برای هوش مکانی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی توصیفات متنی با هندسه‌ی صریح دوربین در یک مدل انتشار؛ Atlas به‌جای حدس زدن نماها، آن‌ها را بر اساس مختصات ریاضی در فضای سه‌بعدی بازسازی می‌کند.

تصور کنید تنها با یک عکس معمولی از سطح زمین، بتوانید یک نمای هوایی کامل و سه‌بعدی از کل آن منظره خلق کنید. در ۱ سپتامبر ۲۰۲۶، شرکت World Labs از مدل Atlas پرده‌برداری کرد؛ مدل جهانی نسل جدیدی که برای تسلط بر هوش مکانی از طریق تولید، بازسازی و شبیه‌سازی هر محیط ممکنی طراحی شده است.

این چرخش به سمت هوش مکانی در حالی رخ می‌دهد که صنعت از تولید محتوای دوبعدی ساده فراتر می‌رود. همان‌طور که در تحلیل قبلی ما درباره‌ی مدل‌سازی ذهنی جهان اشاره کردیم، این قابلیت می‌تواند دقت اقدامات هوش مصنوعی را تا ۸۷.۹٪ افزایش دهد. اکنون Atlas تلاش می‌کند این مفهوم را با ایجاد درک بومی از دنیای فیزیکی عملی کند. این مدل شبیه کارگردانی دیجیتال است که فقط یک تصویر نمی‌کشد، بلکه کل دکور صحنه را می‌سازد، جای هر دیوار را می‌شناسد و می‌تواند دوربین را بدون دگرگون شدن تصویر به هر سو بچرخاند.

معماری هوش مکانی

به نقل از وبلاگ World Labs، مدل Atlas یک ترنسفورمر (Transformer) — شبیه به یک پردازشگر متنی پیشرفته که روابط بین اجزای مختلف را می‌سنجد — انتشار خودبازگشتی و چندوجهی است. این یعنی سه‌بعدی بودن برای این مدل یک مرحله‌ی پس‌پردازش یا فکری متأخر نیست، بلکه از ابتدا برای کار با متن، تصویر، ویدیو و داده‌های سه‌بعدی به‌طور بومی آموزش دیده است.

تمام ورودی‌ها در یک بستر مکانی مشترک ترکیب می‌شوند. برخلاف یک مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — که توکن‌ها را به‌صورت یک توالی خطی پردازش می‌کند، Atlas هر تصویر را در یک موقعیت سه‌بعدی مشخص در فضا مستقر می‌کند. این بستر مکانی به مدل اجازه می‌دهد ثبات سه‌بعدی را در تمام آنچه تولید می‌کند حفظ کرده و بتواند آنچه خارج از کادر دیدنی است را تصور کند.

سازوکارهای فنی

برای دستیابی به این هدف، Atlas از معماری‌های استاندارد LLM و مدل‌های ویدیو فاصله گرفته و چندین پارادایم اصلی هوش مصنوعی را در یک سیستم واحد ترکیب کرده است:

  • پردازش چندوجهی: Atlas به‌طور بومی متن، تصاویر، وضعیت‌های دوربین (Camera Poses) و نقشه‌های عمق سه‌بعدی را مدیریت می‌کند. در این مدل، ویدیوها به عنوان توالی‌هایی از تصاویر دیده می‌شوند که هر تصویر و هر نقشه عمق، بر اساس یک وضعیت دوربین صریح شرطی شده‌اند. این امر باعث می‌شود کنترل مکانی به یک جزء مرکزی در معماری تبدیل شود.

  • تولید خودبازگشتی: مدل روی توالی‌هایی از عناصر عمل می‌کند. هر خروجی یک‌به‌یک و بر اساس بخش‌های قبلی توالی تولید می‌شود. این طراحی منعطف اجازه می‌دهد مدل صرفاً با تغییر توالی ورودی‌ها و خروجی‌ها، خود را با وظایف مختلف سازگار کند.

  • انتشار جریان اصلاح‌شده (Rectified Flow Diffusion): به عنوان یک مدل انتشار نهان (Latent Diffusion)، Atlas خروجی‌ها را با حذف تدریجی نویز تولید می‌کند. این سازوکار اجازه می‌دهد در مرحله‌ی استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند، شبیه به خودِ آشپزی و نه دوره‌ی آموزش آشپز — با تنظیم تعداد گام‌های حذف نویز، سرعت را فدای کیفیت کنیم یا برعکس.

  • پایه ترنسفورمر: Atlas با استفاده از معماری ترنسفورمر مبتنی بر عملیات ضرب ماتریسی بزرگ، برای سخت‌افزارهای مدرن بهینه شده است. این مدل از نوآوری‌های LLM مانند KV-Caching، مسیریابی آگاه از حافظه (Cache-aware routing) و سرویس‌دهی مجزا (Disaggregated serving) بهره می‌برد. همزمان، پیشرفت‌های مدل‌های ویدیو مانند تقطیر انتشار (Diffusion distillation)، هدایت بدون طبقه‌بندی (Classifier-free guidance)، زمان‌بندی‌های نویز جابه‌جا شده و پیشرفت‌ها در طراحی VAE در آن به کار رفته است.

تولید تحت کنترل دوربین

Atlas به کاربران اجازه می‌دهد به‌جای مهندسی پرامپت (Prompt Engineering) — هنر سؤال درست پرسیدن، مثل کسی که می‌داند چطور از یک مشاور باتجربه بهترین جواب بگیرد — در نقش یک کارگردان ظاهر شوند. این مدل از هندسه‌ی دقیق دوربین به عنوان یک ورودی بومی استفاده می‌کند و دیگر به توصیفات مبهم متنی مثل «کمی به چپ بچرخ» یا «زوم کن» متکی نیست.

  • کنترل پیکسل-دقیق: کاربران می‌توانند موقعیت و زاویه دقیق دوربین را برای تولید نماهای جدید از یک صحنه تعیین کنند. این ورودی هندسی بومی اجازه می‌دهد تا هر نما دقیقاً قاب‌بندی شود و هر حرکتی به‌طور کامل کنترل گردد.

  • ویدیوهای بلند: این مدل می‌تواند ویدیوهایی تا ۱ دقیقه با رزولوشن 1440p تولید کند. این ویدیوها می‌توانند از یک تا شش تصویر ورودی و با استفاده از مسیرهای طراحی‌شده‌ی دستی برای دوربین ساخته شوند.

  • برون‌یابی هوشمند: Atlas با استفاده از دانش جهانی خود، آنچه خارج از کادر است را تخمین می‌زند. برای مثال، اگر تصویری از یک ربات داده شود، مدل می‌تواند پشت ربات را تصور کند یا حدس بزند که در کنار یک استخر، باید یک فضای چمنی وجود داشته باشد. این رویکرد تکامل‌یافته‌ای از تلاش‌های پیشین است، مانند زمانی که توصیفات متنی تولکین توسط مدل‌های پیشرفته به محیط‌های سه‌بعدی تبدیل شدند تا تجسم بصری از مفاهیم انتزاعی ممکن شود.

بازسازی مکانی و خروجی سه‌بعدی

یکی از جسورانه‌ترین ادعاهای World Labs این است که Atlas از مدل‌های پیشرفته‌ای که صرفاً برای بازسازی سه‌بعدی تخصصی شده‌اند، پیشی گرفته است. این مدل مشکل چند دهه‌ی قدیمی «سنتز نماهای جدید از تصاویر پراکنده» را حل کرده است.

  • ورودی پراکنده: مدل می‌تواند صحنه‌ای را تنها با دو یا سه تصویر به‌طور وفادارانه بازسازی کند. در آزمایش‌ها، Atlas توانست از یک عکس زمینی، یک نمای هوایی خلق کند، هرچند در این حالت مجبور است بخش‌های خارج از کادر اصلی را تخیل کند.

  • مقیاس‌پذیری بستر: با افزایش تصاویر ورودی، نیاز به تخیل مدل کمتر می‌شود. Atlas می‌تواند بیش از ۱۰۰ تصویر را در بستر مکانی خود جای دهد تا بازسازی بسیار دقیقی از محیط‌های واقعی ارائه دهد.

  • ساخت گام‌به‌گام: در نمایش مربوط به محوطه اصلی استنفورد (Stanford Main Quad)، Atlas صحنه را تکه‌تکه ساخت؛ از ورودی چمنی شروع کرد و به موزاییک‌های کلیسای یادبود رسید. در این فرآیند، مدل از ۲ تا ۲۵ تصویر زمینی برای تولید مسیرهای هوایی در ارتفاع بالای پردیس استفاده کرد.

  • فرمت‌های صریح سه‌بعدی: خروجی Atlas فقط پیکسل نیست؛ بلکه ابر نقاط (Point Clouds) و Gaussian Splats سه‌بعدی تولید می‌کند. مدل عمق هر فریم در یک ویدیو را پیش‌بینی می‌کند تا آن‌ها را در یک بازسازی ترکیب کرده و مناطقی را که دوربین هرگز ندیده است، پر کند.

  • رندرینگ روی دستگاه: با تبدیل ابر نقاط به صحنه‌های کامل Splat، Atlas بازنمایی‌هایی می‌سازد که با رزولوشن و نرخ فریم بالا روی خودِ دستگاه رندر می‌شوند. این همان بازنمایی است که در Marble استفاده شده است.

شبیه‌سازی زمان-مکان و رباتیک

Atlas به عنوان یک شبیه‌ساز جهان عمل می‌کند و هم ساختار مکانی دنیا و هم نحوه تکامل آن در طول زمان را می‌فهمد. این قابلیت گردش‌کارهای «واقعیت به شبیه‌ساز» (Real-to-Sim) را ممکن می‌کند که هزینه آموزش ربات‌ها را به‌شدت کاهش می‌دهد.

جلوه‌های ویژه و بازقاب‌بندی

در حوزه VFX، Atlas می‌تواند چند ویدیوی معمولی موبایل را به یک استودیوی «زمان گلوله» (Bullet Time) تبدیل کند. با بازسازی صحنه از ۳ تا ۵ نمای دوربین — که توسط مهندسان با موبایل و سه‌پایه‌های ساده‌ای که در یک کوله‌پشتی جا می‌شوند گرفته شده — می‌توان زمان را متوقف کرد و نماها را از زوایای غیرممکن، بدون نیاز به تجهیزات حرفه‌ای گران‌قیمت، بازقاب‌بندی کرد.

ناوبری و دست‌ورزی رباتیک

برای رباتیک، این مدل داده‌های RGB و عمقی را تولید می‌کند که سنسورهای یک ربات هنگام حرکت در یک محیط مشاهده می‌کنند.

  • ناوبری: Atlas با استفاده از ویدیوهای موبایل (مثلاً ۲۴ فریم برای بازسازی)، مسیرهای مختلف ربات‌های مختلف را شبیه‌سازی می‌کند. از آنجایی که جهان و نمای ربات توسط یک مدل واحد تولید می‌شوند، نیاز به تجهیزات اسکن پیچیده و گران‌قیمت از بین می‌رود.

  • دست‌ورزی: Atlas در ساخت شبیه‌سازهایی که نحوه حرکت و تعامل اشیاء را ثبت می‌کنند کمک می‌کند. این مدل از بازسازی تعاملات فیزیکی با اشیاء سخت (Rigid)، مفصلی (Articulated) و تغییرشکل‌پذیر (Deformable) پشتیبانی می‌کند.

  • تغییرات کنترل‌شده: پس از شبیه‌سازی یک وظیفه، توسعه‌دهندگان می‌توانند به‌راحتی اشیاء، موقعیت آن‌ها، نورپردازی، پس‌زمینه یا حرکت ربات را تغییر دهند تا داده‌های آموزشی متنوعی در مقیاس بالا تولید کنند.

محک‌ها و مقیاس‌پذیری

World Labs مدل Atlas را در برابر برترین مدل‌های ویدیو برای تولید تحت کنترل دوربین آزمایش کرد. در تست‌هایی که یک مسیر دوربین هدف به مدل‌ها داده شد (برای Atlas از فرمت‌های بومی دوربین و برای دیگران از پرامپت‌های متنی استفاده شد)، ارزیابان انسانی Atlas را به‌طور قابل‌توجهی ترجیح دادند:

  • در برابر MiniMax H3: ترجیح ۷۵ درصدی برای Atlas
  • در برابر Gemini Omni Flash: ترجیح ۸۱ درصدی برای Atlas
  • در برابر Happy Horse 1.1: ترجیح ۸۶ درصدی برای Atlas
  • در برابر FLUX 3: ترجیح ۹۳ درصدی برای Atlas
  • در برابر Seedance 2.5: ترجیح ۹۴ درصدی برای Atlas

این نتایج نشان می‌دهد که هرچه مسیرهای دوربین پیچیده‌تر شوند، برتری Atlas بیشتر می‌شود. همچنین در وظایف بازسازی سه‌بعدی که مدل باید برای هر پیکسل ورودی یک نقطه سه‌بعدی پیش‌بینی کند، Atlas از بهترین مدل‌های بازسازی متن‌باز تخصصی پیشی گرفت.

شرکت اشاره کرد که عملکرد Atlas با افزایش محاسبات آموزشی (Training Compute) به‌طور مداوم بهبود می‌یابد. World Labs با آموزش مجموعه‌ای از مدل‌ها در اندازه‌های مختلف دریافت که هر سطح جدید از محاسبات، قابلیت‌های جدیدی را فعال می‌کند و این نشان می‌دهد که مقیاس‌پذیری بیشتر، همچنان پیشرفت را به جلو می‌برد.

قابلیت‌های تولید تصویر

با وجود اینکه مدل‌سازی جهان اولویت اصلی است، Atlas همچنان یک تولیدکننده تصویر توانمند است. این مدل می‌تواند پرامپت‌های پیچیده را دنبال کند، متن‌های خوانا رندر کند و پانوراماهای ۳۶۰ درجه را از طریق پرامپت‌های متنی یا تصویری در سبک‌های بصری مختلف بسازد.

این قابلیت تضمین می‌کند که Atlas بتواند موتور نسخه‌های آینده Marble و سایر محصولات World Labs باشد و هنر خلاقانه را با دقت هندسی ترکیب کند.

چرخش در کنترل خلاقانه

برای یک سازنده، این یعنی عصر «ماشین قمار» در تولید هوش مصنوعی — جایی که پرامپتی می‌زنید و امیدوارید نتیجه خوب باشد — به پایان می‌رسد. با مدیریت بستر مکانی، می‌توانید دو تصویر نامرتبط را در یک فضای سه‌بعدی قرار دهید و از Atlas بخواهید راهروها، درها و گوشه‌هایی را که به‌طور منطقی آن‌ها را به هم وصل می‌کند، تولید کند.

این سطح از کنترل، هوش مصنوعی را از تولیدکننده «دارایی» (Asset) به تولیدکننده «محیط» تبدیل می‌کند. حالا بحث از «ساخت یک ویدیو» به «صحنه‌پردازی یک محیط» تغییر کرده است.

چه طراح بازی باشید که در حال ساخت یک مرحله است و چه مهندس رباتیک که یک انبار را شبیه‌سازی می‌کند، توانایی تبدیل چند عکس به یک دنیای سه‌بعدی سازگار، نیاز به اسکن‌های گران‌قیمت LiDAR یا جمع‌آوری مجموعه‌داده‌های عظیم را کاهش می‌دهد.

منتظر عرضه دسترسی زودهنگام برای شرکا باشید، زیرا این مدل احتمالاً نحوه ساخت محیط‌های مجازی برای متاورس و شبیه‌سازی‌های صنعتی را بازتعریف خواهد کرد.

گام بعدی شما

  • اگر در حوزه VFX یا طراحی محیط فعالیت می‌کنید، منتظر دسترسی زودهنگام شرکای World Labs باشید تا جایگزینی اسکن‌های LiDAR را تست کنید.
  • بررسی کنید که چگونه ترکیب تصاویر پراکنده می‌تواند هزینه‌های تولید پیش‌نمایش‌های سه‌بعدی شما را کاهش دهد.
  • روی یادگیری مفاهیم Gaussian Splatting تمرکز کنید، زیرا Atlas خروجی‌های خود را بر این پایه بنا می‌کند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با حذف نیاز به تجهیزات گران‌قیمت اسکن سه‌بعدی، دموکراتیزه کردن تولید محیط‌های مجازی را تسریع می‌کند. اعتبار World Labs در ترکیب مدل‌های انتشار با هندسه دقیق، استانداردهای جدیدی برای رباتیک و VFX تعریف می‌کند.

تأثیر برای ایران

این ابزار برای استودیوهای انیمیشن و VFX ایران که بودجه خرید تجهیزات LiDAR ندارند، فرصتی استثنایی برای تولید محیط‌های سه‌بعدی با هزینه نزدیک به صفر است.

·نگاه ما
تحریریه دات‌هوش

Atlas با تبدیل «پرامپت» به «هندسه»، کنترل کاربر را از سطح توصیفی به سطح اجرایی می‌برد. این مدل نشان می‌دهد که آینده‌ی تولید محتوا نه در مدل‌های بزرگ‌تر، بلکه در مدل‌هایی است که قوانین فیزیکی و مکانی را به‌صورت بومی درک می‌کنند. در واقع، ما از دوران «تولید تصویر» به دوران «شبیه‌سازی جهان» وارد می‌شویم.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.