تصور کنید تنها با یک عکس معمولی از سطح زمین، بتوانید یک نمای هوایی کامل و سهبعدی از کل آن منظره خلق کنید. در ۱ سپتامبر ۲۰۲۶، شرکت World Labs از مدل Atlas پردهبرداری کرد؛ مدل جهانی نسل جدیدی که برای تسلط بر هوش مکانی از طریق تولید، بازسازی و شبیهسازی هر محیط ممکنی طراحی شده است.
این چرخش به سمت هوش مکانی در حالی رخ میدهد که صنعت از تولید محتوای دوبعدی ساده فراتر میرود. همانطور که در تحلیل قبلی ما دربارهی مدلسازی ذهنی جهان اشاره کردیم، این قابلیت میتواند دقت اقدامات هوش مصنوعی را تا ۸۷.۹٪ افزایش دهد. اکنون Atlas تلاش میکند این مفهوم را با ایجاد درک بومی از دنیای فیزیکی عملی کند. این مدل شبیه کارگردانی دیجیتال است که فقط یک تصویر نمیکشد، بلکه کل دکور صحنه را میسازد، جای هر دیوار را میشناسد و میتواند دوربین را بدون دگرگون شدن تصویر به هر سو بچرخاند.
معماری هوش مکانی
به نقل از وبلاگ World Labs، مدل Atlas یک ترنسفورمر (Transformer) — شبیه به یک پردازشگر متنی پیشرفته که روابط بین اجزای مختلف را میسنجد — انتشار خودبازگشتی و چندوجهی است. این یعنی سهبعدی بودن برای این مدل یک مرحلهی پسپردازش یا فکری متأخر نیست، بلکه از ابتدا برای کار با متن، تصویر، ویدیو و دادههای سهبعدی بهطور بومی آموزش دیده است.
تمام ورودیها در یک بستر مکانی مشترک ترکیب میشوند. برخلاف یک مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب میدهد — که توکنها را بهصورت یک توالی خطی پردازش میکند، Atlas هر تصویر را در یک موقعیت سهبعدی مشخص در فضا مستقر میکند. این بستر مکانی به مدل اجازه میدهد ثبات سهبعدی را در تمام آنچه تولید میکند حفظ کرده و بتواند آنچه خارج از کادر دیدنی است را تصور کند.
سازوکارهای فنی
برای دستیابی به این هدف، Atlas از معماریهای استاندارد LLM و مدلهای ویدیو فاصله گرفته و چندین پارادایم اصلی هوش مصنوعی را در یک سیستم واحد ترکیب کرده است:
پردازش چندوجهی: Atlas بهطور بومی متن، تصاویر، وضعیتهای دوربین (Camera Poses) و نقشههای عمق سهبعدی را مدیریت میکند. در این مدل، ویدیوها به عنوان توالیهایی از تصاویر دیده میشوند که هر تصویر و هر نقشه عمق، بر اساس یک وضعیت دوربین صریح شرطی شدهاند. این امر باعث میشود کنترل مکانی به یک جزء مرکزی در معماری تبدیل شود.
تولید خودبازگشتی: مدل روی توالیهایی از عناصر عمل میکند. هر خروجی یکبهیک و بر اساس بخشهای قبلی توالی تولید میشود. این طراحی منعطف اجازه میدهد مدل صرفاً با تغییر توالی ورودیها و خروجیها، خود را با وظایف مختلف سازگار کند.
انتشار جریان اصلاحشده (Rectified Flow Diffusion): به عنوان یک مدل انتشار نهان (Latent Diffusion)، Atlas خروجیها را با حذف تدریجی نویز تولید میکند. این سازوکار اجازه میدهد در مرحلهی استنتاج (Inference) — لحظهای که مدل واقعاً جواب تولید میکند، شبیه به خودِ آشپزی و نه دورهی آموزش آشپز — با تنظیم تعداد گامهای حذف نویز، سرعت را فدای کیفیت کنیم یا برعکس.
پایه ترنسفورمر: Atlas با استفاده از معماری ترنسفورمر مبتنی بر عملیات ضرب ماتریسی بزرگ، برای سختافزارهای مدرن بهینه شده است. این مدل از نوآوریهای LLM مانند KV-Caching، مسیریابی آگاه از حافظه (Cache-aware routing) و سرویسدهی مجزا (Disaggregated serving) بهره میبرد. همزمان، پیشرفتهای مدلهای ویدیو مانند تقطیر انتشار (Diffusion distillation)، هدایت بدون طبقهبندی (Classifier-free guidance)، زمانبندیهای نویز جابهجا شده و پیشرفتها در طراحی VAE در آن به کار رفته است.
تولید تحت کنترل دوربین
Atlas به کاربران اجازه میدهد بهجای مهندسی پرامپت (Prompt Engineering) — هنر سؤال درست پرسیدن، مثل کسی که میداند چطور از یک مشاور باتجربه بهترین جواب بگیرد — در نقش یک کارگردان ظاهر شوند. این مدل از هندسهی دقیق دوربین به عنوان یک ورودی بومی استفاده میکند و دیگر به توصیفات مبهم متنی مثل «کمی به چپ بچرخ» یا «زوم کن» متکی نیست.
کنترل پیکسل-دقیق: کاربران میتوانند موقعیت و زاویه دقیق دوربین را برای تولید نماهای جدید از یک صحنه تعیین کنند. این ورودی هندسی بومی اجازه میدهد تا هر نما دقیقاً قاببندی شود و هر حرکتی بهطور کامل کنترل گردد.
ویدیوهای بلند: این مدل میتواند ویدیوهایی تا ۱ دقیقه با رزولوشن 1440p تولید کند. این ویدیوها میتوانند از یک تا شش تصویر ورودی و با استفاده از مسیرهای طراحیشدهی دستی برای دوربین ساخته شوند.
برونیابی هوشمند: Atlas با استفاده از دانش جهانی خود، آنچه خارج از کادر است را تخمین میزند. برای مثال، اگر تصویری از یک ربات داده شود، مدل میتواند پشت ربات را تصور کند یا حدس بزند که در کنار یک استخر، باید یک فضای چمنی وجود داشته باشد. این رویکرد تکاملیافتهای از تلاشهای پیشین است، مانند زمانی که توصیفات متنی تولکین توسط مدلهای پیشرفته به محیطهای سهبعدی تبدیل شدند تا تجسم بصری از مفاهیم انتزاعی ممکن شود.
بازسازی مکانی و خروجی سهبعدی
یکی از جسورانهترین ادعاهای World Labs این است که Atlas از مدلهای پیشرفتهای که صرفاً برای بازسازی سهبعدی تخصصی شدهاند، پیشی گرفته است. این مدل مشکل چند دههی قدیمی «سنتز نماهای جدید از تصاویر پراکنده» را حل کرده است.
ورودی پراکنده: مدل میتواند صحنهای را تنها با دو یا سه تصویر بهطور وفادارانه بازسازی کند. در آزمایشها، Atlas توانست از یک عکس زمینی، یک نمای هوایی خلق کند، هرچند در این حالت مجبور است بخشهای خارج از کادر اصلی را تخیل کند.
مقیاسپذیری بستر: با افزایش تصاویر ورودی، نیاز به تخیل مدل کمتر میشود. Atlas میتواند بیش از ۱۰۰ تصویر را در بستر مکانی خود جای دهد تا بازسازی بسیار دقیقی از محیطهای واقعی ارائه دهد.
ساخت گامبهگام: در نمایش مربوط به محوطه اصلی استنفورد (Stanford Main Quad)، Atlas صحنه را تکهتکه ساخت؛ از ورودی چمنی شروع کرد و به موزاییکهای کلیسای یادبود رسید. در این فرآیند، مدل از ۲ تا ۲۵ تصویر زمینی برای تولید مسیرهای هوایی در ارتفاع بالای پردیس استفاده کرد.
فرمتهای صریح سهبعدی: خروجی Atlas فقط پیکسل نیست؛ بلکه ابر نقاط (Point Clouds) و Gaussian Splats سهبعدی تولید میکند. مدل عمق هر فریم در یک ویدیو را پیشبینی میکند تا آنها را در یک بازسازی ترکیب کرده و مناطقی را که دوربین هرگز ندیده است، پر کند.
رندرینگ روی دستگاه: با تبدیل ابر نقاط به صحنههای کامل Splat، Atlas بازنماییهایی میسازد که با رزولوشن و نرخ فریم بالا روی خودِ دستگاه رندر میشوند. این همان بازنمایی است که در Marble استفاده شده است.
شبیهسازی زمان-مکان و رباتیک
Atlas به عنوان یک شبیهساز جهان عمل میکند و هم ساختار مکانی دنیا و هم نحوه تکامل آن در طول زمان را میفهمد. این قابلیت گردشکارهای «واقعیت به شبیهساز» (Real-to-Sim) را ممکن میکند که هزینه آموزش رباتها را بهشدت کاهش میدهد.
جلوههای ویژه و بازقاببندی
در حوزه VFX، Atlas میتواند چند ویدیوی معمولی موبایل را به یک استودیوی «زمان گلوله» (Bullet Time) تبدیل کند. با بازسازی صحنه از ۳ تا ۵ نمای دوربین — که توسط مهندسان با موبایل و سهپایههای سادهای که در یک کولهپشتی جا میشوند گرفته شده — میتوان زمان را متوقف کرد و نماها را از زوایای غیرممکن، بدون نیاز به تجهیزات حرفهای گرانقیمت، بازقاببندی کرد.
ناوبری و دستورزی رباتیک
برای رباتیک، این مدل دادههای RGB و عمقی را تولید میکند که سنسورهای یک ربات هنگام حرکت در یک محیط مشاهده میکنند.
ناوبری: Atlas با استفاده از ویدیوهای موبایل (مثلاً ۲۴ فریم برای بازسازی)، مسیرهای مختلف رباتهای مختلف را شبیهسازی میکند. از آنجایی که جهان و نمای ربات توسط یک مدل واحد تولید میشوند، نیاز به تجهیزات اسکن پیچیده و گرانقیمت از بین میرود.
دستورزی: Atlas در ساخت شبیهسازهایی که نحوه حرکت و تعامل اشیاء را ثبت میکنند کمک میکند. این مدل از بازسازی تعاملات فیزیکی با اشیاء سخت (Rigid)، مفصلی (Articulated) و تغییرشکلپذیر (Deformable) پشتیبانی میکند.
تغییرات کنترلشده: پس از شبیهسازی یک وظیفه، توسعهدهندگان میتوانند بهراحتی اشیاء، موقعیت آنها، نورپردازی، پسزمینه یا حرکت ربات را تغییر دهند تا دادههای آموزشی متنوعی در مقیاس بالا تولید کنند.
محکها و مقیاسپذیری
World Labs مدل Atlas را در برابر برترین مدلهای ویدیو برای تولید تحت کنترل دوربین آزمایش کرد. در تستهایی که یک مسیر دوربین هدف به مدلها داده شد (برای Atlas از فرمتهای بومی دوربین و برای دیگران از پرامپتهای متنی استفاده شد)، ارزیابان انسانی Atlas را بهطور قابلتوجهی ترجیح دادند:
- در برابر MiniMax H3: ترجیح ۷۵ درصدی برای Atlas
- در برابر Gemini Omni Flash: ترجیح ۸۱ درصدی برای Atlas
- در برابر Happy Horse 1.1: ترجیح ۸۶ درصدی برای Atlas
- در برابر FLUX 3: ترجیح ۹۳ درصدی برای Atlas
- در برابر Seedance 2.5: ترجیح ۹۴ درصدی برای Atlas
این نتایج نشان میدهد که هرچه مسیرهای دوربین پیچیدهتر شوند، برتری Atlas بیشتر میشود. همچنین در وظایف بازسازی سهبعدی که مدل باید برای هر پیکسل ورودی یک نقطه سهبعدی پیشبینی کند، Atlas از بهترین مدلهای بازسازی متنباز تخصصی پیشی گرفت.
شرکت اشاره کرد که عملکرد Atlas با افزایش محاسبات آموزشی (Training Compute) بهطور مداوم بهبود مییابد. World Labs با آموزش مجموعهای از مدلها در اندازههای مختلف دریافت که هر سطح جدید از محاسبات، قابلیتهای جدیدی را فعال میکند و این نشان میدهد که مقیاسپذیری بیشتر، همچنان پیشرفت را به جلو میبرد.
قابلیتهای تولید تصویر
با وجود اینکه مدلسازی جهان اولویت اصلی است، Atlas همچنان یک تولیدکننده تصویر توانمند است. این مدل میتواند پرامپتهای پیچیده را دنبال کند، متنهای خوانا رندر کند و پانوراماهای ۳۶۰ درجه را از طریق پرامپتهای متنی یا تصویری در سبکهای بصری مختلف بسازد.
این قابلیت تضمین میکند که Atlas بتواند موتور نسخههای آینده Marble و سایر محصولات World Labs باشد و هنر خلاقانه را با دقت هندسی ترکیب کند.
چرخش در کنترل خلاقانه
برای یک سازنده، این یعنی عصر «ماشین قمار» در تولید هوش مصنوعی — جایی که پرامپتی میزنید و امیدوارید نتیجه خوب باشد — به پایان میرسد. با مدیریت بستر مکانی، میتوانید دو تصویر نامرتبط را در یک فضای سهبعدی قرار دهید و از Atlas بخواهید راهروها، درها و گوشههایی را که بهطور منطقی آنها را به هم وصل میکند، تولید کند.
این سطح از کنترل، هوش مصنوعی را از تولیدکننده «دارایی» (Asset) به تولیدکننده «محیط» تبدیل میکند. حالا بحث از «ساخت یک ویدیو» به «صحنهپردازی یک محیط» تغییر کرده است.
چه طراح بازی باشید که در حال ساخت یک مرحله است و چه مهندس رباتیک که یک انبار را شبیهسازی میکند، توانایی تبدیل چند عکس به یک دنیای سهبعدی سازگار، نیاز به اسکنهای گرانقیمت LiDAR یا جمعآوری مجموعهدادههای عظیم را کاهش میدهد.
منتظر عرضه دسترسی زودهنگام برای شرکا باشید، زیرا این مدل احتمالاً نحوه ساخت محیطهای مجازی برای متاورس و شبیهسازیهای صنعتی را بازتعریف خواهد کرد.
گام بعدی شما
- اگر در حوزه VFX یا طراحی محیط فعالیت میکنید، منتظر دسترسی زودهنگام شرکای World Labs باشید تا جایگزینی اسکنهای LiDAR را تست کنید.
- بررسی کنید که چگونه ترکیب تصاویر پراکنده میتواند هزینههای تولید پیشنمایشهای سهبعدی شما را کاهش دهد.
- روی یادگیری مفاهیم Gaussian Splatting تمرکز کنید، زیرا Atlas خروجیهای خود را بر این پایه بنا میکند.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو