تصور کنید مدلی را که میتواند یک صحنه داخلی سهبعدی را با صحت ۵۳.۴٪ بازسازی کند، اما نمیتواند تشخیص دهد که آیا ویرایشهای بعدیاش صحنه را بهتر کرده یا بدتر. این وضعیت فعلی GPT-6 Astra است. طبق گزارشی که در ۳ اکتبر ۲۰۲۶ منتشر شد، این یافته شکافی عمیق میان توانایی مدل در تولید کد قابل اجرا و ظرفیت آن برای ارزیابی مکانی (Spatial Self-assessment) را نشان میدهد.
تبدیل یک تصویر دوبعدی به محیط سهبعدی کاربردی، چالشی دیرینه در بینایی ماشین است. اکثر رویکردهای فعلی یا مشهای استاتیک تولید میکنند یا از مدلهای تخصصی برای تخمین عمق استفاده میکنند. اما رویکرد «تصویر به کد» (Image-to-Code) پارادایم را تغییر میدهد؛ در اینجا بازسازی سهبعدی به عنوان یک مسئله برنامهنویسی تعریف میشود که در آن یک عامل (Agent) اسکریپتی برای Blender مینویسد تا هندسه، نورپردازی و موقعیت دوربین را بهطور دقیق تعریف کند.
همانطور که در تحلیلهای پیشین ما دربارهی مدلهای جهان (World Models) اشاره کردیم، انتقال از تولید پیکسل به تولید ساختار، کلید دستیابی به دقت است.
سازوکار تصویر به کد
در این سازوکار، عامل کدنویس بهصورت تکرارشونده عمل میکند. مدل بهجای تولید صحنه در یک مرحله واحد، ابتدا کد را مینویسد، آن را در Blender اجرا میکند، خروجی بصری حاصل را تحلیل کرده و سپس اسکریپت را تا رسیدن به تطابق کامل با عکس اصلی اصلاح میکند. از آنجا که خروجی نهایی یک برنامه است، چیدمان اشیاء و موقعیت دوربین بهطور صریح ثبت میشود. این ویژگی به کاربران اجازه میدهد تا مانند هر قطعه کد دیگری، صحنه را اجرا، بررسی و در صورت نیاز تغییر دهند.

برای سنجش این توانایی، پژوهشگران LEGO-Bench را معرفی کردند؛ محکی متشکل از ۲۰۸ تصویر از ۱۰۴ صحنه داخلی و خارجی با استفاده از ۴۴۳ دارایی (Asset) ثبتشده. به نقل از مستندات این پژوهش، از آنجا که عکسهای دنیای واقعی فاقد داده مرجع (Ground Truth) سهبعدی دقیق هستند، تیم از صحنههای شبیهساز حرفهای استفاده کرد تا ورودیهایی طبیعی با کلیدهای پاسخ مخفی و کامل برای امتیازدهی خودکار ایجاد کند. این متدولوژی اجازه میدهد تا پیچیدگی صحنه بدون تغییر در تنظیمات نورپردازی یا دوربین افزایش یابد.

عملکرد و بنچمارکها
در این مطالعه ۶ پیکربندی مختلف GPT آزمایش شدند. نتایج نشان داد که اگرچه تقریباً همه مدلها توانستند صحنهای قابل اجرا تحویل دهند، اما کیفیت آنها تفاوت چشمگیری داشت. امتیازات این محک بر اساس سه محور تخصصی سنجیده شدند:
- اعتبار (Validity): بررسی اینکه آیا اصلاً یک خروجی یا مصنوع (Artifact) قابل استفاده تحویل داده شده است یا خیر.
- بازسازی (Reconstruction): اندازهگیری اینکه هندسه قابل مشاهده تا چه حد دقیق است.
- ظاهر (Appearance): سنجش شباهت بصری از طریق رندر مجدد صحنه و مقایسه پیکسلبهپیکسل آن با تصویر مرجع.
یافتههای کلیدی عبارتند از:
- GPT-6 Astra: برنده این رقابت با صحت ۵۳.۴٪ در صحنههای داخلی و ۳۹.۶٪ در صحنههای خارجی. مدلهای قدیمیتر در این تستها اغلب اشیاء کامل، سیستم نورپردازی یا زوایای صحیح دوربین را بهطور کامل نادیده میگرفتند.
- مدلهای پایه: پیکربندیهای ضعیفتر نمراتی در حد ۱۵٪ کسب کردند.
- بودجه استدلال (Reasoning Budget): افزایش بودجه استدلال برای نسخههای GPT-6 باعث شد نمرات زیرمجموعه «دفتر کار» از ۳۲.۳٪ به ۶۱.۸٪ جهش کند.

شکست در ارزیابی خودکار
با وجود پیشتازی Astra، پژوهشگران به مشکلی به نام «ویرایش پسرونده» (Regressive Edit) برخورد کردند. عاملها اغلب یک تغییر درست اعمال میکنند و سپس در گام بعدی آن را لغو میکنند، زیرا قضاوت هندسی آنها در سطح حدس تصادفی است. وقتی مدلها باید انتخاب میکردند کدام یک از دو نسخه تطابق بیشتری با اصل دارد، نتوانستند بهطور قابلاعتمادی تشخیص دهند که آیا صحنه بهبود یافته است یا خیر.
این چالش در ارزیابی خروجی، یادآور مشکلات رایج در بازسازیهای بصری هوش مصنوعی است که میتواند منجر به خطاهای ساختاری و ریسکهای قانونی در کاربردهای تجاری شود.
در یک مورد خاص، صحت صحنه در GPT-6 Astra در مراحل پایانی فرآیند اصلاح، از ۳۳.۹٪ به ۴.۴٪ سقوط کرد. بر اساس بررسیها، تلاشهای اولیه ضعیف و ارزیابیهای داخلی غیرقابلاعتماد، رایجترین نقاط شکست در این فرآیند بودند.


این فقدان آگاهی مکانی منجر به ساخت LEGO-Plugin شد. این افزونه قضاوت غیرقابلاعتماد عامل را با اندازهگیریهای عینی و ملموس جایگزین میکند و صحنه اولیه را به تصویر مرجع گره میزند (Anchor) تا از ویرایشهای پسرونده و تخریب پیشرفتهای قبلی جلوگیری شود. این رویکرد جداسازی لایه تولید از لایه تأیید، مشابه استراتژیهایی است که در سیستم AntFlow AI برای کاهش خطاهای کدنویسی به کار گرفته شده است. این پلاگین بیشترین اثر را روی عاملهای ضعیف داشت و باعث افزایش صحت برخی از آنها تا ۶۲.۷٪ شد، در حالی که مدل برتر تنها ۲ درصد بهبود یافت.

ادغام با وظایف بینایی ماشین
برای جامعه فنی، این نتایج نشان میدهد که مسیر بازسازی دقیق سهبعدی تنها از طریق مدلهای بزرگتر نمیگذرد، بلکه نیازمند حلقههای تأیید خارجی است. تیم بررسی کرد که آیا این برنامههای قابل اجرا میتوانند مبنایی برای وظایف استاندارد بینایی ماشین مانند تشخیص اشیا، قطعهبندی (Segmentation) و تخمین عمق باشند یا خیر.
نتایج در این بخش کاربردی اما معمولی بود:
- تشخیص اشیا (Object Detection): به حدود نیمی از عملکرد مدل تخصصی DINO رسید.
- قطعهبندی و عمق: شکافهای گستردهای در مقایسه با مدلهای تخصصی مانند SAM 3 و Depth Anything 3 باقی ماند.
این چرخش به سمت مدلسازی جهان مبتنی بر کد، با اقدامات اخیر Unity که افزونههایی برای Claude Code و Codex منتشر کرد، همسو است. با این حال، اتکای شدید به این عاملها میتواند منجر به افزایش پیچیدگی کد و بدهی فنی در پروژههای نرمافزاری شود. مسیرهای دیگر شامل مدل جهان Atlas از World Labs است که کدنویسی را حذف کرده و مستقیماً به بازسازی میپردازد، و GenCeption گوگل دیپمایند که از مدلهای ویدیویی برای استخراج عمق و قطعهبندی استفاده میکند. یوآو ارتزی، پژوهشگر AI، معتقد است برتری GPT-6 Astra احتمالاً ناشی از آموزش روی حجم عظیمی از دادههای سهبعدی، مانند صحنههای Blender است.
گام بعدی شما
- اگر توسعهدهنده محیطهای سهبعدی هستید، ترکیب مدلهای کدنویس با ابزارهای تأیید هندسی (مانند LEGO-Plugin) را جایگزین تکیه بر خروجی خام مدل کنید.
- برای کاهش خطاهای پسرونده، از سیستمهای «قفل کردن» (Anchoring) برای بخشهای تأییدشده صحنه استفاده کنید.
- عملکرد مدلهای زبانی در وظایف بینایی را با مدلهای تخصصی مانند SAM 3 مقایسه کنید تا نقاط ضعف استدلال مکانی را شناس کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو