تصور کنید میخواهید یک مدل پیچیده لگو بسازید، اما بهجای چیدن قطعات، فقط با توصیف ایدهتان، یک برنامه کامپیوتری بنویسید که دقیقاً جای هر قطعه را محاسبه کند. این همان رویکردی است که پروژه ldraw-nova برای غلبه بر ضعف مدلهای زبانی در درک فضای سهبعدی به کار گرفته است.
طراحی اشیاء فیزیکی نیازمند استدلال مکانی دقیقی است که نقطه ضعف شناختهشده اکثر مدلهای زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن کتابها جواب میدهد — محسوب میشود. طبق اعلام توسعهدهندگان این پروژه در ۲ اکتبر ۲۰۲۶، راهکار ldraw-nova این است که بهجای درخواست محاسبه مختصات از هوش مصنوعی، عامل را مجبور میکند یک اسکریپت تولیدکننده بنویسد تا محاسبات ریاضی را بر عهده بگیرد.
این رویکرد، مدلسازی سهبعدی را به یک مسئله مهندسی نرمافزار تبدیل میکند. با استفاده از LDraw — یک زبان اسمبلی استاندارد و متنباز برای لگو — عامل یک نقشه ساخت میسازد که میتوان آن را در نمایشگرهای سهبعدی رندر کرد، به نرمافزار Blender منتقل کرد یا در محیط واقعیت مجازی با هدست Meta Quest 3 مشاهده نمود.
سالهاست که هوش مصنوعی با «ریاضیات هندسی» یا همان چرخشها و جایگذاریهای لازم برای اتصال قطعات فیزیکی دستوپنجه نرم میکند. اکثر تلاشها برای تولید مستقیم مدلهای سهبعدی به «توهم» (Hallucination) — وقتی مدل با اطمینان چیزی میگوید که اصلاً وجود ندارد، شبیه دوستی که خاطرهای را اشتباه تعریف میکند — منجر میشود؛ نتیجهای که در آن قطعات در هوا معلقاند یا در هم فرو میروند. در همین راستا، مدلهای LLM-JEPA با استفاده از شبیهسازی واقعیت توانستهاند نرخ توهمات را در مدلهای بزرگی مانند Llama3 کاهش دهند تا درک بهتری از دنیای فیزیکی داشته باشند.
همانطور که در تحلیلهای پیشین ما دربارهی محدودیتهای استدلال مکانی در مدلهای مولد اشاره کردیم، ldraw-nova این مشکل را با ایجاد یک لایه ابزار مبتنی بر پایتون حل کرده است. در اینجا عامل بهجای قرار دادن یک قطعه، یک تابع پایتون مینویسد که آن قطعه را جایگذاری کند. این تغییر از این واقعیت بهره میبرد که مدلهای زبانی در تولید کد قابل اجرا، بسیار توانمندتر از انجام محاسبات مثلثاتی خام هستند.
سیر تکامل و زمینهی پروژه
این پروژه حاصل یک فرآیند تکرارشونده طولانی برای رسیدن به عاملهای (Agents) هوشمند است که قادر به طراحی اشیاء فیزیکی قابل ساخت باشند. نویسنده پروژه با هر دو مدل ChatGPT و Claude آزمایش کرد تا ببیند آیا آنها میتوانند مانند سایر زبانهای برنامهنویسی، با زبان LDraw کدنویسی کنند یا خیر.
بر اساس مستندات پروژه، پیش از رسیدن به معماری فعلی، سه تلاش پژوهشی مشخص صورت گرفت:
- ldbuilder-ai: تحقیقات اولیه در زمینه ساختوساز مبتنی بر هوش مصنوعی.
- py2bricks: نخستین تلاش برای ایجاد ابزارهای پایتونی عاملمحور.
- py4bricks: دومین تلاش برای بهینهسازی و پالایش این ابزارها.
این آزمایشها به دو نتیجه حیاتی ختم شد. نخست اینکه یک «مسیر کممقاومت» برای ریاضیات هندسی وجود دارد: عاملها در تولید کد پایتونی که ریاضیات را تولید میکند، بسیار بهتر از تولید مستقیم خودِ ریاضیات عمل میکنند. دوم اینکه عاملها از کدهای پایتونی که مدلها را میسازند، بسیار مؤثرتر از خودِ مدلهای LDraw یاد میگیرند؛ چرا که مدلهای LDraw به دلیل پیچیدگیهای ساختاری، درگیر «هندسه دشوار» (Evil Geometry) هستند. این رویکرد یادگیری از طریق کد، شباهت زیادی به سیستمهای برنامهنویسی خودبهینهساز دارد که اخیراً در اکوسیستم Elixir پیادهسازی شدهاند تا کارایی مدلها را بهطور خودکار ارتقا دهند.
خط لوله تولید (Generative Pipeline)
این سیستم مانند یک کامپایلر چندمرحلهای عمل میکند. به نقل از مستندات گیتهاب پروژه، این فرآیند از یک سلسلهمراتب مشخص پیروی میکند:
- برنامهریزی: عامل پرامپت را دریافت کرده و فایل
instructions.mdو اسناد مرتبط با زبان LDraw را میخواند. سپس یک فایلplan.json(برای مثالatlas-crane.plan.json) ایجاد میکند که جزئیات قطعات مورد نیاز، زیرمدلها و ویژگیهای زیباییشناسی را مشخص میکند. - تولید: عامل بر اساس آن برنامه، یک اسکریپت
generator.pyمینویسد. این اسکریپت به عنوان پلی میان برنامه اولیه و فایل نهایی CAD عمل میکند. - اجرا: اسکریپت اجرا شده و یک فایل منبع
.mpd(زبان تخصصی LDraw) تولید میکند (مانندatlas-crane.mpd) که در واقع یک زبان CAD سهبعدی تخصصی است. - تأیید: عامل با استفاده از رندرینگ بدون رابط کاربری (Headless)، تصاویری از نتیجه میسازد. سپس این تصاویر را برای یافتن شکافها یا تداخلات (Collisions) بررسی کرده، جایگذاریها را تنظیم میکند و کد را تا رسیدن به مدل نهایی اصلاح میکند.

زیرساخت فنی و ابزارها
برای بهبود شناسایی قطعات، سیستم با jev-rerank ادغام شده است؛ ابزاری برای جستوجوی معنایی (Semantic Search) — مثل کارت معرفی عددی برای هر واژه که میگوید این کلمه همسایهی چه کلمات دیگری است — که توسط مدل Jev System One شرکت TypeSafe پشتیبانی میشود. این ابزار به عاملها کمک میکند تا قطعات و مدلهای نمونه مناسب را بیابند. مدل Jev پیش از این توانسته است تأخیر در تصمیمگیری هوش مصنوعی را به ۷۰ میلیثانیه کاهش دهد که این سرعت در پردازشهای لحظهای ldraw-nova بسیار حیاتی است. اگر یک TYPESAFE_API_KEY در تنظیمات وباپلیکیشن ارائه شود، سیستم از قابلیت بازرتببندی (Re-ranking) استفاده میکند؛ در غیر این صورت، به جستوجوی متن کامل (FTS) بازمیگردد که ممکن است مدلهای ضعیفتری را ارائه دهد.
استقرار سیستم از طریق Docker انجام میشود و نیازمند دو مخزن همزمان است که باید با یک تگ یکسان (مثلاً v0.6.0) کلون شوند:
ldraw-nova: منطق اصلی سیستم.ldraw-nova-docker: پیکربندی داکر و اپلیکیشن وب.
نصب اولیه حدود ۵ گیگابایت فضای دیسک میطلبد. دسترسی به برنامه از طریق https://localhost:8443 (که برای Meta Quest 3 ضروری است، هرچند از گواهینامه self-signed استفاده میکند) یا http://localhost:8765 برای HTTP معمولی امکانپذیر است. سایر دستگاههای موجود در شبکه میتوانند از طریق IP کامپیوتر (مثلاً https://192.168.1.20:8443) متصل شوند.
پایگاه دانش عامل
برای اینکه عامل بتواند مانند یک سازنده حرفهای عمل کند، مجموعهای جامع از راهنماها و مراجع در اختیار او قرار میگیرد:
- طراحی بصری: راهنمایی برای بهبود شکل، رنگ و جزئیات بصری مدل.
- گردشکار وسایل نقلیه و سفینهها: متدهای خاص برای طراحی وسایل نقلیه و سفینههای پیشرفته، شامل «اطلس» مخصوص سفینهها.
- راهنمای سازه و مکانیسم: گردشکارهای ساختاری برای قطعات Technic و دستورالعملهای ساخت برای مکانیسمها.
- اعتبارسنجی: مستندات مربوط به هندسه، اتصال قطعات (Snapping) و اعتبارسنجی برای درک صحیح اتصالات و بررسیها.
- کشف مراجع: اطلسی از مراجع برای یافتن ساختارهای قابل استفاده مجدد و قطعات.
- سازماندهی: گردشکارهای ماژولار، مانند مثال «Copper Lane»، برای سازماندهی مدلهای بسیار بزرگ.
عملکرد مدلها
توسعهدهنده پروژه به تفاوت فاحش در توانایی مدلها اشاره میکند. مدلهای ردهبالا مانند GPT-6 Astra و Claude Opus 5.5 برای ایجاد این ابزارها از طریق Vibe Coding (کدنویسی بر اساس حس و شهود بدون سختگیری در سینتکس) ضروری بودند و در حال حاضر تنها مدلهایی هستند که قادر به تولید مدلهای بزرگ و صحیح هستند.
مدلهای کوچکتر مانند Luna یا Haiku در حال حاضر با پیچیدگی دستورالعملها مشکل دارند. هدف پروژه در بهروزرسانیهای آینده، بهینهسازی مستندات و ابزارها است تا سیستم برای این مدلهای کوچکتر نیز قابل دسترسی باشد.
محدودیتها و چشمانداز آینده
با وجود این پیشرفت، سیستم با چندین چالش روبروست:
- کارایی: فرآیند تولید کند است و از نظر محاسباتی هزینه بالایی دارد.
- پایداری VR: مدیریت مدلها و عملکرد کلی در Meta Quest 3 همچنان مشکلاتی دارد.
- شکافهای دامنه: در حالی که وسایل نقلیه پشتیبانی میشوند، سیستم در طراحی اشکال ارگانیک (مانند انسانها و حیوانات/Minifigs) و ماشینآلات یا موتورهای پیچیده Technic ضعف دارد.
- دفترچههای راهنما: ساخت مدل بر اساس دفترچههای راهنما تا حدی کار میکند، اما زمانی که صفحات دفترچه به صورت تصویر ارائه شوند، بسیار مؤثرتر است.
- بازرسی: نیاز به بازرسی دقیقتر (Fine-grained) از زیرمدلها و فرآیندهای گامبهگام ساخت وجود دارد.
این چرخش به سمت «CAD عاملمحور» نشان میدهد که مسیر طراحی فیزیکی توسط هوش مصنوعی، نه از طریق ریاضیات بهتر، بلکه از طریق انتزاعهای بهتر میگذرد. با تبدیل دنیای فیزیکی به یک کدبیس، ما به عاملها اجازه میدهیم از قویترین مهارت خود — برنامهنویسی — برای حل ضعیفترین مهارتشان — استدلال مکانی — استفاده کنند.
گام بعدی شما
- اگر توسعهدهنده هستید، مخازن ldraw-nova را در گیتهاب بررسی کنید تا با نحوه تبدیل توصیفات متنی به اسکریپتهای پایتونی آشنا شوید.
- برای تجربه مدلهای تولید شده، از یک نمایشگر LDraw یا هدست VR استفاده کنید تا دقت جایگذاری قطعات را بسنجید.
- بررسی کنید که چگونه میتوانید از مدلهای استدلالی برای تبدیل سایر مسائل هندسی به مسائل کدنویسی تبدیل کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو