پرش به محتوای اصلی
پرش به محتوای مقاله

ldraw-nova: تبدیل طراحی لگو به مسئله مهندسی نرم‌افزار با عامل‌های هوش مصنوعی

·۱۱ مهر ۱۴۰۵۶ دقیقه مطالعه
ابزار عامل برای ساخت مدل‌های لگویی تولیدشده، ساخته‌شده با Astra و Opus ۵.۵، قدرت‌گرفته از Jev
ابزار عامل برای ساخت مدل‌های لگویی تولیدشده، ساخته‌شده با Astra و Opus ۵.۵، قدرت‌گرفته از Jev
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از اسکریپت‌های پایتون به عنوان لایه واسط برای تولید مدل‌های سه‌بعدی؛ به‌جای اینکه مدل مختصات را حدس بزند، برنامه‌ای می‌نویسد که مختصات را دقیقاً محاسبه کند.

تصور کنید می‌خواهید یک مدل پیچیده لگو بسازید، اما به‌جای چیدن قطعات، فقط با توصیف ایده‌تان، یک برنامه کامپیوتری بنویسید که دقیقاً جای هر قطعه را محاسبه کند. این همان رویکردی است که پروژه ldraw-nova برای غلبه بر ضعف مدل‌های زبانی در درک فضای سه‌بعدی به کار گرفته است.

طراحی اشیاء فیزیکی نیازمند استدلال مکانی دقیقی است که نقطه ضعف شناخته‌شده اکثر مدل‌های زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — محسوب می‌شود. طبق اعلام توسعه‌دهندگان این پروژه در ۲ اکتبر ۲۰۲۶، راهکار ldraw-nova این است که به‌جای درخواست محاسبه مختصات از هوش مصنوعی، عامل را مجبور می‌کند یک اسکریپت تولیدکننده بنویسد تا محاسبات ریاضی را بر عهده بگیرد.

این رویکرد، مدل‌سازی سه‌بعدی را به یک مسئله مهندسی نرم‌افزار تبدیل می‌کند. با استفاده از LDraw — یک زبان اسمبلی استاندارد و متن‌باز برای لگو — عامل یک نقشه ساخت می‌سازد که می‌توان آن را در نمایشگرهای سه‌بعدی رندر کرد، به نرم‌افزار Blender منتقل کرد یا در محیط واقعیت مجازی با هدست Meta Quest 3 مشاهده نمود.

سال‌هاست که هوش مصنوعی با «ریاضیات هندسی» یا همان چرخش‌ها و جای‌گذاری‌های لازم برای اتصال قطعات فیزیکی دست‌وپنجه نرم می‌کند. اکثر تلاش‌ها برای تولید مستقیم مدل‌های سه‌بعدی به «توهم» (Hallucination) — وقتی مدل با اطمینان چیزی می‌گوید که اصلاً وجود ندارد، شبیه دوستی که خاطره‌ای را اشتباه تعریف می‌کند — منجر می‌شود؛ نتیجه‌ای که در آن قطعات در هوا معلق‌اند یا در هم فرو می‌روند. در همین راستا، مدل‌های LLM-JEPA با استفاده از شبیه‌سازی واقعیت توانسته‌اند نرخ توهمات را در مدل‌های بزرگی مانند Llama3 کاهش دهند تا درک بهتری از دنیای فیزیکی داشته باشند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی محدودیت‌های استدلال مکانی در مدل‌های مولد اشاره کردیم، ldraw-nova این مشکل را با ایجاد یک لایه ابزار مبتنی بر پایتون حل کرده است. در اینجا عامل به‌جای قرار دادن یک قطعه، یک تابع پایتون می‌نویسد که آن قطعه را جای‌گذاری کند. این تغییر از این واقعیت بهره می‌برد که مدل‌های زبانی در تولید کد قابل اجرا، بسیار توانمندتر از انجام محاسبات مثلثاتی خام هستند.

سیر تکامل و زمینه‌ی پروژه

این پروژه حاصل یک فرآیند تکرارشونده طولانی برای رسیدن به عامل‌های (Agents) هوشمند است که قادر به طراحی اشیاء فیزیکی قابل ساخت باشند. نویسنده پروژه با هر دو مدل ChatGPT و Claude آزمایش کرد تا ببیند آیا آن‌ها می‌توانند مانند سایر زبان‌های برنامه‌نویسی، با زبان LDraw کدنویسی کنند یا خیر.

بر اساس مستندات پروژه، پیش از رسیدن به معماری فعلی، سه تلاش پژوهشی مشخص صورت گرفت:

  • ldbuilder-ai: تحقیقات اولیه در زمینه ساخت‌وساز مبتنی بر هوش مصنوعی.
  • py2bricks: نخستین تلاش برای ایجاد ابزارهای پایتونی عامل‌محور.
  • py4bricks: دومین تلاش برای بهینه‌سازی و پالایش این ابزارها.

این آزمایش‌ها به دو نتیجه حیاتی ختم شد. نخست اینکه یک «مسیر کم‌مقاومت» برای ریاضیات هندسی وجود دارد: عامل‌ها در تولید کد پایتونی که ریاضیات را تولید می‌کند، بسیار بهتر از تولید مستقیم خودِ ریاضیات عمل می‌کنند. دوم اینکه عامل‌ها از کدهای پایتونی که مدل‌ها را می‌سازند، بسیار مؤثرتر از خودِ مدل‌های LDraw یاد می‌گیرند؛ چرا که مدل‌های LDraw به دلیل پیچیدگی‌های ساختاری، درگیر «هندسه دشوار» (Evil Geometry) هستند. این رویکرد یادگیری از طریق کد، شباهت زیادی به سیستم‌های برنامه‌نویسی خودبهینه‌ساز دارد که اخیراً در اکوسیستم Elixir پیاده‌سازی شده‌اند تا کارایی مدل‌ها را به‌طور خودکار ارتقا دهند.

خط لوله تولید (Generative Pipeline)

این سیستم مانند یک کامپایلر چندمرحله‌ای عمل می‌کند. به نقل از مستندات گیت‌هاب پروژه، این فرآیند از یک سلسله‌مراتب مشخص پیروی می‌کند:

  • برنامه‌ریزی: عامل پرامپت را دریافت کرده و فایل instructions.md و اسناد مرتبط با زبان LDraw را می‌خواند. سپس یک فایل plan.json (برای مثال atlas-crane.plan.json) ایجاد می‌کند که جزئیات قطعات مورد نیاز، زیرمدل‌ها و ویژگی‌های زیبایی‌شناسی را مشخص می‌کند.
  • تولید: عامل بر اساس آن برنامه، یک اسکریپت generator.py می‌نویسد. این اسکریپت به عنوان پلی میان برنامه اولیه و فایل نهایی CAD عمل می‌کند.
  • اجرا: اسکریپت اجرا شده و یک فایل منبع .mpd (زبان تخصصی LDraw) تولید می‌کند (مانند atlas-crane.mpd) که در واقع یک زبان CAD سه‌بعدی تخصصی است.
  • تأیید: عامل با استفاده از رندرینگ بدون رابط کاربری (Headless)، تصاویری از نتیجه می‌سازد. سپس این تصاویر را برای یافتن شکاف‌ها یا تداخلات (Collisions) بررسی کرده، جای‌گذاری‌ها را تنظیم می‌کند و کد را تا رسیدن به مدل نهایی اصلاح می‌کند.

ابزار عامل برای ساخت مدل‌های لگوی تولیدی، ساخته‌شده با Astra و Opus ۵.۵، قدرت‌گرفته از Jev

زیرساخت فنی و ابزارها

برای بهبود شناسایی قطعات، سیستم با jev-rerank ادغام شده است؛ ابزاری برای جست‌وجوی معنایی (Semantic Search) — مثل کارت معرفی عددی برای هر واژه که می‌گوید این کلمه همسایه‌ی چه کلمات دیگری است — که توسط مدل Jev System One شرکت TypeSafe پشتیبانی می‌شود. این ابزار به عامل‌ها کمک می‌کند تا قطعات و مدل‌های نمونه مناسب را بیابند. مدل Jev پیش از این توانسته است تأخیر در تصمیم‌گیری هوش مصنوعی را به ۷۰ میلی‌ثانیه کاهش دهد که این سرعت در پردازش‌های لحظه‌ای ldraw-nova بسیار حیاتی است. اگر یک TYPESAFE_API_KEY در تنظیمات وب‌اپلیکیشن ارائه شود، سیستم از قابلیت بازرتب‌بندی (Re-ranking) استفاده می‌کند؛ در غیر این صورت، به جست‌وجوی متن کامل (FTS) بازمی‌گردد که ممکن است مدل‌های ضعیف‌تری را ارائه دهد.

استقرار سیستم از طریق Docker انجام می‌شود و نیازمند دو مخزن هم‌زمان است که باید با یک تگ یکسان (مثلاً v0.6.0) کلون شوند:

  • ldraw-nova: منطق اصلی سیستم.
  • ldraw-nova-docker: پیکربندی داکر و اپلیکیشن وب.

نصب اولیه حدود ۵ گیگابایت فضای دیسک می‌طلبد. دسترسی به برنامه از طریق https://localhost:8443 (که برای Meta Quest 3 ضروری است، هرچند از گواهینامه self-signed استفاده می‌کند) یا http://localhost:8765 برای HTTP معمولی امکان‌پذیر است. سایر دستگاه‌های موجود در شبکه می‌توانند از طریق IP کامپیوتر (مثلاً https://192.168.1.20:8443) متصل شوند.

پایگاه دانش عامل

برای اینکه عامل بتواند مانند یک سازنده حرفه‌ای عمل کند، مجموعه‌ای جامع از راهنماها و مراجع در اختیار او قرار می‌گیرد:

  • طراحی بصری: راهنمایی برای بهبود شکل، رنگ و جزئیات بصری مدل.
  • گردش‌کار وسایل نقلیه و سفینه‌ها: متدهای خاص برای طراحی وسایل نقلیه و سفینه‌های پیشرفته، شامل «اطلس» مخصوص سفینه‌ها.
  • راهنمای سازه و مکانیسم: گردش‌کارهای ساختاری برای قطعات Technic و دستورالعمل‌های ساخت برای مکانیسم‌ها.
  • اعتبارسنجی: مستندات مربوط به هندسه، اتصال قطعات (Snapping) و اعتبارسنجی برای درک صحیح اتصالات و بررسی‌ها.
  • کشف مراجع: اطلسی از مراجع برای یافتن ساختارهای قابل استفاده مجدد و قطعات.
  • سازماندهی: گردش‌کارهای ماژولار، مانند مثال «Copper Lane»، برای سازماندهی مدل‌های بسیار بزرگ.

عملکرد مدل‌ها

توسعه‌دهنده پروژه به تفاوت فاحش در توانایی مدل‌ها اشاره می‌کند. مدل‌های رده‌بالا مانند GPT-6 Astra و Claude Opus 5.5 برای ایجاد این ابزارها از طریق Vibe Coding (کدنویسی بر اساس حس و شهود بدون سخت‌گیری در سینتکس) ضروری بودند و در حال حاضر تنها مدل‌هایی هستند که قادر به تولید مدل‌های بزرگ و صحیح هستند.

مدل‌های کوچک‌تر مانند Luna یا Haiku در حال حاضر با پیچیدگی دستورالعمل‌ها مشکل دارند. هدف پروژه در به‌روزرسانی‌های آینده، بهینه‌سازی مستندات و ابزارها است تا سیستم برای این مدل‌های کوچک‌تر نیز قابل دسترسی باشد.

محدودیت‌ها و چشم‌انداز آینده

با وجود این پیشرفت، سیستم با چندین چالش روبروست:

  • کارایی: فرآیند تولید کند است و از نظر محاسباتی هزینه بالایی دارد.
  • پایداری VR: مدیریت مدل‌ها و عملکرد کلی در Meta Quest 3 همچنان مشکلاتی دارد.
  • شکاف‌های دامنه: در حالی که وسایل نقلیه پشتیبانی می‌شوند، سیستم در طراحی اشکال ارگانیک (مانند انسان‌ها و حیوانات/Minifigs) و ماشین‌آلات یا موتورهای پیچیده Technic ضعف دارد.
  • دفترچه‌های راهنما: ساخت مدل بر اساس دفترچه‌های راهنما تا حدی کار می‌کند، اما زمانی که صفحات دفترچه به صورت تصویر ارائه شوند، بسیار مؤثرتر است.
  • بازرسی: نیاز به بازرسی دقیق‌تر (Fine-grained) از زیرمدل‌ها و فرآیندهای گام‌به‌گام ساخت وجود دارد.

این چرخش به سمت «CAD عامل‌محور» نشان می‌دهد که مسیر طراحی فیزیکی توسط هوش مصنوعی، نه از طریق ریاضیات بهتر، بلکه از طریق انتزاع‌های بهتر می‌گذرد. با تبدیل دنیای فیزیکی به یک کدبیس، ما به عامل‌ها اجازه می‌دهیم از قوی‌ترین مهارت خود — برنامه‌نویسی — برای حل ضعیف‌ترین مهارتشان — استدلال مکانی — استفاده کنند.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، مخازن ldraw-nova را در گیت‌هاب بررسی کنید تا با نحوه تبدیل توصیفات متنی به اسکریپت‌های پایتونی آشنا شوید.
  • برای تجربه مدل‌های تولید شده، از یک نمایشگر LDraw یا هدست VR استفاده کنید تا دقت جای‌گذاری قطعات را بسنجید.
  • بررسی کنید که چگونه می‌توانید از مدل‌های استدلالی برای تبدیل سایر مسائل هندسی به مسائل کدنویسی تبدیل کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پروژه با تکیه بر تخصص در مهندسی نرم‌افزار، یکی از بزرگ‌ترین موانع هوش مصنوعی در دنیای فیزیکی را دور زد. اعتبار این روش در تبدیل خروجی‌های احتمالی و توهم‌آمیز به کدهای قطعی و قابل اجراست.

تأثیر برای ایران

این پروژه متن‌باز است و برنامه‌نویسان ایرانی می‌توانند بدون نیاز به سخت‌افزارهای گران‌قیمت، از آن برای یادگیری طراحی عامل‌محور در محیط‌های سه‌بعدی استفاده کنند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی استدلال مکانی با تولید کد، یک الگوی استراتژیک در توسعه عامل‌هاست. این رویکرد ثابت می‌کند که برای حل ضعف‌های ذاتی مدل‌های زبانی، نباید روی بهبود همان ضعف پافشاری کرد، بلکه باید مسئله را به حوزه‌ای منتقل کرد که مدل در آن تسلط کامل دارد (مانند کدنویسی). این تغییر پارادایم می‌تواند راه را برای طراحی خودکار قطعات صنعتی و معماری باز کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.