تصور کنید بخواهید یک شهر خیالی را که تنها در شعر وجود دارد، به یک محیط سه بعدی تعاملی تبدیل کنید؛ کاری که پیش از این ساعتها زمان و اصلاحات دستی طراحان را میطلبید. اکنون Claude Opus 5.5 ثابت کرد که میتواند این مسیر را در یک مرحله و با دقتی خیرهکننده طی کند.
به گزارش وبسایت quesma.com در ۸ اکتبر ۲۰۲۶، این مدل در بازسازی بصری کتاب «شهرهای نامرئی» اثر ایتالو کالوینو، استانداردهای جدیدی برای طراحی به کمک هوش مصنوعی تعریف کرد. در این آزمایش، مدل توانست ثبات زیباییشناختی و ظرافتی را ارائه دهد که بسیار فراتر از رقبایش بود و سقف جدیدی برای طراحیهای کمکگرفته از هوش مصنوعی ایجاد کرد.
زمینه: تکامل بصریسازی هوش مصنوعی
برای سالها، استفاده از مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن کتابها جواب میدهد — برای بصریسازی دادهها، بیشتر شبیه به جنگ با «آشغالهای بصری» (AI slop) و اصلاح تداخلات گرافیکی بود. همانطور که در تحلیلهای قبلی ما دربارهی تکامل مدلهای مولد اشاره کردیم، تولید یک صفحه وب ساده برای فروشگاهها با مدلهای محلی اکنون عادی است، اما بصریسازی تعاملی همچنان در سطح دشواری متفاوتی قرار دارد. این چالشها در واقع بخشی از تقابل میان رویکردهای شبیهسازی فیزیکی و مدلهای انتشار در خلق آثار هنری است که مرزهای واقعگرایی بصری را جابهجا کرده است.
در تلاشهای اولیه با مدلهایی مثل Claude Opus 4.8 در پروژهی ریشهشناسی زبانهای هندواروپایی به نام «درختِ درخت» (The Tree of ‘tree’)، پیشنویسهای اولیهای تولید میشد که بهطور غافلگیرکنندهای خوب بودند، اما همچنان به پاکسازی دستی خستهکننده نیاز داشتند. به همین ترتیب، مدل Claude Fable 5.1 برای تحلیل دادهها و پیادهسازی در «نقشه فاصله ژنتیکی» عملکرد خوبی داشت، اما برای رسیدن به یک طراحی مطلوب، به نظارت و راهنمایی شدید انسانی نیاز داشت.


معیار سنجش: شهرهای نامرئی
برای محک زدن مرزهای فعلی، یک پرامپت دشوار و جامع برای هر دو مدل GPT-6 Astra و Claude Opus 5.5 ارسال شد. موضوع، شعر شهری ایتالو کالوینو در کتاب «شهرهای نامرئی» بود که ۵۵ شهر خیالی را توصیف میکند؛ شهرهایی که در آنها معماری بیانگر احساسات یا حالات ذهنی است. برای مثال، شهر «ایسیدورا» با پلههای مارپیچی پوشیده از صدف و تولید تلسکوپها و ویولنهای بینقص شناخته میشود.
این یک جهش عظیم نسبت به سال ۲۰۱۹ بود، زمانی که نویسنده از GPT-2 برای تولید شهرها در یک اجرای نمایشی داستانگویی استفاده میکرد. دستور جدید کاملاً صریح و سختگیرانه بود: «یک بصریسازی three.js (با استفاده از pnpm) برای تمام شهرهای نامرئی اثر ایتالو کالوینو بساز. سوال نپرس، این یک تسک One-shot (تولید در یک مرحله) است. ۶ ساعت زمان داری، از آن تا تبدیل شدن اثر به یک شاهکار استفاده کن».

نتیجهی GPT-6 Astra
مدل GPT-6 Astra این تسک را در ۵۳ دقیقه و با هزینه تقریبی ۱۰ دلار توکن API به پایان رساند. طبق بررسیها، اگرچه کد بهطور کامل از ابتدا تا انتها اجرا میشد، اما نتیجه دچار چندین نقص طراحی بود:
- وجود «آشغالهای طراحی هوش مصنوعی» و کامنتهای غیرضروری که نویز بصری ایجاد میکرد.
- استفاده از جملات «بدیهی» (Captain Obvious) که شاید برای دسترسیپذیری (Accessibility) مناسب بودند، اما به عنوان المانهای بصری مستقیم، کیفیت اثر را پایین میآوردند.
- زیباییشناسی کلی و تکراری که شبیه به سبکهای قدیمی کلود بود، مانند پسزمینههای بژ و شمارهگذاریهای خاص مثل "05".
در این راستا، برای مقابله با چنین نقصاتی، تستهای خودکار به جای بازبینی دستی کد در پروژههای هوش مصنوعی جایگزین شدهاند تا کیفیت خروجیها تضمین شود.

نتیجهی Claude Opus 5.5
در مقابل، Claude Opus 5.5 یک ساعت و ۲۵ دقیقه زمان برد و حدود ۷۴ دلار هزینه توکن داشت. اگرچه این مدل بسیار زودتر از محدودیت ۶ ساعته کار را تمام کرد، اما از تکنیکی به نام «اتساع زمانی عاملمحور» (Agentic time dilation) استفاده کرد؛ به این معنا که ۶ عامل (Agent) — شبیه به تیمی از دستیاران متخصص که هر کدام بخشی از پروژه را همزمان پیش میبرند — را بهصورت موازی به کار گرفت تا مجموعاً حدود هفت ساعت کاری را در یک ساعت و نیم فشرده کند. مدل در نهایت ادعا کرد که هرگونه پرداخت و صیقل دادن بیشتر، بازدهی نزولی خواهد داشت.

نتیجه یک بصریسازی مسحورکننده بود. این موفقیت در ادامه نتایج سطح بالای دیگری است، مانند آزمایشگاه لنز تعاملی رایان سال برای توضیح فوکوس دوربین، که Opus 5.5 آن را در ۱ ساعت و ۲۶ دقیقه و با هزینه ۲۵.۶۶ دلار ساخت. هرچند برخی استدلال میکنند که این نتایج «بیش از حد غنی» هستند و مینیمالیسم را فدای جزئیات کردهاند، اما کیفیت ثابت و یکپارچه آن تکاندهنده است.
این تغییر نشان میدهد آینده طراحی هوش مصنوعی در جریانهای کاری عاملمحور (Agentic) است، نه در استنتاج (Inference) — لحظهای که مدل واقعاً جواب تولید میکند، مثل خودِ آشپزی و نه دورهی آموزش آشپز — تکسویه. با صرف توکن بیشتر و استفاده از زیر-عاملهای موازی، مدل میتواند روی زیباییشناسی به گونهای تکرار و اصلاح کند که یک رابط چت استاندارد قادر به انجام آن نیست.
برای خلقکنندگان رسانههای تعاملی، این موضوع یک سوال حیاتی درباره نقش طراح انسانی ایجاد میکند. وقتی مدلی میتواند کل مسیر از تفسیر شاعرانه تا پیادهسازی فنی در three.js را در کمتر از دو ساعت مدیریت کند، نقش انسان از «سازنده» به «کیوریتور» (گردآورنده) و «کارگردان» تغییر مییابد.
با افزایش بودجه توکنها برای طراحی، میتوان انتظار موجی از «توضیحات قابل کاوش» (Explorable Explanations) را داشت؛ ابزارهای تعاملی که مفاهیم پیچیده را از طریق بصریهای سطح بالا و باکیفیت، بصری و شهودی میکنند. باید منتظر نسل بعدی مدلها بود تا «آشغالهای بصری» را بیشتر کاهش داده و مینیمالیسم را در این طراحیهای تکمرحلهای افزایش دهند.
گام بعدی شما
- اگر طراح UI/UX هستید، به جای پرامپتهای تکمرحلهای، از ساختارهای چند-عاملی برای تکرار (Iteration) روی جزئیات بصری استفاده کنید.
- برای پروژههای بصریسازی داده، بودجه توکنهای خود را افزایش دهید تا مدل فرصت «تفکر» و اصلاح زیباییشناختی داشته باشد.
- کتابخانههای three.js و pnpm را برای پیادهسازی سریع خروجیهای مدلهای پیشرو یاد بگیرید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو