پرش به محتوای اصلی
پرش به محتوای مقاله

کدام مدل بینایی در بازتولید آثار مداد رنگی بهینهٔ تر عمل می‌کند؟

·۳۱ تیر ۱۴۰۵۷ دقیقه مطالعه
نقاشی مونا لیزا با هوش مصنوعی: مقایسه GPT-5.6، Claude، Gemini و Grok
نقاشی مونا لیزا با هوش مصنوعی: مقایسه GPT-5.6، Claude، Gemini و Grok
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

در اولین تست واقعی «عامل‌مندی بصری»، مشخص شد که مدل‌های پیشرو قادر به «خوداصلاحی» (Self-Correction) در هنر نیستند و هرچه بیشتر تلاش می‌کنند، خروجی را تخریب می‌کنند.

تصور کنید یک نقاش دست‌وپاچلفه است که تنها هر چند دقیقه یک بار اجازه دارد به بوم نقاشی‌اش نگاه کند؛ این دقیقاً همان محدودیتی است که پیشرفته‌ترین مدل‌های هوش مصنوعی در یک آزمون دشوار با آن روبرو شدند. در ۲۱ جولای ۲۰۲۶، پلتفرم tryai.dev «آرنای ترسیم» (Drawing Arena) را معرفی کرد تا مدل‌های هوش مصنوعی زاینده (Generative AI) — که برخلاف اکثر مدل‌های امروزی که تصاویر را به‌صورت آنی و با پیش‌بینی پیکسل‌ها تولید می‌کنند، در اینجا مجبور شدند مانند هنرمندانی عمل کنند که مجموعه‌ای محدود از ابزارهای مداد رنگی در اختیار دارند — را در یک چالش واقعی استدلال فضایی قرار دهد. این تست بی‌رحمانه، چهار مورد از پیشرفته‌ترین مدل‌های جهان را در مقابل یکدیگر قرار داد تا آن‌ها را به چالش بکشد که اثر مونا لیزا را ضربه‌به‌ضربه روی یک بوم دیجیتال خالی بازسازی کنند.

این آزمایش در حالی صورت می‌گیرد که صنعت هوش مصنوعی در حال گذار از بنچمارک‌های ایستا به سمت وظایف «مبهم» (Fuzzy Tasks) است؛ وظایفی که «عامل‌مندی» (Agency) مدل‌ها را در دنیای واقعی می‌سنجد. همان‌طور که در تحلیل قبلی ما درباره‌ی نفوذ GPT-5.6 Sol به زیرساخت‌های Hugging Face اشاره کردیم، این تست فرصتی نادر برای دیدن این موضوع فراهم می‌کند که مدل‌ها در واقعیت چگونه با اجرای تکرارشونده و طولانی‌مدت برخورد می‌کنند. این سطح از محدودیت، شباهت زیادی به هنرمندی دارد که چشم‌بند زده و فقط هر چند دقیقه یک بار می‌تواند نگاهی گذرا به بوم بیندازد.

زمینه: فراتر از بنچمارک‌ها

پژوهشگران تأکید می‌کنند که این‌ها تست‌های عینی برای سنجش کلی قابلیت مدل‌ها نیستند، بلکه تکالیفی هستند که تعمداً به‌صورت «پایان-باز» طراحی شده‌اند. آن‌ها استدلال می‌کنند که تماشای نحوه مواجهه یک مدل با یک تکلیف منعطف، شاخص بصری بسیار جذاب‌تری از توانایی‌های آن است تا تکرار یک عدد خشک در جدول‌های بنچمارک. این تست‌ها طراحی شده‌اند تا از پدیده «بنچ‌مکسینگ» (Benchmaxxing - بهینه‌سازی مدل فقط برای کسب نمره در تست‌ها) عبور کرده و قابلیت‌های واقعی مدل‌های مرز فناوری را از بقیه جدا کنند.

برای مثال، در حالی که مدل‌های ارزان‌تر با «وزن‌های باز» (Open Weights) می‌توانند جایگزین مدل‌های پیشرو در کارهای اجرایی ساده شوند، در این تست شکست خوردند. چندین مدل وزن‌باز که امتحان شدند، حتی قابل استفاده نبودند و تنها بوم‌های کاملاً سفید تحویل دادند. علاوه بر این، این آزمایش‌ها هزینه واقعی وظایف طولانی‌مدت را برملا می‌کند. نتایج نشان‌دهنده شکافی عمیق در هزینه‌های سربار است؛ برخی مدل‌ها کیفیت کمی بهتر ارائه می‌دهند اما با قیمتی که آن‌ها را برای بسیاری از کاربردهای عملی غیرقابل استفاده می‌کند.

جزئیات: مکانیسم‌های آرنا

بستر تست که اکنون در گیت‌هاب (github.com/hershalb/canvas-arena) به‌صورت متن‌باز منتشر شده است، مجموعه‌ای خاص از ابزارها را در اختیار مدل‌ها قرار می‌دهد. تمامی مدل‌ها دقیقاً با یک جعبه‌ابزار مشترک از مدادهای رنگی کار کردند:

  • plan: یک فضای یادداشت (Scratchpad) بدون اثر برای تفکر و برنامه‌ریزی بین مراحل.
  • view_target: به مدل اجازه می‌دهد تا دوباره به تصویر هدف نگاه کند.
  • view_canvas: رندر کردن صفحه فعلی تا مدل بتواند نتیجه کارش را ببیند. این دقیقاً نقطه‌ای است که نقاشی با تصویر هدف مقایسه و امتیازدهی می‌شود.
  • set_color / set_brush / set_pressure: تنظیم رنگ فعلی مداد، پهنای نوک قلم و میزان فشار (شفافیت از ۰ تا ۱؛ جایی که فشار کم، تنی نرم‌تر ایجاد می‌کند).
  • draw: ترسیم دسته‌ای از علامت‌ها، مانند ضربات قلم، خطوط، دورخط اشکال یا نقاط در یک فراخوانی واحد.
  • smudge: محو کردن یا نرم کردن یک ناحیه مستطیلی، که دقیقاً مانند یک ابزار محو‌کننده فیزیکی (Blending Stump) عمل می‌کند.
  • erase / clear_canvas: پاک کردن یک ناحیه و بازگرداندن آن به رنگ سفید یا ریست کردن کامل صفحه.

نکته حیاتی این است که هیچ ابزاری برای «پر کردن یک‌باره» (Solid Fill) وجود ندارد. بنابراین، رنگ و سایه‌ها باید از طریق لایه‌گذاری تدریجی ساخته شوند که دقیقاً تقلیدی از فرآیند فیزیکی طراحی با مداد است.

نتایج رویارویی مستقیم

در این رقابت، مدل‌های GPT-5.6 Sol، Claude Fable 5، Grok 4.5 و Gemini 3.6 Flash در مواجهه با دو تصویر هدف (مونا لیزا و شب starry night اثر ون‌گوگ) و پنج پرامپت متنی باز قرار گرفتند. در مجموع، ۲۸ نقاشی توسط این مدل‌ها تولید شد.

نقاشی مونا لیزا با هوش مصنوعی: مقایسه GPT-5.6، Claude، Gemini و Grok

بازسازی تصاویر هدف

در اجراهای مربوط به تصاویر هدف، مدل‌ها دسترسی مداوم به تصویر داشتند و بر اساس معیارهای SSIM (شباهت ساختاری) و RMSE (خطای مربعات میانگین) مورد ارزیابی قرار گرفتند. مقدار SSIM بین ۰ تا ۱ است (هرچه بالاتر، نزدیک‌تر به هدف) و RMSE بین ۰ تا ۲۵۵ متغیر است (هرچه پایین‌تر، نزدیک‌تر به هدف).

  • مونا لیزا: مدل Gemini 3.6 Flash با امتیاز ۰.۴۴۹ به بالاترین نقطه اوج رسید، اگرچه در نهایت با ۰.۳۳۷ متوقف شد. GPT-5.6 Sol با امتیاز نهایی ۰.۳۲۵ (اوج ۰.۳۵۲) در جایگاه بعدی بود. Claude Fable 5 به امتیاز ۰.۲۸۶ رسید و Grok 4.5 با ۰.۱۵۱ در انتهای جدول قرار گرفت.
  • شب starry night: باز هم Gemini 3.6 Flash با امتیاز نهایی ۰.۱۷۲ (اوج ۰.۱۹۰) پیشتازه بود. GPT-5.6 Sol با امتیاز ۰.۱۳۰ (اوج ۰.۱۷۹) پایان یافت. Claude Fable 5 به امتیاز نهایی ۰.۱۵۳ دست یافت، در حالی که Grok 4.5 با ۰.۰۳۹ به شدتP شکست خورد.

نقاشی‌های مبتنی بر پرامپت

مدل‌ها همچنین با پنج پرامپت متنی بدون هیچ تصویر مرجع مواجه شدند:
۱. چهره فرسوده یک ماهیگیر پیر در معرض تابش گرم خورشید اواخر بعدازظهر.
۲. یک غروب زیبا بر فراز اقیانوسی آرام با آسمانی که از نارنجی به بنفش تغییر رنگ می‌دهد.
۳. یک تک گل رز قرمز در گلدانی شیشه‌ای با نورپردازی دراماتیک به سبک رامبراند.
۴. یک گربه تبی که روی لبه پنجره حلقه زده و خوابیده است.
۵. فضای داخلی یک کلبه دنج با شومینه روشن و نور کهربایی.

طبق گزارش tryai.dev، مدل GPT-5.6 Sol پیشرو بی‌چالش در کیفیت بصری بود. این مدل مفصل‌ترین نسخه‌ها از «شب starry night» و «گل رز قرمز» را تولید کرد. در تقریباً تمام نقاشی‌ها، به جز مورد ماهیگیر پیر، Sol از نظر جزئیات تمام رقبای خود را شکست داد.

نقاشی مونا لیزا با هوش مصنوعی: مقایسه GPT-5.6، Claude، Gemini و Grok

Gemini 3.6 Flash نمرات عینی بالایی به دست آورد، اما پژوهشگران خاطرنشان کردند که SSIM خام لزوماً به معنای تصویر زیباتر برای چشم انسان نیست. این موضوع ثابت می‌کند که نزدیکی ساختاری با کیفیت هنری برابر نیست.

نقاشی مونا لیزا با هوش مصنوعی: مقایسه GPT-5.6، کلود، جمینی و گروک

Claude Fable 5 از نظر کیفیت رتبه دوم را کسب کرد اما در بهره‌وری شکست خورد. این مدل با اختلاف بسیار زیاد، گران‌ترین مدل بود و هزینه تخمینی آن ۱۶۰ دلار برای هفت نقاشی بود؛ یعنی تقریباً ۲۰ برابر بیشتر از GPT-5.6 Sol که تنها ۷.۷۴ دلار هزینه داشت. برای درک بهتر چگونگی بهینه‌سازی تعامل با این مدل، می‌توان به راهنمای جامع انتقال از چت‌های ساده به جریان‌های کاری حرفه‌ای کلود رجوع کرد تا نقاط ضعف بهره‌وری در این تست بهتر تحلیل شود.

نقاشی مونا لیزا با هوش مصنوعی: مقایسه GPT-5.6، Claude، Gemini و Grok

Grok 4.5 عملکرد بسیار ضعیفی داشت و اغلب خروجی‌های غیرقابل استفاده تولید کرد. در گزارش این بخش، عملکرد آن «تقریباً زباله» توصیف شده است. رفتار این مدل با «تلاطم» در استفاده از ابزارها شناخته شد؛ جایی که ۶۵ درصد از ۱۳۴۹ فراخوانی آن صرفاً روی تنظیم پارامترهای قلم متمرکز بود، نه روی اصلِ نقاشی کردن.

نقاشی مونا لیزا با هوش مصنوعی: مقایسه GPT-5.6، Claude، Gemini و Grok

شکاف بهره‌وری

این چهار مدل از یک جعبه‌ابزار یکسان، اما به روش‌هایی کاملاً متضاد استفاده کردند:

  • GPT-5.6 Sol: هرگز از دستورات set_color، set_brush یا set_pressure به عنوان دستورات مستقل استفاده نکرد. او این تنظیمات را به‌صورت درون‌خطی (Inline) در هر فراخوانی draw قرار داد که منجر به یک جریان کاری بهینه شامل «ترسیم، محو کردن و مشاهده» شد. این رویکرد بهینه در مدیریت توالی دستورات، شباهت زیادی به تلاش برای جایگزینی دستورات متنی با الگوهای رفتاری دارد تا اصطکاک در اجرای وظایف کاهش یابد.
  • Gemini 3.6 Flash: وسوسناک‌ترین بازبین بود. تقریباً یک‌سوم فراخوانی‌های او مربوط به view_canvas بود (به‌طور متوسط ۲۳ بازبینی برای هر نقاشی). او نیز مانند Sol، ابزارهای مستقل set_* را نادیده گرفت.
  • Grok 4.5: دقیقاً نقطه مقابل Sol بود. بیشتر زمان او صرف فراخوانی‌های تنظیماتی شد و به همین دلیل میانگین ۹۹ مرحله برای هر نقاشی نیاز داشت.
  • Claude Fable 5: به شدت به ابزار smudge تکیه کرد (۱۲۳ فراخوانی) و مدام کار خود را بازبینی می‌کرد.

از نظر هزینه و توکن، Grok 4.5 با ۳۴ میلیون توکن بیشترین مصرف را داشت و Gemini 3.6 Flash با ۲۷.۷ میلیون در رده دوم بود. با این حال، هر دو ارزان باقی ماندند زیرا حدود ۹۸ درصد توکن‌های Grok مربوط به خواندن‌های کش‌شده (Cached Reads) بود. در مقابل، Claude Fable 5 پول بسیار بیشتری بابت خروجی‌هایی پرداخت کرد که نسبت به قیمتشان، کیفیت پایین‌تری داشتند.

مسئله «پلاتو» یا سکون

یکی از افشاگرترین یافته‌ها، شکست در بهبود تکرارشونده بود. در تک‌تک اجراهای تصاویر هدف، مدل‌ها در نهایت «بیش از حد ویرایش» کردند و اثرشان را نسبت به بهترین نسخه خود خراب کردند.

دو الگوی مشخص ظهور کرد:
۱. پلاتوهای زودهنگام: پیشرفت مدل‌ها به سرعت متوقف می‌شد. برای مثال، Claude Fable 5 مونا لیزای خود را ۲۷ بار بازبینی کرد، اما امتیاز شباهت او بعد از پنجمین بازبینی اساساً مسطح شد.
۲. تخریب عملکرد: نقاشی نهایی همیشه امتیاز پایین‌تری نسبت به بهترین فریمی داشت که در میانه مسیر به دست آمده بود.

به‌عنوان مثال، مونا لیزای GPT-5.6 Sol به اوج SSIM ۰.۳۵۲ رسید اما در پایان به ۰.۳۲۵ سقوط کرد. اثر شب starry night او به اوج ۰.۱۷۹ رسید و با ۰.۱۳۰ به پایان رسید. Gemini 3.6 Flash بیشترین نوسان را داشت و پس از رسیدن به اوج ۰.۴۴۹، دوباره به ۰.۳۳۷ سقوط کرد.

نقاشی مونا لیزا با هوش مصنوعی: مقایسه GPT-5.6، Claude، Gemini و Grok
نقاشی مونا لیزا با هوش مصنوعی: مقایسه GPT-5.6، Claude، Gemini و Grok
نقاشی مونا لیزا با هوش مصنوعی: مقایسه GPT-5.6، Claude، Gemini و Grok

تحلیل: مدل‌های مرز فناوری در برابر بقیه

برای کاربر عادی، این بدان معناست که اگرچه مدل‌های «مرز فناوری» مانند Sol به شدت برتر از مدل‌های وزن‌باز هستند، اما نسبت هزینه به کیفیت در حال حاضر نامتعادل است. Claude Fable 5 یک معامله نامناسب ارائه می‌دهد: بسیار کندتر است و تقریباً ۲۰ برابر گران‌تر از هم‌کلاسی‌های خود است، اما خروجی‌اش حتی به گرد پای Sol نمی‌رسد.

این نتایج همچنین محدودیت‌های فعلی حلقه‌های «بینایی-زبان-عمل» (VLA) را برملا می‌کند. این واقعیت که مدل‌ها به‌طور مداوم کار خود را تخریب می‌کنند، نشان‌دهنده شکاف در «قضاوت زیبایی‌شناختی» است؛ آن‌ها می‌توانند اشتباه را تشخیص دهند، اما تلاششان برای اصلاح آن اغلب منجر به خطاهای جدید می‌شود. حتی با قرار دادن تنظیمات استدلال (Reasoning) در بالاترین سطح برای همه مدل‌ها، آن‌ها نتوانستند عملکرد اوج خود را حفظ کنند.

گام بعدی شما

  • اگر از مدل‌های مختلف برای کارهای بصری استفاده می‌کنید، هزینه استنتاج را با کیفیت خروجی مقایسه کنید؛ همیشه مدل گران‌تر برنده نیست.
  • منتظر انتشار متن‌باز مدل Kimi K3 باشید؛ پژوهشگران معتقدند این مدل ممکن است شکاف فعلی بین مدل‌های وزن‌باز و مدل‌های مرز فناوری را در وظایف فضایی به چالش بکشد.
  • برای بهینه‌سازی جریان کاری مدل‌های خود، از متد GPT-5.6 Sol (ترکیب تنظیمات در یک دستور) برای کاهش تعداد فراخوانی‌ها استفاده کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این نتایج بر اعتبار مدل GPT-5.6 Sol در مدیریت وظایف تکراری و پیچیده مهر تأییدی زد و هم‌زمان توهم برتری مدل‌های گران‌قیمت را شکست. تفاوت ۲۰ برابری هزینه در برابر کیفیت مشابه، معماری‌های فعلی Claude را در وضعیت دفاعی قرار می‌دهد.

تأثیر برای ایران

به دلیل هزینه‌های بالای استنتاج مدل‌های پیشرو، توسعه‌دهندگان ایرانی باید روی مدل‌های بهینه‌تری مثل Sol تمرکز کنند تا توازن هزینه و کیفیت را حفظ کنند.

·نگاه ما
تحریریه دات‌هوش

شکست مدل‌ها در حفظ اوج کیفیت و تخریب اثر خود در مراحل نهایی، نشان می‌دهد که «استدلال بصری» هنوز در سطح «درک بصری» نیست. مدل‌ها می‌توانند نقص را تشخیص دهند اما ابزار اصلاحی آن‌ها با منطق زیبایی‌شناختی همراستا نیست. این موضوع احتمالاً باعث می‌شود شرکت‌ها به جای مدل‌های تک‌منظوره، به سمت سیستم‌های چندعاملی حرکت کنند که در آن یک مدل فقط «ناظر کیفیت» باشد و مدل دیگر «اجرا‌کننده».

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.