پرش به محتوای اصلی
پرش به محتوای مقاله

چرا Visual-SDPO در اصلاح خطاهای بصری کدنویسی، GRPO را شکست می‌دهد؟

·۲۱ خرداد ۱۴۰۵۲ دقیقه مطالعه
چرا Visual-SDPO در اصلاح خطاهای بصری کدنویسی، GRPO را شکست می‌دهد؟
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از تقطیر ممتاز برای تزریق «شهود بصری» به مدل بدون افزایش تأخیر در زمان استنتاج؛ به گونه‌ای که مدل در زمان آموزش از رندر استفاده می‌کند اما در زمان اجرا به آن نیازی ندارد.

اگر مدل‌های زبانی شما کدهایی می‌نویسند که از نظر فنی اجرا می‌شوند اما در خروجی بصری دچار مشکلاتی مثل هم‌پوشانی متن یا برش عناصر هستند، دلیل آن عدم دسترسی مدل به خروجی رندر پیش از نهایی کردن کد است. این شکاف بین کد انتزاعی و اثر بصری ملموس، یکی از بزرگ‌ترین چالش‌های فعلی در تولید خودکار رابط‌های کاربری است.

به نقل از گزارش پژوهشی منتشر شده در ۱۰ ژوئن ۲۰۲۶، چارچوب Visual-SDPO با استفاده از تقطیر ممتاز (Privileged Distillation)، بازخوردهای بصری را از یک مدل «معلم» به مدل «شاگرد» منتقل می‌کند. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی مدل‌های چندوجهی (Multimodal) اشاره کردیم، چالش اصلی این است که رندرهای گرافیکی ماهیتی «غیردیفرانسیل» دارند و مدل نمی‌تواند خطاها را از تصویر مستقیماً به کد بازگرداند.

این سیستم که بر پایه مدل Qwen3-VL-8B-Instruct بنا شده است، از مکانیزم وزن‌دهی اعتبار کد مبتنی بر بصری (Visual-Grounded Code Credit Weighting) استفاده می‌کند تا نقص‌های بصری را دقیقاً به دستورات کد مربوطه متصل کند. طبق مستندات این پژوهش، نتایج در بنچمارک‌های ChartMimic، Design2Code و AeSlides به شرح زیر است:

  • بهبود بیش از ۱۰ امتیاز مطلق نسبت به مدل‌های پایه (Zero-shot).
  • کسب حداقل ۲.۴ امتیاز بیشتر نسبت به روش بهینه‌سازی سیاست نسبی گروهی (GRPO).
  • استفاده از یک معلم با اشتراک وزن که بازخوردهای رندر شده را به عنوان بافت ممتاز در نظر می‌گیرد.

این رویکرد، معیار موفقیت مدل‌های کدنویس را تغییر می‌دهد؛ هدف دیگر تنها تولید کد «قابل اجرا» نیست، بلکه تولید اثرات «بصری دقیق» است. پژوهشگران دریافته‌اند که می‌توان «شهود بصری» را بدون افزایش تأخیر در زمان استنتاج (Inference)، در دل مدل جای داد.

گام بعدی شما

  • توسعه‌دهندگان ابزارهای UI باید ادغام Visual-SDPO در موتورهای تولید کد را رصد کنند تا میزان انتقال این دقت به محیط‌های عملیاتی را بسنجند.
  • بررسی قابلیت‌های این مدل در تولید نمودارهای پیچیده برای کاهش خطاهای بصری در گزارش‌های داده‌محور.
  • دنبال کردن گسترش این متد به حوزه‌های رندرینگ سه‌بعدی یا نرم‌افزارهای CAD.

اما چالش‌های استنتاج در مدل‌های بزرگ‌تر همچنان پابرجاست — به بررسی ما درباره‌ی بهینه‌سازی‌های هزینه استنتاج مراجعه کنید.

چرا این موضوع مهم است؟

این پژوهش با تکیه بر اعتبار مدل‌های سری Qwen، راهکاری برای عبور از گلوگاه‌های غیردیفرانسیل در رندرهای گرافیکی ارائه می‌دهد. این تحول باعث می‌شود ابزارهای تولید خودکار UI از حالت پیش‌نویس ساده به ابزارهای تولید محصول نهایی تبدیل شوند.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران مدل‌های بنیادی و توسعه‌دهندگان ابزارهای اتوماسیون UI در ایران اهمیت دارد و اثر مستقیمی بر کاربران عادی ندارد.

·نگاه ما
تحریریه دات‌هوش

تحلیل ما نشان می‌دهد که معیار موفقیت در مدل‌های کدنویس در حال تغییر است؛ دیگر تنها «اجراپذیری» کد کافی نیست، بلکه «دقت بصری» به یک سنجه کلیدی تبدیل شده است. این رویکرد ثابت می‌کند که تقطیر اطلاعات ممتاز می‌تواند جایگزین بهینه‌سازی‌های سنگین و هزینه‌بر RLHF در وظایف چندوجهی شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.