پرش به محتوای اصلی
پرش به محتوای مقاله

چرا پیشرفته‌ترین مدل‌های هوش مصنوعی در مهارت‌های بصری پایه شکست می‌خورند؟

·۲۴ مرداد ۱۴۰۵۴ دقیقه مطالعه۱ بازدید
تست جدید: هوش مصنوعی هنوز در درک بصری ضعیف است
تست جدید: هوش مصنوعی هنوز در درک بصری ضعیف است
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تفکیک عملی «ادراک بصری» از «استدلال منطقی» در یک محک واحد؛ این اولین بار است که ثابت می‌شود شکست مدل‌های پیشرو در تحلیل تصویر، پیش از رسیدن به مرحله تفکر، در همان مرحله دیدن رخ می‌دهد.

تصور کنید سیستمی که ادعا می‌کند پیچیده‌ترین مسائل ریاضی را حل می‌کند، اما نمی‌تواند تشخیص دهد چند گل در یک جعبه قرمز است. این تضاد تکان‌دهنده، واقعیت فعلی مدل‌های پیشرو در حوزه بینایی است.

طبق تحلیل فنی منتشر شده در ۱۵ اوت ۲۰۲۶، سقف توانایی مدل‌های چندوجهی (Multimodal) برای «دیدن» دقیق جهان، روی ۶۰ درصد متوقف شده است. برای افشای این شکاف، شرکت Moonshot AI محک PerceptionBench را معرفی کرد؛ ابزاری که به‌طور اختصاصی طراحی شده تا ادراک بصری خام را از استدلال منطقی — که معمولاً در آزمون‌های چندوجهی با هم ترکیب می‌شوند — جدا کند.

این تفکیک از آن جهت حیاتی است که صنعت مدت‌ها شکست‌های مدل‌ها را به «خطاهای استدلالی» نسبت می‌داد. اما در واقعیت، بسیاری از مدل‌ها در همان گام اول، یعنی خواندن درست تصویر، شکست می‌خورند. در حالی که مدل‌های استدلالی جدید با ترکیب منطق نمادین توانسته‌اند به دقت خیره‌کننده‌ای در مسائل ریاضی دست یابند، اما در حوزه بینایی، PerceptionBench با حذف نیاز به دانش خارجی یا منطق پیچیده، شکاف بنیادین در درک روابط فضایی، شمارش و ویژگی‌های اشیا را برملا می‌کند.

زمینه و متدولوژی

تیم توسعه‌دهنده دستیار هوش مصنوعی Kimi این محک را برای حل یک مشکل خاص ساخت: آزمون‌های موجود بیش از حد محدود بودند. این پژوهشگران با تحلیل ۴۲ محک متن‌باز دریافتند که پروفایل خطاهای این آزمون‌ها تداخل بسیار کمی دارند؛ به این معنا که هیچ تست واحدی نمی‌توانست ادراک بصری را به‌طور جامع بسنجد.

همان‌طور که در بحث‌های گذشته ما درباره‌ی امنیت و دقت مدل‌های بازمتن اشاره کردیم، تکیه بر داده‌های تئوریک اغلب منجر به نتایج گمراه‌کننده می‌شود. به همین دلیل، نویسندگان این پژوهش تاکسونومی خود را بر اساس خطاهای واقعی مدل‌ها بنا کردند. آن‌ها هر شکست را تا اولین گامِ خطا در بنچمارک‌های موجود ردیابی کردند تا اطمینان یابند تست، بازتاب‌دهنده نقاط ضعف دنیای واقعی است، نه فرضیات آکادمیک.

هوش مصنوعی همچنان در درک بصری ضعیف است

جزئیات ادراکی

پژوهشگران برای ساخت این دسته‌بندی، ۱۰ «حوزه مهارتی» را شناسایی کردند که شامل موارد زیر است:

  • روابط بصری، شمارش و ویژگی‌ها
  • عمق، فضای سه‌بعدی و مکان‌یابی
  • مقایسه و بازشناسی دقیق (Fine-grained)
  • یکپارچگی زمینه، نویسه‌خوانی نوری (OCR) و توهم (Hallucination)

Moonshot AI از میان یک مخزن داخلی شامل بیش از ۱۷,۰۰۰ پرسش تأییدشده، ۳,۰۰۰ تکلیف را منتشر کرد. ۶۰ درصد این تکالیف از خطاهای ثبت‌شده مدل‌ها استخراج شده و ۴۰ درصد دیگر با استفاده از تصاویر تقویت‌شده بازنویسی شده‌اند.

این تکالیف برای انسان‌ها بدیهی به نظر می‌رسند؛ مثلاً تشخیص جایگاه یک نماد روی صفحه ساعت، شمارش گل‌ها در یک جعبه قرمز، یا تشخیص تفاوت بین یک جامدادی خاکستری-صورتی و یک جامدادی صورتی با طرح کارتونی. چهار مطالعه موردی در این پژوهش نشان می‌دهد چگونه تکالیف پیچیده چندمرحله‌ای را می‌توان به این پرسش‌های ادراکی ساده تجزیه کرد.

در میان ۱۶ مدل پیشرو آزمایش‌شده، نتایج نشان‌دهنده یک خوشه فشرده در صدر جدول است، بدون اینکه هیچ سیستمی از مرز ۶۰ درصد عبور کند:

  • GPT-5.6 Sol: ۵۹.۷٪ (پیشرو کلی)
  • Kimi K3: ۵۸.۵٪
  • Claude Fable 5: ۵۷.۲٪
  • Gemini 3.1 Pro: ۵۶.۲٪
  • GPT-5.5: ۵۵.۸٪

جایگاه مدل‌های متن‌باز به‌طور قابل‌توجهی پایین‌تر است؛ به‌طوری که Qwen3.5-397B-A17B امتیاز ۴۷.۵٪ و GLM-4.6V تنها ۳۲.۵٪ را کسب کردند.

معیار جدید: مدل‌های هوش مصنوعی هنوز در ادراک بصری ضعیف‌اند

داده‌ها تفاوت‌های شدیدی را در مهارت‌های خاص نشان می‌دهند. «توهم» — یعنی تمایل مدل به اختراع اشیا در حالی که پاسخ درست «صفر» است — ضعیف‌ترین نقطه در تمام مدل‌هاست. جالب اینجاست که در حالی که GPT-5.6 Sol در مجموع پیشتاز است، در زیرآزمون توهم تنها ۲۶.۹٪ امتیاز گرفته، در حالی که مدل کوچک‌تر Gemini 3.5 Flash با ۵۰.۶٪ عملکرد بهتری داشت.

این الگوی شکست با یافته‌های قبلی همین تیم هم‌راستا است. محک WorldVQA آن‌ها نشان داد که Gemini 3 Pro تنها ۴۷.۴٪ امتیاز گرفته و تمام مدل‌ها به‌طور سیستماتیک در تخمین میزان اطمینان خود دچار خطا می‌شوند. همچنین، مطالعه‌ای روی محک BabyVision فاش کرد که مدل‌های پیشرو در تکالیف ابتدایی کودکان، مانند دنبال کردن خطوط یا شمارش بلوک‌های پنهان، شکست می‌خورند. در آن تست‌ها، Gemini 3 Pro امتیاز ۴۹.۷٪ را کسب کرد، در حالی که انسان‌ها به ۹۴.۱٪ رسیدند.

برای جامعه فنی، این نتایج تمرکز را از بهبود «استدلال» به حل «گلوگاه کلامی‌سازی» (Verbalization Bottleneck) تغییر می‌دهد. این همان نقطه‌ای است که اطلاعات بصری با کیفیت بالا به زبان ترجمه می‌شوند و اغلب جزئیات حیاتی در این فرآیند از دست می‌روند. این چالش در تضاد با پیشرفت‌های اخیر در استدلال ماشینی است؛ برای مثال، مدل Claude Opus 5 اخیراً با ثبت رکوردی جدید در بنچمارک ARC-AGI، توانایی‌های استدلالی خود را به رخ کشید، اما همچنان در مواجهه با داده‌های بصری خام با محدودیت‌های مشابه سایر مدل‌ها روبروست.

اگر صنعت همچنان این نقص‌ها را به عنوان شکاف‌های استدلالی تلقی کند، احتمالاً شاهد توقف رشد عملکرد مدل‌های چندوجهی خواهیم بود. گلوگاه فعلی «مغز» مدل نیست، بلکه «چشمان» آن است.

توسعه‌دهندگان اکنون می‌توانند به مجموعه کامل ۳,۰۰۰ تکلیف و کد ارزیابی از طریق مخزن گیت‌هاب MoonshotAI/PerceptionBench دسترسی داشته باشند تا خط لوله‌های بینایی خود را آزمایش کنند.

گام بعدی شما

  • اگر از مدل‌های VLM برای تحلیل تصویر استفاده می‌کنید، تکالیف PerceptionBench را برای سنجش نرخ خطای ادراکی مدل خود اجرا کنید.
  • در طراحی پرامپت‌ها، به جای تکیه بر استدلال مدل، از تکنیک‌های راهنمایی بصری برای کاهش توهم در شمارش اشیا استفاده کنید.
  • نتایج مدل‌های کوچک‌تر (مانند Gemini Flash) را در کارهای ساده‌تر بصری با مدل‌های غول‌پیکر مقایسه کنید؛ احتمالاً به بهینگی بیشتری در هزینه و دقت می‌رسید.

اما داستان سخت‌افزاری این تحول و نقش تراشه‌های جدید در پردازش بصری حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پژوهش با تکیه بر متدولوژی دقیق Moonshot AI، ثابت می‌کند که پیشرفت در هوش مصنوعی چندوجهی به دلیل نقص در ادراک بصری متوقف شده است. این یافته باعث می‌شود شرکت‌های توسعه‌دهنده به‌جای تمرکز بر مدل‌های استدلالی بزرگ‌تر، روی بهبود دقت لایه‌های بینایی سرمایه‌گذاری کنند.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران مدل‌های بنیادی و توسعه‌دهندگان سیستم‌های بینایی ماشین در ایران اهمیت دارد تا کاربران نهایی؛ چرا که مسیر بهینه‌سازی مدل‌های VLM را تغییر می‌دهد.

·نگاه ما
تحریریه دات‌هوش

این نتایج فرضیه «مقیاس‌پذیری مطلق» را به چالش می‌کشد؛ یعنی افزایش پارامترها و داده‌ها لزوماً به معنای درک بهتر دنیای فیزیکی نیست. مشکل فعلی مدل‌ها یک نقص معماری در لایه تبدیل تصویر به توکن است، نه کمبود قدرت پردازش یا منطق. تا زمانی که «چشمان» مدل‌ها اصلاح نشود، استدلال‌های پیچیده روی داده‌های بصری همچنان بر پایه توهمات بنا خواهد بود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.