وقتی برای انتخاب ابزار هوش مصنوعی خود به جدولهای ردهبندی تکیه میکنید، احتمالاً با حقیقتی تحریفشده روبهرو هستید. امتیاز ۳۸.۳ درصد؛ این عددی است که GPT-5.6 Sol در محک (Benchmark) منطقی ARC-AGI-3 کسب کرده تا خود را برتر از رقبای نزدیک نشان دهد.
اما طبق گزارش ۳۰ جولای ۲۰۲۶ از وبسایت the-decoder.com، این برتری به یک تغییر اساسی در قوانین بازی وابسته است. OpenAI برای رسیدن به این نتیجه، محیط آزمون رسمی را کنار گذاشت و از یک سازوکاره فنی اختصاصی استفاده کرد. این اتفاق نشان میدهد که فاصله بین هوش خام مدل و «پوستههای» اجرایی آن در حال افزایش است. همانطور که در تحلیل قبلی ما دربارهی شکست باتهای آماده در آزمونهای بازیابی پیچیده اشاره کردیم، موفقیت یک مدل اغلب بیشتر به تنظیمات API وابسته است تا خودِ شبکه عصبی (Neural Network) — که شبیه نقشهای از مترو است و سیگنالها را از ورودی به جواب میرساند.
به نقل از مستندات OpenAI، این شرکت برای دستیابی به امتیاز ۳۸.۳ درصد، از دو قابلیت خاص در Responses API استفاده کرده است:
- استدلال حفظشده (Retained Reasoning): این ویژگی باعث میشود زنجیره تفکر (Chain-of-Thought) — که مثل وقتی است شاگرد ریاضی پای تخته بلندبلند فکر میکند تا به جواب برسد — بین چندین مرحله فعال بماند.
- فشردهسازی (Compaction): در این حالت، متون قدیمی بهجای حذف شدن، خلاصهسازی میشوند تا در پنجره متنی (Context Window) — که شبیه میز کاری است که فقط جای چند ورق دارد — جا شوند.

بدون این کمکهای فنی، نتایج بهشدت سقوط میکنند. بر اساس دادههای رسمی، در محیط استاندارد ARC-AGI-3 که استدلالها را پس از هر اقدام حذف میکند تا عملکرد خالص مدل سنجیده شود، GPT-5.6 Sol تنها ۷.۸ درصد امتیاز آورد. در مقابل، مدل Claude Opus 5 شرکت Anthropic در همین شرایط سخت، به امتیاز ۳۰.۲ درصد رسیده است؛ دستاوردی که پیشتر به عنوان رکوردی در استدلال ماشینی ثبت شد و برتری فنی این مدل را در محیطهای خالص نشان داد.
برای مدیران کسبوکار، این یعنی «برنده» مسابقه هوش مصنوعی اغلب نتیجه نحوه اندازهگیری است. فاصله بین ۷.۸ و ۳۸.۳ درصد را نباید جهشی در هوش دانست، بلکه این یک جهش در مدیریت حافظه است. این نشان میدهد که لولهکشیهای فنی میتوانند شکافهای واقعی استدلالی را بپوشانند.
گام بعدی شما
- در هنگام بررسی بنچمارکها، حتماً بررسی کنید که آیا مدل در محیط «خالص» (Pure) یا با کمک «سازوکارهای استدلالی» (Reasoning Harness) تست شده است.
- اگر از مدلهای استدلالی استفاده میکنید، قابلیتهای مدیریت حافظه و خلاصهسازی متن را در API خود فعال کنید.
- منتظر واکنش Anthropic بمانید؛ احتمالاً آنها نیز ابزارهای مشابهی برای Claude Code عرضه کنند.
اما داستان سختافزاری این تحولات حتی شگفتانگیزتر است — به تحلیل ما درباره تراشههای Blackwell مراجعه کنید.




گفتگو