پرش به محتوای اصلی
پرش به محتوای مقاله

آیا رکورد جدید GPT-5.6 در ARC-AGI-3 معیار استانداردی است؟

·۸ مرداد ۱۴۰۵۱ دقیقه مطالعه۵ بازدید
پرچم‌دار جدید هوش مصنوعی OpenAI در رقابت با رقیب Anthropic تحت مقررات دولتی ناپایدار راه‌اندازی شد
پرچم‌دار جدید هوش مصنوعی OpenAI در رقابت با رقیب Anthropic تحت مقررات دولتی ناپایدار راه‌اندازی شد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

افشای این واقعیت که برتری GPT-5.6 Sol نه در معماری مدل، بلکه در یک «سازوکار استدلالی سفارشی» (Custom Harness) نهفته است که نتایج را بیش از ۴ برابر تغییر می‌دهد.

وقتی برای انتخاب ابزار هوش مصنوعی خود به جدول‌های رده‌بندی تکیه می‌کنید، احتمالاً با حقیقتی تحریف‌شده روبه‌رو هستید. امتیاز ۳۸.۳ درصد؛ این عددی است که GPT-5.6 Sol در محک (Benchmark) منطقی ARC-AGI-3 کسب کرده تا خود را برتر از رقبای نزدیک نشان دهد.

اما طبق گزارش ۳۰ جولای ۲۰۲۶ از وب‌سایت the-decoder.com، این برتری به یک تغییر اساسی در قوانین بازی وابسته است. OpenAI برای رسیدن به این نتیجه، محیط آزمون رسمی را کنار گذاشت و از یک سازوکاره فنی اختصاصی استفاده کرد. این اتفاق نشان می‌دهد که فاصله بین هوش خام مدل و «پوسته‌های» اجرایی آن در حال افزایش است. همان‌طور که در تحلیل قبلی ما درباره‌ی شکست بات‌های آماده در آزمون‌های بازیابی پیچیده اشاره کردیم، موفقیت یک مدل اغلب بیشتر به تنظیمات API وابسته است تا خودِ شبکه عصبی (Neural Network) — که شبیه نقشه‌ای از مترو است و سیگنال‌ها را از ورودی به جواب می‌رساند.

به نقل از مستندات OpenAI، این شرکت برای دستیابی به امتیاز ۳۸.۳ درصد، از دو قابلیت خاص در Responses API استفاده کرده است:

  • استدلال حفظ‌شده (Retained Reasoning): این ویژگی باعث می‌شود زنجیره تفکر (Chain-of-Thought) — که مثل وقتی است شاگرد ریاضی پای تخته بلندبلند فکر می‌کند تا به جواب برسد — بین چندین مرحله فعال بماند.
  • فشرده‌سازی (Compaction): در این حالت، متون قدیمی به‌جای حذف شدن، خلاصه‌سازی می‌شوند تا در پنجره متنی (Context Window) — که شبیه میز کاری است که فقط جای چند ورق دارد — جا شوند.

ادعای OpenAI: GPT-5.6 Sol با ابزار تست اختصاصی از Opus 5 در ARC-AGI-3 پیشی گرفت

بدون این کمک‌های فنی، نتایج به‌شدت سقوط می‌کنند. بر اساس داده‌های رسمی، در محیط استاندارد ARC-AGI-3 که استدلال‌ها را پس از هر اقدام حذف می‌کند تا عملکرد خالص مدل سنجیده شود، GPT-5.6 Sol تنها ۷.۸ درصد امتیاز آورد. در مقابل، مدل Claude Opus 5 شرکت Anthropic در همین شرایط سخت، به امتیاز ۳۰.۲ درصد رسیده است؛ دستاوردی که پیش‌تر به عنوان رکوردی در استدلال ماشینی ثبت شد و برتری فنی این مدل را در محیط‌های خالص نشان داد.

برای مدیران کسب‌وکار، این یعنی «برنده» مسابقه هوش مصنوعی اغلب نتیجه نحوه اندازه‌گیری است. فاصله بین ۷.۸ و ۳۸.۳ درصد را نباید جهشی در هوش دانست، بلکه این یک جهش در مدیریت حافظه است. این نشان می‌دهد که لوله‌کشی‌های فنی می‌توانند شکاف‌های واقعی استدلالی را بپوشانند.

گام بعدی شما

  • در هنگام بررسی بنچمارک‌ها، حتماً بررسی کنید که آیا مدل در محیط «خالص» (Pure) یا با کمک «سازوکارهای استدلالی» (Reasoning Harness) تست شده است.
  • اگر از مدل‌های استدلالی استفاده می‌کنید، قابلیت‌های مدیریت حافظه و خلاصه‌سازی متن را در API خود فعال کنید.
  • منتظر واکنش Anthropic بمانید؛ احتمالاً آن‌ها نیز ابزارهای مشابهی برای Claude Code عرضه کنند.

اما داستان سخت‌افزاری این تحولات حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این گزارش اعتبار بنچمارک‌های فعلی را به دلیل دخالت سازوکارهای خارجی زیر سؤال می‌برد. تخصص در طراحی API حالا به اندازه معماری مدل در تعیین برنده بازار اهمیت دارد.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و دسترسی‌های خاص OpenAI، توسعه‌دهندگان ایرانی باید بیشتر بر مدل‌های بازمتن تمرکز کنند که کنترل کامل روی محیط استنتاج آن‌ها وجود دارد.

·نگاه ما
تحریریه دات‌هوش

تأکید OpenAI بر محیط‌های سفارشی نشان می‌دهد که مدل‌های زبانی بزرگ به سقف یادگیری از داده‌های متنی رسیده‌اند و حالا برای پیشرفت، به جای آموزش بیشتر، بر «طراحی جریان کار» (Workflow Design) تمرکز کرده‌اند. این یک چرخش از هوش ذاتی به هوش سیستمی است؛ یعنی مدل به‌تنهایی باهوش‌تر نشده، بلکه ابزارهای اطرافش یاد گرفته‌اند چطور از او جواب‌های بهتری بگیرند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.