پرش به محتوای اصلی
پرش به محتوای مقاله

شکاف ۳۴ درصدی در نمرات GPT-6 Astra؛ نقش کلیدی آداپتور در استدلال

·۱۹ شهریور ۱۴۰۵۴ دقیقه مطالعه۲ بازدید
آداپتور آسترا سنجش استدلال ARC-AGI-3 را به چالش کشید
آداپتور آسترا سنجش استدلال ARC-AGI-3 را به چالش کشید
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

افشای تأثیر حیاتی «وضعیت استدلال مبهم» در نمرات ARC-AGI-3؛ مشخص شد که تفاوت بین یک مدل متوسط و یک مدل تقریباً کامل، نه در وزن‌ها، بلکه در زیرساخت حفظ حافظه است.

تصور کنید ابزاری دارید که در شرایط آزمایشگاهی بی‌نقص عمل می‌کند، اما به محض خروج از محیط خاص خود، یک‌سوم توانایی‌هایش را از دست می‌دهد. این دقیقاً همان وضعیتی است که مدل GPT-6 Astra در مواجهه با یکی از سخت‌ترین محک‌های هوش مصنوعی تجربه کرده است.

طبق گزارش منتشر شده توسط ARC Prize در ۳ سپتامبر ۲۰۲۶، مدل Astra در حالی که از آداپتور (Adapter) اختصاصی OpenAI استفاده می‌کرد، به صحت خیره‌کننده ۹۹.۹٪ در بنچمارک ARC-AGI-3 رسید. اما نکته تکان‌دهنده اینجاست که در حالت استاندارد (Standard harness)، این عدد به ۶۲.۷٪ کاهش یافت. این شکاف ۳۴ امتیازی ثابت می‌کند که استدلال در Astra محصول معماری سیستم است، نه صرفاً نتیجه‌ی آموزش وزن‌های مدل. این دستاورد فنی باعث شد تا مدل GPT-6 Astra با همین امتیاز ۹۹.۹٪ در محک ARC-AGI-3 وارد Amazon Bedrock شود و در دسترس توسعه‌دهندگان قرار گیرد.

این تمایز از آن جهت حیاتی است که ARC-AGI-3 شامل بازی‌های نوبتی است که هیچ دفترچه راهنمایی ندارند. این تسک‌ها طراحی شده‌اند تا بسنجند آیا یک عامل (Agent) می‌تواند محیط جدید را کاوش کند، قوانین را استنباط نماید و برنامه‌ریزی کند. در حالی که انسان‌ها ۱۰۰٪ این تسک‌ها را حل می‌کنند، تفاوت فاحش در نمرات Astra نشان می‌دهد که «هوش» مدل به‌شدت به نحوه مدیریت حافظه بین درخواست‌ها وابسته است.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی حافظه عامل‌های هوش مصنوعی اشاره کردیم، حفظ وضعیت (State) بین مراحل استدلال، مرز بین یک مدل ساده و یک عامل واقعی است. این موضوع در قابلیت‌های جدید Codex نیز مشهود است، جایی که حافظه پایدار مانع از فراموشی محدودیت‌های پروژه شد و تداوم عملیاتی را بهبود بخشید. اگرچه نمره ۶۲.۷٪ همچنان جهشی بزرگ نسبت به مدل GPT-5.6 Sol (با نمره ۷.۸٪) محسوب می‌شود، اما عدد ۹۹.۹٪ که در فضای رسانه‌ای دست‌به‌دست شد، به دلیل تفاوت در زیرساخت حافظه، مقایسه‌ای گمراه‌کننده ایجاد کرده است.

بر اساس مستندات منتشر شده توسط ARC Prize، این دو پیکربندی با قوانین حافظه متفاوتی عمل می‌کنند:

  • حالت استاندارد (Standard Harness): یک رابط مشترک که در آن مدل باید خودش تصمیم بگیرد کدام یادداشت‌ها را به مرحله بعد ببرد. Astra در این حالت با حداکثر استدلال به نمره ۶۲.۷٪ رسید و هزینه اجرای آن ۲۶,۰۹۸ دلار بود.
  • آداپتور ارائه‌دهنده (Provider Adapter): پیاده‌سازی اختصاصی OpenAI که یک وضعیت استدلال مبهم (Opaque state) را حفظ کرده و گفتگوهای طولانی را فشرده می‌کند. این ساختار به مدل اجازه می‌دهد از کارهای قبلی خود مجدداً استفاده کند. Astra در اینجا به نمره ۹۹.۹٪ رسید و هزینه آن به ۱۸,۸۱۷ دلار کاهش یافت.
  • بدون استدلال (Reasoning None): جالب اینجاست که Astra حتی با خاموش کردن قابلیت استدلال در محیط آداپتور، همچنان نمره ۹۶.۷٪ را کسب کرد (با هزینه ۲۳,۴۵۷ دلار).

این داده‌ها نشان می‌دهند که «لوله‌کشی زمینه» (Context plumbing) یا همان توانایی بازاستفاده از کارهای قبلی، بسیار اثرگذارتر از خودِ تنظیمات استدلال مدل است. همچنین بهره‌وری عملیاتی به‌شدت تغییر کرد؛ اجراهای مبتنی بر آداپتور ۴۹٪ توکن کمتری مصرف کردند و حدود ۳.۶۶ برابر سریع‌تر از حالت استاندارد به نتیجه رسیدند. این موضوع یک اصل بنیادی در طراحی عامل‌محور را تایید می‌کند: تلاش مجدد از یک زمینه سرد (Cold start) در مقایسه با داشتن یک تخته‌سیاه فعال برای یادداشت‌ها، به‌شدت گران و کند است.

برای توسعه‌دهندگان، این بدان معناست که عدد ۹۹.۹٪ نمایشِ یک پشته (Stack) نرم‌افزاری خاص است، نه یک قابلیت قابل انتقال در وزن‌های مدل. اگر محیط اجرای شما وضعیت استدلال مبهم را در فراخوانی‌های ابزار حفظ نکند، باید انتظار عملکردی نزدیک به ۶۲.۷٪ و هزینه‌های بالاتر باشید. در همین راستا، OpenAI برای بهینه‌سازی تعامل با این مدل‌ها، با ممنوعیت «کلمات زائد» ترمز تردید در عامل‌های GPT-6 Astra را گرفت تا دقت پاسخ‌دهی افزایش یابد.

با وجود این نمرات بالا، ARC Prize و مایک نوب (Mike Knoop) از برچسب زدن عنوان AGI به این مدل خودداری کردند. آن‌ها اعلام کردند که اشباع کردن این تست خاص، دلیل کافی برای اثبات هوش مصنوعی عمومی نیست و شواهد لازم برای چنین ادعایی وجود ندارد.

این نتیجه، بحث‌های مربوط به بنچمارک‌ها را از «کدام مدل باهوش‌تر است» به «کدام معماری سیستم بهتر وضعیت را حفظ می‌کند» تغییر می‌دهد. این اتفاق نقطه کوری را در لیدربوردهای فعلی آشکار می‌کند که اغلب قوانین زمینه (Context rules) مورد استفاده برای دستیابی به یک نمره را نادیده می‌گیرند.

از این پس، ARC Prize هر دو نتیجه (استاندارد و آداپتور) را در لیدربورد درج می‌کند تا از مقایسه‌های نادرست جلوگیری شود. هر نموداری که تنها یک درصد بدون برچسب برای ARC-AGI-3 ارائه دهد، باید با تردید نگریسته شود.

گام بعدی شما

  • اگر از APIهای مدل‌های استدلالی استفاده می‌کنید، بررسی کنید که آیا سیستم شما وضعیت (State) را بین درخواست‌ها حفظ می‌کند یا هر بار با یک «راه‌اندازی سرد» مواجه می‌شوید.
  • در تحلیل بنچمارک‌ها، به‌جای تمرکز بر نمره نهایی، به «حالت اجرا» (Harness) و قوانین مدیریت توکن‌ها دقت کنید.
  • برای کاهش هزینه استنتاج، به‌جای افزایش قدرت استدلال مدل، روی مکانیزم‌های فشرده‌سازی زمینه (Context Compaction) سرمایه‌گذاری کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این خبر اعتبار بنچمارک‌های فعلی را به چالش می‌کشد و ثابت می‌کند که نمرات بالا بدون ذکر معماری سیستم، فاقد ارزش فنی هستند. تخصص در طراحی لایه‌های سازگارساز (Adapters) اکنون به اندازه آموزش مدل‌های بنیادی اهمیت یافته است.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت‌های هزینه API مواجه‌اند، این خبر نشان می‌دهد که بهینه‌سازی لایه مدیریت زمینه (Context) می‌تواند بدون نیاز به مدل‌های گران‌تر، عملکرد را به‌شدت بهبود بخشد.

·نگاه ما
تحریریه دات‌هوش

این یافته‌ها نشان می‌دهد که ما از عصر «مدل‌محوری» به عصر «سیستم‌محوری» در هوش مصنوعی وارد شده‌ایم. برتری Astra نه در لایه‌های عصبی، بلکه در لایه مدیریت حافظه است؛ این یعنی بهینه‌سازی زیرساخت‌های اطراف مدل (Scaffolding) می‌تواند اثرگذاری بیشتری نسبت به افزایش پارامترها داشته باشد. در واقع، هوش مصنوعی در حال تبدیل شدن به یک سیستم توزیع‌شده است که در آن مدل تنها موتور است و آداپتورها، سیستم انتقال قدرت.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.