پرش به محتوای اصلی
پرش به محتوای مقاله

Claude Opus 5 با کسب امتیاز ۳۰.۲٪ رکورد جدیدی در استدلال ماشینی ثبت کرد

·۴ مرداد ۱۴۰۵۳ دقیقه مطالعه۱ بازدید
آنتروپیک اوپوس ۵ از فبل ۵ و جی‌پی‌تی-۵.۶ سول در معیار سنجش هوش واقعی پیشی گرفت
آنتروپیک اوپوس ۵ از فبل ۵ و جی‌پی‌تی-۵.۶ سول در معیار سنجش هوش واقعی پیشی گرفت
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

قابلیت فرمول‌بندی مستقل معادلات جبری برای حل پازل‌های ناشناخته؛ این نخستین بار است که یک مدل زبانی به‌جای حدس زدن جواب، ابزار ریاضی برای رسیدن به آن را در لحظه خلق می‌کند.

تصور کنید ابزاری دارید که نه با تکرار خاطرات، بلکه با تفکر خالص، مسئله‌ای را حل می‌کند که هرگز در کتاب‌های آموزشی‌اش ندیده است. اگر امروز از مدل‌های زبانی برای حل مسائل پیچیده استفاده می‌کنید، باید بدانید که مرز بین «تکرار الگو» و «تفکر واقعی» در حال فروپاشی است.

به گزارش ARC Prize، مدل Claude Opus 5 در تاریخ ۲۶ ژوئیه ۲۰۲۶ با کسب امتیاز ۳۰.۲ درصدی در محک ARC-AGI-3، رکورد قبلی GPT-5.6 Sol (Max) را که تنها ۷.۸ درصد بود، تقریباً چهار برابر کرد. این جهش، استانداردهای طلایی هوش ماشینی را بازتعریف کرده و نقطه عطف جدیدی در مسیر رسیدن به هوش مصنوعی عمومی (AGI) است. این پیشرفت در توانمندسازی مدل، در کنار دستاوردهای امنیتی اخیر این شرکت که در گزارش مربوط به کاهش نرخ موفقیت حملات تزریقی در مدل‌های Anthropic بررسی شد، جایگاه این شرکت را در رقابت AGI تثبیت می‌کند.

بسیاری از مدل‌های فعلی، مانند یک دانش‌آموزی هستند که تمام کتاب‌ها را حفظ کرده اما در مواجهه با یک مسئله‌ی جدید که در کتاب نبوده، درمانده می‌شوند. اما ARC-AGI-3 — که شبیه به یک بازی منطقی است و مدل را مجبور می‌کند قوانین را در لحظه کشف کرده و اقدامات خود را گام‌به‌گام برنامه‌ریزی کند — دقیقاً همین نقطه ضعف را هدف قرار می‌دهد. همان‌طور که در تحلیل قبلی ما درباره‌ی چالش‌های مدل‌های استدلالی و نقاط ضعف ابزارهایی مانند ChatGPT در آموزش اشاره کردیم، این تغییر رویکرد نشان‌دهنده گذار از تطبیق ساده‌ی الگوها به سمت استدلال شناختی واقعی است.

در این محک، مدل‌های هوش مصنوعی زاینده (Generative AI) — مانند کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — باید بدون تکیه بر داده‌های آموزش‌دیده و از طریق استنباط قوانین در لحظه، مسائل را حل کنند. بر اساس مستندات رسمی، امتیازات ثبت‌شده تنها مربوط به عملکرد خالص مدل زبانی است. در حالی که برخی سیستم‌ها ممکن است با استفاده از یک «هارنس» (نرم‌افزارهای کمکی خارجی) موفق به عبور شوند، ARC Prize استدلال می‌کند که سیستم‌های AGI آینده باید بتوانند وظایف جدید را بدون چنین کمک‌های خارجی حل کنند. شایان ذکر است که اگر Opus 5 در محیط Claude Code ادغام شود، احتمالاً امتیازات حتی بالاتری کسب خواهد کرد.

ماهیت محک ARC-AGI-3

برخلاف بنچمارک‌های قدیمی، ARC-AGI-3 اندازه‌گیری می‌کند که یک مدل تا چه حد در حل وظایفی موفق است که در طول مرحله پیش‌آموزش با آن‌ها مواجه نشده است؛ وظایفی که انسان‌ها معمولاً با سهولت حل می‌کنند. تمرکز اصلی این بنچمارک بر استدلال عمومی است و نه بازیابی دانش ذخیره‌شده در حافظه.

دستاوردهای فنی و معیارهای عملکرد

پیشتازی Opus 5 مدیون توانایی جدید آن در مدیریت محیط‌های ناشناخته است. طبق اعلام تحلیلگران، این موفقیت حاصل تقویت استدلال منطقی است که اجازه می‌دهد مدل به‌صورت خودگردان در محیط‌های ناآشنا به اکتشاف، برنامه‌ریزی و اجرا بپردازد. دستاوردهای کلیدی عبارتاند از:

  • اجرای خودگردان: مدل توانست ۵ محیطی را که پیش‌تر هرگز حل نشده بودند، حل کند؛ در ۴ مورد از این‌ها، عملکرد مدل با سطح انسانی برابری کرد یا از آن فراتر رفت. این دستاورد، مدل مذکور را حتی از مدل‌های کلاس «Fable» خودِ شرکت Anthropic که به امتیاز حدود ۲۰ درصد رسیدند، پیشتاز می‌کند. در این راستا، تحلیل‌های متعددی بر برتری مدل‌های کوچک‌تر در مدیریت ابزارها و ردیابی وضعیت متمرکز شده‌اند که نشان می‌دهد معماری مدل در کنار اندازه، نقش کلیدی در توانمندی‌های عامل‌محور دارد.
  • نوآوری ریاضی: پژوهشگران مشاهده کردند که مدل برای نخستین بار، وظایف را به نمادهای جبری تبدیل کرده و معادلات بازتابی (Reflection Equations) را به‌طور مستقل طراحی می‌کند.
  • نتایج مدل‌های قدیمی: در نسخه‌های ARC-AGI-1 و ARC-AGI-2، مدل به ترتیب به ۹۷.۵٪ و ۹۰.۴٪ رسید که با رکوردهای قبلی برابری می‌کند، هرچند هزینه استنتاج (Inference) — همان لحظه پردازش و تولید جواب — کمی بیشتر شده است.
  • دسترسی عمومی: ۶ محیط از ۲۵ محیط دموی عمومی اکنون حل شده‌اند و تمامی بازپخش‌ها (Replays) و کدهای مربوط به بنچمارک به‌صورت عمومی در دسترس قرار گرفته‌اند.

«اوپوس ۵ انسان‌نما از فابل ۵ و جی‌پی‌تی-۵.۶ سول در معیار سنجش هوش واقعی پیشی گرفت»

سایر گزارش‌ها نیز بر سلطه گسترده این مدل تأکید دارند. بر اساس گزارش Artificial Analysis Intelligence Index، مدل Opus 5 در ۹ آزمون مختلف شامل کدنویسی، استدلال علمی و دقت واقعی (Factual Accuracy)، امتیاز ۶۱ را کسب کرد. این عدد او را بالاتر از Claude Fable 5 (امتیاز ۶۰) و GPT-5.6 Sol (امتیاز ۵۹) قرار می‌دهد، در حالی که نکته قابل توجه این است که هزینه اجرای آن کمتر از مدل‌های کلاس Fable است.

تحلیل جهش استدلالی

با این حال، برخی متخصصان در مورد جامعیت این پیشرفت‌ها تردید دارند. گوانگهان نینگ، سازنده محک خصوصی Witness، دریافت که عملکرد Opus 5 در این محیط متواضع‌تر (امتیاز ۴۳.۴) است و از نظر آماری با Kimi K3 و Fable 5 برابر شده است.

به باور نینگ، بهبود Opus 5 نسبت به نسخه ۴.۸ در محیط Witness بسیار کمتر از ARC-AGI-3 بود. او به طور مشخص اشاره کرد که اگرچه مدل توانست قوانین پنهان در یک پازل متداول را پیش از اقدام شناسایی کند، اما در بازی‌هایی با مکانیسم‌های کمتر آشنا، از Opus 4.8 عقب افتاد. این موضوع احتمال را مطرح می‌کند که مدل ممکن است روی داده‌های خاصِ این ژانر آموزش دیده باشد. در واقع، این نگرانی با بحث‌های گسترده‌تری درباره پدیده Reward Hacking و تورم مصنوعی نمرات در بنچ‌مارک‌ها همسو است که هشدار می‌دهند مدل‌ها گاهی به جای یادگیری واقعی، روش‌های میانبر برای کسب امتیاز را می‌یابند.

آموزش و تعمیم‌پذیری

اگرچه Anthropic جزئیات فنی این پیشرفت‌ها را فاش نکرده، اما تحلیلگران دو عامل احتمالی را برجسته می‌کنند:

۱. برچسب‌گذاری هدفمند: احتمال دارد تحلیلگران انسانی، مسیرهای استدلال، تلاش‌های شکست‌خورده، گام‌های بازیابی و اقدامات مفید در پازل‌های مشابه را برچسب‌گذاری کرده باشند.
۲. یادگیری تقویتی: استفاده از RL برای پاداش دادن به کشف قوانین، خوداصلاح‌گری و برنامه‌ریزی دقیق.

گرگ کامرادت، پژوهشگر ARC-AGI-3، معتقد است این نتایج همچنان نشان‌دهنده پیشرفت در تعمیم‌پذیری است. او استدلال می‌کند که چون Witness بر اساس پازل‌های سبک ARC-AGI-3 طراحی شده، عملکرد در آنجا می‌تواند بازتابی از انتقال واقعی دانش باشد. نینگ بعدها تصریح کرد که Opus 5 واقعاً به Witness تعمیم یافته است، هرچند این تعمیم کمتر از ARC-AGI-3 بود. او این روند را با تکامل بنچمارک‌های کدنویسی مقایسه می‌کند که از تست‌های اشباع‌شده‌ای مثل HumanEval به سمت «عوامل کدنویسی» (Coding Agents) پیچیده حرکت کردند.

برای مدیران کسب‌وکار و توسعه‌دهندگان، این یعنی فاصله بین «دانستن» (بازیابی داده) و «فکر کردن» (حل مسئله جدید) در حال بسته شدن است. به‌زودی با عامل‌هایی مواجه می‌شویم که می‌توانند با منطق تجاری سفارشی شما و محیط‌های نرم‌افزاری ناشناخته سازگار شوند، بدون اینکه نیاز باشد انسان برای هر مورد خاص (Edge Case)، یک پرامپت مفصل بنویسد.

به منظور بررسی اینکه آیا این توانایی استدلالی به جریان کاری شما نیز منتقل می‌شود، سعی کنید مدل را با یک پازل منطقی پیچیده به چالش بکشید که نیازمند کشف گام‌به‌گام قوانین پیش از ارائه پاسخ نهایی باشد.

گام بعدی شما

  • برای سنجش قدرت تفکر مدل، یک پازل منطقی پیچیده طراحی کنید که پاسخ آن مستقیماً در وب نباشد و مدل را مجبور کنید ابتدا قوانین را استخراج کرده و سپس جواب دهد.
  • اگر در حال توسعه عامل‌های خودگردان هستید، قابلیت‌های جدید Opus 5 در برنامه‌ریزی محیط‌های ناشناخته را با مدل‌های قبلی مقایسه کنید.
  • نتایج مدل‌های وزن‌باز در مواجهه با این بنچمارک را دنبال کنید تا بفهمید آیا این جهش استدلالی مختص مدل‌های بسته است یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است؛ به تحلیل ما درباره تأثیر تراشه‌های نسل جدید بر هزینه استنتاج مراجعه کنید.

چرا این موضوع مهم است؟

این رکورد با تکیه بر اعتبار ARC Prize، ثابت می‌کند که مدل‌های زبانی می‌توانند فراتر از حافظه عمل کنند و استدلال انتزاعی انجام دهند. این تحول، مسیر توسعه عامل‌های خودگردان را که قادر به حل مسائل پیش‌بینی‌نشده در محیط‌های تجاری هستند، هموار می‌کند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی توسعه‌دهندگان ایرانی به نسخه‌های پیشرفته Opus 5 محدود است؛ اما نتایج این مدل برای پژوهشگران داخلی در حوزه مدل‌های استدلالی و تعمیم‌پذیری بسیار ارزشمند است.

·نگاه ما
تحریریه دات‌هوش

این جهش در ARC-AGGI-3 نشان می‌دهد که ما از عصر «پیش‌بینی توکن بعدی» به عصر «جست‌وجوی فضای حل» حرکت کرده‌ایم. موفقیت Opus 5 در طراحی مستقل معادلات جبری، احتمالاً به معنای ادغام عمیق‌تر مدل‌های نمادین (Symbolic) و شبکه‌های عصبی در یک معماری واحد است. این تغییر پارادایم، جایگاه مهندسی پرامپت را از مدیریت متن به مدیریت استراتژی‌های حل مسئله تغییر می‌دهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.