پرش به محتوای اصلی
پرش به محتوای مقاله

شاخص CRI: امتیاز ۷۳.۶ برای Opus 5 در استدلال مفهومی

·۲۲ مرداد ۱۴۰۵۷ دقیقه مطالعه۳ بازدید
نمودار: مقایسه شاخص استدلال مفهومی با سایر شاخص‌های هوش وکسلر برای ارزیابی تفکر انتزاعی
نمودار: مقایسه شاخص استدلال مفهومی با سایر شاخص‌های هوش وکسلر برای ارزیابی تفکر انتزاعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی CRI به عنوان نخستین متریک وزنی که استدلال مفهومی را از توانایی‌های ریاضی/کدی جدا می‌کند و نشان می‌دهد که پیشرفت در نظریه تصمیم (DTBench) بسیار سریع‌تر از استدلال فلسفی (LMCA) رخ داده است.

امتیاز ۷۳.۶؛ این عددی است که مدل Opus 5 در یک معیار تخصصی جدید به دست آورده تا نشان دهد حتی توانمندترین مدل‌های امروز نیز در مواجهه با استدلال‌های انتزاعی فلسفی و ایمنی هوش مصنوعی به شدت دشوار می‌بینند. این شکاف ثابت می‌کند که در حالی که هوش مصنوعی در حل مسائل ریاضی و کدنویسی پیشرفت کرده، هنوز نمی‌تواند به‌طور قابل‌اعتمادی در محیط‌هایی که فاقد حلقه‌های بازخورد تجربی هستند، استدلال کند.

این چالش در زمانی رخ می‌دهد که صنعت به سمت استفاده از هوش مصنوعی برای کاهش ریسک‌های وجودی خودش حرکت می‌کند. بخش بزرگی از کارهای مربوط به ایمنی هوش مصنوعی مستلزم استدلال درباره سیستم‌هایی است که از هر انسانی توانمندترند؛ این بدان معناست که هیچ کلاس مرجع یا «حقیقت زمینی» (Ground Truth) برای آموزش مدل‌ها وجود ندارد. طبق گزارشی که در ۱۲ اوت ۲۰۲۶ توسط Anthropic و Redwood Research منتشر شد، توانایی خودکارسازی این کارهای مفهومی، تعیین‌کننده اصلی این است که آیا ما می‌توانیم به‌موقع با ریسک‌های هوش مصنوعی مقابله کنیم یا خیر.

زمینه استدلال مفهومی

آموزش مدل‌های فعلی به‌شدت به داده‌های انبوه و بازخوردهای قابل‌اتکا وابسته است. مدل‌ها معمولاً در کارهایی که به‌صورت تجربی یا ریاضی قابل تأیید نیستند، عملکرد ضعیف‌تری دارند. این موضوع برای ایمنی هوش مصنوعی چندین مشکل اساسی ایجاد می‌کند:

  • فقدان کلاس‌های مرجع: بسیاری از کارهای ایمنی شامل استدلال درباره هوش‌های مصنوعی است که از هر انسانی توانمندترند، که این امر مدل‌سازی بر اساس نمونه‌های موجود را غیرممکن می‌کند.
  • هزینه بالای خطا: در سناریوهایی مانند کودتای کمک‌گرفته از هوش مصنوعی یا تسلط AGI، یک اشتباه واحد ممکن است تا زمانی که دیگر برای مداخله دیر شده باشد، شناسایی نشود.
  • بازه زمانی طولانی: تصمیمات مربوط به مداخلات حاکمیتی یا اولویت‌های پژوهشی در بازه‌های زمانی چندساله اجرا می‌شوند؛ این یعنی بازخوردهای تجربی بسیار دیر می‌رسند تا مفید باشند.
  • نبود داده مرجع (Ground Truth): پرسش‌هایی درباره اینکه هوش مصنوعی باید چه ارزش‌هایی داشته باشد، پاسخ قطعی ندارند و پیشرفت در آن‌ها نیازمند استدلال است، نه تأیید.

ضرورت استدلال

به دلیل این عوامل، پژوهشگران بر نیاز به «استدلال مفهومی» تأکید می‌کنند؛ یعنی توانایی تحلیل پرسش‌هایی که شواهد تجربی در آن‌ها محدود است و باید به‌شدت به استدلال تکیه کرد. این مهارت حیاتی است زیرا بسیاری از وظایف مورد نیاز برای مدیریت ریسک‌های هوش مصنوعی، فاقد حلقه‌های بازخورد عملی هستند.

اگر مدل‌ها بتوانند کارهایی را که ریسک هوش مصنوعی را در سطح متخصصان انسانی کاهش می‌دهد انجام دهند، خروجی‌های حاصل از کمک هوش مصنوعی می‌تواند حجم کارهای انسانی بدون کمک AI را به‌شدت افزایش دهد. بنابراین، بهبود انتخابی مهارت‌هایی مثل استدلال درباره حاکمیت هوش مصنوعی، همراستاسازی (Alignment) و جلوگیری از شکست‌های فاجعه‌بار در همکاری، یک اولویت است.

برای کمی کردن این توانایی، پژوهشگران شاخص استدلال مفهومی (CRI) را توسعه دادند که مجموع وزنی از سه محک متمایز است. این شاخص به‌گونه‌ای طراحی شده است که توانایی تکیه بر استدلال را در شرایطی که شواهد تجربی محدود یا غیرموجود هستند، اندازه‌گیری کند. این رویکرد در کنار سایر معیارهای سنجش هوش، مانند معیارهای جدید ARC Prize برای سنجش هوش واقعی، تلاش می‌کند تا مرزهای استدلال مدل‌ها را دقیق‌تر ترسیم کند.

سه ستون CRI

  • LMCA (استدلال مفهومی مدل زبانی): این مجموعه داده شامل ۵۶۰ متن موضع‌گیرانه و ۱۴۶۱ استدلال رتبه‌بندی‌شده توسط متخصصان در حوزه‌های نظریه تصمیم، فلسفه و ریسک‌های هوش مصنوعی پیشرفته است. این محک می‌سنجد مدل تا چه حد می‌تواند کیفیت یک استدلال را در برابر یک موضع خاص بر اساس یک دستورالعمل (Rubric) دقیق قضاوت کند.
    • فرآیند رتبه‌بندی: تقریباً تمام استدلال‌ها (به جز ۱۶ مورد که توسط کاسپار اوسترهلد رتبه‌بندی شدند) توسط پژوهشگر مفهومی، امری کوپر، رتبه‌بندی شده‌اند و برخی توسط پژوهشگران دیگر به‌طور مستقل بررسی شده‌اند تا در مجموع ۲۱۴۰ رتبه به دست آید.
    • اعتبارسنجی: یک مجموعه اعتبارسنجی شامل تقریباً ۵۰ استدلال توسط ۴ تا ۶ نفر به‌طور مستقل رتبه‌بندی شد و مجموعاً ۷ تا ۸ ساعت مورد بحث قرار گرفت که نشان‌دهنده توافق بالای بین رتبه‌دهندگان انسانی در مقایسه با توافق بین انسان و مدل است.
    • توانایی استدلال: این محک اجازه می‌دهد توانایی مدل در تولید استدلال‌های جدید نیز سنجیده شود؛ به‌طوری که مدل A یک استدلال تولید می‌کند و مدل B آن را با استفاده از دستورالعمل و پرامپت‌های چند-نمونه‌ای (Few-shot) از استدلال‌های رتبه‌بندی‌شده موجود، ارزیابی می‌کند. این متدولوژی رتبه‌بندی‌های نسبتاً دقیقی را از مدل B استخراج می‌کند.

نمودار مفهومی شاخص استدلال مفهومی (CRI) و ارتباط آن با سایر شاخص‌های هوش وایکسلر

  • ACCoRD (ارزیابی سازگاری در حوزه‌های استدلال مفهومی): این محک سازگاری منطقی را می‌سنجد. از مدل‌ها خواسته می‌شود تخمین‌های احتمالی عددی یا ترتیب ترجیحات را در مسائل مفهومی ارائه دهند تا مشخص شود آیا با خودشان در تضاد هستند یا خیر.

    • مکانیزم: برای مثال، اگر یک نمونه از مدل احتمال P(A) را ارائه دهد و نمونه‌ای دیگر احتمال P(A&B) را بدهد، این محک بررسی می‌کند که آیا شرط P(A) ≥ P(A&B) برقرار است یا خیر.
    • مقیاس داده‌ها: این مجموعه شامل نزدیک به ۱۴,۰۰۰ محدودیت سازگاری تولیدشده توسط مدل در ۱۸ نوع مختلف از محدودیت‌ها است.
    • فیلتر کردن: پس از یک خط لوله بررسی خودکار، ۵۶۷ محدودیت به‌صورت دستی بررسی و برای گنجاندن در CRI تأیید شدند. فقدان سازگاری به عنوان نشانه‌ای از ضعف در استدلال مفهومی مدل تلقی می‌شود.
  • DTBench (محک نظریه تصمیم): مجموعه‌ای از ۴۰۷ پرسش چندگزینه‌ای دست‌ساز که بر موقعیت‌های نظریه تصمیم، به‌ویژه تعامل مدل با نسخه‌های مشابه یا نزدیک به خودش، تمرکز دارد.

    • تخصص: اکثریت پرسش‌ها توسط کاسپار اوسترهلد، که در زمینه نظریه تصمیم مقاله منتشر کرده است، طراحی و به‌طور مستقل توسط امری کوپر اعتبارسنجی شده‌اند.
    • دامنه: مجموعه کامل شامل ۱۳۰ پرسش اضافی برای اندازه‌گیری نگرش‌های نظریه تصمیم است، هرچند این موارد در مجموع کلی CRI لحاظ نشده‌اند.

نمودار مفهومی شاخص استدلال مفهومی (CRI) و ارتباط آن با سایر شاخص‌های هوش وکسلر.

عملکرد و بنچمارک‌ها

وزن‌دهی CRI در حال حاضر ۶۰٪ برای LMCA، ۲۰٪ برای ACCoRD و ۲۰٪ برای DTBench است. در ۱۰ اوت ۲۰۲۶، Opus 5 با امتیاز ۷۳.۶ (با فاصله اطمینان ۹۵٪: ± ۲.۱) به عنوان مدل برتر معرفی شد. این عدد به‌طور قابل‌توجهی کمتر از سقف تخمینی ۹۱ است. این برتری در استدلال مفهومی در کنار سایر موفقیت‌های این مدل است، چرا که Opus 5 پیش‌تر در بنچمارک‌های کدنویسی نیز از Fable 5 پیشی گرفته بود.

تمام مدل‌ها در حداکثر محدودیت توکن و سطح تلاش اجرا شدند. برای محاسبه امتیاز Claude Fable 5، تیم از Opus 5 به‌عنوان جایگزین (Fallback) در مواردی که Fable 5 از پاسخ دادن به یک سؤال امتناع کرد، استفاده کرد. امتیازها از ۰ (حدس تصادفی) تا ۱۰۰ (بالاترین امتیاز ممکن در تمام بنچمارک‌ها) متغیر است.

درک سقف امتیازدهی

سقف ۹۱ بر اساس ماهیت خاص بنچمارک‌ها محاسبه شده است:

  • سقف LMCA: به‌دلیل نویز در رتبه‌بندی‌های انسانی، تخمین زده می‌شود مدلی که دقیقاً قضاوت انسان را بازتولید کند، به‌جای ۱۰۰، امتیازی حدود ۸۵ می‌گیرد (بر اساس توافق بین رتبه‌دهندگان متخصص).
  • سقف DTBench: پاسخ درست به تمام سوالات منجر به امتیاز ۱۰۰ یا عددی بسیار نزدیک به آن می‌شود.
  • سقف ACCoRD: امتیاز ۱۰۰ به معنای سازگاری منطقی کامل است.

مدل‌های دیگری مانند Claude Fable 5، Muse Spark 1.2 و Gemini 3.6 Flash نیز ارزیابی شدند. در حالی که این مدل‌ها در بنچمارک‌های عمومی خارجی خوب عمل می‌کنند، در CRI عقب ماندند. نکته جالب این است که Fable 5 تقریباً بخش DTBench را اشباع کرد و به ۹۸٪ پاسخ‌های درست رسید؛ این نشان می‌دهد که قابلیت‌های نظریه تصمیم سریع‌تر از استدلال مفهومی کلی پیشرفت می‌کنند.

نمودار مفهومی شاخص استدلال مفهومی (CRI) و ارتباط آن با سایر شاخص‌های شناختی.

داده‌ها نشان می‌دهند امتیازات CRI از اواخر ۲۰۲۴ به‌صورت خطی افزایش یافته و هنوز نشانه‌ای از توقف رشد دیده نمی‌شود. با این حال، پژوهشگران اشاره کردند که GPT-4 داده‌های ناقصی برای ACCoRD ارائه داد و از پاسخ به ۱۸٪ موارد امتناع کرد.

شکاف استدلالی

این تفاوت در عملکرد، یک گلوگاه بحرانی در توسعه هوش مصنوعی را آشکار می‌کند. مدل‌ها در مسائل «تپه‌نوردی» (Hill-climbable) — کارهایی که پیشرفت در آن‌ها به‌راحتی توسط یک کامپایلر یا بررسی ریاضی تأیید می‌شود — فوق‌العاده قوی هستند. این با یافته‌های گزارش ریسک‌های پیشرو (Frontier Risk Report) در فوریه و مارس ۲۰۲۶ توسط METR همسو است که اشاره داشت عامل‌ها در کارهای غیرتپه‌نوردی، قضاوت و قابلیت اطمینان بسیار کمتری نسبت به متخصصان انسانی دارند.

اما آن‌ها در حوزه‌هایی که یک اشتباه می‌تواند فاجعه‌بار باشد و هیچ بازخوردی تا زمان وقوع حادثه وجود ندارد، شکست می‌خورند. تخمین زده می‌شود در حالی که DTBench در حال اشباع است، LMCA احتمالاً تا یک سال دیگر اشباع شود، اما زمان‌بندی اشباع ACCoRD نامشخص است.

برای جامعه فنی، این موضوع بحث بنچمارک‌ها را تغییر می‌دهد. این یعنی «هوش عمومی» را نمی‌توان تنها با کدنویسی یا ریاضی ادعا کرد؛ مرز بعدی، توانایی مشارکت در استدلال‌های مفهومی دقیق، سازگار و در سطح متخصص است.

اگر مدل‌ها نتوانند به سقف CRI برسند، هنوز نمی‌توان برای اولویت‌بندی مستقل برنامه‌های پژوهشی یا طراحی مداخلات حاکمیتی برای AGI به آن‌ها اعتماد کرد. تکیه بر متخصصان انسانی برای این وظایف مفهومی، همچنان یک وابستگی حیاتی است.

برای ردیابی امتیازات زنده و بررسی متدولوژی، پژوهشگران می‌توانند به وب‌سایت conceptualreasoning.ai مراجعه کنند یا از طریق فرم‌های رسمی درخواست دسترسی به مجموعه داده اصلی LMCA را بدهند.

چرا این موضوع مهم است؟

این شاخص با تکیه بر اعتبار پژوهشگران Redwood Research، نشان می‌دهد که هوش مصنوعی هنوز در سطح استراتژیک و مفهومی ناتوان است. این یعنی مدیریت ریسک‌های وجودی AI همچنان به‌طور کامل به انسان‌ها وابسته است و نمی‌توان نظارت بر مدل‌های فوق‌توانمند را به خود آن‌ها سپرد.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران مدل‌های بنیادی و متخصصان ایمنی هوش مصنوعی اهمیت دارد تا بازار مصرف ایران و اثر مستقیمی بر کاربران نهایی ندارد.

·نگاه ما
تحریریه دات‌هوش

تمرکز صنعت بر بنچمارک‌های کدنویسی و ریاضی، نوعی توهم پیشرفت ایجاد کرده است. در واقع، مدل‌ها در حال یادگیری «الگوهای موفقیت» در محیط‌های بسته هستند، نه یادگیری «تفکر». تا زمانی که مدل‌ها نتوانند در ACCoRD سازگاری منطقی پیدا کنند، هرگونه ادعای رسیدن به AGI صرفاً تکرار آماری داده‌های آموزشی است، نه استدلال واقعی.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.