پرش به محتوای اصلی
پرش به محتوای مقاله

Terminal-Bench-Science: نرخ موفقیت Claude Opus 5 در پژوهش‌های علمی ۳۰٪

·۶ شهریور ۱۴۰۵۷ دقیقه مطالعه۲ بازدید
پایگاه داده مقایسه عملکرد مدل‌های زبانی بزرگ در استخراج اطلاعات از مقالات علمی زیست‌پزشکی
پایگاه داده مقایسه عملکرد مدل‌های زبانی بزرگ در استخراج اطلاعات از مقالات علمی زیست‌پزشکی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی نخستین محک پویا و مستمر که در آن دانشمندان فعال، تکالیف را بر اساس گردش‌کارهای واقعی آزمایشگاهی تعریف می‌کنند، نه بر اساس سؤالات کتابی.

تصور کنید یک دستیار پژوهشی دارید که تمام کتاب‌های مرجع دنیا را خوانده، اما وقتی نوبت به اجرای یک آزمایش واقعی می‌رسد، در ۷۰٪ مواقع درمانده می‌شود. این دقیقاً وضعیتی است که پیشرفته‌ترین مدل‌های هوش مصنوعی امروز در مواجهه با علم واقعی تجربه می‌کنند.

طبق گزارشی که در ۲۸ اوت ۲۰۲۶ منتشر شد، مدل Claude Opus 5 تنها موفق به حل ۳۰٪ از تکالیف محک Terminal-Bench-Science 0.1 شده است. اگرچه این مدل در حال حاضر پیشروترین عامل (Agent) در حوزه علوم است، اما این عدد نشان می‌دهد فاصله میان استدلال‌های کتابخانه‌ای و رویه‌های عملی پژوهشی بسیار بیشتر از آن است که تصور می‌شد.

بسیاری از محک‌های فعلی بر پایه تمرینات استاندارد یا سؤالات کتابی هستند که مدل‌ها می‌توانند آن‌ها را حفظ کنند. این موضوع توهمی از توانمندی ایجاد می‌کند که به محض مواجهه با یک وظیفه پژوهشی واقعی، فرو می‌پاشد. برای حل این مشکل، پژوهشگران دانشگاه استنفورد (Stanford University) و تیم Terminal-Bench با متخصصان جهانی همکاری کردند تا سیستمی بسازند که در آن دانشمندان، و نه توسعه‌دهندگان مدل، معیار موفقیت را تعیین کنند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت و قابلیت اطمینان مدل‌های استدلالی اشاره کردیم، تکیه بر بنچمارک‌های ایستا منجر به «نشت داده» و نتایج گمراه‌کننده می‌شود. Terminal-Bench-Science با تبدیل شدن به یک محک پویا، سعی دارد این چرخه را بشکند.

چشم‌انداز عامل‌های علمی

هدف این پروژه توسعه عامل‌هایی است که به عنوان دستیاران پژوهشی واقعی عمل کنند. هدف نهایی این است که هوش مصنوعی بتواند گردش‌کارهای فنی و زمان‌بر را اجرا کند. این رویکرد در راستای تحقق اتوماسیون کامل چرخه پژوهش علمی است که در آن زیرساخت‌های هوش مصنوعی تمامی مراحل کشف علمی را مدیریت می‌کنند. با اتوماسیون این فرآیندها، دانشمندان می‌توانند زمان خود را بر بخش‌هایی از علم متمرکز کنند که قضاوت انسانی در آن‌ها حیاتی‌ترین نقش را دارد: تعریف سؤالات پژوهشی، شکل‌دهی به فرضیات، تفسیر و اعتبارسنجی نتایج و ارتباط یافته‌ها.

برای دستیابی به این هدف، سه شرط اساسی تعریف شده است: اول، وظایف باید از گردش‌کارهای واقعی علمی استخراج شوند، نه تمرینات آکادمیک. دوم، مدل باید شواهد قابل تأییدی (مانند مصنوعات عینی یا Concrete Artifacts) ارائه دهد. سوم، محک باید هم‌گام با پیشرفت مدل‌ها تکامل یابد تا به یک مقاله ایستا و منسوخ تبدیل نشود که با پیشرفت مدل‌ها رها شود.

Terminal-Bench-Science به عنوان یک محک مستمر طراحی شده است. برخلاف مقالات ایستایی که منتشر شده و سپس فراموش می‌شوند، این پلتفرم هم‌زمان با مدل‌های پیشرو تکامل می‌یابد. این ساختار یک حلقه بازخورد ایجاد می‌کند که در آن دانشمندان با اشباع شدن تکالیف موجود توسط مدل‌ها، گردش‌کارهای جدید و چالش‌برانگیزتری را اضافه می‌کنند تا اطمینان حاصل شود که این محک همواره معیاری معنادار برای پیشرفت باقی می‌ماند.

سخت‌گیری در انتخاب تکالیف

برای جلوگیری از راهکارهای پیش‌پاافتاده و نشت داده‌ها به مجموعه آموزش مدل‌ها، فرآیند ورود به این محک بسیار سخت‌گیرانه است و از یک خط لوله «پیشنهاد $\rightarrow$ ساخت $\rightarrow$ بررسی» پیروی می‌کند:

  • پیشنهادها: پژوهشگران گردش‌کارهای خود را از طریق گیت‌هاب و کانال #tb-science در دیسکورد ارسال می‌کنند. داوران هر ایده را بحث می‌کنند و تنها مواردی را تأیید می‌کنند که گردش‌کارهای علمی مستدل و ارزشمندی برای اندازه‌گیری باشند.
  • پیاده‌سازی: ایده‌های تأییدشده به درخواست‌های ادغام (Pull Requests) تبدیل می‌شوند. داوران تأیید می‌کنند که هر تکلیف به‌طور عینی قابل تأیید باشد، برای عامل‌های هوش مصنوعی واقعاً چالش‌برانگیز باشد و چیزی نباشد که سیستم‌های پیشرو فعلی به‌راحتی حل کنند.
  • تأیید نهایی: تکالیف تحت بررسی‌های موازی فنی و تخصصی قرار می‌گیرند. داوران تخصصی، اعتبار علمی و واقع‌گرایانه بودن را ارزیابی می‌کنند، در حالی که داوران فنی ساختار تکلیف را بررسی می‌کنند. در نهایت، یک «ارزیاب کیفیت» (Bar Raiser) پیش از ادغام نهایی، بررسی کیفیت را انجام می‌دهد.

سخت‌گیری در این فرآیند در اعداد مشهود است. از ۹۲۰ پیشنهاد اولیه، تنها ۴۶۴ مورد برای پیاده‌سازی تأیید شدند. از ۳۸۶ درخواست ادغام باز شده، تنها ۷۰ تکلیف به اندازه کافی دقیق و سخت‌گیرانه بودند تا وارد نسخه 0.1 شوند. این موضوع نشان‌دهنده دشواری ایجاد تکالیفی است که هم از نظر علمی جذاب باشند و هم برای ارزیابی دقیق، به‌اندازه کافی مشخص شده باشند. پیشرفت این فرآیند به‌طور عمومی در یک داشبورد تکالیف ردیابی می‌شود.

دامنه فنی نسخه 0.1

این نسخه شامل ۷۰ تکلیف در علوم زیستی، فیزیک، زمین، ریاضیات و مهندسی است. این‌ها پرس‌وجوهای ساده نیستند، بلکه گردش‌کارهای پیچیده‌ای هستند که طیف گسترده‌ای از مکانیسم‌های علمی را پوشش می‌دهند، از جمله:

  • داده و تحلیل: تحلیل داده‌های علمی، استنتاج (Inference) آماری و برازش مدل (Model Fitting).
  • محاسبات: شبیه‌سازی، بهینه‌سازی و یادگیری ماشین علمی (Scientific ML).
  • سیگنال و تصویر: بازسازی تصویر، پردازش سیگنال و کالیبراسیون حسگرها.
  • منطق صوری: اثبات قضایا و مسائل معکوس (Inverse Problems).
  • طبقه‌بندی: تکالیف پیچیده طبقه‌بندی علمی.

موازنه عملکرد و هزینه

نتایج ارزیابی مدل‌ها در پنج حوزه علمی، شکاف عمیقی را در توانمندی و هزینه نشان می‌دهد. برای هر مدل، سه تلاش مستقل برای هر یک از ۷۰ تکلیف اجرا شد:

  • Claude Opus 5 (با Claude Code) با نرخ موفقیت ۳۰.۰٪ پیشتاز است.
  • GPT-5.6 Sol (با Codex) با ۲۲.۴٪ در رتبه دوم قرار دارد.
  • Claude Fable 5 (با Claude Code) به ۲۱.۴٪ رسید.
  • Claude Opus 4.8 با ۱۰.۵٪ در میانه جدول است.
  • مدل‌های GPT-5.6 Terra، Kimi K3 و Grok 4.6 همگی زیر ۱۰٪ موفقیت داشتند.
  • GLM 5.3 قوی‌ترین مدل با وزن‌های باز (Open Weights) با ۸.۱٪ بود.
  • GPT-5.6 Luna با ۳.۳٪ در انتهای لیست قرار گرفت.

به نقل از مستندات پروژه، این محک نرخ موفقیت مدل‌ها را نسبت به Terminal-Bench 3.0 بیش از ۱۰ درصد کاهش داده است؛ زیرا تکالیف به‌طور خاص برای به چالش کشیدن مدل‌های پیشرو کالیبره شده‌اند.

علاوه بر دقت، هزینه موفقیت نیز ردیابی شده است. Claude Opus 5 برتری خود را با هزینه کل ۷,۰۰۰ دلار به دست آورد. در مقابل، GPT-5.6 Sol عملکردی مشابه Claude Fable 5 داشت اما هزینه‌ای کمتر از یک‌سوم آن پرداخت کرد (۴,۲۰۰ دلار در برابر ۱۴,۲۰۰ دلار).

از نظر بهره‌وری توکن، Claude Fable 5 با مصرف تقریباً ۲۵٪ توکن کمتر (۶.۴ میلیارد در برابر ۸.۴ میلیارد)، به نرخ موفقیت GPT-5.6 Sol رسید. در این میان، Kimi K3 در پایین‌ترین سطح مصرف توکن قرار دارد. تنها Kimi K3 و Claude Opus 5 توانستند هم‌زمان در مرز پارتو (Pareto frontier) «هزینه پایین» و «دقت بالا» قرار بگیرند.

نقاط قوت تخصصی

در حالی که مدل‌های آنتروپیک و OpenAI در اکثر دسته‌ها غالب هستند، علوم مهندسی یک استثنا بود. Grok 4.6 در مهندسی با نرخ ۱۴.۸٪ با GPT-5.6 Sol برابر شد و این را با هزینه و مصرف توکن کمتری نسبت به رقبای خود به دست آورد.

در علوم ریاضی، برتری از Opus 5 تغییر کرد. Claude Fable 5 (۳۳.۳٪) و GPT-5.6 Sol (۳۱.۴٪) دو جایگاه اول را گرفتند که نشان می‌دهد انتخاب‌های معماری خاص در این مدل‌ها برای اثبات‌های صوری و بهینه‌سازی ریاضی مناسب‌تر است. در تمام حوزه‌های دیگر، Claude Opus 5 هم از GPT-5.6 Sol و هم از Claude Fable 5 پیشی گرفته است.

زیرساخت ارزیابی

برای کاهش هزینه‌ها و افزایش بازتولیدپذیری، این محک از پلتفرم Harbor استفاده می‌کند. تکالیف نسخه‌بندی شده‌اند و می‌توان آن‌ها را با یک دستور ساده Harbor مجدداً اجرا، مجدداً نمره‌گذاری یا مجدداً استفاده کرد. این زیرساخت اجازه می‌دهد تکالیفی که توسط مدل‌ها «اشباع» شده‌اند یا بررسی‌ها نشان داده که تعریف ناقصی دارند، حذف و موارد جدید بدون تخریب داده‌های تاریخی جایگزین شوند.

این پروژه یک تلاش جمعی عظیم است که توسط دانشگاه استنفورد و مؤسسه Laude، با همکاری آزمایشگاه هوش مصنوعی استنفورد (SAIL)، مؤسسه استنفورد برای هوش مصنوعی انسان‌محور (HAI)، علم اندازه‌گیری هوش مصنوعی استنفورد (AIMS)، مؤسسه NSF برای مبانی یادگیری ماشین (IFML)، مؤسسه آلن و مؤسسه آلن برای هوش مصنوعی (Ai2) میزبانی می‌شود. همچنین حمایت‌های مالی و فنی توسط برنامه Slingshots، Snorkel AI، بنیاد متن‌باز 2077AI، UniPat AI و Modal صورت گرفته و اعتبارات API توسط Bespoke Labs، Anthropic، Google، Moonshot AI، SpaceXAI و Z.ai تأمین شده است.

کار روی نسخه 0.2 آغاز شده و مهلت ارسال درخواست‌های ادغام (Pull Request) ۵ اکتبر ۲۰۲۶ است. هدف این است که عامل‌های هوش مصنوعی از چت‌بات‌های ساده به دستیاران پژوهشی تبدیل شوند که قادر به اجرای گردش‌کارهای فنی و زمان‌بر باشند.

این تغییر رویکرد به دانشمندان انسان اجازه می‌دهد بر تکالیف با قضاوت بالا تمرکز کنند: تعریف سؤالات پژوهشی، شکل‌دهی به فرضیات و تفسیر نتایج، در حالی که هوش مصنوعی شبیه‌سازی، تحلیل داده‌ها و پردازش سیگنال را بر عهده می‌گیرد.

برای جامعه فنی، این محک این فرض را که نمرات بالای MMLU یا GSM8K به معنای کاربرد علمی است، تغییر می‌دهد. این نتایج ثابت می‌کند «توانمندی علمی» یک عدد واحد نیست، بلکه مجموعه‌ای از مصنوعات قابل تأیید (کد، اثبات و محصولات داده‌ای) است که باید در محیطی واقعی بازتولید شوند.

پژوهشگرانی که گردش‌کارهایی دارند که عامل‌های پیشرو فعلی قادر به حل آن‌ها نیستند، تشویق می‌شوند تا از طریق گیت‌هاب و دیسکورد پروژه مشارکت کنند تا به تعریف مرزهای بعدی علم هوش مصنوعی کمک نمایند.

گام بعدی شما

  • اگر پژوهشگر هستید، گردش‌کارهای خود را در گیت‌هاب پروژه ثبت کنید تا مرزهای توانمندی مدل‌ها تعریف شود.
  • در انتخاب مدل برای کارهای ریاضی، به جای Opus 5، مدل‌های Fable 5 یا GPT-5.6 Sol را آزمایش کنید.
  • برای کاهش هزینه‌های استنتاج در مقیاس بالا، موازنه بین نرخ موفقیت و هزینه (Pareto frontier) را در گزارش‌های Harbor بررسی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این محک با تکیه بر اعتبار متخصصان استنفورد، استاندارد ارزیابی هوش مصنوعی را از «پاسخ درست» به «تولید مصنوعات علمی قابل تأیید» تغییر می‌دهد. این تغییر باعث می‌شود شرکت‌ها به جای رقابت بر سر نمرات بنچمارک‌های تئوریک، بر روی کاربردی کردن عامل‌ها در صنایع استراتژیک تمرکز کنند.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران مدل‌های بنیادی و دانشجویان دکتری علوم محاسباتی در ایران اهمیت دارد تا بازار مصرف؛ چرا که معیاری واقعی برای سنجش توانایی مدل‌های بازمتن در کارهای پژوهشی ارائه می‌دهد.

·نگاه ما
تحریریه دات‌هوش

این نتایج نشان می‌دهد که ما در حال برخورد با یک «سقف استدلالی» در مدل‌های فعلی هستیم؛ جایی که افزایش اندازه مدل یا داده‌های آموزشی دیگر به تنهایی منجر به حل مسائل پیچیده دنیای واقعی نمی‌شود. برای عبور از این نقطه، احتمالاً نیاز به تغییر معماری از مدل‌های پیش‌بینی توکن به سمت سیستم‌هایی داریم که به‌طور ذاتی قابلیت برنامه‌ریزی سلسله‌مراتبی و خود-اصلاحی در محیط‌های خارجی را دارند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.