پرش به محتوای اصلی
پرش به محتوای مقاله

بازار عامل‌محور: اولویت مدل‌های پیشرو از قدرت خام به هزینهٔ هر وظیفه

·۱۳ مهر ۱۴۰۵۶ دقیقه مطالعه
مقایسه مدل‌های هوش مصنوعی پیشرو: GPT-6 Astra، GPT-6.1 Sol، Gemini 4 Argon و Claude Fable 5.1
مقایسه مدل‌های هوش مصنوعی پیشرو: GPT-6 Astra، GPT-6.1 Sol، Gemini 4 Argon و Claude Fable 5.1
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر پارادایم رقابت از «افزایش نمره بنچمارک» به «کاهش هزینه هر وظیفه»؛ جایی که مدل‌های ارزان‌تر (Sol/Argon) اکنون عملکرد مدل‌های پرچم‌دار را در وظایف مهندسی با یک‌پنجم هزینه تکرار می‌کنند.

انتخاب مدل اشتباه در اکوسیستم جدید، می‌تواند بدون هیچ افزایشی در کیفیت خروجی، هزینه‌های شما را تا ۵ برابر افزایش دهد. در سپتامبر ۲۰۲۶، میدان نبرد از بنچمارک‌های تئوریک به اقتصاد توکن‌ها منتقل شد.

این نوسانات در حالی رخ می‌دهد که توسعه‌دهندگان برای توازن میان استقلال عامل‌ها و نرخ مصرف API در تکاپو هستند. همان‌طور که در تحلیل قبلی ما درباره‌ی ریسک‌های امنیتی ابزارهایی مثل Claude Code اشاره کردیم، صنعت اکنون به سمت حلقه‌های عامل‌محور با فرکانس بالا حرکت می‌کند؛ جایی که هزینهٔ ورودی‌های کش‌شده (Cached Input) — و نه قیمت‌های اسمی — تعیین‌کنندهٔ بقای یک محصول است.

آرایش جدید مدل‌های پیشرو

بین ۱ تا ۳۰ سپتامبر ۲۰۲۶، چهار مدل کلیدی وارد بازار شدند. ابتدا Claude Fable 5.1 در ۱ سپتامبر عرضه شد و پس از آن GPT-6 Astra در ۳ سپتامبر معرفی گردید. ماه سپتامبر با انتشار GPT-6.1 Sol در ۲۹ سپتامبر و معرفی Gemini 4 Argon در ۳۰ سپتامبر به پایان رسید؛ هرچند مدل آرگون در حال حاضر تنها برای اعضای برنامه Fairwind گوگل (مخصوص متخصصان دفاع سایبری) در دسترس است.

طبق گزارش‌های داخلی، استراتژی OpenAI در ۲۸ سپتامبر تغییر ناگهانی کرد و شرکت مدل GPT-6.1 Astra را به دلیل شکست در آزمون‌های محدوده و مجوزهای دسترسی لغو کرد. این تصمیم باعث شد Astra مدل سطح‌بالای اصلی باقی بماند و Sol نقش مدل بهینه و اقتصادی را ایفا کند.

اقتصاد توکن‌ها و ساختار قیمت‌گذاری

قیمت‌های اعلام‌شده نشان‌دهندهٔ تفکیک دقیق بازار است. GPT-6 Astra و Claude Fable 5.1 هر دو قیمت ۱۰ دلار برای هر ۱ میلیون توکن ورودی و ۵۰ دلار برای هر ۱ میلیون توکن خروجی دارند. در مقابل، GPT-6.1 Sol و Gemini 4 Argon با قیمتی معادل یک‌پنجم این مقدار (۲ دلار ورودی / ۱۰ دلار خروجی) عرضه شده‌اند؛ البته قیمت آرگون یک نرخ تشویقی است که در آینده به ۴ دلار ورودی و ۲۰ دلار خروجی افزایش می‌یابد.

قیمت‌گذاری برای پرامپت‌های طولانی، صورت‌حساب‌ها را پیچیده‌تر می‌کند. برای ورودی‌های بالای ۲۷۲ هزار توکن، قیمت Astra به ۲۰ دلار ورودی و ۷۵ دلار خروجی جهش می‌کند. مدل Sol برای همین آستانه، ضریب ۲ برابر برای ورودی و ۱.۵ برابر برای خروجی اعمال می‌کند، در حالی که Fable 5.1 تا ۱ میلیون توکن نرخ ثابت را حفظ می‌کند.

برای گردش‌کارهای عامل‌محور (Agentic)، نرخ ورودی کش‌شده حیاتی‌ترین معیار است. عامل‌ها به‌طور مکرر پرامپت‌های سیستمی و تاریخچه را ارسال می‌کنند و در اینجا شکاف قیمتی عظیم است:

  • GPT-6.1 Sol و Gemini 4 Argon: ۰.۱۰ دلار برای هر ۱ میلیون توکن کش‌شده.
  • Claude Fable 5.1: ۰.۲۵ دلار برای هر ۱ میلیون توکن کش‌شده.
  • GPT-6 Astra: ۱.۰۰ دلار برای هر ۱ میلیون توکن کش‌شده.

بر اساس تحلیل Marktechpost، در سناریویی با ۲۰۰ هزار توکن زمینهٔ کش‌شده، یک حلقهٔ ۱۰۰ مرحله‌ای برای یک عامل در Astra حدود ۲۰ دلار هزینه دارد، اما در Sol یا Argon این مبلغ تنها ۲ دلار است. Fable 5.1 با ۵ دلار در جایگاه میانی قرار می‌گیرد.

تخصص‌ها و عملکرد در محک‌ها

هیچ مدلی در تمام دسته‌ها برتری مطلق ندارد. به نقل از مقایسه‌های منتشرشده توسط Google DeepMind، مدل Gemini 4 Argon در کارهای دانشی و کدنویسی بلندمدت پیشتاز است و در محک DeepSWE v1.1 امتیاز ۷۷.۹٪ و در شاخص Vals برای امور مالی، حقوقی و مالیاتی امتیاز ۶۸.۹٪ را کسب کرده است.

GPT-6 Astra همچنان رهبر وظایف دشوار مهندسی نرم‌افزار و استفاده از کامپیوتر است. این مدل در FrontierSWE v2 با ۶۵.۵٪ و در OSWorld-2.0 با ۷۲.۶٪ پیشتاز است. OpenAI برای سخت‌ترین پژوهش‌های علمی، Astra را توصیه می‌کند و به امتیاز ۶۸.۱٪ آن در Terminal-Bench Science 0.1 استناد می‌کند.

Claude Fable 5.1 جایگاه منحصر‌به‌فردی دارد. اگرچه در برخی محک‌های سازنده عقب است، اما داده‌های مستقل Artificial Analysis آن را در شاخص هوش (Intelligence Index) با امتیاز ۶۶، پنج واحد بالاتر از Astra (امتیاز ۶۱) قرار می‌دهد. همچنین در شاخص عامل‌های کدنویسی در Claude Code با امتیاز ۷۰، از Astra (امتیاز ۶۷) پیشی گرفته است.

جزئیات معیارهای عملکرد

برای درک بهتر موازنه میان هزینه و کیفیت، این پیشتازی‌ها را بررسی کنید:

  • مهندسی نرم‌افزار: Argon در DeepSWE v1.1 (۷۷.۹٪) و Astra در FrontierSWE v2 (۶۵.۵٪) برنده است.
  • کار با ترمینال: Astra در Terminal-Bench 4.0 با ۵۸.۲٪ پیشتاز است، هرچند Claude Opus 5.5 (خارج از این لیست) با ۶۶.۴٪ همچنان برترین است.
  • رفع آسیب‌پذیری‌ها: Argon و Astra هر دو با ۶۸٪ در CWE-bench v1 برابر هستند و Fable 5.1 (۵۸٪) را شکست داده‌اند.
  • هوش عمومی: در ARC-AGI-2، مدل Astra امتیاز ۹۵٪ و Fable 5.1 امتیاز ۹۰٪ را کسب کرده‌اند.

پارادوکس هزینهٔ هر وظیفه

قیمت‌های اسمی اغلب صورت‌حساب واقعی را می‌پوشانند. طبق گزارش Artificial Analysis، هزینه هر وظیفه برای Claude Fable 5.1 حدود ۹.۱۸ دلار است، در حالی که برای GPT-6 Astra این رقم ۴.۷۲ دلار است؛ این در حالی است که قیمت‌های اسمی آن‌ها یکسان است. این تفاوت ناشی از حجم توکن‌هاست؛ Fable 5.1 توکن‌های بیشتری مصرف می‌کند، زیرا توکن‌ساز (Tokenizer) جدید آنتروپیک برای یک متن یکسان، حدود ۳۰٪ توکن بیشتری تولید می‌کند.

بهره‌وری در GPT-6.1 Sol مشهودتر است. OpenAI گزارش می‌دهد که در Terminal-Bench Science، هزینه هر وظیفه برای Sol حدود ۵.۴۷ دلار است، در حالی که برای Astra این رقم ۲۳.۸۰ دلار است. این موضوع Sol را به انتخاب پیش‌فرض برای بات‌های CI و عامل‌های بررسی PR تبدیل می‌کند، زیرا در DeepSWE v1.1 با یک‌پنجم هزینه، عملکردی مشابه Astra دارد.

استثناهای ساختاری و دسترسی

Gemini 4 Argon تنها مدل این گروه است که خروجی‌های عظیم را پشتیبانی می‌کند و سقف خروجی آن ۱ میلیون توکن در هر پاسخ است، در حالی که سایر مدل‌ها به ۱۲۸ هزار توکن محدود شده‌اند. با این حال، اندازه پنجرهٔ زمینه (Context Window) ورودی آرگون هنوز اعلام نشده است.

دسترسی همچنان یک مانع بزرگ است. آرگون پشت برنامه Fairwind برای مدافعان سایبری قفل شده است. به همین ترتیب، قابلیت‌های پیشرفته امنیت تهاجمی Astra تنها در برنامه Daybreak در دسترس است و نسخه عمومی از انجام وظایف سایبری تهاجمی خودداری می‌کند. آنتروپیک نیز دسترسی به مدل Claude Mythos 5.1 را محدود به برنامه‌های دسترسی مورد اعتماد کرده است.

راهنمای انتخاب مدل بر اساس حجم کاری

بسته به نوع پروژه، مدل بهینه تغییر می‌کند:

  • بات‌های کدنویسی با حجم بالا/CI: مدل GPT-6.1 Sol (بهترین نسبت قیمت به عملکرد).
  • مهندسی باز و دشوار: مدل GPT-6 Astra (پیشتاز FrontierSWE v2).
  • عامل‌های مرورگر: مدل GPT-6 Astra (پیشتاز OSWorld-2.0).
  • جلسات طولانی کدنویسی: مدل Claude Fable 5.1 (بالاترین امتیاز عامل کدنویسی).
  • اتوماسیون حقوقی/مالی: مدل Gemini 4 Argon (پیشتاز شاخص Vals).
  • بازنویسی‌های بزرگ/گزارش‌های جامع: مدل Gemini 4 Argon (خروجی ۱ میلیون توکن).
  • پژوهش‌های علمی سخت: مدل GPT-6 Astra (پیشتاز Terminal-Bench Science).

تحلیل فنی: چرخش به سمت بهره‌وری

این چرخهٔ انتشار سیگنالی است مبنی بر اینکه صنعت در دستیابی به هوش خام به یک سقف (Plateau) رسیده است. وقتی GPT-6.1 Sol با یک‌پنجم هزینه، عملکرد Astra را در DeepSWE v1.1 تکرار می‌کند، ارزش پیشنهادی از «آیا مدل می‌تواند این کار را انجام دهد؟» به «با چه هزینه‌ای می‌تواند این کار را در مقیاس بالا انجام دهد؟» تغییر می‌یابد.

برای مدیران فنی، نتیجه این است که رتبه‌های جدول‌های بنچمارک اکنون در اولویت دوم قرار دارند و تحلیل ردپای توکن‌ها (Trace Analysis) اهمیت یافته است. تفاوت عظیم در هزینه خواندن کش به این معناست که مدلی که در بنچمارک کمی «باهوش‌تر» است، برای یک عامل تولیدی که ساعتی صدها بار تکرار می‌شود، از نظر اقتصادی غیرقابل‌توجیه است.

ملاحظات نهایی پیش از تغییر مدل

بسیاری از اعداد گزارش‌شده توسط سازندگان هستند و تضاداتی وجود دارد. برای مثال، OpenAI امتیاز Astra در Terminal-Bench 4.0 را ۵۷.۹٪ اعلام کرده، اما جدول گوگل آن را ۵۸.۲٪ نشان می‌دهد. علاوه بر این، آنتروپیک بنچمارک‌های Fable 5.1 را با حفاظ‌های تولیدی فعال اجرا کرده است؛ وظایف سایبری و بیولوژیکی علامت‌گذاری شده به مدل‌های دیگر ارجاع داده شدند که احتمالاً نتایج OSWorld و AutomationBench را کاهش داده است.

منتظر انتشار عمومی Gemini 4 Argon و افزایش قیمت لایه تشویقی آن باشید، زیرا این اتفاق احتمالاً دور جدیدی از تعدیل قیمت‌ها توسط OpenAI و آنتروپیک را آغاز خواهد کرد.

گام بعدی شما

  • تحلیل هزینهٔ هر وظیفه (Cost-per-Task) را جایگزین بررسی صرفِ رتبه‌های بنچمارک کنید.
  • اگر از حلقه‌های تکرارشونده در عامل‌های خود استفاده می‌کنید، مدل‌های Sol یا Argon را برای کاهش هزینهٔ کش جایگزین کنید.
  • برای خروجی‌های بسیار طولانی (بالای ۱۲۸ هزار توکن)، دسترسی به Gemini 4 Argon را پیگیری کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تغییر رویکرد، استقرار عامل‌های هوش مصنوعی در مقیاس صنعتی را اقتصادی می‌کند و تخصص را از «مهندسی پرامپت» به «مهندسی هزینه» منتقل می‌کند. اعتبار این ادعا بر اساس داده‌های مقایسه‌ای سه شرکت پیشرو در صنعت است.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی توسعه‌دهندگان ایرانی به مدل‌های تخصصی مانند Argon محدود است و این شکاف قیمتی فعلاً اثر مستقیمی بر هزینه‌های استنتاج در بازار داخلی ندارد.

·نگاه ما
تحریریه دات‌هوش

دستیابی به سقف رشد هوش خام در مدل‌های پیشرو، رقابت را به سمت «بهینه‌سازی لایه استنتاج» سوق داده است. وقتی تفاوت عملکردی بین مدل‌های گران‌قیمت و ارزان‌قیمت در وظایف تخصصی به حداقل می‌رسد، برندهٔ نهایی کسی است که بتواند توکن‌های بیشتری را با کمترین هزینه در ثانیه جابه‌جا کند. این یعنی عصر «مدل‌های همه‌کاره» جای خود را به «مدل‌های تخصصیِ بهینه» می‌دهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.