پرش به محتوای اصلی
پرش به محتوای مقاله

GPT-6.1 Sol در برابر Claude Sonnet 5.5 در نبرد هزینه هر وظیفه

·۸ مهر ۱۴۰۵۹ دقیقه مطالعه
مقایسه دو مدل هوش مصنوعی رقیب با قیمت یکسان و عدم وجود معیار ارزیابی مشترک
مقایسه دو مدل هوش مصنوعی رقیب با قیمت یکسان و عدم وجود معیار ارزیابی مشترک
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی مفهوم «هزینه به‌ازای هر وظیفه» به‌جای قیمت توکن؛ مدل‌ها قیمت پایه یکسانی دارند اما تفاوت در نرخ مصرف توکن برای رسیدن به پاسخ صحیح، هزینه نهایی را تغییر می‌دهد.

اگر امروز برای استنتاج مدل‌های سطح متوسط هزینه می‌پردازید، باید بدانید که قیمت هر توکن دیگر معیار تعیین‌کننده نیست. رقابت جدید بین دو مدل، بر سر این است که کدام‌یک با مصرف توکن کمتر، جواب درست را تحویل می‌دهد. قیمت ۲ دلار به‌ازای هر میلیون توکن ورودی اکنون به کف قیمتی این صنعت برای مدل‌های سطح متوسط رده‌بالا تبدیل شده است. این استاندارد قیمتی، صحنه را برای رویارویی Claude Sonnet 5.5 (منتشر شده در ۲۸ سپتامبر ۲۰۲۶) و GPT-6.1 Sol (منتشر شده در ۲۹ سپتامبر ۲۰۲۶) آماده کرد که تنها یک روز پس از یکدیگر عرضه شدند.

این عرضه همزمان، یک بن‌بست قیمتی ایجاد کرده است؛ جایی که برنده را نه قیمت روی برچسب، بلکه میزان توکنی که مدل برای حل یک مسئله خاص مصرف می‌کند، تعیین می‌کند. برای توسعه‌دهندگان، تمرکز از نرخ‌های ساده API به هزینه واقعی یک «وظیفه موفق» تغییر یافته است. همان‌طور که در تحلیل قبلی ما درباره‌ی تبدیل ChatGPT به یک فروشگاه اپلیکیشن برای میلیاردها کاربر اشاره کردیم، عرضه GPT-6.1 Sol تلاشی برای آوردن اتوماسیون در سطح حرفه‌ای با قیمتی بسیار کمتر از مدل‌های پرچمداری مثل GPT-6 Astra است. این رقابت را شبیه دو پیمانکار تصور کنید که هر دو ساعت کاری یکسانی دارند، اما یکی کار را در دو ساعت و دیگری در پنج ساعت تمام می‌کند. این دقیقاً وضعیت فعلی رقابت Sol در برابر Sonnet است.

بن‌بست قیمتی

هر دو مدل قیمت پایه ۲ دلار برای ورودی و ۱۰ دلار برای خروجی (به‌ازای هر میلیون توکن) دارند. اما هزینه‌های پنهان در بخش حافظه موقت یا KV Cache — که شبیه یادداشت‌های سریع مدل برای جلوگیری از خواندن مجدد متن‌های طولانی است — ظاهر می‌شود.

  • خواندن از حافظه (Cache Reads): مدل GPT-6.1 Sol با ۰.۱۰ دلار به‌ازای هر میلیون توکن، ارزان‌تر از Sonnet 5.5 است که ۰.۲۰ دلار دریافت می‌کند.
  • نوشتن در حافظه (Cache Writes): هر دو مدل ۲.۵۰ دلار به‌ازای هر میلیون توکن می‌گیرند، اما Sonnet 5.5 یک گزینه گران‌تر ۴ دلاری برای حافظه یک‌ساعته ارائه می‌دهد (در حالی که نرخ ۲.۵۰ دلاری در مدل اوپن‌ای‌آی برای پنجره‌ای ۵ دقیقه‌ای است).
  • پردازش دسته‌ای (Batch Processing): هر دو مدل تخفیفی ۵۰ درصدی ارائه می‌دهند که قیمت را به ۱ دلار برای ورودی و ۵ دلار برای خروجی به‌ازای هر میلیون توکن کاهش می‌دهد.

مقایسه GPT-6.1 Sol و Claude Sonnet 5.5: قیمت یکسان، عرضه با یک روز فاصله، بدون بنچمارک مشترک

مشخصات فنی و دسترسی

فراتر از قیمت، این مدل‌ها در محدودیت‌های معماری و نحوه دسترسی با هم تفاوت دارند. GPT-6.1 Sol (با شناسه مدل gpt-6.1-sol) دارای پنجره متنی (Context Window) به اندازه ۱,۰۵۰,۰۰۰ توکن است، در حالی که حداکثر ورودی مجاز آن ۹۲۲,۰۰۰ توکن است. حداکثر خروجی این مدل ۱۲۸,۰۰۰ توکن است و تاریخ قطع دانش (Knowledge Cutoff) آن ۳۰ آوریل ۲۰۲۶ است.

در مقابل، Claude Sonnet 5.5 (با شناسه claude-sonnet-5-5 یا anthropic.claude-sonnet-5-5 در Bedrock) پنجره متنی یک میلیون توکنی دارد. محدودیت خروجی آن ۱۲۸ هزار توکن است، اما در درخواست‌های دسته‌ای (Batch) با استفاده از هدر بتا، این مقدار می‌تواند تا ۳۰۰,۰۰۰ توکن گسترش یابد. تاریخ قطع دانش این مدل ژوئن ۲۰۲۶ است.

نقاط دسترسی نیز متفاوت است. GPT-6.1 Sol از طریق API اوپن‌ای‌آی، ChatGPT (در نسخه‌های Plus، Pro، Business، Enterprise و Edu) و OpenRouter (با شناسه openai/gpt-6.1-sol) در دسترس است. Claude Sonnet 5.5 از طریق Claude.ai، Bedrock، گوگل‌کلاود و Microsoft Foundry قابل دسترسی است. در حالی که GPT-6.1 Sol هیچ سطح رایگانی برای API ندارد، Sonnet 5.5 را می‌توان از طریق رابط کاربری Claude.ai استفاده کرد، هرچند API آن همچنان بر اساس پرداخت به‌ازای توکن است.

جریمه پرامپت‌های طولانی

یک تفاوت حیاتی زمانی رخ می‌دهد که پرامپت‌ها از ۲۷۲,۰۰۰ توکن عبور کنند. اوپن‌ای‌آی برای این درخواست‌های حجیم یک «پاداش معکوس» یا جریمه اعمال می‌کند و نرخ ورودی/حافظه را ۲ برابر و نرخ خروجی را ۱.۵ برابر می‌کند. به‌طور مشخص، این یعنی برای کل درخواست، ۴ دلار برای ورودی، ۰.۲۰ دلار برای توکن‌های حافظه و ۱۵ دلار برای خروجی پرداخت خواهید کرد.

آنتروپیک قیمت یکسانی را برای کل پنجره یک میلیون توکنی خود حفظ کرده است. برای مثال، یک پرامپت ۴۰۰,۰۰۰ توکنی با پاسخ ۵,۰۰۰ توکنی، در GPT-6.1 Sol حدود ۱.۶۸ دلار هزینه دارد، اما در Sonnet 5.5 تنها ۰.۸۵ دلار تمام می‌شود.

عملکرد و محک‌ها

در حال حاضر بنچمارک‌های مستقیم و رودررو بین این دو نسخه خاص وجود ندارد. اکثر داده‌های شخص ثالث هنوز Sonnet 5.5 را با نسخه قدیمی‌تر GPT-6 Sol مقایسه می‌کنند.

اوپن‌ای‌آی ادعا می‌کند GPT-6.1 Sol در آزمون AutomationBench 1.0.6 (در سطح تلاش متوسط) ۲.۲ درصد بهتر از Claude Opus 5.5 و ۴.۸ درصد بهتر از GPT-6 Sol عمل کرده است. در آزمون Terminal-Bench Science 0.1 (در سطح تلاش بیشینه)، هزینه هر وظیفه در GPT-6.1 Sol مبلغ ۵.۴۷ دلار است، در حالی که برای Opus 5.5 این رقم ۲۳.۲۱ دلار است؛ هرچند GPT-6 Astra همچنان با امتیاز ۶۸.۱٪ رتبه اول را دارد. همچنین گزارش شده که در OSWorld 2.0 آفلاین، این مدل ۷ درصد نسبت به GPT-6 Sol بهبود یافته و همزمان هزینه‌ها را به نصف کاهش داده است.

اما داده‌های آنتروپیک روایت دیگری دارد. در محک FrontierCode 1.1 (از طریق Cognition)، مدل Sonnet 5.5 در سطح تلاش xhigh امتیاز ۵۲.۱٪ و در سطح max امتیاز ۴۶.۲٪ کسب کرد و توانست GPT-6 Sol با امتیاز ۴۹.۳٪ را شکست دهد. آنتروپیک همچنین مدعی است که Sonnet 5.5 نتایج مشابه بهترین امتیازات GPT-6 Sol در سطح تلاش بالا را با یک‌پنجم هزینه به دست می‌آورد. در آزمون‌های GDPval-AA v2.1 و AA-Briefcase v1.1 (از طریق Artificial Analysis)، مدل Sonnet 5.5 به‌ترتیب امتیازات ۱۸۴۴ در مقابل ۱۴۸۷ و ۱۸۱۱ در مقابل ۱۴۸۳ را کسب کرد.

تفاوت در پیکربندی بنچمارک‌ها

ترکیب اعداد از نمودارهای مختلف بدون بررسی دقیق پیکربندی‌ها خطرناک است. برای مثال، اوپن‌ای‌آی آزمون AutomationBench 1.0.6 را با سطح تلاش «متوسط» در محیط تست خود اجرا کرده است. در مقابل، کارت سیستم آنتروپیک از سطح تلاش «بیشینه» برای مدل‌های کلود استفاده می‌کند و امتیاز Sonnet 5.5 را ۴۴.۷، Opus 5.5 را ۴۲.۵ و GPT-6 Sol را ۳۲.۰ گزارش کرده است.

ناهمسانی‌های دیگری نیز در تست‌های محیطی وجود دارد. آنتروپیک امتیاز ۵۹.۹٪ را برای Sonnet 5.5 در Terminal-Bench Science گزارش کرده، اما اوپن‌ای‌آی امتیاز خام برای GPT-6.1 Sol ارائه نداده است. علاوه بر این، اوپن‌ای‌آی از OSWorld 2.0 آفلاین استفاده می‌کند، در حالی که آنتروپیک از OSWorld 2.1 بهره می‌برد. این تناقض‌ها دقیقاً مشابه مشکلاتی است که در مقایسه‌های قبلی بین GPT-6 Sol و Claude Opus 5.5 مشاهده شد.

شاخص هوش شخص ثالث

طبق بررسی Artificial Analysis (شاخص هوش v4.3.2) که ترکیبی از ۱۰ ارزیابی است، مدل Sonnet 5.5 به‌طور کلی در سطوح تلاش متوسط تا بیشینه امتیازات بالاتری می‌گیرد، اما این دقت با هزینه استنتاج (Inference) بیشتری همراه است:

  • تلاش متوسط: Sonnet 5.5 (شاخص ۴۱، ۰.۵۹ دلار) در برابر GPT-6 Sol (شاخص ۴۰، ۰.۲۵ دلار)
  • تلاش بالا: Sonnet 5.5 (شاخص ۴۷، ۱.۰۸ دلار) در برابر GPT-6 Sol (شاخص ۴۳، ۰.۳۸ دلار)
  • تلاش xHigh: Sonnet 5.5 (شاخص ۵۲، ۲.۷۴ دلار) در برابر GPT-6 Sol (شاخص ۴۴، ۰.۵۲ دلار)
  • تلاش بیشینه: Sonnet 5.5 (شاخص ۵۶، ۷.۶۰ دلار) در برابر GPT-6 Sol (شاخص ۴۸، ۱.۰۵ دلار)

این داده‌ها فاش می‌کنند که Sonnet 5.5 برای رسیدن به دقت بالاتر، توکن‌های بسیار بیشتری مصرف می‌کند. یک مقایسه مرتبط‌تر نشان می‌دهد که عملکرد Sonnet 5.5 در سطح «بالا» (شاخص ۴۷، ۱.۰۸ دلار) تقریباً با عملکرد GPT-6 Sol در سطح «بیشینه» (شاخص ۴۸، ۱.۰۵ دلار) برابر است.

در بنچمارک AA-Briefcase، مدل GPT-6 Sol در هر سطح از تلاش ارزان‌تر است (مثلاً ۰.۳۴ دلار در مقابل ۱.۶۴ دلار در سطح متوسط)، هرچند Sonnet 5.5 امتیاز بالاتری می‌گیرد. در FrontierCode، مدل Sonnet 5.5 در سطح تلاش بالا به دقت ۴۹.۴٪ با هزینه ۰.۴۲ دلار به ازای هر تسک می‌رسد، در حالی که GPT-6 Sol در سطح تلاش بیشینه به دقت ۴۹.۳٪ با هزینه ۲.۰۷ دلار دست می‌یابد.

سرعت و تأخیر

سرعت یک تمایز بزرگ دیگر است. Artificial Analysis سرعت Sonnet 5.5 را ۱۳۸ توکن در ثانیه اندازه‌گیری کرده که تقریباً دو برابر سرعت ۷۶ توکن در ثانیه در GPT-6 Sol (در سطح تلاش بیشینه) است.

اوپن‌ای‌آی برای مقابله با این موضوع، یک سطح پرداخت‌شده به نام Fast برای GPT-6.1 Sol معرفی کرده (۴ دلار ورودی / ۲۰ دلار خروجی) و وعده یک حالت Ultrafast را داده است. آنتروپیک در حال حاضر چنین تفکیکی برای سرعت در API مدل Sonnet 5.5 ارائه نمی‌دهد.

انتخاب مدل مناسب

اگر گردش‌کار شما شامل موارد زیر است، GPT-6.1 Sol را اولویت قرار دهید:

  • اتوماسیون‌های عامل‌محور (Agentic) و استفاده از کامپیوتر.
  • وظایف علمی که نیاز به استدلال با تلاش بالا دارند.
  • استفاده مکرر از پرامپت‌های سیستمی طولانی (بهره‌گیری از خواندن حافظه ارزان ۰.۱۰ دلاری).
  • نیاز به تأخیر کم از طریق سطح پرداخت‌شده Fast.
  • کارهای حرفه‌ای که نیاز به عملکردی شبیه Astra اما با یک‌پنجم هزینه دارند.

در مقابل، Claude Sonnet 5.5 کاندیدای بهتری برای موارد زیر است:

  • کدنویسی عامل‌محور و تولید اسناد ساختاریافته (مانند اسلایدها و صفحات گسترده).
  • پرامپت‌های بسیار طولانی (بالای ۲۷۲ هزار توکن) برای اجتناب از جریمه‌های قیمتی اوپن‌ای‌آی.
  • یکپارچگی از طریق AWS Bedrock، گوگل‌کلاود یا Microsoft Foundry.
  • وظایف روزمره با محدوده مشخص و نیاز به خروجی‌های صیقل‌خورده.

اجتناب از تله بنچمارک‌ها

مقایسه این مدل‌ها تنها بر اساس نام گمراه‌کننده است، زیرا تنظیمات پیش‌فرض «تلاش» (Effort) آن‌ها متفاوت است. GPT-6.1 Sol به‌طور پیش‌فرض روی Medium است، در حالی که Sonnet 5.5 از طریق API روی High تنظیم شده است. سطوح تلاش برای GPT-6.1 Sol شامل low، medium، high، xhigh و max است. Sonnet 5.5 نیز همین بازه را دارد، اما قابلیت «تفکر» (Thinking) آن را نمی‌توان خاموش کرد.

علاوه بر این، Sonnet 5.5 در مورد نمونه‌برداری (Sampling) سخت‌گیر است؛ اگر مقادیر temperature، top_p یا top_k را از حالت پیش‌فرض تغییر دهید، خطای HTTP 400 برمی‌گرداند. در مقابل، اوپن‌ای‌آی پیشنهاد می‌کند زمانی که سطح تلاش روی none نیست، این مقادیر را کاهش دهید.

استراتژی ارزیابی عملی

برای یافتن برنده واقعی، باید ۲۰ تا ۵۰ وظیفه واقعی را در هر دو مدل اجرا کنید. روی خروجی‌های قابل تأیید مثل JSON، SQL یا وصله‌های کد (Code Patches) تمرکز کنید.

معیار اصلی شما باید «هزینه به‌ازای هر وظیفه موفق» (مجموع هزینه تقسیم بر تعداد موفقیت‌ها) باشد. این معیار هم قیمت توکن و هم کارایی مدل در رسیدن به پاسخ درست را محاسبه می‌کند.

می‌توانید از ابزاری مثل Apidog برای اتوماسیون این تست استفاده کنید. محیط‌هایی برای هر دو کلید API بسازید، خروجی‌های مورد انتظار را تعریف کنید و با اجرای مجموعه داده از طریق CLI، میانگین تأخیر و نرخ موفقیت را مقایسه کنید.

مراحل پیاده‌سازی در Apidog

۱. تنظیم محیط: محیطی با متغیرهای محرمانه برای OPENAI_API_KEY ،ANTHROPIC_API_KEY و EFFORT ایجاد کنید. متغیرهای داده‌ای برای prompt و expected اضافه کنید.
۲. پیکربندی درخواست:

  • OpenAI: از POST https://api.openai.com/v1/responses با مدل gpt-6.1-sol و پارامتر reasoning: { "effort": "{{EFFORT}}" } استفاده کنید. مقدار max_output_tokens را روی ۲۵,۰۰۰ قرار دهید.
  • Anthropic: از POST https://api.anthropic.com/v1/messages با مدل claude-sonnet-5-5 و پارامتر output_config: { "effort": "{{EFFORT}}" } استفاده کنید. مقدار max_tokens را روی ۲۵,۰۰۰ قرار دهید.
    ۳. تأیید پاسخ‌ها: قبل از ارزیابی محتوا، ساختار را بررسی کنید.
  • OpenAI: بررسی کنید $.status == completed و $.output[*].type == message باشد.
  • Anthropic: بررسی کنید $.stop_reason == end_turn و $.content[*].type == text باشد.
  • مصرف: مقدار $.usage.output_tokens را برای هر دو ردیابی کنید. برای اوپن‌ای‌آی، $.usage.input_tokens_details.cached_tokens و cache_write_tokens را بررسی کنید. برای آنتروپیک، $.usage.cache_read_input_tokens و cache_creation_input_tokens را چک کنید.
    ۴. تأییدات خاص وظیفه: برای خروجی JSON، مطمئن شوید پاسخ قابل تجزیه است، $.category == {{expected_category}} و $.confidence >= 0.8 باشد.
    ۵. محاسبه هزینه: از داده‌های مصرف استفاده کنید. برای اوپن‌ای‌آی، توکن‌های خواندن/نوشتن حافظه را از کل ورودی کم کرده و سپس نرخ ۲ دلاری را اعمال کنید. اگر ورودی بیش از ۲۷۲ هزار توکن بود، جریمه را اعمال کنید. برای آنتروپیک، توکن‌های cache_read_input_tokens و cache_creation_input_tokens را به‌طور جداگانه محاسبه کنید.
    ۶. اجرای CLI: مجموعه داده prompts.csv خود را با استفاده از Apidog CLI برای سطوح مختلف تلاش (مثلاً ابتدا EFFORT=medium و سپس EFFORT=high) اجرا کنید تا نرخ موفقیت و میانگین تأخیر را مقایسه کنید.

این رویکرد، نویز ادعاهای سازندگان را حذف کرده و فاش می‌کند که کدام مدل در محیط عملیاتی واقعاً برای شما در هزینه صرفه‌جویی می‌کند.

این تغییر رویکرد به سمت «هزینه به‌ازای هر وظیفه»، پایان عصری است که توسعه‌دهندگان می‌توانستند تنها با نگاه به یک جدول قیمت، مدل خود را انتخاب کنند. هزینه واقعی اکنون در کارایی استدلال مدل پنهان شده است.

منتظر به‌روزرسانی بعدی Artificial Analysis باشید تا ببینید آیا بهبودهای گزارش‌شده در GPT-6.1 Sol نسبت به نسخه قبلی، فاصله را با سرعت و دقت Sonnet 5.5 پر می‌کند یا خیر.

چرا این موضوع مهم است؟

این رقابت نشان می‌دهد که مدل‌های میان‌رده اکنون در حال بلعیدن سهم بازار مدل‌های پرچمدار هستند. اعتبار این تحلیل بر اساس داده‌های مصرف واقعی توکن‌هاست و ثابت می‌کند که بهینه‌سازی استنتاج، مهم‌تر از افزایش پارامترها شده است.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، توسعه‌دهندگان ایرانی برای دسترسی به این مدل‌ها همچنان به واسطه‌هایی مثل OpenRouter نیاز دارند که ممکن است هزینه‌های اضافی به قیمت‌های پایه اضافه کنند.

·نگاه ما
تحریریه دات‌هوش

به نظر ما، جریمه ۲ برابری اوپن‌ای‌آی برای پرامپت‌های طولانی، یک حرکت استراتژیک برای سوق دادن کاربران به سمت مدل‌های کوچک‌تر یا استفاده بهینه از حافظه است. این نشان می‌دهد که رقابت از «بزرگ‌ترین پنجره متنی» به «بهینه‌ترین مصرف توکن» تغییر کرده است. برنده واقعی کسی نیست که مدل ارزان‌تری دارد، بلکه کسی است که مدلش برای رسیدن به جواب درست، کمتر «حرف می‌زند».

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.