اگر امروز برای استنتاج مدلهای سطح متوسط هزینه میپردازید، باید بدانید که قیمت هر توکن دیگر معیار تعیینکننده نیست. رقابت جدید بین دو مدل، بر سر این است که کدامیک با مصرف توکن کمتر، جواب درست را تحویل میدهد. قیمت ۲ دلار بهازای هر میلیون توکن ورودی اکنون به کف قیمتی این صنعت برای مدلهای سطح متوسط ردهبالا تبدیل شده است. این استاندارد قیمتی، صحنه را برای رویارویی Claude Sonnet 5.5 (منتشر شده در ۲۸ سپتامبر ۲۰۲۶) و GPT-6.1 Sol (منتشر شده در ۲۹ سپتامبر ۲۰۲۶) آماده کرد که تنها یک روز پس از یکدیگر عرضه شدند.
این عرضه همزمان، یک بنبست قیمتی ایجاد کرده است؛ جایی که برنده را نه قیمت روی برچسب، بلکه میزان توکنی که مدل برای حل یک مسئله خاص مصرف میکند، تعیین میکند. برای توسعهدهندگان، تمرکز از نرخهای ساده API به هزینه واقعی یک «وظیفه موفق» تغییر یافته است. همانطور که در تحلیل قبلی ما دربارهی تبدیل ChatGPT به یک فروشگاه اپلیکیشن برای میلیاردها کاربر اشاره کردیم، عرضه GPT-6.1 Sol تلاشی برای آوردن اتوماسیون در سطح حرفهای با قیمتی بسیار کمتر از مدلهای پرچمداری مثل GPT-6 Astra است. این رقابت را شبیه دو پیمانکار تصور کنید که هر دو ساعت کاری یکسانی دارند، اما یکی کار را در دو ساعت و دیگری در پنج ساعت تمام میکند. این دقیقاً وضعیت فعلی رقابت Sol در برابر Sonnet است.
بنبست قیمتی
هر دو مدل قیمت پایه ۲ دلار برای ورودی و ۱۰ دلار برای خروجی (بهازای هر میلیون توکن) دارند. اما هزینههای پنهان در بخش حافظه موقت یا KV Cache — که شبیه یادداشتهای سریع مدل برای جلوگیری از خواندن مجدد متنهای طولانی است — ظاهر میشود.
- خواندن از حافظه (Cache Reads): مدل GPT-6.1 Sol با ۰.۱۰ دلار بهازای هر میلیون توکن، ارزانتر از Sonnet 5.5 است که ۰.۲۰ دلار دریافت میکند.
- نوشتن در حافظه (Cache Writes): هر دو مدل ۲.۵۰ دلار بهازای هر میلیون توکن میگیرند، اما Sonnet 5.5 یک گزینه گرانتر ۴ دلاری برای حافظه یکساعته ارائه میدهد (در حالی که نرخ ۲.۵۰ دلاری در مدل اوپنایآی برای پنجرهای ۵ دقیقهای است).
- پردازش دستهای (Batch Processing): هر دو مدل تخفیفی ۵۰ درصدی ارائه میدهند که قیمت را به ۱ دلار برای ورودی و ۵ دلار برای خروجی بهازای هر میلیون توکن کاهش میدهد.

مشخصات فنی و دسترسی
فراتر از قیمت، این مدلها در محدودیتهای معماری و نحوه دسترسی با هم تفاوت دارند. GPT-6.1 Sol (با شناسه مدل gpt-6.1-sol) دارای پنجره متنی (Context Window) به اندازه ۱,۰۵۰,۰۰۰ توکن است، در حالی که حداکثر ورودی مجاز آن ۹۲۲,۰۰۰ توکن است. حداکثر خروجی این مدل ۱۲۸,۰۰۰ توکن است و تاریخ قطع دانش (Knowledge Cutoff) آن ۳۰ آوریل ۲۰۲۶ است.
در مقابل، Claude Sonnet 5.5 (با شناسه claude-sonnet-5-5 یا anthropic.claude-sonnet-5-5 در Bedrock) پنجره متنی یک میلیون توکنی دارد. محدودیت خروجی آن ۱۲۸ هزار توکن است، اما در درخواستهای دستهای (Batch) با استفاده از هدر بتا، این مقدار میتواند تا ۳۰۰,۰۰۰ توکن گسترش یابد. تاریخ قطع دانش این مدل ژوئن ۲۰۲۶ است.
نقاط دسترسی نیز متفاوت است. GPT-6.1 Sol از طریق API اوپنایآی، ChatGPT (در نسخههای Plus، Pro، Business، Enterprise و Edu) و OpenRouter (با شناسه openai/gpt-6.1-sol) در دسترس است. Claude Sonnet 5.5 از طریق Claude.ai، Bedrock، گوگلکلاود و Microsoft Foundry قابل دسترسی است. در حالی که GPT-6.1 Sol هیچ سطح رایگانی برای API ندارد، Sonnet 5.5 را میتوان از طریق رابط کاربری Claude.ai استفاده کرد، هرچند API آن همچنان بر اساس پرداخت بهازای توکن است.
جریمه پرامپتهای طولانی
یک تفاوت حیاتی زمانی رخ میدهد که پرامپتها از ۲۷۲,۰۰۰ توکن عبور کنند. اوپنایآی برای این درخواستهای حجیم یک «پاداش معکوس» یا جریمه اعمال میکند و نرخ ورودی/حافظه را ۲ برابر و نرخ خروجی را ۱.۵ برابر میکند. بهطور مشخص، این یعنی برای کل درخواست، ۴ دلار برای ورودی، ۰.۲۰ دلار برای توکنهای حافظه و ۱۵ دلار برای خروجی پرداخت خواهید کرد.
آنتروپیک قیمت یکسانی را برای کل پنجره یک میلیون توکنی خود حفظ کرده است. برای مثال، یک پرامپت ۴۰۰,۰۰۰ توکنی با پاسخ ۵,۰۰۰ توکنی، در GPT-6.1 Sol حدود ۱.۶۸ دلار هزینه دارد، اما در Sonnet 5.5 تنها ۰.۸۵ دلار تمام میشود.
عملکرد و محکها
در حال حاضر بنچمارکهای مستقیم و رودررو بین این دو نسخه خاص وجود ندارد. اکثر دادههای شخص ثالث هنوز Sonnet 5.5 را با نسخه قدیمیتر GPT-6 Sol مقایسه میکنند.
اوپنایآی ادعا میکند GPT-6.1 Sol در آزمون AutomationBench 1.0.6 (در سطح تلاش متوسط) ۲.۲ درصد بهتر از Claude Opus 5.5 و ۴.۸ درصد بهتر از GPT-6 Sol عمل کرده است. در آزمون Terminal-Bench Science 0.1 (در سطح تلاش بیشینه)، هزینه هر وظیفه در GPT-6.1 Sol مبلغ ۵.۴۷ دلار است، در حالی که برای Opus 5.5 این رقم ۲۳.۲۱ دلار است؛ هرچند GPT-6 Astra همچنان با امتیاز ۶۸.۱٪ رتبه اول را دارد. همچنین گزارش شده که در OSWorld 2.0 آفلاین، این مدل ۷ درصد نسبت به GPT-6 Sol بهبود یافته و همزمان هزینهها را به نصف کاهش داده است.
اما دادههای آنتروپیک روایت دیگری دارد. در محک FrontierCode 1.1 (از طریق Cognition)، مدل Sonnet 5.5 در سطح تلاش xhigh امتیاز ۵۲.۱٪ و در سطح max امتیاز ۴۶.۲٪ کسب کرد و توانست GPT-6 Sol با امتیاز ۴۹.۳٪ را شکست دهد. آنتروپیک همچنین مدعی است که Sonnet 5.5 نتایج مشابه بهترین امتیازات GPT-6 Sol در سطح تلاش بالا را با یکپنجم هزینه به دست میآورد. در آزمونهای GDPval-AA v2.1 و AA-Briefcase v1.1 (از طریق Artificial Analysis)، مدل Sonnet 5.5 بهترتیب امتیازات ۱۸۴۴ در مقابل ۱۴۸۷ و ۱۸۱۱ در مقابل ۱۴۸۳ را کسب کرد.
تفاوت در پیکربندی بنچمارکها
ترکیب اعداد از نمودارهای مختلف بدون بررسی دقیق پیکربندیها خطرناک است. برای مثال، اوپنایآی آزمون AutomationBench 1.0.6 را با سطح تلاش «متوسط» در محیط تست خود اجرا کرده است. در مقابل، کارت سیستم آنتروپیک از سطح تلاش «بیشینه» برای مدلهای کلود استفاده میکند و امتیاز Sonnet 5.5 را ۴۴.۷، Opus 5.5 را ۴۲.۵ و GPT-6 Sol را ۳۲.۰ گزارش کرده است.
ناهمسانیهای دیگری نیز در تستهای محیطی وجود دارد. آنتروپیک امتیاز ۵۹.۹٪ را برای Sonnet 5.5 در Terminal-Bench Science گزارش کرده، اما اوپنایآی امتیاز خام برای GPT-6.1 Sol ارائه نداده است. علاوه بر این، اوپنایآی از OSWorld 2.0 آفلاین استفاده میکند، در حالی که آنتروپیک از OSWorld 2.1 بهره میبرد. این تناقضها دقیقاً مشابه مشکلاتی است که در مقایسههای قبلی بین GPT-6 Sol و Claude Opus 5.5 مشاهده شد.
شاخص هوش شخص ثالث
طبق بررسی Artificial Analysis (شاخص هوش v4.3.2) که ترکیبی از ۱۰ ارزیابی است، مدل Sonnet 5.5 بهطور کلی در سطوح تلاش متوسط تا بیشینه امتیازات بالاتری میگیرد، اما این دقت با هزینه استنتاج (Inference) بیشتری همراه است:
- تلاش متوسط: Sonnet 5.5 (شاخص ۴۱، ۰.۵۹ دلار) در برابر GPT-6 Sol (شاخص ۴۰، ۰.۲۵ دلار)
- تلاش بالا: Sonnet 5.5 (شاخص ۴۷، ۱.۰۸ دلار) در برابر GPT-6 Sol (شاخص ۴۳، ۰.۳۸ دلار)
- تلاش xHigh: Sonnet 5.5 (شاخص ۵۲، ۲.۷۴ دلار) در برابر GPT-6 Sol (شاخص ۴۴، ۰.۵۲ دلار)
- تلاش بیشینه: Sonnet 5.5 (شاخص ۵۶، ۷.۶۰ دلار) در برابر GPT-6 Sol (شاخص ۴۸، ۱.۰۵ دلار)
این دادهها فاش میکنند که Sonnet 5.5 برای رسیدن به دقت بالاتر، توکنهای بسیار بیشتری مصرف میکند. یک مقایسه مرتبطتر نشان میدهد که عملکرد Sonnet 5.5 در سطح «بالا» (شاخص ۴۷، ۱.۰۸ دلار) تقریباً با عملکرد GPT-6 Sol در سطح «بیشینه» (شاخص ۴۸، ۱.۰۵ دلار) برابر است.
در بنچمارک AA-Briefcase، مدل GPT-6 Sol در هر سطح از تلاش ارزانتر است (مثلاً ۰.۳۴ دلار در مقابل ۱.۶۴ دلار در سطح متوسط)، هرچند Sonnet 5.5 امتیاز بالاتری میگیرد. در FrontierCode، مدل Sonnet 5.5 در سطح تلاش بالا به دقت ۴۹.۴٪ با هزینه ۰.۴۲ دلار به ازای هر تسک میرسد، در حالی که GPT-6 Sol در سطح تلاش بیشینه به دقت ۴۹.۳٪ با هزینه ۲.۰۷ دلار دست مییابد.
سرعت و تأخیر
سرعت یک تمایز بزرگ دیگر است. Artificial Analysis سرعت Sonnet 5.5 را ۱۳۸ توکن در ثانیه اندازهگیری کرده که تقریباً دو برابر سرعت ۷۶ توکن در ثانیه در GPT-6 Sol (در سطح تلاش بیشینه) است.
اوپنایآی برای مقابله با این موضوع، یک سطح پرداختشده به نام Fast برای GPT-6.1 Sol معرفی کرده (۴ دلار ورودی / ۲۰ دلار خروجی) و وعده یک حالت Ultrafast را داده است. آنتروپیک در حال حاضر چنین تفکیکی برای سرعت در API مدل Sonnet 5.5 ارائه نمیدهد.
انتخاب مدل مناسب
اگر گردشکار شما شامل موارد زیر است، GPT-6.1 Sol را اولویت قرار دهید:
- اتوماسیونهای عاملمحور (Agentic) و استفاده از کامپیوتر.
- وظایف علمی که نیاز به استدلال با تلاش بالا دارند.
- استفاده مکرر از پرامپتهای سیستمی طولانی (بهرهگیری از خواندن حافظه ارزان ۰.۱۰ دلاری).
- نیاز به تأخیر کم از طریق سطح پرداختشده Fast.
- کارهای حرفهای که نیاز به عملکردی شبیه Astra اما با یکپنجم هزینه دارند.
در مقابل، Claude Sonnet 5.5 کاندیدای بهتری برای موارد زیر است:
- کدنویسی عاملمحور و تولید اسناد ساختاریافته (مانند اسلایدها و صفحات گسترده).
- پرامپتهای بسیار طولانی (بالای ۲۷۲ هزار توکن) برای اجتناب از جریمههای قیمتی اوپنایآی.
- یکپارچگی از طریق AWS Bedrock، گوگلکلاود یا Microsoft Foundry.
- وظایف روزمره با محدوده مشخص و نیاز به خروجیهای صیقلخورده.
اجتناب از تله بنچمارکها
مقایسه این مدلها تنها بر اساس نام گمراهکننده است، زیرا تنظیمات پیشفرض «تلاش» (Effort) آنها متفاوت است. GPT-6.1 Sol بهطور پیشفرض روی Medium است، در حالی که Sonnet 5.5 از طریق API روی High تنظیم شده است. سطوح تلاش برای GPT-6.1 Sol شامل low، medium، high، xhigh و max است. Sonnet 5.5 نیز همین بازه را دارد، اما قابلیت «تفکر» (Thinking) آن را نمیتوان خاموش کرد.
علاوه بر این، Sonnet 5.5 در مورد نمونهبرداری (Sampling) سختگیر است؛ اگر مقادیر temperature، top_p یا top_k را از حالت پیشفرض تغییر دهید، خطای HTTP 400 برمیگرداند. در مقابل، اوپنایآی پیشنهاد میکند زمانی که سطح تلاش روی none نیست، این مقادیر را کاهش دهید.
استراتژی ارزیابی عملی
برای یافتن برنده واقعی، باید ۲۰ تا ۵۰ وظیفه واقعی را در هر دو مدل اجرا کنید. روی خروجیهای قابل تأیید مثل JSON، SQL یا وصلههای کد (Code Patches) تمرکز کنید.
معیار اصلی شما باید «هزینه بهازای هر وظیفه موفق» (مجموع هزینه تقسیم بر تعداد موفقیتها) باشد. این معیار هم قیمت توکن و هم کارایی مدل در رسیدن به پاسخ درست را محاسبه میکند.
میتوانید از ابزاری مثل Apidog برای اتوماسیون این تست استفاده کنید. محیطهایی برای هر دو کلید API بسازید، خروجیهای مورد انتظار را تعریف کنید و با اجرای مجموعه داده از طریق CLI، میانگین تأخیر و نرخ موفقیت را مقایسه کنید.
مراحل پیادهسازی در Apidog
۱. تنظیم محیط: محیطی با متغیرهای محرمانه برای OPENAI_API_KEY ،ANTHROPIC_API_KEY و EFFORT ایجاد کنید. متغیرهای دادهای برای prompt و expected اضافه کنید.
۲. پیکربندی درخواست:
- OpenAI: از
POST https://api.openai.com/v1/responsesبا مدلgpt-6.1-solو پارامترreasoning: { "effort": "{{EFFORT}}" }استفاده کنید. مقدارmax_output_tokensرا روی ۲۵,۰۰۰ قرار دهید. - Anthropic: از
POST https://api.anthropic.com/v1/messagesبا مدلclaude-sonnet-5-5و پارامترoutput_config: { "effort": "{{EFFORT}}" }استفاده کنید. مقدارmax_tokensرا روی ۲۵,۰۰۰ قرار دهید.
۳. تأیید پاسخها: قبل از ارزیابی محتوا، ساختار را بررسی کنید. - OpenAI: بررسی کنید
$.status == completedو$.output[*].type == messageباشد. - Anthropic: بررسی کنید
$.stop_reason == end_turnو$.content[*].type == textباشد. - مصرف: مقدار
$.usage.output_tokensرا برای هر دو ردیابی کنید. برای اوپنایآی،$.usage.input_tokens_details.cached_tokensوcache_write_tokensرا بررسی کنید. برای آنتروپیک،$.usage.cache_read_input_tokensوcache_creation_input_tokensرا چک کنید.
۴. تأییدات خاص وظیفه: برای خروجی JSON، مطمئن شوید پاسخ قابل تجزیه است،$.category == {{expected_category}}و$.confidence >= 0.8باشد.
۵. محاسبه هزینه: از دادههای مصرف استفاده کنید. برای اوپنایآی، توکنهای خواندن/نوشتن حافظه را از کل ورودی کم کرده و سپس نرخ ۲ دلاری را اعمال کنید. اگر ورودی بیش از ۲۷۲ هزار توکن بود، جریمه را اعمال کنید. برای آنتروپیک، توکنهایcache_read_input_tokensوcache_creation_input_tokensرا بهطور جداگانه محاسبه کنید.
۶. اجرای CLI: مجموعه دادهprompts.csvخود را با استفاده از Apidog CLI برای سطوح مختلف تلاش (مثلاً ابتداEFFORT=mediumو سپسEFFORT=high) اجرا کنید تا نرخ موفقیت و میانگین تأخیر را مقایسه کنید.
این رویکرد، نویز ادعاهای سازندگان را حذف کرده و فاش میکند که کدام مدل در محیط عملیاتی واقعاً برای شما در هزینه صرفهجویی میکند.
این تغییر رویکرد به سمت «هزینه بهازای هر وظیفه»، پایان عصری است که توسعهدهندگان میتوانستند تنها با نگاه به یک جدول قیمت، مدل خود را انتخاب کنند. هزینه واقعی اکنون در کارایی استدلال مدل پنهان شده است.
منتظر بهروزرسانی بعدی Artificial Analysis باشید تا ببینید آیا بهبودهای گزارششده در GPT-6.1 Sol نسبت به نسخه قبلی، فاصله را با سرعت و دقت Sonnet 5.5 پر میکند یا خیر.




گفتگو