پرش به محتوای اصلی
پرش به محتوای مقاله

سنجش هزینه در برابر هوش؛ تحلیل فنی مدل Mercury 2.5

·۲ مهر ۱۴۰۵۵ دقیقه مطالعه۱ بازدید
تحلیل Mercury 2.5: هوش، عملکرد و قیمت | مقایسه مدل‌های هوش مصنوعی
تحلیل Mercury 2.5: هوش، عملکرد و قیمت | مقایسه مدل‌های هوش مصنوعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی معیار «هزینه به ازای هر وظیفه در شاخص هوش»؛ تغییری از ارزیابی‌های ایستا به سنجش هزینه عملیاتی واقعی در وظایف عامل‌محور.

اگر امروز برای استقرار مدل‌های استدلالی بودجه‌بندی می‌کنید، باید بدانید که سرعت تولید توکن دیگر تنها معیار موفقیت نیست. طبق گزارش فنی Artificial Analysis که در ۲۳ سپتامبر ۲۰۲۶ منتشر شد، مدل Mercury 2.5 اکنون تحت یک کالبدشکافی دقیق قرار گرفته تا مشخص شود آیا هوش بالای آن با هزینه‌های عملیاتی توجیه‌پذیر است یا خیر. این ارزیابی فراتر از بنچ‌مارک‌های ساده‌ی چت می‌رود تا اندازه‌گیری کند که مدل چگونه وظایف پیچیده، عامل‌محور و واقعی را مدیریت می‌کند.

این تحلیل در حالی رخ می‌دهد که صنعت هوش مصنوعی از اندازه‌گیری توانمندی‌های کلی به سمت سنجش «هوش به ازای هر دلار» حرکت کرده است. همان‌طور که در تحلیل قبلی ما درباره‌ی پیشتازی مدل MiMo-V2.6-Pro در حوزه هوش مدل‌های وزن‌باز اشاره کردیم، اکنون نقطه تمرکز بر روی هزینه‌های عملیاتی برای حفظ آن سطح از هوش در محیط‌های تولید (Production) است.

شاخص هوش v4.3.2

به نقل از مستندات این گزارش، مدل مذکور با استفاده از شاخص هوش v4.3.2 مورد آزمایش قرار گرفت که ترکیبی از ۱۰ ارزیابی مجزا است. این رویکرد در واقع تکامل یافته‌ی شاخص Intelligence Index v4.3 است که معیار سنجش هوش را به سمت کاربردهای عامل‌محور سوق داد تا دقت ارزیابی‌ها در محیط‌های عملیاتی افزایش یابد. این معیارها عبارت‌اند از:

  • AA-Briefcase v1.1: سنجش کارهای دانشی عامل‌محور (Agentic) از طریق یک معیار ترکیبی شامل نرخ پذیرش دستورالعمل‌ها (Rubric Pass Rate)، کیفیت تحلیلی و امتیاز Elo در ارائه. در این بخش، عملکرد دستورالعمل‌ها از طریق مسابقات شبیه‌سازی شده‌ی رودررو به امتیاز Elo تبدیل می‌شود و کران‌های آن در عدد ۰ محدود شده است.
  • AA-Omniscience: شاخصی برای سنجش قابلیت اطمینان (از ۱۰۰- تا ۱۰۰+) که پاسخ‌های درست را پاداش داده و به توهم (Hallucination) جریمه می‌دهد. امتیاز ۰ نشان‌دهنده تعداد برابر پاسخ‌های درست و غلط است، در حالی که امتیازات منفی به معنای غلبه پاسخ‌های نادرست است. نکته مهم این است که برای امتناع از پاسخ دادن، جریمه‌ای در نظر گرفته نشده است.
  • محک‌های تخصصی: شامل SciCode، Humanity's Last Exam و Terminal-Bench 4.0 برای ارزیابی دقیق توانایی‌های کدنویسی و تعامل با ترمینال.
  • سایر ارزیابی‌ها: این شاخص همچنین شامل GDPval-AA v2.1، AutomationBench-AA، GDP.pdf، CritPt و AA-LCR v1.1 است تا پوششی جامع‌تر فراهم کند.

تمرکز بر قابلیت‌ها و صنایع

این ارزیابی‌ها به‌گونه‌ای طراحی شده‌اند که عملکرد مدل را در قابلیت‌های خاص و صنایع مختلف تفکیک کنند. بر اساس این گزارش، تفاوت میان «کارهای دانشی عامل‌محور» و «وظایف دنیای واقعی» به‌صورت دقیق اندازه‌گیری شده است و هر دو با فرمول (Elo-500)/2000 محاسبه می‌شوند.

حوزه‌های حیاتی دیگر شامل استدلال روی اسناد حرفه‌ای (All-pass) و استدلال در متون پزشکی با پنجره زمینه (Context Window) بلند است. تحلیلگران Artificial Analysis اشاره می‌کنند که اگرچه هوش کلی معمولاً در کاربردهای مختلف منتقل می‌شود، اما بسته به هدف نهایی اپلیکیشن، برخی از این ارزیابی‌های تخصصی ارتباط و اولویت بیشتری دارند.

معیارهای تأخیر و پاسخ‌دهی

گزارش مذکور، پاسخ‌دهی مدل را از طریق چندین نشانگر تأخیر (Latency) تحلیل می‌کند. «زمان پاسخ کلی» (End-to-End Response Time) به‌طور مشخص ثانیه‌های مورد نیاز برای تولید ۵۰۰ توکن را محاسبه می‌کند که یک معیار ترکیبی شامل موارد زیر است:

  • زمان ورودی (Input Time): فاصله زمانی تا دریافت نخستین توکن پاسخ.
  • زمان تفکر (Thinking Time): در مدل‌های استدلالی (Reasoning Models)، زمانی است که مدل صرف تولید توکن‌های داخلی برای استدلال پیش از ارائه پاسخ نهایی می‌کند. این مقدار بر اساس میانگین توکن‌های استدلال در ۶۰ پرامپت متنوع محاسبه شده است.
  • زمان پاسخ (Answer Time): مدت‌زمان تولید ۵۰۰ توکن خروجی که بر اساس سرعت تولید توکن‌ها محاسبه می‌شود.

سرعت خروجی بر حسب توکن در ثانیه اندازه‌گیری می‌شود که مستقیماً بر «زمان هر وظیفه در شاخص هوش» اثر می‌گذارد. این میانگین وزنی زمان رمزگشایی (Decode Time)، هزینه‌های سربار و TTFT را حذف می‌کند تا نگاهی خالص به کارایی تولید داشته باشیم. تأخیر همچنین توسط «زمان تا اولین توکن» (TTFT) اندازه‌گیری می‌شود که زمان تفکر مدل‌های استدلالی را نیز در بر می‌گیرد.

اقتصاد توکن و هزینه‌ها

پلتفرم Artificial Analysis معیار جدیدی به نام «هزینه به ازای هر وظیفه در شاخص هوش» را معرفی کرده است. این عدد از طریق وزن‌دهی به قیمت‌های ورودی، برخورد با حافظه (Cache Hit)، ثبت حافظه (Cache Write)، توکن‌های استدلال و توکن‌های پاسخ در برابر تعداد کل وظایف محاسبه می‌شود.

عوامل اقتصادی کلیدی تحلیل‌شده عبارت‌اند از:

  • قیمت‌گذاری Cache Hit: هزینه پرامپت‌هایی که قبلاً پردازش شده‌اند و بر حسب دلار به ازای هر میلیون توکن نمایش داده می‌شود. این مورد معمولاً تخفیف قابل‌توجهی نسبت به ورودی عادی دارد، هرچند هزینه ثبت و ذخیره‌سازی حافظه موقت به‌طور جداگانه صورت می‌گیرد.
  • پنجره زمینه (Context Window): حداکثر محدودیت ترکیبی توکن‌های ورودی و خروجی. این مورد برای جریان‌های کاری تولید بازیابی‌افزا (RAG) که شامل بازیابی اطلاعات در مقیاس بزرگ است، حیاتی است. لازم به ذکر است که توکن‌های خروجی معمولاً محدودیت بسیار کمتری دارند.
  • میانگین هزینه وزنی: ارزشی به دلار برای هر وظیفه که به توسعه‌دهندگان اجازه می‌دهد بار مالی مدل‌های مختلف را در یک سطح هوشی یکسان مقایسه کنند. در این راستا، رقابت شدیدی میان مدل‌ها شکل گرفته است؛ برای مثال مدل Grok 4.7 با کاهش قیمت استنتاج تلاش کرد تا جذاب‌تر شود، اما در کدنویسی عامل‌محور با چالش‌های جدی روبرو شد.
  • استفاده از توکن: میانگین وزنی تعداد توکن‌های خروجی مصرف شده در هر وظیفه، که از ضرب توکن‌های خروجی هر ارزیابی در وزن نسبی هر بنچ‌مارک به دست می‌آید.

موازنه‌های فنی

داده‌ها نشان می‌دهند که همبستگی شدیدی میان عمق استدلال مدل و تأخیر آن وجود دارد. در وظایف سنگین استدلالی، «زمان تفکر» به گلوگاه اصلی تبدیل می‌شود و اغلب تأثیر آن از سرعت واقعی تولید توکن‌ها بیشتر است.

علاوه بر این، تفاوت میان وزن‌های «محدود به استفاده تجاری» (Commercial Use Restricted) و «غیرتجاری» (Non-commercial) همچنان عاملی تعیین‌کننده برای پذیرش سازمانی است. مدل‌ها در صورتی «محدود به استفاده تجاری» برچسب می‌خورند که شرایط خاصی استفاده از آن‌ها را محدود کند، و «غیرتجاری» هستند اگر مجوز آن‌ها به‌طور کلی استفاده تجاری را ممنوع کند. امتیازات هوش زمانی بی‌معنی می‌شوند که مجوز مدل، استقرار آن در محیط تولید را ممنوع کند.

این تغییر در نحوه بنچ‌مارک کردن، فرضیات میدان را تغییر می‌دهد؛ اکنون هوش مصنوعی نه به عنوان یک پایگاه دانش ایستا، بلکه به عنوان یک ابزار کاربردی با «هزینه کالای فروخته شده» (COGS) قابل اندازه‌گیری به ازای هر واحد هوش دیده می‌شود.

توسعه‌دهندگان دیگر نمی‌توانند تنها روی دقت تمرکز کنند؛ برای رقابت در محیط تولید، باید نقطه تلاقی امتیاز Elo، توکن در ثانیه و کارایی حافظه موقت (Cache-hit efficiency) را بهینه کنند.

برای مشاهده نحوه مقایسه Mercury 2.5 با سایر مدل‌های پیشرو به‌صورت بلادرنگ، می‌توانید متدولوژی کامل Intelligence Index و جدول‌های رده‌بندی زنده Artificial Analysis را بررسی کنید.

گام بعدی شما

  • بررسی متدولوژی کامل Intelligence Index برای درک نحوه وزن‌دهی به وظایف عامل‌محور.
  • تحلیل هزینه استنتاج مدل‌های فعلی خود در برابر معیار «هوش به ازای هر دلار».
  • ارزیابی تأثیر زمان تفکر (Thinking Time) بر تجربه کاربری در اپلیکیشن‌های بلادرنگ.

اما تأثیر این مدل بر اکوسیستم مدل‌های بازمتن حتی پیچیده‌تر است — به تحلیل ما درباره‌ی استراتژی‌های کاهش هزینه استنتاج مراجعه کنید.

چرا این موضوع مهم است؟

این گزارش با تکیه بر اعتبار متدولوژی Artificial Analysis، استانداردی جدید برای سنجش بازگشت سرمایه (ROI) در استقرار مدل‌های زبانی ایجاد می‌کند. اکنون سازمان‌ها می‌توانند پیش از استقرار، هزینه دقیق هر واحد هوش را پیش‌بینی کنند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و هزینه‌های بالای ارزی در بازار ایران، بهینه‌سازی هزینه استنتاج و استفاده از مدل‌های با Cache Hit بالا برای توسعه‌دهندگان داخلی حیاتی‌تر از افزایش دقت مدل است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی معیارهای دقت مطلق با معیارهای اقتصادی، نشان‌دهنده بلوغ عملیاتی صنعت است. وقتی «زمان تفکر» به گلوگاه اصلی تبدیل می‌شود، رقابت از لبه‌ی معماری مدل به لبه‌ی بهینه‌سازی سخت‌افزاری و مدیریت حافظه موقت منتقل می‌شود. در واقع، برنده نهایی مدل‌های لبه، نه باهوش‌ترین، بلکه بهینه‌ترین مدل در تبدیل دلار به پاسخ خواهد بود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.