پرش به محتوای اصلی
پرش به محتوای مقاله

OmnisBench: ابزاری برای افشای واقعیتِ صرفه‌جویی در مسیریابی مدل‌های زبانی

·۲۸ مرداد ۱۴۰۵۴ دقیقه مطالعه۲ بازدید
همه ۶۰٪ در هزینه‌های LLM صرفه‌جویی می‌کنند. اما هیچ‌کس آمار واقعی را نشان نمی‌دهد.
همه ۶۰٪ در هزینه‌های LLM صرفه‌جویی می‌کنند. اما هیچ‌کس آمار واقعی را نشان نمی‌دهد.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی نخستین چارچوب متن‌باز برای محاسبه فاصله بین عملکرد مسیریاب‌های واقعی و «سقف تئوریک» (Oracle)، که ثابت می‌کند توانایی مدل‌های ارزان‌قیمت عامل اصلی صرفه‌جویی است، نه هوشمندی مسیریاب.

اگر برای کاهش هزینه‌های استنتاج از لایه‌های مسیریابی (Routing) استفاده می‌کنید، احتمالاً بخشی از صرفه‌جویی‌هایتان توهمی است. اعداد درخشان مثل کاهش ۹۰ درصدی هزینه‌ها و نرخ موفقیت ۹۹.۷٪ که معمولاً توسط لایه‌های مسیریابی ایده‌آل وعده داده می‌شوند، اغلب گمراه‌کننده هستند. برای مبارزه با اتکای صنعت به اسکرین‌شات‌های غیرقابل تایید و مجموعه‌های ارزیابی خصوصی جهت اثبات این صرفه‌جویی‌ها، شرکت Fortitude Omnis در ۱۹ اوت ۲۰۲۶ ابزار متن‌باز OmnisBench را تحت مجوز Apache 2.0 منتشر کرد تا پایان عصر «اعتماد به اسکرین‌شات‌ها» در ارزیابی مدل‌ها باشد.

زمینه و بستر مسیریابی

اکثر توسعه‌دهندگان اکنون به لایه‌های مسیریابی اعتماد می‌کنند که ادعا می‌کنند پرامپت‌های ساده را به مدل‌های ارزان و مسائل دشوار را به مدل‌های پیشرو (Frontier) می‌فرستند. تئوری این کار ساده است: شما بخش اعظم کیفیت را حفظ می‌کنید اما تنها کسری از صورت‌حساب را می‌پردازید. اما همان‌طور که در تحلیل قبلی ما درباره‌ی TOOLCALL-300 اشاره کردیم، تجزیه و تحلیل‌های ساده‌انگارانه (Naive Parsing) و مسیریابی‌های ابتدایی در محیط عملیاتی اغلب شکست می‌خورند. این چالش‌ها نشان می‌دهند که چرا بسیاری از گیت‌وی‌های هوش مصنوعی بدون ارزیابی کیفیت در محیط‌های واقعی با شکست مواجه می‌شوند.

در حال حاضر صنعت فاقد یک روش شفاف برای اندازه‌گیری «اوراکل» (Oracle) است؛ یعنی سقف تئوریک ارزان‌ترین مدلی که می‌توانست یک تکلیف خاص را حل کند. از آنجایی که اکثر ادعاهای مربوط به مسیریابی بر پایه نمره‌دهی‌های خصوصی و مجموعه‌های ارزیابی محرمانه است، از کاربران خواسته می‌شود صرفاً به یک اسکرین‌شات اعتماد کنند. در دنیای فناوری اطلاعات، یک اسکرین‌شات به‌ندرت ارزشی بیشتر از پیکسل‌هایی که روی کاغذ چاپ شده‌اند دارد.

متدولوژی OmnisBench

برای آزمایش این موضوع، Fortitude Omnis تعداد ۳۶۴ تکلیف را در دو مجموعه داده اصلی اجرا کرد:

  • HumanEval: شامل ۱۶۴ مسئله کدنویسی که توسط تست‌های واحد (Unit Tests) خودشان نمره‌دهی شدند.
  • GSM8K: شامل ۲۰۰ مسئله ریاضی که بر اساس پاسخ نهایی سنجیده شدند.

آن‌ها چهار مدل را در این استخر مدل مقایسه کردند: Claude Opus 5، GPT-5، Claude Haiku 4.5 و GPT-5-nano.

همه ۶۰٪ در هزینه‌های LLM صرفه‌جویی می‌کنند. اما هیچ‌کس آمار واقعی را نشان نمی‌دهد.

جزئیات یافته‌ها

یافته‌های آن‌ها تضاد شدیدی را در هزینه و عملکرد در سیاست‌های مختلف نشان می‌دهد:

  • اوراکل (مسیریابی ایده‌آل): این روش ارزان‌ترین مدلی را انتخاب می‌کند که در واقعیت تکلیف را درست پاسخ داده است. نتیجه: ۹۹.۷٪ موفقیت با هزینه ۰.۶۲ دلار به ازای هر ۱۰۰۰ درخواست.
  • همیشه پیشرو (Claude Opus 5): ارسال همه درخواست‌ها به برترین مدل. نتیجه: ۹۹.۲٪ موفقیت با هزینه ۶.۲۵ دلار به ازای هر ۱۰۰۰ درخواست.
  • تصادفی: انتخاب مدل به صورت رندوم. نتیجه: ۹۶.۲٪ موفقیت با هزینه ۴.۰۱ دلار به ازای هر ۱۰۰۰ درخواست.
  • همیشه ارزان‌ترین (GPT-5-nano): ارسال همه درخواست‌ها به کوچک‌ترین مدل. نتیجه: ۹۴.۵٪ موفقیت با هزینه ۰.۴۳ دلار به ازای هر ۱۰۰۰ درخواست.

به نقل از گزارش dev.to، شگفت‌انگیزترین یافته این است که مدل GPT-5-nano به تنهایی ۹۴.۵٪ تکالیف را مدیریت کرد. این یعنی مسیریابی یک جادوی ۶۰ درصدی برای کاهش هزینه نیست؛ بلکه در واقع ابزاری است تا چند درصدِ باقی‌مانده از کیفیت را بدون پرداخت هزینه‌های گزاف مدل‌های پیشرو برای تک‌تک فراخوانی‌ها، به دست آورید. این واقعیت با تجربه‌ی شرکت Manifest همسو است که به دلیل عدم پایداری خروجی در برابر صرفه‌جویی در توکن‌ها، استراتژی مسیریابی خود را بازنگری کرد.

حقیقت درباره اوراکل

تیم Fortitude Omnis هشدار می‌دهد که اوراکل یک «سقف» است، نه یک محصول. اوراکل در واقع «تقلب» می‌کند زیرا بعد از وقوع حادثه می‌داند کدام مدل موفق شده است. هیچ مسیریاب زنده‌ای (Live Router) چنین امتیازی ندارد. معیار واقعی برای یک مسیریاب قابل استقرار، فاصله بین عملکرد آن و خط اوراکل است. هر کسی که اعداد سبکِ اوراکل را به عنوان یک محصول نهایی می‌فروشد، در واقع سقف تئوریک را می‌فروشد، نه واقعیت عملیاتی را.

شفافیت قابل تایید

OmnisBench مشکل اعتماد را با انتشار تک‌تک پاسخ‌های مدل‌ها حل می‌کند. این ابزار شامل یک دستور اعتبارسنجی است که به کاربران اجازه می‌دهد نتایج منتشر شده را به‌صورت آفلاین، بدون نیاز به انجام فراخوانی‌های جدید API یا داشتن کلید دسترسی (API Key)، بازبینی و نمره‌دهی کنند.

توسعه‌دهندگان می‌توانند با اجرای توالی زیر نتایج را تایید کنند:
pip install -e .
python scripts/prepare_datasets.py
python -m omnisbench.cli run --config configs/v0.yaml --run runs/mine
python -m omnisbench.cli report --run runs/mine
python -m omnisbench.cli verify --run runs/2026-08-19

اگر حتی یک پاسخ ذخیره‌شده دستکاری شده باشد، اعتبارسنجی شکست می‌خورد. این تضمین می‌کند که اگر اعداد اشتباه باشند، می‌توان در حدود یک دقیقه آن‌ها را رد کرد.

برای کیف پول توسعه‌دهندگان، این تغییر به معنای جابجایی بحث از «چقدر می‌توانم پس‌انداز کنم» به «واقعاً چقدر کیفیت به دست می‌آورم» است. ارزش واقعی یک مسیریاب قابل استقرار، سقف اوراکل نیست، بلکه این است که تا چه حد می‌تواند در لحظه و بدون دانستن پاسخ پیش‌ینی، رفتار اوراکل را شبیه‌سازی کند. در این راستا، رویکردهای جدیدی مانند مدل قیمت‌گذاری Oxlo.ai سعی دارند هزینه استنتاج را از تعداد توکن‌ها جدا کنند تا دقت مدل اولویت یابد.

علاوه بر مسیریابی، اهرم‌های هزینه دیگری نیز وجود دارند. تحلیل جداگانه‌ی این تیم نشان می‌دهد که یک لایه کشینگ (Caching) قدرتمند اغلب دست‌کم گرفته شده است؛ چراکه ارزان‌ترین فراخوانی استنتاج (Inference) — یعنی همان لحظه‌ای که مدل جواب تولید می‌کند — فراخوانی‌ای است که هرگز نیاز نباشد انجام شود.

در حال حاضر Fortitude Omnis در حال ساخت OmnisRouter است؛ یک مسیریاب باز که در هر نسخه با این بنچمارک سنجیده می‌شود تا از افت کیفیت پنهان (Performance Regressions) جلوگیری شود. نتایج و کدها از طریق سایت و گیت‌هاب آن‌ها در دسترس است.

گام بعدی شما

  • اگر از لایه‌های مسیریابی تجاری استفاده می‌کنید، از OmnisBench برای تست مدل‌های ارزان‌قیمت خود روی داده‌های واقعی استفاده کنید.
  • به جای تمرکز صرف بر کاهش هزینه، نرخ «بهره‌وری کیفیت» (Quality Gain per Dollar) را محاسبه کنید.
  • لایه‌ی کشینگ را پیش از پیاده‌سازی مسیریابی‌های پیچیده بررسی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

OmnisBench با ایجاد یک استاندارد شفاف و قابل تایید، مانع از فریب توسعه‌دهندگان توسط ادعاهای بازاریابی شرکت‌های AI می‌شود. این ابزار اعتبار (Authority) ارزیابی‌های مدل را از اسکرین‌شات‌های خصوصی به کدهای قابل بازبینی منتقل می‌کند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت بودجه ارزی و هزینه‌های بالای API مواجه‌اند، استفاده از این ابزار برای شناسایی دقیق‌ترین مدل ارزان‌قیمت (مانند GPT-5-nano) می‌تواند هزینه‌های عملیاتی را بدون افت کیفیت کاهش دهد.

·نگاه ما
تحریریه دات‌هوش

این ابزار فرضیه «جادوی مسیریابی» را به چالش می‌کشد و نشان می‌دهد که پیشرفت مدل‌های کوچک (SLM) در حال بلعیدن ارزش افزوده لایه‌های Routing است. وقتی مدل‌های نانو بتوانند ۹۵٪ کارها را انجام دهند، پیچیدگی پیاده‌سازی یک مسیریاب هوشمند دیگر توجیه اقتصادی ندارد و تمرکز باید روی بهینه‌سازی لایه‌ی کشینگ جابجا شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.