تصور کنید مدلی را انتخاب میکنید که در جدولهای رتبهبندی جهانی رتبه اول است، اما در مواجهه با دیتابیس SQL شرکت شما بهطور کامل شکست میخورد. این شکاف میان نمرات تئوریک و عملکرد واقعی، همان جایی است که بسیاری از استقرارهای سازمانی با شکست مواجه میشوند. برای پر کردن این شکاف، مجموعه Artificial Analysis — که به دلیل ارزیابیهای مستقل از مدلهای زبانی بزرگ (LLM) و پیادهسازی بنچمارکهایی مانند GDPval-AA و AA-Briefcase شناخته میشود — پلتفرم Optima را عرضه کرد. این ابزار به کاربران اجازه میدهد بهجای تکیه بر بنچمارکهای عمومی، محکهای اختصاصی خود را بر اساس دادههای واقعی و موارد استفادهی خاص سازمانشان بسازند.
بنچمارکهای عمومی اغلب ناکارآمد هستند چون بر تسکهای پیشفرض تکیه میکنند که پیچیدگیهای دنیای واقعی را بازتاب نمیدهند. به عنوان مثال، مدلی ممکن است در یک آزمون کدنویسی کلی عالی باشد، اما در مدیریت گویشهای خاص SQL یک شرکت یا پیامهای خطای منحصربهفرد آن ناتوان باشد. طبق گزارشهای فنی، این تفاوت باعث میشود تیمها مدلهای «ارزانتر» را مستقر کنند که بهطور خاموش گردشکار را مختل کرده و در نهایت هزینههای اصلاح دستی و تکرار مجدد تسکها را افزایش میدهند.
همانطور که در تحلیلهای قبلی ما دربارهی امنیت و پایداری مدلهای بازمتن اشاره کردیم، تکیه بر معیارهای کلی میتواند منجر به تصمیمات استراتژیک غلط در زیرساخت شود.
زمینه: شکست بنچمارکهای عمومی
پلتفرم Optima به دنبال حل مشکلی شناخته شده در ارزیابیهای AI است. تحلیلهای انجام شده توسط Epoch AI فاش کرد که نتایج بنچمارکها اغلب بر اساس جزئیات افشا نشدهای مثل نحوه نوشتن پرامپت یا تنظیمات دمای مدل (Temperature) — که شبیه به تنظیم درجهی خلاقیت یا سختگیری مدل است — بهشدت تغییر میکنند. در محکهای عاملمحور (Agentic) مانند SWE-bench، حتی تغییر ساده در نرمافزار کنترلکننده (Scaffold) میتواند نمرات را تا ۱۵ درصد جابهجا کند. این ناتوانی در بازتاب واقعیت را میتوان در شکست مدلهای پیشرو در مأموریتهای نظارتی Drone-Bench مشاهده کرد که نشان میدهد حتی قدرتمندترین مدلها در سناریوهای عملیاتی خاص دچار ضعف شدید میشوند.
علاوه بر این، مطالعهای روی ۴۴۵ مقاله بنچمارک در کنفرانسهای برتر AI نشان داد که تقریباً همه آنها ضعفهای متدولوژیک دارند. این ضعفها شامل تعاریف نامشخص، نمونههای غیرنماینده و فقدان اعتبارسنجی آماری بود. تنها حدود ۱۰ درصد از بنچمارکهای بررسی شده از تسکهای کامل دنیای واقعی استفاده کرده بودند که سناریوهای کاربردی واقعی را بازتاب دهد. مفاهیم کلیدی مانند استدلال (Reasoning) یا همراستاسازی (Alignment) اغلب بهدرستی تعریف نشده بودند که این امر قابلیت اطمینان به هرگونه نتیجهگیری را محدود میکرد.
جزئیات: ایجاد بنچمارکهای سفارشی
پلتفرم Optima سه مسیر متمایز برای ایجاد این تستهای سفارشی ارائه میدهد:
- یکپارچهسازی دادهها: کاربران میتوانند مجموعهدادههای ارزیابی موجود را از طریق فایلها یا Hugging Face آپلود کنند، یا ردپای عاملهای AI (Agent Traces) را از پلتفرمهایی مثل Arize، Braintrust یا Langfuse وارد کنند.
- ابزارهای توسعهدهنده: توسعهدهندگان میتوانند یک «مهارت» (Skill) تخصصی را نصب کنند که اطلاعات را مستقیماً از محیط کدنویسی و جلسات کاری گذشته آنها استخراج میکند. در این راستا، رقابت بر سر عملکرد در کدنویسی شدت یافته است، چنانکه اخیراً Claude Opus 5 در این حوزه از Fable 5 پیشی گرفت تا استانداردهای جدیدی برای توسعهدهندگان تعریف کند.
- تولید هدایتشده: برای کسانی که دادههای موجود ندارند، کاربر مورد استفاده مورد نظر خود را توصیف کرده و نمونههایی از ورودیها و خروجیها را ارائه میدهد. سپس Optima ورودیهای پیشنهادی برای تست، معیارهای ارزیابی و نمونه تسکها را برای بررسی و اصلاح کاربر تولید میکند.
این پلتفرم از دو روش امتیازدهی پشتیبانی میکند: ارزیابی بر اساس دستورالعملهای عینی (Rubric) و روش مقایسه زوجی (Pairwise). در روش مقایسه زوجی، که Artificial Analysis برای GDPval-AA و AA-Briefcase نیز از آن استفاده میکند، کاربران نمونهای از جفت-پاسخها را ارزیابی کرده و ترجیح خود را اعلام میکنند. سپس Optima رتبهبندی کامل را در کل مجموعهدادهی تست بر اساس این ترجیحات استخراج میکند.
نکته کلیدی این است که Optima هزینه و سرعت را بهعنوان معیارهای درجه اول (First-class metrics) میبیند. این ابزار بهجای قیمت هر توکن (Token) — که مثل تکههای کوچک متن است که مدل میخورد — هزینه و زمان واقعی برای «تکمیل یک تسک» را ردیابی میکند. در برنامههای عاملمحور، مدلی که ارزان است اما برای موفقیت به ۵ بار تلاش نیاز دارد، گرانتر از مدل پرمیومی است که در تلاش اول پیروز میشود. قیمت خام توکن به تنهایی اطلاعات بسیار کمی به توسعهدهنده میدهد، بهخصوص اگر مدل بیشتر شکست بخورد یا نیاز به کارهای اصلاحی اضافی داشته باشد. این رویکرد با این واقعیت همسو است که مدلهای زبانی کوچک به دلیل کاهش هزینههای استنتاج در حال تبدیل شدن به گزینههای جذابتری برای محیطهای عملیاتی هستند.
تستهای اولیه در این پلتفرم برای بهینهسازی عاملهای بخش حسابداری و مالی استفاده شد و مدلهایی کشف شدند که هزینهها را بدون افت کیفیت قابل توجه، تا ۱۰ برابر کاهش میدادند. کاربران دیگر مدلها را در برابر سبکهای نوشتاری خاص وکلا یا مجموعهدادههای تصویری اختصاصی آزمایش کردند تا از دقت آنها اطمینان حاصل کنند.
بر اساس اعلام Artificial Analysis، سیستم پرداخت در این پلتفرم بر اساس مصرف واقعی و بدون هیچ افزایشی روی هزینه توکنها است. ارزیابیهای دستورالعملمحور ۰.۱۲۵ دلار به ازای هر معیار برای هر مدل و ارزیابیهای زوجی ۰.۳۷۵ دلار برای هر مقایسه هزینه دارند. در ابتدای ایجاد بنچمارک، هر اجرا و هر دور ارزیابی، پلتفرم بر اساس یک تخمین هزینه، موجودی حساب را نگه میدارد.
با انتقال بنچمارک به دادههای خود کاربر، Optima شکستهای بنچمارکهای عمومی را دور میزند. با این حال، محکهای اختصاصی یک راهکار جادویی نیستند. کارایی یک تست همچنان به این بستگی دارد که قابلیتهای هدف با چه دقتی تعریف شدهاند، موارد تست تا چه حد نماینده واقعیت هستند و ارزیابی چگونه پیادهسازی و مستند شده است.
محدودیت دیگری نیز وجود دارد که باید در نظر گرفت. حتی هزینه و زمان هر تسک، ارزش واقعی خروجی برای کسبوکار را فاش نمیکند. یک گردشکار سریع و ارزان همچنان یک شکست محسوب میشود اگر خروجی آن نیاز به بازبینی سنگین انسانی داشته باشد یا ارزش کمی به فرآیندی که بخشی از آن است اضافه کند.
برای توسعهدهندگان، هدف دیگر یافتن «بهترین مدل جهان» نیست، بلکه یافتن بهینهترین مدل برای یک مخزن کد (Repo) و مجموعهای از عادتهای کاری خاص است. اندازهگیری تنها راهی است که میتوان از بحثهای نظری درباره اینکه آیا به یک عامل دسترسی به ابزارها بدهیم یا آن را محدود کنیم، عبور کرد.
گام بعدی شما
- اگر در حال استقرار عاملهای AI هستید، بهجای تکیه بر MMLU، یک مجموعه داده کوچک از شکستهای واقعی مدل خود در محیط عملیاتی جمعآوری کنید.
- هزینههای استنتاج را بر اساس «تعداد توکن» نه «تعداد تسکهای موفق» محاسبه کنید تا هزینه واقعی عملیاتی را بفهمید.
- از متد مقایسه زوجی برای کالیبره کردن مدلهای ارزانتر در برابر مدلهای پیشرو (Frontier) در تسکهای تکراری استفاده کنید.
اما تأثیر این تغییر رویکرد بر انتخاب سختافزارها حتی پیچیدهتر است — به تحلیل ما درباره بهینهسازی هزینههای استنتاج در لبه مراجعه کنید.




گفتگو