اگر امروز بر اساس رتبهبندیهای عمومی مدل هوش مصنوعی خود را انتخاب میکنید، احتمالاً در محیط عملیاتی با شکست مواجه خواهید شد. نمرات ترکیبی که به عنوان «هوش» مدل فروخته میشوند، در واقع بازتابی از بودجهٔ محاسباتی، نرمافزارهای پیرامونی و زمینهای هستند که مدل در آن قرار گرفته است.
به نقل از تحلیل جاسپریت سینگ که در ژوئیه ۲۰۲۶ منتشر شد، شرکتهایی که تنها به محکها (Benchmarks) تکیه میکنند، نقش حیاتی مهندسی سیستم را در تعیین قابلیت اطمینان محصول نادیده میگیرند. این تغییر دیدگاه درست زمانی رخ میدهد که صنعت از پرسشوپاسخهای ساده به سمت عاملهای هوش مصنوعی (AI Agents) حرکت میکند. سالها رقابت بر سر افزایش درصدها در تستهای ایستا بود، اما اکنون که هوش مصنوعی در گردشکارهای چندمرحلهای تجاری ادغام میشود، فاصله بین یک پاسخ «صیقلخورده» و یک محصول «قابل اتکا» بیش از هر زمان دیگری زیاد شده است.
زمینه و بستر تحلیل
پژوهش سینگ بر اساس این مشاهده شکل گرفت که توضیحات معمول برای پیشرفت هوش مصنوعی — مانند این ادعا که مدلها صرفاً بزرگتر شدهاند — با واقعیتهای موجود همخوانی ندارد. او همچنین دریافت که ادعای رایج مبنی بر اینکه «متنباز در حال پیروزی است»، تنها نیمی از حقیقت را بیان میکند و نمرات بنچمارکها بسیار کمتر از آنچه انتظار میرفت، مفید هستند.
او برای یافتن حقیقت، دادههای ۱۸ ماهه از ۴۶ مدل متعلق به ۸ آزمایشگاه مختلف را استخراج کرد. هدف او این بود که تعیین کند آیا هوش در حال تبدیل شدن به یک کالای عمومی (Commodity) است، آیا مدلهای باز در حال رسیدن به سطح مدلهای پیشرو (Frontier) هستند و شرکتها هنگام انتخاب سیستمهایی که قرار است بر پایه آنها محصول بسازند، واقعاً باید از چه معیارهایی استفاده کنند.
شکاف بنچمارکها
دادههای سینگ تضاد شدیدی را در نحوه اندازهگیری هوش برجسته میکند. وقتی مدلها را بهجای نمرات ترکیبی، تست به تست مقایسه میکنیم، شکاف بین مدلهای پیشرو تجاری و مدلهای وزنباز بسته به نوع تست بهشدت نوسان میکند.
در آزمون SWE-bench Verified که تستی قدیمیتر است و در بسیاری از معرفیهای مدلها دیده میشود، شکاف تنها ۰.۲ امتیاز است و تقریباً ناچیز است. اما در SWE-bench Pro — تستی جدیدتر که حول محور کارهای واقعی نرمافزاری، چندزبانه و با یک ساختار استاندارد طراحی شده — این شکاف به ۱۸.۲ امتیاز جهش میکند.
سایر یافتههای این تحلیل در مورد اشباع یا واگرایی تستها عبارتند از:
- GPQA Diamond: این تست اشباع شده است و سقف عملکرد در آن حدود ۹۲ تا ۹۵ درصد است (شکاف تنها ۲ امتیاز).
- Terminal-Bench 2.1: یک تست عاملمحور زنده که شکافی بین ۲.۱ تا ۴.۹ امتیاز را نشان میدهد.
- Humanity’s Last Exam: تستی برای استدلالهای پیشرو که شکافی ۹.۸ امتیازی دارد.
- SWE-bench Verified: اشباع شده و احتمال نشت داده (Contamination) در آن گزارش شده است (شکاف ۰.۲ امتیازی).
حتی یک مدل واحد بسته به ارزیاب، نتایج متفاوتی میدهد. مدل Kimi K3 در یک ارزیابی مستقل امتیاز ۸۰.۹٪ در Terminal-Bench 2.1 گرفت، اما سازندهاش عدد ۸۸.۳٪ را گزارش کرد. این نوسان ۷.۴ امتیازی، از تفاوت مدلهای باز و بسته در سه مورد از پنج بنچمارک تحلیلشده بیشتر است.
مکانیسمهای سیستمیک
این بیثباتی به این دلیل است که خروجی یک مدل توسط بودجهٔ استدلال (Reasoning Budget) و ابزارهایی که میتواند به آنها دسترسی داشته باشد، تعیین میشود. مدل دستورالعملها را از طریق نرمافزارهای پیرامونی دریافت میکند و از زمینههای (Context) خاصی بهره میبرد. اگر این شرایط تغییر کند، نتیجه نیز تغییر میکند.
این موضوع زمانی حیاتی میشود که هوش مصنوعی به سمت تکمیل توالیهایی از اقدامات حرکت میکند. در یک گردشکار ۲۰ مرحلهای، مدلی که در هر مرحله به صورت مجزا ۹۵٪ دقت دارد، در مجموع تنها ۳۶٪ شانس موفقیت در کل توالی را خواهد داشت. تفاوت بین شکست و پیروزی، بهندرت به تنهایی مربوط به خودِ مدل است، بلکه به مهندسی مربوط میشود که اجازه میدهد پیشرفت ذخیره شود، خروجیها تأیید شوند، تلاش مجدد (Retry) به صورت ایمن انجام شود و سیستم از خطاها بازیابی شود.
برای معماران فنی، این بدان معناست که بحث «باز در برابر بسته» یک تقابل کاذب است. مدلهای وزنباز اکنون برای کارهای کوتاهمدت و تعریفشده که نتایج آنها مستقیماً قابل اندازهگیری است — مانند طبقهبندی، استخراج، خلاصهسازی و تولید ساختاریافته — بسیار رقابتی هستند.
با این حال، مدلهای پیشرو (Frontier) همچنان برای تکالیف عاملمحور با افق زمانی طولانی و رعایت دستورالعملهای حساس که هزینهٔ شناسایی خطا در آنها بالاست، برتری دارند. این برتری در حالی است که غولهایی مانند OpenAI برای حفظ پیشتازی در لبهی تکنولوژی، بخش بزرگی از پژوهشهای خود را بر روی نسلهای آینده مانند GPT-7 و GPT-8 متمرکز کردهاند تا شکاف عملکردی را در وظایف پیچیده بیشتر کنند. در این حوزهها، شکاف عملکردی به ۱۸ امتیاز نزدیکتر است تا صفر، و لایه امنیتی که توسط فروشنده مدل ارائه میشود، ارزش قابل توجهی دارد.
اقتصاد هوش
علاوه بر این، اقتصاد هوش در حال تغییر است. در حالی که قابلیتهای عمومی در حال تبدیل شدن به کالای ارزان هستند، دستیابی به ۹ درصد نهایی از عملکرد پیک، تقریباً ۱۰ برابر بیشتر از تمام مراحل قبلی هزینه میبرد. اکثر سازمانها برای هر درخواست به قدرتمندترین مدل نیاز ندارند، بلکه به «قضاوت» نیاز دارند تا بدانند کدام تکلیف ارزش هزینهٔ محاسباتی بالا را دارد.
قضاوت — یعنی توانایی تشخیص یک سؤال غلط، تشخیص اینکه کدام یک از پنج پاسخ محتمل درست است، یا تصمیم برای توقف و پرسش از انسان — را نمیتوان به صورت توکن خرید. این قابلیت از طریق قوانین تجاری اختصاصی، دانش تاریخی و لایههای تأییدی که جلوی شکست را میگیرند، ساخته میشود.
استراتژی پیادهسازی
شرکتها باید مدلها را بر اساس نوع تکلیف انتخاب کنند، اما باید تشخیص دهند که تغییر مدل یک تصمیم معماری است، نه یک جابجایی رایگان. حافظه زمینه (Context)، استدلال و کشهای پرامپت (Prompt Caches) به راحتی بین ارائهدهندگان مختلف منتقل نمیشوند. یک مدل ارزانتر میتواند گرانتر تمام شود اگر تغییر سیستم باعث شود کارها از ابتدا شروع شوند یا لایههای نظارتی جدیدی اضافه شود.
برای پیشروی، سازمانها باید تکیه بر لیدربوردهای عمومی را متوقف کنند و مجموعههای ارزیابی خصوصی متشکل از ۵۰ تا ۲۰۰ تکلیف واقعی تجاری بسازند. با ثابت نگه داشتن سیستم پیرامونی و اندازهگیری «هزینه به ازای نتیجهٔ پذیرفتهشده» بهجای «هزینه به ازای توکن»، شرکتها میتوانند از گمراه شدن توسط مدلهایی که زمان بیشتری برای استدلال صرف میکنند یا نیاز به تلاشهای مجدد بیشتری دارند، جلوگیری کنند.
با تعداد کمی از مدلها شروع کنید و مسیریابی کارها را در ابتدای پروژه انجام دهید، بهجای اینکه در میانه راه ارائهدهنده را تغییر دهید. بار امنیتی و عملیاتی هر ارائهدهنده اضافی را در کنار قیمت آن محاسبه کنید. تنها بنچمارکی که واقعاً اهمیت دارد، بنچمارکی است که فقط شرکت شما میتواند آن را اجرا کند.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو