پرش به محتوای اصلی
پرش به محتوای مقاله

بنچمارک ITBench-AA: نرخ موفقیت مدل‌های پیشرو در وظایف SRE کمتر از ۵۰٪ است

·۶ خرداد ۱۴۰۵۳ دقیقه مطالعه
اشتراک‌گذاری

اگر امروز قصد دارید مدیریت خوشه‌های کوبرنتیز خود را به عامل‌های هوش مصنوعی (AI Agents) بسپارید، باید بدانید که حتی پیشرفته‌ترین مدل‌های جهان در نیمی از موارد دچار شکست می‌شوند. طبق گزارشی که در ۲۷ مه ۲۰۲۶ منتشر شد، بنچمارک جدید ITBench-AA نشان می‌دهد هیچ مدلی هنوز نتوانسته است از مرز ۵۰٪ دقت در وظایف مهندسی قابلیت اطمینان سایت (SRE) عبور کند.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی چالش‌های استقرار عامل‌های خودکار اشاره کردیم، صنعت اکنون از چت‌بات‌های ساده به سمت سیستم‌های عامل‌محور حرکت می‌کند. به همین دلیل، IBM Research و Artificial Analysis این مجموعه آزمون را طراحی کردند تا توانایی مدل‌ها در تشخیص عیب سیستم‌های زنده، تحلیل لاگ‌ها و شناسایی علت ریشه‌ای (Root Cause) در زیرساخت‌های پیچیده را بسنجند.

image

این بنچمارک شامل ۵۹ وظیفه SRE بر اساس نماهای واقعی حوادث در کوبرنتیز (Kubernetes) است. بر اساس مستندات منتشر شده، نتایج برترین‌ها به شرح زیر است:

  • Claude Opus 4.7 (در حالت Adaptive Reasoning): ۴۷٪
  • GPT-5.5 (در حالت xhigh): ۴۶٪
  • Qwen3.7 Max: ۴۲٪
  • GLM-5.1 (مدل استدلالی): ۴۰٪
  • Gemma 4 31B (مدل استدلالی): ۳۷٪

این نتایج تأیید می‌کند که مدل‌های پیشرو همچنان با محدودیت‌های استدلالی جدی روبرو هستند؛ چنان‌که کالبدشکافی خطاهای سیستمی در GPT-5.5 و Opus 4.7 نشان داد که برخی توابع منطقی حتی در پیشرفته‌ترین معماری‌ها نیز با شکست مواجه می‌شوند.

image

ارزیابی‌های فنی از طریق ابزار متن‌باز Stirrup یک پارادوکس بحرانی را فاش کرد: طولانی‌تر شدن مسیر استدلال لزوماً به معنای نتایج بهتر نیست. به نقل از داده‌های این ابزار، مدل Gemini 3.1 Pro Preview به‌طور متوسط ۸۳ گام برای هر وظیفه طی کرد اما تنها ۳۰٪ دقت داشت، در حالی که Gemma 4 31B با ۵۸ گام به دقت ۳۷٪ رسید.

image

مدل‌هایی که «بیش از حد بررسی» می‌کنند، تمایل دارند علائم هم‌زمان یا مکانیسم‌های تزریق خطا را به جای علت اصلی شناسایی کنند که در سیستم امتیازدهی به عنوان مثبت کاذب (False Positive) جریمه می‌شوند. این نشان می‌دهد مدل‌های استدلالی (Reasoning Models) فعلی در تفکیک محرک‌های علی از اثرات ثانویه در توپولوژی‌های پیچیده سیستم دچار مشکل هستند.

image

از منظر بهره‌وری هزینه، مدل‌های با وزن‌های باز (Open Weights) در حال حاضر برتری دارند. Gemma 4 31B هم در دقت و هم در هزینه از Gemini 3.1 Pro Preview پیشی گرفت؛ به‌طوری که هزینه هر وظیفه در مدل گوگل تنها ۰.۱۴ دلار بود، در حالی که برای مدل Gemini این رقم ۲.۲۳ دلار است. در مقابل، Claude Opus 4.7 با ۵.۳۸ دلار گران‌ترین گزینه است. این تضاد میان هزینه و کارایی، یادآور تحلیل‌های ما درباره‌ی مدل Claude Mythos بود که با وجود قدرت بالا در اکسپلویت‌های مرورگر، هزینه‌ای ۱۲ برابر بیشتر را طلب می‌کرد.

image

این داده‌ها ما را مجبور می‌کند نگاه خود را به قابلیت‌های استدلال تغییر دهیم؛ صرفاً افزایش محاسبات (Compute) در زمان استنتاج (Inference) یا افزایش تعداد گام‌ها ممکن است در محیط‌های IT با دقت بالا، عملکرد عامل را تخریب کند.

گام بعدی شما

  • اگر از مدل‌های استدلالی برای عیب‌یابی استفاده می‌کنید، تعداد گام‌های تفکر را محدود کنید تا از «بیش‌بررسی» و توهم جلوگیری شود.
  • برای کاهش هزینه‌ها، مدل‌های با وزن‌های باز مانند Gemma 4 را در محیط‌های ایزوله تست کنید.
  • منتظر گسترش ITBench-AA به حوزه‌های FinOps و وظایف CISO باشید تا متوجه شوید این شکاف عملکردی در سایر دامنه‌های سازمانی نیز وجود دارد یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این نتایج نشان می‌دهد که اعتماد به عامل‌های خودکار برای مدیریت زیرساخت‌های حیاتی هنوز زود است. اعتبار این یافته‌ها بر اساس ارزیابی‌های سخت‌گیرانه در محیط‌های واقعی است که ریسک عملیاتی را برجسته می‌کند.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.