پرش به محتوای اصلی
پرش به محتوای مقاله

Benzi هزینهٔ رفع باگ‌های واقعی را به زیر ۱۰ سنت کاهش داد

·۲۰ شهریور ۱۴۰۵۲ دقیقه مطالعه
نمودار مقایسه عملکرد Benzi در برابر سایر معیارهای ارزیابی هوش مصنوعی
نمودار مقایسه عملکرد Benzi در برابر سایر معیارهای ارزیابی هوش مصنوعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی معیاری جدید برای ارزیابی عامل‌های کدنویس که در آن «هزینه به ازای هر باگ» و «شیب رشد هزینه» جایگزین نرخ موفقیت ساده شده است.

تصور کنید یک برنامه‌نویس ارشد بتواند صدها باگ پیچیده را با هزینه‌ای کمتر از یک فنجان قهوه برطرف کند. این ادعایی نیست، بلکه نتیجهٔ عملکرد سامانه Benzi در یکی از سخت‌ترین محک‌های دنیای واقعی است.

طبق داده‌های منتشر شده در ۱۱ سپتامبر ۲۰۲۶ در وب‌سایت benzi.fly.dev، این ابزار توانسته است ۷۸.۲٪ از ۵۰۰ مسئلهٔ واقعی در بنچمارک SWE-bench Verified را حل کند، در حالی که هزینهٔ هر اصلاحیه زیر ۱۰ سنت بوده است. این رقم یک جهش خیره‌کننده در بهره‌وری است، زیرا اکثر عامل‌های (Agents) فعلی با مشکل «تورم توکن» دست‌وپنجه نرم می‌کنند؛ یعنی هرچه باگ پیچیده‌تر می‌شود، مدل حجم عظیمی از کدهای نامرتبط را می‌خواند و هزینهٔ استنتاج (Inference) را به‌شدت بالا می‌برد. این رویکرد در راستای جریانی است که در آن تست‌های محلی کدنویسی به دلیل دقت بیشتر، در حال جایگزینی بنچمارک‌های عمومی هوش مصنوعی هستند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی هزینه‌های مدل‌های زبانی اشاره کردیم، کاهش مصرف توکن بدون افت کیفیت، کلید مقیاس‌پذیری در محیط‌های تولیدی است. Benzi با استفاده از هوش مصنوعی بومی برای کد، شاخص «خطوط کد خوانده‌شده» را بهینه می‌کند تا حجم داده‌های ورودی با دشواری باگ، رابطهٔ خطی نداشته باشد. این بهینه‌سازی در لایه‌های پایین‌تر، یادآور معماری ReclaimLLM است که با ثبت تغییرات فایل‌ها در لایه‌ی بومی، تعاملات توسعه‌دهنده و هوش مصنوعی را به شکل دقیق‌تری مدیریت می‌کند.

معیارهای عملکرد

بررسی فنی ۲۴ مسئلهٔ گیت‌هاب در ۱۰ زبان برنامه‌نویسی، یافته‌های کلیدی زیر را نشان می‌دهد:

  • بهره‌وری هزینه: اجراهای مبتنی بر DeepSeek به دلیل هزینهٔ توکن بسیار پایین‌تر (حدود ۲۰ برابر کمتر از مدل‌های رقیب)، یک مرتبه ارزان‌تر از اجراهای مبتنی بر Sonnet بودند.
  • شیب مقیاس‌پذیری: در حالی که هزینهٔ ابزاری مثل Claude Code با افزایش دشواری باگ به‌سرعت بالا می‌رود، Benzi شیب هزینهٔ بسیار ملایم‌تری را حفظ می‌کند.
  • زمان اجرا: زمان ثبت‌شده در این گزارش شامل زمان ساخت ایندکس برای هر مخزن (Repo) است که داده‌ها را واقعی‌تر می‌کند.

محدودیت‌های فنی

به نقل از مستندات این پروژه، تمام مدل‌ها موفق به پوشش کامل نشدند؛ برای مثال، مدل Sonnet در حل باگ http-parser شکست خورد و مدل DeepSeek نتوانست nats-server را اجرا کند. با این حال، رویکرد Benzi در حذف خروجی‌های grep و shell از شمارش «خواندن فایل»، سربارهای غیرضروری را به‌طور چشم‌گیری کاهش داده است.

این تغییر در نحوهٔ ارزیابی نشان می‌دهد که صنعت از تمرکز بر «نرخ موفقیت خام» به سمت «عملکرد تعدیل‌شده بر اساس بهره‌وری» حرکت می‌کند. برای توسعه‌دهندگان، این یعنی گلوگاه دیگر فقط قدرت استدلال مدل نیست، بلکه توانایی سامانه در شناسایی جراحی‌گونهٔ کدهای مرتبط بدون تخلیه بودجه است. مشابه این رویکرد در بهینه‌سازی ساختارهای نظارتی دیده می‌شود، جایی که استفاده از هارنس‌های سفارشی انویدیا توانست دقت مدل Claude Opus 5 را به ۱۰۰٪ برساند.

گام بعدی شما

  • اگر از عامل‌های کدنویس استفاده می‌کنید، میزان توکن‌های مصرف‌شده برای خواندن فایل‌های نامرتبط را پایش کنید.
  • برای مقایسه شیب هزینه در مدل‌های مختلف، بنچمارک‌های تعاملی در benzi.fly.dev/about را بررسی کنید.
  • استراتژی‌های کاهش خوانش کد (مانند فیلتر کردن خروجی‌های شل) را در گردش‌کارهای خود پیاده کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار بنچمارک SWE-bench ثابت می‌کند که هزینهٔ استقرار عامل‌های کدنویس در مقیاس صنعتی می‌تواند به شدت کاهش یابد. این موضوع باعث می‌شود شرکت‌ها به‌جای تکیه بر مدل‌های گران‌قیمت، به سراغ ترکیب مدل‌های بهینه و سامانه‌های بازیابی دقیق بروند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت بودجهٔ ارزی و هزینه‌های بالای API مواجه‌اند، استفاده از مدل‌های بهینه مانند DeepSeek در کنار سامانه‌هایی شبیه به Benzi، تنها راه عملی برای پیاده‌سازی عامل‌های کدنویس در مقیاس واقعی است.

·نگاه ما
تحریریه دات‌هوش

تمرکز بر «شیب هزینه» به‌جای «درصد موفقیت»، پارادایم جدیدی در ارزیابی عامل‌های هوشمند است. این یعنی برندهٔ نهایی بازار، لزوماً هوشمندترین مدل نیست، بلکه سیستمی است که بتواند با کمترین دادهٔ ورودی، دقیق‌ترین خروجی را تولید کند. در واقع، مهندسیِ لایهٔ بازیابی داده (Retrieval) اکنون اهمیت بیشتری نسبت به اندازهٔ پارامترهای مدل پیدا کرده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.