پرش به محتوای اصلی
پرش به محتوای مقاله

بنچمارک SWE Atlas: برتری مدل big-pickle بر تمامی رقبای غیررسمی

·۲۵ مرداد ۱۴۰۵۵ دقیقه مطالعه۳ بازدید
مدل مخفی OpenCode Zen با نام big-pickle، ۵۰.۸٪ در معیار SWE Atlas Codebase QnA Scale AI کسب کرد — نتایج کامل، گزارش‌ها و تنظی
مدل مخفی OpenCode Zen با نام big-pickle، ۵۰.۸٪ در معیار SWE Atlas Codebase QnA Scale AI کسب کرد — نتایج کامل، گزارش‌ها و تنظی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اثبات اینکه یک داربست ساده (bash-only) می‌تواند نرخ حل بالای ۵۰٪ را در کدبیس‌های پیچیده به دست آورد و نیاز به داربست‌های بومی و سنگین را زیر سوال ببرد.

۵۰.۸ درصد؛ این نرخ حل وظایفی است که مدل ناشناس big-pickle در محک پرسش‌وپاسخ کدبیس SWE Atlas به دست آورده است. طبق تحلیل فنی منتشر شده در گیت‌هاب در ۱۶ اوت ۲۰۲۶، این امتیاز مدل مذکور را بالاتر از تمامی ورودی‌های کلاس Mini-SWE-Agent در جدول رسمی قرار می‌دهد.

این پیشرفت در حالی رخ می‌دهد که صنعت به سمت عامل‌های (Agents) مهندسی نرم‌افزار خودمختار حرکت می‌کند که قادر به پیمایش در کدبیس‌های عظیم و ناشناخته هستند. این عامل‌ها باید بتوانند در محیط‌های پیچیده کدنویسی، مسیرهای درست را برای یافتن پاسخ‌ها پیدا کنند. همان‌طور که در تحلیل قبلی ما درباره‌ی استفاده DeepSeek از معماری‌های پلاگین برای مقیاس‌دهی به عامل‌های هوش مصنوعی اشاره کردیم، ظهور big-pickle نشان می‌دهد که مدل‌های کدنویسی با عملکرد بالا، پیش از انتشار رسمی، از طریق نقاط انتهایی (Endpoints) ناشناس در دسترس قرار می‌گیرند.

زمینه و محک‌زنی

این مدل در ۱۱ اوت ۲۰۲۶ با استفاده از داربست mini-swe-agent (نسخه ۲.۴.۶) و ابزار Harbor نسخه ۰.۱۸.۰ مورد ارزیابی قرار گرفت. این محک شامل ۱۲۴ وظیفه بدون تغییر از مجموعه داده SWE-Atlas است که تحت لایسنس Apache-2.0 منتشر شده است. در این ارزیابی از پیکربندی عامل mswea_qa_config.yaml ارائه شده توسط Scale AI استفاده شده است. این پیکربندی شامل قالب‌های خاص سیستم و نمونه (system/instance templates) است و محدودیت ۲۵۰ گام برای هر وظیفه را تعیین می‌کند.

این اجرا یک مقایسه دقیق «سیب با سیب» در کلاس داربست Mini-SWE-Agent فراهم می‌کند. در این دسته‌بندی، big-pickle از تمام ورودی‌های رسمی جدول امتیازات پیشی گرفته است. این مدل همچنین از تمامی ورودی‌های GPT که در داربست Codex اجرا شده‌اند، امتیاز بالاتری کسب کرد. در نهایت، تنها دو مدل Claude که روی داربست بومی Claude Code اجرا شده‌اند، توانستند امتیاز بالاتری به دست آورند و برتری خود را حفظ کنند.

تحلیل عملکرد مقایسه‌ای

در مقایسه مستقیم با جدول رسمی (به‌روزرسانی شده در ۲۸ ژوئیه ۲۰۲۶)، نرخ حل ۵۰.۸۱ درصدی big-pickle از چندین مدل مطرح عبور کرد:

  • GLM 5.2 (Mini-SWE-Agent): ۴۸.۱۲٪
  • GPT-5.6-Sol (Codex, xHigh): ۴۶.۰۰٪
  • GPT 5.5 (Codex, xHigh): ۴۵.۴۳٪

تنها داربست‌های بومی Claude Code برای مدل‌های Opus 5 و Opus 4.8 با امتیازات ۶۳.۱۷٪ و ۵۷.۲۶٪ به ترتیب، برتری خود را حفظ کردند.

تفکیک عملکرد

  • نرخ حل کلی: ۵۰.۸۱٪ (۶۳ از ۱۲۴ وظیفه)
  • نقاط قوت زبانی:
    • TypeScript: ۵۸.۱٪ (۱۸ از ۳۱ وظیفه)
    • Python: ۵۵.۲٪ (۱۶ از ۲۹ وظیفه)
    • Go: ۵۰.۰٪ (۱۹ از ۳۸ وظیفه)
    • C: ۳۸.۵٪ (۱۰ از ۲۶ وظیفه)
  • موفقیت در دسته‌ها:
    • آنبوردینگ کد (Code Onboarding): ۶۰.۷٪ (۱۷ از ۲۸ وظیفه)
    • معماری و طراحی سیستم: ۵۲.۳٪ (۲۳ از ۴۴ وظیفه)
    • تحلیل علت ریشه‌ای (Root-cause analysis): ۴۵.۹٪ (۱۷ از ۳۷ وظیفه)
    • امنیت: ۴۵.۵٪ (۵ از ۱۱ وظیفه)
    • استفاده از API و کتابخانه‌ها / یکپارچه‌سازی: ۲۵.۰٪ (۱ از ۴ وظیفه)

پیاده‌سازی فنی

ارزیابی در محیط‌های ایزوله‌شده (Sandboxes) Modal با منابع کاهش‌یافته (۴ CPU / ۸ GB) انجام شد تا با بودجه شخصی سازگار باشد، در حالی که وظایف معمولاً به ۱۶ CPU / ۱۶ GB نیاز دارند. با این حال، بررسی تمامی ۱۲۴ مسیر اجرای عامل نشان داد که هیچ‌کدام با خطای زمان (Timeout) یا محدودیت حافظه (Exit-137) مواجه نشدند؛ به این معنا که هیچ دستوری به سقف ۹۰۰ ثانیه یا حد حافظه نرسید.

داوری توسط مدل claude-opus-4-5-20251101 انجام شد که دقیقاً مطابق پروتکل Scale AI است و از طریق نقطه انتهایی سازگار با OpenAI شرکت Anthropic فراخوانی شد. مجموع توکن‌های مصرف‌شده به ۶۷۴ میلیون توکن ورودی و ۴.۳ میلیون توکن خروجی رسید که از طریق نقطه انتهایی سازگار با OpenAI در OpenCode Zen (openai/big-pickle) به صورت رایگان ارائه شد.

جزئیات اجرا

  • هزینه زیرساخت: کل این اجرا حدود ۷۰ دلار برای محاسبات Modal و ۲۵ دلار برای API داور Anthropic هزینه داشت. خودِ مدل در دوره ناشناس بودن (Stealth period) رایگان بود و هزینه‌ای برای استفاده از آن پرداخت نشد.
  • منطق امتیازدهی: از تاییدکننده مبتنی بر دستورالعمل (Rubric) خودِ بنچمارک استفاده شد. یک وظیفه تنها زمانی حل‌شده تلقی می‌شود که تمام موارد ضروری (must-have) دستورالعمل تایید شوند. تاییدکننده همچنین شامل منطقی برای معکوس کردن دستورالعمل‌هایی است که با قطبیت منفی (negative-polarity) علامت‌گذاری شده‌اند.
  • تکرارپذیری: این فرآیند با استفاده از مخزن عمومی SWE-Atlas و Harbor v0.18.0 قابل تکرار است. پیکربندی‌های ارائه شده شامل اسکریپت‌های run_config/qa و یک فایل preflight.sh برای بررسی‌های احراز هویت و نقطه انتهایی است تا دیگران بتوانند نتایج را بازبینی کنند.

ملاحظات حیاتی

نتایج با محدودیت‌هایی همراه است. این اجرا از یک تلاش برای هر وظیفه (-k 1) استفاده کرد، نه میانگین سه تلاش رسمی که در بنچمارک‌های استاندارد رایج است. در تعداد ۱۲۴ نمونه، این موضوع خطای استاندارد تقریبی ±۴.۵ امتیازی ایجاد می‌کند که با حاشیه خطای جدول رسمی (±۵) سازگار است.

علاوه بر این، ارزیابی به‌صورت خودگزارشی بوده و توسط Scale AI تایید نشده است. همچنین دو وظیفه (task-...ba9ad و task-...baa1d) وجود داشت که خروجی داور آن‌ها غیرقابل تجزیه (unparseable) بود. اگر این موارد را شکست تلقی کنیم، نرخ حل به یک حد پایین‌تر سخت‌گیرانه یعنی ۴۹.۲٪ (۶۱ از ۱۲۴) می‌رسد که همچنان از تمام ورودی‌های Mini-SWE-Agent بیشتر است.

از منظر فنی، این نتیجه این فرض را به چالش می‌کشد که تنها داربست‌های یکپارچه و بومی (مانند Claude Code) می‌توانند از مرز ۵۰٪ در پرسش‌وپاسخ پیچیده کدبیس عبور کنند. اگر یک داربست ساده مبتنی بر bash بتواند به این اعداد برسد، گلوگاه کدنویسی هوش مصنوعی از «ابزارهای» عامل به قابلیت‌های استدلال (Reasoning) و بازیابی مدل زیربنایی منتقل می‌شود. این تمرکز بر قدرت استدلال، مشابه تحلیل‌های اخیر ماست که در آن عملکرد مدل Qwen3.8 Max در برابر رقبا بررسی شد و نشان داد که استدلال قوی‌تر لزوماً با فقدان توهم همراه نیست.

همچنین شواهد قوی درباره منشأ مدل وجود دارد. خطاهای ارائه‌دهنده (provider errors) و امضاهای API نشان می‌دهد که big-pickle احتمالاً توسط زیرساخت‌های DeepSeek سرویس‌دهی می‌شود، هرچند این موضوع رسماً تایید نشده است. این امر با روند ظهور مدل‌های استدلالی با بهره‌وری بالا از این آزمایشگاه همسو است.

توسعه‌دهندگان باید نقطه انتهایی OpenCode Zen را برای تغییرات احتمالی در هویت مدل زیر نظر داشته باشند، زیرا وزن‌های مدل زیربنایی ممکن است بدون اطلاع قبلی تغییر کنند. لاگ‌های کامل تاییدکننده و پیکربندی‌های تکرارپذیری — شامل اسکریپت‌های run_config/qa و بررسی‌های preflight.sh — اکنون برای بازرسی مستقل در گیت‌هاب در دسترس است.

چرا این موضوع مهم است؟

این دستاورد بر اساس اعتبار بنچمارک SWE Atlas نشان می‌دهد که مدل‌های استدلالی اکنون می‌توانند بدون نیاز به یکپارچگی عمیق با IDE، در کدبیس‌های واقعی عمل کنند. این موضوع هزینه توسعه عامل‌های کدنویسی را به شدت کاهش می‌دهد.

تأثیر برای ایران

دسترسی به مدل big-pickle از طریق OpenCode Zen برای توسعه‌دهندگان ایرانی که با محدودیت‌های API مدل‌های تراز اول مواجه‌اند، فرصتی برای تست رایگان یک مدل سطح بالا در مهندسی نرم‌افزار است.

·نگاه ما
تحریریه دات‌هوش

عبور از مرز ۵۰٪ در SWE Atlas بدون استفاده از داربست‌های پیچیده، نشان می‌دهد که قدرت استدلال مدل‌های جدید در حال جبران کمبودهای ابزاری است. اگر حدس ما درست باشد و این مدل متعلق به DeepSeek باشد، یعنی فاصله بین مدل‌های باز و بسته در حوزه کدنویسی به شدت در حال بسته شدن است. این تغییر پارادایم یعنی تمرکز توسعه‌دهندگان باید از ساخت ابزارهای پیچیده برای عامل‌ها به سمت بهینه‌سازی بازیابی داده‌ها در مدل‌های استدلالی منتقل شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.