پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Laguna S 2.1 با امتیاز ۷۸.۵٪ صدرنشین SWE-Bench چندزبانه شد

·۳۱ تیر ۱۴۰۵۵ دقیقه مطالعه۱ بازدید
انتشار Laguna S 2.1 توسط Poolside: مدل کدنویسی هوشمند چندزبانه با عملکرد برتر در معیار SWE-Bench
انتشار Laguna S 2.1 توسط Poolside: مدل کدنویسی هوشمند چندزبانه با عملکرد برتر در معیار SWE-Bench
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی تعداد پارامترهای فعال با افزایش محاسبات در زمان پاسخ‌دهی؛ مدل Laguna S 2.1 با ۶.۸٪ پارامتر فعال، در برخی بنچمارک‌ها مدل‌هایی با پارامترهای بسیار بیشتر را شکست داده است.

دستیابی به امتیاز ۷۸.۵ درصد در کدنویسی عامل‌محور چندزبانه، استاندارد جدیدی را تعریف کرده است. طبق گزارش فنی شرکت Poolside، مدل Laguna S 2.1 با ۱۱۸ میلیارد پارامتر، اکنون توانسته است سامانه‌هایی را که ۱۰ برابر حجیم‌تر از آن هستند، در عمل شکست دهد.

این عرضه در حالی رخ می‌دهد که صنعت از تکمیل سادهٔ کد به‌سمت گردش‌های کاری عامل‌محور (Agentic) — جایی که هوش مصنوعی به‌طور مستقل برنامه‌ریزی، اجرا و بازبینی می‌کند — حرکت می‌کند. اگرچه مدل‌های بسته‌ای مثل Claude Fable 5 و Kimi K3 هنوز در چندین بنچمارک پیشتاز هستند، اما شکاف بین آن‌ها و مدل‌های وزن‌باز (Open Weights) که به‌طور خاص برای «افق‌های بلند» مهندسی نرم‌افزار بهینه شده‌اند، به‌سرعت در حال کاهش است.

زمینه و خاستگاه

Laguna S 2.1 در واقع نسخه‌ی مقیاس‌یافته‌ی خانواده‌ی Laguna XS است. این مدل با استفاده از همان داده‌های پیش‌آموزش (Pre-training data) که در نسخه XS 2.1 به کار رفته بود، آموزش دیده است. چرخه توسعه این مدل به‌شدت تهاجمی بود؛ به طوری که از شروع عملیات آموزش تا لحظه عرضه تنها کمتر از ۹ هفته زمان برد.

بر اساس مستندات شرکت، آموزش این مدل رسماً در ۲۲ مه ۲۰۲۶ آغاز شد. در این فرآیند از یک خوشه‌ی محاسباتی عظیم شامل ۴۰۹۶ واحد پردازش گرافیکی NVIDIA H200 استفاده گردید. این اتفاق یک نقطه عطف فنی برای Poolside محسوب می‌شود، زیرا این اولین مدل در خط تولید آن‌ها است که در آن یادگیری تقویتی (Reinforcement Learning) با دقت FP8 اجرا شده است.

معماری و مقیاس

از نظر معماری، این مدل از نوع ترکیب خبره‌ها (Mixture-of-Experts یا MoE) است. با وجود اینکه ۱۱۸ میلیارد پارامتر کل در حافظه مستقر هستند، اما در هر توکن (Token) تنها حدود ۸ میلیارد پارامتر (۶.۸٪) فعال می‌شوند. این خاصیت پراکندگی (Sparsity) باعث می‌شود مدل در حالی که عملکردی در سطح مدل‌های پیشرو دارد، هزینه‌ی سرویس‌دهی آن مقرون‌به‌صرفه باقی بماند.

برای دسترسی گسترده و تسهیل در پیاده‌سازی، تیم Poolside وزن‌ها را در قالب‌های مختلف BF16، FP8، INT4 و NVFP4 منتشر کرده است. آن‌ها همچنین تبدیل‌های رسمی GGUF و MLX و مدل‌های پیش‌نویس DFlash را برای بهینه‌سازی بیشتر سرعت استنتاج (Inference) ارائه داده‌اند.

بنچمارک‌های عملکردی

در مقایسه‌های رودروبه‌رو، Laguna S 2.1 بسیار فراتر از اندازه خود عمل کرده و در برابر غول‌هایی مثل Nemotron 3 Ultra انویدیا، Inkling از شرکت Thinking Machines و DeepSeek-V4-Pro-Max ایستادگی کرده است. در این میان، رقابت با مدل‌هایی چون Inkling که به دلیل پیشتازی در عملیات‌های عامل‌محور مورد توجه قرار گرفته بود، نشان‌دهنده سطح بالای توانمندی Laguna S 2.1 است:

  • SWE-Bench Multilingual: امتیاز ۷۸.۵٪ (صدرنشین مطلق جدول منتشر شده و پیشی گرفتن از Hy3 تنسنت با ۷۵.۸٪).
  • Terminal-Bench 2.1: امتیاز ۷۰.۲٪ با فعال‌سازی حالت تفکر (اولین مدل وزن‌باز با اندازه افشا شده در رتبه‌های بالا، هرچند پایین‌تر از سامانه‌های بسته مثل Muse Spark 1.1 با ۸۰.۰٪ و Claude Fable 5 با ۸۸.۰٪ است).
  • DeepSWE v1.1: امتیاز ۴۰.۴٪، در حالی که مقدار مشابه برای DeepSeek-V4-Pro-Max تنها ۹.۰٪ است.
  • SWE-Bench Pro (Public): امتیاز ۵۹.۴٪.
  • SWE Atlas (Codebase QnA): امتیاز ۴۶.۲٪.
  • Toolathlon Verified: امتیاز ۴۹.۷٪.

تکان‌دهنده‌ترین سیگنال در آزمون DeepSWE v1.1 یافت می‌شود؛ جایی که Laguna S 2.1 به دقت ۴۰.۴٪ دست یافته، در حالی که تنها از حدود یک‌ششم پارامترهای فعالِ مدل DeepSeek-V4-Pro-Max استفاده می‌کند.

مکانیسم «تفکر» (Thinking)

این مدل دارای دو حالت است: «خاموش» (off) و «حداکثر» (max). در حالت max که به‌صورت پیش‌فرض فعال است، مدل بودجه‌ی محاسباتی زمان تست (Test-time compute budget) را خودش تعیین می‌کند. در حال حاضر Poolside این قابلیت را بدون کنترل‌های قابل تنظیم توسط کاربر (مانند سطح تلاش پایین/متوسط/بالا) عرضه کرده است.

این قابلیت «تفکر» جهش‌های چشمگیری در عملکرد ایجاد می‌کند:

  • در Terminal-Bench 2.1، امتیاز از ۶۰.۴٪ (در حالت خاموش) به ۷۰.۲٪ (در حالت حداکثر) افزایش یافت.
  • در DeepSWE، دقت از ۱۶.۵٪ (خاموش) به ۴۰.۴٪ (حداکثر) جهش کرد.

البته این دستاوردها با هزینه توکن همراه است. مسیرهای (Trajectories) مدل در DeepSWE در حالت تفکر به تقریباً ۲۴۹ هزار توکن خروجی نیاز دارند، در حالی که در حالت عادی این رقم تنها ۹۹ هزار توکن است. با این وجود، Poolside گزارش می‌دهد که مدل می‌تواند استدلال‌های منسجم و سازنده را برای ساعت‌ها و در بازه‌ی صدها هزار توکن حفظ کند.

مسیرهای عملیاتی در دنیای واقعی

شرکت Poolside سه مسیر عملیاتی بدون ویرایش را برای نمایش رفتار خودگردان مدل به اشتراک گذاشت:

  • ساخت موتور مرورگر: مدل یک موتور مرورگر HTML/CSS فعال را از یک پوشه کاملاً خالی ساخت. این فرآیند شامل ۱۸۱ مرحله در یک جلسه ۵۰ دقیقه‌ای بود. این عملیات بدون هیچ دخالت انسانی پیش رفت و مدل خروجی خود را در برابر Chromium بدون سر (Headless) اعتبارسنجی کرد.
  • بهینه‌سازی Harness: مدل سیستم عامل Agent خودِ Poolside را بهینه کرد. مدل با جایگزینی الحاق رشته‌ها (string concatenation) با پیچیدگی $O(n^2)$ توسط بافرها، سرعت اجرا را ۵.۲٪ افزایش و تخصیص حافظه را تقریباً ۷۱٪ کاهش داد.
  • بازکشف ریاضی: مدل مسئله شماره ۳۹۷ اردوش (Erdős Problem #397) را به‌صورت آفلاین در زبان Perl طی ۶۸ دقیقه حل کرد، زیرا محیط Sandbox پایتون نداشت. این یک بازکشف مستقل بود؛ زیرا در حالی که GPT-5.2 Pro این مسئله را در ژانویه ۲۰۲۶ حل کرده بود، تاریخ قطع دانش (Knowledge cutoff) مدل Laguna نوامبر ۲۰۲۵ است.

استقرار و دسترسی

این مدل از یک پنجره زمینه (Context Window) عظیم ۱ میلیون توکنی در هر دو حالت تفکر و بدون تفکر پشتیبانی می‌کند. به دلیل اینکه هر خبره در معماری MoE باید در حافظه باقی بماند، سایز مدل بر اساس کل ۱۱۸ میلیارد پارامتر محاسبه می‌شود. این رویکرد به طور مستقیم چالش‌هایی را که پیش‌تر در مورد محدودیت حافظه در عامل‌های محلی برای کدنویسی بحث شده بود، هدف قرار می‌دهد:

  • ۴ بیتی (NVFP4/INT4): حدود ۵۹ گیگابایت. این حجم به‌طور راحت در ۱۲۸ گیگابایت حافظه یکپارچه یک NVIDIA DGX Spark جای می‌گیرد.
  • FP8: حدود ۱۱۸ گیگابایت. این مدل در یک واحد Spark یا یک GPU H200 جای می‌گیرد.
  • BF16: حدود ۲۳۶ گیگابایت. این حالت نیازمند دو Spark متصل یا یک گره دیتاسنتر با چندین GPU است.

Poolside برای بهینه‌سازی استنتاج از طریق TRT-LLM برای خروجی NVFP4 روی سخت‌افزارهای Blackwell با انویدیا همکاری کرده است. پشتیبانی از روز اول برای vLLM، SGLang و Ollama در دسترس است. دسترسی میزبانی شده از طریق OpenRouter (رایگان تا ۲۵۶ هزار توکن زمینه؛ پولی برای ۱ میلیون توکن با نرخ ۰.۱۰ / ۰.۲۰ / ۰.۰۱ دلار به‌ازای هر ۱ میلیون توکن ورودی/خروجی/کش)، و همچنین Baseten، Kilo، Prime Intellect Prime Lab و ZML فراهم است.

یکپارچه‌سازی هوش مصنوعی عامل‌محور

فراتر از خود مدل، Poolside بر جریان‌های کاری واقعاً عامل‌محور تأکید دارد. دموهای آن‌ها شامل یک عامل بازمنبع است که یک محیط زنده را مدیریت می‌کند و از یک حلقه واقعی LangGraph برای درک، برنامه‌ریزی، اقدام و بازبینی استفاده می‌کند. این سیستم از حافظه عامل از طریق سه لایه روی MongoDB Atlas با بازیابی جست‌وجوی برداری (Vector Search) بهره می‌برد. این چارچوب تحت لایسنس MIT منتشر شده و با دستور uv run python scripts/smoke_test.py قابل اجرا است.

این عرضه، این پیش‌فرض را که برای استدلال‌های سطح بالای عامل‌محور حتماً به تعداد پارامترهای عظیم نیاز است، تغییر می‌دهد. Poolside نشان داد که مدل‌های «میان‌اندازه» اگر ترکیب پراکندگی MoE را با محاسبات تهاجمی زمان تست همراه کنند، می‌توانند در بنچمارک‌های فنی تخصصی غالب شوند.

توسعه‌دهندگان اکنون باید ارزیابی کنند که آیا هزینه توکن‌های حالت «max thinking» در برابر افزایش بهره‌وری هنگام یکپارچه‌سازی Laguna S 2.1 در خط لوله‌های CI/CD خودکار، توجیه‌پذیر است یا خیر.

چرا این موضوع مهم است؟

این مدل با تکیه بر تخصص در معماری MoE و بهینه‌سازی‌های سخت‌افزاری، اثبات کرد که مدل‌های وزن‌باز می‌توانند در وظایف پیچیده مهندسی نرم‌افزار با مدل‌های بسته رقابت کنند. این موضوع اعتبار مدل‌های میان‌اندازه را در کاربردهای صنعتی افزایش می‌دهد.

تأثیر برای ایران

به دلیل وزن‌باز بودن مدل و پشتیبانی از فرمت‌های کوانتیده (INT4)، توسعه‌دهندگان ایرانی می‌توانند آن را روی سخت‌افزارهای محدودتر میزبانی کنند و برای ساخت عامل‌های کدنویسی محلی از آن بهره ببرند.

·نگاه ما
تحریریه دات‌هوش

پیروزی Laguna S 2.1 در DeepSWE نشان می‌دهد که «مقیاس پارامترها» دیگر تنها متغیر تعیین‌کننده در کیفیت کدنویسی نیست، بلکه «بودجه محاسباتی زمان استنتاج» (Test-time Compute) کلید اصلی است. این مدل ثابت کرد که با فعال کردن زنجیره تفکر طولانی، یک مدل میان‌اندازه می‌تواند عملکرد مدل‌های غول‌پیکر را شبیه‌سازی کند. در واقع، ما از عصر «بزرگ‌تر باش تا 똑똑‌تر باشی» به عصر «بیشتر فکر کن تا دقیق‌تر باشی» وارد می‌شویم.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.