دستیابی به امتیاز ۷۸.۵ درصد در کدنویسی عاملمحور چندزبانه، استاندارد جدیدی را تعریف کرده است. طبق گزارش فنی شرکت Poolside، مدل Laguna S 2.1 با ۱۱۸ میلیارد پارامتر، اکنون توانسته است سامانههایی را که ۱۰ برابر حجیمتر از آن هستند، در عمل شکست دهد.
این عرضه در حالی رخ میدهد که صنعت از تکمیل سادهٔ کد بهسمت گردشهای کاری عاملمحور (Agentic) — جایی که هوش مصنوعی بهطور مستقل برنامهریزی، اجرا و بازبینی میکند — حرکت میکند. اگرچه مدلهای بستهای مثل Claude Fable 5 و Kimi K3 هنوز در چندین بنچمارک پیشتاز هستند، اما شکاف بین آنها و مدلهای وزنباز (Open Weights) که بهطور خاص برای «افقهای بلند» مهندسی نرمافزار بهینه شدهاند، بهسرعت در حال کاهش است.
زمینه و خاستگاه
Laguna S 2.1 در واقع نسخهی مقیاسیافتهی خانوادهی Laguna XS است. این مدل با استفاده از همان دادههای پیشآموزش (Pre-training data) که در نسخه XS 2.1 به کار رفته بود، آموزش دیده است. چرخه توسعه این مدل بهشدت تهاجمی بود؛ به طوری که از شروع عملیات آموزش تا لحظه عرضه تنها کمتر از ۹ هفته زمان برد.
بر اساس مستندات شرکت، آموزش این مدل رسماً در ۲۲ مه ۲۰۲۶ آغاز شد. در این فرآیند از یک خوشهی محاسباتی عظیم شامل ۴۰۹۶ واحد پردازش گرافیکی NVIDIA H200 استفاده گردید. این اتفاق یک نقطه عطف فنی برای Poolside محسوب میشود، زیرا این اولین مدل در خط تولید آنها است که در آن یادگیری تقویتی (Reinforcement Learning) با دقت FP8 اجرا شده است.
معماری و مقیاس
از نظر معماری، این مدل از نوع ترکیب خبرهها (Mixture-of-Experts یا MoE) است. با وجود اینکه ۱۱۸ میلیارد پارامتر کل در حافظه مستقر هستند، اما در هر توکن (Token) تنها حدود ۸ میلیارد پارامتر (۶.۸٪) فعال میشوند. این خاصیت پراکندگی (Sparsity) باعث میشود مدل در حالی که عملکردی در سطح مدلهای پیشرو دارد، هزینهی سرویسدهی آن مقرونبهصرفه باقی بماند.
برای دسترسی گسترده و تسهیل در پیادهسازی، تیم Poolside وزنها را در قالبهای مختلف BF16، FP8، INT4 و NVFP4 منتشر کرده است. آنها همچنین تبدیلهای رسمی GGUF و MLX و مدلهای پیشنویس DFlash را برای بهینهسازی بیشتر سرعت استنتاج (Inference) ارائه دادهاند.
بنچمارکهای عملکردی
در مقایسههای رودروبهرو، Laguna S 2.1 بسیار فراتر از اندازه خود عمل کرده و در برابر غولهایی مثل Nemotron 3 Ultra انویدیا، Inkling از شرکت Thinking Machines و DeepSeek-V4-Pro-Max ایستادگی کرده است. در این میان، رقابت با مدلهایی چون Inkling که به دلیل پیشتازی در عملیاتهای عاملمحور مورد توجه قرار گرفته بود، نشاندهنده سطح بالای توانمندی Laguna S 2.1 است:
- SWE-Bench Multilingual: امتیاز ۷۸.۵٪ (صدرنشین مطلق جدول منتشر شده و پیشی گرفتن از Hy3 تنسنت با ۷۵.۸٪).
- Terminal-Bench 2.1: امتیاز ۷۰.۲٪ با فعالسازی حالت تفکر (اولین مدل وزنباز با اندازه افشا شده در رتبههای بالا، هرچند پایینتر از سامانههای بسته مثل Muse Spark 1.1 با ۸۰.۰٪ و Claude Fable 5 با ۸۸.۰٪ است).
- DeepSWE v1.1: امتیاز ۴۰.۴٪، در حالی که مقدار مشابه برای DeepSeek-V4-Pro-Max تنها ۹.۰٪ است.
- SWE-Bench Pro (Public): امتیاز ۵۹.۴٪.
- SWE Atlas (Codebase QnA): امتیاز ۴۶.۲٪.
- Toolathlon Verified: امتیاز ۴۹.۷٪.
تکاندهندهترین سیگنال در آزمون DeepSWE v1.1 یافت میشود؛ جایی که Laguna S 2.1 به دقت ۴۰.۴٪ دست یافته، در حالی که تنها از حدود یکششم پارامترهای فعالِ مدل DeepSeek-V4-Pro-Max استفاده میکند.
مکانیسم «تفکر» (Thinking)
این مدل دارای دو حالت است: «خاموش» (off) و «حداکثر» (max). در حالت max که بهصورت پیشفرض فعال است، مدل بودجهی محاسباتی زمان تست (Test-time compute budget) را خودش تعیین میکند. در حال حاضر Poolside این قابلیت را بدون کنترلهای قابل تنظیم توسط کاربر (مانند سطح تلاش پایین/متوسط/بالا) عرضه کرده است.
این قابلیت «تفکر» جهشهای چشمگیری در عملکرد ایجاد میکند:
- در Terminal-Bench 2.1، امتیاز از ۶۰.۴٪ (در حالت خاموش) به ۷۰.۲٪ (در حالت حداکثر) افزایش یافت.
- در DeepSWE، دقت از ۱۶.۵٪ (خاموش) به ۴۰.۴٪ (حداکثر) جهش کرد.
البته این دستاوردها با هزینه توکن همراه است. مسیرهای (Trajectories) مدل در DeepSWE در حالت تفکر به تقریباً ۲۴۹ هزار توکن خروجی نیاز دارند، در حالی که در حالت عادی این رقم تنها ۹۹ هزار توکن است. با این وجود، Poolside گزارش میدهد که مدل میتواند استدلالهای منسجم و سازنده را برای ساعتها و در بازهی صدها هزار توکن حفظ کند.
مسیرهای عملیاتی در دنیای واقعی
شرکت Poolside سه مسیر عملیاتی بدون ویرایش را برای نمایش رفتار خودگردان مدل به اشتراک گذاشت:
- ساخت موتور مرورگر: مدل یک موتور مرورگر HTML/CSS فعال را از یک پوشه کاملاً خالی ساخت. این فرآیند شامل ۱۸۱ مرحله در یک جلسه ۵۰ دقیقهای بود. این عملیات بدون هیچ دخالت انسانی پیش رفت و مدل خروجی خود را در برابر Chromium بدون سر (Headless) اعتبارسنجی کرد.
- بهینهسازی Harness: مدل سیستم عامل Agent خودِ Poolside را بهینه کرد. مدل با جایگزینی الحاق رشتهها (string concatenation) با پیچیدگی $O(n^2)$ توسط بافرها، سرعت اجرا را ۵.۲٪ افزایش و تخصیص حافظه را تقریباً ۷۱٪ کاهش داد.
- بازکشف ریاضی: مدل مسئله شماره ۳۹۷ اردوش (Erdős Problem #397) را بهصورت آفلاین در زبان Perl طی ۶۸ دقیقه حل کرد، زیرا محیط Sandbox پایتون نداشت. این یک بازکشف مستقل بود؛ زیرا در حالی که GPT-5.2 Pro این مسئله را در ژانویه ۲۰۲۶ حل کرده بود، تاریخ قطع دانش (Knowledge cutoff) مدل Laguna نوامبر ۲۰۲۵ است.
استقرار و دسترسی
این مدل از یک پنجره زمینه (Context Window) عظیم ۱ میلیون توکنی در هر دو حالت تفکر و بدون تفکر پشتیبانی میکند. به دلیل اینکه هر خبره در معماری MoE باید در حافظه باقی بماند، سایز مدل بر اساس کل ۱۱۸ میلیارد پارامتر محاسبه میشود. این رویکرد به طور مستقیم چالشهایی را که پیشتر در مورد محدودیت حافظه در عاملهای محلی برای کدنویسی بحث شده بود، هدف قرار میدهد:
- ۴ بیتی (NVFP4/INT4): حدود ۵۹ گیگابایت. این حجم بهطور راحت در ۱۲۸ گیگابایت حافظه یکپارچه یک NVIDIA DGX Spark جای میگیرد.
- FP8: حدود ۱۱۸ گیگابایت. این مدل در یک واحد Spark یا یک GPU H200 جای میگیرد.
- BF16: حدود ۲۳۶ گیگابایت. این حالت نیازمند دو Spark متصل یا یک گره دیتاسنتر با چندین GPU است.
Poolside برای بهینهسازی استنتاج از طریق TRT-LLM برای خروجی NVFP4 روی سختافزارهای Blackwell با انویدیا همکاری کرده است. پشتیبانی از روز اول برای vLLM، SGLang و Ollama در دسترس است. دسترسی میزبانی شده از طریق OpenRouter (رایگان تا ۲۵۶ هزار توکن زمینه؛ پولی برای ۱ میلیون توکن با نرخ ۰.۱۰ / ۰.۲۰ / ۰.۰۱ دلار بهازای هر ۱ میلیون توکن ورودی/خروجی/کش)، و همچنین Baseten، Kilo، Prime Intellect Prime Lab و ZML فراهم است.
یکپارچهسازی هوش مصنوعی عاملمحور
فراتر از خود مدل، Poolside بر جریانهای کاری واقعاً عاملمحور تأکید دارد. دموهای آنها شامل یک عامل بازمنبع است که یک محیط زنده را مدیریت میکند و از یک حلقه واقعی LangGraph برای درک، برنامهریزی، اقدام و بازبینی استفاده میکند. این سیستم از حافظه عامل از طریق سه لایه روی MongoDB Atlas با بازیابی جستوجوی برداری (Vector Search) بهره میبرد. این چارچوب تحت لایسنس MIT منتشر شده و با دستور uv run python scripts/smoke_test.py قابل اجرا است.
این عرضه، این پیشفرض را که برای استدلالهای سطح بالای عاملمحور حتماً به تعداد پارامترهای عظیم نیاز است، تغییر میدهد. Poolside نشان داد که مدلهای «میاناندازه» اگر ترکیب پراکندگی MoE را با محاسبات تهاجمی زمان تست همراه کنند، میتوانند در بنچمارکهای فنی تخصصی غالب شوند.
توسعهدهندگان اکنون باید ارزیابی کنند که آیا هزینه توکنهای حالت «max thinking» در برابر افزایش بهرهوری هنگام یکپارچهسازی Laguna S 2.1 در خط لولههای CI/CD خودکار، توجیهپذیر است یا خیر.




گفتگو