تصور کنید برنامهنویسی دارید که بهجای تسلیم شدن در برابر یک باگ سخت، ساعتها روی آن فکر میکند، مسیرهای غلط را میشناسد و دوباره تلاش میکند تا هر طور شده جواب را پیدا کند. این دقیقاً همان «استقامتی» است که Laguna S 2.1 در دنیای کدنویسی عاملمحور به ارمغان آورده است.
طبق اعلام Poolside AI، این مدل در ۲۱ ژوئیه ۲۰۲۶ عرضه شد و در محک DeepSWE امتیاز ۴۰.۴٪ را به دست آورد. این عدد ثابت میکند که تکیه بر استقامت و محاسبات زمان استنتاج (Test-time compute) میتواند شکاف میان مدلهای میانجثه و غولهای پیشرو را پر کند. Laguna S 2.1 یک مدل ترکیب خبرهها (Mixture-of-Experts یا MoE) — شبیه به تیمی از متخصصان که هر بار فقط فرد مناسب برای پاسخ به سؤال فراخوانده میشود — با ۱۱۸ میلیارد پارامتر است که بهطور خاص برای کارهای عاملمحور (Agentic Coding) و پروژههای بلندمدت مهندسی نرمافزار طراحی شده است.
در حالی که صنعت هوش مصنوعی اغلب بر روی تعداد خام پارامترها تمرکز میکند، Laguna S 2.1 بر روی «چگونگی» انجام کار متمرکز است. این مدل دقیقاً روی نقطه ضعف عاملهای هوش مصنوعی دست گذاشته است: تمایل به تسلیم شدن یا اعلام پیروزی زودهنگام هنگام مواجهه با باگهای پیچیده و چندمرحلهای. Poolside با اولویت دادن به استقامت و تایید (Verification) بهجای مقیاس ساده، در تلاش است تا کارایی عاملهای کدنویسی را بازتعریف کند. برای اطمینان از شفافیت کامل، Poolside تمام مسیرهای اجرای مدل (Trajectories) برای هر آزمایش در مجموعه ارزیابی نهایی را در وبسایت trajectories.poolside.ai منتشر کرده است.
همانطور که در تحلیلهای پیشین ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، شفافیت در خروجیها برای پذیرش ابزارهای AI حیاتی است؛ به همین دلیل این سطح از انتشار دادهها اهمیت دارد.
معماری و مقیاس
مدل Laguna S 2.1 به عنوان یک مدل Mixture-of-Experts با مجموع ۱۱۸ میلیارد پارامتر ساخته شده است، اما در هر توکن تنها ۸ میلیارد پارامتر فعال میکند. این فعالسازی فشرده باعث میشود مدل بهطور منحصربهفردی برای استقرار روی ماشینهای محلی مناسب باشد؛ بهویژه سختافزارهایی مانند یک دستگاه واحد NVIDIA DGX Spark را هدف قرار داده است.
یکی از حیاتیترین ویژگیهای این مدل، پنجره متنی (Context Window) است که تا ۱ میلیون توکن را هم در حالتهای «تفکر» (Thinking) و «بدون تفکر» پشتیبانی میکند. این قابلیت به مدل اجازه میدهد حافظه کاری عظیمی از کدبیسها را در طول جلسات طولانی عاملمحور حفظ کند؛ جلساتی که اغلب صدها هزار توکن تاریخچه در آنها انباشته میشود. این رویکرد بهینهسازی پنجرههای متنی وسیع، مشابه استراتژیهای بهکار رفته در مدل LongCat-2.0 برای هدفگذاری مهندسی نرمافزار است که بر مدیریت حجم بالای دادهها در پروژههای پیچیده تمرکز دارد. مدل در این حوزه سطح توانمندیای را نشان میدهد که تا ۶ ماه پیش تنها مختص مدلهای پیشرو (Frontier) بود.
عملکرد و محکها
به گزارش وبسایت poolside.ai، عملکرد مدل بسته به فعال بودن یا نبودن «حالت تفکر» (Thinking Mode) بهشدت تغییر میکند و S 2.1 با اختلافی زیاد، توانمندترین مدل کدنویسی عاملمحور در کلاس وزنی خود توصیف شده است:
- Terminal-Bench 2.1: این محک مجموعهای گسترده و باکیفیت از وظایف بلندمدت (Long-horizon) را ارزیابی میکند که در آن عامل از طریق یک ترمینال به محیط متصل میشود. امتیاز مدل با فعال بودن تفکر ۷۰.۲٪ و بدون آن ۶۰.۴٪ است.
- DeepSWE v1.1: در محیط تست Pool Agent، مدل در حالت تفکر امتیاز ۴۰.۴٪ را کسب کرد که جهشی عظیم نسبت به ۱۶.۵٪ در حالت بدون تفکر است. لازم به ذکر است که این امتیاز از چارچوب Pool استفاده کرده و نه mini-swe-agent که در جدول امتیازات DeepSWE به کار میرود.
وظایف DeepSWE بهویژه طاقتفرسا هستند زیرا افق زمانی آنها بلند است و بهسختی میتوان آنها را بهصورت جزئی حل کرد. برخلاف محکهای قدیمیتر که امتیازات برتر در بازه ۷۰ تا ۹۰ درصد متمرکز شدهاند، امتیازات DeepSWE پراکندگی زیادی دارند. مدلهای پیشرو در این محک بین ۵۴٪ تا ۷۳٪ امتیاز میگیرند، در حالی که برخی مدلهای باز با بیش از یک تریلیون پارامتر، امتیازی زیر ۱۰٪ کسب کردهاند.
مکانیزم تفکر
مدل Laguna S 2.1 دو حالت «خاموش» (Off) و «بیشینه» (Max) را معرفی میکند. در حالت Max، که بهطور پیشفرض فعال است، مدل خودش بودجه مناسب تفکر و محاسبات زمان استنتاج را برای یک مسئله خاص تعیین میکند. Poolside گزارش داده است که تفکرهای منسجم و سازندهای را مشاهده کرده که چندین ساعت به طول میانجامد و صدها هزار توکن را در بر میگیرد.
این «تکگویی داخلی» (Internal Monologue) موتور اصلی تغییر کیفیت در مدل است. استفاده از زنجیرههای تفکری طولانی برای حل مسائل پیچیده، یادآور شبیهسازی محیطهای عملیاتی در Qwen-AgentWorld است که در آن مدلها با تحلیل گامبهگام، دقت اجرای وظایف را افزایش میدهند. در میان تمام مدلهایی که تاکنون آموزش دیدهاند، S 2.1 بیشترین تفاوت (Delta) در ارزیابی و کیفیت ادراکشده بین حالتهای با تفکر و بدون تفکر را نشان میدهد. شرکت معتقد است که یادگیری تقویتی (RL) میتواند فرآیند «تفکر» — یعنی منطق و گامهای میانی — را بازیابی کند؛ مواردی که معمولاً در پاسخهای نهایی ثبتشده در وب غایب هستند.
استراتژی آموزش و دادهها
آموزش S 2.1 از ۲۲ مه ۲۰۲۶ با استفاده از ۴۰۹۶ پردازنده NVIDIA H200 آغاز شد. مدل در کمتر از ۹ هفته از شروع آموزش به مرحله عرضه رسید. این سرعت بالای چرخه تولید مدیون پلتفرم داخلی «Model Factory» است؛ یک سیستم داخلی برای تحقیق و مهندسی که توسعه مدل را صنعتی کرده تا نیاز به مدیریت دستی زیرساختی کاهش یابد.
جالب است بدانید که تغییر از خانواده Laguna XS به S 2.1 بر اثر دادههای پیشآموزشی جدید نبوده است، بلکه حاصل مقیاسبندی (Scale)، اصلاحات در کدهای آموزش، تغییرات کوچک در دستورالعملها (Recipes) و بهبودهای پسآموزش است. S 2.1 در واقع نسخه مقیاسیافته خانواده XS است و دقیقاً با همان دادههای پیشآموزشی XS 2.1 آموزش دیده است.
جزئیات: پسآموزش و یادگیری تقویتی (RL)
فرآیند پسآموزش در دو مرحله متمایز انجام شد: ابتدا مرحله SFT (تنظیم نظارتشده) که توانمندیها را با استفاده از دادههای مصنوعی تقویت کرد و سپس مرحله RL که برای وظایفی رزرو شد که مدل هنوز نمیتوانست آنها را با نرخ موفقیت بالا حل کند.
- دقت محاسباتی: S 2.1 اولین مدلی است که در آن یادگیری تقویتی (RL) با دقت FP8 انجام شده است، که این امر سرعت آن بخش از آموزش را بهطور قابلتوجهی افزایش داد.
- پیکره داده (Corpus): مجموعه دادهها شامل ۴۰۹ هزار محیط عاملمحور و غیرعاملمحور است. این شامل ۸۳ هزار تنظیمات برای موارد استفاده از ترمینال و ۱۶۸ هزار مورد هدفگذاری شده برای گردش کارهای استاندارد مهندسی نرمافزار است.
- منبعیابی دادهها: وظایف از مخازن متن-باز جمعآوری شدند، یا از طریق یک سیستم تخصصی برای نصب خودکار وابستگیها بهصورت داخلی سنتز شدند و یا از طریق خرید استراتژیک دادهها از تامینکنندگان خارجی تامین گردیدند.
- مبنیسازی در دنیای واقعی: وظایف مهندسی نرمافزار بر اساس تاریخچه واقعی کدها هستند. بزرگترین منبع، حدود ۳۸,۰۰۰ کامیت واقعی را در حدود ۱۷,۰۰۰ مخزن بازسازی میکند. سایر وظایف، درخواستهای ادغام شده (Merged PRs) را بازسازی میکنند، باگهای تزریقشده را اصلاح میکنند یا فایلهای حذفشده را در مقابل یک مجموعه تست بازسازی میکنند.
- نصب عاملمحور (Agentic Installation): یک ویژگی جدید در S 2.1، نصب عاملمحور مخازن است؛ بهطوری که به مدل یک مخزن داده میشود و مدل باید هر وابستگی (Dependency) را نصب کند تا مجموعه تستها اجرا شوند.
جزئیات: حلقه آموزش
تیم Poolside چندین تغییر کلیدی در حلقه آموزش ایجاد کرد تا استقامت و استحکام مدل افزایش یابد:
- بودجههای بازگشت (Rollout Budgets): تیم مهندسی مهلتهای زمانی (Timeouts) بهمراتب طولانیتر، توکنهای بیشتر در هر نوبت و نوبتهای بیشتر برای هر وظیفه را نسبت به نسخههای قبلی پیاده کرد.
- زیرساخت Sandbox: بخش RL به یک سرویس سندباکسینگ جدید منتقل شد که اجازه اجرای فرآیندهای پسزمینه و کش کردن آثار (Artifact Caching) را میدهد. همچنین از مسدودسازی انتخابی شبکه برای کاهش سطح دسترسی جهت جلوگیری از «سوءاستفاده از پاداش» (Reward Hacking) استفاده میکند.
- اجرا در چارچوبهای مختلف (Multi-harness Rollouts): پرامپتها در چندین چارچوب عاملمحور مختلف اجرا شدند. این کار مدل را مجبور میکند رفتارهایی را یاد بگیرد که در ساختارهای مختلف کاربرد دارند، بهجای اینکه فقط روی یک چارچوب خاص بیشبرازش (Overfit) شود.
تحلیل شکستهای «رباتیک»
Poolside AI درباره موانع باقیمانده مدل کاملاً شفاف است. نسخه فعلی ممکن است با «بیشبرازش روی چارچوب» (Harness Overfitting) دست و پنجه نرم کند؛ جایی که مدل بهجای پیروی از طرحواره (Schema) ارائه شده توسط یک چارچوب شخص ثالث (مانند ابزار ترمینال در Hermes Agent)، بر حافظه داخلی خود از اولین تجربه استفاده از آن ابزار تکیه میکند. این مشکل معمولاً در صورتی که چارچوب درخواست را رد کند و بخواهد دوباره تلاش شود، از طریق یادگیری در متن (In-context learning) حل میشود.
علاوه بر این، مدل ممکن است در فراخوانیهای ابزاری تو در تو (Nested Tool Calls) دچار مشکل شود. Laguna S 2. 1 از فرمت تگهای شبیه XML استفاده میکند، مانند:<tool_call>terminal<arg_key>cmd</arg_key><arg_value>uname -a</arg_value></tool_call>
در مواردی که آرگومان ابزار انتظار یک آرایه JSON دارد (مانند ابزار ویرایش Pi)، مدل ممکن است JSON نامعتبر یا بهطور نادرست Escaped تولید کند.
همچنین مسئله «بیشازحد فکر کردن» (Overthinking) وجود دارد؛ یعنی صرف توالیهای طولانی از تفکر پیش از پیشرفت در کار، بهویژه هنگام حل مسائل ریاضی مسابقاتی. مدلهای آینده برای مدیریت این کارایی، کنترلهای تلاش خاص (کم-متوسط-زیاد) را معرفی خواهند کرد.
یکپارچگی با اکوسیستم
برای اطمینان از کاربرد فوری، مدل از چندین کانال در دسترس است. Poolside با NVIDIA همکاری کرد تا استنتاج را از سرویس دهی TRT-LLM تا NVFP4 روی سیستمهای Blackwell بهینه کند. آنها همچنین برای سرویسدهی باز و استنتاج محلی در روز اول با vLLM، SGLang و Ollama یکپارچه شدند.
- ابر و API: مدل در کتابخانه مدلهای Baseten از طریق Frontier Gateway و همچنین از طریق OpenRouter (که یک نقطه اتصال رایگان و یک استقرار اختصاصی با پنجره ۱ میلیون توکنی ارائه میدهد) در دسترس است. همچنین در Kilo موجود است.
- ابزارهای پسآموزش: مدل Laguna S 2.1 در Prime Lab شرکت Prime Intellect برای پسآموزش سفارشی قابل انتخاب است و از طریق چارچوب LLMD شرکت ZML روی سختافزارهای مختلف اجرا میشود.
- وزنها: وزنهای مدل در Hugging Face تحت لایسنس OpenMDW-1.1 در فرمتهای BF16، FP8، INT4 و NVFP4 منتشر شده است، شامل نسخههای رسمی GGUF، تبدیلهای MLX و مدلهای پیشنویس DFlash.
- دسترسی مصرفکننده: برای کسانی که توسعهدهنده نیستند، وبسایت chat.poolside.ai امروز راهاندازی شد که یک چت ساده وب با قابلیت جستجویان وب و اجرای کد پایه، بدون نیاز به ثبتنام فراهم میکند.
تحلیل: چرخش به سمت استقامت
مدل Laguna S 2.1 نشاندهنده یک چرخش در رقابت هوش مصنوعی عاملمحور است. برای مدتها، صنعت تصور میکرد که هوش خام (تعداد پارامترها) تنها محور بهبود است. Poolside استدلال میکند که «استقامت» — یعنی تمایل به بازگشت به عقب، تایید و ادامه تلاش — دومین محور است که اهمیتی برابر دارد. در حالی که مدلهای قدیمیتر Laguna ممکن بود در تستهایی که تا حدی پاس شدهاند اعلام پیروزی کنند یا رویکردی را خیلی زود رها کنند، S 2.1 پافشاری میکند. این رقابت برای بهینهسازی گردشهای کاری نرمافزاری، همانطور که در مقایسه Grok 4.5 و Opus 4.8 مشاهده شد، اکنون از تمرکز صرف بر حجم خروجی به سمت کیفیت و دقت در حل مسئله تغییر کرده است.
با ارائه توانمندیهای عاملمحور در سطح مدلهای پیشرو در مدلی که به اندازه کافی کوچک است تا روی یک نود واحد Spark اجرا شود، آنها سد ورود شرکتها برای اجرای عاملهای کدنویسی محلی و امن را پایین آوردهاند. پیروزی واقعی در اینجا فقط امتیاز بنچمارک نیست، بلکه این حقیقت است که یک مدل ۱۱۸ میلیاردی اکنون میتواند «استقامتی» را نشان دهد که قبلاً تنها مختص غولهای تریلیون-پارامتری بود.
گام بعدی شما
توسعهدهندگان میتوانند این استقامت را با نصب pool (عامل کدنویسی مبتنی بر ترمینال) تست کنند. کاربران میتوانند سطح تفکر را در هر جلسه با دستور /thought-level تغییر دهند. برای کسانی که از OpenRouter استفاده میکنند، نقطه اتصال پرداختشده اختصاصی برای پنجره کامل ۱ میلیونی دارای هزینه ۰.۱۰ دلار برای هر میلیون توکن ورودی، ۰.۲۰ دلار برای هر میلیون توکن خروجی و ۰.۰۱ دلار برای هر میلیون توکن خوانده شده از کش (Cache-read) است.
منتظر تکرار بعدی سری Laguna باشید که Poolside تایید کرده پیشآموزش آن از هفته گذشته آغاز شده است. این مدل بعدی و بزرگتر احتمالاً بر اساس پیشرفتهای پسآموزش و محاسبات زمان استنتاج که در S 2.1 دیده شد، بنا خواهد شد.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو