پرش به محتوای اصلی
پرش به محتوای مقاله

DeepSWE: رکورد ۴۰.۴ درصدی Laguna S 2.1 در کدنویسی عامل‌محور

·۳۰ تیر ۱۴۰۵۹ دقیقه مطالعه۲ بازدید
لگونا اس ۲.۱: اسپیکر بلوتوثی قابل‌حمل با صدای فراگیر و باس قدرتمند
لگونا اس ۲.۱: اسپیکر بلوتوثی قابل‌حمل با صدای فراگیر و باس قدرتمند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی مقیاس پارامترها با «استقامت» در یک مدل ۱۱۸ میلیاردی؛ مدل S 2.1 ثابت کرد که با بهینه‌سازی RL و تفکر طولانی‌مدت، می‌توان بدون افزایش اندازه مدل، نمرات DeepSWE را به‌صورت جهشی بهبود داد.

تصور کنید برنامه‌نویسی دارید که به‌جای تسلیم شدن در برابر یک باگ سخت، ساعت‌ها روی آن فکر می‌کند، مسیرهای غلط را می‌شناسد و دوباره تلاش می‌کند تا هر طور شده جواب را پیدا کند. این دقیقاً همان «استقامتی» است که Laguna S 2.1 در دنیای کدنویسی عامل‌محور به ارمغان آورده است.

طبق اعلام Poolside AI، این مدل در ۲۱ ژوئیه ۲۰۲۶ عرضه شد و در محک DeepSWE امتیاز ۴۰.۴٪ را به دست آورد. این عدد ثابت می‌کند که تکیه بر استقامت و محاسبات زمان استنتاج (Test-time compute) می‌تواند شکاف میان مدل‌های میان‌جثه و غول‌های پیشرو را پر کند. Laguna S 2.1 یک مدل ترکیب خبره‌ها (Mixture-of-Experts یا MoE) — شبیه به تیمی از متخصصان که هر بار فقط فرد مناسب برای پاسخ به سؤال فراخوانده می‌شود — با ۱۱۸ میلیارد پارامتر است که به‌طور خاص برای کارهای عامل‌محور (Agentic Coding) و پروژه‌های بلندمدت مهندسی نرم‌افزار طراحی شده است.

در حالی که صنعت هوش مصنوعی اغلب بر روی تعداد خام پارامترها تمرکز می‌کند، Laguna S 2.1 بر روی «چگونگی» انجام کار متمرکز است. این مدل دقیقاً روی نقطه ضعف عامل‌های هوش مصنوعی دست گذاشته است: تمایل به تسلیم شدن یا اعلام پیروزی زودهنگام هنگام مواجهه با باگ‌های پیچیده و چندمرحله‌ای. Poolside با اولویت دادن به استقامت و تایید (Verification) به‌جای مقیاس ساده، در تلاش است تا کارایی عامل‌های کدنویسی را بازتعریف کند. برای اطمینان از شفافیت کامل، Poolside تمام مسیرهای اجرای مدل (Trajectories) برای هر آزمایش در مجموعه ارزیابی نهایی را در وب‌سایت trajectories.poolside.ai منتشر کرده است.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، شفافیت در خروجی‌ها برای پذیرش ابزارهای AI حیاتی است؛ به همین دلیل این سطح از انتشار داده‌ها اهمیت دارد.

معماری و مقیاس

مدل Laguna S 2.1 به عنوان یک مدل Mixture-of-Experts با مجموع ۱۱۸ میلیارد پارامتر ساخته شده است، اما در هر توکن تنها ۸ میلیارد پارامتر فعال می‌کند. این فعال‌سازی فشرده باعث می‌شود مدل به‌طور منحصر‌به‌فردی برای استقرار روی ماشین‌های محلی مناسب باشد؛ به‌ویژه سخت‌افزارهایی مانند یک دستگاه واحد NVIDIA DGX Spark را هدف قرار داده است.

یکی از حیاتی‌ترین ویژگی‌های این مدل، پنجره متنی (Context Window) است که تا ۱ میلیون توکن را هم در حالت‌های «تفکر» (Thinking) و «بدون تفکر» پشتیبانی می‌کند. این قابلیت به مدل اجازه می‌دهد حافظه کاری عظیمی از کدبیس‌ها را در طول جلسات طولانی عامل‌محور حفظ کند؛ جلساتی که اغلب صدها هزار توکن تاریخچه در آن‌ها انباشته می‌شود. این رویکرد بهینه‌سازی پنجره‌های متنی وسیع، مشابه استراتژی‌های به‌کار رفته در مدل LongCat-2.0 برای هدف‌گذاری مهندسی نرم‌افزار است که بر مدیریت حجم بالای داده‌ها در پروژه‌های پیچیده تمرکز دارد. مدل در این حوزه سطح توانمندی‌ای را نشان می‌دهد که تا ۶ ماه پیش تنها مختص مدل‌های پیشرو (Frontier) بود.

عملکرد و محک‌ها

به گزارش وب‌سایت poolside.ai، عملکرد مدل بسته به فعال بودن یا نبودن «حالت تفکر» (Thinking Mode) به‌شدت تغییر می‌کند و S 2.1 با اختلافی زیاد، توانمندترین مدل کدنویسی عامل‌محور در کلاس وزنی خود توصیف شده است:

  • Terminal-Bench 2.1: این محک مجموعه‌ای گسترده و باکیفیت از وظایف بلندمدت (Long-horizon) را ارزیابی می‌کند که در آن عامل از طریق یک ترمینال به محیط متصل می‌شود. امتیاز مدل با فعال بودن تفکر ۷۰.۲٪ و بدون آن ۶۰.۴٪ است.
  • DeepSWE v1.1: در محیط تست Pool Agent، مدل در حالت تفکر امتیاز ۴۰.۴٪ را کسب کرد که جهشی عظیم نسبت به ۱۶.۵٪ در حالت بدون تفکر است. لازم به ذکر است که این امتیاز از چارچوب Pool استفاده کرده و نه mini-swe-agent که در جدول امتیازات DeepSWE به کار می‌رود.

وظایف DeepSWE به‌ویژه طاقت‌فرسا هستند زیرا افق زمانی آن‌ها بلند است و به‌سختی می‌توان آن‌ها را به‌صورت جزئی حل کرد. برخلاف محک‌های قدیمی‌تر که امتیازات برتر در بازه ۷۰ تا ۹۰ درصد متمرکز شده‌اند، امتیازات DeepSWE پراکندگی زیادی دارند. مدل‌های پیشرو در این محک بین ۵۴٪ تا ۷۳٪ امتیاز می‌گیرند، در حالی که برخی مدل‌های باز با بیش از یک تریلیون پارامتر، امتیازی زیر ۱۰٪ کسب کرده‌اند.

مکانیزم تفکر

مدل Laguna S 2.1 دو حالت «خاموش» (Off) و «بیشینه» (Max) را معرفی می‌کند. در حالت Max، که به‌طور پیش‌فرض فعال است، مدل خودش بودجه مناسب تفکر و محاسبات زمان استنتاج را برای یک مسئله خاص تعیین می‌کند. Poolside گزارش داده است که تفکرهای منسجم و سازنده‌ای را مشاهده کرده که چندین ساعت به طول می‌انجامد و صدها هزار توکن را در بر می‌گیرد.

این «تک‌گویی داخلی» (Internal Monologue) موتور اصلی تغییر کیفیت در مدل است. استفاده از زنجیره‌های تفکری طولانی برای حل مسائل پیچیده، یادآور شبیه‌سازی محیط‌های عملیاتی در Qwen-AgentWorld است که در آن مدل‌ها با تحلیل گام‌به‌گام، دقت اجرای وظایف را افزایش می‌دهند. در میان تمام مدل‌هایی که تاکنون آموزش دیده‌اند، S 2.1 بیشترین تفاوت (Delta) در ارزیابی و کیفیت ادراک‌شده بین حالت‌های با تفکر و بدون تفکر را نشان می‌دهد. شرکت معتقد است که یادگیری تقویتی (RL) می‌تواند فرآیند «تفکر» — یعنی منطق و گام‌های میانی — را بازیابی کند؛ مواردی که معمولاً در پاسخ‌های نهایی ثبت‌شده در وب غایب هستند.

استراتژی آموزش و داده‌ها

آموزش S 2.1 از ۲۲ مه ۲۰۲۶ با استفاده از ۴۰۹۶ پردازنده NVIDIA H200 آغاز شد. مدل در کمتر از ۹ هفته از شروع آموزش به مرحله عرضه رسید. این سرعت بالای چرخه تولید مدیون پلتفرم داخلی «Model Factory» است؛ یک سیستم داخلی برای تحقیق و مهندسی که توسعه مدل را صنعتی کرده تا نیاز به مدیریت دستی زیرساختی کاهش یابد.

جالب است بدانید که تغییر از خانواده Laguna XS به S 2.1 بر اثر داده‌های پیش‌آموزشی جدید نبوده است، بلکه حاصل مقیاس‌بندی (Scale)، اصلاحات در کدهای آموزش، تغییرات کوچک در دستورالعمل‌ها (Recipes) و بهبودهای پس‌آموزش است. S 2.1 در واقع نسخه مقیاس‌یافته خانواده XS است و دقیقاً با همان داده‌های پیش‌آموزشی XS 2.1 آموزش دیده است.

جزئیات: پس‌آموزش و یادگیری تقویتی (RL)

فرآیند پس‌آموزش در دو مرحله متمایز انجام شد: ابتدا مرحله SFT (تنظیم نظارت‌شده) که توانمندی‌ها را با استفاده از داده‌های مصنوعی تقویت کرد و سپس مرحله RL که برای وظایفی رزرو شد که مدل هنوز نمی‌توانست آن‌ها را با نرخ موفقیت بالا حل کند.

  • دقت محاسباتی: S 2.1 اولین مدلی است که در آن یادگیری تقویتی (RL) با دقت FP8 انجام شده است، که این امر سرعت آن بخش از آموزش را به‌طور قابل‌توجهی افزایش داد.
  • پیکره داده (Corpus): مجموعه داده‌ها شامل ۴۰۹ هزار محیط عامل‌محور و غیرعامل‌محور است. این شامل ۸۳ هزار تنظیمات برای موارد استفاده از ترمینال و ۱۶۸ هزار مورد هدف‌گذاری شده برای گردش کارهای استاندارد مهندسی نرم‌افزار است.
  • منبع‌یابی داده‌ها: وظایف از مخازن متن-باز جمع‌آوری شدند، یا از طریق یک سیستم تخصصی برای نصب خودکار وابستگی‌ها به‌صورت داخلی سنتز شدند و یا از طریق خرید استراتژیک داده‌ها از تامین‌کنندگان خارجی تامین گردیدند.
  • مبنی‌سازی در دنیای واقعی: وظایف مهندسی نرم‌افزار بر اساس تاریخچه واقعی کدها هستند. بزرگترین منبع، حدود ۳۸,۰۰۰ کامیت واقعی را در حدود ۱۷,۰۰۰ مخزن بازسازی می‌کند. سایر وظایف، درخواست‌های ادغام شده (Merged PRs) را بازسازی می‌کنند، باگ‌های تزریق‌شده را اصلاح می‌کنند یا فایل‌های حذف‌شده را در مقابل یک مجموعه تست بازسازی می‌کنند.
  • نصب عامل‌محور (Agentic Installation): یک ویژگی جدید در S 2.1، نصب عامل‌محور مخازن است؛ به‌طوری که به مدل یک مخزن داده می‌شود و مدل باید هر وابستگی (Dependency) را نصب کند تا مجموعه تست‌ها اجرا شوند.

جزئیات: حلقه آموزش

تیم Poolside چندین تغییر کلیدی در حلقه آموزش ایجاد کرد تا استقامت و استحکام مدل افزایش یابد:

  • بودجه‌های بازگشت (Rollout Budgets): تیم مهندسی مهلت‌های زمانی (Timeouts) به‌مراتب طولانی‌تر، توکن‌های بیشتر در هر نوبت و نوبت‌های بیشتر برای هر وظیفه را نسبت به نسخه‌های قبلی پیاده کرد.
  • زیرساخت Sandbox: بخش RL به یک سرویس سندباکسینگ جدید منتقل شد که اجازه اجرای فرآیندهای پس‌زمینه و کش کردن آثار (Artifact Caching) را می‌دهد. همچنین از مسدودسازی انتخابی شبکه برای کاهش سطح دسترسی جهت جلوگیری از «سوءاستفاده از پاداش» (Reward Hacking) استفاده می‌کند.
  • اجرا در چارچوب‌های مختلف (Multi-harness Rollouts): پرامپت‌ها در چندین چارچوب عامل‌محور مختلف اجرا شدند. این کار مدل را مجبور می‌کند رفتارهایی را یاد بگیرد که در ساختارهای مختلف کاربرد دارند، به‌جای اینکه فقط روی یک چارچوب خاص بیش‌برازش (Overfit) شود.

تحلیل شکست‌های «رباتیک»

Poolside AI درباره موانع باقی‌مانده مدل کاملاً شفاف است. نسخه فعلی ممکن است با «بیش‌برازش روی چارچوب» (Harness Overfitting) دست و پنجه نرم کند؛ جایی که مدل به‌جای پیروی از طرحواره (Schema) ارائه شده توسط یک چارچوب شخص ثالث (مانند ابزار ترمینال در Hermes Agent)، بر حافظه داخلی خود از اولین تجربه استفاده از آن ابزار تکیه می‌کند. این مشکل معمولاً در صورتی که چارچوب درخواست را رد کند و بخواهد دوباره تلاش شود، از طریق یادگیری در متن (In-context learning) حل می‌شود.

علاوه بر این، مدل ممکن است در فراخوانی‌های ابزاری تو در تو (Nested Tool Calls) دچار مشکل شود. Laguna S 2. 1 از فرمت تگ‌های شبیه XML استفاده می‌کند، مانند:
<tool_call>terminal<arg_key>cmd</arg_key><arg_value>uname -a</arg_value></tool_call>
در مواردی که آرگومان ابزار انتظار یک آرایه JSON دارد (مانند ابزار ویرایش Pi)، مدل ممکن است JSON نامعتبر یا به‌طور نادرست Escaped تولید کند.

همچنین مسئله «بیش‌ازحد فکر کردن» (Overthinking) وجود دارد؛ یعنی صرف توالی‌های طولانی از تفکر پیش از پیشرفت در کار، به‌ویژه هنگام حل مسائل ریاضی مسابقاتی. مدل‌های آینده برای مدیریت این کارایی، کنترل‌های تلاش خاص (کم-متوسط-زیاد) را معرفی خواهند کرد.

یکپارچگی با اکوسیستم

برای اطمینان از کاربرد فوری، مدل از چندین کانال در دسترس است. Poolside با NVIDIA همکاری کرد تا استنتاج را از سرویس دهی TRT-LLM تا NVFP4 روی سیستم‌های Blackwell بهینه کند. آن‌ها همچنین برای سرویس‌دهی باز و استنتاج محلی در روز اول با vLLM، SGLang و Ollama یکپارچه شدند.

  • ابر و API: مدل در کتابخانه مدل‌های Baseten از طریق Frontier Gateway و همچنین از طریق OpenRouter (که یک نقطه اتصال رایگان و یک استقرار اختصاصی با پنجره ۱ میلیون توکنی ارائه می‌دهد) در دسترس است. همچنین در Kilo موجود است.
  • ابزارهای پس‌آموزش: مدل Laguna S 2.1 در Prime Lab شرکت Prime Intellect برای پس‌آموزش سفارشی قابل انتخاب است و از طریق چارچوب LLMD شرکت ZML روی سخت‌افزارهای مختلف اجرا می‌شود.
  • وزن‌ها: وزن‌های مدل در Hugging Face تحت لایسنس OpenMDW-1.1 در فرمت‌های BF16، FP8، INT4 و NVFP4 منتشر شده است، شامل نسخه‌های رسمی GGUF، تبدیل‌های MLX و مدل‌های پیش‌نویس DFlash.
  • دسترسی مصرف‌کننده: برای کسانی که توسعه‌دهنده نیستند، وب‌سایت chat.poolside.ai امروز راه‌اندازی شد که یک چت ساده وب با قابلیت جستجویان وب و اجرای کد پایه، بدون نیاز به ثبت‌نام فراهم می‌کند.

تحلیل: چرخش به سمت استقامت

مدل Laguna S 2.1 نشان‌دهنده یک چرخش در رقابت هوش مصنوعی عامل‌محور است. برای مدت‌ها، صنعت تصور می‌کرد که هوش خام (تعداد پارامترها) تنها محور بهبود است. Poolside استدلال می‌کند که «استقامت» — یعنی تمایل به بازگشت به عقب، تایید و ادامه تلاش — دومین محور است که اهمیتی برابر دارد. در حالی که مدل‌های قدیمی‌تر Laguna ممکن بود در تست‌هایی که تا حدی پاس شده‌اند اعلام پیروزی کنند یا رویکردی را خیلی زود رها کنند، S 2.1 پافشاری می‌کند. این رقابت برای بهینه‌سازی گردش‌های کاری نرم‌افزاری، همان‌طور که در مقایسه Grok 4.5 و Opus 4.8 مشاهده شد، اکنون از تمرکز صرف بر حجم خروجی به سمت کیفیت و دقت در حل مسئله تغییر کرده است.

با ارائه توانمندی‌های عامل‌محور در سطح مدل‌های پیشرو در مدلی که به اندازه کافی کوچک است تا روی یک نود واحد Spark اجرا شود، آن‌ها سد ورود شرکت‌ها برای اجرای عامل‌های کدنویسی محلی و امن را پایین آورده‌اند. پیروزی واقعی در اینجا فقط امتیاز بنچ‌مارک نیست، بلکه این حقیقت است که یک مدل ۱۱۸ میلیاردی اکنون می‌تواند «استقامتی» را نشان دهد که قبلاً تنها مختص غول‌های تریلیون-پارامتری بود.

گام بعدی شما

توسعه‌دهندگان می‌توانند این استقامت را با نصب pool (عامل کدنویسی مبتنی بر ترمینال) تست کنند. کاربران می‌توانند سطح تفکر را در هر جلسه با دستور /thought-level تغییر دهند. برای کسانی که از OpenRouter استفاده می‌کنند، نقطه اتصال پرداخت‌شده اختصاصی برای پنجره کامل ۱ میلیونی دارای هزینه ۰.۱۰ دلار برای هر میلیون توکن ورودی، ۰.۲۰ دلار برای هر میلیون توکن خروجی و ۰.۰۱ دلار برای هر میلیون توکن خوانده شده از کش (Cache-read) است.

منتظر تکرار بعدی سری Laguna باشید که Poolside تایید کرده پیش‌آموزش آن از هفته گذشته آغاز شده است. این مدل بعدی و بزرگتر احتمالاً بر اساس پیشرفت‌های پس‌آموزش و محاسبات زمان استنتاج که در S 2.1 دیده شد، بنا خواهد شد.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با تکیه بر تخصص در محاسبات زمان استنتاج، دسترسی به عامل‌های کدنویسی قدرتمند را از مراکز داده غول‌پیکر به گره‌های محلی (Single Node) منتقل می‌کند. این یعنی کاهش چشمگیر هزینه و افزایش امنیت برای سازمان‌هایی که نمی‌خواهند کدبیس خود را به ابرهای عمومی بسپارند.

تأثیر برای ایران

به دلیل وزن‌های باز (Open Weights) در Hugging Face، توسعه‌دهندگان ایرانی می‌توانند مدل را به‌صورت محلی میزبانی کنند و از محدودیت‌های API‌های تجاری عبور کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز Poolside بر «استقامت» به‌جای «هوش خام»، پارادایم جدیدی را در توسعه عامل‌ها معرفی می‌کند. این رویکرد نشان می‌دهد که برای رسیدن به قابلیت‌های سطح Frontier، لزوماً به تریلیون‌ها پارامتر نیاز نیست و بهینه‌سازی زنجیره تفکر در زمان استنتاج، می‌تواند مدل‌های کوچک‌تر را به رقبا برسانَد. در واقع، ما از عصر «بزرگ‌تر بهتر است» به عصر «بهتر فکر کردن» نقل مکان می‌کنیم.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.