هزینه ۶۴٪ کمتر؛ این تنها عدد نیست، بلکه تغییر قواعد بازی در استقرار عاملهای کدنویس است. مدل SWE-2 که در ۱۰ سپتامبر ۲۰۲۶ توسط شرکت Cognition منتشر شد، ثابت کرد که میتوان بدون افت کیفیت، هزینههای محاسباتی را بهشدت کاهش داد.
طبق اعلام این شرکت، SWE-2 در محک FrontierCode 1.1 Main به امتیاز ۵۰.۰٪ رسید و بدین ترتیب عملکرد مدل Fable 5.1 را با هزینهای بسیار کمتر بازتولید کرد. این اتفاق در حالی رخ میدهد که صنعت هوش مصنوعی از تعقیب کورکورانه نمرات بنچمارک، به سمت بهینهسازی «جبهه پارتو» (Pareto frontier) — یعنی یافتن نقطه بهینه بین توانایی مدل و هزینه مالی استنتاج (Inference) — حرکت کرده است.
همانطور که در تحلیلهای پیشین ما دربارهی بهینهسازی مدلهای بازمتن اشاره کردیم، کاهش هزینه استنتاج کلید تبدیل مدلهای آزمایشگاهی به ابزارهای تجاری است. برای توسعهدهندگان، این یعنی شکاف میان عاملهای «ارزان اما غیرقابلاعتماد» و «گران اما توانمند» بهسرعت در حال بسته شدن است.
Cognition برای ساخت این مدل، زیرساختهای نسخه SWE-1.7 را ارتقا داد و برای نخستین بار یادگیری تقویتی (Reinforcement Learning) را در مقیاس چند-تریلیون پارامتر پیاده کرد. SWE-2 بر پایه مدل Kimi K3 با ۲.۸ تریلیون پارامتر آموزش دیده است. به نقل از تیم فنی Cognition، فرآیند یادگیری تقویتی آنها توانست ۵ تا ۶ امتیاز به نتایج بسیاری از محکها اضافه کند و منحنی هزینه-عملکرد مدل پایه را بهطور کلی جابهجا کند.
عملکرد در محکهای فنی
مدل SWE-2 در چندین معیار کلیدی مهندسی نرمافزار، مدلهای SWE-1.7 و Grok 4.6 را شکست داد و در برخی موارد با مدلهای بسیار گرانقیمتتر رقابت کرد:
- FrontierCode 1.1 Main: کسب امتیاز ۵۰.۰٪ (در فاصله یک امتیازی از Fable 5.1 با ۵۰.۹٪ و برتری نسبت به Grok 4.6 با ۴۸.۰٪).
- DeepSWE 1.1: کسب امتیاز ۷۳.۰٪ که بهطور چشمگیری از SWE-1.7 (۳۷.۷٪) پیشی گرفت و حتی مدل GPT-5.6 Sol (۷۲.۷٪) را پشت سر گذاشت.
- Terminal-Bench 2.1: دستیابی به ۹۲.۸٪ که نشاندهنده تسلط بالا در محیطهای خط فرمان (CLI) است و از GPT-6 Astra (۸۹.۹٪) بالاتر است.
- Terminal-Bench 4: جهشی بزرگ از ۷.۶٪ در نسخه قبلی به ۲۷.۳٪، هرچند هنوز فاصله زیادی با Fable 5.1 (۵۵.۸٪) دارد.
سازوکار فنی: یادگیری تقویتی مبتنی بر پارتو
دستاورد اصلی Cognition، یک الگوریتم جدید یادگیری تقویتی است که تمام سطوح تلاش استدلالی را در یک اجرای واحد آموزش میدهد. برخلاف Kimi K3 که برای هر سطح پیچیدگی، خبرههای جداگانهای آموزش میداد، Cognition یک «جریمه هزینه خطی» برای هر سطح تلاش اعمال کرد.
در این مدل، تابع پاداش بهگونهای طراحی شده که پاداش برابر است با «موفقیت منهای جریمه هزینه» ($R = S - \lambda_e C$). در این فرمول، $S$ نشاندهنده موفقیت، $C$ هزینه (ترکیبی از هزینه دلاری و زمان اجرا) و $\lambda_e$ پارامتری است که با شیب منحنی پارتو در سطح تلاش $e$ تنظیم میشود. این سازوکار مدل را مجبور میکند تا به جای صرف محاسبات بیهدف، بهینهترین مسیر رسیدن به جواب را پیدا کند.
تغییرات رفتاری در کدنویسی
این بهینگی در نحوه تعامل عامل با کدبیس کاملاً مشهود است. در سطح تلاش متوسط (medium)، مدل SWE-2 در مقایسه با نسخه ۱.۷، ۵۸٪ نوبتهای کمتری را طی میکند و ۸۱٪ ارزانتر است. میانگین نوبتهای اجرا از ۱۲۷ نوبت در نسخه قبلی به ۵۳ نوبت در نسخه جدید کاهش یافته است.
یکی از تغییرات کلیدی، «کاوش متمرکز» است. در حالی که SWE-1.7 به خواندنهای تکراری و جامع کدبیس معروف بود، SWE-2 با قضاوت مهندسی قویتر، فایلهای حیاتی را شناسایی میکند. به طور میانگین، این مدل پس از ۱۸ گام اولین ویرایش واقعی کد را انجام میدهد، در حالی که در نسخه قبلی این عدد ۴۸ گام بود.
به گزارش Cognition، سه بهبود رفتاری مشخص در این نسخه دیده میشود:
۱. پوشش تست: نوشتن تستهای End-to-End قابلاعتمادتر برای شناسایی لبههای خطا.
۲. تدبیر در حل مسئله: در صورت مسدود شدن مسیر اصلی، مدل به دنبال جایگزین میگردد (مثلاً بازسازی دادههای گمشده از تاریخچه Slack).
۳. انضباط در تایید: مدل بهجای تایید ساده حرف کاربر، نتایج را باز-استخراج کرده و شواهد را بررسی میکند.
دینامیک سطوح تلاش
در SWE-2 سه سطح تلاش تعریف شده است. تنظیمات «متوسط» برای کارهای ساده و میانرده طراحی شده تا سریعتر وارد فاز اجرا شود. در مقابل، سطوح «بالا» (high) و «بیشینه» (max) برای وظایف پیچیده به کار میروند که با برنامهریزی گستردهتر و بررسیهای عمیقتر کدبیس همراه هستند.
زیرساخت آموزش و دادهها
برای پشتیبانی از مدل ۲.۸ تریلیون پارامتری، Cognition زیرساخت سرویسدهی خود را با چهار هدف بازطراحی کرد: حداکثر کردن توان عملیاتی، کاهش تأخیر، مدیریت ظرفیت KV Cache و حفظ نزدیکی عددی بین استنتاج و آموزش. این رویکرد بهینهسازی زیرساختی، یادآور پیشرفتهای اخیر در سطح سختافزار است؛ برای مثال، بهینهسازی هستههای GPU با Codex توانست سرعت محاسبات پیچیده را به شکل خیرهکنندهای افزایش دهد.
- بهینهسازی Rollout: با ساخت یک زمانبند برای دستهبندی درخواستها، توان عملیاتی (TPS) هر GPU بین ۱۰ تا ۲۰٪ افزایش یافت.
- رمزگشایی گمانهزنانه: استفاده از DSpark و SpecForge برای افزایش طول پذیرش توکنها تا ۱۵٪.
- دقت و حافظه: بهرهگیری از کرنلهای NVFP4 و FP8 با آموزش آگاه از کوانتش (Quantization-aware training).
در بخش دادهها نیز، تعداد محیطهای یادگیری تقویتی سه برابر شد و لایههای «پیروی از دستور» (Instruction-following) اضافه شدند تا مدل بتواند چندین الزام را همزمان در زمینه نگه دارد بدون اینکه هدف اصلی را فراموش کند.
پایداری و همراستاسازی
برای جلوگیری از سوءاستفاده از پاداش (Reward hacking)، Cognition از یک چرخه بازخوردی بازگشتی استفاده کرد تا موارد مثبت و منفی کاذب را شناسایی و اصلاح کند. همچنین برای پایداری آموزش، از یک خط پایه پاداش وزندار بر اساس طول اجرا استفاده کردند که باعث کاهش واریانس گرادیان و پایداری بیشتر در مقایسه با روشهای استاندارد شد.
در زمینه ایمنی، مدل در برابر سانسور و تبلیغات سیاسی (بهویژه در مورد چین) آزمایش شد و در ۹۸٪ موارد توانست پاسخهایی substantive و مستقل ارائه دهد. همچنین بررسیها نشان داد که زبان درخواست یا هویت مشتری (غربی، چینی و غیره) تأثیری بر تمایل مدل به نوشتن کدهای آسیبپذیر یا مخرب ندارد.
گام بعدی شما
- اگر از ابزارهای کدنویسی AI استفاده میکنید، مدل SWE-2 را از طریق Devin Desktop یا CLI تست کنید تا تفاوت سرعت در رسیدن به اولین ویرایش کد را ببینید.
- در پروژههای بزرگ، سطوح تلاش (Medium vs Max) را مقایسه کنید تا نقطه بهینه هزینه-کیفیت را برای تیم خود بیابید.
- بررسی کنید که آیا مدل در بازسازی دادههای گمشده از محیطهای جانبی (مانند Slack یا Jira) همان تدبیر نسخه جدید را نشان میدهد یا خیر.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell و تاثیر آن بر استنتاج مدلهای تریلیونی مراجعه کنید.




گفتگو