پرش به محتوای اصلی
پرش به محتوای مقاله

شرکت Cognition: هزینهٔ کدنویسی SWE-2 حدود ۶۴٪ کاهش یافت

·۱۹ شهریور ۱۴۰۵۱۵ دقیقه مطالعه۱ بازدید
نمودار جبهه پارتو: مقایسه عملکرد SWE-2 با مدل‌های پیشین در تعادل هزینه-دقت
نمودار جبهه پارتو: مقایسه عملکرد SWE-2 با مدل‌های پیشین در تعادل هزینه-دقت
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی خبره‌های مجزا با یک الگوریتم RL واحد که با اعمال جریمه هزینه خطی، مدل را مجبور به بهینه‌سازی مسیر استدلال می‌کند. این اولین بار است که یادگیری تقویتی در مقیاس چند-تریلیون پارامتر برای کاهش هزینه استنتاج بدون افت کیفیت به کار گرفته شده است.

هزینه ۶۴٪ کمتر؛ این تنها عدد نیست، بلکه تغییر قواعد بازی در استقرار عامل‌های کدنویس است. مدل SWE-2 که در ۱۰ سپتامبر ۲۰۲۶ توسط شرکت Cognition منتشر شد، ثابت کرد که می‌توان بدون افت کیفیت، هزینه‌های محاسباتی را به‌شدت کاهش داد.

طبق اعلام این شرکت، SWE-2 در محک FrontierCode 1.1 Main به امتیاز ۵۰.۰٪ رسید و بدین ترتیب عملکرد مدل Fable 5.1 را با هزینه‌ای بسیار کمتر بازتولید کرد. این اتفاق در حالی رخ می‌دهد که صنعت هوش مصنوعی از تعقیب کورکورانه نمرات بنچمارک، به سمت بهینه‌سازی «جبهه پارتو» (Pareto frontier) — یعنی یافتن نقطه بهینه بین توانایی مدل و هزینه مالی استنتاج (Inference) — حرکت کرده است.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی مدل‌های بازمتن اشاره کردیم، کاهش هزینه استنتاج کلید تبدیل مدل‌های آزمایشگاهی به ابزارهای تجاری است. برای توسعه‌دهندگان، این یعنی شکاف میان عامل‌های «ارزان اما غیرقابل‌اعتماد» و «گران اما توانمند» به‌سرعت در حال بسته شدن است.

Cognition برای ساخت این مدل، زیرساخت‌های نسخه SWE-1.7 را ارتقا داد و برای نخستین بار یادگیری تقویتی (Reinforcement Learning) را در مقیاس چند-تریلیون پارامتر پیاده کرد. SWE-2 بر پایه مدل Kimi K3 با ۲.۸ تریلیون پارامتر آموزش دیده است. به نقل از تیم فنی Cognition، فرآیند یادگیری تقویتی آن‌ها توانست ۵ تا ۶ امتیاز به نتایج بسیاری از محک‌ها اضافه کند و منحنی هزینه-عملکرد مدل پایه را به‌طور کلی جابه‌جا کند.

عملکرد در محک‌های فنی

مدل SWE-2 در چندین معیار کلیدی مهندسی نرم‌افزار، مدل‌های SWE-1.7 و Grok 4.6 را شکست داد و در برخی موارد با مدل‌های بسیار گران‌قیمت‌تر رقابت کرد:

  • FrontierCode 1.1 Main: کسب امتیاز ۵۰.۰٪ (در فاصله یک امتیازی از Fable 5.1 با ۵۰.۹٪ و برتری نسبت به Grok 4.6 با ۴۸.۰٪).
  • DeepSWE 1.1: کسب امتیاز ۷۳.۰٪ که به‌طور چشمگیری از SWE-1.7 (۳۷.۷٪) پیشی گرفت و حتی مدل GPT-5.6 Sol (۷۲.۷٪) را پشت سر گذاشت.
  • Terminal-Bench 2.1: دستیابی به ۹۲.۸٪ که نشان‌دهنده تسلط بالا در محیط‌های خط فرمان (CLI) است و از GPT-6 Astra (۸۹.۹٪) بالاتر است.
  • Terminal-Bench 4: جهشی بزرگ از ۷.۶٪ در نسخه قبلی به ۲۷.۳٪، هرچند هنوز فاصله زیادی با Fable 5.1 (۵۵.۸٪) دارد.

سازوکار فنی: یادگیری تقویتی مبتنی بر پارتو

دستاورد اصلی Cognition، یک الگوریتم جدید یادگیری تقویتی است که تمام سطوح تلاش استدلالی را در یک اجرای واحد آموزش می‌دهد. برخلاف Kimi K3 که برای هر سطح پیچیدگی، خبره‌های جداگانه‌ای آموزش می‌داد، Cognition یک «جریمه هزینه خطی» برای هر سطح تلاش اعمال کرد.

در این مدل، تابع پاداش به‌گونه‌ای طراحی شده که پاداش برابر است با «موفقیت منهای جریمه هزینه» ($R = S - \lambda_e C$). در این فرمول، $S$ نشان‌دهنده موفقیت، $C$ هزینه (ترکیبی از هزینه دلاری و زمان اجرا) و $\lambda_e$ پارامتری است که با شیب منحنی پارتو در سطح تلاش $e$ تنظیم می‌شود. این سازوکار مدل را مجبور می‌کند تا به جای صرف محاسبات بی‌هدف، بهینه‌ترین مسیر رسیدن به جواب را پیدا کند.

تغییرات رفتاری در کدنویسی

این بهینگی در نحوه تعامل عامل با کدبیس کاملاً مشهود است. در سطح تلاش متوسط (medium)، مدل SWE-2 در مقایسه با نسخه ۱.۷، ۵۸٪ نوبت‌های کمتری را طی می‌کند و ۸۱٪ ارزان‌تر است. میانگین نوبت‌های اجرا از ۱۲۷ نوبت در نسخه قبلی به ۵۳ نوبت در نسخه جدید کاهش یافته است.

یکی از تغییرات کلیدی، «کاوش متمرکز» است. در حالی که SWE-1.7 به خواندن‌های تکراری و جامع کدبیس معروف بود، SWE-2 با قضاوت مهندسی قوی‌تر، فایل‌های حیاتی را شناسایی می‌کند. به طور میانگین، این مدل پس از ۱۸ گام اولین ویرایش واقعی کد را انجام می‌دهد، در حالی که در نسخه قبلی این عدد ۴۸ گام بود.

به گزارش Cognition، سه بهبود رفتاری مشخص در این نسخه دیده می‌شود:

۱. پوشش تست: نوشتن تست‌های End-to-End قابل‌اعتمادتر برای شناسایی لبه‌های خطا.
۲. تدبیر در حل مسئله: در صورت مسدود شدن مسیر اصلی، مدل به دنبال جایگزین می‌گردد (مثلاً بازسازی داده‌های گم‌شده از تاریخچه Slack).
۳. انضباط در تایید: مدل به‌جای تایید ساده حرف کاربر، نتایج را باز-استخراج کرده و شواهد را بررسی می‌کند.

دینامیک سطوح تلاش

در SWE-2 سه سطح تلاش تعریف شده است. تنظیمات «متوسط» برای کارهای ساده و میان‌رده طراحی شده تا سریع‌تر وارد فاز اجرا شود. در مقابل، سطوح «بالا» (high) و «بیشینه» (max) برای وظایف پیچیده به کار می‌روند که با برنامه‌ریزی گسترده‌تر و بررسی‌های عمیق‌تر کدبیس همراه هستند.

زیرساخت آموزش و داده‌ها

برای پشتیبانی از مدل ۲.۸ تریلیون پارامتری، Cognition زیرساخت سرویس‌دهی خود را با چهار هدف بازطراحی کرد: حداکثر کردن توان عملیاتی، کاهش تأخیر، مدیریت ظرفیت KV Cache و حفظ نزدیکی عددی بین استنتاج و آموزش. این رویکرد بهینه‌سازی زیرساختی، یادآور پیشرفت‌های اخیر در سطح سخت‌افزار است؛ برای مثال، بهینه‌سازی هسته‌های GPU با Codex توانست سرعت محاسبات پیچیده را به شکل خیره‌کننده‌ای افزایش دهد.

  • بهینه‌سازی Rollout: با ساخت یک زمان‌بند برای دسته‌بندی درخواست‌ها، توان عملیاتی (TPS) هر GPU بین ۱۰ تا ۲۰٪ افزایش یافت.
  • رمزگشایی گمانه‌زنانه: استفاده از DSpark و SpecForge برای افزایش طول پذیرش توکن‌ها تا ۱۵٪.
  • دقت و حافظه: بهره‌گیری از کرنل‌های NVFP4 و FP8 با آموزش آگاه از کوانتش (Quantization-aware training).

در بخش داده‌ها نیز، تعداد محیط‌های یادگیری تقویتی سه برابر شد و لایه‌های «پیروی از دستور» (Instruction-following) اضافه شدند تا مدل بتواند چندین الزام را هم‌زمان در زمینه نگه دارد بدون اینکه هدف اصلی را فراموش کند.

پایداری و همراستاسازی

برای جلوگیری از سوءاستفاده از پاداش (Reward hacking)، Cognition از یک چرخه بازخوردی بازگشتی استفاده کرد تا موارد مثبت و منفی کاذب را شناسایی و اصلاح کند. همچنین برای پایداری آموزش، از یک خط پایه پاداش وزن‌دار بر اساس طول اجرا استفاده کردند که باعث کاهش واریانس گرادیان و پایداری بیشتر در مقایسه با روش‌های استاندارد شد.

در زمینه ایمنی، مدل در برابر سانسور و تبلیغات سیاسی (به‌ویژه در مورد چین) آزمایش شد و در ۹۸٪ موارد توانست پاسخ‌هایی substantive و مستقل ارائه دهد. همچنین بررسی‌ها نشان داد که زبان درخواست یا هویت مشتری (غربی، چینی و غیره) تأثیری بر تمایل مدل به نوشتن کدهای آسیب‌پذیر یا مخرب ندارد.

گام بعدی شما

  • اگر از ابزارهای کدنویسی AI استفاده می‌کنید، مدل SWE-2 را از طریق Devin Desktop یا CLI تست کنید تا تفاوت سرعت در رسیدن به اولین ویرایش کد را ببینید.
  • در پروژه‌های بزرگ، سطوح تلاش (Medium vs Max) را مقایسه کنید تا نقطه بهینه هزینه-کیفیت را برای تیم خود بیابید.
  • بررسی کنید که آیا مدل در بازسازی داده‌های گم‌شده از محیط‌های جانبی (مانند Slack یا Jira) همان تدبیر نسخه جدید را نشان می‌دهد یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell و تاثیر آن بر استنتاج مدل‌های تریلیونی مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با تکیه بر تخصص در یادگیری تقویتی مقیاس‌بزرگ، اثبات کرد که می‌توان عملکرد مدل‌های پیشرو را با هزینه‌ای بسیار کمتر به دست آورد. این تغییر، استقرار گسترده عامل‌های مهندسی نرم‌افزار را در سازمان‌ها از نظر اقتصادی توجیه‌پذیر می‌کند.

تأثیر برای ایران

به‌دلیل محدودیت‌های دسترسی به APIهای پیشرفته و هزینه‌های بالای ارزی، مدل‌هایی که هزینه استنتاج را کاهش می‌دهند برای توسعه‌دهندگان ایرانی جذاب‌ترند، هرچند دسترسی به Devin همچنان نیازمند ابزارهای دور زدن تحریم است.

·نگاه ما
تحریریه دات‌هوش

تمرکز Cognition بر «جبهه پارتو» نشان می‌دهد که دوران رقابت صرف بر سر نمرات بنچمارک به پایان رسیده و اکنون میدان نبرد، بهره‌وری استنتاج است. جالب اینجاست که SWE-2 ثابت کرد افزایش توان استدلالی لزوماً به معنای افزایش مصرف محاسبات نیست، بلکه با یک تابع پاداش درست در RL، می‌توان مدل را به «تنبلی هوشمندانه» یا همان یافتن کوتاه‌ترین مسیر درست سوق داد. این رویکرد احتمالاً الگوی آینده برای تمام عامل‌های خودمختار خواهد بود که باید بودجه محاسباتی خود را بر اساس سختی تسک مدیریت کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.