پرش به محتوای اصلی
پرش به محتوای مقاله

مدل‌های Smaug هزینهٔ عملیاتی عامل‌های هوش مصنوعی را تا ۱۰۰ برابر کاهش دادند

·۱۹ شهریور ۱۴۰۵۵ دقیقه مطالعه
انتشار سه مدل متن‌باز Smaug توسط Abacus.AI برای وظایف عامل‌محور
انتشار سه مدل متن‌باز Smaug توسط Abacus.AI برای وظایف عامل‌محور
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جدا کردن توکن‌های استدلال از تابع زیان در هنگام آموزش؛ این کار اجازه می‌دهد مدل بدون تخریب توانایی تفکر پایه، فقط در نحوهٔ تعامل با ابزارها و APIها بهینه شود.

اگر امروز برای اجرای عامل‌های هوش مصنوعی هزینه‌های گزافی می‌پردازید، مدل‌های جدید Smaug می‌توانند صورت‌حساب شما را تا ۱۰۰ برابر کاهش دهند. این ادعای جسورانه شرکت Abacus.AI است که در ۱۰ سپتامبر ۲۰۲۶، خانوادهٔ مدل‌های Smaug را برای پایان دادن به هزینه‌های کمرشکنِ حلقه‌های تکرارشوندهٔ عامل‌ها معرفی کرد. این شرکت ادعا می‌کند که سه مدل با وزن‌های باز (Open-weight) ارائه داده است که ۱۰ تا ۱۰۰ برابر ارزان‌تر از مدل‌های پیشرو (Frontier) شرکت‌های OpenAI و Anthropic هستند.

بسیاری از سازمان‌ها با «شکاف عامل‌محور» (Agentic Gap) دست‌وپنجه نرم می‌کنند؛ وضعیتی که در آن مدل‌های متن‌باز با وجود توانایی‌های پایهٔ بالا، در وظایف طولانی‌مدت شکست می‌خورند. مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — در حالت عادی برای پاسخ‌های کوتاه طراحی شده، نه برای مدیریت پروژه‌های چندساعته. همان‌طور که در تحلیل قبلی ما درباره‌ی استراتژی‌های قیمت‌گذاری مدل‌های هوش مصنوعی و نحوه استفاده شرکت‌هایی مانند Oxlo.ai از قیمت‌گذاری نرخ ثابت (Flat-rate) برای مدیریت هزینه‌ها اشاره کردیم، عرضه Smaug تمرکز صنعت را از مدل‌های قیمت‌گذاری به سمت بهینه‌سازی لایه‌های زیرین وزن‌های مدل تغییر داده است.

تصور کنید یک عامل (Agent) — شبیه به کارمندی دیجیتال که می‌تواند به‌جای دریافت دستورات تک‌مرحله‌ای، یک پروژهٔ کدنویسی پیچیده را ساعت‌ها مدیریت کند بدون اینکه زمانش تمام شود (Timeout) یا جایگاه خود را در پروژه گم کند — اکنون واقعیت شده است. بیندور ردی (Bindu Reddy)، مدیرعامل Abacus.AI، طبق اعلام رسمی شرکت، می‌گوید Smaug دقیقاً همین مشکل را هدف قرار داده و عملکرد حلقه‌های عامل‌محور طولانی‌مدت را ۱۵ تا ۲۰ درصد بهبود بخشیده است، بدون آنکه هزینه‌ای اضافی به سیستم تحمیل کند.

جزئیات استقرار و زمینه

به نقل از مستندات فنی Abacus.AI، این مدل‌ها در حال حاضر در پلتفرم عامل‌های سازمانی و Super Assistant این شرکت ادغام شده‌اند. برای توسعه‌دهندگان و پژوهشگران، هر سه مدل برای دانلود در Hugging Face در دسترس هستند. همچنین می‌توان از طریق API شرکت RouteLLM به این مدل‌ها دسترسی داشت.

توسعه Smaug بر اثر ناکارآمدی ذاتی حلقه‌های عامل‌محور بزرگ صورت گرفت. این حلقه‌ها معمولاً شامل پنجره‌های زمینه (Context) بسیار وسیع و فراخوانی‌های مکرر ابزارها هستند. این ناکارآمدی زمانی تشدید می‌شود که حافظهٔ موقت (Prompt Caching) در فواصل زمانی طولانی از بین می‌رود و منجر به افزایش هزینه‌ها و کاهش سرعت پاسخ‌دهی می‌شود.

معرفی خانوادهٔ مدل‌های Smaug

مدل Smaug Agentic قدرتمندترین عضو این خانواده است. این مدل یک نسخه تنظیم‌شده (Supervised Fine-tune) از مدل Kimi K3 شرکت Moonshot AI است. Kimi K3 یک مدل از نوع ترکیب خبره‌ها (Mixture of Experts) با ۲.۸ تریلیون پارامتر کل و ۱۰۴ میلیارد پارامتر فعال است. این مدل دارای پنجرهٔ متنی عظیم ۱,۰۴۸,۵۷۶ توکنی است و از رمزگذار بینایی MoonViT-V2 بهره می‌برد.

بر اساس برگه فنی (Technical Brief) و کارت مدل (Model Card)، Smaug Agentic به نتایج زیر دست یافته است:

  • GPQA Diamond: ۹۴.۱
  • DeepSWE: ۶۹.۹
  • Terminal-Bench 2.1: ۸۶.۵
  • SciCode: ۶۰.۸
  • LiveBench (کدنویسی عامل‌محور): ۶۴.۶
  • AutomationBench: ۳۱.۰
  • MMMU-Pro: ۸۱.۰
  • AA-LCR: ۷۵.۷

در مقایسه با مدل پایهٔ Kimi K3، این مدل در آزمون DeepSWE و کدنویسی LiveBench رشد ۲.۴ امتیازی، در SciCode رشد ۲.۱ امتیازی، در AA-LCR رشد ۱.۰ امتیازی و در GPQA Diamond رشد ۰.۶ امتیازی داشته است. نکتهٔ کلیدی این است که طول استدلال در p99 برای آزمون‌های SciCode و AA-LCR به حدود ۰.۶ برابر مدل پایه کاهش یافته، در حالی که طول پاسخ‌های قابل مشاهده از نظر آماری تفاوتی با مدل پایه نداشته است. در یک تست سخت‌گیرانه روی ۱۱۳ وظیفهٔ DeepSWE طی هفت ساعت کار مداوم، شرکت گزارش داد که هیچ خطای زیرساختی یا توقفی (Timeout) ثبت نشده است.

برای کاربردهایی که سرعت و یکپارچگی اولویت دارد، Smaug Flash معرفی شده است. این مدل بر پایه DeepSeek V4 Flash 0731 تنظیم شده و برای عامل‌های شخصی که به برنامه‌هایی مانند واتس‌اپ، تلگرام و اسلک متصل می‌شوند، بهینه شده است. در مستندات ذکر شده که مدل پایه در استفاده از ابزارها در زمینه‌های متنی طولانی مستعد «چرخش و سردرگمی» (Spins and Confusion) بود که Smaug Flash قصد رفع آن را دارد. در تست‌های داخلی، این مدل امتیاز ۶۱.۱ را در کدنویسی LiveBench کسب کرد که نسبت به امتیاز ۴۶.۸ مدل پایه، جهشی چشمگیر است. سایر امتیازات شامل ۷۷.۴ در مجموع LiveBench، ۵۶.۶ در DeepSWE 1.1، ۳۸.۸۳ در بخش عمومی ۶۰۰ مدل AutomationBench (عبور سخت‌گیرانه) و ۷۳.۳ در NL2repo-bench است.

در نهایت، Smaug Mini یک مدل ۲۷ میلیارد پارامتری بر پایه Qwen3.8 27B است. این مدل برای کاربردهای چندوجهی (Multimodal) و چت‌بات‌های سازمانی ساده‌تر طراحی شده است. این رویکرد در ادامه بهینه‌سازی‌های مدل‌های خانواده Qwen است که پیش‌تر در مدل SuperQwen3.8 با پنجرهٔ متنی یک میلیون توکنی و ساختار بدون سانسور مشاهده شد. عملکرد آن شامل موارد زیر است:

  • مجموع LiveBench: ۷۶.۹ (در مقابل ۷۵.۳ مدل پایه)
  • IFBench: ۸۲.۰
  • AutomationBench: ۴۱.۸ (در مقابل ۳۷.۳ مدل پایه)
  • JobBench (پروتکل رسمی ۶۵ وظیفه): ۵۰.۵ (در مقابل ۳۳.۴ مدل پایه)
  • NL2repo-bench: ۵۵.۸ (در مقابل ۴۲.۳ مدل پایه)

سازوکار فنی و یادگیری

شرکت Abacus.AI صرفاً داده‌های بیشتر اضافه نکرده است، بلکه نحوهٔ یادگیری مدل برای «عمل کردن» را تغییر داده است. تکنیک Smaug ترکیبی از ردپاهای (Traces) واقعی و منتخب انسانی از رفتارهای عامل‌محور در دنیای واقعی و داده‌های مصنوعی (Synthetic Data) است که بر اساس مثال‌های دشوار بنا شده‌اند. این متدولوژی به‌گونه‌ای طراحی شده که برای هر مدل پایهٔ متن‌باز قابل اجرا باشد.

یک نکتهٔ فنی حیاتی این است که در هنگام آموزش، توکن‌های استدلالی از تابع زیان (Loss Function) ماسک شده و حذف شده‌اند. این یعنی تنظیم دقیق فقط روی «اقدامات» مدل — یعنی نحوهٔ استفاده از یک ابزار یا فراخوانی یک API — اثر می‌گذارد و توزیع استدلال داخلی مدل پایه را دست‌نخورده باقی می‌گذارد. به دلیل اینکه معماری مدل تغییر نکرده است، Smaug Agentic در هر محیطی که Kimi K3 اجرا شود، قابل اجراست و دستورالعمل‌های استقرار برای vLLM, SGLang و TokenSpeed ارائه شده است.

پروتکل ارزیابی

ارزیابی‌ها توسط Abacus.AI با استفاده از یک چارچوب (Harness) ثابت انجام شده است. داده‌های LiveBench از لیدربورد ۲۵ ژوئن ۲۰۲۶ استخراج شده‌اند. برای Smaug Agentic، نتایج روی یک استقرار اختصاصی 8×B300 با دمای (Temperature) ۱.۰ و تلاش استدلالی (Reasoning Effort) در حالت حداکثر تولید شده است. ارزیابی SciCode شامل یک اصلاح خاص برای یک نقص در لایه‌های بالادستی بود که پیش از این ۱۲ زیر-مسئله را غیرقابل حل کرده بود.

کنترل سازمانی و امنیت

به گزارش Abacus.AI، امنیت همچنان یکی از موانع اصلی پذیرش هوش مصنوعی در شرکت‌هاست. برای رفع این مشکل، امکان میزبانی این مدل‌ها در محیط‌های ابری خصوصی (VPC) فراهم شده است تا کنترل کامل روی داده‌ها و مکان میزبانی تضمین شود.

سازمان‌هایی با نیازهای شدید به حریم خصوصی می‌توانند Smaug Agentic را روی خوشهٔ GPU داخلی خود اجرا کنند. این کار کنترل کامل داده‌ها را فراهم کرده و وابستگی به APIهای شخص ثالث را حذف می‌کند. همچنین Smaug Mini به‌گونه‌ای طراحی شده که شرکت‌ها بتوانند آن را روی داده‌های اختصاصی و محرمانه خود مجدداً تنظیم (Fine-tune) کنند.

تغییر پارادایم در هوش مصنوعی عامل‌محور

این عرضه نشان‌دهندهٔ چرخش از فلسفهٔ «بزرگ‌تر بهتر است» به سمت «تخصص برای عاملیت» است. Abacus.AI با تمرکز بر «حلقه» — یعنی چرخه تفکر، عمل و مشاهده — روی این فرضیه شرط بسته است که تنظیم دقیق می‌تواند جایگزین مقیاس خام مدل‌ها شود.

برای یک مدیر کسب‌وکار، این یعنی هزینهٔ استقرار یک عامل هوش مصنوعی خودبهبودبخش دیگر به توکن‌های گران‌قیمت غول‌های بسته وابسته نیست. شما اکنون می‌توانید یک عامل در سطح مدل Opus را روی سخت‌افزار خود با کسری از قیمت اجرا کنید.

اگر این تز درست باشد، مزیت رقابتی از کسی که بزرگ‌ترین مدل را دارد به کسی منتقل می‌شود که بهترین کتابخانه از ردپاهای عامل‌محور (Agentic Traces) را برای تنظیم دقیق در اختیار دارد. باید دید جامعهٔ متن‌باز چگونه این وزن‌ها را در فریم‌ورک‌های موجود مانند AutoGPT یا LangGraph ادغام می‌کند تا مشخص شود آیا بهبود ۱۵ تا ۲۰ درصدی عملکرد، به بهره‌وری واقعی در دنیای واقعی تبدیل می‌شود یا خیر.

گام بعدی شما

  • اگر از فریم‌ورک‌های LangGraph یا AutoGPT استفاده می‌کنید، وزن‌های Smaug را جایگزین مدل‌های فعلی کنید تا کاهش هزینه استنتاج را بسنجید.
  • برای کاربردهای سبک سازمانی، Smaug Mini را روی داده‌های داخلی شرکت خود Fine-tune کنید.
  • عملکرد Smaug Flash را در محیط‌های پیام‌رسان برای مدیریت تسک‌های سریع تست کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما دربارهٔ تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تحول با تکیه بر تخصص در تنظیم دقیق (Fine-tuning)، هزینهٔ عملیاتی عامل‌های هوش مصنوعی را از سطح تجاری به سطح دست‌یافتنی برای استارتاپ‌ها می‌کشاند. اعتبار این ادعا در کاهش چشمگیر طول استدلال بدون افت کیفیت است که می‌تواند مدل‌های باز را به جایگزینی واقعی برای مدل‌های بسته تبدیل کند.

تأثیر برای ایران

به‌دلیل وزن‌های باز (Open Weights)، توسعه‌دهندگان ایرانی می‌توانند این مدل‌ها را بدون نیاز به APIهای تحریمی و به‌صورت محلی روی سرورهای خود مستقر کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز Abacus.AI بر روی «ردپاهای رفتاری» به‌جای افزایش پارامترها، نشان می‌دهد که گلوگاه فعلی عامل‌های هوش مصنوعی دیگر قدرت استدلال خام نیست، بلکه مهارت در اجرای زنجیره‌ای اقدامات است. این رویکرد احتمالاً باعث می‌شود در آینده، ارزش مدل‌ها نه بر اساس اندازه، بلکه بر اساس کیفیت کتابخانهٔ رفتارهای آموزش‌دیده آن‌ها سنجیده شود. در واقع، ما از عصر «مدل‌های همه‌فن‌حریف» به سمت «مدل‌های متخصص در اجرا» حرکت می‌کنیم.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.