اگر امروز برای اجرای عاملهای هوش مصنوعی هزینههای گزافی میپردازید، مدلهای جدید Smaug میتوانند صورتحساب شما را تا ۱۰۰ برابر کاهش دهند. این ادعای جسورانه شرکت Abacus.AI است که در ۱۰ سپتامبر ۲۰۲۶، خانوادهٔ مدلهای Smaug را برای پایان دادن به هزینههای کمرشکنِ حلقههای تکرارشوندهٔ عاملها معرفی کرد. این شرکت ادعا میکند که سه مدل با وزنهای باز (Open-weight) ارائه داده است که ۱۰ تا ۱۰۰ برابر ارزانتر از مدلهای پیشرو (Frontier) شرکتهای OpenAI و Anthropic هستند.
بسیاری از سازمانها با «شکاف عاملمحور» (Agentic Gap) دستوپنجه نرم میکنند؛ وضعیتی که در آن مدلهای متنباز با وجود تواناییهای پایهٔ بالا، در وظایف طولانیمدت شکست میخورند. مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن کتابها جواب میدهد — در حالت عادی برای پاسخهای کوتاه طراحی شده، نه برای مدیریت پروژههای چندساعته. همانطور که در تحلیل قبلی ما دربارهی استراتژیهای قیمتگذاری مدلهای هوش مصنوعی و نحوه استفاده شرکتهایی مانند Oxlo.ai از قیمتگذاری نرخ ثابت (Flat-rate) برای مدیریت هزینهها اشاره کردیم، عرضه Smaug تمرکز صنعت را از مدلهای قیمتگذاری به سمت بهینهسازی لایههای زیرین وزنهای مدل تغییر داده است.
تصور کنید یک عامل (Agent) — شبیه به کارمندی دیجیتال که میتواند بهجای دریافت دستورات تکمرحلهای، یک پروژهٔ کدنویسی پیچیده را ساعتها مدیریت کند بدون اینکه زمانش تمام شود (Timeout) یا جایگاه خود را در پروژه گم کند — اکنون واقعیت شده است. بیندور ردی (Bindu Reddy)، مدیرعامل Abacus.AI، طبق اعلام رسمی شرکت، میگوید Smaug دقیقاً همین مشکل را هدف قرار داده و عملکرد حلقههای عاملمحور طولانیمدت را ۱۵ تا ۲۰ درصد بهبود بخشیده است، بدون آنکه هزینهای اضافی به سیستم تحمیل کند.
جزئیات استقرار و زمینه
به نقل از مستندات فنی Abacus.AI، این مدلها در حال حاضر در پلتفرم عاملهای سازمانی و Super Assistant این شرکت ادغام شدهاند. برای توسعهدهندگان و پژوهشگران، هر سه مدل برای دانلود در Hugging Face در دسترس هستند. همچنین میتوان از طریق API شرکت RouteLLM به این مدلها دسترسی داشت.
توسعه Smaug بر اثر ناکارآمدی ذاتی حلقههای عاملمحور بزرگ صورت گرفت. این حلقهها معمولاً شامل پنجرههای زمینه (Context) بسیار وسیع و فراخوانیهای مکرر ابزارها هستند. این ناکارآمدی زمانی تشدید میشود که حافظهٔ موقت (Prompt Caching) در فواصل زمانی طولانی از بین میرود و منجر به افزایش هزینهها و کاهش سرعت پاسخدهی میشود.
معرفی خانوادهٔ مدلهای Smaug
مدل Smaug Agentic قدرتمندترین عضو این خانواده است. این مدل یک نسخه تنظیمشده (Supervised Fine-tune) از مدل Kimi K3 شرکت Moonshot AI است. Kimi K3 یک مدل از نوع ترکیب خبرهها (Mixture of Experts) با ۲.۸ تریلیون پارامتر کل و ۱۰۴ میلیارد پارامتر فعال است. این مدل دارای پنجرهٔ متنی عظیم ۱,۰۴۸,۵۷۶ توکنی است و از رمزگذار بینایی MoonViT-V2 بهره میبرد.
بر اساس برگه فنی (Technical Brief) و کارت مدل (Model Card)، Smaug Agentic به نتایج زیر دست یافته است:
- GPQA Diamond: ۹۴.۱
- DeepSWE: ۶۹.۹
- Terminal-Bench 2.1: ۸۶.۵
- SciCode: ۶۰.۸
- LiveBench (کدنویسی عاملمحور): ۶۴.۶
- AutomationBench: ۳۱.۰
- MMMU-Pro: ۸۱.۰
- AA-LCR: ۷۵.۷
در مقایسه با مدل پایهٔ Kimi K3، این مدل در آزمون DeepSWE و کدنویسی LiveBench رشد ۲.۴ امتیازی، در SciCode رشد ۲.۱ امتیازی، در AA-LCR رشد ۱.۰ امتیازی و در GPQA Diamond رشد ۰.۶ امتیازی داشته است. نکتهٔ کلیدی این است که طول استدلال در p99 برای آزمونهای SciCode و AA-LCR به حدود ۰.۶ برابر مدل پایه کاهش یافته، در حالی که طول پاسخهای قابل مشاهده از نظر آماری تفاوتی با مدل پایه نداشته است. در یک تست سختگیرانه روی ۱۱۳ وظیفهٔ DeepSWE طی هفت ساعت کار مداوم، شرکت گزارش داد که هیچ خطای زیرساختی یا توقفی (Timeout) ثبت نشده است.
برای کاربردهایی که سرعت و یکپارچگی اولویت دارد، Smaug Flash معرفی شده است. این مدل بر پایه DeepSeek V4 Flash 0731 تنظیم شده و برای عاملهای شخصی که به برنامههایی مانند واتساپ، تلگرام و اسلک متصل میشوند، بهینه شده است. در مستندات ذکر شده که مدل پایه در استفاده از ابزارها در زمینههای متنی طولانی مستعد «چرخش و سردرگمی» (Spins and Confusion) بود که Smaug Flash قصد رفع آن را دارد. در تستهای داخلی، این مدل امتیاز ۶۱.۱ را در کدنویسی LiveBench کسب کرد که نسبت به امتیاز ۴۶.۸ مدل پایه، جهشی چشمگیر است. سایر امتیازات شامل ۷۷.۴ در مجموع LiveBench، ۵۶.۶ در DeepSWE 1.1، ۳۸.۸۳ در بخش عمومی ۶۰۰ مدل AutomationBench (عبور سختگیرانه) و ۷۳.۳ در NL2repo-bench است.
در نهایت، Smaug Mini یک مدل ۲۷ میلیارد پارامتری بر پایه Qwen3.8 27B است. این مدل برای کاربردهای چندوجهی (Multimodal) و چتباتهای سازمانی سادهتر طراحی شده است. این رویکرد در ادامه بهینهسازیهای مدلهای خانواده Qwen است که پیشتر در مدل SuperQwen3.8 با پنجرهٔ متنی یک میلیون توکنی و ساختار بدون سانسور مشاهده شد. عملکرد آن شامل موارد زیر است:
- مجموع LiveBench: ۷۶.۹ (در مقابل ۷۵.۳ مدل پایه)
- IFBench: ۸۲.۰
- AutomationBench: ۴۱.۸ (در مقابل ۳۷.۳ مدل پایه)
- JobBench (پروتکل رسمی ۶۵ وظیفه): ۵۰.۵ (در مقابل ۳۳.۴ مدل پایه)
- NL2repo-bench: ۵۵.۸ (در مقابل ۴۲.۳ مدل پایه)
سازوکار فنی و یادگیری
شرکت Abacus.AI صرفاً دادههای بیشتر اضافه نکرده است، بلکه نحوهٔ یادگیری مدل برای «عمل کردن» را تغییر داده است. تکنیک Smaug ترکیبی از ردپاهای (Traces) واقعی و منتخب انسانی از رفتارهای عاملمحور در دنیای واقعی و دادههای مصنوعی (Synthetic Data) است که بر اساس مثالهای دشوار بنا شدهاند. این متدولوژی بهگونهای طراحی شده که برای هر مدل پایهٔ متنباز قابل اجرا باشد.
یک نکتهٔ فنی حیاتی این است که در هنگام آموزش، توکنهای استدلالی از تابع زیان (Loss Function) ماسک شده و حذف شدهاند. این یعنی تنظیم دقیق فقط روی «اقدامات» مدل — یعنی نحوهٔ استفاده از یک ابزار یا فراخوانی یک API — اثر میگذارد و توزیع استدلال داخلی مدل پایه را دستنخورده باقی میگذارد. به دلیل اینکه معماری مدل تغییر نکرده است، Smaug Agentic در هر محیطی که Kimi K3 اجرا شود، قابل اجراست و دستورالعملهای استقرار برای vLLM, SGLang و TokenSpeed ارائه شده است.
پروتکل ارزیابی
ارزیابیها توسط Abacus.AI با استفاده از یک چارچوب (Harness) ثابت انجام شده است. دادههای LiveBench از لیدربورد ۲۵ ژوئن ۲۰۲۶ استخراج شدهاند. برای Smaug Agentic، نتایج روی یک استقرار اختصاصی 8×B300 با دمای (Temperature) ۱.۰ و تلاش استدلالی (Reasoning Effort) در حالت حداکثر تولید شده است. ارزیابی SciCode شامل یک اصلاح خاص برای یک نقص در لایههای بالادستی بود که پیش از این ۱۲ زیر-مسئله را غیرقابل حل کرده بود.
کنترل سازمانی و امنیت
به گزارش Abacus.AI، امنیت همچنان یکی از موانع اصلی پذیرش هوش مصنوعی در شرکتهاست. برای رفع این مشکل، امکان میزبانی این مدلها در محیطهای ابری خصوصی (VPC) فراهم شده است تا کنترل کامل روی دادهها و مکان میزبانی تضمین شود.
سازمانهایی با نیازهای شدید به حریم خصوصی میتوانند Smaug Agentic را روی خوشهٔ GPU داخلی خود اجرا کنند. این کار کنترل کامل دادهها را فراهم کرده و وابستگی به APIهای شخص ثالث را حذف میکند. همچنین Smaug Mini بهگونهای طراحی شده که شرکتها بتوانند آن را روی دادههای اختصاصی و محرمانه خود مجدداً تنظیم (Fine-tune) کنند.
تغییر پارادایم در هوش مصنوعی عاملمحور
این عرضه نشاندهندهٔ چرخش از فلسفهٔ «بزرگتر بهتر است» به سمت «تخصص برای عاملیت» است. Abacus.AI با تمرکز بر «حلقه» — یعنی چرخه تفکر، عمل و مشاهده — روی این فرضیه شرط بسته است که تنظیم دقیق میتواند جایگزین مقیاس خام مدلها شود.
برای یک مدیر کسبوکار، این یعنی هزینهٔ استقرار یک عامل هوش مصنوعی خودبهبودبخش دیگر به توکنهای گرانقیمت غولهای بسته وابسته نیست. شما اکنون میتوانید یک عامل در سطح مدل Opus را روی سختافزار خود با کسری از قیمت اجرا کنید.
اگر این تز درست باشد، مزیت رقابتی از کسی که بزرگترین مدل را دارد به کسی منتقل میشود که بهترین کتابخانه از ردپاهای عاملمحور (Agentic Traces) را برای تنظیم دقیق در اختیار دارد. باید دید جامعهٔ متنباز چگونه این وزنها را در فریمورکهای موجود مانند AutoGPT یا LangGraph ادغام میکند تا مشخص شود آیا بهبود ۱۵ تا ۲۰ درصدی عملکرد، به بهرهوری واقعی در دنیای واقعی تبدیل میشود یا خیر.
گام بعدی شما
- اگر از فریمورکهای LangGraph یا AutoGPT استفاده میکنید، وزنهای Smaug را جایگزین مدلهای فعلی کنید تا کاهش هزینه استنتاج را بسنجید.
- برای کاربردهای سبک سازمانی، Smaug Mini را روی دادههای داخلی شرکت خود Fine-tune کنید.
- عملکرد Smaug Flash را در محیطهای پیامرسان برای مدیریت تسکهای سریع تست کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهٔ تراشههای Blackwell مراجعه کنید.




گفتگو