اگر امروز بودجههای کلان شرکتتان را صرف مدلهای گرانقیمت برای تصحیح غلطهای تایپی یا نوشتن توابع ساده میکنید، باید بدانید راهی برای کاهش ۳ تا ۵ برابری این هزینهها پیدا شده است. شرکت Fireworks AI در ۲۶ ژوئیه ۲۰۲۶ ابزار Fireworks Nexus را عرضه کرد تا بحران اتلاف بودجه در تیمهای مهندسی را متوقف کند.
این اتفاق درست زمانی رخ میدهد که پذیرش مدلهای عاملمحور (Agentic AI) — یعنی سیستمهایی که میتوانند بهطور مستقل ابزارها را اجرا کرده و تصمیم بگیرند — بهشدت افزایش یافته است. طبق گزارشی که Fireworks نقل کرده، استفاده مهندسان از این ابزارها در تنها دو ماه از یکسوم به بیش از چهارپنجم رسیده است. این جهش باعث شده سازمانها برای کارهای روتین، «قیمتهای مدلهای پیشرو» پرداخت کنند؛ روندی که باعث شد شرکت Uber کل بودجه هوش مصنوعی سال ۲۰۲۶ خود را تنها در چهار ماه اول مصرف کند. این فشار مالی سازمانها را به سمت راهکارهای سختگیرانه سوق داده است؛ چنانکه تسلا نیز پیشتر سقف هزینه توکنهای هوش مصنوعی کارکنان خود را محدود کرد تا از هزینههای پیشبینینشده جلوگیری کند.
همانطور که در تحلیل قبلی ما دربارهی ریسکهای مدلهای وزنباز اشاره کردیم، Nexus تلاش میکند این مدلها را برای محیطهای تجاری کاربردی کند. این لایه، اصطکاک عملیاتی را حذف میکند تا تیمهای پلتفرم دیگر برای جایگزینی مدلهای بسته با مدلهای باز تردید نکنند. این حرکت با روند جهانی تصاحب ۶۵ درصدی حجم توکنها توسط مدلهای وزنباز همسو است که نشان میدهد صنعت به سمت بهینهسازی هزینهها حرکت میکند.
سیستم Nexus از سه بخش فنی اصلی تشکیل شده است:
- کنترلهای سازمانی: تنظیم متمرکز بودجه و ردیابی نرخ بازگشت سرمایه (ROI) در ۲۰ مرکز داده جهانی، بدون ذخیرهسازی دادهها.
- FireConnect: یک نصبکننده تکخطی با مجوز Apache 2.0 که ابزارهای فعلی مثل Claude Code، Codex و OpenCode را بدون تغییر در گردش کار، به مدلهای Fireworks متصل میکند.
- مدیریت ترافیک هوشمند: یک مدل آموزشدیده اختصاصی که سطح دشواری درخواست را میسنجد. کارهای ساده به مدلهای ارزان وزنهای باز (Open Weights) — یعنی مدلهایی که «دستور پخت» یا همان پارامترهایشان علناً منتشر شده — سپرده میشوند و تسکهای دشوار به کلید API مدلهای پیشرو میروند.
بر اساس مستندات این شرکت، تستهای اولیه با Notion و Doximity نشان میدهد هزینه هر Pull Request ادغامشده یکسوم کاهش یافته است. تیم تحقیقات Fireworks همچنین گزارش دادهاند که نرخ توکنهای ترکیبی در این سیستم، تقریباً یکچهارم نرخ مدلهای بسته است.
به گزارش Faros AI که ۲۱۱ تسک واقعی مهندسی را در ۱۲ مخزن کد بررسی کرده، این روش مسیریابی بسیار موثر است. آنها دریافتند Claude Code وقتی روی مدل GLM-5.2 اجرا شد، امتیاز ۰.۵۶۸ را کسب کرد که از امتیاز ۰.۵۲۱ مدل Opus 4.8 بیشتر بود؛ در حالی که هزینه هر تسک تنها ۰.۹۲ دلار بود (در مقابل ۱.۷۶ دلار برای مدل گرانتر).
سپس مطالعه مشترکی با Arize روی ۲۴۰۰ آزمایش در ۴۰ تسک Terminal-Bench انجام شد. این مطالعه نشان داد در کارهای آسان، پرداخت «پاداش پیشرو» هیچ سودی ندارد؛ مثلاً مدل Kimi K2.6 در ۷۳٪ موارد موفق بود، در حالی که GPT-5.5 تنها ۶۹٪ را پاس کرد. اما در تسکهای سخت، فقط لایه برتر رقابتی بود و GPT-5.5 با ۵۱٪ موفقیت، مدل Kimi K3 را با ۳۲٪ شکست داد.
دادههای Arize ثابت میکند «نردبان ارتقای آگاهانه» بهینهترین استراتژی است. این روش مسیریابی به هزینه ۰.۵۲۵ دلار برای هر تسک موفق رسید و ۳۲.۳ تسک از ۴۰ مورد را حل کرد. در مقابل، استفاده تکمدلی از GPT-5.5 هزینه ۰.۶۳۶ دلار داشت و فقط ۲۵ تسک را حل کرد. بدترین عملکرد مربوط به ارتقای سادهلوحانه بین ۱۰ مدل با هزینه ۱.۳۱۹ دلار بود. این رویکرد لایهبندی شده در واقع پاسخی به شکاف هماهنگی در سامانههای چندعاملی است که پیشتر مانع از بهرهوری این سیستمها در مقیاس سازمانی میشد.
برای تیمهایی که میخواهند این سیستم را پیاده کنند، سادهترین راه استفاده از نصبکننده FireConnect است. این ابزار نیاز دارد Claude Code CLI روی سیستم شما نصب باشد و با دستوراتی مثل /fireconnect:on و /fireconnect:set-models وضعیت مسیریابی را مدیریت میکند.
این چرخش نشان میدهد آینده هوش مصنوعی سازمانی در گرو پیدا کردن یک «مدل خدا» نیست، بلکه در ساخت لایههای ارکستراسیون هوشمند نهفته است. با تبدیل مدلها به کالاهای جایگزین بر اساس دشواری کار، شرکتها میتوانند بدون کاهش کیفیت کد، جلوی خونریزی بودجه را بگیرند.
توسعهدهندگان باید گذار Nexus را از وضعیت پیشنمایش پژوهشی — که فعلاً بین Claude Opus 5 و GLM-5.2 مسیریابی میکند — به نسخه تولیدی کامل زیر نظر داشته باشند.
گام بعدی شما
- بررسی هزینه استنتاج (Inference) فعلی خود برای کارهای تکراری کدنویسی.
- تست نصبکننده FireConnect برای جایگزینی مدلهای گران با مدلهای وزنباز در محیط توسعه.
- مطالعه مستندات ارزیابی دشواری تسکها برای بهینهسازی لایه مسیریابی.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است؛ اثر این بهینهسازیها بر مصرف GPU را در گزارشهای بعدی بررسی خواهیم کرد.




گفتگو