اگر برای اجرای عاملهای هوش مصنوعی هزینه پرداخت میکنید، احتمالاً نیمی از صورتحساب شما بابت «فکرهای بیهوده» مدل است. شرکت Fireworks AI در ۲۳ سپتامبر ۲۰۲۶ مدل Ember-1 را عرضه کرد؛ اولین مدلی که بهطور خاص برای تشخیص تفاوت بین ردپاهای استدلالی مفید و بیفایده آموزش دیده است تا این مالیات پنهان عصر عاملها را با حذف توکنهای استدلالی زائد از بین ببرد.
بسیاری از مدلهای استدلالی بیش از ۹۰٪ توکنهای تولیدی خود را صرف برنامهریزی داخلی و تردید (Second-guessing) میکنند، پیش از آنکه پاسخ نهایی را بنویسند. به نقل از Fireworks AI، مدلهایی مانند Kimi K3 بهشدت مستعد این رفتار هستند. برای یک پرسش ساده، این هزینه ناچیز است؛ اما برای یک عامل (Agent) — شبیه دستیاری که برای انجام یک پروژه، چندین مرحله فکر و عمل میکند — این موضوع یک فاجعه مالی است. چون تاریخچه گفتگو در هر درخواست مجدداً ارسال میشود، هزینه این ردپاهای استدلالی بهصورت نمایی (Quadratic) رشد میکند. این فشار مالی در حالی رخ میدهد که میزان مصرف توکنها در پلتفرمهایی مانند OpenRouter رشد خیرهکنندهای داشته است و هزینههای عملیاتی را برای توسعهدهندگان به چالش کشیده است.
Fireworks AI این مشکل را بهوضوح تبیین میکند: در گام پانزدهم یک جلسه عامل، شما فقط هزینه ۱۵ مرحله فکر کردن را نمیپردازید، بلکه هزینه بازخوانی ۱۴ دور قبلی از تمام تفکرات مدل را هم میدهید. در واقع، پرگوییهای مراحل اولیه در هر گام بعدی مجدداً صورتحساب میشوند و به همین دلیل است که صورتحسابهای مدلهای استدلالی در محیطهای عاملمحور بهسرعت منفجر میشوند.
تا پیش از این، تنها راه کاهش هزینه، کم کردن درجه «تلاش استدلالی» (Reasoning Effort) بود. اما این شرکت دریافت که کاهش این تنظیمات، اغلب کیفیت را میکشد؛ چون مدل در این حالت، اصلاحات حیاتی را همزمان با اضافات حذف میکند. Ember-1 با تنظیم دقیق (Fine-tuning) — مثل وقتی به یک پزشک عمومی، تخصص پوست میدهیم تا روی یک حوزه دقیق شود — این مشکل را حل کرده است؛ مدل یاد گرفته اصلاحات را نگه دارد و حلقههای تکراری و زائد را حذف کند.
سازوکار بهرهوری
مدل Ember-1 یک مدل کوچکتر یا یک معماری جدید نیست، بلکه نسخهای بهینهشده از مدل Kimi K3 متعلق به شرکت Moonshot AI است. هدف این نبود که نرخ قیمت ارزانتر شود یا ردپای مدل کوچکتر شود، بلکه هدف این بود که همان مدل را طوری آموزش دهند که وقت کمتری تلف کند. ادعای آنها غیرمعمول و صریح است: پاسخهای یکسان، اما ۴۰٪ توکن کمتر.
فرآیند آموزش شامل یک فاز آزمایشی سختگیرانه برای تفکیک استدلال مفید (مانند اصلاح خودکار، بررسی مفروضات و بازیابی از خطاها) از استدلال بیفایده (مانند حلقههای تکراری و تأیید مجدد حقایقی که قبلاً تأیید شدهاند) بوده است. این تلاشها شامل موارد زیر بود:
- آزمایشهای گسترده: اجرای بیش از ۵۰ آزمایش آموزشی برای یافتن نقطه بهینه.
- ارزیابی سختگیرانه: انجام بیش از ۲۰۰ ارزیابی برای تضمین پایداری مدل و عدم افت کیفیت.
- نوآوری الگوریتمی: توسعه الگوریتمهای آموزشی جدید که بهطور خاص برای کوتاه کردن استدلال بدون آسیب به دقت طراحی شدهاند.
- تنوع در وظایف: آموزش روی طیف وسیعی از تسکها برای اطمینان از اینکه صرفهجویی در توکنها فقط محدود به کارهای کدنویسی نیست و به سایر حوزهها نیز منتقل میشود.
روشهای اعتبارسنجی
شرکت Fireworks AI مدل خود را از سه مسیر اصلی تأیید کرد که مورد سوم برای آمادگی در محیط تولید (Production) حیاتیترین بود:
۱. محکهای خارجی: Ember-1 توانست مرز کیفیت-بهرهوری خود را در نزدیکی سطوح مدل Kimi K3 حفظ کند.
۲. استقرار خاموش (Silent Rollout): Fireworks توسعهدهندگان داخلی خود را بدون اطلاع آنها به Ember-1 منتقل کرد؛ تیمی که در نهایت گزارش داد هیچ افت کیفیتی احساس نمیکند و هیچ شکایت یا پسروی (Regression) در کیفیت در این فاز داخلی ثبت نشد.
۳. تستهای A/B در محیط عملیاتی: بررسی بارهای کاری واقعی کدنویسی که نشاندهنده تغییر چشمگیر در بهرهوری بود.
تحلیل دادهها: دستاوردها و هزینهها
در یک تست عملیاتی روی عاملهای کدنویسی، اعداد تفاوت تکاندهندهای را در مصرف منابع نشان میدهند. تسکهایی که در مدل K3 بهطور متوسط ۴۹,۳۰۰ توکن خروجی در ۲۳.۸ گام عامل نیاز داشتند، در Ember-1 تنها به ۲۹,۹۰۰ توکن در ۲۱.۴ گام نیاز داشتند.
این یعنی کاهش ۷۱.۳ درصدی در توکنهای استدلالی و کاهش کل هزینه توکنها به میزان حدود ۳۹٪. امتیاز کیفیت نیز تقریباً ثابت ماند و از ۰.۷۵۱ برای K3 به ۰.۷۵۳ برای Ember-1 رسید. باید توجه داشت که این اعداد توسط خود Fireworks گزارش شدهاند، هرچند استفاده از ترافیک واقعی تولیدی و استقرار خاموش، این شواهد را نسبت به بنچمارکهای مصنوعی سختتر برای جعل میکند.
با این حال، این بهرهوری هزینهای خاص در بنچمارکهای سطح بالا دارد. در آزمون SWE-bench Verified، مدل Ember-1 امتیاز ۹۲.۲٪ گرفت که یک درصد کمتر از ۹۳.۲٪ مدل K3-Max است. برای اکثر تیمها، ۳۹٪ صرفهجویی در هزینه، این افت ناچیز را توجیه میکند؛ چرا که این یک درصد افت، در هر ۵۰۰ تسک حدود ۶۸.۱۰ دلار صرفهجویی به همراه دارد. البته برای خط لولههایی (Pipelines) که هر درصد کیفیت در آنها حیاتی است، این سبک مبادله (Trade-off) واقعاً قابل بحث است.
جالب اینجاست که Ember-1 در برخی بنچمارکها حتی از مدل اصلی پیشی گرفت:
- Terminal Bench 2.1: امتیاز ۸۲.۰٪ در برابر ۸۰.۹٪ مدل K3-Max.
- DeepSWE 1.1: امتیاز ۷۵.۲٪ در برابر ۶۶.۴٪ (یک پیروزی ۸.۸ امتیازی که در ۱۱۳ تسک منجر به صرفهجویی ۱۲۶.۹۰ دلاری شد).
این نتایج نشان میدهد که گاهی ردپاهای استدلالی بیش از حد طولانی، میتوانند مضر باشند. فرضیه اصلی این است که کوتاه کردن مسیر، مدل را مجبور به استدلال متمرکزتر و آگاهانهتر کرده و به آن کمک کرده تا از حلقههایی که در واقع به عملکردش آسیب میزدند، خارج شود.
مقایسه Ember-1 در برابر Kimi K3
برای خلاصه کردن این مقایسه:
- مدل پایه: تنظیم دقیق شده از Kimi K3؛ بدون هیچ تغییر در معماری.
- مصرف توکن: حدود ۴۰٪ کاهش کل توکنها؛ ۷۱.۳٪ کاهش توکنهای استدلالی در تستهای A/B کدنویسی.
- کیفیت: ثابت در بارهای کاری عملیاتی (۰.۷۵۳ در برابر ۰.۷۵۱)؛ افت جزئی در SWE-bench Verified.
- هزینه: حدود ۳۹٪ کاهش هزینه به ازای هر تسک با قیمت یکسان هر توکن.
- ریسک: افت ۱ امتیازی در SWE-bench Verified نسبت به K3-Max.
استراتژی جایگزینی و پیادهسازی
برای توسعهدهندگانی که مدلهای استدلالی را در پسِ عاملهای خود اجرا میکنند، Fireworks AI یک توالی ارزیابی خاص را پیشنهاد میکند تا متوجه شوند آیا این جابجایی برای آنها به صرفه است یا خیر:
- گام ۱: سنجش سهم استدلال. دادههای مصرف یک هفته اخیر خود را استخراج کنید. اگر توکنهای استدلالی ۷۰ تا ۹۰ درصد صورتحساب شما را تشکیل میدهند، اقتصاد این مدل برای شما صادق است. اگر زیر ۵۰ درصد است، دستاوردهای آن ناچیز خواهد بود.
- گام ۲: بررسی شکل بار کاری. شناسایی کنید که آیا جلسات چندمرحلهای طولانی دارید یا خیر. یک خلاصهساز تکمرحلهای سود کمی میبرد، اما یک عامل کدنویسی ۲۰ مرحلهای به دلیل رشد نمایی هزینهها، بیشترین سود را میبرد.
- گام ۳: تعیین خط قرمز کیفیت. دستهبندیهایی از تسکها را پیدا کنید که در آنها حتی یک درصد افت کیفیت را هم نمیتوانید تحمل کنید. ابتدا Ember-1 را در برابر K3 روی همان دستههای خاص اجرا کنید.
- گام ۴: مقایسه هزینه هر تسک. قیمت هر توکن یکسان است. برتری Ember-1 در این است که تسکها را با توکنهای کمتر و در گامهای کمتر به پایان میرساند و هزینه نهایی هر تسک را پایین میآورد.
- گام ۵: بودجهبندی هزینه جابجایی. در حالی که تغییر فنی ساده است (تغییر یک خط در Base URL از طریق یک Endpoint سازگار با OpenAI)، هزینه واقعی، اجرای مجدد مجموعه ارزیابیهای (Eval Suite) شماست. دو هفته متوالی از کیفیت یکسان روی ترافیک واقعی خودتان، معیاری معقول برای پذیرش نهایی است.
تأثیر گستردهتر بر صنعت
این عرضه نشاندهنده تغییری در نگاه صنعت به مفهوم «تفکر» است. Fireworks AI با تبدیل بهرهوری به یک هدف آموزشی (Training Objective) به جای یک تنظیم ساده (Settings Dial)، ثابت کرد که ما تا به حال هزینه پرگوییهایی را پرداخت کردهایم که در واقع هوشمندی بیشتری نمیخریدند.
اگر این الگو تکرار شود، میتوان انتظار داشت دستهای جدید از نسخههای «آموزشدیده برای بهرهوری» برای تمام مدلهای باز (Open Models) محبوب عرضه شوند. Fireworks صراحتاً Ember-1 را اولین مدل از یک سری مدلهای تخصصی معرفی کرده است. این موضوع میتواند دادههای آموزشی آینده را تغییر دهد؛ اگر مدلهای پرکپی سال ۲۰۲۷ از ردپاهایی یاد بگیرند که میدانند کجا متوقف شوند، پرگویی پیشفرض مدلهای باز در سطح جهانی تغییر خواهد کرد.
ملاحظات نهایی
یک نکته صادقانه در مقابل این نتایج وجود دارد: این دادهها مربوط به یک فروشنده، یک مدل پایه و یک نسخه پیشنمایش است. اگرچه افشای افت امتیاز در SWE-bench باعث ایجاد اعتماد میشود، اما هنوز تکرار مستقل این نتایج توسط شخص ثالث صورت نگرفته است.
مدل Ember-1 در حال حاضر به عنوان یک پیشنمایش تحقیقاتی در Fireworks در دسترس است و یک پنجره دسترسی Serverless محدود دو هفتهای دارد. پس از آن، تداوم دسترسی به میزان پذیرش کاربران بستگی دارد. کاربران باید ارزیابیهای خود را از همین حالا شروع کنند تا متوجه شوند آیا توازن هزینه-کیفیت با بار کاری خاص آنها سازگار است یا خیر.
من هر هفته درباره مدلهای هوش مصنوعی، ابزارهای توسعهدهنده و هزینههای عملیاتی آنها مینویسم. مشترک شوید، رایگان است و کمک میکند این مطالب به خوانندگان بیشتری برسد. آیا تا به حال اندازهگیری کردهاید که چه مقدار از صورتحساب مدل شما توکنهای استدلالی پنهان است؟ اگر Ember-1 را اجرا کردهاید یا تنظیمات تلاش استدلالی را در استک خود مقایسه کردهاید، مشتاقم اعداد شما را در کامنتها ببینم.




گفتگو