پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Ember-1 توکن‌های استدلالی را ۷۱٪ کاهش داد بدون افت کیفیت

·۶ مهر ۱۴۰۵۷ دقیقه مطالعه
مقایسه Ember-1 و Kimi K3: اولین مدل هوش مصنوعی آموزش‌دیده برای تفکر کمتر
مقایسه Ember-1 و Kimi K3: اولین مدل هوش مصنوعی آموزش‌دیده برای تفکر کمتر
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تبدیل «بهره‌وری در تفکر» از یک تنظیم ساده (Dial) به یک هدف آموزشی (Training Objective). برای نخستین بار مدل استدلالی آموزش دیده تا تفاوت بین تفکر مفید و تکرارهای زائد را تشخیص دهد.

اگر برای اجرای عامل‌های هوش مصنوعی هزینه پرداخت می‌کنید، احتمالاً نیمی از صورت‌حساب شما بابت «فکرهای بیهوده» مدل است. شرکت Fireworks AI در ۲۳ سپتامبر ۲۰۲۶ مدل Ember-1 را عرضه کرد؛ اولین مدلی که به‌طور خاص برای تشخیص تفاوت بین ردپاهای استدلالی مفید و بی‌فایده آموزش دیده است تا این مالیات پنهان عصر عامل‌ها را با حذف توکن‌های استدلالی زائد از بین ببرد.

بسیاری از مدل‌های استدلالی بیش از ۹۰٪ توکن‌های تولیدی خود را صرف برنامه‌ریزی داخلی و تردید (Second-guessing) می‌کنند، پیش از آنکه پاسخ نهایی را بنویسند. به نقل از Fireworks AI، مدل‌هایی مانند Kimi K3 به‌شدت مستعد این رفتار هستند. برای یک پرسش ساده، این هزینه ناچیز است؛ اما برای یک عامل (Agent) — شبیه دستیاری که برای انجام یک پروژه، چندین مرحله فکر و عمل می‌کند — این موضوع یک فاجعه مالی است. چون تاریخچه گفتگو در هر درخواست مجدداً ارسال می‌شود، هزینه این ردپاهای استدلالی به‌صورت نمایی (Quadratic) رشد می‌کند. این فشار مالی در حالی رخ می‌دهد که میزان مصرف توکن‌ها در پلتفرم‌هایی مانند OpenRouter رشد خیره‌کننده‌ای داشته است و هزینه‌های عملیاتی را برای توسعه‌دهندگان به چالش کشیده است.

Fireworks AI این مشکل را به‌وضوح تبیین می‌کند: در گام پانزدهم یک جلسه عامل، شما فقط هزینه ۱۵ مرحله فکر کردن را نمی‌پردازید، بلکه هزینه بازخوانی ۱۴ دور قبلی از تمام تفکرات مدل را هم می‌دهید. در واقع، پرگویی‌های مراحل اولیه در هر گام بعدی مجدداً صورت‌حساب می‌شوند و به همین دلیل است که صورت‌حساب‌های مدل‌های استدلالی در محیط‌های عامل‌محور به‌سرعت منفجر می‌شوند.

تا پیش از این، تنها راه کاهش هزینه، کم کردن درجه «تلاش استدلالی» (Reasoning Effort) بود. اما این شرکت دریافت که کاهش این تنظیمات، اغلب کیفیت را می‌کشد؛ چون مدل در این حالت، اصلاحات حیاتی را هم‌زمان با اضافات حذف می‌کند. Ember-1 با تنظیم دقیق (Fine-tuning) — مثل وقتی به یک پزشک عمومی، تخصص پوست می‌دهیم تا روی یک حوزه دقیق شود — این مشکل را حل کرده است؛ مدل یاد گرفته اصلاحات را نگه دارد و حلقه‌های تکراری و زائد را حذف کند.

سازوکار بهره‌وری

مدل Ember-1 یک مدل کوچک‌تر یا یک معماری جدید نیست، بلکه نسخه‌ای بهینه‌شده از مدل Kimi K3 متعلق به شرکت Moonshot AI است. هدف این نبود که نرخ قیمت ارزان‌تر شود یا ردپای مدل کوچک‌تر شود، بلکه هدف این بود که همان مدل را طوری آموزش دهند که وقت کمتری تلف کند. ادعای آن‌ها غیرمعمول و صریح است: پاسخ‌های یکسان، اما ۴۰٪ توکن کمتر.

فرآیند آموزش شامل یک فاز آزمایشی سخت‌گیرانه برای تفکیک استدلال مفید (مانند اصلاح خودکار، بررسی مفروضات و بازیابی از خطاها) از استدلال بی‌فایده (مانند حلقه‌های تکراری و تأیید مجدد حقایقی که قبلاً تأیید شده‌اند) بوده است. این تلاش‌ها شامل موارد زیر بود:

  • آزمایش‌های گسترده: اجرای بیش از ۵۰ آزمایش آموزشی برای یافتن نقطه بهینه.
  • ارزیابی سخت‌گیرانه: انجام بیش از ۲۰۰ ارزیابی برای تضمین پایداری مدل و عدم افت کیفیت.
  • نوآوری الگوریتمی: توسعه الگوریتم‌های آموزشی جدید که به‌طور خاص برای کوتاه کردن استدلال بدون آسیب به دقت طراحی شده‌اند.
  • تنوع در وظایف: آموزش روی طیف وسیعی از تسک‌ها برای اطمینان از اینکه صرفه‌جویی در توکن‌ها فقط محدود به کارهای کدنویسی نیست و به سایر حوزه‌ها نیز منتقل می‌شود.

روش‌های اعتبارسنجی

شرکت Fireworks AI مدل خود را از سه مسیر اصلی تأیید کرد که مورد سوم برای آمادگی در محیط تولید (Production) حیاتی‌ترین بود:

۱. محک‌های خارجی: Ember-1 توانست مرز کیفیت-بهره‌وری خود را در نزدیکی سطوح مدل Kimi K3 حفظ کند.
۲. استقرار خاموش (Silent Rollout): Fireworks توسعه‌دهندگان داخلی خود را بدون اطلاع آن‌ها به Ember-1 منتقل کرد؛ تیمی که در نهایت گزارش داد هیچ افت کیفیتی احساس نمی‌کند و هیچ شکایت یا پس‌روی (Regression) در کیفیت در این فاز داخلی ثبت نشد.
۳. تست‌های A/B در محیط عملیاتی: بررسی بارهای کاری واقعی کدنویسی که نشان‌دهنده تغییر چشمگیر در بهره‌وری بود.

تحلیل داده‌ها: دستاوردها و هزینه‌ها

در یک تست عملیاتی روی عامل‌های کدنویسی، اعداد تفاوت تکان‌دهنده‌ای را در مصرف منابع نشان می‌دهند. تسک‌هایی که در مدل K3 به‌طور متوسط ۴۹,۳۰۰ توکن خروجی در ۲۳.۸ گام عامل نیاز داشتند، در Ember-1 تنها به ۲۹,۹۰۰ توکن در ۲۱.۴ گام نیاز داشتند.

این یعنی کاهش ۷۱.۳ درصدی در توکن‌های استدلالی و کاهش کل هزینه توکن‌ها به میزان حدود ۳۹٪. امتیاز کیفیت نیز تقریباً ثابت ماند و از ۰.۷۵۱ برای K3 به ۰.۷۵۳ برای Ember-1 رسید. باید توجه داشت که این اعداد توسط خود Fireworks گزارش شده‌اند، هرچند استفاده از ترافیک واقعی تولیدی و استقرار خاموش، این شواهد را نسبت به بنچمارک‌های مصنوعی سخت‌تر برای جعل می‌کند.

با این حال، این بهره‌وری هزینه‌ای خاص در بنچمارک‌های سطح بالا دارد. در آزمون SWE-bench Verified، مدل Ember-1 امتیاز ۹۲.۲٪ گرفت که یک درصد کمتر از ۹۳.۲٪ مدل K3-Max است. برای اکثر تیم‌ها، ۳۹٪ صرفه‌جویی در هزینه، این افت ناچیز را توجیه می‌کند؛ چرا که این یک درصد افت، در هر ۵۰۰ تسک حدود ۶۸.۱۰ دلار صرفه‌جویی به همراه دارد. البته برای خط لوله‌هایی (Pipelines) که هر درصد کیفیت در آن‌ها حیاتی است، این سبک مبادله (Trade-off) واقعاً قابل بحث است.

جالب اینجاست که Ember-1 در برخی بنچمارک‌ها حتی از مدل اصلی پیشی گرفت:

  • Terminal Bench 2.1: امتیاز ۸۲.۰٪ در برابر ۸۰.۹٪ مدل K3-Max.
  • DeepSWE 1.1: امتیاز ۷۵.۲٪ در برابر ۶۶.۴٪ (یک پیروزی ۸.۸ امتیازی که در ۱۱۳ تسک منجر به صرفه‌جویی ۱۲۶.۹۰ دلاری شد).

این نتایج نشان می‌دهد که گاهی ردپاهای استدلالی بیش از حد طولانی، می‌توانند مضر باشند. فرضیه اصلی این است که کوتاه کردن مسیر، مدل را مجبور به استدلال متمرکزتر و آگاهانه‌تر کرده و به آن کمک کرده تا از حلقه‌هایی که در واقع به عملکردش آسیب می‌زدند، خارج شود.

مقایسه Ember-1 در برابر Kimi K3

برای خلاصه کردن این مقایسه:

  • مدل پایه: تنظیم دقیق شده از Kimi K3؛ بدون هیچ تغییر در معماری.
  • مصرف توکن: حدود ۴۰٪ کاهش کل توکن‌ها؛ ۷۱.۳٪ کاهش توکن‌های استدلالی در تست‌های A/B کدنویسی.
  • کیفیت: ثابت در بارهای کاری عملیاتی (۰.۷۵۳ در برابر ۰.۷۵۱)؛ افت جزئی در SWE-bench Verified.
  • هزینه: حدود ۳۹٪ کاهش هزینه به ازای هر تسک با قیمت یکسان هر توکن.
  • ریسک: افت ۱ امتیازی در SWE-bench Verified نسبت به K3-Max.

استراتژی جایگزینی و پیاده‌سازی

برای توسعه‌دهندگانی که مدل‌های استدلالی را در پسِ عامل‌های خود اجرا می‌کنند، Fireworks AI یک توالی ارزیابی خاص را پیشنهاد می‌کند تا متوجه شوند آیا این جابجایی برای آن‌ها به صرفه است یا خیر:

  • گام ۱: سنجش سهم استدلال. داده‌های مصرف یک هفته اخیر خود را استخراج کنید. اگر توکن‌های استدلالی ۷۰ تا ۹۰ درصد صورت‌حساب شما را تشکیل می‌دهند، اقتصاد این مدل برای شما صادق است. اگر زیر ۵۰ درصد است، دستاوردهای آن ناچیز خواهد بود.
  • گام ۲: بررسی شکل بار کاری. شناسایی کنید که آیا جلسات چندمرحله‌ای طولانی دارید یا خیر. یک خلاصه‌ساز تک‌مرحله‌ای سود کمی می‌برد، اما یک عامل کدنویسی ۲۰ مرحله‌ای به دلیل رشد نمایی هزینه‌ها، بیشترین سود را می‌برد.
  • گام ۳: تعیین خط قرمز کیفیت. دسته‌بندی‌هایی از تسک‌ها را پیدا کنید که در آن‌ها حتی یک درصد افت کیفیت را هم نمی‌توانید تحمل کنید. ابتدا Ember-1 را در برابر K3 روی همان دسته‌های خاص اجرا کنید.
  • گام ۴: مقایسه هزینه هر تسک. قیمت هر توکن یکسان است. برتری Ember-1 در این است که تسک‌ها را با توکن‌های کمتر و در گام‌های کمتر به پایان می‌رساند و هزینه نهایی هر تسک را پایین می‌آورد.
  • گام ۵: بودجه‌بندی هزینه جابجایی. در حالی که تغییر فنی ساده است (تغییر یک خط در Base URL از طریق یک Endpoint سازگار با OpenAI)، هزینه واقعی، اجرای مجدد مجموعه ارزیابی‌های (Eval Suite) شماست. دو هفته متوالی از کیفیت یکسان روی ترافیک واقعی خودتان، معیاری معقول برای پذیرش نهایی است.

تأثیر گسترده‌تر بر صنعت

این عرضه نشان‌دهنده تغییری در نگاه صنعت به مفهوم «تفکر» است. Fireworks AI با تبدیل بهره‌وری به یک هدف آموزشی (Training Objective) به جای یک تنظیم ساده (Settings Dial)، ثابت کرد که ما تا به حال هزینه پرگویی‌هایی را پرداخت کرده‌ایم که در واقع هوشمندی بیشتری نمی‌خریدند.

اگر این الگو تکرار شود، می‌توان انتظار داشت دسته‌ای جدید از نسخه‌های «آموزش‌دیده برای بهره‌وری» برای تمام مدل‌های باز (Open Models) محبوب عرضه شوند. Fireworks صراحتاً Ember-1 را اولین مدل از یک سری مدل‌های تخصصی معرفی کرده است. این موضوع می‌تواند داده‌های آموزشی آینده را تغییر دهد؛ اگر مدل‌های پرکپی سال ۲۰۲۷ از ردپاهایی یاد بگیرند که می‌دانند کجا متوقف شوند، پرگویی پیش‌فرض مدل‌های باز در سطح جهانی تغییر خواهد کرد.

ملاحظات نهایی

یک نکته صادقانه در مقابل این نتایج وجود دارد: این داده‌ها مربوط به یک فروشنده، یک مدل پایه و یک نسخه پیش‌نمایش است. اگرچه افشای افت امتیاز در SWE-bench باعث ایجاد اعتماد می‌شود، اما هنوز تکرار مستقل این نتایج توسط شخص ثالث صورت نگرفته است.

مدل Ember-1 در حال حاضر به عنوان یک پیش‌نمایش تحقیقاتی در Fireworks در دسترس است و یک پنجره دسترسی Serverless محدود دو هفته‌ای دارد. پس از آن، تداوم دسترسی به میزان پذیرش کاربران بستگی دارد. کاربران باید ارزیابی‌های خود را از همین حالا شروع کنند تا متوجه شوند آیا توازن هزینه-کیفیت با بار کاری خاص آن‌ها سازگار است یا خیر.

من هر هفته درباره مدل‌های هوش مصنوعی، ابزارهای توسعه‌دهنده و هزینه‌های عملیاتی آن‌ها می‌نویسم. مشترک شوید، رایگان است و کمک می‌کند این مطالب به خوانندگان بیشتری برسد. آیا تا به حال اندازه‌گیری کرده‌اید که چه مقدار از صورت‌حساب مدل شما توکن‌های استدلالی پنهان است؟ اگر Ember-1 را اجرا کرده‌اید یا تنظیمات تلاش استدلالی را در استک خود مقایسه کرده‌اید، مشتاقم اعداد شما را در کامنت‌ها ببینم.

چرا این موضوع مهم است؟

این رویکرد با تکیه بر تجربه عملی در محیط‌های تولیدی، هزینه اجرای عامل‌های هوشمند را به شدت کاهش می‌دهد. اعتبار این مدل از طریق استقرار خاموش (Silent Rollout) تأیید شده که نشان می‌دهد بهره‌وری می‌تواند بدون آسیب به کیفیت حاصل شود.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم به Fireworks AI برای توسعه‌دهندگان ایرانی دشوار است، اما این مدل برای کسانی که از واسطه‌ها استفاده می‌کنند، راهکاری برای کاهش شدید هزینه‌های دلاری است.

·نگاه ما
تحریریه دات‌هوش

تمرکز بر «بهره‌وری استدلال» به جای «افزایش قدرت استدلال»، نشان می‌دهد که صنعت به سقف بازدهی در حجم توکن‌ها رسیده است. Ember-1 ثابت می‌کند که ما سال‌ها هزینه پرگویی مدل‌ها را پرداخته‌ایم، بدون اینکه این پرگویی لزوماً به معنای هوشمندی بیشتر باشد. احتمالاً در آینده، مدل‌های «بهینه‌شده برای استنتاج» به یک استاندارد تبدیل می‌شوند و مدل‌های پرحرف فعلی به عنوان نسخه‌های ناکارآمد شناخته شوند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.