پرش به محتوای اصلی
پرش به محتوای مقاله

چگونه Tokdiet هزینه استنتاج مدل‌های زبانی را ۷۱٪ کاهش می‌دهد؟

·۲۸ خرداد ۱۴۰۵۸ دقیقه مطالعه
کاهش ۷۱٪ توکن ورودی عامل هوش مصنوعی بدون افت کیفیت: معرفی بنچمارک ۶۶ وظیفه‌ای
کاهش ۷۱٪ توکن ورودی عامل هوش مصنوعی بدون افت کیفیت: معرفی بنچمارک ۶۶ وظیفه‌ای
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی مکانیزم حذف تکرار (Dedup) و انتقال داده‌های قدیمی به SQLite به‌جای خلاصه‌سازی متنی؛ روشی که کاهش ۷۰ درصدی توکن‌ها را بدون از دست دادن اطلاعات کلیدی ممکن می‌کند.

اگر از عامل‌های کدنویسی هوش مصنوعی استفاده می‌کنید، احتمالاً هر جلسه چندین بار هزینه ارسال فایل‌های تکراری به مدل را می‌پردازید. در ۱۷ ژوئن ۲۰۲۶، توسعه‌دهنده‌ای به نام agiwhitelist ابزار tokdiet را منتشر کرد؛ یک پروکسی معکوس محلی که مصرف توکن‌های ورودی را ۷۱٪ کاهش می‌دهد بدون اینکه عامل را «کودزد» یا کندتر کند.

بسیاری از حلقه‌های پردازشی در سیستم‌های عامل‌محور دچار رشد یک‌نواخت متن می‌شوند؛ یعنی خروجی‌های قدیمی ابزارها حتی زمانی که دیگر کاربرد ندارند، در حافظه باقی می‌مانند. همان‌طور که در تحلیل‌های قبلی ما درباره مدیریت حافظه در مدل‌های زبانی اشاره کردیم، روش‌های رایجی مثل خلاصه‌سازی میانه-گفتگو وجود دارند، اما این روش‌ها باعث حذف جزئیات حیاتی مثل شماره خطوط یا کدهای خطا می‌شوند. tokdiet این مشکل را با مدیریت حافظه شبیه به حافظه مجازی در کامپیوترها حل می‌کند. این رویکرد در راستای تغییر پارادایم از تکیه بر مدل‌های واحد به سمت زیرساخت‌های بهینه‌تر است، چرا که وابستگی صرف به یک مدل واحد در زیرساخت‌های هوش مصنوعی می‌تواند به یک ریسک تجاری تبدیل شود.

طبق گزارش وب‌سایت dev.to، این ابزار برای کاهش هزینه‌ها از دو مکانیزم اصلی استفاده می‌کند:

  • Dedup: یک لایه حذف تکرار که فقط تازه‌ترین نسخه از بلوک‌های تکراری را نگه می‌دارد.
  • Elision: فرآیندی که بخش‌های حجیم نتایج قدیمی را به یک پایگاه‌داده SQLite محلی منتقل می‌کند و تنها خطوط کلیدی مثل شناسه‌ها و URLها را در دسترس نگه می‌دارد.

برای اثبات این ادعا، نویسنده یک بنچمارک A/B شامل ۶۶ تکلیف را روی مدل MiniMax-M3 اجرا کرد. بر اساس مستندات این پروژه، در ۱۹۸ اجرای جفت‌شده، حالت عادی برای حل ۶۴ تکلیف به ۵.۰۷ میلیون توکن (Tkn) — تکه‌های کوچکی از متن که مدل تکه‌تکه می‌خورد — نیاز داشت، در حالی که حالت بهینه‌شده تنها با ۱.۴۶ میلیون توکن، ۶۳ تکلیف را حل کرد. این تفاوت بسیار کم در موفقیت، در محدوده نویز مدل است و با کاهش ۷۲ درصدی در مدل MiniMax-M2.5 نیز تأیید شد.

برای کیف پول شما، این یعنی کاهش شدید هزینه‌ها برای کسانی که از APIهای شرکت‌های Anthropic، OpenAI یا Gemini استفاده می‌کنند. اگرچه اشتراک‌های ماهانه ثابت تغییری در صورت‌حساب ایجاد نمی‌کنند، اما این پروکسی یک داشبورد زنده روی پورت ۷۸۷۸ برای نظارت بر هزینه‌ها فراهم می‌کند. همچنین یک «بودجه کیفیت» دارد که اگر انحراف مدل از حالت عادی زیاد شود، فشرده‌سازی تهاجمی را متوقف می‌کند.

گام بعدی شما

  • با اجرای دستور npx tokdiet start پروکسی را فعال کنید.
  • ترافیک عامل خود را به URLهای محلی ارجاع دهید تا مصرف توکن‌ها را رصد کنید.
  • تنظیمات «بودجه کیفیت» را بر اساس حساسیت پروژه خود تغییر دهید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره بهینه‌سازی‌های KV Cache در مدل‌های جدید مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با تکیه بر تجربه عملی در کاهش هزینه استنتاج، مدل‌های تجاری را از وابستگی به پنجره‌های متنی عظیم و گران‌قیمت رها می‌کند. اعتبار این ادعا با بنچمارک‌های باز و نتایج عددی در مدل‌های MiniMax تأیید شده است.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت بودجه دلاری برای APIهای OpenAI و Anthropic دست‌وپنجه نرم می‌کنند، این ابزار راهکاری مستقیم برای کاهش هزینه‌های عملیاتی است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی خلاصه‌سازی متنی با سیستم Paging (صفحه‌بندی) داده‌ها، رویکردی مهندسی‌شده به مشکل Context Window است. این تغییر نشان می‌دهد که برای افزایش هوشمندی عامل‌ها، به‌جای افزایش حجم پنجره متنی، باید بر روی مدیریت هوشمند بازیابی داده‌ها تمرکز کرد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.