پرش به محتوای اصلی
پرش به محتوای مقاله

«حفظ کیفیت با مدل ارزان‌تر»؛ هدف لایه مسیریابی Tokenless

·۷ مرداد ۱۴۰۵۲ دقیقه مطالعه۲ بازدید
روتر بدون توکن: نصف کردن هزینه استنتاج هوش مصنوعی
روتر بدون توکن: نصف کردن هزینه استنتاج هوش مصنوعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی انتخاب مدل استاتیک با مسیریابی پویا بر اساس «اعتماد لحظه‌ای»؛ یعنی مدل ارزان‌تر اول تلاش می‌کند و مدل گران‌قیمت فقط در صورت شکست مدل اول فعال می‌شود.

اگر ماهانه هزاران دلار برای APIهای هوش مصنوعی هزینه می‌کنید، احتمالاً بخش زیادی از بودجه شما صرف مدل‌هایی می‌شود که برای کارهای ساده بیش از حد قدرتمند و گران‌اند. Tokenless با معرفی یک لایه مسیریابی پویا، این هزینه را تا ۵۰٪ کاهش داد.

بر اساس اعلام این شرکت در ۲۹ جولای ۲۰۲۶، این ابزار به عنوان جایگزینی مستقیم برای فراخوانی‌های OpenAI و Anthropic عمل می‌کند. هدف اصلی آن حذف هزینه‌های اضافی برای مدل‌های پیشرو (Frontier Models) در کارهایی است که مدل‌های کوچک‌تر هم از پس آن‌ها برمی‌آیند. این رویکرد یادآور استراتژی‌هایی است که پلتفرم Manifest برای کاهش هزینه‌های مدل‌های پیشرو از طریق مسیریابی محلی به کار گرفته است.

بسیاری از درخواست‌ها به مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — نیازی به حداکثر توان پردازشی ندارند. همان‌طور که در تحلیل قبلی ما درباره‌ی بهینه‌سازی هزینه‌های استنتاج اشاره کردیم، اتکای همیشگی به مدل‌های غول‌پیکر یک اتلاف منابع است. برای درک بهتر پیچیدگی‌های این فرآیند، می‌توان به بررسی ۱۵ لایه‌ی پنهان پشت هر فراخوانی API اشاره کرد که زیرساخت‌های توزیع‌شده‌ی این مدل‌ها را تحلیل می‌کند. Tokenless این مشکل را با ارسال هم‌زمان یک درخواست به گروهی از مدل‌ها حل می‌کند و به محض اینکه یک مدل ارزان‌تر پاسخ باکیفیتی تولید کرد، سایر پردازش‌های گران‌قیمت را لغو می‌کند.

طبق مستندات فنی این پلتفرم، توسعه‌دهندگان دو حالت اصلی برای مدیریت هزینه‌ها دارند:

  • MAX: اولویت با حداکثر کیفیت است و هر وظیفه به بهترین مدل موجود ارجاع داده می‌شود.
  • Savings Mode: تمرکز بر کاهش هزینه‌هاست، اما کفِ کیفیت پاسخ‌ها را تضمین می‌کند.

این سامانه که توسط پژوهشگران Google DeepMind، Princeton و UC Berkeley طراحی شده و حمایت Y Combinator را دارد، در محک‌های کدنویسی عمومی توانسته کیفیتی برابر با Opus 4.8 ارائه دهد، در حالی که هزینه هر تسک را به‌شدت کاهش داده است.

به گزارش این شرکت، برای سازمانی که ماهانه ۲۶,۰۰۰ دلار هزینه LLM دارد، Tokenless می‌تواند ۱۴,۰۰۰ دلار صرفه‌جویی ایجاد کند. این موضوع در حالی رخ می‌دهد که طبق شاخص Ramp AI، هزینه هر کارمند برای AI بین ژوئن ۲۰۲۵ تا ژوئن ۲۰۲۶ ماهانه ۱۱٪ رشد کرده است. در همین راستا، تلاش‌هایی نظیر آنچه در پروژه Oxlo.ai برای جداسازی هزینه استنتاج از توکن‌ها دیده می‌شود، گامی به سوی بهینه‌سازی مدل‌های اقتصادی برای اتوماسیون‌های صنعتی است.

این رویکرد، صنعت را از انتخاب مدل‌های استاتیک به سمت مسیریابی پویا در زمان استنتاج (Test-time Routing) می‌برد. برای برنامه‌نویسان، موازنه بین «هزینه در برابر کیفیت» دیگر یک تنظیم دستی نیست، بلکه یک لایه‌ی زیرساختی است که کیف پول آن‌ها را در لحظه بهینه می‌کند.

گام بعدی شما

  • اگر از APIهای گران‌قیمت استفاده می‌کنید، دو خط کد خود را برای تست به Tokenless تغییر دهید.
  • برای تحلیل الگوهای ترافیکی خاص خود، یک جلسه دموی رایگان رزرو کنید.
  • مدل‌های کوچک‌تر (SLMs) را برای کارهای تکراری‌تر جایگزین مدل‌های پیشرو کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با تکیه بر اعتبار پژوهشی DeepMind و Berkeley، استانداردی جدید برای مدیریت بودجه AI در مقیاس سازمانی ایجاد می‌کند. کاهش ۵۰ درصدی هزینه استنتاج، مانع اصلی استقرار انبوه عامل‌های هوش مصنوعی را برمی‌دارد.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، توسعه‌دهندگان ایرانی که از واسطه‌های پرداخت استفاده می‌کنند، بیش از هر کس دیگری با هزینه‌های استنتاج درگیرند و این ابزار برای کاهش هزینه‌های عملیاتی آن‌ها حیاتی است.

·نگاه ما
تحریریه دات‌هوش

جابجایی از انتخاب مدل دستی به مسیریابی پویا، پایان عصر «یک مدل برای همه کارها» است. این استراتژی عملاً مدل‌های پیشرو را به «داور» یا «پشتیبان» تبدیل می‌کند و مدل‌های کوچک را به «مجریان» اصلی؛ یعنی هوش مصنوعی به سمت معماری‌های توزیع‌شده و سلسله‌مراتبی می‌رود تا سودآوری اقتصادی ممکن شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.