اگر ماهانه هزاران دلار برای APIهای هوش مصنوعی هزینه میکنید، احتمالاً بخش زیادی از بودجه شما صرف مدلهایی میشود که برای کارهای ساده بیش از حد قدرتمند و گراناند. Tokenless با معرفی یک لایه مسیریابی پویا، این هزینه را تا ۵۰٪ کاهش داد.
بر اساس اعلام این شرکت در ۲۹ جولای ۲۰۲۶، این ابزار به عنوان جایگزینی مستقیم برای فراخوانیهای OpenAI و Anthropic عمل میکند. هدف اصلی آن حذف هزینههای اضافی برای مدلهای پیشرو (Frontier Models) در کارهایی است که مدلهای کوچکتر هم از پس آنها برمیآیند. این رویکرد یادآور استراتژیهایی است که پلتفرم Manifest برای کاهش هزینههای مدلهای پیشرو از طریق مسیریابی محلی به کار گرفته است.
بسیاری از درخواستها به مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب میدهد — نیازی به حداکثر توان پردازشی ندارند. همانطور که در تحلیل قبلی ما دربارهی بهینهسازی هزینههای استنتاج اشاره کردیم، اتکای همیشگی به مدلهای غولپیکر یک اتلاف منابع است. برای درک بهتر پیچیدگیهای این فرآیند، میتوان به بررسی ۱۵ لایهی پنهان پشت هر فراخوانی API اشاره کرد که زیرساختهای توزیعشدهی این مدلها را تحلیل میکند. Tokenless این مشکل را با ارسال همزمان یک درخواست به گروهی از مدلها حل میکند و به محض اینکه یک مدل ارزانتر پاسخ باکیفیتی تولید کرد، سایر پردازشهای گرانقیمت را لغو میکند.
طبق مستندات فنی این پلتفرم، توسعهدهندگان دو حالت اصلی برای مدیریت هزینهها دارند:
- MAX: اولویت با حداکثر کیفیت است و هر وظیفه به بهترین مدل موجود ارجاع داده میشود.
- Savings Mode: تمرکز بر کاهش هزینههاست، اما کفِ کیفیت پاسخها را تضمین میکند.
این سامانه که توسط پژوهشگران Google DeepMind، Princeton و UC Berkeley طراحی شده و حمایت Y Combinator را دارد، در محکهای کدنویسی عمومی توانسته کیفیتی برابر با Opus 4.8 ارائه دهد، در حالی که هزینه هر تسک را بهشدت کاهش داده است.
به گزارش این شرکت، برای سازمانی که ماهانه ۲۶,۰۰۰ دلار هزینه LLM دارد، Tokenless میتواند ۱۴,۰۰۰ دلار صرفهجویی ایجاد کند. این موضوع در حالی رخ میدهد که طبق شاخص Ramp AI، هزینه هر کارمند برای AI بین ژوئن ۲۰۲۵ تا ژوئن ۲۰۲۶ ماهانه ۱۱٪ رشد کرده است. در همین راستا، تلاشهایی نظیر آنچه در پروژه Oxlo.ai برای جداسازی هزینه استنتاج از توکنها دیده میشود، گامی به سوی بهینهسازی مدلهای اقتصادی برای اتوماسیونهای صنعتی است.
این رویکرد، صنعت را از انتخاب مدلهای استاتیک به سمت مسیریابی پویا در زمان استنتاج (Test-time Routing) میبرد. برای برنامهنویسان، موازنه بین «هزینه در برابر کیفیت» دیگر یک تنظیم دستی نیست، بلکه یک لایهی زیرساختی است که کیف پول آنها را در لحظه بهینه میکند.
گام بعدی شما
- اگر از APIهای گرانقیمت استفاده میکنید، دو خط کد خود را برای تست به Tokenless تغییر دهید.
- برای تحلیل الگوهای ترافیکی خاص خود، یک جلسه دموی رایگان رزرو کنید.
- مدلهای کوچکتر (SLMs) را برای کارهای تکراریتر جایگزین مدلهای پیشرو کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو