اگر امروز برای چندین مدل مختلف هزینه پرداخت میکنید یا با خطای Rate Limit دستوپنجه نرم میکنید، صورتحساب ماهانه شما میتواند تا ۶۵٪ کاهش یابد. ابزار 9Router با تبدیل دهها کلید API پراکنده به یک نقطه دسترسی واحد، مدیریت مدلها را از یک کابوس لجستیکی به یک فرآیند خودکار تبدیل کرده است. این ابزار که در ۶ اکتبر ۲۰۲۶ عرضه شد، یک درگاه هوشمند AI به صورت self-hosted است که برای حل مشکل پراکندگی سرویسها برای کاربرانی که از ابزارهایی مانند Cursor، Cline و Roo Code استفاده میکنند، طراحی شده است. اکنون بیش از ۶۰ ارائهدهنده AI را میتوان تنها با یک دستور ساده در یک نقطه دسترسی محلی (Local Endpoint) تجمیع کرد و نیاز به جابهجایی مداوم کلیدهای API در IDEهای مختلف را از بین برد.
مدیریت دستی دستیارهای کدنویسی معمولاً خستهکننده است؛ برنامهنویسان معمولاً مجبورند حسابهای مجزایی در OpenAI، Anthropic، Google Gemini، OpenRouter، xKiro و CleanAPIs داشته باشند. این وضعیت منجر به شلوغ شدن لیست مدلها در منوی کشویی IDE و توقف ناگهانی جریان کاری هنگام رسیدن به سقف سهمیه (Token Quota) هر مدل میشود. توسعهدهندگان اغلب مجبورند بهطور دستی کلیدهای API و Base URLها را در چندین اپلیکیشن مختلف تغییر دهند. 9Router شبیه به یک پلیس راهنمایی هوشمند که ترافیک درخواستهای شما را به خلوتترین و بهصرفهترین مسیر هدایت میکند، این گسست را از بین میبرد تا دیگر هرگز با خطای 'rate limit' مواجه نشوید. همانطور که در تحلیلهای قبلی ما دربارهی بهینهسازی هزینههای استنتاج اشاره کردیم، حذف لایههای اضافی در ارتباط با مدلها، کلید افزایش بهرهوری است.
به گزارش وبسایت dev.to، این ابزار به عنوان یک پروکسی معکوس روی localhost:20128 اجرا میشود. 9Router برای تضمین عدم توقف (Zero Downtime)، یک سیستم جایگزینی سهلایه (Three-tier Fallback) را پیاده کرده است:
- لایه اول (اشتراکی): اولویت با سهمیههای گرانقیمت و باکیفیت مدلهایی مثل Claude Code، OpenAI Codex، Google Gemini یا GitHub Copilot است.
- لایه دوم (ارزان): در صورت اتمام سهمیه لایه اول، درخواستها بهطور خودکار به ارائهدهندگان ارزانقیمت منتقل میشوند؛ برای مثال مدل GLM (۰.۶۰ دلار در هر میلیون توکن) یا MiniMax (۰.۲۰ دلار در هر میلیون توکن).
- لایه سوم (رایگان): به عنوان آخرین لایه حفاظتی، درخواستها به مدلهای رایگان و نامحدود ارائهدهندگانی چون iFlow، Qwen، Kiro AI، OpenCode Free، Cloudflare AI یا NVIDIA NIM هدایت میشوند.

این درگاه تنها محدود به مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب میدهد — نیست، بلکه یک پورت واحد برای ۹ نوع سرویس مختلف AI فراهم میکند. طبق مستندات این ابزار، قابلیتهای آن شامل موارد زیر است:
- بردار معنایی (Embedding): برای تبدیل متن به اعداد جهت جستوجوی معنایی، با پشتیبانی از Voyage، Jina، OpenAI، Cohere و Mistral.
- سرویسهای صوتی: تبدیل متن به گفتار (TTS) از طریق ElevenLabs، Deepgram و Edge TTS؛ و تبدیل گفتار به متن (STT) از طریق Deepgram، Whisper و AssemblyAI.
- سرویسهای بصری: تولید تصویر از طریق Fal، Stability، Flux و Recraft؛ و تحلیل تصویر (Vision) از طریق GPT-4o Vision، Claude 3.5 Sonnet و Gemini Pro.
- رسانه پیشرفته و وب: تولید ویدیو از طریق Runway ML و Topaz؛ و جستوجو و استخراج دادههای وب از طریق Perplexity، Tavily، Brave و Jina Reader.
برای کاهش هزینههای عملیاتی، 9Router دو مکانیزم فشردهسازی خاص را پیاده کرده است. اولین مورد، فشردهساز آنی (RTK) است که خروجیهای ابزارهایی مثل git diff، grep و نتایج ls را بدون حذف اطلاعات (Lossless) کوچک میکند و پیش از ارسال به LLM، بین ۲۰ تا ۴۰ درصد در توکنهای ورودی صرفهجویی میکند. دومین مورد، «حالت غارنشین» (Caveman Mode) است که مدل را مجبور میکند پاسخهای بسیار کوتاه، موجز و مستقیم بدهد؛ این قابلیت میتواند مصرف توکنهای خروجی را تا ۶۵٪ کاهش دهد.
نصب این سیستم برای کمترین میزان سربار طراحی شده است و از کانتینرهای سنگین داکر، WSL یا تنظیمات مصرفکننده رم بالا اجتناب میکند. کاربران میتوانند سیستم را با اجرای دو دستور ساده در ترمینال مستقر کنند:
npm install -g 9router9router
پس از اجرای دستور، یک منوی تعاملی (نسخه v0.5.95) ظاهر میشود. کاربران میتوانند بین رابط کاربری وب (Web UI)، رابط ترمینال (Interactive CLI) یا گزینه "Hide to Tray" برای اجرای سرور در پسزمینه انتخاب کنند. انتخاب Web UI بهطور خودکار داشبورد را در آدرس http://localhost:20128 باز میکند.
از طریق داشبورد مرورگر، توسعهدهندگان میتوانند ارائهدهندگان را از طریق API Key یا OAuth (برای سرویسهایی مثل Claude و Codex) متصل کنند. این داشبورد نظارت لحظهای بر مصرف توکنها، شمارش معکوس برای بازنشانی سهمیهها و تخمین هزینهها به ازای هر ارائهدهنده را فراهم میکند.
برای اتصال به IDEهایی مثل Cursor، Cline، Roo Code یا Continue، کاربر باید فرمت "OpenAI Compatible" را انتخاب کرده و مقادیر زیر را وارد کند:
- Base URL: http://localhost:20128/v1
- API Key: کلید محلی موجود در داشبورد (یا مقدار پیشفرض '9router')
- Model ID: هر مدل فعالی که در داشبورد تعریف شده است
این تغییر، قدرت مدیریت API را از شرکتهای ارائهدهنده به برنامهنویس منتقل میکند. با انتزاع لایه ارائهدهنده، توسعهدهندگان دیگر وابسته به قیمتگذاری یا پایداری یک اکوسیستم واحد نیستند. اثر ثانویه این ابزار، کاهش چشمگیر «اضطراب توکن» است که اجازه میدهد برنامهنویسان با جسارت بیشتری روی گردشهای کاری عاملمحور (Agentic) آزمایش کنند.
برای یک توسعهدهنده معمولی، این یعنی کیف پول شما توسط یک گیت منطقی خودکار محافظت میشود. شما ابتدا اشتراکهای گرانقیمت خود را به حداکثر میرسانید، سپس به سراغ مدلهای ارزان (پنی در هر میلیون توکن) میروید و تنها در صورت ضرورت مطلق به لایه رایگان میرسید. توسعهدهندگان باید چشمانداز در حال تغییر ارائهدهندگان لایه رایگان مانند Kiro AI و OpenCode را رصد کنند تا زنجیرههای جایگزین لایه سوم خود را بهینه سازند.
گام بعدی شما
- اگر از چندین سرویس AI استفاده میکنید، 9Router را نصب کنید تا از توقف ناگهانی کدنویسی به دلیل اتمام سهمیه جلوگیری کنید.
- حالت Caveman را برای تسکهای ساده فعال کنید تا هزینه خروجیهای مدل را به شدت کاهش دهید.
- لیست ارائهدهندگان رایگان لایه سوم را بهروز نگه دارید تا حتی در صورت نبود بودجه، دسترسیتان قطع نشود.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو