پرش به محتوای اصلی
پرش به محتوای مقاله

۳ قابلیت کلیدی New API در کنترل سهمیه و جایگزینی خودکار مدل‌ها

·۲۱ شهریور ۱۴۰۵۶ دقیقه مطالعه
راهنما
راهنمای کامل راه‌اندازی دروازه LLM متن‌باز روی سرورهای ابری
راهنمای کامل راه‌اندازی دروازه LLM متن‌باز روی سرورهای ابری
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ایجاد یک لایه انتزاعی (Abstraction Layer) متن‌باز که چندین ارائه‌دهنده مدل را به یک فرمت واحد OpenAI تبدیل کرده و قابلیت Failover خودکار را به سطح توسعه‌دهنده می‌آورد.

اگر امروز برای مدیریت چندین مدل زبانی مختلف، ده‌ها کلید API و صورت‌حساب‌های پراکنده را دنبال می‌کنید، احتمالاً با یک کابوس لجستیکی رو‌به‌رو هستید. New API، درگاه متن‌باز توسعه‌یافته توسط QuantumNous، این آشفتگی را با تجمیع مدل‌های جریان اصلی در یک رابط واحد و سازگار با OpenAI حل می‌کند.

این ابزار که با بیش از ۴۲ هزار ستاره در گیت‌هاب و تحت لایسنس AGPL-3.0 منتشر شده، به‌سرعت به استانداردی جهانی برای مدیریت دارایی‌های هوش مصنوعی تبدیل شده است. همان‌طور که در تحلیل قبلی ما درباره‌ی نوسانات سریع لیست تامین‌کنندگان مدل‌ها اشاره کردیم، نیاز به یک لایه انتزاعی پایدار اکنون حیاتی‌تر از هر زمان دیگری است. این رویکرد یادآور تلاش‌های مشابه در صنعت است، مانند زمانی که OmniRoute دسترسی به ۵۰ مدل مختلف را در یک API یکپارچه کرد تا پیچیدگی‌های اتصال به مدل‌های متنوع کاهش یابد. برای یک توسعه‌دهنده مستقل، جابه‌جایی بین ارائه‌دهندگان معمولاً به معنای بازنویسی آدرس‌های پایه و مدیریت چرخه‌های پرداخت متفاوت است؛ اما New API مثل یک تبدیل جهانی عمل می‌کند و اجازه می‌دهد تنها با تغییر یک خط کد، مدل خود را عوض کنید.

مدیریت متمرکز دارایی‌ها

به نقل از راهنمای منتشر شده در dev.to در ۱۲ سپتامبر ۲۰۲۶، New API از طیف گسترده‌ای از مدل‌ها شامل OpenAI، Claude، Gemini، DeepSeek، Tongyi Qwen، Midjourney و Suno پشتیبانی می‌کند. این سامانه تمام این APIهای متنوع را به یک جریان واحد تبدیل می‌کند.

این سیستم به تیم‌ها اجازه می‌دهد تمام کلیدهای API را در یک داشبورد متمرکز کنند. این کار نیاز به توزیع کلیدهای حساس در فایل‌های محیطی (Environment Files) یا بین اعضای تیم را از بین می‌برد. با متمرکز کردن این دارایی‌ها، توسعه‌دهندگان می‌توانند چندین ارائه‌دهنده را بدون اصطکاک ناشی از داشبوردهای مجزا مدیریت کنند.

پایداری و کنترل ترافیک

یکی از تعیین‌کننده‌ترین قابلیت‌های این ابزار، مکانیزم توزیع تصادفی وزن‌دار است. اگر یک ارائه‌دهنده به سقف نرخ درخواست (Rate Limit) برسد یا دچار قطعی شود، درگاه به‌طور خودکار ترافیک را به کانال‌های در دسترس دیگر هدایت می‌کند.

این قابلیت بازتلاش خودکار در صورت شکست (Automatic Failure Retry) تضمین می‌کند که اپلیکیشن‌های عملیاتی حتی در زمان خرابی یک تامین‌کننده، آنلاین بمانند. در واقع، این سازوکار نقطه شکست واحد (Single Point of Failure) را که در تکیه بر یک API وجود داشت، حذف می‌کند. این مکانیزم برای حفظ دسترسی بالا (High Availability) در برنامه‌های هوش مصنوعی که با مشتری در ارتباط هستند، حیاتی است.

حاکمیت بر سهمیه و هزینه‌ها

برای بنیان‌گذاران استارتاپ‌ها، این درگاه کنترل دقیقی بر میزان مصرف فراهم می‌کند. شما می‌توانید سهمیه‌های توکن (Token) — که مثل برش‌های یک کیک طولانی هستند و مدل متن را تکه‌تکه می‌خورد — را برای بخش‌های مختلف یا پروژه‌های مجزا تعریف کنید تا از هزینه‌های پیش‌بینی‌نشده و قبض‌های نجومی جلوگیری شود.

این پلتفرم شامل قابلیت‌های شارژ آنلاین داخلی است. سازمان‌ها می‌توانند سیستم‌های صورت‌حساب داخلی برای ابزارهای هوش مصنوعی خود راه بیندازند و دقیقاً ردیابی کنند که چه کسی از کدام منابع استفاده می‌کند. این سطح از نظارت مانع از تخطی از بودجه شده و تخصیص دقیق هزینه‌ها را در سطح تیم ممکن می‌سازد.

لایه‌های امنیتی و حریم خصوصی

توسعه‌دهندگان با هدایت تمام درخواست‌ها از طریق یک سرور میزبانی شخصی (Self-hosting)، می‌توانند سیستم‌های ثبت وقایع (Logging) و فیلترینگ محتوای سفارشی پیاده کنند. این کار وابستگی به پروکسی‌های شخص ثالث که ممکن است حریم خصوصی داده‌ها را به خطر بیندازند، حذف می‌کند.

میزبانی شخصی اجازه می‌دهد پروتکل‌های امنیتی و محدودیت‌های نرخ درخواست اختصاصی تعریف شود. این امر تضمین می‌کند که تمام ترافیک هوش مصنوعی پیش از رسیدن به ارائه‌دهنده خارجی، با سیاست‌های داخلی شرکت مطابقت داشته باشد.

مشخصات استقرار

نیازمندی‌های سخت‌افزاری این ابزار اندک است. برای تست‌های شخصی، یک سرور با ۲ هسته CPU و ۲ گیگابایت رم (2C2G) کافی است. اما محیط‌های عملیاتی با حجم کاری بالا و کاربران متعدد به پیکربندی 2C4G نیاز دارند.

بر اساس بررسی منابع متعدد، قیمت‌های ابری در سپتامبر ۲۰۲۶ بسیار رقابتی هستند. جزئیات قیمت‌ها به شرح زیر است:

  • Alibaba Cloud Lightweight: مدل 2C2G با حافظه 40G ESSD و پیک ترافیک 200M حدود ۳۸ یوان در سال (۵.۳۰ دلار) است. این یک حراج لحظه‌ای است که روزانه در ساعت ۱۰:۰۰ و ۱۵:۰۰ در دسترس است.
  • Alibaba Cloud ECS Economy e: مدل 2C2G با پهنای باند 3M حدود ۹۹ یوان در سال است. این طرح شامل قیمت تمدید ثابت تا سال ۲۰۲۹ است.
  • Alibaba Cloud ECS u1: مدل 2C4G با پهنای باند 5M حدود ۱۹۹ یوان در سال است. این گزینه برای محیط‌های عملیاتی و استفاده تیمی توصیه می‌شود.
  • Tencent Cloud Lightweight: مدل 2C2G با پهنای باند 4M حدود ۹۹ یوان در سال است. طرح‌های کاربر جدید در فصل خرید از ۳۸ یوان در سال شروع می‌شود.
  • Tencent Cloud CVM/Lightweight: مدل 2C4G با پهنای باند 5M حدود ۱۸۸ یوان در سال است. این طرح شامل پیشنهاد «یک سال خرید به همراه ۳ ماه رایگان» با قیمت تمدید یکسان است.

مسیرهای پیاده‌سازی

توسعه‌دهندگان می‌توانند از طریق Alibaba Cloud Compute Nest استقرار را با یک کلیک انجام دهند. این مسیر برای اکثر کاربران توصیه می‌شود زیرا تنظیمات محیط، نصب داکر (Docker) و مدیریت کانتینرها را به‌طور خودکار انجام می‌دهد. کاربران کافی است عبارت "New API" را جستجو کنند، کارت سرویس را انتخاب کرده و مراحل جادویی برای تنظیم رمز عبور مدیر و پیکربندی شبکه را دنبال کنند.

همچنین استقرار دستی داکر برای محیط‌های مستقل یا کاربران Tencent Cloud در دسترس است. این فرآیند شامل تهیه سرور، اتصال SSH و نصب داکر از طریق دستور curl -fsSL https://get.docker.com | sh است.

دستور استقرار به شرح زیر است:
docker run -d --restart always --name new-api -p 3000:3000 -e TZ=Asia/Shanghai -v /home/ubuntu/data/new-api:/data justsong/new-api

این دستور پورت ۳۰۰۰ را مپ کرده و یک Volume محلی برای ماندگاری داده‌ها ایجاد می‌کند. برای محیط عملیاتی، استفاده از Nginx به عنوان Reverse Proxy و فعال‌سازی HTTPS با Let's Encrypt به شدت توصیه می‌شود.

برای پایداری بیشتر، توصیه می‌شود به‌جای SQLite پیش‌فرض، از یک پایگاه‌داده خارجی MySQL یا PostgreSQL از طریق متغیر محیطی SQL_DSN استفاده کنید تا عملکرد تحت فشار و قابلیت اطمینان داده‌ها بهبود یابد.

عیب‌یابی عملیاتی

مشکلات رایجی مثل حلقه تکرار استارت‌آپ کانتینر (Container Restart Loops) معمولاً به دلیل کمبود حافظه در نمونه‌های 2C2G رخ می‌دهد. اگر از این پیکربندی استفاده می‌کنید، مطمئن شوید سرویس سنگین دیگری در حال اجرا نیست. ارتقا به 2C4G معمولاً این مشکلات پایداری را حل می‌کند.

بازنشانی رمز عبور مدیر از طریق کنسول Compute Nest امکان‌پذیر است. کاربران داکر می‌توانند رمز اولیه را از طریق متغیرهای محیطی تنظیم کنند یا Volume داده‌ها را بازنشانی کنند، هرچند روش دوم منجر به حذف تمام تنظیمات موجود می‌شود.

انطباق و اخلاق

شرکت QuantumNous صراحتاً اعلام کرده است که New API برای مدیریت داخلی تیم‌ها، استفاده شخصی و توسعه قانونی طراحی شده است. استفاده از این ابزار برای بازفروش غیرمجاز API، دور زدن الزامات احراز هویت واقعی (Real-name Authentication) یا هرگونه فعالیت غیرقانونی (违规) ممنوع است.

این تغییر معماری، قدرت را از ارائه‌دهنده مدل به توسعه‌دهنده منتقل می‌کند. با مالکیت درگاه، شما مالک منطق مسیریابی و ساختار هزینه پشته‌ی هوش مصنوعی خود هستید.

چه مهندس DevOps باشید و چه یک علاقه‌مند به هوش مصنوعی، میزبانی شخصی این زیرساخت کنترل مطلق روی خط لوله داده‌های شما فراهم می‌کند. برای بهینه‌سازی هزینه‌ها، از تخفیف‌های کاربر جدید استفاده کنید و قیمت‌های تمدید را تثبیت کنید تا در برابر افزایش قیمت‌های آینده ابری مصون بمانید.

به پایان رویداد خرید Tencent Cloud در ۱۲ اکتبر ۲۰۲۶ توجه کنید تا بتوانید پایین‌ترین نرخ‌های میزبانی ممکن را برای درگاه خود رزرو کنید.

گام بعدی شما

  • اگر از چندین مدل مختلف استفاده می‌کنید، New API را روی یک نمونه کوچک 2C2G تست کنید تا پیچیدگی مدیریت کلیدها را کاهش دهید.
  • برای محیط‌های عملیاتی، حتماً پایگاه‌داده را از SQLite به PostgreSQL منتقل کنید تا از کرش‌های احتمالی جلوگیری شود.
  • تا ۱۲ اکتبر ۲۰۲۶ برای بررسی تخفیف‌های خرید Tencent Cloud اقدام کنید تا هزینه میزبانی درگاه خود را به حداقل برسانید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با حذف نقطه شکست واحد، پایداری اپلیکیشن‌های تجاری مبتنی بر هوش مصنوعی را تضمین می‌کند. اعتبار این رویکرد در پذیرش گسترده توسط جامعه متن‌باز و کاهش هزینه‌های عملیاتی مدیریت APIها نهفته است.

تأثیر برای ایران

به‌دلیل تحریم‌ها و محدودیت‌های پرداخت، این ابزار برای توسعه‌دهندگان ایرانی که از پروکسی‌های مختلف برای دسترسی به APIها استفاده می‌کنند، راهکاری ایده‌آل برای متمرکز کردن ترافیک و مدیریت هزینه‌هاست.

·نگاه ما
تحریریه دات‌هوش

انتقال لایه مدیریت از سمت ارائه‌دهنده به سمت توسعه‌دهنده، پایان دوران وابستگی مطلق به یک اکوسیستم واحد است. این رویکرد در واقع «دموکراتیزه کردن» دسترسی به مدل‌هاست و اجازه می‌دهد استراتژی‌های Multi-model را بدون هزینه بازنویسی کد پیاده کنیم. به نظر ما، این ابزارها پیش‌نیاز تبدیل شدن مدل‌های زبانی از یک «سرویس» به یک «کالا» (Commodity) هستند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.