پرش به محتوای اصلی
پرش به محتوای مقاله

مدل قیمت‌گذاری ثابت Oxlo.ai هزینه استنتاج سیستم‌های توصیه‌گر را حذف کرد

·۴ شهریور ۱۴۰۵۶ دقیقه مطالعه۱ بازدید
راهنما
سیستم پیشنهاددهنده با ترکیب مدل زبانی بزرگ و فیلترینگ مشارکتی
سیستم پیشنهاددهنده با ترکیب مدل زبانی بزرگ و فیلترینگ مشارکتی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی مدل پرداخت توکنی با نرخ ثابت به‌ازای هر درخواست در رتبه‌بندی LLM؛ این یعنی طول تاریخچه کاربر دیگر تأثیری بر هزینه نهایی استنتاج ندارد.

اگر امروز برای شخصی‌سازی تجربه کاربران خود هزینه می‌پردازید، احتمالاً با این واقعیت تلخ روبروستید که هرچه داده‌های کاربر بیشتر شود، صورت‌حساب شما به‌طور وحشتناکی رشد می‌کند. قیمت‌گذاری API با نرخ ثابت (Flat-rate) به توسعه‌دهندگان اجازه می‌دهد تا تاریخچه‌های عظیم کاربران را بدون جهش‌های هزینه‌ای خطی که در صورت‌حساب‌های مبتنی بر توکن رایج است، وارد مدل‌های رتبه‌بندی کنند. این تغییر رویکرد، ایجاد یک سیستم توصیه‌گر ترکیبی با دقت بالا را ممکن می‌سازد که الگوهای رفتاری را با استدلال معنایی ترکیب می‌کند. این مدل اقتصادی در واقع تکامل همان رویکردی است که Oxlo.ai برای جداسازی هزینه استنتاج از تعداد توکن‌ها به کار گرفته تا محدودیت‌های مالی را از مسیر دقت مدل‌ها بردارد.

بسیاری از سیستم‌های عملیاتی با مشکل «راه‌اندازی سرد» (Cold Start) — شبیه وقتی یک فروشنده جدید وارد بازار می‌شود و هیچ‌کس او را نمی‌شناسد تا بتواند بر اساس سلیقه مشتریان توصیه کند — دست‌وپنجه نرم می‌کنند؛ جایی که آیتم‌ها یا کاربران جدید، داده‌های تعاملی کافی برای الگوریتم‌های سنتی ندارند. همان‌طور که در تحلیل قبلی ما درباره‌ی کاهش تأخیر با استفاده از KV Caching و رمزگشایی گمانه‌زن (Speculative Decoding) اشاره کردیم، صنعت اکنون به سمت خط‌لوله‌های ترکیبی حرکت می‌کند که در آن مدل‌های زبانی بزرگ (LLMs) برای پر کردن این شکاف‌های داده‌ای استفاده می‌شوند. تصور کنید یک سرویس استریم می‌داند شما به علمی-تخیلی علاقه دارید (الگوی رفتاری)، اما هم‌زمان می‌تواند استدلال کند که یک فیلم جدید دقیقاً با علاقه شما به «زیبایی‌شناسی سایبرپانک» هم‌خوانی دارد (استدلال معنایی).

معماری دو مرحله‌ای

به نقل از یک راهنمای فنی منتشر شده در ۲۶ اوت ۲۰۲۶، سیستم‌های سطح تولید برای حفظ تأخیر پایین، مرحله بازیابی (Retrieval) را از رتبه‌بندی (Ranking) جدا می‌کنند. در مرحله اول، فیلترینگ مشارکتی (Collaborative Filtering) میلیون‌ها آیتم را به یک مجموعه کوچک از کاندیداها محدود می‌کند. در مرحله دوم، یک مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — این کاندیداها را بر اساس استدلال روی تاریخچه کامل کاربر، ویژگی‌های آیتم و قوانین تجاری بازرتبه‌بندی می‌کند.

این طراحی دو مرحله‌ای باعث می‌شود تأخیر سیستم پایین بماند و در عین حال، مدل بتواند توان محاسباتی خود را فقط روی مرتبط‌ترین موارد متمرکز کند. Oxlo.ai با میزبانی مدل‌های وزن‌باز (Open Weights) — یعنی مدل‌هایی که دستور پخت آن‌ها علناً منتشر شده و نه فقط غذای آماده — برای هر دو مرحله، این فرآیند را تسهیل می‌کند. توسعه‌دهندگان می‌توانند از مدل‌های BGE-Large یا E5-Large برای بازیابی برداری استفاده کنند و سپس رتبه‌بندی نهایی را به مدل‌های قدرتمندی مثل Llama 3.3 70B، DeepSeek V3.2 یا Qwen 3 32B بسپارند.

از آنجا که Oxlo.ai کاملاً با SDK شرکت OpenAI سازگار است، توسعه‌دهندگان تنها با تغییر آدرس API به https://api.oxlo.ai/v1 می‌توانند بدون تغییر در کد، زیرساخت خود را منتقل کنند و همان کدهایی را اجرا کنند که برای هر ارائه‌دهنده سازگار با OpenAI استفاده می‌کردند.

بازیابی با فیلترینگ مشارکتی

مرحله بازیابی معمولاً از تجزیه ماتریسی (Matrix Factorization) برای یافتن شباهت‌های رفتاری استفاده می‌کند. بر اساس مستندات فنی، استفاده از کتابخانه implicit برای ایجاد ماتریس تعامل کاربر-آیتم توصیه می‌شود. یک پیاده‌سازی رایج، استفاده از مدل AlternatingLeastSquares با ۱۲۸ فاکتور، مقدار منظم‌سازی (Regularization) ۰.۰۵ و ۲۰ تکرار برای برازش ماتریس تعامل است.

  • این مدل مجموعه‌ای از کاندیداهای پایه (مثلاً ۱۰۰ آیتم برتر) را از طریق ضرب داخلی (Dot-product) فاکتورهای کاربر و آیتم تولید می‌کند.
  • این فرآیند بسیار سریع است اما فاقد درک متنی است.
  • مدل می‌فهمد «که» کاربر آیتمی را دوست دارد، اما نمی‌داند «چرا».
  • این ۱۰۰ مورد به عنوان یک فیلتر اولیه عمل می‌کنند که شباهت رفتاری را می‌گیرند اما ظرافت‌های معنایی آیتم‌ها را نادیده می‌گیرند.

بازرتبه‌بندی مبتنی بر LLM

پس از شناسایی کاندیداها، مدل زبانی آن‌ها را بازرتبه‌بندی می‌کند. در پلتفرم‌های سنتی، طول متن یا پنجره زمینه (Context Window) — میزان متنی که مدل هم‌زمان در ذهن نگه می‌دارد، شبیه میز کاری که جا برای چند ورق دارد — به یک بدهی مالی تبدیل می‌شود. برای هر کاربر، سیستم پرامپتی شامل تعاملات اخیر و توصیفات ساختاریافته هر آیتم کاندید می‌سازد و از مدل می‌خواهد یک امتیاز ارتباطی یا یک لیست بازرتبه‌بندی شده ارائه دهد.

به‌عنوان مثال، پرامپتی با ۵۰ تعامل گذشته و ۱۰۰ آیتم کاندید، به‌راحتی ده‌ها هزار توکن (Token) — تکه‌های کوچکی از متن، شبیه برش‌های یک کیک که مدل تکه‌تکه می‌خورد — مصرف می‌کند. در مدل‌های پرداخت توکنی، این حجم از ورودی هزینه هر درخواست را به‌شدت بالا می‌برد. اگر هر درخواست رتبه‌بندی به‌طور متوسط ۸۰۰۰ توکن باشد و سیستم روزانه یک میلیون رتبه‌بندی انجام دهد، هزینه‌ها به‌طور خطی با هر دو متغیر حجم درخواست و طول زمینه رشد می‌کنند.

Oxlo.ai این محدودیت را با دریافت هزینه ثابت به‌ازای هر درخواست حذف کرده است. فرقی نمی‌کند پرامپت شما ۵۰۰ توکن باشد یا ۵۰,۰۰۰ توکن؛ قیمت یکسان است. این یعنی توسعه‌دهندگان می‌توانند توصیفات کامل محصول، تکه‌هایی از نظرات کاربران و لاگ‌های جلسات چند-مرحله‌ای (Multi-turn session logs) را بدون نگرانی از شمارنده هزینه، به مدل بدهند.

تقویت معنایی

برای بهبود بیشتر خط‌لوله، توسعه‌دهندگان می‌توانند فیلترینگ مشارکتی را با جست‌وجوی برداری متراکم (Dense Vector Search) جایگزین یا تقویت کنند. با تبدیل توصیفات آیتم‌ها به بردار معنایی (Embedding) — مثل کارت معرفی عددی برای هر واژه که می‌گوید این کلمه همسایه چه کلمات دیگری است — با استفاده از مدل‌های BGE-Large یا E5-Large، سیستم می‌تواند آیتم‌هایی را بازیابی کند که از نظر معنایی با ترجیحات بیان‌شده کاربر یا تعاملات مثبت اخیر او مشابه هستند.

ترکیب این بردارها با فیلترینگ مشارکتی، یک بازیاب ترکیبی (Hybrid Retriever) واقعی می‌سازد. لایه رتبه‌بندی LLM سپس روی کاندیداهایی عمل می‌کند که هم از نظر رفتاری و هم از نظر معنایی قوی هستند و بدین ترتیب شکاف مربوط به آیتم‌هایی که تعاملات کمی دارند اما ارتباط متنی بالایی دارند، پر می‌شود.

اجرای خط‌لوله انتها-به-انتها

یک پیاده‌سازی کامل از این چرخه از یک ریتم شبانه و در لحظه (Real-time) پیروی می‌کند:

۱. محاسبات شبانه: پیش‌محاسبه فاکتورهای ALS کاربر/آیتم و بردارهای متنی برای کل کاتالوگ از طریق Embeddingهای Oxlo.ai.
۲. بازیابی کاندیدا: در لحظه درخواست، استخراج ۱۰۰ کاندیدا از طریق ضرب داخلی ALS.
۳. بازرتبه‌بندی LLM: رتبه‌بندی ۲۰ مورد اول با استفاده از پرامپت LLM که شامل ۱۰ تعامل آخر کاربر و توصیفات کامل آیتم‌ها است.
۴. ارسال نهایی: بازگرداندن ۵ مورد اول و مرتبط‌ترین آیتم‌ها به کاربر.

در پلتفرم‌های توکنی، مرحله LLM گران‌ترین بخش خط‌لوله است چون به‌صورت آنلاین اجرا می‌شود و ورودی‌های طولانی مصرف می‌کند، اما در Oxlo.ai این یک درخواست با هزینه ثابت است.

استقرار و بهینه‌سازی

برای حفظ کارایی سیستم، راهنمای فنی پیشنهاد می‌کند مجموعه کاندیداهای LLM را در حدود ۲۰ مورد نگه دارید تا تعادلی بین کیفیت و زمان پاسخ ایجاد شود. Oxlo.ai مدل‌های محبوب را بدون «راه‌اندازی سرد» سرو می‌کند، به این معنی که هیچ جریمه‌ای برای گرم شدن (Warmup penalty) در اولین درخواست پس از مدتی بیکاری وجود ندارد.

  • کشینگ: ذخیره بردارها و فاکتورهای ALS در Redis یا یک ذخیره‌ساز برداری در حافظه (In-memory).
  • حالت JSON: استفاده از ویژگی JSON Mode برای محدود کردن مدل به بازگرداندن یک آرایه قابل تجزیه (Parseable) از شناسه‌های آیتم و امتیازها به‌جای رتبه‌بندی‌های متنی آزاد.
  • استریمینگ: استفاده از ویژگی پاسخ‌های جریانی (Streaming) برای کاهش زمان تا نخستین بایت (TTFB) در برنامه‌هایی با ترافیک بالا.
  • مانیتورینگ: بازاستفاده از ابزارهای نظارتی موجود برای تأخیر و نرخ خطا به‌دلیل سازگاری کامل API با SDK شرکت OpenAI بدون نیاز به تغییر کد.

این تغییر در مدل قیمت‌گذاری، مفروضات بنیادی مهندسی هوش مصنوعی را تغییر می‌دهد. پیش از این، محدودیت اصلی در رتبه‌بندی مبتنی بر LLM، «بودجه توکن» بود که توسعه‌دهندگان را مجبور می‌کرد برای صرفه‌جویی در هزینه، زمینه (Context) را کوتاه کنند و دقت را فدا کنند.

با جداسازی هزینه از طول متن، گلوگاه از کیف پول به توان استدلال واقعی مدل منتقل می‌شود. این موضوع برای برنامه‌هایی که نیاز به شخصی‌سازی عمیق دارند اما توان پرداخت هزینه‌های خطی ارائه‌دهندگان توکنی را ندارند، یک نقطه عطف است. جزئیات بیشتر درباره طرح‌های قیمت‌گذاری در https://oxlo.ai/pricing در دسترس است.

توسعه‌دهندگان باید اکنون ارزیابی کنند که آیا منطق فعلی آن‌ها برای کوتاه کردن متن، کیفیت توصیه‌ها را مختل کرده است یا خیر. تست یک ارائه‌دهنده با نرخ ثابت در سطح رایگان — که Oxlo.ai با ۶۰ درخواست روزانه و دسترسی به بیش از ۱۶ مدل ارائه می‌دهد — می‌تواند افزایش چشمگیر دقت را به دلیل استفاده از پرامپت‌های غنی‌تر آشکار کند.

گام بعدی شما

  • بررسی کنید که آیا در سیستم‌های فعلی خود برای کاهش هزینه، بخش‌هایی از تاریخچه کاربر را حذف می‌کنید یا خیر.
  • مدل‌های Llama 3.3 یا DeepSeek V3.2 را در محیط Oxlo.ai برای رتبه‌بندی آیتم‌ها تست کنید تا اثر پرامپت‌های طولانی‌تر بر صحت نتایج را بسنجید.
  • زیرساخت بازیابی خود را از حالت تک‌بعدی (فقط رفتاری یا فقط معنایی) به مدل ترکیبی (Hybrid) ارتقا دهید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تغییر مدل تجاری، سد مالی پیش روی شخصی‌سازی عمیق در مقیاس بالا را می‌شکند. با تکیه بر اعتبار مدل‌های وزن‌باز و حذف هزینه‌های متغیر، شرکت‌های کوچک اکنون می‌توانند سیستم‌های توصیه‌گری در سطح غول‌های تکنولوژی پیاده کنند.

تأثیر برای ایران

توسعه‌دهندگان ایرانی که با محدودیت بودجه ارزی برای APIهای توکنی دست‌وپنجه نرم می‌کنند، می‌توانند با مدل نرخ ثابت Oxlo.ai، دقت سیستم‌های خود را بدون افزایش هزینه ارتقا دهند.

·نگاه ما
تحریریه دات‌هوش

انتقال مدل قیمت‌گذاری از توکن به نرخ ثابت، در واقع «دموکراتیزه کردن» پنجره‌های متنی بزرگ برای کاربردهای تجاری است. این رویکرد باعث می‌شود مهندسان به‌جای صرف وقت برای فشرده‌سازی متن (Context Compression)، روی بهبود کیفیت استدلال مدل تمرکز کنند. در واقع، هزینه دیگر متغیری نیست که معماری سیستم را دیکته کند، بلکه تنها محدودیت باقی‌مانده، توان پردازشی و دقت مدل است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.