پرش به محتوای اصلی
پرش به محتوای مقاله

مدل قیمت‌گذاری Oxlo.ai هزینه استنتاج سیستم‌های توصیه‌گر را ثابت کرد

·۱۰ مرداد ۱۴۰۵۴ دقیقه مطالعه۴ بازدید
راهنما
بهینه‌سازی سیستم‌های توصیه‌گر مبتنی بر LLM از نظر هزینه و عملکرد
بهینه‌سازی سیستم‌های توصیه‌گر مبتنی بر LLM از نظر هزینه و عملکرد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر پارادایم پرداخت از «مقدار داده» به «تعداد درخواست» در استنتاج مدل‌های زبانی؛ این یعنی حذف جریمه مالی برای استفاده از پنجره‌های متنی بسیار طولانی در سیستم‌های توصیه‌گر.

اگر امروز برای مدیریت هزینه‌های استنتاج در سیستم‌های توصیه‌گر با محدود کردن تاریخچه کاربران دست‌وپنجه نرم می‌کنید، مدل اقتصادی جدید Oxlo.ai بازی را تغییر می‌دهد. تصور کنید دیگر نیازی نباشد برای کاهش صورت‌حساب ماهانه، جزئیات محصولات یا رفتار کاربر را حذف کنید. قیمت‌گذاری ثابت به‌ازای هر درخواست در Oxlo.ai، جریمه مالی استفاده از تاریخچه‌های طولانی کاربر در موتورهای توصیه‌گر را از بین می‌برد. با دریافت یک هزینه واحد برای هر فراخوانی API، صرف‌نظر از طول ورودی، این پلتفرم به توسعه‌دهندگان اجازه می‌دهد تا دقت را بر شمارش توکن‌ها ترجیح دهند.

این تغییر در حالی رخ می‌دهد که تیم‌های توسعه با رشد خطی هزینه‌ها در مدل‌های توکنی مواجه‌اند؛ جایی که هر توصیف محصول اضافی یا هر لاگ کاربر، مستقیماً مبلغ قبض را بالا می‌برد. همان‌طور که در تحلیل قبلی ما درباره‌ی تعادل میان تأخیر لبه و قدرت ابری اشاره کردیم، چالش اصلی سیستم‌های توصیه‌گر، حجم عظیم داده‌های مورد نیاز برای شخصی‌سازی است. روش‌های سنتی فیلترینگ مشارکتی (Collaborative Filtering) ارزان هستند اما نسبت به متادیتای غنی نابیناهند. مدل‌های زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — این مشکل را حل می‌کنند، اما به دلیل الحاق ده‌ها توصیف محصول و دستورات سیستمی در هر فراخوانی بازرتبه‌بندی، یک «گلوگاه هزینه» ایجاد می‌کنند که منجر به هزینه‌های غیرقابل پیش‌بینی می‌شود.

گلوگاه هزینه در توصیه‌گرها

سیستم‌های توصیه‌گر ذاتاً ورودی-محور هستند. یک فراخوانی بازرتبه‌بندی (Reranking) ممکن است ترکیبی از لاگ‌های تعاملی کاربر، دستورات سیستمی و ده‌ها توصیف محصول باشد. در مدل‌های استنتاج توکن-محور، هزینه‌ها به‌صورت خطی با افزایش طول زمینه (Context Length) رشد می‌کنند.

این وضعیت در سیستم‌های توصیه‌گر عامل‌محور (Agentic Recommenders) تشدید می‌شود. این سیستم‌ها به‌صورت تکرارشونده روی مجموعه‌های کاندیدا کار می‌کنند یا ابزارها را به‌صورت ضربی فراخوانی می‌کنند. اگر پرامپت‌ها به‌طور متوسط هزاران توکن در هر جلسه داشته باشند، صورت‌حساب توکن‌ها به‌سرعت مقیاس می‌گیرد و افزایش می‌یابد.

بر اساس یک راهنمای فنی که در ۱ اوت ۲۰۲۶ منتشر شد، موثرترین راه برای مقیاس‌دهی این سیستم‌ها، طراحی دو مرحله‌ای است: ابتدا یک مدل بردار معنایی (Embedding) هزاران کاندیدا را به یک مجموعه کوچک (Top-K) محدود می‌کند. سپس یک LLM بازرتبه‌بندی نهایی یا تولید توضیح (Explanation Generation) را بر عهده می‌گیرد.

جزئیات پیاده‌سازی

برای اجرای این استراتژی، Oxlo.ai ابزارها و مدل‌های خاصی را فراهم کرده است:

  • بردار معنایی (Embeddings): نقاط انتهایی برای مدل‌های BGE-Large و E5-Large جهت بازیابی اولیه. این مدل‌ها از طریق همان SDK سازگار با OpenAI قابل فراخوانی هستند.
  • مدل‌های بازرتبه‌بندی: استفاده از Llama 3.3 70B یا DeepSeek V3.2 با حالت JSON برای خروجی‌های ساختاریافته و قابل تجزیه، که نیاز به تکرار عملیات تجزیه (Parsing Retries) را حذف می‌کند.
  • پشتیبانی از زمینه طولانی: مدل‌های DeepSeek V4 Flash (با پنجره متنی ۱ میلیون توکن) و Kimi K2.6 (با ۱۳۱ هزار توکن) برای توصیه‌های Zero-shot.
  • مدل‌های بهره‌وری: Qwen 3 Coder 30B یا Oxlo.ai Coder Fast برای امتیازدهی ساختاریافته و منطق فیلترینگ.
  • استدلال‌های باارزش: مدل‌های حجیمی مثل DeepSeek R1 671B، GLM 5 یا Kimi K2.6 برای توضیحات مرحله نهایی یا بخش‌های کاربرانی با ارزش بالا (High-value segments).

توسعه‌دهندگان می‌توانند با تبدیل داده‌های خام کاتالوگ به تگ‌های ویژگی متراکم، نویز را کاهش دهند. برای مثال، جایگزینی یک توصیف ۲۰۰ کلمه‌ای با یک رشته ویژگی ۲۰ کلمه‌ای، اندازه ورودی را کاهش داده و تمرکز مدل را بهبود می‌بخشد.

علاوه بر این، نگهداری خلاصه‌های متحرک (Rolling Summaries) از پروفایل کاربر در یک حافظه کش کلید-مقدار (Key-Value Cache)، نیاز به ارسال کل تاریخچه تعاملات خام در هر درخواست را از بین می‌برد. این رویکرد بهینه‌سازی حافظه با مفاهیم مدرن همسو است؛ به‌طوری که ذخیره‌سازی درک مدل جایگزین کش کردن پاسخ‌های نهایی در RAG شده است تا بازدهی استنتاج افزایش یابد. این خلاصه‌ها می‌توانند توسط یک پردازش پس‌زمینه یا یک مدل کوچک‌تر تولید شوند و اندازه ورودی را تا یک مرتبه بزرگی (Order of Magnitude) کاهش دهند.

مهندسی پرامپت برای زمینه‌های طولانی

حتی پس از بازیابی، پنجره‌های متنی می‌توانند بیش از حد کشیده شوند. تیم‌ها باید از «برش پویا» (Dynamic Truncation) برای حفظ تعاملات اخیر و حذف موارد قدیمی استفاده کنند، یا از فشرده‌سازی معنایی (Semantic Compression) برای خلاصه‌سازی تاریخچه‌های قدیمی‌تر بهره ببرند.

وقتی ارسال زمینه طولانی اجتناب‌ناپذیر است، قیمت‌گذاری بر اساس درخواست، اقتصاد ماجرا را عوض می‌کند. ارسال یک زمینه کامل ۱۲۸ هزار توکنی دیگر هزینه هر فراخوانی را تغییر نمی‌دهد و توصیه‌های Zero-shot (بدون نمونه) را از حالت گران‌قیمت به حالت کاربردی تبدیل می‌کند.

این چرخش معماری، متادیتای غنی را از یک «بدهی مالی» به یک «سرمایه دقت» تبدیل می‌کند. در مدل‌های توکنی ارائه‌دهندگانی مثل Together AI، Fireworks AI، OpenRouter, Replicate یا Anyscale، متادیتای غنی‌تر یک ریسک مالی است. اما در Oxlo.ai، هزینه برای یک پرامپت ۱ هزار توکنی یا ۱۲۸ هزار توکنی یکسان است. این امر به تیم‌ها اجازه می‌دهد تا بدون نگرانی از شمارنده توکن‌ها، روی مجموعه‌های کاندیدای بزرگ‌تر و زمینه‌های جامع‌تر آزمایش کنند.

برای توسعه‌دهنده، این بدان معناست که LLM دیگر یک مکانیسم ذخیره‌سازی نیست، بلکه یک موتور خالص رتبه‌بندی است. با برون‌سپاری جستجوی داده‌های آنی به APIهای خارجی از طریق فراخوانی توابع (Function Calling) و استفاده از ابزارها، پرامپت‌ها سبک و متمرکز باقی می‌مانند.

الگوی خط لوله بهینه

یک خط لوله بهینه در Oxlo.ai از این مسیر می‌گذرد:
۱. تبدیل سیگنال‌های کاربر به بردار با BGE-Large از طریق نقطه انتهایی embeddings.
۲. بازیابی ۲۰ کاندیدای برتر از یک ذخیره‌ساز برداری (Vector Store).
۳. برش یا خلاصه‌سازی متادیتای کاندیداها به حداکثر ۵۰ کلمه برای هر مورد.
۴. فراخوانی Llama 3.3 70B یا DeepSeek V3.2 با حالت JSON برای دریافت لیست رتبه‌بندی شده و منطق توجیهی (Rationale).
۵. ذخیره نتیجه در کش برای آن جلسه (Session).

در این ساختار، بازیابی کارهای سخت را انجام می‌دهد و مدل قیمت‌گذاری، دقت را پاداش می‌دهد نه اینکه آن را جریمه کند.

برای شروع، توسعه‌دهندگان می‌توانند base_url خود را در SDK مدل OpenAI به Oxlo.ai تغییر دهند. این کار تضمین می‌کند که برای مدل‌های محبوب هیچ «راه‌اندازی سرد» (Cold Start) وجود نداشته باشد و هنگام مقیاس‌دهی از صدها به هزاران درخواست در دقیقه، تأخیر قابل پیش‌بینی باشد. جزئیات دقیق طرح‌های قیمت‌گذاری در https://oxlo.ai/pricing در دسترس است.

گام بعدی شما

  • برای شروع، base_url خود را در SDK مدل OpenAI به Oxlo.ai تغییر دهید تا از تأخیرهای راه‌اندازی سرد خلاص شوید.
  • متادیتای کاتالوگ خود را به تگ‌های ویژگی متراکم تبدیل کنید تا تمرکز مدل افزایش یابد.
  • استراتژی بازیابی دو مرحله‌ای (Embedding $\rightrightarrows$ Reranking) را جایگزین فراخوانی‌های مستقیم LLM کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل قیمت‌گذاری با حذف وابستگی هزینه به طول متن، دسترسی به شخصی‌سازی‌های عمیق را برای استارتاپ‌ها ممکن می‌کند. اعتبار این رویکرد در کاهش هزینه‌های عملیاتی (OpEx) برای سیستم‌هایی است که با داده‌های حجیم سر و کار دارند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم توسعه‌دهندگان ایرانی به این سرویس دشوار است، اما الگوی بازیابی دو مرحله‌ای برای پیاده‌سازی روی مدل‌های بازمتن در سرورهای داخلی بسیار کاربردی است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی توکن با درخواست، در واقع انتقال ریسک مالی از دوش توسعه‌دهنده به زیرساخت است. این تغییر باعث می‌شود مدل‌های زبانی از نقش «حافظه» خارج شده و صرفاً به عنوان «پردازشگر» عمل کنند. در نتیجه، رقابت در سیستم‌های توصیه‌گر از بهینه‌سازی تعداد توکن‌ها به بهینه‌سازی کیفیت بازیابی (Retrieval) منتقل می‌شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.