اگر امروز برای مدیریت هزینههای استنتاج در سیستمهای توصیهگر با محدود کردن تاریخچه کاربران دستوپنجه نرم میکنید، مدل اقتصادی جدید Oxlo.ai بازی را تغییر میدهد. تصور کنید دیگر نیازی نباشد برای کاهش صورتحساب ماهانه، جزئیات محصولات یا رفتار کاربر را حذف کنید. قیمتگذاری ثابت بهازای هر درخواست در Oxlo.ai، جریمه مالی استفاده از تاریخچههای طولانی کاربر در موتورهای توصیهگر را از بین میبرد. با دریافت یک هزینه واحد برای هر فراخوانی API، صرفنظر از طول ورودی، این پلتفرم به توسعهدهندگان اجازه میدهد تا دقت را بر شمارش توکنها ترجیح دهند.
این تغییر در حالی رخ میدهد که تیمهای توسعه با رشد خطی هزینهها در مدلهای توکنی مواجهاند؛ جایی که هر توصیف محصول اضافی یا هر لاگ کاربر، مستقیماً مبلغ قبض را بالا میبرد. همانطور که در تحلیل قبلی ما دربارهی تعادل میان تأخیر لبه و قدرت ابری اشاره کردیم، چالش اصلی سیستمهای توصیهگر، حجم عظیم دادههای مورد نیاز برای شخصیسازی است. روشهای سنتی فیلترینگ مشارکتی (Collaborative Filtering) ارزان هستند اما نسبت به متادیتای غنی نابیناهند. مدلهای زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن کتابها جواب میدهد — این مشکل را حل میکنند، اما به دلیل الحاق دهها توصیف محصول و دستورات سیستمی در هر فراخوانی بازرتبهبندی، یک «گلوگاه هزینه» ایجاد میکنند که منجر به هزینههای غیرقابل پیشبینی میشود.
گلوگاه هزینه در توصیهگرها
سیستمهای توصیهگر ذاتاً ورودی-محور هستند. یک فراخوانی بازرتبهبندی (Reranking) ممکن است ترکیبی از لاگهای تعاملی کاربر، دستورات سیستمی و دهها توصیف محصول باشد. در مدلهای استنتاج توکن-محور، هزینهها بهصورت خطی با افزایش طول زمینه (Context Length) رشد میکنند.
این وضعیت در سیستمهای توصیهگر عاملمحور (Agentic Recommenders) تشدید میشود. این سیستمها بهصورت تکرارشونده روی مجموعههای کاندیدا کار میکنند یا ابزارها را بهصورت ضربی فراخوانی میکنند. اگر پرامپتها بهطور متوسط هزاران توکن در هر جلسه داشته باشند، صورتحساب توکنها بهسرعت مقیاس میگیرد و افزایش مییابد.
بر اساس یک راهنمای فنی که در ۱ اوت ۲۰۲۶ منتشر شد، موثرترین راه برای مقیاسدهی این سیستمها، طراحی دو مرحلهای است: ابتدا یک مدل بردار معنایی (Embedding) هزاران کاندیدا را به یک مجموعه کوچک (Top-K) محدود میکند. سپس یک LLM بازرتبهبندی نهایی یا تولید توضیح (Explanation Generation) را بر عهده میگیرد.
جزئیات پیادهسازی
برای اجرای این استراتژی، Oxlo.ai ابزارها و مدلهای خاصی را فراهم کرده است:
- بردار معنایی (Embeddings): نقاط انتهایی برای مدلهای BGE-Large و E5-Large جهت بازیابی اولیه. این مدلها از طریق همان SDK سازگار با OpenAI قابل فراخوانی هستند.
- مدلهای بازرتبهبندی: استفاده از Llama 3.3 70B یا DeepSeek V3.2 با حالت JSON برای خروجیهای ساختاریافته و قابل تجزیه، که نیاز به تکرار عملیات تجزیه (Parsing Retries) را حذف میکند.
- پشتیبانی از زمینه طولانی: مدلهای DeepSeek V4 Flash (با پنجره متنی ۱ میلیون توکن) و Kimi K2.6 (با ۱۳۱ هزار توکن) برای توصیههای Zero-shot.
- مدلهای بهرهوری: Qwen 3 Coder 30B یا Oxlo.ai Coder Fast برای امتیازدهی ساختاریافته و منطق فیلترینگ.
- استدلالهای باارزش: مدلهای حجیمی مثل DeepSeek R1 671B، GLM 5 یا Kimi K2.6 برای توضیحات مرحله نهایی یا بخشهای کاربرانی با ارزش بالا (High-value segments).
توسعهدهندگان میتوانند با تبدیل دادههای خام کاتالوگ به تگهای ویژگی متراکم، نویز را کاهش دهند. برای مثال، جایگزینی یک توصیف ۲۰۰ کلمهای با یک رشته ویژگی ۲۰ کلمهای، اندازه ورودی را کاهش داده و تمرکز مدل را بهبود میبخشد.
علاوه بر این، نگهداری خلاصههای متحرک (Rolling Summaries) از پروفایل کاربر در یک حافظه کش کلید-مقدار (Key-Value Cache)، نیاز به ارسال کل تاریخچه تعاملات خام در هر درخواست را از بین میبرد. این رویکرد بهینهسازی حافظه با مفاهیم مدرن همسو است؛ بهطوری که ذخیرهسازی درک مدل جایگزین کش کردن پاسخهای نهایی در RAG شده است تا بازدهی استنتاج افزایش یابد. این خلاصهها میتوانند توسط یک پردازش پسزمینه یا یک مدل کوچکتر تولید شوند و اندازه ورودی را تا یک مرتبه بزرگی (Order of Magnitude) کاهش دهند.
مهندسی پرامپت برای زمینههای طولانی
حتی پس از بازیابی، پنجرههای متنی میتوانند بیش از حد کشیده شوند. تیمها باید از «برش پویا» (Dynamic Truncation) برای حفظ تعاملات اخیر و حذف موارد قدیمی استفاده کنند، یا از فشردهسازی معنایی (Semantic Compression) برای خلاصهسازی تاریخچههای قدیمیتر بهره ببرند.
وقتی ارسال زمینه طولانی اجتنابناپذیر است، قیمتگذاری بر اساس درخواست، اقتصاد ماجرا را عوض میکند. ارسال یک زمینه کامل ۱۲۸ هزار توکنی دیگر هزینه هر فراخوانی را تغییر نمیدهد و توصیههای Zero-shot (بدون نمونه) را از حالت گرانقیمت به حالت کاربردی تبدیل میکند.
این چرخش معماری، متادیتای غنی را از یک «بدهی مالی» به یک «سرمایه دقت» تبدیل میکند. در مدلهای توکنی ارائهدهندگانی مثل Together AI، Fireworks AI، OpenRouter, Replicate یا Anyscale، متادیتای غنیتر یک ریسک مالی است. اما در Oxlo.ai، هزینه برای یک پرامپت ۱ هزار توکنی یا ۱۲۸ هزار توکنی یکسان است. این امر به تیمها اجازه میدهد تا بدون نگرانی از شمارنده توکنها، روی مجموعههای کاندیدای بزرگتر و زمینههای جامعتر آزمایش کنند.
برای توسعهدهنده، این بدان معناست که LLM دیگر یک مکانیسم ذخیرهسازی نیست، بلکه یک موتور خالص رتبهبندی است. با برونسپاری جستجوی دادههای آنی به APIهای خارجی از طریق فراخوانی توابع (Function Calling) و استفاده از ابزارها، پرامپتها سبک و متمرکز باقی میمانند.
الگوی خط لوله بهینه
یک خط لوله بهینه در Oxlo.ai از این مسیر میگذرد:
۱. تبدیل سیگنالهای کاربر به بردار با BGE-Large از طریق نقطه انتهایی embeddings.
۲. بازیابی ۲۰ کاندیدای برتر از یک ذخیرهساز برداری (Vector Store).
۳. برش یا خلاصهسازی متادیتای کاندیداها به حداکثر ۵۰ کلمه برای هر مورد.
۴. فراخوانی Llama 3.3 70B یا DeepSeek V3.2 با حالت JSON برای دریافت لیست رتبهبندی شده و منطق توجیهی (Rationale).
۵. ذخیره نتیجه در کش برای آن جلسه (Session).
در این ساختار، بازیابی کارهای سخت را انجام میدهد و مدل قیمتگذاری، دقت را پاداش میدهد نه اینکه آن را جریمه کند.
برای شروع، توسعهدهندگان میتوانند base_url خود را در SDK مدل OpenAI به Oxlo.ai تغییر دهند. این کار تضمین میکند که برای مدلهای محبوب هیچ «راهاندازی سرد» (Cold Start) وجود نداشته باشد و هنگام مقیاسدهی از صدها به هزاران درخواست در دقیقه، تأخیر قابل پیشبینی باشد. جزئیات دقیق طرحهای قیمتگذاری در https://oxlo.ai/pricing در دسترس است.
گام بعدی شما
- برای شروع،
base_urlخود را در SDK مدل OpenAI به Oxlo.ai تغییر دهید تا از تأخیرهای راهاندازی سرد خلاص شوید. - متادیتای کاتالوگ خود را به تگهای ویژگی متراکم تبدیل کنید تا تمرکز مدل افزایش یابد.
- استراتژی بازیابی دو مرحلهای (Embedding $\rightrightarrows$ Reranking) را جایگزین فراخوانیهای مستقیم LLM کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو