اگر امروز برای هر توکن در لایه مسیریابی عاملهای خود هزینه میدهید، احتمالاً بخش بزرگی از بودجه شما صرف متونی میشود که مدل برای فهمیدن یک دستور ساده به آنها نیاز دارد. Oxlo.ai با حذف جریمه مالی برای ارسال متون طولانی، بازی را برای توسعهدهندگان تغییر داده است.
در محیطهای عملیاتی، تشخیص قصد (Intent Detection) — یعنی همان لایهای که تعیین میکند کاربر واقعاً چه میخواهد — معمولاً با هر توکن اضافهشده به پرامپت گرانتر میشود. درک زبان طبیعی (NLU) سنتی نیازمند مجموعههای آموزشی سختگیرانه، ثبات در برچسبگذاری و بازآموزی مداوم هرگاه قصد جدیدی ظاهر شود بود. هوش مصنوعی زاینده (Generative AI) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن کتابها جواب میدهد — این فرآیند را معکوس کرده و آن را از یک تسک سختِ برنامهنویسی به یک مسئله مهندسی پرامپت (Prompt Engineering) — هنر سؤال درست پرسیدن برای گرفتن بهترین جواب — تبدیل کرده است. این تغییر اجازه میدهد تا تاکسونومیهای پویا و تعمیم صفر-شات (Zero-shot) ایجاد شوند. اما همانطور که در تحلیل قبلی ما دربارهی توکنسازی و بصریسازی آن اشاره کردیم، حجم بالای توکنها در پنجرههای متنی بزرگ میتواند بودجههای عملیاتی را بهسرعت تخلیه کند.
طبق یک راهنمای فنی که در ۲۶ سپتامبر ۲۰۲۶ منتشر شد، Oxlo.ai با دریافت یک هزینه ثابت بهازای هر درخواست، فارغ از طول ورودی، این مشکل را حل کرده است. این رویکرد که در تحلیل ما درباره کاهش هزینههای استنتاج چتباتها بررسی شد، به توسعهدهندگان اجازه میدهد دستورالعملهای سیستمی مفصل و نمونههای متعدد (Few-shot) را بدون نگرانی از شمارنده توکنها اضافه کنند. بر اساس بررسی منابع، این رویکرد برای حجمهای کاری با متن طولانی، میتواند ۱۰ تا ۱۰۰ برابر ارزانتر از ارائهدهندگانی مثل Together AI، Fireworks AI، OpenRouter، Replicate یا Anyscale باشد.
منطق مسیریابی و زمینه
تشخیص قصد، نقطه تصمیمگیری اصلی در سامانههای عاملمحور (Agentic) است. چه در حال ساخت یک دستیار صوتی باشید و چه یک عامل پژوهشی خودکار، اولین تصمیم حیاتیترین است. مدلهای زبانی میتوانند درخواستهای مبهم یا ترکیبی را تحلیل کنند که در خط لولههای سنتی NLU باعث شکست سیستم میشد.
این قابلیت در تحلیلهای با زمینه طولانی حیاتی است؛ زیرا قصد کاربر بهندرت در یک جمله خلاصه میشود. برای مثال، یک تیکت پشتیبانی ممکن است شامل رشتهای از ۲۰ پیام باشد. وقتی کاربر میگوید «آن را لغو کن»، مدل ممکن است به ۵ دقیقه از تاریخچه گفتگو نیاز داشته باشد تا بفهمد «آن» به یک سفر اشاره دارد یا رزرو رستوران.
پیادهسازی فنی و مجموعه مدلها
این پلتفرم برای تضمین خروجیهای قطعی در سیستمهای تولیدی، از حالت JSON استفاده میکند. این کار مدل را مجبور میکند خروجی را در قالب یک ساختار مشخص، شامل امتیاز اطمینان تایپشده، موجودیتهای شناساییشده و مسیر اقدام بعدی برگرداند. API این سرویس جایگزینی مستقیم برای SDK شرکت OpenAI است و توسعهدهندگان میتوانند بدون تغییر در کد کلاینت، نقطه اتصال خود را به https://api.oxlo.ai/v1 تغییر دهند.
مثال پیادهسازی با استفاده از OpenAI SDK:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_OXLO_API_KEY",
base_url="https://api.oxlo.ai/v1"
)
response = client.chat.completions.create(
model="llama-3.3-70b",
messages=[
{
"role": "system",
"content": (
"You are an intent classification engine. "
"Analyze the user message and return a JSON object with fields: "
"intent (string), confidence (float 0-1), entities (list of objects), "
"and next_action (string)."
)
},
{
"role": "user",
"content": "I need to reschedule my flight to Tokyo for next Tuesday."
}
],
response_format={"type": "json_object"},
temperature=0.1
)
Oxlo.ai بیش از ۴۵ مدل را در هفت دسته مختلف میزبانی میکند تا پیچیدگیهای مختلف تشخیص قصد را پوشش دهد، بهطوری که هیچکدام دچار راهاندازی سرد (Cold Start) نمیشوند:
- Llama 3.3 70B: پرچمدار همهمنظوره برای طبقهبندی سریع و قابلاعتماد در دامنههای رایج.
- Qwen 3 32B: بهینهشده برای استدلالهای چندزبانه و جریانهای کاری که مرزهای قصد در آنها از نظر فرهنگی ظریف است.
- DeepSeek R1 671B MoE: طراحیشده برای استدلال عمیق و کدنویسی پیچیده؛ مناسب برای منطقهای تودرتو، مانند فیلتر کردن فاکتورهای بالای ۵۰۰ دلار از یک فصل خاص و خروجی گرفتن از آنها.
- DeepSeek V4 Flash: یک مدل MoE کارآمد با پنجره متنی (Context Window) — میزان متنی که مدل همزمان در ذهن نگه میدارد، شبیه میز کاری که جا برای چند ورق دارد — یک میلیون توکنی. ایدهآل برای طبقهبندی قصد در کل یک سند طولانی یا ترنسکریپتهای طولانی جلسات در یک مرحله.
- Kimi K2.6: پشتیبانی از زمینه ۱۳۱ هزار توکنی و تشخیص قصد چندوجهی (Multimodal) از طریق اسکرینشات یا نمودار در کنار متن.
از تشخیص تا اجرا
تشخیص قصد تنها گام اول است؛ سیستم باید منطقهای بعدی را فعال کند. این پلتفرم از فراخوانی تابع (Function Calling) و استفاده از ابزار پشتیبانی میکند تا مرحله طبقهبندی بتواند بلافاصله APIها را فراخوانی کند، پایگاهداده را جستوجو کند یا درخواست را به عاملهای تخصصی منتقل کند. ترکیب حالت JSON برای تجزیه و فراخوانی تابع برای اجرا، یک مسیریاب عامل کاملاً تایپشده ایجاد میکند.
همچنین امکان پاسخهای جریانی (Streaming) فراهم است. اگر تشخیص قصد بخشی از یک زنجیره بزرگتر است، توسعهدهندگان میتوانند نتایج جزئی را برای کاهش تأخیر perceived (ادراکشده) به کاربر نمایش دهند در حالی که مدل در حال نهایی کردن طبقهبندی خود است.
زیرساخت و ملاحظات هزینه
برای سیستمهای با حجم درخواست بالا، این تغییر در قیمتگذاری نحوه ساخت مهندسی را عوض میکند. در پلتفرمهای توکنمحور، مهندسان اغلب مجبورند زمینه را حذف کنند، تاریخچه را کوتاه کنند یا لایههای پیچیده بازیابی مبتنی بر بردار معنایی (Embedding) — مثل کارت معرفی عددی برای هر واژه که همسایگی آن با کلمات دیگر را میگوید — بسازند تا هزینهها پیشبینیپذیر بماند. این بهینهسازیها پیچیدگی را زیاد و دقت را کم میکند.
Oxlo.ai با تخت کردن منحنی هزینه، به تیمها اجازه میدهد دقت را بر اقتصاد توکن ترجیح دهند و تاریخچه کامل گفتگوها را برای رفع ابهام درخواستهای کاربر حفظ کنند. این امر اصطکاک ناشی از نظارت بر شمارنده توکنها در طول حجمهای کاری عاملمحور با متن طولانی را از بین میبرد.
توسعهدهندگان در حال حاضر میتوانند از سطح رایگان با ۶۰ درخواست در روز برای بیش از ۱۶ مدل رایگان استفاده کنند، که شامل یک دوره آزمایشی ۷ روزه با دسترسی کامل است. پلنهای پولی از Pro تا Enterprise، شامل گزینههای GPU اختصاصی، در آدرس https://oxlo.ai/pricing در دسترس است.
گام بعدی شما
- اگر از OpenAI SDK استفاده میکنید،
base_urlخود را به Oxlo تغییر دهید تا هزینه لایه مسیریابی را تست کنید. - برای اسناد طولانی، مدل DeepSeek V4 Flash را جایگزین مدلهای کوچکتر کنید تا دقت تشخیص قصد را بسنجید.
- ساختار خروجی JSON را برای اتوماسیون مستقیم فراخوانی توابع در سیستم خود پیاده کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو