پرش به محتوای اصلی
پرش به محتوای مقاله

قیمت‌گذاری ثابت در برابر توکنی؛ راهکاری برای ارسال تاریخچه کامل گفتگو

·۵ مهر ۱۴۰۵۵ دقیقه مطالعه
راهنما
دیدگاه آکسلو در استفاده از مدل‌های زبانی بزرگ برای تشخیص قصد کاربر
دیدگاه آکسلو در استفاده از مدل‌های زبانی بزرگ برای تشخیص قصد کاربر
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی کامل مدل پرداخت توکنی با هزینه ثابت به‌ازای هر درخواست در لایه تشخیص قصد؛ این یعنی طول پرامپت دیگر تأثیری بر صورت‌حساب نهایی ندارد.

اگر امروز برای هر توکن در لایه مسیریابی عامل‌های خود هزینه می‌دهید، احتمالاً بخش بزرگی از بودجه شما صرف متونی می‌شود که مدل برای فهمیدن یک دستور ساده به آن‌ها نیاز دارد. Oxlo.ai با حذف جریمه مالی برای ارسال متون طولانی، بازی را برای توسعه‌دهندگان تغییر داده است.

در محیط‌های عملیاتی، تشخیص قصد (Intent Detection) — یعنی همان لایه‌ای که تعیین می‌کند کاربر واقعاً چه می‌خواهد — معمولاً با هر توکن اضافه‌شده به پرامپت گران‌تر می‌شود. درک زبان طبیعی (NLU) سنتی نیازمند مجموعه‌های آموزشی سخت‌گیرانه، ثبات در برچسب‌گذاری و بازآموزی مداوم هرگاه قصد جدیدی ظاهر شود بود. هوش مصنوعی زاینده (Generative AI) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — این فرآیند را معکوس کرده و آن را از یک تسک سختِ برنامه‌نویسی به یک مسئله مهندسی پرامپت (Prompt Engineering) — هنر سؤال درست پرسیدن برای گرفتن بهترین جواب — تبدیل کرده است. این تغییر اجازه می‌دهد تا تاکسونومی‌های پویا و تعمیم صفر-شات (Zero-shot) ایجاد شوند. اما همان‌طور که در تحلیل قبلی ما درباره‌ی توکن‌سازی و بصری‌سازی آن اشاره کردیم، حجم بالای توکن‌ها در پنجره‌های متنی بزرگ می‌تواند بودجه‌های عملیاتی را به‌سرعت تخلیه کند.

طبق یک راهنمای فنی که در ۲۶ سپتامبر ۲۰۲۶ منتشر شد، Oxlo.ai با دریافت یک هزینه ثابت به‌ازای هر درخواست، فارغ از طول ورودی، این مشکل را حل کرده است. این رویکرد که در تحلیل ما درباره کاهش هزینه‌های استنتاج چت‌بات‌ها بررسی شد، به توسعه‌دهندگان اجازه می‌دهد دستورالعمل‌های سیستمی مفصل و نمونه‌های متعدد (Few-shot) را بدون نگرانی از شمارنده توکن‌ها اضافه کنند. بر اساس بررسی منابع، این رویکرد برای حجم‌های کاری با متن طولانی، می‌تواند ۱۰ تا ۱۰۰ برابر ارزان‌تر از ارائه‌دهندگانی مثل Together AI، Fireworks AI، OpenRouter، Replicate یا Anyscale باشد.

منطق مسیریابی و زمینه

تشخیص قصد، نقطه تصمیم‌گیری اصلی در سامانه‌های عامل‌محور (Agentic) است. چه در حال ساخت یک دستیار صوتی باشید و چه یک عامل پژوهشی خودکار، اولین تصمیم حیاتی‌ترین است. مدل‌های زبانی می‌توانند درخواست‌های مبهم یا ترکیبی را تحلیل کنند که در خط لوله‌های سنتی NLU باعث شکست سیستم می‌شد.

این قابلیت در تحلیل‌های با زمینه طولانی حیاتی است؛ زیرا قصد کاربر به‌ندرت در یک جمله خلاصه می‌شود. برای مثال، یک تیکت پشتیبانی ممکن است شامل رشته‌ای از ۲۰ پیام باشد. وقتی کاربر می‌گوید «آن را لغو کن»، مدل ممکن است به ۵ دقیقه از تاریخچه گفتگو نیاز داشته باشد تا بفهمد «آن» به یک سفر اشاره دارد یا رزرو رستوران.

پیاده‌سازی فنی و مجموعه مدل‌ها

این پلتفرم برای تضمین خروجی‌های قطعی در سیستم‌های تولیدی، از حالت JSON استفاده می‌کند. این کار مدل را مجبور می‌کند خروجی را در قالب یک ساختار مشخص، شامل امتیاز اطمینان تایپ‌شده، موجودیت‌های شناسایی‌شده و مسیر اقدام بعدی برگرداند. API این سرویس جایگزینی مستقیم برای SDK شرکت OpenAI است و توسعه‌دهندگان می‌توانند بدون تغییر در کد کلاینت، نقطه اتصال خود را به https://api.oxlo.ai/v1 تغییر دهند.

مثال پیاده‌سازی با استفاده از OpenAI SDK:

from openai import OpenAI
client = OpenAI(
    api_key="YOUR_OXLO_API_KEY",
    base_url="https://api.oxlo.ai/v1"
)
response = client.chat.completions.create(
    model="llama-3.3-70b",
    messages=[
        {
            "role": "system",
            "content": (
                "You are an intent classification engine. "
                "Analyze the user message and return a JSON object with fields: "
                "intent (string), confidence (float 0-1), entities (list of objects), "
                "and next_action (string)."
            )
        },
        {
            "role": "user",
            "content": "I need to reschedule my flight to Tokyo for next Tuesday."
        }
    ],
    response_format={"type": "json_object"},
    temperature=0.1
)

Oxlo.ai بیش از ۴۵ مدل را در هفت دسته مختلف میزبانی می‌کند تا پیچیدگی‌های مختلف تشخیص قصد را پوشش دهد، به‌طوری که هیچ‌کدام دچار راه‌اندازی سرد (Cold Start) نمی‌شوند:

  • Llama 3.3 70B: پرچم‌دار همه‌منظوره برای طبقه‌بندی سریع و قابل‌اعتماد در دامنه‌های رایج.
  • Qwen 3 32B: بهینه‌شده برای استدلال‌های چندزبانه و جریان‌های کاری که مرزهای قصد در آن‌ها از نظر فرهنگی ظریف است.
  • DeepSeek R1 671B MoE: طراحی‌شده برای استدلال عمیق و کدنویسی پیچیده؛ مناسب برای منطق‌های تودرتو، مانند فیلتر کردن فاکتورهای بالای ۵۰۰ دلار از یک فصل خاص و خروجی گرفتن از آن‌ها.
  • DeepSeek V4 Flash: یک مدل MoE کارآمد با پنجره متنی (Context Window) — میزان متنی که مدل هم‌زمان در ذهن نگه می‌دارد، شبیه میز کاری که جا برای چند ورق دارد — یک میلیون توکنی. ایده‌آل برای طبقه‌بندی قصد در کل یک سند طولانی یا ترنسکریپت‌های طولانی جلسات در یک مرحله.
  • Kimi K2.6: پشتیبانی از زمینه ۱۳۱ هزار توکنی و تشخیص قصد چندوجهی (Multimodal) از طریق اسکرین‌شات یا نمودار در کنار متن.

از تشخیص تا اجرا

تشخیص قصد تنها گام اول است؛ سیستم باید منطق‌های بعدی را فعال کند. این پلتفرم از فراخوانی تابع (Function Calling) و استفاده از ابزار پشتیبانی می‌کند تا مرحله طبقه‌بندی بتواند بلافاصله APIها را فراخوانی کند، پایگاه‌داده را جست‌وجو کند یا درخواست را به عامل‌های تخصصی منتقل کند. ترکیب حالت JSON برای تجزیه و فراخوانی تابع برای اجرا، یک مسیریاب عامل کاملاً تایپ‌شده ایجاد می‌کند.

همچنین امکان پاسخ‌های جریانی (Streaming) فراهم است. اگر تشخیص قصد بخشی از یک زنجیره بزرگ‌تر است، توسعه‌دهندگان می‌توانند نتایج جزئی را برای کاهش تأخیر perceived (ادراک‌شده) به کاربر نمایش دهند در حالی که مدل در حال نهایی کردن طبقه‌بندی خود است.

زیرساخت و ملاحظات هزینه

برای سیستم‌های با حجم درخواست بالا، این تغییر در قیمت‌گذاری نحوه ساخت مهندسی را عوض می‌کند. در پلتفرم‌های توکن‌محور، مهندسان اغلب مجبورند زمینه را حذف کنند، تاریخچه را کوتاه کنند یا لایه‌های پیچیده بازیابی مبتنی بر بردار معنایی (Embedding) — مثل کارت معرفی عددی برای هر واژه که همسایگی آن با کلمات دیگر را می‌گوید — بسازند تا هزینه‌ها پیش‌بینی‌پذیر بماند. این بهینه‌سازی‌ها پیچیدگی را زیاد و دقت را کم می‌کند.

Oxlo.ai با تخت کردن منحنی هزینه، به تیم‌ها اجازه می‌دهد دقت را بر اقتصاد توکن ترجیح دهند و تاریخچه کامل گفتگوها را برای رفع ابهام درخواست‌های کاربر حفظ کنند. این امر اصطکاک ناشی از نظارت بر شمارنده توکن‌ها در طول حجم‌های کاری عامل‌محور با متن طولانی را از بین می‌برد.

توسعه‌دهندگان در حال حاضر می‌توانند از سطح رایگان با ۶۰ درخواست در روز برای بیش از ۱۶ مدل رایگان استفاده کنند، که شامل یک دوره آزمایشی ۷ روزه با دسترسی کامل است. پلن‌های پولی از Pro تا Enterprise، شامل گزینه‌های GPU اختصاصی، در آدرس https://oxlo.ai/pricing در دسترس است.

گام بعدی شما

  • اگر از OpenAI SDK استفاده می‌کنید، base_url خود را به Oxlo تغییر دهید تا هزینه لایه مسیریابی را تست کنید.
  • برای اسناد طولانی، مدل DeepSeek V4 Flash را جایگزین مدل‌های کوچک‌تر کنید تا دقت تشخیص قصد را بسنجید.
  • ساختار خروجی JSON را برای اتوماسیون مستقیم فراخوانی توابع در سیستم خود پیاده کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل قیمت‌گذاری با حذف وابستگی هزینه به طول متن، مانع مالی توسعه سامانه‌های عامل‌محور با حافظه بلندمدت را برمی‌دارد. اعتبار این تغییر در کاهش چشمگیر هزینه عملیاتی برای سازمان‌هایی است که با متون حجیم سر و کار دارند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم به این سرویس برای توسعه‌دهندگان ایرانی دشوار است، اما مدل قیمت‌گذاری آن الگویی برای ارائه‌دهندگان داخلی مدل‌های زبانی است تا هزینه‌های استنتاج را پیش‌بینی‌پذیر کنند.

·نگاه ما
تحریریه دات‌هوش

تغییر مدل درآمدی از توکن به درخواست، در واقع اعترافی به این است که در لایه‌های مسیریابی (Routing)، مقدار توکن‌ها معیار درستی برای ارزش افزوده نیست. این رویکرد احتمالاً باعث می‌شود توسعه‌دهندگان دوباره به سمت پرامپت‌های غنی‌تر و مفصل‌تر برگردند و وابستگی به لایه‌های پیچیده RAG برای کارهای ساده‌تر کاهش یابد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.