پرش به محتوای اصلی
پرش به محتوای مقاله

گزارش Oxlo.ai: قیمت‌گذاری بر اساس درخواست، جایگزینی بهینه برای توکن‌ها

·۲۱ شهریور ۱۴۰۵۳ دقیقه مطالعه۲ بازدید
نقش مدل‌های زبانی بزرگ در خدمات مشتریان
نقش مدل‌های زبانی بزرگ در خدمات مشتریان
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر پارادایم پرداخت از «تعداد توکن» به «تعداد درخواست» در سرویس‌های استنتاج؛ این یعنی طول متن ورودی دیگر تأثیری بر هزینه نهایی ندارد.

اگر امروز برای استنتاج مدل‌های زبانی هزینه می‌پردازید، احتمالاً متوجه شده‌اید که هرچه گفتگو طولانی‌تر می‌شود، صورت‌حساب شما به‌صورت تصاعدی رشد می‌کند. Oxlo.ai با معرفی یک مدل قیمت‌گذاری تخت (Flat-rate)، این «مالیات زمینه» را حذف کرده و هزینه استنتاج در گردش‌های کاری پشتیبانی را بین ۱۰ تا ۱۰۰ برابر کاهش داده است.

این تغییر رویکرد دقیقاً همان نقطه‌ای است که بسیاری از کسب‌وکارها در استقرار عامل‌های هوش مصنوعی شکست می‌خورند: افزایش خطی هزینه‌ها هم‌زمان با رشد تاریخچه گفتگوها و حجم اسناد ارسالی به مدل. همان‌طور که در تحلیل قبلی ما درباره‌ی تعمیم‌پذیری تغییرات در عامل‌های هوش مصنوعی اشاره کردیم، پایداری زیرساخت و هزینه استنتاج (Inference) — که شبیه به کرایه یک آشپزخانه صنعتی است و هرچه دستور پخت سنگین‌تر باشد، هزینه هر وعده بیشتر می‌شود — اکنون به اهمیتی بیشتر از تعداد پارامترهای مدل تبدیل شده است. این رویکرد در راستای تلاش‌های پیشین این شرکت برای بهینه‌سازی هزینه‌هاست که پیش‌تر در گزارش ما درباره کاهش هزینه‌های عملیاتی از طریق کاتالوگ مدل یکپارچه Oxlo.ai بررسی شده بود.

به گزارش وب‌سایت dev.to در تاریخ ۱۱ سپتامبر ۲۰۲۶، زیرساخت‌های عملیاتی اکنون به سمت الگوی تولید بازیابی‌افزا (RAG) — شبیه به دانش‌آموزی که قبل از جواب دادن، اول کتاب درسی را باز می‌کند و از آن نقل می‌آورد — هم‌گرا شده‌اند. این معماری بر سه رکن اصلی استوار است:

  • مدل‌های بردار معنایی (Embedding Models): ابزارهایی مثل BGE-Large که مقالات مرکز کمک را فهرست‌بندی می‌کنند — مثل کارت معرفی عددی برای هر واژه که همسایگی آن با کلمات دیگر را مشخص می‌کند.
  • فراخوانی تابع (Function Calling): اجازه می‌دهد مدل برای جلوگیری از توهم (Hallucination) — وقتی مدل با اطمینان چیزی می‌گوید که وجود ندارد — داده‌های لحظه‌ای را از CRM استخراج کند.
  • خروجی ساختاریافته (Structured Output): استفاده از حالت JSON برای اطمینان از اینکه سیستم‌های بک‌اند می‌توانند به‌روزرسانی‌های تیکت را به‌درستی بخوانند.

طبق مستندات Oxlo.ai، توسعه‌دهندگان اکنون می‌توانند بدون بازنویسی URL پایه، بین مدل‌های Qwen 3 32B برای استدلال‌های چندزبانه یا Llama 3.3 70B جابه‌جا شوند. این انعطاف‌پذیری با حذف مشکل «راه‌اندازی سرد» (Cold Start) همراه شده است تا تأخیر در چت‌های لحظه‌ای به حداقل برسد. این قابلیت مدیریت مدل‌های متنوع، مکمل راهکارهای تخصصی شرکت در حوزه‌های زبانی است که در تحلیل ما پیرامون رویکرد جدید Oxlo.ai در مدیریت اصطلاحات برای ترجمه‌های آماده تولید به آن پرداخته بودیم.

این چرخش در مدل مالی، اقتصاد عامل‌های هوش مصنوعی را تغییر می‌دهد. وقتی هزینه با طول ورودی رشد نمی‌کند، برنامه‌نویسان دیگر مجبور نیستند برای صرفه‌جویی در هزینه، تاریخچه گفتگوها را کوتاه کنند یا اسناد بازیابی‌شده را ببُرند. این یعنی زمینه غنی‌تر و پاسخ‌های دقیق‌تر در جلسات چندمرحله‌ای.

برای یک کسب‌وکار معمولی، این به معنای حذف محدودیت‌های بودجه‌ای در مقابل قابلیت‌های استدلالی مدل است. اکنون می‌توان یک رشته ایمیل طولانی و یک دفترچه راهنمای کامل را بدون نگرانی از تورم صورت‌حساب، به پرامپت ارسال کرد.

گام بعدی شما

  • هزینه‌های فعلی توکنی خود را بررسی کنید تا بفهمید چه مقدار از آن صرف زمینه (Context) ضروری شده و چه مقدار حاصل مهندسی پرامپت ناکارآمد است.
  • امکان مهاجرت به مدل‌های Request-based را برای کاهش هزینه‌های عملیاتی (OpEx) در مقیاس بالا بسنجید.
  • تأثیر حذف محدودیت طول متن بر نرخ حل مسئله (Resolution Rate) در عامل‌های پشتیبانی خود را آزمایش کنید.

اما واکنش سایر ارائه‌دهندگان استنتاج به این مدل قیمت‌گذاری می‌تواند کل صنعت را به سمت هزینه‌های پیش‌بینی‌پذیر و اشتراکی سوق دهد — به تحلیل ما درباره‌ی رقابت در بازار Inference مراجعه کنید.

چرا این موضوع مهم است؟

این مدل قیمت‌گذاری با حذف وابستگی هزینه به طول متن، مانع اصلی مقیاس‌پذیری عامل‌های هوش مصنوعی در سازمان‌های بزرگ را برمی‌دارد. اعتبار این رویکرد در کاهش چشمگیر OpEx برای شرکت‌هایی است که با حجم بالای داده‌های متنی در پشتیبانی سر و کار دارند.

تأثیر برای ایران

به‌دلیل محدودیت‌های پرداخت ارزی و دسترسی به APIهای خارجی، استفاده از این مدل برای توسعه‌دهندگان ایرانی دشوار است، اما الگوی قیمت‌گذاری آن می‌تواند برای ارائه‌دهندگان داخلی مدل‌های زبانی در ایران به عنوان یک استراتژی رقابتی الگو شود.

·نگاه ما
تحریریه دات‌هوش

جایگزینی توکن با درخواست، در واقع انتقال ریسک محاسباتی از دوش توسعه‌دهنده به دوش ارائه‌دهنده است. این حرکت نشان می‌دهد که بهینه‌سازی‌های سخت‌افزاری در لایه استنتاج به حدی رسیده که ارائه‌دهندگان می‌توانند هزینه‌های متغیر را در یک قیمت تخت جذب کنند. این تغییر احتمالاً منجر به ظهور نسل جدیدی از عامل‌های «پرخور» می‌شود که برای دقت بیشتر، حجم عظیمی از داده را در هر درخواست ارسال می‌کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.