اگر برای هر تیکت پشتیبانی ساده، هزینه استنتاج یک مدل عظیم را میپردازید، در واقع دارید از یک تبر برای بریدن کاغذ استفاده میکنید. یک سامانه مسیریابی ترکیبی با استفاده از spaCy و Oxlo.ai این تضاد را حل میکند تا منطقهای پایه بهصورت محلی فیلتر شوند و تنها موارد دشوار به مدلهای زبانی ارجاع یابند.
این رویکرد با اطمینان از اینکه موارد بدیهی فوراً روی دستگاه پردازش میشوند، هزینههای غیرضروری را حذف کرده و فراخوانیهای API را فقط به محتواهای مبهم یا طولانی محدود میکند. همانطور که در تحلیل قبلی ما دربارهی نقصهای ساختاری معماری مدلهای زبانی اشاره کردیم، تکیه مطلق بر مدلهای احتمالی برای کارهای قطعی، ریسک عملیاتی ایجاد میکند؛ بنابراین این الگو بر نیاز به مسیریابی قطعی (Deterministic Routing) تأکید دارد.
در بسیاری از محیطهای عملیاتی، استفاده از یک مدل غولپیکر برای هر درخواست، یک بدهی مالی است. طبق گزارشی که در ۲۴ اوت ۲۰۲۶ منتشر شد، یک اسکنر سادهی کلمات کلیدی اغلب میتواند جایگزین مدلی با میلیاردها پارامتر برای تریاژ اولیه شود.
ساختار و معماری
بر اساس مستندات این راهنما، معماری سیستم از دو لایه مجزا تشکیل شده است. لایه اول، یک لایه NLP سنتی است که از مدل en_core_web_sm در spaCy — شبیه به یک فیلتر سریع که فقط کلمات کلیدی و ساختارهای مشخص را میشناسد — برای استخراج موجودیتهای نامدار و یک اسکنر فوریت مبتنی بر Regex استفاده میکند. این لایه کاملاً روی ماشین محلی اجرا میشود و سرعتی بیرقیب برای وظایف محدود دارد.
این خط لوله محلی برای سرعت و بهرهوری هزینه طراحی شده است. سیستم از مجموعهای از الگوهای فوریت (URGENCY_PATTERNS) برای جستوجوی کلماتی مثل «فوری»، «همین حالا»، «قطعی» و «بحرانی» استفاده میکند. اگر تیکتی شامل دو یا چند مورد از این کلمات باشد، بدون نیاز به API خارجی، فوراً بهعنوان «فوری» علامتگذاری میشود. این رویکرد ترکیبی از قوانین سختگیرانه و مدلهای هوشمند، مشابه راهکاری است که برای خودکارسازی بازبینی کد با ترکیب قوانین متنی و Diff به کار میرود تا دقت عملیاتی افزایش یابد.
زمانی که لایه محلی سیگنالهای متناقض تشخیص دهد، یا تعداد کلمات از ۱۰۰ مورد بیشتر شود، درخواست به لایه دوم ارجاع داده میشود. این لایه استدلالی از API شرکت Oxlo.ai و بهطور مشخص مدل llama-3.3-70b استفاده میکند تا بتواند طعنه، متنهای طولانی یا تیکتهای چندمنظوره را تحلیل کند.
جزئیات پیادهسازی فنی
- لایه محلی: از spaCy برای بازشناسی موجودیتها و Regex سفارشی استفاده میکند و یک حدس دستهبندی (
category_guess) و امتیاز فوریت برمیگرداند. - لایه مدل زبانی: از یک پرامپت سیستمی (System Prompt) سختگیرانه در قالب JSON استفاده میکند تا خروجیها قابل تجزیه باشند. مدل باید کلیدهای مشخصی مثل دستهبندی، فوریت، تحلیل احساسات، موجودیتها و یک پیشنویس پاسخ زیر ۵۰ کلمه را برگرداند.
- منطق مسیریابی: اگر دستهبندی «نامشخص» باشد، بیش از سه موجودیت شناسایی شود، امتیاز فوریت صفر باشد یا طول متن از ۱۰۰ کلمه بیشتر شود، مدل زبانی فعال میشود.
- مدل هزینه: این سیستم از قیمتگذاری ثابت بهازای هر درخواست در Oxlo.ai بهره میبرد. این موضوع از جهش هزینهها هنگام پردازش شکایتهای طولانی — مثلاً یک متن ۲۰۰۰ کلمهای — که در سیستمهای توکنمحور جریمه میشوند، جلوگیری میکند. برای مدیریت بهینه این لایهها، ابزارهایی مانند Routara میتوانند اتصال به چندین ارائهدهنده LLM را در یک نقطه متمرکز کنند تا انعطافپذیری زیرساخت افزایش یابد.
این تغییر در رویکرد، صنعت را از ذهنیت «مدل زبانی برای همه چیز» دور میکند. با تبدیل هوش مصنوعی زاینده (Generative AI) — مثل متخصصی گرانقیمت که فقط برای پروندههای سخت فراخوانده میشود — به جای یک کارگر عمومی، توسعهدهندگان میتوانند زیرساخت خود را بدون افزایش خطی هزینهها مقیاس کنند.
برای کاربر نهایی، این یعنی پاسخ سریعتر برای پرسشهای ساده و استدلال باکیفیتتر برای مشکلات پیچیده. در واقع یک معماری «سیستم ۱» (سریع و شهودی) و «سیستم ۲» (کند و تحلیلی) برای اتوماسیون پشتیبانی ایجاد شده است. برای مثال، تیکت «سرور قطع است. بحرانی. فوری» توسط لایه سنتی مدیریت میشود، اما شکایتی درباره اختلافات مالی و عملکرد داشبورد به مدل زبانی ارجاع مییابد.
توسعهدهندگان میتوانند با افزودن آستانههای اطمینان، تیکتهای بحرانی و عصبانی را مستقیماً به انسانها ارجاع دهند. همچنین، جایگزینی مدل با deepseek-r1-671b یا qwen-3-32b در همان پلتفرم، امکان استدلال عمیقتر در عیبیابیهای چندمرحلهای را بدون تغییر در منطق مسیریابی فراهم میکند.
برای پیادهسازی این سیستم به پایتون ۳.۱۰ یا جدیدتر، بستههای openai ،spacy و scikit-learn و یک کلید API از پورتال Oxlo نیاز دارید. مراحل نصب شامل دریافت مدل en_core_web_sm و تعریف متغیر محیطی OXLO_API_KEY است.
گام بعدی شما
- بررسی کنید کدام بخش از ترافیک ورودی شما «بدیهی» است و با Regex یا spaCy آن را از چرخه LLM خارج کنید.
- برای کاهش هزینهها، از مدلهای با قیمت ثابت (Flat-rate) بهجای مدلهای توکنمحور برای متون طولانی استفاده کنید.
- یک لایه تایید انسانی (Human-in-the-loop) برای تیکتهایی با امتیاز احساسی «عصبانی» تعریف کنید.
اما بهینهسازی هزینه تنها نیمی از مسیر است؛ برای درک اینکه چگونه مدلهای کوچکتر در محیطهای محلی عملکرد مدلهای غولپیکر را شبیهسازی میکنند، به تحلیل ما درباره مدلهای SLM مراجعه کنید.




گفتگو