پرش به محتوای اصلی
پرش به محتوای مقاله

معماری ترکیبی NLP: کاهش هزینه با ارجاع وظایف ساده به spaCy

·۲ شهریور ۱۴۰۵۴ دقیقه مطالعه۱ بازدید
راهنما
مقایسه مدل‌های زبانی بزرگ با روش‌های سنتی پردازش زبان طبیعی
مقایسه مدل‌های زبانی بزرگ با روش‌های سنتی پردازش زبان طبیعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی یک لایه مسیریابی دوگانه که به‌جای استفاده از LLM برای طبقه‌بندی، از ترکیب Regex و مدل‌های کوچک محلی برای حذف ترافیک ساده استفاده می‌کند.

اگر برای هر تیکت پشتیبانی ساده، هزینه استنتاج یک مدل عظیم را می‌پردازید، در واقع دارید از یک تبر برای بریدن کاغذ استفاده می‌کنید. یک سامانه مسیریابی ترکیبی با استفاده از spaCy و Oxlo.ai این تضاد را حل می‌کند تا منطق‌های پایه به‌صورت محلی فیلتر شوند و تنها موارد دشوار به مدل‌های زبانی ارجاع یابند.

این رویکرد با اطمینان از اینکه موارد بدیهی فوراً روی دستگاه پردازش می‌شوند، هزینه‌های غیرضروری را حذف کرده و فراخوانی‌های API را فقط به محتواهای مبهم یا طولانی محدود می‌کند. همان‌طور که در تحلیل قبلی ما درباره‌ی نقص‌های ساختاری معماری مدل‌های زبانی اشاره کردیم، تکیه مطلق بر مدل‌های احتمالی برای کارهای قطعی، ریسک عملیاتی ایجاد می‌کند؛ بنابراین این الگو بر نیاز به مسیریابی قطعی (Deterministic Routing) تأکید دارد.

در بسیاری از محیط‌های عملیاتی، استفاده از یک مدل غول‌پیکر برای هر درخواست، یک بدهی مالی است. طبق گزارشی که در ۲۴ اوت ۲۰۲۶ منتشر شد، یک اسکنر ساده‌ی کلمات کلیدی اغلب می‌تواند جایگزین مدلی با میلیاردها پارامتر برای تریاژ اولیه شود.

ساختار و معماری

بر اساس مستندات این راهنما، معماری سیستم از دو لایه مجزا تشکیل شده است. لایه اول، یک لایه NLP سنتی است که از مدل en_core_web_sm در spaCy — شبیه به یک فیلتر سریع که فقط کلمات کلیدی و ساختارهای مشخص را می‌شناسد — برای استخراج موجودیت‌های نام‌دار و یک اسکنر فوریت مبتنی بر Regex استفاده می‌کند. این لایه کاملاً روی ماشین محلی اجرا می‌شود و سرعتی بی‌رقیب برای وظایف محدود دارد.

این خط لوله محلی برای سرعت و بهره‌وری هزینه طراحی شده است. سیستم از مجموعه‌ای از الگوهای فوریت (URGENCY_PATTERNS) برای جست‌وجوی کلماتی مثل «فوری»، «همین حالا»، «قطعی» و «بحرانی» استفاده می‌کند. اگر تیکتی شامل دو یا چند مورد از این کلمات باشد، بدون نیاز به API خارجی، فوراً به‌عنوان «فوری» علامت‌گذاری می‌شود. این رویکرد ترکیبی از قوانین سخت‌گیرانه و مدل‌های هوشمند، مشابه راهکاری است که برای خودکارسازی بازبینی کد با ترکیب قوانین متنی و Diff به کار می‌رود تا دقت عملیاتی افزایش یابد.

زمانی که لایه محلی سیگنال‌های متناقض تشخیص دهد، یا تعداد کلمات از ۱۰۰ مورد بیشتر شود، درخواست به لایه دوم ارجاع داده می‌شود. این لایه استدلالی از API شرکت Oxlo.ai و به‌طور مشخص مدل llama-3.3-70b استفاده می‌کند تا بتواند طعنه، متن‌های طولانی یا تیکت‌های چندمنظوره را تحلیل کند.

جزئیات پیاده‌سازی فنی

  • لایه محلی: از spaCy برای بازشناسی موجودیت‌ها و Regex سفارشی استفاده می‌کند و یک حدس دسته‌بندی (category_guess) و امتیاز فوریت برمی‌گرداند.
  • لایه مدل زبانی: از یک پرامپت سیستمی (System Prompt) سخت‌گیرانه در قالب JSON استفاده می‌کند تا خروجی‌ها قابل تجزیه باشند. مدل باید کلیدهای مشخصی مثل دسته‌بندی، فوریت، تحلیل احساسات، موجودیت‌ها و یک پیش‌نویس پاسخ زیر ۵۰ کلمه را برگرداند.
  • منطق مسیریابی: اگر دسته‌بندی «نامشخص» باشد، بیش از سه موجودیت شناسایی شود، امتیاز فوریت صفر باشد یا طول متن از ۱۰۰ کلمه بیشتر شود، مدل زبانی فعال می‌شود.
  • مدل هزینه: این سیستم از قیمت‌گذاری ثابت به‌ازای هر درخواست در Oxlo.ai بهره می‌برد. این موضوع از جهش هزینه‌ها هنگام پردازش شکایت‌های طولانی — مثلاً یک متن ۲۰۰۰ کلمه‌ای — که در سیستم‌های توکن‌محور جریمه می‌شوند، جلوگیری می‌کند. برای مدیریت بهینه این لایه‌ها، ابزارهایی مانند Routara می‌توانند اتصال به چندین ارائه‌دهنده LLM را در یک نقطه متمرکز کنند تا انعطاف‌پذیری زیرساخت افزایش یابد.

این تغییر در رویکرد، صنعت را از ذهنیت «مدل زبانی برای همه چیز» دور می‌کند. با تبدیل هوش مصنوعی زاینده (Generative AI) — مثل متخصصی گران‌قیمت که فقط برای پرونده‌های سخت فراخوانده می‌شود — به جای یک کارگر عمومی، توسعه‌دهندگان می‌توانند زیرساخت خود را بدون افزایش خطی هزینه‌ها مقیاس کنند.

برای کاربر نهایی، این یعنی پاسخ سریع‌تر برای پرسش‌های ساده و استدلال باکیفیت‌تر برای مشکلات پیچیده. در واقع یک معماری «سیستم ۱» (سریع و شهودی) و «سیستم ۲» (کند و تحلیلی) برای اتوماسیون پشتیبانی ایجاد شده است. برای مثال، تیکت «سرور قطع است. بحرانی. فوری» توسط لایه سنتی مدیریت می‌شود، اما شکایتی درباره اختلافات مالی و عملکرد داشبورد به مدل زبانی ارجاع می‌یابد.

توسعه‌دهندگان می‌توانند با افزودن آستانه‌های اطمینان، تیکت‌های بحرانی و عصبانی را مستقیماً به انسان‌ها ارجاع دهند. همچنین، جایگزینی مدل با deepseek-r1-671b یا qwen-3-32b در همان پلتفرم، امکان استدلال عمیق‌تر در عیب‌یابی‌های چندمرحله‌ای را بدون تغییر در منطق مسیریابی فراهم می‌کند.

برای پیاده‌سازی این سیستم به پایتون ۳.۱۰ یا جدیدتر، بسته‌های openai ،spacy و scikit-learn و یک کلید API از پورتال Oxlo نیاز دارید. مراحل نصب شامل دریافت مدل en_core_web_sm و تعریف متغیر محیطی OXLO_API_KEY است.

گام بعدی شما

  • بررسی کنید کدام بخش از ترافیک ورودی شما «بدیهی» است و با Regex یا spaCy آن را از چرخه LLM خارج کنید.
  • برای کاهش هزینه‌ها، از مدل‌های با قیمت ثابت (Flat-rate) به‌جای مدل‌های توکن‌محور برای متون طولانی استفاده کنید.
  • یک لایه تایید انسانی (Human-in-the-loop) برای تیکت‌هایی با امتیاز احساسی «عصبانی» تعریف کنید.

اما بهینه‌سازی هزینه تنها نیمی از مسیر است؛ برای درک اینکه چگونه مدل‌های کوچک‌تر در محیط‌های محلی عملکرد مدل‌های غول‌پیکر را شبیه‌سازی می‌کنند، به تحلیل ما درباره مدل‌های SLM مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد با تکیه بر تخصص NLP سنتی، وابستگی خطرناک شرکت‌ها به APIهای گران‌قیمت را کاهش می‌دهد. در نتیجه، هزینه عملیاتی اتوماسیون پشتیبانی از رشد خطی به رشد لگاریتمی تغییر می‌کند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت بودجه ارزی برای APIها مواجه‌اند، انتقال بخش بزرگی از پردازش به لایه‌های محلی (Local) تنها راه مقیاس‌پذیر کردن سرویس‌های هوشمند است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی مدل‌های زبانی با منطق‌های قطعی در لایه‌های اولیه، نشان‌دهنده پایان دوران «تست و خطا» با پرامپت‌های پیچیده برای کارهای ساده است. این معماری در واقع مدل زبانی را از جایگاه «موتور اصلی» به جایگاه «متخصص سطح ۲» تنزل می‌دهد که باعث می‌شود پایداری سیستم در مقیاس بالا به‌شدت افزایش یابد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.