پرش به محتوای اصلی
پرش به محتوای مقاله

اتوماسیون طبقه‌بندی اسناد در Oxlo.ai بدون نیاز به زیرساخت محلی و بردار معنایی

·۳۱ تیر ۱۴۰۵۵ دقیقه مطالعه۱ بازدید
راهنما
مدل زبانی بزرگ برای مدل‌سازی موضوع: کاربردها و روش‌ها
مدل زبانی بزرگ برای مدل‌سازی موضوع: کاربردها و روش‌ها
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از مدل‌های مختلف (Multi-model) برای تفکیک مرحله «ساخت ساختار» از «طبقه‌بندی انبوه» در یک خط لوله بدون نیاز به زیرساخت Vector DB.

تصور کنید مدیر محصولی هستید که با هزاران تیکت پشتیبانی نامنظم دست‌وپنجه نرم می‌کند و می‌خواهد در چند ثانیه بفهمد دقیقاً چه مشکلی برای کاربران تکرار شده است. اگر هنوز از جستجوی کلمات کلیدی یا ابزارهای پیچیده آماری استفاده می‌کنید، باید بدانید که یک خط لوله (Pipeline) ساده پایتونی می‌تواند این آشفتگی را به یک بایگانی دیجیتال منظم تبدیل کند. این سیستم در واقع یک گردش کار پنج‌مرحله‌ای است که تیکت‌های خام پشتیبانی را بدون نیاز به هیچ‌گونه استک محلی برای جاسازی (Embedding) یا استنتاج (Inference)، به یک تاکسونومی موضوعی ساختاریافته تبدیل می‌کند.

به نقل از راهنمای منتشرشده در ۲۱ ژوئیه ۲۰۲۶ در وب‌سایت dev.to، این رویکرد [Zero-shot] — یا همان یادگیری بدون نمونه — جایگزین روش‌های سنتی مثل استخراج دستی کلمات کلیدی یا تنظیم دشوار و پیچیده ابرپارامترهای مدل‌های LDA شده است. این رویکرد از طریق ارکستراسیون مستقیم مدل‌های زبانی بزرگ (LLM) به واسطه پلتفرم Oxlo.ai عملیاتی می‌شود. برای راه‌اندازی این سیستم، تنها به نسخه ۳.۱۰ یا جدیدتر پایتون، کتابخانه‌های pandas و openai و یک کلید API از پورتال portal.oxlo.ai نیاز دارید.

همان‌طور که در پوشش پیشین ما از قابلیت‌های Oxlo.ai در اتوماسیون قطعه‌بندی تصاویر دیدیم، این پلتفرم اکنون کارایی مشابه API-driven را به پردازش زبان طبیعی (NLP) آورده است. این پیشرفت در زمانی رخ می‌دهد که سازمان‌ها برای عبور از جستجوهای ساده مبتنی بر کلمه کلیدی و رسیدن به درک معنایی (Semantic Understanding) واقعی از نقاط درد مشتریان در تلاش هستند. برای یک کاربر غیرمتخصص یا مدیر محصول، این فرآیند شبیه جابجایی از یک توده نامنظم از یادداشت‌های چسبان به یک فایلباکس دیجیتال است که هر برگه در جای درست خود قرار دارد.

معماری خط لوله

فرآیند با مقداردهی اولیه یک کلاینت سازگار با OpenAI آغاز می‌شود که به نقطه انتهایی (Endpoint) Oxlo.ai از طریق آدرس base_url="https://api.oxlo.ai/v1" متصل است. توسعه‌دهنده مجموعه‌ای از اسناد خام — مانند تیکت‌های پشتیبانی مشتریان — را بارگذاری کرده و با استفاده از یک پرامپت سیستمی (System Prompt) خاص، مدل را مجبور می‌کند تا خروجی‌ها را دقیقاً در قالب JSON برگرداند. این استراتژی نیاز به استفاده از ابزارهای شکننده و متغیر regex برای تجزیه (Parsing) متن را کاملاً از بین می‌برد.

برای ایجاد تاکسونومی یا همان ساختار طبقه‌بندی اولیه، خط لوله زیرمجموعه‌ای از اسناد را به مدل Llama 3.3 70B ارسال می‌کند. این مدل وظیفه شناسایی تم‌های محوری را بر عهده دارد و یک شیء JSON تولید می‌کند که شامل چهار جزء اصلی است: یک شناسه موضوع (Topic ID)، یک نام کوتاه (بین ۲ تا ۴ کلمه)، یک شرح تک‌جمله‌ای و لیستی شامل ۳ تا ۵ کلمه کلیدی مرتبط.

جزئیات پیاده‌سازی

طبق مستندات این پروژه، تبدیل متن خام به بینش‌های ساختاریافته طی مراحل مکانیکی و دقیق زیر رخ می‌دهد:

  • تولید تاکسونومی: سیستم ابتدا ۶ سند نخست را به مدل ارسال می‌کند. یک SYSTEM_PROMPT تخصصی به هوش مصنوعی دستور می‌دهد تا در نقش یک تحلیل‌گر مدل‌سازی موضوعات (Topic Modeling Analyst) عمل کرده و یک شیء JSON با کلید topics خروجی دهد.
  • طبقه‌بندی اسناد: سیستم از یک LABEL_PROMPT استفاده می‌کند که به مدل دستور می‌دهد در نقش یک طبقه‌بند اسناد (Document Classifier) عمل کند. در این مرحله، هر سند با بلوک تاکسونومی تولیدشده در مرحله قبل جفت می‌شود تا اطمینان حاصل شود که برچسب‌گذاری‌ها با ساختار اولیه کاملاً سازگار هستند.
  • پردازش داده‌ها: هر تیکت دقیقاً به یک موضوع اختصاص می‌یابد. مدل در خروجی خود یک topic_id و یک امتیاز اطمینان (Confidence Score) را برمی‌گرداند که مقداری بین ۰.۰ تا ۱.۰ دارد.
  • تحلیل فراوانی: خط لوله با استفاده از یک جدول محوری (Pivot) در pandas، شناسه‌ها را دوباره به نام‌های موضوعی نگاشت کرده و عملیات value_counts() را برای یافتن رایج‌ترین مشکلات کاربران اجرا می‌کند.

انتخاب مدل و استنتاج

پس از تثبیت ساختار تاکسونومی، سیستم وارد فاز طبقه‌بندی انبوه (Bulk Classification) می‌شود. نویسنده این راهنما برای این گام از مدل DeepSeek V3.2 استفاده کرده است؛ چرا که این مدل به دلیل بهره‌وری بالا و در دسترس بودن در سطح رایگان (Free Tier) پلتفرم Oxlo.ai، هزینه‌های عملیاتی را به شدت کاهش می‌دهد. در این مرحله، هر سند در برابر تاکسونومی تولیدشده مقایسه شده و یک شناسه موضوعی واحد به همراه امتیاز اطمینان بین ۰.۰ و ۱.۰ دریافت می‌کند.

برای پاسخ به نیازهای متنوع، این خط لوله امکان تعویض مدل‌ها را بر اساس نوع مجموعه داده فراهم می‌کند:

  • Qwen 3 32B: برای مجموعه‌های متنی (Corpora) که نیازمند پشتیبانی قوی‌تر از زبان‌های مختلف (Multilingual) هستند، توصیه می‌شود.
  • Kimi K2.6: گزینه ترجیحی برای پردازش اسنادی است که طول آن‌ها به طور قابل توجهی زیاد است و باید توسط طبقه‌بند پردازش شوند.
  • Llama 3.3 70B: به عنوان یک پیش‌فرض قدرتمند برای ایجاد ساختار اولیه به زبان انگلیسی عمل می‌کند.

تجمیع داده‌ها و ساختار هزینه‌ای

نتایج نهایی با استفاده از یک جدول محوری pandas تجمیع می‌شوند تا شمارش فراوانی موضوعات به دست آید. خروجی این فرآیند، یک نگاشت شفاف از هر تیکت به دسته‌بندی شناسایی شده است؛ دسته‌بندی‌هایی نظیر «مشکلات صورت‌حساب» (Billing Issues)، «کرش‌های برنامه» (App Crashes)، «درخواست‌های ویژگی جدید» (Feature Requests)، «دسترسی به حساب» (Account Access)، «سوالات قیمت‌گذاری» (Pricing Questions)، «محدودیت‌های نرخ API» (API Rate Limits)، یا «رابط کاربری و تم‌ها» (UI and Themes).

به عنوان مثال، تیکتی که درباره «خطای ۵۰۰ پس از فعال‌سازی تأیید دو مرحله‌ای» است یا تیکتی در مورد «عدم دریافت ایمیل بازیابی رمز عبور»، هر دو به دسته‌بندی «دسترسی به حساب» نگاشت می‌شوند. این امر به سیستم اجازه می‌دهد تا روند (Trend) ایجاد شده را شناسایی کند؛ مثلاً تشخیص دهد که برای این دسته ۲ تیکت وجود دارد در حالی که برای دسته‌های دیگر تنها ۱ تیکت ثبت شده است.

نکته کلیدی و حیاتی در زیرساخت این سیستم، مدل قیمت‌گذاری تخت (Flat-rate) است. برخلاف ارائه‌دهندگان مبتنی بر توکن (Token-based) — که متن را به قطعات کوچک تقسیم کرده و هزینه می‌گیرند — Oxlo.ai هزینه را به ازای هر درخواست (Request) محاسبه می‌کند. این رویکرد که پیش‌تر در گزارشات ما درباره کاهش هزینه‌های گردش کار رسانه‌ای مورد بررسی قرار گرفت، بدان معناست که پرامپت‌های طولانی — مانند مواردی که شامل کل تاکسونومی و تیکت‌های پشتیبانی حجیم هستند — برخلاف پلتفرم‌های سنتی، باعث تورم صورت‌حساب نمی‌شوند. جزئیات برنامه‌های فعلی در آدرس oxlo.ai/pricing در دسترس است.

تحلیل تحریریه

این گذار به سمت مدل‌سازی موضوعی «API-first»، نقش متخصص را از یک دانشمند داده که در حال تنظیم وزن‌ها (Weights) است، به یک ارکستراتور تبدیل می‌کند که در حال بهینه‌سازی پرامپت‌هاست. با جداسازی مرحله تولید تاکسونومی از مرحله طبقه‌بندی، توسعه‌دهندگان می‌توانند پیش از اعمال دسته‌ها بر روی هزاران ردیف داده، «منطق» دسته‌بندی‌های خود را بازرسی و اصلاح کنند.

برای یک توسعه‌دهنده معمولی، بزرگترین دستاورد، حذف بار زیرساختی محلی است. دیگر نیازی به مدیریت خوشه‌های GPU یا دیتابیس‌های برداری (Vector Databases) برای خوشه‌بندی‌های ساده نیست؛ زیرا LLM به طور همزمان نقش مدل جاسازی (Embedding)، خوشه‌بند (Clusterer) و برچسب‌زن (Labeler) را ایفا می‌کند. این موضوع سد ورود برای تحلیل لحظه‌ای احساسات مشتریان (Sentiment Analysis) در شرکت‌های کوچک و متوسط را به شدت کاهش می‌دهد.

برای مقیاس‌پذیری بیشتر، این خط لوله می‌تواند به یک Cron Job یا یک DAG در Airflow متصل شود. این کار به کسب‌وکارها اجازه می‌دهد تا تیکت‌های جدید را به محض ورود به طور خودکار برچسب‌گذاری کنند و یک داشبورد زنده از مشکلات نوظهور محصول ایجاد نمایند. با ذخیره اسکریپت به نام topic_model.py و صادر کردن کلید API در متغیرهای محیطی (Environment Variables)، کل فرآیند از دریافت داده تا تجمیع نهایی در کمتر از پنجاه خط کد پایتون انجام می‌شود.

گام بعدی شما

  • اگر با حجم زیادی از بازخوردهای متنی روبرو هستید، ابتدا یک نمونه کوچک (۶ سند) را برای استخراج موضوعات به Llama 3.3 70B بدهید.
  • برای کاهش هزینه در مقیاس بالا، از DeepSeek V3.2 برای مرحله برچسب‌گذاری انبوه استفاده کنید.
  • این اسکریپت را به یک Cron Job متصل کنید تا داشبورد مشکلات محصول شما به صورت زنده به‌روز شود.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است؛ برای درک اینکه چگونه این مدل‌ها روی سخت‌افزارهای بهینه اجرا می‌شوند، به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد سد ورود به تحلیل احساسات مشتری را برای کسب‌وکارهای کوچک می‌شکند. تکیه بر اعتبار مدل‌های زبانی برای استخراج ساختار، جایگزین روش‌های پیچیده ریاضی مانند LDA شده است.

تأثیر برای ایران

به دلیل مدل قیمت‌گذاری بر اساس درخواست به جای توکن، این ابزار برای توسعه‌دهندگان ایرانی که با متون طولانی سروکار دارند به‌صرفه‌تر است؛ هرچند دسترسی به API همچنان نیازمند ابزارهای دور زدن محدودیت‌های جغرافیایی است.

·نگاه ما
تحریریه دات‌هوش

حذف نیاز به ایجاد بردار معنایی (Embedding) و دیتابیس‌های برداری برای کارهای ساده مثل خوشه‌بندی، نقطه عطف جدیدی در توسعه محصول است. با این روش، LLM هم‌زمان نقش بردارساز، خوشه‌بند و برچسب‌زن را ایفا می‌کند و نقش توسعه‌دهنده را از یک دانشمند داده که وزن‌ها را تنظیم می‌کند به یک ارکستراتور تبدیل می‌کند که تنها پرامپت‌ها را بهینه می‌سازد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.