پرش به محتوای اصلی
پرش به محتوای مقاله

chinese-nlp-mcp پردازش محلی متون چینی را به عامل‌های هوش مصنوعی آورد

·۱۹ مهر ۱۴۰۵۵ دقیقه مطالعه
راهنما
افزودن پردازش زبان چینی به عامل هوش مصنوعی در ۵ دقیقه
افزودن پردازش زبان چینی به عامل هوش مصنوعی در ۵ دقیقه
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

پیاده‌سازی قابلیت‌های NLP تخصصی زبان چینی در قالب یک سرور MCP محلی؛ این یعنی برای اولین بار، دقت ابزارهای سنتی NLP بدون خروج داده از دستگاه، در دسترس عامل‌های هوشمند قرار گرفته است.

تصور کنید برنامه‌نویسی هستید که می‌خواهد یک عامل هوشمند برای تحلیل بازخوردهای مشتریان چینی بسازد، اما متوجه می‌شود مدل زبانی‌اش در تشخیص دقیق مرز کلمات شکست می‌خورد. شکاف عمیقی میان توانایی یک مدل زبانی بزرگ (LLM) در گفتگو به زبان چینی و توانایی آن در مدیریت لایه‌ی مکانیکی پردازش زبان طبیعی (NLP) — مانند قطعه‌بندی دقیق کلمات و استخراج کلمات کلیدی وزن‌دار — وجود دارد. برای پر کردن این شکاف، ابزار chinese-nlp-mcp در ۱۱ اکتبر ۲۰۲۶ منتشر شد تا پردازش متنی محلی برای زبان‌های چینی را برای عامل‌های هوش مصنوعی در دسترس قرار دهد.

شکاف مکانیکی

زبان چینی چالشی منحصربه‌فرد دارد؛ چون برخلاف انگلیسی، بین کلمات هیچ فاصله‌ای وجود ندارد. برای مثال، عبارتی مانند "我喜欢北京天安门" باید با دقت جراحی شود؛ اگر قطعه‌بندی (Segmentation) اشتباه باشد، تمام فرآیندهای پایین‌دستی با شکست مواجه می‌شوند. در چنین حالتی، استخراج‌کننده‌های کلمات کلیدی تنها قطعات ناقص را برمی‌گردانند، شاخص‌های جست‌وجو تطابق‌ها را پیدا نمی‌کنند و تولیدکننده‌های لینک (Slug generators) خروجی‌های بی‌معنی و نامفهوم تولید می‌کنند.

مدل‌های زبانی بزرگ معمولاً در این فرآیند حدس می‌زنند. وقتی از آن‌ها خواسته می‌شود یک پاراگراف را تقسیم کنند، نتایجی تولید می‌کنند که شاید پذیرفتنی به نظر برسد، اما به‌ندرت با توکن‌ساز (Tokenizer) خاصی که در استک فنی یک توسعه‌دهنده استفاده شده، مطابقت دارد. به همین ترتیب، اگرچه آن‌ها معمولاً در تبدیل نام‌ها به پین‌یین (Pinyin) برای مرتب‌سازی درست عمل می‌کنند، اما خطاهای گاه‌به‌گاه آن‌ها شناسایی سخت‌تری نسبت به خطاهای سیستماتیک و ثابت دارد. این چالش‌ها نشان می‌دهد که چرا رویکردهای ساده‌ی ترجمه در بات‌های چندزبانه اغلب با شکست مواجه می‌شوند و نیاز به مسیریابی‌های تخصصی برای هر زبان وجود دارد.

همان‌طور که در تحلیل قبلی ما درباره‌ی اینکه چگونه دسترسی به ابزارها می‌تواند منجر به نشت داده‌های خصوصی شود اشاره کردیم، این انتشار یک شکاف امنیتی حیاتی را برطرف می‌کند. در حال حاضر اکثر توسعه‌دهندگان برای این وظایف به APIهای ابری متکی هستند، به این معنی که هر سند پردازش شده باید ماشین محلی را ترک کند. با انتقال این عملیات به داخل فرآیند (In-process)، توسعه‌دهنده هم هزینه فراخوانی API و هم تأخیر ناشی از رفت‌وبرگشت‌های شبکه را حذف می‌کند. این بهینه‌سازی در زمان پاسخ‌دهی، یادآور تکنیک‌های کاهش تأخیر در استنتاج مدل‌هاست که هدفشان حفظ کیفیت در عین افزایش سرعت است.

طبق گزارش dev.to، سرور chinese-nlp-mcp چهار ابزار اصلی را از طریق stdio ارائه می‌دهد. این ابزارها از کتابخانه‌های تثبیت‌شده‌ای بهره می‌برند تا ثباتی را تضمین کنند که مدل‌های زبانی به تنهایی قادر به ارائه آن نیستند:

جزئیات ابزارها

  • segment_chinese: این ابزار از قطعه‌بندی jieba با حالت‌های پیش‌فرض، جست‌وجو (Search) و نمایه (Index) استفاده می‌کند. این ابزار برای به‌دست آوردن آفست‌ها (Offsets) به جای صرفاً شناسایی موضوعات ضروری است. نکته مهم این است که jieba علائم نگارشی را به عنوان توکن‌های مجزا حفظ می‌کند.
  • convert_pinyin: برای رومی‌سازی (Romanization) از کتابخانه pypinyin استفاده می‌کند. این ابزار از فرمت‌های tone ،tone2 ،initials و first_letter پشتیبانی می‌کند. یک جزئیات فنی این است که initials و first_letter برای هر کاراکتر اعمال می‌شوند (مثلاً "中国" به "zh g" و "z g" تبدیل می‌شود).
  • extract_keywords: استخراج TF-IDF را پیاده‌سازی می‌کند تا وزن‌های خام برای شناسایی تم‌ها و شکایات ارائه دهد. این وزن‌ها نرمال‌سازی نشده‌اند و در اسناد طولانی‌تر می‌توانند از ۱.۰ فراتر روند.
  • detect_sensitive_words: از الگوریتم Aho-Corasick برای اسکن متن در برابر یک لیست کلمات ارائه شده توسط کاربر جهت شناسایی سریع استفاده می‌کند.

علاوه بر این، سرور شامل یک ابزار hello_world برای بررسی سلامت (Health check) است که هرگز محدود (Throttle) نمی‌شود تا اطمینان حاصل شود که سرور هرگز خراب به نظر نمی‌رسد.

برای مثال، هنگام پردازش نظرات محصولات — مانند مواردی که از تأخیر در ارسال یا کیفیت پایین شکایت می‌کنند — یک مدل زبانی ممکن است فقط «حس کلی» (Vibe) متن را خلاصه کند، اما chinese-nlp-mcp به عامل اجازه می‌دهد تا تصمیمات مسیریابی را بر اساس اعداد بگیرد. در یک مورد تست، این ابزار کلمه "质量" (کیفیت: ۰.۶۱۰) و "发货" (ارسال: ۰.۵۳۶) را به عنوان تم‌های اصلی با استفاده از وزن‌های TF-IDF شناسایی کرد، در حالی که "退款" (استرداد وجه: ۰.۵۳۱) و "太慢" (خیلی کند: ۰.۵۱۰) به عنوان شکایات علامت‌گذاری شدند. این امر به عامل اجازه می‌دهد تا تیکت را به‌صورت برنامه‌ریزی‌شده دسته‌بندی کند، نه اینکه حدس بزند.

نصب این ابزار برای ویرایشگرهای مدرن هوش مصنوعی ساده شده است. کاربران می‌توانند سرور را از طریق uvx chinese-nlp-mcp یا pip install chinese-nlp-mcp مستقر کنند. این ابزار با Claude Desktop، Cursor و VS Code سازگار است و به پایتون ۳.۱۰ یا بالاتر نیاز دارد. همچنین در PyPI و رجیستری رسمی MCP با نام io.github.leonmch-byte/chinese-nlp-mcp در دسترس است.

یک مدل دسترسی لایه‌ای برای این نرم‌افزار وجود دارد. سطح رایگان، روزانه ۵۰۰ فراخوانی segment_chinese ،۳۰۰ فراخوانی convert_pinyin ،۱۰۰ فراخوانی extract_keywords و ۲۰۰ فراخوانی detect_sensitive_words را ارائه می‌دهد که در ساعت ۰۰:۰۰ UTC بازنشانی می‌شود. پرداخت یک‌باره ۱۹ دلاری برای نسخه Pro، این محدودیت‌ها را حذف کرده و قابلیت پردازش دسته‌ای (Batch processing) را برای حداکثر ۱۰۰ متن در هر فراخوانی اضافه می‌کند؛ این قابلیت برای پردازش مجموعه‌های بزرگ داده (Corpora) که در آن سربار هر فراخوانی می‌تواند غالب شود، ضروری است. نسخه Pro همچنین دیکشنری‌های سفارشی برای واژگان تخصصی دامنه و پشتیبانی اولویت‌دار را اضافه می‌کند.

از منظر حریم خصوصی، این ابزار بدون بررسی کلید لایسنس، تماس‌های شبکه یا تله‌متری (Telemetry) عمل می‌کند. بررسی به‌روزرسانی FastMCP در هنگام شروع غیرفعال است؛ کتابخانه‌های jieba، pypinyin و اتوماتون همگی در داخل فرآیند اجرا می‌شوند. شمارنده‌های روزانه در فایل‌های محلی سیستم ذخیره می‌شوند — مانند %LOCALAPPDATA% در ویندوز، ~/Library/Application Support در macOS یا $XDG_STATE_HOME در لینوکس — و برای جلوگیری از دستکاری‌های ساده، با HMAC-SHA256 امضا می‌شوند.

نویسنده اشاره می‌کند که این نرم‌افزار با لایسنس MIT، به‌طور کامل دارای حفاظت DRM نیست. اگرچه اتصال به دستگاه (Device binding) یک شناسه ماشین هش‌شده را ثبت کرده و پس از سه دستگاه هشدار می‌دهد، اما هرگز دسترسی را مسدود نمی‌کند، زیرا توسعه‌دهنده ترجیح می‌دهد مقدار کمی درآمد را از دست بدهد تا یک کاربر پرداخت‌کننده را محروم کند.

این تغییر، رویکرد ساخت عامل‌های چندزبانه را عوض می‌کند و NLP را از یک سرویس ابری به یک ابزار محلی تبدیل می‌کند. این امر به توسعه‌دهندگان اجازه می‌دهد تا معماری «صفر-نشت» (Zero-leak) را حفظ کنند و در عین حال از دقت کتابخانه‌های سنتی NLP مانند jieba بهره ببرند.

توسعه‌دهندگان اکنون باید جریان‌های کاری فعلی خود در زبان چینی را آزمایش کنند تا ببینند آیا قطعه‌بندی مبتنی بر LLM باعث از دست رفتن ایندکس‌ها یا تولید لینک‌های بی‌معنی می‌شود یا خیر. شما می‌توانید پیاده‌سازی کامل را در گیت‌هاب در آدرس leonmch-byte/chinese-nlp-mcp بیابید.

گام بعدی شما

  • اگر از عامل‌های هوشمند برای متون چینی استفاده می‌کنید، خروجی‌های قطعه‌بندی مدل را با یک کتابخانه استاندارد مقایسه کنید تا خطاهای احتمالی را بیابید.
  • برای کاهش هزینه‌های API و افزایش سرعت پاسخ‌دهی، ابزارهای پردازش متنی را به محیط محلی منتقل کنید.
  • مستندات کامل این پروژه را در گیت‌هاب leonmch-byte/chinese-nlp-mcp بررسی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با تکیه بر اعتبار کتابخانه‌های اثبات‌شده‌ای مثل jieba، خطای توهم در پردازش‌های ساختاری زبان چینی را حذف می‌کند. همچنین با حذف وابستگی به ابر، استانداردهای حریم خصوصی را برای سازمان‌های حساس ارتقا می‌دهد.

تأثیر برای ایران

این ابزار برای توسعه‌دهندگان ایرانی که روی تحلیل متون شرق آسیا کار می‌کنند، راهکاری رایگان و محلی برای حذف هزینه‌های ارزی APIهای ابری است.

·نگاه ما
تحریریه دات‌هوش

انتقال ابزارهای NLP سنتی به پروتکل MCP نشان می‌دهد که آینده‌ی عامل‌های هوشمند در ترکیب «استدلال مدل‌های زبانی» و «دقت ابزارهای قطعی» است. به نظر ما، تکیه صرف بر LLMها برای کارهای مکانیکی مثل توکن‌سازی، یک اشتباه استراتژیک است که منجر به ناپایداری سیستم‌های تولیدی می‌شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.