اگر امروز برای دیجیتالی کردن اسناد قانونی در زبانهای غیرانگلیسی هزینه میکنید، احتمالاً با نرخ خطای بالایی روبرو هستید که معنای جملات را تغییر میدهد. اما حالا یک مدل بهینهشده میتواند این خطاها را در زبان مالایالام به شدت کاهش دهد.
دستیابی به صحت ۸۵ درصدی در استخراج دادههای ساختاریافته از PDFهای مالایالام، نقطه عطفی برای ابزارهای نویسهخوانی نوری (OCR) — شبیه به چشمهای مصنوعی که متنهای چاپشده را میخوانند و به کد تبدیل میکنند — است. این نتیجه بر سوگیری سیستماتیک ابزارهای هوش مصنوعی که معمولاً زبانهای انگلیسی و هندی را ترجیح میدهند، غلبه میکند. سازمانها اکنون میتوانند اسناد پیچیده را بهجای تکیه بر APIهای ابری گرانقیمت یا ریسکهای حریم خصوصی، روی سختافزارهای معمولی اجرا کنند.
سالهاست که شکاف دیجیتال باعث شده کاربران زبان مالایالام در مناطقی مثل کرالا برای پردازش خودکار اسناد دچار مشکل شوند. اکثر موتورهای OCR، خطوط پیوسته و ترکیبات پیچیده این زبان را بهعنوان «نویز» شناسایی میکنند، که این امر مانعی جدی برای پردازش سوابق دولتی، قراردادهای حقوقی و مطالب آموزشی ایجاد کرده است. همانطور که در تحلیلهای قبلی ما دربارهی عدالت در دسترسی به مدلهای زبانی اشاره کردیم، این نقص فنی صرفاً یک مشکل کدنویسی نیست، بلکه مانعی برای شمولیت دیجیتال است که بهطور نامتناسبی بر مناطقی که مالایالام در آنها رایج است تأثیر میگذارد. نبود راهکارهای قدرتمند، ناکارآمدیها را تشدید کرده و دسترسی به اطلاعات ضروری را محدود میکند، که این امر نیاز مبرم به یک مداخله هدفمند را برجسته میسازد. این توسعه به عنوان یک مداخله هدفمند برای تضمین شمولیت زبانی در عصر هوش مصنوعی ارائه شده است.
تصور کنید در یک قرارداد حقوقی، هوش مصنوعی یک علامت کوچک را اشتباه تشخیص دهد و کل معنای جمله عوض شود. این واقعیت تلخ برای اکثر کاربران مالایالام تا به امروز بود. با انتقال پردازش به سختافزار محلی، کاربران علاوه بر حذف تأخیر و هزینههای ابری، از مدلی بهره میبرند که دقیقاً برای ظرافتهای خط «آبوگیدا» (Abugida) تنظیم شده است. پردازش محلی وابستگی به APIهای مبتنی بر ابر را از بین میبرد و ریسکهای مرتبط با حریم خصوصی دادهها، تأخیر شبکه و هزینههای تکرارشونده را کاهش میدهد.
مانع فنی: پیچیدگی خط
به نقل از گزارشی که در ۱ اکتبر ۲۰۲۶ در dev.to منتشر شد، چالش اصلی، گلیفهای وابسته در زبان مالایالام است. خط مالایالام که از نوع آبوگیدا است، با ماهیت پیوسته و ترکیبات متنی (ligatures) شناخته میشود که چالشهای قابلتوجهی برای موتورهای OCR ایجاد میکند. وابستگی متقابل کاراکترها و استفاده گسترده از علائم دیاکریتیک، الگوریتمهای بخشبندی سنتی را مختل میکند و منجر به شناسایی اشتباه یا تکهتکه شدن کلمات میشود.
ابزارهای سنتی مثل Tesseract اغلب در بخشبندی کاراکترها شکست میخورند و صحت آنها در اسناد اسکنشده مالایالام تنها ۷۰ درصد است. مدلهایی که عمدتاً روی خطوط لاتین یا دواناگاری آموزش دیدهاند، تخصص زبانی لازم برای مدیریت این پیچیدگیها را ندارند. بدون چنین مدلی، سازمانها و افرادی که به پردازش اسناد چندزبانه متکی هستند، همچنان با نقص در دقت و گلوگاههای عملیاتی روبرو خواهند بود.
برخی از رایجترین حالتهای شکست عبارتاند از:
- اشتباه گرفتن کاراکترهای محو، مثل «ണ» (ṇa) و «ന» (na) به دلیل همپوشانی خطوط.
- تبدیل علامتهای کوچک (diacritics) مانند «ൈ» به نویز پسزمینه در اسکنهای با کیفیت پایین، که بازسازی آنها را نیازمند آستانهگذاری تطبیقی (adaptive thresholding) میکند.
- عدم تراز درست سرتیترهای جدول وقتی متن بیش از ۲۰ درجه کج باشد؛ در حالی که LayoutLM میتواند کجیهای ۱۰ تا ۱۵ درجه را اصلاح کند، اما زوایای بیش از ۲۰ درجه باعث عدم تراز بحرانی میشود.
راهکار: LayoutLM و دادههای مصنوعی
برای پر کردن شکاف دادهای، توسعهدهندگان از مدل LayoutLM در کنار تقویت دادههای مصنوعی استفاده کردند. از آنجایی که مجموعهدادههای برچسبدار مالایالام در مقایسه با انگلیسی یا هندی بسیار کمیاب هستند، تیم سازنده مجموعههای مصنوعی تولید کرد تا مدل را با تغییرات خط آشنا کند. این کمبود دادهها، رویکردهای نوآورانهای مانند یادگیری انتقالی (transfer learning) یا تولید دادههای مصنوعی را ضروری میکند تا شکاف بین زبانهای کممنبع و زبانهایی با مجموعهدادههای عظیم پر شود. این چالش در ترجمه تخصصی نیز دیده میشود، جایی که استراتژیهای جدیدی برای جایگزینی نگاشتهای سنتی با تکمیل متن برای افزایش دقت در زبانهای پیچیده به کار گرفته شده است.
این رویکرد باعث شد تا تنظیم دقیق (Fine-tuning) — شبیه به وقتی که به یک پزشک عمومی، تخصص پوست میدهیم تا در یک حوزه دقیق شود — نتایج درخشانی داشته باشد:
- افزایش صحت OCR از ۷۰ درصد (Tesseract) به ۸۵ درصد از طریق توانمندسازی مدل برای تعمیم در تغییرات خط.
- رسیدن صحت استخراج ساختاریافته (خروجی JSON) به ۹۰ درصد برای انگلیسی و هندی.
- رسیدن صحت استخراج مالایالام به ۷۵ درصد (که هنوز در جداول با سلولهای ادغامشده به دلیل مسائل توکنسازی ترکیبات خطی مشکل دارد).
جزئیات استخراج ساختاریافته
استخراج اطلاعات ساختاریافته نیازمند تحلیل چیدمانهای پیچیده است، مانند اسناد چندستونی و جداولی با سلولهای ادغامشده. ارزیابیها روی توانایی مدل در تولید فرمت JSON متمرکز بود، نه صرفاً متن خام، تا فیلدها و جداول خاص استخراج شوند. عدم حفظ یکپارچگی ساختاری — برای مثال، جابجایی سرتیترهای جدول — بهطور بحرانی ارزیابی شد، زیرا مستقیماً کاربرد نهایی دادهها در مراحل بعدی را مختل میکند.
- سلولهای ادغامشده: توجه شبکهای (grid-based attention) مدل LayoutLM توانست ۹۰ درصد سرتیترهای ادغامشده در انگلیسی/هندی را شناسایی کند، اما این عدد در مالایالام ۷۵ درصد بود. این موضوع به دلیل دادههای آموزشی ناکافی برای جداول با ترکیبات خطی سنگین است، جایی که مدلها به دلیل توکنسازی نامناسب، سرتیترهای ادغامشده را به اشتباه به عنوان ردیفهای مجزا تفسیر میکنند.
- همپوشانی ستونها: در حالی که ستونهای هندی و انگلیسی به صحت ۹۵ درصدی رسیدند، ستونهای مالایالام به دلیل فاصله بیشتر گلیفها اغلب همپوشانی داشتند. این مشکل از طریق پردازش تکمیلی با تشخیص کانتور (contour detection) برای جداسازی جریانهای متنی حل شد.
- اختلال در ترکیبات: ترکیبات خطی مثل «ക്ക» (kka) اغلب مرزهای توکنسازی (Tokenization) — یعنی تکهتکه کردن متن برای بلعیدن توسط مدل — را به هم میزنند و یکپارچگی ساختاری دادههای استخراجشده را مختل میکنند.
بهینهسازی برای سختافزار محلی
اجرای مدلهای ترنسفورمر معمولاً به حافظه VRAM عظیمی نیاز دارد، اما این پیادهسازی برای سختافزارهای معمولی مثل CPU اینتل i5 با ۸ گیگابایت رم هدفگذاری شده است. یک مدل محلی باید عملکرد خود را در این محدودیتها بهینه کند و از طریق معماریهای سبک و متدهای آموزشی آگاه به منابع، بین بهرهوری محاسباتی و دقت تعادل برقرار کند. در همین راستا، بهینهسازیهای مربوط به نمایش و ذخیرهسازی دادههای بصری اهمیت مییابد، مشابه آنچه در مدل NeoMME برای کاهش چشمگیر هزینه ذخیرهسازی بردارها مشاهده شد.
تیم توسعه برای جلوگیری از کرش کردن سیستم و داغ شدن بیش از حد (Thermal Throttling)، که پیش از این پس از پردازش ۱۰ صفحه رخ میداد، چندین بهینهسازی سختافزاری اعمال کرد. این کار شامل بهرهگیری از تکنیکهایی مانند کوانتایزیشن مدل، تقطیر دانش (knowledge distillation) و بهینهسازیهای سختافزاری بود.
اقدامات کلیدی برای افزایش بهرهوری عبارتاند از:
- کوانتایزیشن INT8: تبدیل وزنها از FP32 به INT8 مصرف حافظه را ۵۰ درصد کاهش داد، در حالی که افت صحت کمتر از ۱ درصد بود. این فرآیند اندازه مدل را با تبدیل وزنها به فرمتهای با دقت پایینتر کاهش میدهد اما برای جلوگیری از افت دقت، نیاز به تنظیم دقیق دارد.
- پردازش دستهای: پردازش چهار صفحه در هر دسته، تأخیر استنتاج (Inference) — یعنی لحظهای که مدل واقعاً جواب تولید میکند — را ۴۰ درصد کم کرد.
- آستانه اطمینان: پیشبینیهایی با احتمال کمتر از ۰.۷ حذف شدند تا توهم (Hallucination) — وقتی مدل با اطمینان چیزی میگوید که وجود ندارد — که ناشی از دادههای آموزشی مصنوعی است، تا ۳۰ درصد کاهش یابد.
- اندازه دسته پویا: این قابلیت از کرش کردن سیستم جلوگیری کرد، هرچند تأخیر را ۱۵ درصد افزایش داد.
با این حال، شکاف عملکردی همچنان وجود دارد. پردازش یک صفحه مالایالام حدود ۱۲ ثانیه زمان میبرد، در حالی که برای انگلیسی این زمان ۴ ثانیه است؛ زیرا گلیفهای پیچیده مالایالام به توکنهای سه برابری نسبت به انگلیسی نیاز دارند که باعث فشار به رم موجود میشود.
مقابله با کمبود داده
اگرچه دادههای مصنوعی نقطه شروع خوبی بودند، اما تنوع دنیای واقعی (مثل یادداشتهای دستنویس) را نداشتند. طبق گزارشها، تنظیم دقیق مدل روی تنها ۱۰۰۰ صفحه برچسبگذاریشده توسط انسان، صحت را ۵ درصد دیگر افزایش داد.
برخی شکستها همچنان پابرجاست؛ مثلاً اصلاحگر reph (്) در ۲۰ درصد موارد اشتباه شناسایی میشود. این موضوع باعث اختلال در مرزهای کلمات در خروجی ساختاریافته نهایی میشود و نیاز مبرم به مجموعهدادههای متنباز و سازمانیافته مالایالام را برای جایگزینی راهکارهای موقت مصنوعی برجسته میکند. کمبود مجموعهدادههای برچسبدار مالایالام بهشدت توسعه مدل را مختل میکند، زیرا این زبان فاقد مجموعهدادههای عظیمی است که برای هندی و انگلیسی در دسترس است.
تحلیل راهبردی
چرخش به سمت مدلهای محلی و زبانمحور، معیارهای هوش مصنوعی اسناد را تغییر میدهد. این تجربه ثابت میکند برای حل مشکلات پیچیده زبانی، نیازی به مدلهای ابری با تریلیونها پارامتر نیست؛ بلکه دادههای هدفمند و باکیفیت و کوانتایزیشن کلید موفقیتاند. عدم توجه به این شکاف، ریسک عمیقتر شدن نابرابری در دسترسی به دانش و خدمات را در دوران تحول دیجیتال که در تمام بخشها شتاب گرفته است، افزایش میدهد.
برای کاربر نهایی، این به معنای گذار از دیجیتالسازی «تقریبی» به اتوماسیون «قابلاعتماد» است. این رویکرد وابستگی به قیمتگذاری APIهای غولهای فناوری و برداشت دادهها را حذف کرده و حاکمیت زبانی را به مناطق کممنبع بازمیگرداند و عدم تقارن اطلاعاتی را در مناطقی مثل کرالا کاهش میدهد. اسناد حیاتی — سوابق دولتی، قراردادهای حقوقی و مطالب آموزشی — در نهایت میتوانند برای پردازش خودکار در دسترس قرار گیرند.
مسیر پیش رو
برای رسیدن به صحت ۹۵ درصد یا بالاتر، گام بعدی توسعه الگوریتمهای OCR است که بهطور خاص برای خطوط آبوگیدا طراحی شده باشند، نه صرفاً تطبیق مدلهای لاتینمحور. این امر نیازمند یک رویکرد چندرشتهای است که درک عمیق از بخشبندی کاراکترها را با بهینهسازی سختافزاری ترکیب کند. از نظر فنی، این کار مستلزم درک نحوه شکست الگوریتمهای بخشبندی در برابر پیچیدگی خط و تأثیر کمبود داده بر همگرایی مدل است. این رویکرد چندوجهی به ساختارهای پیچیدهتری شبیه به استکهای چندوجهی در ترجمه رباتیک زنده شباهت دارد که در آن چندین لایه پردازشی برای رسیدن به دقت لحظهای با هم ترکیب میشوند.
نسخههای آینده ممکن است از موارد زیر بهره ببرند:
- معماریهای مبتنی بر MobileNet: بهینهشده برای استقرار محلی جهت کاهش بیشتر تأخیر ۱۲ ثانیهای هر صفحه از طریق ایجاد تعادل بین دقت و بهرهوری محاسباتی.
- یادگیری انتقالی بینزبانی: بهرهگیری از مدلهای پیشآموزشدیده روی هندی و انگلیسی برای ارتقای عملکرد مالایالام با استفاده از شباهتهای زبانی و ویژگیهای مشترک خط (مثلاً دواناگاری برای هندی).
- مجموعهدادههای متنباز: توسعه مجموعهدادههای مالایالام سازمانیافته برای حل مشکل بنیادی کمبود داده و تضمین دسترسی در کاربردهای متنوع.
کاربرانی که به دنبال پیادهسازی این مدل هستند باید اولویت را بر جمعآوری حداقل ۱۰۰۰ صفحه واقعی برای تنظیم دقیق بگذارند و از انتقال پردازش به GPU در دستگاههای میانرده به دلیل ناسازگاری درایورها و احتمال افت عملکرد پرهیز کنند. برای افزایش استحکام مدل، کاربران باید از آستانهگذاری تطبیقی برای بازسازی علامتهای تکهتکه شده در اسکنهای با کیفیت پایین استفاده کرده و نرمالسازی هندسی را برای متون کج بیش از ۲۰ درجه اجرا کنند.
اما داستان بهینهسازی مدلهای کوچک برای زبانهای محلی تازه شروع شده است؛ در تحلیل بعدی ما درباره مدلهای SLM و جایگزینی آنها با LLMها در محیطهای سازمانی، این موضوع را بازتر خواهیم کرد.




گفتگو