پرش به محتوای اصلی
پرش به محتوای مقاله

«پر کردن شکاف OCR»؛ دستاورد جدید در استخراج داده‌های محلی

·۹ مهر ۱۴۰۵۱۰ دقیقه مطالعه
استخراج داده چندزبانه از PDF با هوش مصنوعی محلی: تمرکز بر زبان‌های مالایالام، هندی و انگلیسی
استخراج داده چندزبانه از PDF با هوش مصنوعی محلی: تمرکز بر زبان‌های مالایالام، هندی و انگلیسی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

دستیابی به صحت ۸۵ درصدی در استخراج داده‌های مالایالام روی سخت‌افزار معمولی (CPU) — در حالی که پیش از این مدل‌ها یا به ابری وابسته بودند یا در شناسایی خطوط پیوسته این زبان شکست می‌خوردند.

اگر امروز برای دیجیتالی کردن اسناد قانونی در زبان‌های غیرانگلیسی هزینه می‌کنید، احتمالاً با نرخ خطای بالایی روبرو هستید که معنای جملات را تغییر می‌دهد. اما حالا یک مدل بهینه‌شده می‌تواند این خطاها را در زبان مالایالام به شدت کاهش دهد.

دستیابی به صحت ۸۵ درصدی در استخراج داده‌های ساختاریافته از PDFهای مالایالام، نقطه عطفی برای ابزارهای نویسه‌خوانی نوری (OCR) — شبیه به چشم‌های مصنوعی که متن‌های چاپ‌شده را می‌خوانند و به کد تبدیل می‌کنند — است. این نتیجه بر سوگیری سیستماتیک ابزارهای هوش مصنوعی که معمولاً زبان‌های انگلیسی و هندی را ترجیح می‌دهند، غلبه می‌کند. سازمان‌ها اکنون می‌توانند اسناد پیچیده را به‌جای تکیه بر APIهای ابری گران‌قیمت یا ریسک‌های حریم خصوصی، روی سخت‌افزارهای معمولی اجرا کنند.

سال‌هاست که شکاف دیجیتال باعث شده کاربران زبان مالایالام در مناطقی مثل کرالا برای پردازش خودکار اسناد دچار مشکل شوند. اکثر موتورهای OCR، خطوط پیوسته و ترکیبات پیچیده این زبان را به‌عنوان «نویز» شناسایی می‌کنند، که این امر مانعی جدی برای پردازش سوابق دولتی، قراردادهای حقوقی و مطالب آموزشی ایجاد کرده است. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی عدالت در دسترسی به مدل‌های زبانی اشاره کردیم، این نقص فنی صرفاً یک مشکل کدنویسی نیست، بلکه مانعی برای شمولیت دیجیتال است که به‌طور نامتناسبی بر مناطقی که مالایالام در آن‌ها رایج است تأثیر می‌گذارد. نبود راهکارهای قدرتمند، ناکارآمدی‌ها را تشدید کرده و دسترسی به اطلاعات ضروری را محدود می‌کند، که این امر نیاز مبرم به یک مداخله هدفمند را برجسته می‌سازد. این توسعه به عنوان یک مداخله هدفمند برای تضمین شمولیت زبانی در عصر هوش مصنوعی ارائه شده است.

تصور کنید در یک قرارداد حقوقی، هوش مصنوعی یک علامت کوچک را اشتباه تشخیص دهد و کل معنای جمله عوض شود. این واقعیت تلخ برای اکثر کاربران مالایالام تا به امروز بود. با انتقال پردازش به سخت‌افزار محلی، کاربران علاوه بر حذف تأخیر و هزینه‌های ابری، از مدلی بهره می‌برند که دقیقاً برای ظرافت‌های خط «آبوگیدا» (Abugida) تنظیم شده است. پردازش محلی وابستگی به APIهای مبتنی بر ابر را از بین می‌برد و ریسک‌های مرتبط با حریم خصوصی داده‌ها، تأخیر شبکه و هزینه‌های تکرارشونده را کاهش می‌دهد.

مانع فنی: پیچیدگی خط

به نقل از گزارشی که در ۱ اکتبر ۲۰۲۶ در dev.to منتشر شد، چالش اصلی، گلیف‌های وابسته در زبان مالایالام است. خط مالایالام که از نوع آبوگیدا است، با ماهیت پیوسته و ترکیبات متنی (ligatures) شناخته می‌شود که چالش‌های قابل‌توجهی برای موتورهای OCR ایجاد می‌کند. وابستگی متقابل کاراکترها و استفاده گسترده از علائم دیاکریتیک، الگوریتم‌های بخش‌بندی سنتی را مختل می‌کند و منجر به شناسایی اشتباه یا تکه‌تکه شدن کلمات می‌شود.

ابزارهای سنتی مثل Tesseract اغلب در بخش‌بندی کاراکترها شکست می‌خورند و صحت آن‌ها در اسناد اسکن‌شده مالایالام تنها ۷۰ درصد است. مدل‌هایی که عمدتاً روی خطوط لاتین یا دواناگاری آموزش دیده‌اند، تخصص زبانی لازم برای مدیریت این پیچیدگی‌ها را ندارند. بدون چنین مدلی، سازمان‌ها و افرادی که به پردازش اسناد چندزبانه متکی هستند، همچنان با نقص در دقت و گلوگاه‌های عملیاتی روبرو خواهند بود.

برخی از رایج‌ترین حالت‌های شکست عبارت‌اند از:

  • اشتباه گرفتن کاراکترهای محو، مثل «ണ» (ṇa) و «ന» (na) به دلیل هم‌پوشانی خطوط.
  • تبدیل علامت‌های کوچک (diacritics) مانند «ൈ» به نویز پس‌زمینه در اسکن‌های با کیفیت پایین، که بازسازی آن‌ها را نیازمند آستانه‌گذاری تطبیقی (adaptive thresholding) می‌کند.
  • عدم تراز درست سرتیترهای جدول وقتی متن بیش از ۲۰ درجه کج باشد؛ در حالی که LayoutLM می‌تواند کجی‌های ۱۰ تا ۱۵ درجه را اصلاح کند، اما زوایای بیش از ۲۰ درجه باعث عدم تراز بحرانی می‌شود.

راهکار: LayoutLM و داده‌های مصنوعی

برای پر کردن شکاف داده‌ای، توسعه‌دهندگان از مدل LayoutLM در کنار تقویت داده‌های مصنوعی استفاده کردند. از آنجایی که مجموعه‌داده‌های برچسب‌دار مالایالام در مقایسه با انگلیسی یا هندی بسیار کمیاب هستند، تیم سازنده مجموعه‌های مصنوعی تولید کرد تا مدل را با تغییرات خط آشنا کند. این کمبود داده‌ها، رویکردهای نوآورانه‌ای مانند یادگیری انتقالی (transfer learning) یا تولید داده‌های مصنوعی را ضروری می‌کند تا شکاف بین زبان‌های کم‌منبع و زبان‌هایی با مجموعه‌داده‌های عظیم پر شود. این چالش در ترجمه تخصصی نیز دیده می‌شود، جایی که استراتژی‌های جدیدی برای جایگزینی نگاشت‌های سنتی با تکمیل متن برای افزایش دقت در زبان‌های پیچیده به کار گرفته شده است.

این رویکرد باعث شد تا تنظیم دقیق (Fine-tuning) — شبیه به وقتی که به یک پزشک عمومی، تخصص پوست می‌دهیم تا در یک حوزه دقیق شود — نتایج درخشانی داشته باشد:

  • افزایش صحت OCR از ۷۰ درصد (Tesseract) به ۸۵ درصد از طریق توانمندسازی مدل برای تعمیم در تغییرات خط.
  • رسیدن صحت استخراج ساختاریافته (خروجی JSON) به ۹۰ درصد برای انگلیسی و هندی.
  • رسیدن صحت استخراج مالایالام به ۷۵ درصد (که هنوز در جداول با سلول‌های ادغام‌شده به دلیل مسائل توکن‌سازی ترکیبات خطی مشکل دارد).

جزئیات استخراج ساختاریافته

استخراج اطلاعات ساختاریافته نیازمند تحلیل چیدمان‌های پیچیده است، مانند اسناد چندستونی و جداولی با سلول‌های ادغام‌شده. ارزیابی‌ها روی توانایی مدل در تولید فرمت JSON متمرکز بود، نه صرفاً متن خام، تا فیلدها و جداول خاص استخراج شوند. عدم حفظ یکپارچگی ساختاری — برای مثال، جابجایی سرتیترهای جدول — به‌طور بحرانی ارزیابی شد، زیرا مستقیماً کاربرد نهایی داده‌ها در مراحل بعدی را مختل می‌کند.

  • سلول‌های ادغام‌شده: توجه شبکه‌ای (grid-based attention) مدل LayoutLM توانست ۹۰ درصد سرتیترهای ادغام‌شده در انگلیسی/هندی را شناسایی کند، اما این عدد در مالایالام ۷۵ درصد بود. این موضوع به دلیل داده‌های آموزشی ناکافی برای جداول با ترکیبات خطی سنگین است، جایی که مدل‌ها به دلیل توکن‌سازی نامناسب، سرتیترهای ادغام‌شده را به اشتباه به عنوان ردیف‌های مجزا تفسیر می‌کنند.
  • هم‌پوشانی ستون‌ها: در حالی که ستون‌های هندی و انگلیسی به صحت ۹۵ درصدی رسیدند، ستون‌های مالایالام به دلیل فاصله بیشتر گلیف‌ها اغلب هم‌پوشانی داشتند. این مشکل از طریق پردازش تکمیلی با تشخیص کانتور (contour detection) برای جداسازی جریان‌های متنی حل شد.
  • اختلال در ترکیبات: ترکیبات خطی مثل «ക്ക» (kka) اغلب مرزهای توکن‌سازی (Tokenization) — یعنی تکه‌تکه کردن متن برای بلعیدن توسط مدل — را به هم می‌زنند و یکپارچگی ساختاری داده‌های استخراج‌شده را مختل می‌کنند.

بهینه‌سازی برای سخت‌افزار محلی

اجرای مدل‌های ترنسفورمر معمولاً به حافظه VRAM عظیمی نیاز دارد، اما این پیاده‌سازی برای سخت‌افزارهای معمولی مثل CPU اینتل i5 با ۸ گیگابایت رم هدف‌گذاری شده است. یک مدل محلی باید عملکرد خود را در این محدودیت‌ها بهینه کند و از طریق معماری‌های سبک و متدهای آموزشی آگاه به منابع، بین بهره‌وری محاسباتی و دقت تعادل برقرار کند. در همین راستا، بهینه‌سازی‌های مربوط به نمایش و ذخیره‌سازی داده‌های بصری اهمیت می‌یابد، مشابه آنچه در مدل NeoMME برای کاهش چشمگیر هزینه ذخیره‌سازی بردارها مشاهده شد.

تیم توسعه برای جلوگیری از کرش کردن سیستم و داغ شدن بیش از حد (Thermal Throttling)، که پیش از این پس از پردازش ۱۰ صفحه رخ می‌داد، چندین بهینه‌سازی سخت‌افزاری اعمال کرد. این کار شامل بهره‌گیری از تکنیک‌هایی مانند کوانتایزیشن مدل، تقطیر دانش (knowledge distillation) و بهینه‌سازی‌های سخت‌افزاری بود.

اقدامات کلیدی برای افزایش بهره‌وری عبارت‌اند از:

  • کوانتایزیشن INT8: تبدیل وزن‌ها از FP32 به INT8 مصرف حافظه را ۵۰ درصد کاهش داد، در حالی که افت صحت کمتر از ۱ درصد بود. این فرآیند اندازه مدل را با تبدیل وزن‌ها به فرمت‌های با دقت پایین‌تر کاهش می‌دهد اما برای جلوگیری از افت دقت، نیاز به تنظیم دقیق دارد.
  • پردازش دسته‌ای: پردازش چهار صفحه در هر دسته، تأخیر استنتاج (Inference) — یعنی لحظه‌ای که مدل واقعاً جواب تولید می‌کند — را ۴۰ درصد کم کرد.
  • آستانه اطمینان: پیش‌بینی‌هایی با احتمال کمتر از ۰.۷ حذف شدند تا توهم (Hallucination) — وقتی مدل با اطمینان چیزی می‌گوید که وجود ندارد — که ناشی از داده‌های آموزشی مصنوعی است، تا ۳۰ درصد کاهش یابد.
  • اندازه دسته پویا: این قابلیت از کرش کردن سیستم جلوگیری کرد، هرچند تأخیر را ۱۵ درصد افزایش داد.

با این حال، شکاف عملکردی همچنان وجود دارد. پردازش یک صفحه مالایالام حدود ۱۲ ثانیه زمان می‌برد، در حالی که برای انگلیسی این زمان ۴ ثانیه است؛ زیرا گلیف‌های پیچیده مالایالام به توکن‌های سه برابری نسبت به انگلیسی نیاز دارند که باعث فشار به رم موجود می‌شود.

مقابله با کمبود داده

اگرچه داده‌های مصنوعی نقطه شروع خوبی بودند، اما تنوع دنیای واقعی (مثل یادداشت‌های دست‌نویس) را نداشتند. طبق گزارش‌ها، تنظیم دقیق مدل روی تنها ۱۰۰۰ صفحه برچسب‌گذاری‌شده توسط انسان، صحت را ۵ درصد دیگر افزایش داد.

برخی شکست‌ها همچنان پابرجاست؛ مثلاً اصلاح‌گر reph (്) در ۲۰ درصد موارد اشتباه شناسایی می‌شود. این موضوع باعث اختلال در مرزهای کلمات در خروجی ساختاریافته نهایی می‌شود و نیاز مبرم به مجموعه‌داده‌های متن‌باز و سازمان‌یافته مالایالام را برای جایگزینی راهکارهای موقت مصنوعی برجسته می‌کند. کمبود مجموعه‌داده‌های برچسب‌دار مالایالام به‌شدت توسعه مدل را مختل می‌کند، زیرا این زبان فاقد مجموعه‌داده‌های عظیمی است که برای هندی و انگلیسی در دسترس است.

تحلیل راهبردی

چرخش به سمت مدل‌های محلی و زبان‌محور، معیارهای هوش مصنوعی اسناد را تغییر می‌دهد. این تجربه ثابت می‌کند برای حل مشکلات پیچیده زبانی، نیازی به مدل‌های ابری با تریلیون‌ها پارامتر نیست؛ بلکه داده‌های هدفمند و باکیفیت و کوانتایزیشن کلید موفقیت‌اند. عدم توجه به این شکاف، ریسک عمیق‌تر شدن نابرابری در دسترسی به دانش و خدمات را در دوران تحول دیجیتال که در تمام بخش‌ها شتاب گرفته است، افزایش می‌دهد.

برای کاربر نهایی، این به معنای گذار از دیجیتال‌سازی «تقریبی» به اتوماسیون «قابل‌اعتماد» است. این رویکرد وابستگی به قیمت‌گذاری APIهای غول‌های فناوری و برداشت داده‌ها را حذف کرده و حاکمیت زبانی را به مناطق کم‌منبع بازمی‌گرداند و عدم تقارن اطلاعاتی را در مناطقی مثل کرالا کاهش می‌دهد. اسناد حیاتی — سوابق دولتی، قراردادهای حقوقی و مطالب آموزشی — در نهایت می‌توانند برای پردازش خودکار در دسترس قرار گیرند.

مسیر پیش رو

برای رسیدن به صحت ۹۵ درصد یا بالاتر، گام بعدی توسعه الگوریتم‌های OCR است که به‌طور خاص برای خطوط آبوگیدا طراحی شده باشند، نه صرفاً تطبیق مدل‌های لاتین‌محور. این امر نیازمند یک رویکرد چندرشته‌ای است که درک عمیق از بخش‌بندی کاراکترها را با بهینه‌سازی سخت‌افزاری ترکیب کند. از نظر فنی، این کار مستلزم درک نحوه شکست الگوریتم‌های بخش‌بندی در برابر پیچیدگی خط و تأثیر کمبود داده بر همگرایی مدل است. این رویکرد چندوجهی به ساختارهای پیچیده‌تری شبیه به استک‌های چندوجهی در ترجمه رباتیک زنده شباهت دارد که در آن چندین لایه پردازشی برای رسیدن به دقت لحظه‌ای با هم ترکیب می‌شوند.

نسخه‌های آینده ممکن است از موارد زیر بهره ببرند:

  • معماری‌های مبتنی بر MobileNet: بهینه‌شده برای استقرار محلی جهت کاهش بیشتر تأخیر ۱۲ ثانیه‌ای هر صفحه از طریق ایجاد تعادل بین دقت و بهره‌وری محاسباتی.
  • یادگیری انتقالی بین‌زبانی: بهره‌گیری از مدل‌های پیش‌آموزش‌دیده روی هندی و انگلیسی برای ارتقای عملکرد مالایالام با استفاده از شباهت‌های زبانی و ویژگی‌های مشترک خط (مثلاً دواناگاری برای هندی).
  • مجموعه‌داده‌های متن‌باز: توسعه مجموعه‌داده‌های مالایالام سازمان‌یافته برای حل مشکل بنیادی کمبود داده و تضمین دسترسی در کاربردهای متنوع.

کاربرانی که به دنبال پیاده‌سازی این مدل هستند باید اولویت را بر جمع‌آوری حداقل ۱۰۰۰ صفحه واقعی برای تنظیم دقیق بگذارند و از انتقال پردازش به GPU در دستگاه‌های میان‌رده به دلیل ناسازگاری درایورها و احتمال افت عملکرد پرهیز کنند. برای افزایش استحکام مدل، کاربران باید از آستانه‌گذاری تطبیقی برای بازسازی علامت‌های تکه‌تکه شده در اسکن‌های با کیفیت پایین استفاده کرده و نرمال‌سازی هندسی را برای متون کج بیش از ۲۰ درجه اجرا کنند.

اما داستان بهینه‌سازی مدل‌های کوچک برای زبان‌های محلی تازه شروع شده است؛ در تحلیل بعدی ما درباره مدل‌های SLM و جایگزینی آن‌ها با LLMها در محیط‌های سازمانی، این موضوع را بازتر خواهیم کرد.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص در پردازش زبان‌های کم‌منبع، حاکمیت داده‌ای را برای جوامعی فراهم می‌کند که توسط مدل‌های انگلیسی‌محور نادیده گرفته شده‌اند. همچنین هزینه‌های عملیاتی استخراج داده را برای سازمان‌های محلی به شدت کاهش می‌دهد.

تأثیر برای ایران

این رویکرد برای توسعه OCR زبان فارسی (به‌ویژه در اسناد اداری قدیمی با خطوط پیچیده) الگوست؛ چراکه نشان می‌دهد با داده‌های مصنوعی و کوانتایزیشن می‌توان مدل‌های سنگین را روی سخت‌افزارهای موجود در ایران اجرا کرد.

·نگاه ما
تحریریه دات‌هوش

این پروژه ثابت می‌کند که «داده‌های باکیفیت و هدفمند» بر «مقیاس عظیم مدل» پیروز می‌شوند. در حالی که صنعت به سمت مدل‌های بزرگتر می‌رود، موفقیت LayoutLM در محیط‌های محلی نشان می‌دهد که برای کاربردهای تخصصی (Vertical AI)، بهینه‌سازی معماری و کوانتایزیشن راهکار بهینه‌تری نسبت به افزایش پارامترهاست.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.