پرش به محتوای اصلی
پرش به محتوای مقاله

مدل‌های کوچک OCR دقت استخراج متن از کتاب‌های تاریخی را به ۹۷٪ رساندند

·۱۹ مرداد ۱۴۰۵۴ دقیقه مطالعه۱ بازدید
متن جایگزین: کتاب‌های قدیمی با OCR ضعیف، آموزش مدل‌های زبانی را ناتوان می‌کند؛ FineBooks راه‌حل گسترده‌ای دارد.
متن جایگزین: کتاب‌های قدیمی با OCR ضعیف، آموزش مدل‌های زبانی را ناتوان می‌کند؛ FineBooks راه‌حل گسترده‌ای دارد.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اثبات این نکته که مدل‌های کوچک OCR (زیر ۳ میلیارد پارامتر) در استخراج متن از اسناد تاریخی، هم ارزان‌تر و هم دقیق‌تر از مدل‌های غول‌پیکر عمل می‌کنند.

اگر برای آموزش مدل‌های هوش مصنوعی از مجموعه‌داده‌های متنی قدیمی استفاده می‌کنید، احتمالاً با داده‌هایی سر و کار دارید که تنها ۳۰ درصد از پتانسیل یادگیری خود را فعال کرده‌اند. این افت شدید بازدهی، نتیجه‌ی خطاهای سیستمی در اسکن‌های قدیمی است که حالا راه حلی ارزان و دقیق برای آن پیدا شده است. برای پر کردن این شکاف، Hugging Face و EleutherAI پروژه FineBooks را راه‌اندازی کردند؛ پروژه‌ای که هدف آن پاک‌سازی میلیون‌ها صفحه از دامنه عمومی (Public Domain) از خطاهایی است که توسط نرم‌افزارهای اسکن قدیمی به جای گذاشته شده‌اند.

بسیاری از مجموعه‌داده‌های متن‌باز برای آموزش مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — بر کتاب‌های عمومی متکی هستند که سال‌ها پیش دیجیتالی شده‌اند. در این کتاب‌ها از نسخه‌های ابتدایی نویسه‌خوانی نوری (OCR) استفاده شده که اغلب حروف را اشتباه تشخیص داده و داده‌های «نویزی» ایجاد کرده است. همان‌طور که در بحث‌های گذشته‌ی ما درباره‌ی کیفیت داده‌های آموزشی اشاره کردیم، نویز در ورودی مدل، مستقیماً منجر به کاهش هوشمندی خروجی می‌شود.

به گزارش تیم Hugging Face و EleutherAI، این مشکل در مجموعه‌داده‌ی Common Pile که سال گذشته توسط EleutherAI و شرکایش منتشر شد، به‌وضوح دیده می‌شد. این مجموعه به عنوان بزرگ‌ترین کورپوس آموزشی با مجوز باز تا به امروز، شامل تقریباً ۳۰۰ هزار کتاب از دامنه عمومی بود که از متون حاصل از همان اجراهای قدیمی OCR استفاده می‌کردند. برای جامعه‌ی مدل‌های وزن‌های باز (Open Weights) — یعنی مدل‌هایی که «دستور پخت» یا همان پارامترهایشان علناً منتشر شده — پاک‌سازی این داده‌ها اکنون به اصلی‌ترین اهرم برای افزایش هوش مدل‌ها تبدیل شده است، بدون آنکه نیاز به جمع‌آوری داده‌های خام جدید باشد.

طبق اعلام این تیم در ۱۰ اوت ۲۰۲۶، آن‌ها یک جدول رده‌بندی (Leaderboard) منتشر کردند که حاصل آزمایش ۱۴ مدل مختلف روی ۲۱۶۵ صفحه از کتابخانه‌ی Biodiversity Heritage Library (BHL) بود. این کتابخانه با داشتن بیش از ۳۰۰ هزار سند دیجیتالی تاریخ طبیعی که در مجموع بیش از ۶۴ میلیون صفحه را شامل می‌شوند و از طریق دانلودهای حجیم AWS در دسترس هستند، یکی از بزرگ‌ترین اهداف برای این پروژه است. مجموعه‌ی آزمون شامل انواع متنوعی از صفحات بود:

  • یک متن تاریخ طبیعی انگلیسی تک‌ستونی.
  • یک فهرست مطالب چندزبانه.
  • یک صفحه تصویر (Illustration plate) که در آن متن استخراج شده تنها یک خط مربوط به اعتبار هنرمند است.

متن جایگزین: متن قدیمی OCR آموزش مدل زبانی را مختل می‌کند؛ FineBooks راه‌حل گسترده‌ای دارد

نتایج این آزمایش رابطه‌ای معکوس و شگفت‌انگیز بین اندازه مدل و دقت آن در اسناد تاریخی نشان داد. تیم پژوهشگر از معیار نرخ خطای نویسه (CER) برای سنجش استفاده کردند و نتایج را به دو دسته‌ی «دیپلماتیک» (که در آن مدرن‌سازی حروف قدیمی به عنوان خطا محسوب می‌شود) و «خوانشی» (که تغییرات برای مدرن‌سازی را می‌پذیرد) تقسیم کردند:

  • dots.mocr با ۳ میلیارد پارامتر، با دقت ۹۷.۶٪ و هزینه ۱.۹۴ دلار به‌ازای هر ۱۰۰۰ صفحه، رتبه‌ی اول را کسب کرد.
  • OvisOCR2 با ۰.۹ میلیارد پارامتر، با دقت ۹۶.۹٪ و هزینه بسیار کم ۰.۴۶ دلار به‌ازای هر ۱۰۰۰ صفحه در جایگاه دوم قرار گرفت.
  • PaddleOCR-VL-1.6 با ۱ میلیارد پارامتر، دقتی معادل ۹۶.۱٪ و ارزان‌ترین هزینه (۰.۳۴ دلار) را ثبت کرد.
  • olmOCR-2 با ۸.۳ میلیارد پارامتر، دقت ۹۵.۷٪ را با هزینه ۰.۴۵ دلار به دست آورد.
  • Qwen3.5-9B با وجود اینکه تقریباً سه برابر بزرگ‌تر از مدل برنده بود، دقت پایین‌تری (۹۴.۹٪) داشت.

بر اساس مستندات پروژه، این ارزیابی روی تایپ‌های Antiqua در زبان‌های انگلیسی، فرانسوی، آلمانی و لاتین متمرکز بود. برای تایید صحت، از داده‌های مرجع (Ground-truth) پروژه‌ی IMPACT و BHL-Europe استفاده شد. بین سال‌های ۲۰۱۱ و ۲۰۱۲، متخصصان شش جلد از BHL را با نرخ خطای بسیار پایین (تنها یک حرف در هر ۲۰۰۰ نویسه) نسخه‌برداری کردند. این داده‌ها تحت مجوز CC-BY از طریق گیت‌هاب در دسترس هستند. با این حال، این ارزیابی محدودیت‌هایی دارد؛ این تست‌ها دست‌خط‌ها، زبان‌های غیرلاتین یا تایپ‌های Fraktur را در نظر نمی‌گیرند و تنها به صفحات تک‌ستونی محدود شده‌اند.

یک شکاف مهم میان متن «آماده برای هوش مصنوعی» و متن «آماده برای پژوهشگر» وجود دارد. مدل‌های برتر برای آموزش LLMها عالی هستند، اما اغلب «به‌طور خاموش مدرن‌سازی» می‌کنند؛ یعنی حروف قدیمی مانند s بلند (ſ) یا ترکیبات حرفی (Ligatures) را با معادل‌های مدرن جایگزین می‌کنند. این موضوع آن‌ها را برای نسخه‌برداری‌های دقیق دانشگاهی نامناسب می‌کند، مگر اینکه تحت تنظیم دقیق (Fine-tuning) — شبیه وقتی که به یک پزشک عمومی، تخصص پوست می‌دهیم تا روی یک حوزه دقیق شود — قرار گیرند. این رویکرد تخصصی در مدل‌های کوچک‌تر، مشابه تجربه‌ای است که مدل DharmaOCR در استخراج متون پرتغالی داشت و توانست مدل‌های غول‌پیکری مانند Mistral را شکست دهد.

علاوه بر این، خروجی این مدل‌ها به‌صورت Markdown یا متن ساده است. این موضوع یک تضاد فنی با زیرساخت‌های کتابخانه‌ای ایجاد می‌کند که بر پایه استاندارد ALTO XML بنا شده‌اند؛ استانداردی که نیازمند مختصات دقیق هر کلمه در سطح صفحه است، قابلیتی که مدل‌های جدید ارائه نمی‌دهند.

این نتایج ثابت می‌کند که برای وظایف تخصصی تبدیل تصویر به متن، افزایش تعداد پارامترها راهکار اصلی نیست. با استفاده از مدل‌های کوچک و بهینه، اکنون بازپردازش ۲۰۰ هزار سند BHL بدون فشار به بودجه، ممکن است. برای کل صنعت هوش مصنوعی، این یعنی «دیوار داده‌ها» دورتر شده است؛ توسعه‌دهندگان به‌جای جست‌وجوی بی‌پایان برای داده‌های جدید وب، می‌توانند ارزش نهفته در میلیون‌ها کتاب دیجیتالی قدیمی را با یک دور پردازش OCR ارزان و دقیق آزاد کنند.

منتظر انتشار مجموعه‌داده‌ی بازپردازش‌شده‌ی BHL باشید که یک کورپوس عظیم و پاک‌سازی‌شده را برای جامعه‌ی متن‌باز فراهم می‌کند تا بتوانند مدل‌های خود را در برابر مدل‌های تجاری و انحصاری بسنجند.

گام بعدی شما

  • اگر روی مجموعه‌داده‌های متنی قدیمی کار می‌کنید، مدل dots.mocr را برای پاک‌سازی داده‌ها جایگزین OCRهای سنتی کنید.
  • برای کاهش هزینه‌های استنتاج در پروژه‌های استخراج متن، از مدل‌های زیر ۱ میلیارد پارامتر مانند OvisOCR2 استفاده کنید.
  • منتظر انتشار مجموعه‌داده‌ی بازپردازش‌شده‌ی BHL باشید تا مدل‌های متن‌باز خود را با داده‌های پاک‌سازی‌شده بسنجید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار پروژه‌های Hugging Face و EleutherAI، هزینه‌ی تولید داده‌های باکیفیت را به‌شدت کاهش می‌دهد. در نتیجه، مدل‌های متن‌باز می‌توانند بدون نیاز به داده‌های انحصاری شرکت‌های بزرگ، از طریق بهینه‌سازی منابع موجود، به سطح هوشمندی بالاتری برسند.

تأثیر برای ایران

این خبر برای پژوهشگران مدل‌های زبانی در ایران که با محدودیت بودجه برای خرید داده‌های تجاری روبرو هستند، فرصتی برای استفاده از مدل‌های وزن‌باز جهت ارتقای کیفیت داده‌های آموزشی فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

این یافته‌ها فرضیه «بزرگ‌تر یعنی بهتر» را در وظایف بینایی-زبانی به چالش می‌کشد. در واقع، تخصص در استخراج متن از اسناد تاریخی نیازمند معماری‌های بهینه است، نه لزوماً پارامترهای بیشتر. این رویکرد نشان می‌دهد که آینده‌ی داده‌های آموزشی نه در کمیت، بلکه در «بازیافت هوشمند» داده‌های موجود نهفته است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.