پرش به محتوای اصلی
پرش به محتوای مقاله

olmOCR در برابر GPT-4o: برتری در دقت استخراج داده‌های پیچیده

·۱۵ تیر ۱۴۰۵۳ دقیقه مطالعه۱ بازدید
مقاله فلوکروپ: چرا PDFهای زیبای شما برای هوش مصنوعی ویرانه‌ای باستانی‌اند
مقاله فلوکروپ: چرا PDFهای زیبای شما برای هوش مصنوعی ویرانه‌ای باستانی‌اند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی تکنیک Document-Anchoring که با ترکیب مختصات متنی و تصویر، نرخ توهم در پردازش PDFهای پیچیده را به شدت کاهش داده و هزینه را ۳۵ برابر کمتر از GPT-4o کرده است.

اگر امروز برای استخراج داده از میلیون‌ها صفحه PDF بودجه می‌بندید، احتمالاً متوجه شده‌اید که هزینه مدل‌های پیشرفته کمرشکن است. اما حالا یک راهکار جدید، قیمت این عملیات را از ۶۲۴۰ دلار به تنها ۱۷۶ دلار برای هر میلیون صفحه کاهش داده است.

این کاهش ۳۵ برابری هزینه، حاصل انتشار مدل olmOCR در ۶ ژوئیه ۲۰۲۶ توسط پژوهشکده هوش مصنوعی آلن (AI2) است. این ابزار بر روی نقطه ضعف بنیادی فناوری PDF دست گذاشته است: این فرمت به‌جای ساختار معنایی جملات، صرفاً مختصات نویسه‌ها را برای چاپ ذخیره می‌کند. این رویکرد اقتصادی در استخراج داده، یادآور مدل‌های تجاری است که مانند DataSwift AI سعی در تسهیل دسترسی کسب‌وکارهای کوچک به داده‌ها از طریق مدل‌های پرداخت به تعداد سند داشتند.

همان‌طور که در تحلیل قبلی ما درباره‌ی معماری جزیره‌ای داده‌ها اشاره کردیم، PDFها یکی از سرسخت‌ترین «جزایر اطلاعاتی» هستند که دسترسی به آن‌ها دشوار است. اکثر مدل‌های هوش مصنوعی زاینده (Generative AI) — که شبیه کتابخانه‌داری هستند که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — در مواجهه با ستون‌های متعدد یا جداول پیچیده دچار سردرگمی می‌شوند و متن‌ها را به‌صورت نامنظم می‌خوانند یا دچار توهم (Hallucination) می‌شوند؛ یعنی با اطمینان چیزی می‌گویند که اصلاً وجود ندارد، مثل دوستی که خاطره‌ای را اشتباه تعریف می‌کند.

برای شکستن این حصار، AI2 مدل olmOCR را توسعه داد؛ یک مدل بینایی-زبانی (Vision-Language Model) ۷ میلیارد پارامتری که مانند یک «استاد حل پازل» عمل می‌کند. طبق اعلام AI2، این مدل تکه‌های پراکنده متن در تصاویر را به متن ساده و خطی تبدیل کرده و معادلات ریاضی آشفته را به کدهای ساختاریافته LaTeX و اسناد نامنظم را به Markdown تبدیل می‌کند.

تحول فنی: لنگرگذاری سند (Document-Anchoring)

به نقل از مستندات این پروژه، این مدل برای جلوگیری از خطاها از تکنیکی به نام «لنگرگذاری سند» استفاده می‌کند. در این روش، مدل تنها به تصویر صفحه تکیه نمی‌کند، بلکه یک مسیر دوگانه را طی می‌کند:

  • ابتدا مختصات دیجیتال متن را از لایه‌ی پشتی PDF استخراج می‌کند تا یک نقشه اولیه بسازد.
  • سپس این نقشه مختصات را در کنار تصویر بصری به مدل می‌دهد تا مسیر حرکت هوش مصنوعی هدایت شود.

این دقت لیزری باعث می‌شود مدل بتواند سربرگ‌ها و پاورقی‌ها را حذف کند و بدون ساختن کلمات خیالی، در صفحات چندستونی حرکت کند.

محک عملکرد

AI2 ادعاهای خود را با استفاده از olmOCR-Bench تأیید کرد؛ مجموعه‌ای سخت‌گیرانه شامل ۷۰۱۰ مورد در ۱۴۰۰ صفحه واقعی. بر اساس گزارش وب‌سایت dev.to، این محک شامل سناریوهای «کابوسی» مانند جداول ادغام‌شده، متون بسیار ریز تایپی و نمادهای پیچیده arXiv بود. این تمرکز بر استخراج دقیق داده‌ها از مقالات علمی، در حالی صورت می‌گیرد که گزارش‌های اخیر arXiv نشان‌دهنده افزایش ۶ برابری اشتراک‌گذاری کد و داده در مقالات هوش مصنوعی است و نیاز به ابزارهای استخراج خودکار را بیش از پیش می‌کند. نتایج نشان داد که olmOCR به‌طور قاطع از غول‌های تجاری مثل GPT-4o و Gemini Flash 2 پیشی گرفته است.

برای یک پژوهشگر یا کسب‌وکار، این یعنی دیگر نیازی نیست برای استخراج داده‌های ساده، هزینه‌ی «سرآشپز ستاره‌دار میشلن» (مدل‌های گران‌قیمت) را پرداخت کنید. اکنون می‌توانید آرشیوهای عظیم اسناد قدیمی را با قیمت «فست‌فود» و بدون افت کیفیت پردازش کنید.

این نوآوری، PDFها را به «غذای مغزی» درجه‌یک برای آموزش نسل بعدی هوش مصنوعی تبدیل می‌کند. با تقریباً رایگان شدن این تبدیل، سد دیجیتالی پیش روی دانش متخصصانه علمی و تاریخی به‌طور کلی می‌شکند.

گام بعدی شما

  • اگر با حجم زیادی از اسناد PDF سر و کار دارید، مستندات AI2 را برای پیاده‌سازی این خط لوله (Pipeline) کاهش هزینه بررسی کنید.
  • خروجی‌های Markdown حاصل از این مدل را برای تغذیه در سامانه‌های تولید بازیابی‌افزا (RAG) — که شبیه دانش‌آموزی است که قبل از جواب دادن، اول کتاب درسی را باز می‌کند — به کار ببرید.

اما اثر این مدل بر سرعت آموزش مدل‌های زبانی کوچک حتی شگفت‌انگیزتر است؛ در گزارش بعدی ما درباره بهینه‌سازی داده‌های آموزشی، این موضوع را بررسی خواهیم کرد.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار پژوهشی AI2، هزینه‌ی دیجیتال‌سازی دانش بشری را به‌شدت کاهش می‌دهد. در نتیجه، دسترسی مدل‌های آموزش آینده به داده‌های باکیفیت علمی که پیش‌تر در PDFها زندانی بودند، تسهیل می‌شود.

تأثیر برای ایران

به دلیل متن‌باز بودن وزن‌های این مدل، توسعه‌دهندگان ایرانی می‌توانند بدون پرداخت هزینه‌های دلاری APIهای OpenAI، زیرساخت استخراج داده از اسناد اداری و علمی را به‌صورت محلی مستقر کنند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی مدل‌های غول‌آسای تجاری با مدل‌های تخصصی ۷ میلیاردی در کارهای Routine، نشان‌دهنده پایان عصر «یک مدل برای همه کارها» است. olmOCR ثابت می‌کند که با ترکیب هوشمندانه داده‌های ساختاریافته (مختصات PDF) و بینایی ماشین، می‌توان به دقتی دست یافت که حتی مدل‌های بسیار بزرگ‌تر با تکیه بر brute-force به آن نمی‌رسند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.