پرش به محتوای اصلی
پرش به محتوای مقاله

«تولید داده‌های ساختاریافته»؛ هدف اصلی IBM از عرضهٔ ابزار Docling

·۲۹ شهریور ۱۴۰۵۳ دقیقه مطالعه۲ بازدید
مستندات ناخوانا را به داده‌های تمیز برای هوش مصنوعی تبدیل کنید
مستندات ناخوانا را به داده‌های تمیز برای هوش مصنوعی تبدیل کنید
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی استخراج متنی ساده با مدل‌های یادگیری ماشین برای درک ساختار بصری سند؛ تبدیل PDF به Markdown ساختاریافته بدون تخریب جداول.

تصور کنید یک سیستم RAG پیشرفته را ساخته‌اید، اما یک فایل PDF به‌هم‌ریخته تمام جداول ساختاریافته را به رشته‌هایی تصادفی از متن تبدیل کرده و خروجی مدل را نابود می‌کند. برای حل این بحران، بخش تحقیقات IBM در زوریخ کتابخانه متن‌باز Docling را توسعه داد تا تبدیل اسناد را به‌جای استخراج ساده متن، به عنوان یک مسئله «درک چیدمان» تعریف کند.

بسیاری از توسعه‌دهندگان با «دیوارهای داده» مواجه‌اند؛ جایی که فایل‌های PDF، Word و اسلایدهای ارائه دارای چیدمان‌های دو ستونی یا فرمول‌های پیچیده‌ای هستند که ابزارهای ابتدایی آن‌ها را تخریب می‌کنند. همان‌طور که در تحلیل قبلی ما درباره‌ی کاهش تأخیر در برنامه‌های هوش مصنوعی اشاره کردیم، گلوگاه بعدی معمولاً کیفیت داده‌های ورودی است. اگر داده‌های ورودی زباله باشند، پاسخ مدل نیز زباله خواهد بود، فارغ از اینکه توکن‌ها با چه سرعتی تولید شوند. این چالش به‌ویژه در پردازش اسناد تخصصی مشهود است؛ برای مثال، پروژه‌ی Paxa Labs بر حل نقاط کور زبانی در اسناد تجاری تمرکز کرده است تا دقت استخراج داده‌ها در زبان‌های پیچیده افزایش یابد.

به گزارش وب‌سایت dev.to در ۱۹ سپتامبر ۲۰۲۶، Docling طیف گسترده‌ای از فرمت‌ها — از جمله PDF، DOCX، PPTX، XLSX و حتی متن‌های استخراج‌شده از صوت و ویدیو — را به یک فرمت داخلی واحد به نام DoclingDocument تبدیل می‌کند. این قابلیت به کاربران اجازه می‌دهد خروجی‌های تمیز در قالب Markdown، HTML یا JSON بدون نقص دریافت کنند. این رویکرد در مدیریت هزینه‌های پردازش اسناد حجیم نیز حیاتی است، مشابه آنچه در مدل قیمت‌گذاری ثابت Oxlo.ai برای اسناد پزشکی بلند مشاهده می‌کنیم تا هزینه‌های عملیاتی پیش‌بینی‌پذیر شوند.

قابلیت‌های فنی

  • هوشمندی چیدمان: تشخیص ترتیب خواندن، بازسازی جداول و شناسایی بلوک‌های کد و فرمول‌ها.
  • یکپارچگی OCR: مدیریت PDFهای اسکن‌شده از طریق نویسه‌خوانی نوری (OCR) — شبیه به چشم انسان که تصویر حروف را می‌بیند و آن‌ها را به متن تبدیل می‌کند.
  • اجرای محلی: اجرا به‌صورت کامل روی دستگاه کاربر، به‌طوری که اسناد حساس هرگز از ماشین خارج نمی‌شوند.
  • سازگاری با اکوسیستم: دارای یکپارچگی‌های آماده برای LangChain، LlamaIndex، CrewAI و Haystack.

تبدیل اسناد نامرتب به داده تمیز برای هوش مصنوعی با Docling

با این حال، این هوشمندی هزینه‌ای دارد. از آنجا که Docling برای تشخیص جداول و چیدمان از مدل‌های یادگیری ماشین استفاده می‌کند، نصب آن سنگین‌تر از کتابخانه‌های سبکی مثل pypdf است. طبق مستندات این ابزار، پردازش دسته‌های بزرگ داده روی CPU کند است و برای مقیاس‌های تولیدی، استفاده از واحد پردازش گرافیکی (GPU) — که مثل یک موتور توربوشارژ سرعت محاسبات را بالا می‌برد — به‌شدت توصیه می‌شود.

برای یک توسعه‌دهنده، این ابزار گردش کار تولید بازیابی‌افزا (RAG) — شبیه به دانش‌آموزی که قبل از جواب دادن، اول کتاب درسی را باز می‌کند و از آن نقل می‌آورد — را تغییر می‌دهد. دیگر نیازی به نوشتن کدهای پیچیده برای هر نوع فایل نیست و «مالیات تجزیه داده» که پروژه‌های سازمانی را در آرشیوهای قدیمی فلج می‌کرد، حذف می‌شود.

گام بعدی شما

  • اگر برای اسناد شرکتی چت‌بات می‌سازید، Docling را روی پیچیده‌ترین PDFهای خود تست کنید.
  • ابزار را از طریق pip نصب کرده و یک تبدیل ساده در خط فرمان اجرا کنید تا دقت بازسازی جداول را بسنجید.
  • در صورت پردازش حجم بالای داده، محیط اجرای خود را به GPU منتقل کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با تکیه بر اعتبار تحقیقاتی IBM، یکی از بزرگ‌ترین موانع استقرار RAG در محیط‌های سازمانی (داده‌های غیرساختاریافته) را برطرف می‌کند. نتیجه این است که دقت بازیابی اطلاعات از اسناد قدیمی به‌شدت افزایش می‌یابد.

تأثیر برای ایران

برنامه‌نویسان ایرانی که روی سیستم‌های مدیریت دانش سازمانی کار می‌کنند، می‌توانند با استفاده از این کتابخانه متن‌باز، هزینه‌ی توسعه لایه‌ی پردازش اسناد را به‌شدت کاهش دهند.

·نگاه ما
تحریریه دات‌هوش

انتقال تمرکز از استخراج متن به درک چیدمان (Layout Understanding) نشان می‌دهد که کیفیت داده در RAG اکنون از کمیت آن مهم‌تر شده است. Docling با حذف نیاز به Regexهای سفارشی، استانداردی جدید برای لایه‌ی Ingestion ایجاد می‌کند که احتمالاً منجر به کاهش نرخ توهم در مدل‌های سازمانی می‌شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.