تصور کنید یک سیستم RAG پیشرفته را ساختهاید، اما یک فایل PDF بههمریخته تمام جداول ساختاریافته را به رشتههایی تصادفی از متن تبدیل کرده و خروجی مدل را نابود میکند. برای حل این بحران، بخش تحقیقات IBM در زوریخ کتابخانه متنباز Docling را توسعه داد تا تبدیل اسناد را بهجای استخراج ساده متن، به عنوان یک مسئله «درک چیدمان» تعریف کند.
بسیاری از توسعهدهندگان با «دیوارهای داده» مواجهاند؛ جایی که فایلهای PDF، Word و اسلایدهای ارائه دارای چیدمانهای دو ستونی یا فرمولهای پیچیدهای هستند که ابزارهای ابتدایی آنها را تخریب میکنند. همانطور که در تحلیل قبلی ما دربارهی کاهش تأخیر در برنامههای هوش مصنوعی اشاره کردیم، گلوگاه بعدی معمولاً کیفیت دادههای ورودی است. اگر دادههای ورودی زباله باشند، پاسخ مدل نیز زباله خواهد بود، فارغ از اینکه توکنها با چه سرعتی تولید شوند. این چالش بهویژه در پردازش اسناد تخصصی مشهود است؛ برای مثال، پروژهی Paxa Labs بر حل نقاط کور زبانی در اسناد تجاری تمرکز کرده است تا دقت استخراج دادهها در زبانهای پیچیده افزایش یابد.
به گزارش وبسایت dev.to در ۱۹ سپتامبر ۲۰۲۶، Docling طیف گستردهای از فرمتها — از جمله PDF، DOCX، PPTX، XLSX و حتی متنهای استخراجشده از صوت و ویدیو — را به یک فرمت داخلی واحد به نام DoclingDocument تبدیل میکند. این قابلیت به کاربران اجازه میدهد خروجیهای تمیز در قالب Markdown، HTML یا JSON بدون نقص دریافت کنند. این رویکرد در مدیریت هزینههای پردازش اسناد حجیم نیز حیاتی است، مشابه آنچه در مدل قیمتگذاری ثابت Oxlo.ai برای اسناد پزشکی بلند مشاهده میکنیم تا هزینههای عملیاتی پیشبینیپذیر شوند.
قابلیتهای فنی
- هوشمندی چیدمان: تشخیص ترتیب خواندن، بازسازی جداول و شناسایی بلوکهای کد و فرمولها.
- یکپارچگی OCR: مدیریت PDFهای اسکنشده از طریق نویسهخوانی نوری (OCR) — شبیه به چشم انسان که تصویر حروف را میبیند و آنها را به متن تبدیل میکند.
- اجرای محلی: اجرا بهصورت کامل روی دستگاه کاربر، بهطوری که اسناد حساس هرگز از ماشین خارج نمیشوند.
- سازگاری با اکوسیستم: دارای یکپارچگیهای آماده برای LangChain، LlamaIndex، CrewAI و Haystack.

با این حال، این هوشمندی هزینهای دارد. از آنجا که Docling برای تشخیص جداول و چیدمان از مدلهای یادگیری ماشین استفاده میکند، نصب آن سنگینتر از کتابخانههای سبکی مثل pypdf است. طبق مستندات این ابزار، پردازش دستههای بزرگ داده روی CPU کند است و برای مقیاسهای تولیدی، استفاده از واحد پردازش گرافیکی (GPU) — که مثل یک موتور توربوشارژ سرعت محاسبات را بالا میبرد — بهشدت توصیه میشود.
برای یک توسعهدهنده، این ابزار گردش کار تولید بازیابیافزا (RAG) — شبیه به دانشآموزی که قبل از جواب دادن، اول کتاب درسی را باز میکند و از آن نقل میآورد — را تغییر میدهد. دیگر نیازی به نوشتن کدهای پیچیده برای هر نوع فایل نیست و «مالیات تجزیه داده» که پروژههای سازمانی را در آرشیوهای قدیمی فلج میکرد، حذف میشود.
گام بعدی شما
- اگر برای اسناد شرکتی چتبات میسازید، Docling را روی پیچیدهترین PDFهای خود تست کنید.
- ابزار را از طریق pip نصب کرده و یک تبدیل ساده در خط فرمان اجرا کنید تا دقت بازسازی جداول را بسنجید.
- در صورت پردازش حجم بالای داده، محیط اجرای خود را به GPU منتقل کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو