پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Lift: دقت استخراج داده‌های PDF به ۹۰.۲ درصد رسید

·۱۸ تیر ۱۴۰۵۱۰ دقیقه مطالعه
مقایسه Datalab Lift با NuExtract3، LlamaExtract، Marker و Docling: استخراج‌کننده ۹ میلیارد پارامتری مبتنی بر اسکیما
مقایسه Datalab Lift با NuExtract3، LlamaExtract، Marker و Docling: استخراج‌کننده ۹ میلیارد پارامتری مبتنی بر اسکیما
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

حذف کامل مرحله تبدیل سند به Markdown و جایگزینی آن با استخراج مستقیم بصری (Visual Extraction) در یک مرحله، که منجر به افزایش خیره‌کننده سرعت و کاهش خطای لایه‌های میانی شده است.

دقت ۹۰.۲ درصدی در استخراج میدان‌ها (Fields) در یک مرحله، استاندارد جدیدی است که Lift تعریف کرده است. این مدل بینایی-زبانی (Vision-Language Model) با ۹ میلیارد پارامتر، پیچیدگی‌های بصری PDFها و تصاویر را مستقیماً به مقادیر آماده برای اپلیکیشن در قالب JSON تبدیل می‌کند. طبق اعلام Datalab، این مدل با حذف فرآیند سنتی دو مرحله‌ای (تبدیل سند به Markdown و سپس استخراج داده)، پیچیدگی‌های خط لوله‌ای (Pipeline) را که اکثر سیستم‌های هوش مصنوعی اسناد را دچار مشکل می‌کند، از بین برده است. به‌جای اینکه ابتدا سند را به Markdown تبدیل کند و سپس مدل دیگری را برای استخراج فیلدها به کار بگیرد، Lift تصویر رندر شده صفحه را می‌خواند و بلافاصله شیء ساختاریافته نهایی را تولید می‌کند.

این چرخش در زمانی رخ می‌دهد که صنعت بین «پارسرهای» (Parsers) و «استخراج‌کننده‌ها» (Extractors) تقسیم شده است. پارسرها اسناد را به نمایش‌های میانی وفادار تبدیل می‌کنند: Markdown، HTML، بلوک‌های JSON، درخت‌های چیدمان (Layout Trees)، جداول، سرتیترها، ترتیب خواندن و تکه‌های متنی (Chunks) برای بازیابی. ابزارهایی مانند Docling، MinerU، Marker، Unstructured، PyMuPDF، OCRmyPDF و Surya عمدتاً در این دسته قرار می‌گیرند. اما استخراج‌کننده‌ها بر شناسایی میدان‌های خاصی تمرکز دارند که توسط کاربر در یک JSON Schema تعریف شده‌اند؛ مانند «شماره فاکتور» (invoice_number)، «نام فروشنده» (vendor_name)، «مبلغ کل» (total)، «تاریخ سررسید» (due_date) یا «آیتم‌های لیست» (line_items[]). همان‌طور که در تحلیل‌های قبلی ما درباره‌ی نقش vLLM در شتاب‌بخشی به استنتاج (Inference) اشاره کردیم، توانایی میزبانی شخصی (Self-hosting) یک استخراج‌کننده تخصصی مانند Lift، کنترل حیاتی روی محل ذخیره داده‌ها و هزینه‌ها به تیم‌های فنی می‌دهد. این دستاوردها در راستای تلاش‌های Datalab برای تبدیل بهینه PDF به JSON است که استانداردهای جدیدی را در دنیای متن‌باز ایجاد کرده است.

معماری فنی Lift

Lift به عنوان یک استخراج‌کننده «طرح‌محور» (Schema-first) تعریف شده است. برخلاف مدل‌های زبانی بزرگ عمومی، این مدل از رمزگشایی (Decoding) محدود به طرح استفاده می‌کند تا تضمین کند JSON تولید شده دقیقاً با ساختار درخواستی کاربر مطابقت دارد. Lift در اصل یک موتور OCR نیست و تبدیل‌کننده PDF به Markdown یا یک پلتفرم کامل بررسی اسناد سازمانی هم نیست؛ بلکه به‌طور خاص مدلی است برای تبدیل اسناد دارای پیچیدگی بصری به میدان‌های آماده برای اپلیکیشن.

طبق تحلیل فنی وب‌سایت marktechpost.com، Lift روی تصاویر رندر شده صفحات عمل می‌کند. این رویکرد «ابتدا-بصری» (Visual-first) به مدل اجازه می‌دهد مقادیری را که در چندین صفحه پراکنده شده‌اند شناسایی و حل کند؛ موردی که یکی از نقاط شکست شناخته شده برای ابزارهایی است که اسناد را به تکه‌های کوچک تقسیم می‌کنند. این مدل برای توازن سرعت-دقت طراحی شده است که محیط‌های تولیدی با حجم بالا را به استدلال‌های عمومی ترجیح می‌دهد. با تجمیع گردش کار در یک مرحله استخراج بصری، Lift پیچیدگی خط لوله را در زمانی که هدف استخراج فیلد است (و نه بازسازی وفادارانه سند)، کاهش می‌دهد.

چشم‌انداز رقابتی

مدل Lift در تقاطع چندین دسته ابزاری قرار دارد، اگرچه همه آن‌ها رقبای مستقیم نیستند. برخی ابزارهای زیرساختی مجاور هستند و برخی دیگر جایگزین‌های مستقیم:

  • مدل‌های VLM با وزن‌های باز: مانند NuExtract3.
  • مدل‌های چندوجهی پیشرو: مدل‌هایی که از حالت‌های خروجی ساختاریافته استفاده می‌کنند.
  • سیستم‌های ابری: Azure، Google و AWS.
  • پلتفرم‌های تجاری استخراج: Reducto، Extend، LlamaExtract و APIهای خود Datalab.
  • پارسرهای متن‌باز: Docling، MinerU، Marker و Unstructured.
  • کتابخانه‌های تولید ساختاریافته: XGrammar، Outlines، Instructor، BAML و سیستم‌های مرتبط با خروجی JSON.

مقایسه با رقبا در دنیای وزن‌های باز

در مقایسه با NuExtract3 (مدل ۴ میلیاردی استدلال بینایی-زبانی از شرکت NuMind)، مدل Lift برتری واضحی در دقت دارد. NuMind مدل NuExtract3 را به عنوان یک مدل یکپارچه برای درک اسناد توصیف می‌کند که استخراج اطلاعات ساختاریافته را با تبدیل تصویر به Markdown برای اسنادی چون اسکن‌ها، رسیدها، فرم‌ها، فاکتورها، قراردادها و جداول ترکیب می‌کند. این مدل در Hugging Face تحت لایسنس Apache-2.0 منتشر شده است.

در بنچمارک‌های داخلی Datalab، مدل Lift به دقت ۹۰.۲٪ در میدان‌ها رسید، در حالی که NuExtract3 تنها ۸۱.۵٪ صحت داشت. با این حال، انتخاب بین این دو تنها بر اساس دقت نیست:

  • NuExtract3 کوچک‌تر است، استقرار محلی آن آسان‌تر است و لایسنس بازتری دارد.
  • NuExtract3 همچنین به عنوان ابزار تبدیل به Markdown عمل می‌کند و برای درک عمومی اسناد تطبیق‌پذیرتر است.
  • Lift بزرگ‌تر است (۹ میلیارد پارامتر) و منحصراً بر دقت استخراج میدان‌های محدود به طرح تمرکز دارد.

Lift در برابر غول‌های چندوجهی پیشرو

مقایسه Lift با مدل‌های ابری مانند Gemini Flash 3.5 تفاوت شدیدی را در میزان تأخیر (Latency) نشان می‌دهد. یک جایگزین رایgın این است که سند را به یک مدل چندوجهی پیشرو ارسال کرده و خروجی ساختاریافته بخواهید. اگرچه Gemini Flash 3.5 در دقت خام میدان‌ها و دقت کلی سند کمی بهتر از Lift عمل می‌کند، اما به‌شدت کندتر است.

داده‌های Datalab نشان می‌دهد میانگین تأخیر Lift حدود ۹.۵ ثانیه است، در حالی که Gemini Flash 3.5 به ۲۸.۱ ثانیه زمان نیاز دارد. برای سازمانی که میلیون‌ها صفحه را پردازش می‌کند، این افزایش سرعت تقریباً ۳ برابری، هم هزینه‌های عملیاتی و هم زمان انتظار را کاهش می‌دهد. این برتری عملکردی باعث شده تا قابلیت استخراج ساختاریافته Lift تا ۳ برابر سریع‌تر از Gemini Flash باشد، که برای مقیاس‌های صنعتی حیاتی است. مدل‌های پیشرو زمانی جذاب هستند که حجم داده کم باشد، زمان راه‌اندازی مهم‌تر از کنترل زیرساخت باشد و پردازش ابری پذیرفته شده باشد. مزیت Lift زمانی ظاهر می‌شود که تأخیر، محل ذخیره داده‌ها، قابلیت تکرار میزبانی شخصی و کنترل هزینه‌ها در حجم بالا اهمیت یابد.

مقایسه با پلتفرم‌های ابری و سازمانی

سرویس‌های مدیریت‌شده مانند Azure AI Document Intelligence، Azure Content Understanding، Google Document AI و AWS Textract زیرساخت‌های گسترده‌تری شامل کنترل‌های استقرار، قابلیت اطمینان سرویس، مانیتورینگ و سیستم‌های خرید سازمانی ارائه می‌دهند. مایکروسافت Azure Content Understanding را راهی برای تبدیل داده‌های بدون ساختار به اطلاعات ساختاریافته و ماشین‌خوان با حفظ روابط ساختاری توصیف می‌کند.

در بنچمارک‌های Datalab، سرویس Azure Content Understanding دقت میدان کمتر و تأخیر بیشتری نسبت به Lift گزارش کرد. با این حال، سرویس ابری شامل «استنادات» (Citations) است که وزن‌های باز Lift ندارند. API میزبانی شده‌ی Datalab این نقص را با افزودن تأییدیه برای هر میدان، استنادات و نمرات اطمینان (Confidence Scores) فراتر از مدل باز برطرف می‌کند. این همان تبادل ابری است: پلتفرم‌ها در شرکت‌هایی که روی Azure یا AWS استاندارد شده‌اند راحت‌تر پذیرفته می‌شوند و زمانی که حاکمیت سازمانی (Enterprise Governance) مهم‌تر از سرعت خام باشد، قوی‌ترند. برای اسکنی‌های بی‌کیفیت با دست‌خط زیاد، فرم‌های بالینی، اسناد دارای حاشیه‌نویسی یا گردش‌های کاری تنظیم‌شده که نیاز به ردیابی دارند، پلتفرم‌های ابری باید مستقیماً با Lift مقایسه شوند، نه اینکه پیش‌فرض بر برتری آن‌ها باشد.

پلتفرم‌های تجاری استخراج لایه دیگری از بازار را اشغال می‌کنند. این‌ها صرفاً مدل نیستند، بلکه «سیستم‌های استخراج» هستند که قابلیت‌هایی چون منشأ داده (Provenance)، گردش کارهای بازبینی و زیرساخت‌های انطباق را اضافه می‌کنند:

  • Reducto: محصول Extract آن بر استخراج JSON با تایپ طرح و استنادات اختیاری تمرکز دارد، در حالی که محصول Parse آن بر بلوک‌های تایپ‌شده، کادرهای محدوده (Bounding Boxes) و نمرات اطمینان تأکید می‌کند.
  • LlamaExtract: استخراج با طرح سفارشی را همراه با استنادات دقیق و نمرات اطمینان تبلیغ می‌کند.
  • سایرین: Extend و Mindee لایه‌های مشابه سطح سازمانی را فراهم می‌کنند.

وزن‌های باز Lift به‌طور عمدی سبک‌تر هستند تا استخراج سریع و طرح‌محور را در اولویت قرار دهند. بنابراین مقایسه صرفاً «مدل در برابر مدل» نیست، بلکه «مدل در برابر پلتفرم» است. Lift برای استخراج خام در میزبانی شخصی جذاب است، در حالی که پلتفرم‌های مدیریت‌شده زمانی که قابلیت حسابرسی، استنادات و بازبینی انسانی اجباری باشد، قوی‌ترند.

تفکیک Lift از پارسرها

بسیار حیاتی است که Lift را از ابزارهایی مانند Marker تفکیک کنیم. Marker یک چارچوب تبدیل گسترده است که اسناد را به Markdown، JSON، تکه‌های متنی و HTML تبدیل می‌کند. این ابزار از طیف وسیعی از فرمت‌ها شامل PDF، تصاویر، PPTX، DOCX، XLSX، HTML و EPUB پشتیبانی می‌کند. Marker جداول، فرم‌ها، معادلات، ریاضیات درون‌خطی، لینک‌ها، ارجاعات، بلوک‌های کد، استخراج تصاویر، حذف آرتیفکت‌ها و فرمت‌بندی سفارشی را مدیریت می‌کند و همچنین استخراج ساختاریافته بتا با JSON Schema را شامل می‌شود.

در حالی که Marker یک سند را خواندنی، قابل جست‌وجو یا آماده برای RAG می‌کند، Lift فقط داده‌های خاصی را که در یک Schema تعریف شده‌اند استخراج می‌کند. یک خط لوله عملیاتی ممکن است از هر دو استفاده کند: Marker برای تحلیل کامل سند جهت جست‌وجو یا بازبینی انسانی، و Lift برای استخراج میدان‌های خاص اپلیکیشن.

به همین ترتیب، Lift با سایر چارچوب‌های متن‌باز اصلی تفاوت دارد:

Docling:

  • از PDF، DOCX، PPTX، XLSX، HTML، EPUB، فرمت‌های صوتی، تصاویر، LaTeX و متن ساده پشتیبانی می‌کند.
  • بر درک پیشرفته PDF، چیدمان صفحه، ترتیب خواندن، ساختار جدول، کد، فرمول‌ها، طبقه‌بندی تصاویر و نمایش یکپارچه DoclingDocument تأکید دارد.
  • نتیجه: Docling برای تبدیل سند است؛ Lift برای استخراج فیلد.

MinerU:

  • در اسناد پیچیده و علمی تخصص دارد و بر تبدیل جدول به HTML و OCR برای ۱۰۹ زبان تأکید می‌کند.
  • فرمت‌های خروجی متعددی مانند Markdown و JSON ارائه می‌دهد که نتایج بر اساس ترتیب خواندن مرتب شده و خروجی‌های بصری برای بررسی کیفیت دارند.
  • برای مقالات پژوهشی، گزارش‌های فنی و چیدمان‌های چندستونی جهت حفظ ساختار برای خواندن و نمایه‌سازی ایده‌آل است.
  • نتیجه: MinerU یک نسخه ماشین‌خوان وفادار ارائه می‌دهد؛ Lift میدان‌های خاص درخواستی را می‌دهد.

Unstructured:

  • یک کیت ابزار ingest و پیش‌پردازش برای گردش‌های کاری LLM است.
  • توابع بخش‌بندی آن اسناد را به المان‌هایی مانند «عنوان» (Title)، «متن روایتی» (NarrativeText) و «آیتم لیست» (ListItem) تقسیم می‌کند و به توسعه‌دهندگان اجازه می‌دهد انتخاب کنند چه محتوایی حفظ شود.
  • نتیجه: از Unstructured برای ingest اسناد در مقیاس بزرگ استفاده کنید؛ از Lift برای تبدیل تصاویر به میدان‌های JSON تایپ‌شده.

زیرساخت‌های سطح پایین:

  • OCRmyPDF: یک لایه متنی OCR به PDFهای اسکن شده اضافه می‌کند تا آن‌ها را قابل جست‌وجو و کپی کنند. عالی برای دیجیتالی‌سازی و آرشیو.
  • PyMuPDF: یک کتابخانه پایتونی با عملکرد بالا برای پردازش، استخراج و رندرینگ قطعی (Deterministic) اسناد. کنترل سطح پایین و APIهای سطح بالا را فراهم می‌کند.
  • نتیجه: این‌ها رقبای مستقیم نیستند. اگر هر سند از یک چیدمان یکسان پیروی کند و منطق قطعی باشد، PyMuPDF سریع‌تر و ارزان‌تر است. وقتی چیدمان‌ها متغیر باشند یا میدان‌ها باید بصری استنباط شوند، Lift ضروری می‌شود.

نقش کتابخانه‌های تولید ساختاریافته

Lift در اکوسیستم گسترده‌تری از ابزارهای رمزگشایی محدود مانند XGrammar، Outlines، Instructor و BAML رقابت می‌کند. مقاله JSONSchemaBench این چارچوب‌ها را از نظر کارایی و کیفیت خروجی ارزیابی می‌کند که نشان‌دهنده تقاضای بالا برای خروجی ساختاریافته در اپلیکیشن‌های مدرن LLM است.

در حالی که این کتابخانه‌ها می‌توانند هر LLM را برای تولید JSON معتبر بپیچند، یک مدل عمومی همچنان ممکن است در خواندن صفحه دچار خطا شود یا در یک میدان توهم (Hallucination) کند. شواهد از مقاله ExtractBench نشان می‌دهد که مدل‌های پیشرو با افزایش گستردگی طرح (Schema) و حجم خروجی، به‌شدت دچار افت کیفیت می‌شوند. تمایز اصلی Lift در این است که یک مدل بینایی تخصصی اسناد را با تولید محدود به طرح ترکیب کرده است، نه اینکه صرفاً یک مدل عمومی را با یک اعتبارسنج (Validator) بپوشاند. نکته کلیدی این است: JSON معتبر به معنای JSON صحیح نیست. یک طرح (Schema) شکل را تضمین می‌کند، اما نه دقت مبلغ کل یک فاکتور یا تاریخ یک قرارداد را.

ماتریس تصمیم‌گیری نهایی

ابزار / دسته بهترین مورد استفاده استقرار محلی استخراج طرح‌محور منشأ داده (Provenance)
Lift استخراج سریع محلی از PDF/تصویر به JSON بله بله خیر (وزن‌های باز)
NuExtract3 استخراج‌کننده باز کوچک‌تر + Markdown بله بله خیر
Frontier LLMs استخراج سریع با دقت بالا (ابری) خیر بله محدود/متغیر
Datalab API استخراج مدیریت‌شده با تأییدیه میزبانی شده بله بله
Reducto / Extend گردش کارهای استخراج تولیدی قابل حسابرسی میزبانی شده بله بله
Azure / Google AI هوش مصنوعی ابری سازمانی و انطباق مدیریت‌شده خیر متغیر متغیر
Docling / Marker پارسینگ سند، Markdown و ingest برای RAG بله نه به‌طور اصلی نه به‌طور اصلی
OCRmyPDF / PyMuPDF لایه‌های OCR، استخراج قطعی بله خیر خیر
Instructor / BAML لایه خروجی ساختاریافته دور مدل‌ها متغیر بله خیر

مزایای رقابتی کلیدی

مدل Lift چندین مزیت متمایز برای توسعه‌دهندگان فراهم می‌کند:

  • سرعت-در-مقابل-دقت: در میان مدل‌هایی که دقت میدان حدود ۹۰٪ را رد می‌کنند، Lift سریع‌ترین است. این مدل تأخیر میانه ۹.۵ ثانیه را ثبت می‌کند، در حالی که Gemini/Datalab API حدود ۲۸-۳۱ ثانیه و Azure حدود ۷۴ ثانیه زمان می‌برد. NuExtract3 سریع‌تر است اما نه نقطه دقت کمتری دارد.
  • مدیریت چندصفحه‌ای: Lift کل اسناد چندصفحه‌ای را یک‌باره می‌گیرد و مقادیری را که بین صفحات تقسیم شده‌اند حل می‌کند؛ این موضوع یکی از نقاط درد اصلی خط لوله‌های «تکه-بندی و چسباندن» (Chunk-and-stitch) است.
  • ارگونومی توسعه‌دهنده: یک ورودی استاندارد JSON Schema، یک CLI برای فایل‌ها و دایرکتوری‌ها، یک API پایتونی و یک «Schema Studio» بر پایه Streamlit برای تکرار روی اسناد واقعی را ارائه می‌دهد.
  • سابقه اثبات شده: Datalab پیش از این Marker، Surya و Chandra را منتشر کرده است که توسط مؤسساتی چون هاروارد، استنفورد، MIT و Anthropic استفاده می‌شوند.

این تغییر معماری از «پارسینگ $\rightarrow$ استخراج» به «استخراج بصری»، احتمال خطاهای وارد شده در مرحله تبدیل به Markdown را به حداقل می‌رساند. برای توسعه‌دهندگان، این به معنای قوانین regex کمتر و نگهداری کمتر خط لوله است. برای ارزیابی تأثیر این مدل، توسعه‌دهندگان باید عملکرد Lift را روی اسنادی آزمایش کنند که داده‌های جدولی آن‌ها در میان شکست صفحات تقسیم شده است؛ سناریویی که پارسرهای استاندارد معمولاً در آن شکست می‌خورند.

گام بعدی شما

  • اگر از خط لوله‌های پیچیده «تبدیل به متن $\rightarrow$ استخراج» استفاده می‌کنید، عملکرد Lift را روی اسنادی که جداول آن‌ها بین دو صفحه تقسیم شده است آزمایش کنید.
  • برای محیط‌های حساس به حریم خصوصی، استقرار محلی (Self-hosting) این مدل ۹ میلیاردی را جایگزین APIهای ابری کنید تا تأخیر را به زیر ۱۰ ثانیه برسانید.
  • از Streamlit Schema Studio برای تکرار و بهینه‌سازی طرح‌های استخراج داده روی اسناد واقعی استفاده نمایید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با کاهش ۳ برابری تأخیر نسبت به مدل‌های پیشرو، سد اقتصادی پردازش میلیون‌ها سند را برای شرکت‌ها می‌شکند. تخصص Datalab در حذف مراحل میانی، دقت استخراج داده‌های پیچیده را به سطح عملیاتی (۹۰٪+) رسانده است.

تأثیر برای ایران

به‌دلیل وزن‌های باز (Open Weights) بودن، توسعه‌دهندگان ایرانی می‌توانند این مدل را بدون نیاز به APIهای تحریم‌شده به‌صورت محلی مستقر کنند و استخراج داده از اسناد اداری را بهینه کنند.

·نگاه ما
تحریریه دات‌هوش

انتقال از معماری «تبدیل به متن» به «استخراج بصری»، ریسک خطاهای زنجیره‌ای در پردازش اسناد را به‌طور معنایی حذف می‌کند. این رویکرد نشان می‌دهد که برای داده‌های ساختاریافته، تخصص در بینایی (Vision) بسیار کارآمدتر از تلاش برای تبدیل تصویر به متن است و سپس تحلیل آن. در واقع Lift اثبات می‌کند که در استخراج داده، «دیدن» مستقیم بهتر از «خواندن» واسطه‌ای است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.