پرش به محتوای اصلی
پرش به محتوای مقاله

LandingAI هزینه استخراج داده از اسناد را تا ۸۰٪ کاهش داد

·۱۹ شهریور ۱۴۰۵۴ دقیقه مطالعه
نسخه دوم استخراج هوشمند اسناد LandingAI با مدل‌های DPT-3 Pro و DPT-3 Verity
نسخه دوم استخراج هوشمند اسناد LandingAI با مدل‌های DPT-3 Pro و DPT-3 Verity
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر بنیادین در ساختار خروجی از تکه‌های متنی (Chunks) به درخت بلوک‌های معنایی و معرفی مدل قیمت‌گذاری مبتنی بر کاراکتر برای کاهش هزینه‌های پردازش.

اگر امروز برای پردازش هزاران سند اداری هزینه می‌پردازید، احتمالاً با یک خبر خوش روبرو هستید: طبق اعلام شرکت LandingAI، هزینه‌های تجزیه و تحلیل (Parsing) برای حجم‌های کاری مختلط از اسناد، اکنون می‌تواند بین ۲۵٪ تا ۸۰٪ کاهش یابد. این شرکت با عرضه نسل دوم سیستم استخراج مستندات یا ADE Gen2، بازی را برای کسب‌وکارهایی که با حجم بالای اسناد سر و کار دارند، تغییر داد. ADE Gen2 در واقع بازسازی کامل پشته‌ی هوش مستندات این شرکت است که در آن مدل‌های قدیمی DPT-2 با خانواده‌ی جدید مدل‌های DPT-3 جایگزین شده‌اند.

شرکت LandingAI این نسخه جدید را حول سه محور اصلی تعریف کرده است: مقرون‌به‌صرفه بودن، خروجی‌های آماده برای عامل‌ها (Agent-ready) و مبنی‌سازی اتمی (Atomic Grounding). در دنیای هوش مصنوعی، اکثر ابزارها با اسناد مانند لیستی تخت از تکه‌های متن (Text Chunks) برخورد می‌کنند؛ شبیه به کسی که یک کتاب را تکه‌تکه کرده و بدون ترتیب روی میز ریخته است. این رویکرد اغلب منجر به ایجاد «توهم» (Hallucination) در ارجاعات یا استخراج نادقیق داده‌ها می‌شود. اما ADE Gen2 استاندارد صنعت را تغییر می‌دهد و اسناد را به صورت یک «درخت از گره‌ها» (شامل سند، صفحه و بلوک) می‌بیند. این ساختار به عامل‌های هوشمند اجازه می‌دهد تا هر پاسخ را دقیقاً به یک کلمه یا خط خاص در یک صفحه متصل کنند.

استقرار و دسترسی

سیستم ADE Gen2 هم‌اکنون به‌صورت عمومی در دسترس است. توسعه‌دهندگان می‌توانند تست‌های خود را به‌صورت رایگان در محیط ADE Playground آغاز کنند. برای سازمان‌های بزرگ، این سیستم انعطاف‌پذیری بالایی دارد و می‌تواند در محیط‌های مختلفی مستقر شود:

  • ابرهای ایالات متحده یا اتحادیه اروپا
  • شبکه‌های خصوصی مجازی (VPC) در AWS، Azure یا Google Cloud
  • داخل محیط Snowflake
  • استقرار محلی (On-premises)، از جمله محیط‌های ایزوله یا Air-gapped

معرفی Dyna-2: مدل جهان-عمل رباتیکی با پیش‌آموزش بر یک میلیون ساعت ویدیوی انسانی

برای بهینه‌سازی همزمان سرعت و بودجه، ADE Gen2 فرآیند تجزیه را بین دو مدل مجزا تقسیم می‌کند. مدل DPT-3 Verity اسنادی را که به‌صورت دیجیتالی ایجاد شده‌اند، به‌صورت قطعی (Deterministic) پردازش می‌کند و برای هر تک کلمه، یک کادر محدودکننده (Bounding Box) و یک امتیاز اطمینان برمی‌گرداند. این مدل برای متون با حجم بالا، فرم‌های ساده و جداول طراحی شده است.

در مقابل، DPT-3 Pro نقش مدل قدرتمند و اصلی را ایفا می‌کند. این مدل پیش از خواندن کلمات، چیدمان صفحه را تحلیل می‌کند تا انواع بلوک‌های پیچیده، از جمله یادداشت‌های حاشیه (Marginalia)، امضاها و فرمول‌های ریاضی LaTeX را تشخیص دهد. DPT-3 Pro انتخاب اصلی برای صفحات اسکن‌شده، متون دست‌نویس و زبان‌هایی است که از حروف لاتین استفاده نمی‌کنند.

مقایسه مدل‌ها و مسیریابی

LandingAI اعلام کرده است که هزینه استفاده از DPT-3 Verity تقریباً ۴۰٪ اعتبارهایی است که DPT-3 Pro مصرف می‌کند. در حال حاضر توسعه‌دهندگان باید مدل مورد نظر را به‌صورت دستی انتخاب کنند، اما برنامه‌ریزی شده است که مسیریابی خودکار (Automated Routing) بین این دو مدل تا پاییز ۲۰۲۶ فعال شود.

این شرکت اساساً نحوه پرداخت سازمان‌ها برای این خدمات را تغییر داده است. در سیستم قدیمی DPT-2، هر صفحه هزینه ثابت ۳ اعتبار داشت. اما قیمت‌گذاری جدید DPT-3 ترکیبی از یک هزینه پایه برای هر صفحه و یک مؤلفه بر اساس تعداد کاراکترهای خروجی است:

  • DPT-3 Pro (اولویت بالا): ۱ اعتبار برای هر صفحه + ۰.۵ اعتبار به ازای هر ۱,۰۰۰ کاراکتر.
  • DPT-3 Verity (اولویت بالا): ۰.۳ اعتبار برای هر صفحه + ۰.۲ اعتبار به ازای هر ۱,۰۰۰ کاراکتر.

برای خط لوله‌های پردازشی (Pipelines) که می‌توانند تأخیرهایی در حد چند دقیقه یا چند ساعت را تحمل کنند، یک سطح «استاندارد» (Standard) وجود دارد که این نرخ‌ها را به نصف کاهش می‌دهد. LandingAI ادعا می‌کند که استفاده از مدل Verity در سطح استاندارد می‌تواند هزینه تجزیه هر صفحه را به زیر یک سنت برساند. برای مثال، تجزیه یک سند ۱۲ صفحه‌ای با مدل Pro که ۴۸,۱۲۰ کاراکتر خروجی دارد، در حالت اولویت بالا ۳۶.۱ اعتبار هزینه دارد و در حالت استاندارد تقریباً نیمی از این مقدار خواهد بود. مجموع هزینه‌ها به نزدیک‌ترین ۰.۱ اعتبار رند می‌شود و متادیتای پاسخ، تمام ورودی‌های استفاده شده در این محاسبه را گزارش می‌کند.

جزئیات فنی: بلوک‌ها و ساختار

پاسخ‌های Parse v2 به جای «تکه‌ها»، از یک درخت ساختاریافته استفاده می‌کنند. این پاسخ شامل سه فیلد سطح بالا است: متن Markdown با ترتیب خواندن، متادیتای سند و ساختار (Structure). ساختار در واقع یک گره سند است که فرزندان آن صفحات هستند و هر صفحه شامل بلوک‌هایی است.

  • انواع بلوک‌ها: این‌ها شامل متن (text)، جدول (table)، سلول جدول (table_cell)، شکل (figure)، یادداشت حاشیه (marginalia)، گواهی/تأییدیه (attestation)، لوگو (logo)، کارت (card) و کد اسکن (scan_code) هستند.
  • شناسایی: هر بلوک دارای یک شناسه معنایی (type-index) است که در طول یک پاسخ واحد، ثابت می‌ماند.
  • اشیاء مبنی‌سازی: هر بلوک شامل شماره صفحه، یک محدوده (Range) در رشته Markdown و یک کادر محدودکننده نرمال‌شده است.
  • Markdown استاندارد شده: برای اشکال از المان‌های <figure type="CHART"> استفاده می‌شود و متون توضیحی در تگ‌های <description> ایزوله می‌شوند. گواهی‌ها از برچسب‌های پشته‌ای مانند [STAMPED][SIGNED] استفاده می‌کنند و برای موارد ناخوانا از عبارات ثابت [ILLEGIBLE_SIGNATURE] و [ILLEGIBLE_TEXT] بهره می‌برند.
  • جداول: برای حفظ سلول‌های ادغام‌شده، جداول به‌صورت پیش‌فرض در قالب HTML ارسال می‌شوند.

کاربران فنی متوجه خواهند شد که «مبنی‌سازی اتمی» (Atomic Grounding) تأثیرگذارترین تغییر است. هر بلوک نهایی (Leaf Block) اکنون یک آرایه atomic_grounding دارد: در مدل DPT-3 Pro برای هر خط بصری یک ورودی، و در مدل DPT-3 Verity برای هر کلمه یک ورودی وجود دارد. مدل Verity برای هر کلمه یک مقدار اطمینان بین ۰ تا ۱ اختصاص می‌دهد که بر اساس کمترین امتیاز هر کاراکتر در آن کلمه محاسبه شده است. این قابلیت به تیم‌ها سیگنالی می‌دهد تا نسخه‌برداری‌های نامطمئن را برای بررسی انسانی ارسال کنند.

سلول‌های جدول اکنون کادرهای محدودکننده مخصوص به خود را دارند، هرچند مدل Pro بخش مبنی‌سازی اتمی در سطح سلول را خالی می‌گذارد. سیستم Extract V2 ارجاعات خود را از این مبنی‌سازی استخراج می‌کند، بنابراین یک فیلد استخراج شده مستقیماً به یک کلمه خاص در یک صفحه خاص ردیابی می‌شود. این امر باعث می‌شود حذف داده‌های حساس (PII) بر اساس مختصات، مقایسه تفاوت‌های سند (Document Diffing) و ساخت رابط‌های کاربری برای بازبینان، به‌جای تخمین، به‌صورت دقیق و مهندسی‌شده انجام شود.

این تغییر از «تکه‌ها» به «بلوک‌ها» به این معناست که کدهای کلاینت نسل اول با اندپوینت‌های نسل دوم سازگار نخواهند بود و کاربران فعلی باید مهاجرت کامل را انجام دهند. LandingAI با جداسازی نسخه‌برداری از متون ساده از تحلیل‌های پیچیده چیدمان، پردازش اسناد را به جای یک وظیفه یکسان، به یک مسئله «مسیریابی» تبدیل کرده است. این رویکرد به کسب‌وکارها اجازه می‌دهد تا پردازش اسناد را بدون رشد خطی هزینه‌ها — که معمولاً باعث نابودی بازگشت سرمایه (ROI) در پروژه‌های OCR حجیم می‌شود — مقیاس‌پذیر کنند. این روند بهینه‌سازی هزینه‌ها از طریق ادغام مدل‌های پیشرفته، مشابه کاهش چشمگیر هزینه‌های کدنویسی در محیط Kiro است که پیش‌تر با بهره‌گیری از مدل‌های جدیدتر محقق شد.

باید زیر نظر داشت که این مدل قیمت‌گذاری مبتنی بر کاراکتر چگونه بر سایر ارائه‌دهندگان هوش مصنوعی مستندات تأثیر می‌گذارد، زیرا ریسک مالی را از تامین‌کننده به تراکم محتوای خود سند منتقل می‌کند.

گام بعدی شما

  • اگر از OCRهای سنتی استفاده می‌کنید، مدل DPT-3 Verity را در محیط Playground برای کاهش هزینه‌ها تست کنید.
  • برای اسناد دست‌نویس یا پیچیده، استراتژی مسیریابی را روی DPT-3 Pro تنظیم کنید.
  • ساختار درختی جدید را برای پیاده‌سازی سیستم‌های بازبینی انسانی (Human-in-the-loop) به کار بگیرید.

اما تأثیر این مدل قیمت‌گذاری بر سایر ارائه‌دهندگان هوش مصنوعی را باید زیر نظر داشت؛ آیا شاهد رقابتی در کاهش قیمت‌های استخراج داده خواهیم بود؟ به تحلیل ما درباره‌ی اقتصاد مدل‌های زبانی مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد با تکیه بر تخصص در بینایی ماشین و مدل‌های زبانی، هزینه ورود به اتوماسیون اسناد را برای شرکت‌های بزرگ به‌شدت کاهش می‌دهد. تغییر ساختار داده به مدل درختی، اعتبار استخراج داده‌ها را برای کاربردهای حساس (مثل حقوقی و مالی) تضمین می‌کند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم به این سرویس برای توسعه‌دهندگان ایرانی دشوار است، اما مدل قیمت‌گذاری کاراکتر-محور می‌تواند الگویی برای استارتاپ‌های داخلی OCR باشد.

·نگاه ما
تحریریه دات‌هوش

جایگزینی مدل قیمت‌گذاری «هر صفحه» با «هر کاراکتر»، ریسک مالی را از دوش فروشنده به تراکم سند منتقل می‌کند. این یک حرکت استراتژیک برای جذب مشتریانی است که حجم اسناد بسیار بالا اما محتوای هر صفحه کم است. در واقع LandingAI با تبدیل پردازش اسناد به یک مسئله مسیریابی (Routing)، بهره‌وری سخت‌افزاری را به حداکثر رسانده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.