اگر امروز برای پردازش هزاران سند اداری هزینه میپردازید، احتمالاً با یک خبر خوش روبرو هستید: طبق اعلام شرکت LandingAI، هزینههای تجزیه و تحلیل (Parsing) برای حجمهای کاری مختلط از اسناد، اکنون میتواند بین ۲۵٪ تا ۸۰٪ کاهش یابد. این شرکت با عرضه نسل دوم سیستم استخراج مستندات یا ADE Gen2، بازی را برای کسبوکارهایی که با حجم بالای اسناد سر و کار دارند، تغییر داد. ADE Gen2 در واقع بازسازی کامل پشتهی هوش مستندات این شرکت است که در آن مدلهای قدیمی DPT-2 با خانوادهی جدید مدلهای DPT-3 جایگزین شدهاند.
شرکت LandingAI این نسخه جدید را حول سه محور اصلی تعریف کرده است: مقرونبهصرفه بودن، خروجیهای آماده برای عاملها (Agent-ready) و مبنیسازی اتمی (Atomic Grounding). در دنیای هوش مصنوعی، اکثر ابزارها با اسناد مانند لیستی تخت از تکههای متن (Text Chunks) برخورد میکنند؛ شبیه به کسی که یک کتاب را تکهتکه کرده و بدون ترتیب روی میز ریخته است. این رویکرد اغلب منجر به ایجاد «توهم» (Hallucination) در ارجاعات یا استخراج نادقیق دادهها میشود. اما ADE Gen2 استاندارد صنعت را تغییر میدهد و اسناد را به صورت یک «درخت از گرهها» (شامل سند، صفحه و بلوک) میبیند. این ساختار به عاملهای هوشمند اجازه میدهد تا هر پاسخ را دقیقاً به یک کلمه یا خط خاص در یک صفحه متصل کنند.
استقرار و دسترسی
سیستم ADE Gen2 هماکنون بهصورت عمومی در دسترس است. توسعهدهندگان میتوانند تستهای خود را بهصورت رایگان در محیط ADE Playground آغاز کنند. برای سازمانهای بزرگ، این سیستم انعطافپذیری بالایی دارد و میتواند در محیطهای مختلفی مستقر شود:
- ابرهای ایالات متحده یا اتحادیه اروپا
- شبکههای خصوصی مجازی (VPC) در AWS، Azure یا Google Cloud
- داخل محیط Snowflake
- استقرار محلی (On-premises)، از جمله محیطهای ایزوله یا Air-gapped

برای بهینهسازی همزمان سرعت و بودجه، ADE Gen2 فرآیند تجزیه را بین دو مدل مجزا تقسیم میکند. مدل DPT-3 Verity اسنادی را که بهصورت دیجیتالی ایجاد شدهاند، بهصورت قطعی (Deterministic) پردازش میکند و برای هر تک کلمه، یک کادر محدودکننده (Bounding Box) و یک امتیاز اطمینان برمیگرداند. این مدل برای متون با حجم بالا، فرمهای ساده و جداول طراحی شده است.
در مقابل، DPT-3 Pro نقش مدل قدرتمند و اصلی را ایفا میکند. این مدل پیش از خواندن کلمات، چیدمان صفحه را تحلیل میکند تا انواع بلوکهای پیچیده، از جمله یادداشتهای حاشیه (Marginalia)، امضاها و فرمولهای ریاضی LaTeX را تشخیص دهد. DPT-3 Pro انتخاب اصلی برای صفحات اسکنشده، متون دستنویس و زبانهایی است که از حروف لاتین استفاده نمیکنند.
مقایسه مدلها و مسیریابی
LandingAI اعلام کرده است که هزینه استفاده از DPT-3 Verity تقریباً ۴۰٪ اعتبارهایی است که DPT-3 Pro مصرف میکند. در حال حاضر توسعهدهندگان باید مدل مورد نظر را بهصورت دستی انتخاب کنند، اما برنامهریزی شده است که مسیریابی خودکار (Automated Routing) بین این دو مدل تا پاییز ۲۰۲۶ فعال شود.
این شرکت اساساً نحوه پرداخت سازمانها برای این خدمات را تغییر داده است. در سیستم قدیمی DPT-2، هر صفحه هزینه ثابت ۳ اعتبار داشت. اما قیمتگذاری جدید DPT-3 ترکیبی از یک هزینه پایه برای هر صفحه و یک مؤلفه بر اساس تعداد کاراکترهای خروجی است:
- DPT-3 Pro (اولویت بالا): ۱ اعتبار برای هر صفحه + ۰.۵ اعتبار به ازای هر ۱,۰۰۰ کاراکتر.
- DPT-3 Verity (اولویت بالا): ۰.۳ اعتبار برای هر صفحه + ۰.۲ اعتبار به ازای هر ۱,۰۰۰ کاراکتر.
برای خط لولههای پردازشی (Pipelines) که میتوانند تأخیرهایی در حد چند دقیقه یا چند ساعت را تحمل کنند، یک سطح «استاندارد» (Standard) وجود دارد که این نرخها را به نصف کاهش میدهد. LandingAI ادعا میکند که استفاده از مدل Verity در سطح استاندارد میتواند هزینه تجزیه هر صفحه را به زیر یک سنت برساند. برای مثال، تجزیه یک سند ۱۲ صفحهای با مدل Pro که ۴۸,۱۲۰ کاراکتر خروجی دارد، در حالت اولویت بالا ۳۶.۱ اعتبار هزینه دارد و در حالت استاندارد تقریباً نیمی از این مقدار خواهد بود. مجموع هزینهها به نزدیکترین ۰.۱ اعتبار رند میشود و متادیتای پاسخ، تمام ورودیهای استفاده شده در این محاسبه را گزارش میکند.
جزئیات فنی: بلوکها و ساختار
پاسخهای Parse v2 به جای «تکهها»، از یک درخت ساختاریافته استفاده میکنند. این پاسخ شامل سه فیلد سطح بالا است: متن Markdown با ترتیب خواندن، متادیتای سند و ساختار (Structure). ساختار در واقع یک گره سند است که فرزندان آن صفحات هستند و هر صفحه شامل بلوکهایی است.
- انواع بلوکها: اینها شامل متن (text)، جدول (table)، سلول جدول (table_cell)، شکل (figure)، یادداشت حاشیه (marginalia)، گواهی/تأییدیه (attestation)، لوگو (logo)، کارت (card) و کد اسکن (scan_code) هستند.
- شناسایی: هر بلوک دارای یک شناسه معنایی (type-index) است که در طول یک پاسخ واحد، ثابت میماند.
- اشیاء مبنیسازی: هر بلوک شامل شماره صفحه، یک محدوده (Range) در رشته Markdown و یک کادر محدودکننده نرمالشده است.
- Markdown استاندارد شده: برای اشکال از المانهای
<figure type="CHART">استفاده میشود و متون توضیحی در تگهای<description>ایزوله میشوند. گواهیها از برچسبهای پشتهای مانند[STAMPED][SIGNED]استفاده میکنند و برای موارد ناخوانا از عبارات ثابت[ILLEGIBLE_SIGNATURE]و[ILLEGIBLE_TEXT]بهره میبرند. - جداول: برای حفظ سلولهای ادغامشده، جداول بهصورت پیشفرض در قالب HTML ارسال میشوند.
کاربران فنی متوجه خواهند شد که «مبنیسازی اتمی» (Atomic Grounding) تأثیرگذارترین تغییر است. هر بلوک نهایی (Leaf Block) اکنون یک آرایه atomic_grounding دارد: در مدل DPT-3 Pro برای هر خط بصری یک ورودی، و در مدل DPT-3 Verity برای هر کلمه یک ورودی وجود دارد. مدل Verity برای هر کلمه یک مقدار اطمینان بین ۰ تا ۱ اختصاص میدهد که بر اساس کمترین امتیاز هر کاراکتر در آن کلمه محاسبه شده است. این قابلیت به تیمها سیگنالی میدهد تا نسخهبرداریهای نامطمئن را برای بررسی انسانی ارسال کنند.
سلولهای جدول اکنون کادرهای محدودکننده مخصوص به خود را دارند، هرچند مدل Pro بخش مبنیسازی اتمی در سطح سلول را خالی میگذارد. سیستم Extract V2 ارجاعات خود را از این مبنیسازی استخراج میکند، بنابراین یک فیلد استخراج شده مستقیماً به یک کلمه خاص در یک صفحه خاص ردیابی میشود. این امر باعث میشود حذف دادههای حساس (PII) بر اساس مختصات، مقایسه تفاوتهای سند (Document Diffing) و ساخت رابطهای کاربری برای بازبینان، بهجای تخمین، بهصورت دقیق و مهندسیشده انجام شود.
این تغییر از «تکهها» به «بلوکها» به این معناست که کدهای کلاینت نسل اول با اندپوینتهای نسل دوم سازگار نخواهند بود و کاربران فعلی باید مهاجرت کامل را انجام دهند. LandingAI با جداسازی نسخهبرداری از متون ساده از تحلیلهای پیچیده چیدمان، پردازش اسناد را به جای یک وظیفه یکسان، به یک مسئله «مسیریابی» تبدیل کرده است. این رویکرد به کسبوکارها اجازه میدهد تا پردازش اسناد را بدون رشد خطی هزینهها — که معمولاً باعث نابودی بازگشت سرمایه (ROI) در پروژههای OCR حجیم میشود — مقیاسپذیر کنند. این روند بهینهسازی هزینهها از طریق ادغام مدلهای پیشرفته، مشابه کاهش چشمگیر هزینههای کدنویسی در محیط Kiro است که پیشتر با بهرهگیری از مدلهای جدیدتر محقق شد.
باید زیر نظر داشت که این مدل قیمتگذاری مبتنی بر کاراکتر چگونه بر سایر ارائهدهندگان هوش مصنوعی مستندات تأثیر میگذارد، زیرا ریسک مالی را از تامینکننده به تراکم محتوای خود سند منتقل میکند.
گام بعدی شما
- اگر از OCRهای سنتی استفاده میکنید، مدل DPT-3 Verity را در محیط Playground برای کاهش هزینهها تست کنید.
- برای اسناد دستنویس یا پیچیده، استراتژی مسیریابی را روی DPT-3 Pro تنظیم کنید.
- ساختار درختی جدید را برای پیادهسازی سیستمهای بازبینی انسانی (Human-in-the-loop) به کار بگیرید.
اما تأثیر این مدل قیمتگذاری بر سایر ارائهدهندگان هوش مصنوعی را باید زیر نظر داشت؛ آیا شاهد رقابتی در کاهش قیمتهای استخراج داده خواهیم بود؟ به تحلیل ما دربارهی اقتصاد مدلهای زبانی مراجعه کنید.




گفتگو