تصور کنید میخواهید یک سند ۱۰۰ صفحهای را تحلیل کنید، اما حافظه سیستم شما اجازه پردازش تمام صفحات با کیفیت بالا را نمیدهد. LensVLM-9B اپل دقیقاً برای حل این بنبست طراحی شده است تا بدون فدا کردن دقت، حجم محاسبات را به شدت کاهش دهد.
این مدل با اسکن نسخههای کمکیفیت اسناد شروع میکند و تنها زمانی که به صفحه یا بخشی حیاتی میرسد، آن را به وضوح کامل بازمیگرداند. این رویکرد مانع از افت صحت (Accuracy) میشود که معمولاً در پردازش تصاویر فشرده رخ میدهد؛ موضوعی که در بررسیهای پیشین درباره حفظ دقت LensVLM در فشردهسازیهای ۱۰ برابری به تفصیل مورد بحث قرار گرفت.
بیشتر مدلهای بینایی-زبانی (VLM) — شبیه به دوربینهایی که فقط یک اندازه عکس میگیرند و اگر عکس بزرگ باشد، مجبورند کیفیت را پایین بیاورند تا در حافظه جا شود — کاربر را بین وضوح تصویر و طول زمینه (Context Length) مجبور به انتخاب میکنند. همانطور که در تحلیل قبلی ما درباره بهینهسازی فرمتهای مدل توسط Hugging Face اشاره کردیم، تمرکز اکنون از نحوه ذخیرهسازی مدل به نحوه «ادراک گزینشی» دادههای بصری تغییر کرده است.
به نقل از مقاله پژوهشی منتشر شده در ۲۳ سپتامبر ۲۰۲۶، این سامانه از یک فرآیند گسترش گزینشی استفاده میکند. مشخصات فنی کلیدی عبارتاند از:
- اندازه مدل: ۹ میلیارد پارامتر، بر پایه تغییراتی در معماری Qwen.
- گزینههای فشردهسازی: امکان انتخاب نرخهای ۵، ۱۰ و ۱۵ برابر.
- سازوکار: اسکن اولیه تصاویر فشرده و سپس فراخوانی ابزاری برای بازیابی نسخه بدون فشردهسازی صفحات مرتبط.
این معماری در واقع تکاملیافتهی رویکردهایی است که در مدلهای بینایی ۸ میلیاردی برای بهینهسازی استخراج اسناد به کار گرفته شده بود تا پیچیدگیهای پردازش متون طولانی کاهش یابد.
بر اساس مستندات اپل، این متد فرضیه قدیمی را که «تمام بخشهای یک سند به وضوح بالا نیاز دارند» به چالش میکشد. برای کاربر عملی، این یعنی امکان پرسوجو از مجموعههای عظیم PDF بدون برخورد با محدودیت حافظه یا از دست دادن جزئیات متون ریز.
اپل با تبدیل تصویر به یک شاخص قابل جستوجو به جای یک ورودی ایستا، به سمت ادراک بصری عاملمحور (Agentic) حرکت میکند. این رویکرد یادآور نوآوریهای مدل NeoMME است که با کاهش چشمگیر هزینه ذخیرهسازی بردارها، مدیریت دادههای بصری حجیم را تسهیل کرد. این یعنی مدلهای آینده فقط تصویر را «نمیبینند»، بلکه فعالانه تصمیم میگیرند کدام بخش صحنه برای درک درست، به وضوح بیشتری نیاز دارد.
گام بعدی شما
- مخزن رسمی مدل را کلون کرده و دمو را با مدل
apple/LensVLM-9Bدر Hugging Face اجرا کنید. - نرخهای مختلف فشردهسازی (۵x تا ۱۵x) را روی اسناد پیچیده خود تست کنید تا نقطه شکست دقت را بیابید.
- این مدل را برای استخراج داده از فرمهای طولانی که بخشهای کوچکی از آنها حیاتی است، به کار بگیرید.
اما تأثیر این رویکرد بر کاهش هزینههای استنتاج در مقیاس سازمانی حتی جذابتر است — به تحلیل ما درباره بهینهسازی GPUها مراجعه کنید.




گفتگو