پرش به محتوای اصلی
پرش به محتوای مقاله

اپل با گسترش گزینشی تصاویر، دقت مدل LensVLM-9B را حفظ کرد

·۲ مهر ۱۴۰۵۱ دقیقه مطالعه۱ بازدید
لنز ویژوال زبانی اپل با ۹ میلیارد پارامتر در پلتفرم هاگینگ‌فیس
لنز ویژوال زبانی اپل با ۹ میلیارد پارامتر در پلتفرم هاگینگ‌فیس
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی سازوکار «گسترش گزینشی» (Selective Expansion) که برخلاف مدل‌های رایج، وضوح تصویر را نه به صورت یکپارچه، بلکه بر اساس نیاز لحظه‌ای مدل تغییر می‌دهد.

تصور کنید می‌خواهید یک سند ۱۰۰ صفحه‌ای را تحلیل کنید، اما حافظه سیستم شما اجازه پردازش تمام صفحات با کیفیت بالا را نمی‌دهد. LensVLM-9B اپل دقیقاً برای حل این بن‌بست طراحی شده است تا بدون فدا کردن دقت، حجم محاسبات را به شدت کاهش دهد.

این مدل با اسکن نسخه‌های کم‌کیفیت اسناد شروع می‌کند و تنها زمانی که به صفحه یا بخشی حیاتی می‌رسد، آن را به وضوح کامل بازمی‌گرداند. این رویکرد مانع از افت صحت (Accuracy) می‌شود که معمولاً در پردازش تصاویر فشرده رخ می‌دهد؛ موضوعی که در بررسی‌های پیشین درباره حفظ دقت LensVLM در فشرده‌سازی‌های ۱۰ برابری به تفصیل مورد بحث قرار گرفت.

بیشتر مدل‌های بینایی-زبانی (VLM) — شبیه به دوربین‌هایی که فقط یک اندازه عکس می‌گیرند و اگر عکس بزرگ باشد، مجبورند کیفیت را پایین بیاورند تا در حافظه جا شود — کاربر را بین وضوح تصویر و طول زمینه (Context Length) مجبور به انتخاب می‌کنند. همان‌طور که در تحلیل قبلی ما درباره بهینه‌سازی فرمت‌های مدل توسط Hugging Face اشاره کردیم، تمرکز اکنون از نحوه ذخیره‌سازی مدل به نحوه «ادراک گزینشی» داده‌های بصری تغییر کرده است.

به نقل از مقاله پژوهشی منتشر شده در ۲۳ سپتامبر ۲۰۲۶، این سامانه از یک فرآیند گسترش گزینشی استفاده می‌کند. مشخصات فنی کلیدی عبارت‌اند از:

  • اندازه مدل: ۹ میلیارد پارامتر، بر پایه تغییراتی در معماری Qwen.
  • گزینه‌های فشرده‌سازی: امکان انتخاب نرخ‌های ۵، ۱۰ و ۱۵ برابر.
  • سازوکار: اسکن اولیه تصاویر فشرده و سپس فراخوانی ابزاری برای بازیابی نسخه بدون فشرده‌سازی صفحات مرتبط.

این معماری در واقع تکامل‌یافته‌ی رویکردهایی است که در مدل‌های بینایی ۸ میلیاردی برای بهینه‌سازی استخراج اسناد به کار گرفته شده بود تا پیچیدگی‌های پردازش متون طولانی کاهش یابد.

بر اساس مستندات اپل، این متد فرضیه قدیمی را که «تمام بخش‌های یک سند به وضوح بالا نیاز دارند» به چالش می‌کشد. برای کاربر عملی، این یعنی امکان پرس‌وجو از مجموعه‌های عظیم PDF بدون برخورد با محدودیت حافظه یا از دست دادن جزئیات متون ریز.

اپل با تبدیل تصویر به یک شاخص قابل جست‌وجو به جای یک ورودی ایستا، به سمت ادراک بصری عامل‌محور (Agentic) حرکت می‌کند. این رویکرد یادآور نوآوری‌های مدل NeoMME است که با کاهش چشمگیر هزینه ذخیره‌سازی بردارها، مدیریت داده‌های بصری حجیم را تسهیل کرد. این یعنی مدل‌های آینده فقط تصویر را «نمی‌بینند»، بلکه فعالانه تصمیم می‌گیرند کدام بخش صحنه برای درک درست، به وضوح بیشتری نیاز دارد.

گام بعدی شما

  • مخزن رسمی مدل را کلون کرده و دمو را با مدل apple/LensVLM-9B در Hugging Face اجرا کنید.
  • نرخ‌های مختلف فشرده‌سازی (۵x تا ۱۵x) را روی اسناد پیچیده خود تست کنید تا نقطه شکست دقت را بیابید.
  • این مدل را برای استخراج داده از فرم‌های طولانی که بخش‌های کوچکی از آن‌ها حیاتی است، به کار بگیرید.

اما تأثیر این رویکرد بر کاهش هزینه‌های استنتاج در مقیاس سازمانی حتی جذاب‌تر است — به تحلیل ما درباره بهینه‌سازی GPUها مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص اپل در بهینه‌سازی سخت‌افزار و نرم‌افزار، استانداردی جدید برای پردازش اسناد حجیم تعریف می‌کند. اکنون مدل‌ها می‌توانند بدون نیاز به سخت‌افزارهای فوق‌سنگین، دقت سطح صنعتی را در تحلیل‌های بصری حفظ کنند.

تأثیر برای ایران

به‌دلیل انتشار وزن‌های باز در Hugging Face، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به APIهای پولی، این مدل را برای اتوماسیون اسناد اداری فارسی به کار بگیرند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی ورودی‌های استاتیک با ادراک پویا، مدل‌های بینایی را از «ناظر» به «جست‌وجوگر» تبدیل می‌کند. این تغییر پارادایم نشان می‌دهد که مسیر بهینه‌سازی مدل‌های بزرگ، دیگر تنها در افزایش پارامترها نیست، بلکه در هوشمند کردن نحوه مصرف توکن‌های بصری است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.