پرش به محتوای اصلی
پرش به محتوای مقاله

«تخصص در درک رابط‌های کاربری»؛ اولویت جدید مدل LFM2.5-VL-3B

·۲۱ مرداد ۱۴۰۵۵ دقیقه مطالعه۲ بازدید
معماری LFM2.5-VL-3B برای قابلیت‌های بینایی بهتر و سریع‌تر در لبه شبکه
معماری LFM2.5-VL-3B برای قابلیت‌های بینایی بهتر و سریع‌تر در لبه شبکه
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

دستیابی به توان عملیاتی ۱۱ هزار توکن بر ثانیه در یک مدل بینایی-زبانی کوچک؛ این مدل برخلاف رقبای خود، سرعت استنتاج را فدای زنجیره تفکر نکرده و برای کاربردهای بلادرنگ (Real-time) بهینه شده است.

تصور کنید دستیاری بصری دارید که صفحه نمایش شما را در میلی‌ثانیه می‌خواند و بدون ارسال حتی یک بایت داده به سرورهای ابری، دستورات شما را اجرا می‌کند. این تجربه اکنون با مدل LFM2.5-VL-3B به واقعیت تبدیل شده است.

یک واحد پردازش گرافیکی H100 در روز قادر است نزدیک به یک میلیارد توکن خروجی با این مدل تولید کند. Liquid AI در ۱۲ اوت ۲۰۲۶ این مدل را منتشر کرد تا کفِ عملکرد مدل‌های بینایی-زبانی در رایانش لبه (Edge Computing) — یعنی همان پردازش روی لپ‌تاپ، گوشی هوشمند یا سرورهای محلی، جایی که حافظه محدود و توان مصرفی پایین است — را بازتعریف کند. این رویکرد بهینه‌سازی برای سخت‌افزارهای محلی، مشابه استراتژی انویدیا در مدل Cosmos 3 Edge برای پیش‌بینی اقدامات فیزیکی در لبه است که بر کاهش تأخیر در محیط‌های عملیاتی تمرکز دارد. این مدل به‌جای زنجیره‌های استدلالی کند، بر پاسخ‌های مستقیم تمرکز دارد تا تأخیر را به حداقل برساند و پاسخ‌ها برای برنامه‌های بلادرنگ و روی-دستگاه سریع باقی بمانند.

بسیاری از مدل‌های بینایی برای پاسخ‌دهی سریع به خوشه‌های عظیم ابری نیاز دارند تا کاربر احساس سرعت کند، اما هدف Liquid AI سخت‌افزارهای محلی است. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی مدل‌های زبانی کوچک (SLM) اشاره کردیم، گرایش صنعت به سمت مدل‌هایی است که بدون نیاز به اینترنت، هوشمندی را به دستگاه کاربر بیاورند.

به نقل از گزارش رسمی Liquid AI، این مدل از یک رمزگذار بینایی SigLIP2 400M NaFlex و یک بدنه متنی ۲.۶ میلیارد پارامتری استفاده می‌کند. این مدل روی ۳۴ تریلیون توکن پیش‌آموزش دیده است که حجم داده‌های بینایی آن چهار برابر نسخه‌های قبلی است. این داده‌ها از مجموعه‌های منتخب و مصنوعی شامل شرح تصاویر (image-caption)، نویسه‌خوانی نوری (OCR) — شبیه به اسکنری که متن چاپ شده را به متن دیجیتال تبدیل می‌کند —، مبنی‌سازی (grounding) و مجموعه‌های دنبال‌کردن دستورالعمل‌ها استخراج شده‌اند. در همین راستا، ابزارهایی مانند Oxlo.ai نیز با تبدیل زبان طبیعی به مختصات مکانی، فرآیند قطعه‌بندی تصویر را خودکار کرده‌اند تا دقت مبنی‌سازی بصری افزایش یابد.

برای پشتیبانی از زبان‌های غیرلاتین، تیم توسعه توکن‌ساز را به ۱۲۸ هزار ورودی گسترش داد تا بدون نیاز به آموزش مجدد از ابتدا، پشتیبانی چندزبانه در میان خطوط متنوع بهبود یابد. این دو برابر شدن حجم واژگان، تضمین‌کننده پشتیبانی بهتر از زبان‌های مختلف است.

فرآیند پس‌آموزش در دو مرحله مجزا انجام شد: ابتدا تنظیم نظارت‌شده (SFT) — مثل وقتی به یک پزشک عمومی، تخصص پوست می‌دهیم تا روی یک حوزه دقیق شود — با استفاده از روش Antidoom و distillation (تقطیر دانش) از یک مدل معلم بزرگ‌تر صورت گرفت. در مرحله دوم، مدل از طریق یادگیری تقویتی با پاداش‌های چندگانه (RL) پالایش و بهینه شد.

قابلیت‌های فنی و بنچمارک‌ها

مدل LFM2.5-VL-3B بر چهار محور اصلی بهبود معماری تمرکز دارد:

  • درک صفحه و رابط کاربری (UI): مهارت بالا در تفسیر محیط‌های دیجیتال در دستگاه‌های موبایل و دسکتاپ.
  • مبنی‌سازی (Grounding): تشخیص دقیق‌تر اشیا با استفاده از پرس‌وجوهای زبان طبیعی.
  • ورودی چند-تصویری: استدلال بهبودیافته هنگام پردازش چندین فریم بصری به صورت هم‌زمان.
  • فراخوانی تابع (Function Calling): توانایی قوی‌تر در استفاده از ابزارها، هم در سناریوهای صرفاً متنی و هم در سناریوهای ترکیبی متن و تصویر.

معماری LFM2.5-VL-3B برای قابلیت‌های بینایی بهتر و سریع‌تر در لبه شبکه

بر اساس مستندات منتشر شده، این مدل در تست‌های رودررو، در وظایف واقعی تصویری پیشتاز کلاس وزنی خود است. این مدل در محک RefCOCO-avg امتیاز ۸۷.۹ و در ScreenSpot-v2 Mobile امتیاز ۸۱.۲ را کسب کرد و از چندین مدل بزرگ‌تر در بازه ۴ تا ۸ میلیارد پارامتر پیشی گرفت. همچنین در خواندن اسناد و نمودارها با امتیاز ۹۱.۱ در DocVQA (val) و ۸۱.۳ در ChartQA (test) عملکرد درخشانی داشت.

تحلیل معیارهای عملکرد

ارزیابی‌ها با استفاده از vLLM 0.26.0 در حالت غیر استدلالی (non-reasoning mode) انجام شده است. نتایج در حوزه‌های تخصصی به شرح زیر است:

  • درک بصری: امتیاز ۶۳.۳ در MMStar و ۷۳.۱ در MME. همچنین امتیاز ۷۷.۷ در SEED-Bench (image) و ۸۱.۰ در MMBench (dev EN v1.1) را به دست آورد.
  • توانایی چندزبانه: مدل به امتیاز ۸۳.۰ در Multilingual MMMB و ۷۹.۵ در Multilingual MMBench رسید.
  • منطق و STEM: امتیاز ۶۸.۵ در MathVista (mini)، ۳۷.۴ در LogicVista و ۴۸.۴ در MMMU (val) ثبت شد.
  • OCR و اسناد: امتیاز ۸۴.۲ در OCRBench v1، ۸۴.۳ در TextVQA (val) و ۷۰.۲ در InfographicVQA (val) کسب شد.
  • درک GUI: امتیاز ۷۸.۷ در ScreenSpot-v2 Desktop و ۸۲.۲ در ScreenSpot-v2 Web به دست آمد.
  • چند-تصویری: امتیاز ۶۱.۵ در BLINK و ۵۸.۳ در MuirBench ثبت شد.
  • کنترل توهم: امتیاز ۸۸.۷ در POPE برای کاهش توهم (Hallucination) — وقتی مدل با اطمینان چیزی می‌گوید که اصلاً وجود ندارد — و ۴۷.۲ در HallusionBench کسب شد.

علاوه بر بینایی، توانایی دنبال‌کردن دستورات متنی و استفاده از ابزارها نیز به‌شدت بهبود یافته است. در محک ToolSandbox، این مدل امتیاز ۵۹.۵ را کسب کرد که آن را در رده مدل‌های بزرگ‌تری مثل Gemma-4-E2B و Qwen3.5-2B قرار می‌دهد. همچنین امتیاز ۸۲.۳ در IFEval و ۳۲.۵ در BFCL V4 برای فراخوانی توابع ثبت شد.

عملکرد سخت‌افزاری

بهینگی، وجه تمایز اصلی این مدل است. این مدل در ۳ گیگابایت حافظه جای می‌گیرد و روی یک Galaxy S26 Ultra با سرعت ۲۰ توکن بر ثانیه اجرا می‌شود. در سخت‌افزارهای قدرتمندتر، سرعت به ۲۲۸ توکن بر ثانیه در M5 Max و ۱۱۶ توکن بر ثانیه در Ryzen AI Max+ 395 می‌رسد.

معماری LFM2.5-VL-3B برای قابلیت‌های بینایی بهتر و سریع‌تر در لبه شبکه

معماری مدل بینایی-زبانی LFM2.5-VL-3B برای پردازش سریع‌تر و کارآمدتر در دستگاه‌های لبه‌ای

برای استقرار در سطح سازمانی، توان عملیاتی (Throughput) به‌شدت افزایش می‌یابد. در حالت هم‌زمانی بالا، مدل به ۱۱,۰۰۰ توکن بر ثانیه می‌رسد که تقریباً دو برابر مدل‌های کلاس ۴ میلیارد پارامتری است. این ویژگی، LFM2.5 را به سریع‌ترین مدل آزمایش‌شده برای ورودی‌های چند-فریمی تبدیل می‌کند.

مدل LFM2.5-VL-3B برای قابلیت‌های بینایی بهتر و سریع‌تر در لبه شبکه

پیاده‌سازی

توسعه‌دهندگان می‌توانند این مدل را از طریق کتابخانه transformers (نسخه ۵.۱۰.۱ یا بالاتر) مستقر کنند. این مدل با اکوسیستم‌های استنتاج گسترده‌ای از جمله vLLM، llama.cpp، MLX، SGLang و ONNX سازگار است.

معماری LFM2.5-VL-3B برای قابلیت‌های بینایی بهتر و سریع‌تر در لبه شبکه

چرخش به سمت مدل‌های بینایی کوچک با توان عملیاتی بالا، این فرض را که «هوشمندی» مستلزم مقیاس عظیم است، به چالش می‌کشد. Liquid AI با بهینه‌سازی سرعت خروجی و حافظه محلی، اولویت را از «اول-ابر» به «اول-محلی» تغییر داده است. برای کاربر نهایی، این یعنی تأخیر کمتر، حریم خصوصی بیشتر و برنامه‌هایی که آفلاین کار می‌کنند.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، مدل را از Hugging Face دانلود کنید تا برای اتوماسیون رابط‌های کاربری (UI) خاص، آن را تنظیم دقیق (Fine-tuning) کنید.
  • قابلیت‌های مدل را از طریق دموی WebGPU در مرورگر تست کنید تا سرعت استنتاج محلی را تجربه کنید.
  • در پروژه‌های خود، جایگزینی مدل‌های ابری سنگین با LFM2.5 را برای کاهش هزینه استنتاج بررسی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با تکیه بر تخصص Liquid AI در بهینه‌سازی معماری، اثبات می‌کند که مدل‌های زیر ۳ میلیارد پارامتر می‌توانند در وظایف پیچیده بصری با مدل‌های بسیار بزرگ‌تر رقابت کنند. این دستاورد، مسیر استقرار هوش مصنوعی در دستگاه‌های پوشیدنی و موبایل را بدون وابستگی به ابر هموار می‌کند.

تأثیر برای ایران

به‌دلیل وزن‌های باز (Open Weights)، توسعه‌دهندگان ایرانی می‌توانند این مدل را به‌صورت محلی میزبانی کنند و از محدودیت‌های API و تحریم‌های سرویس‌های ابری عبور کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز Liquid AI بر حذف زنجیره‌های استدلالی کند در مدل‌های لبه، نشان می‌دهد که برای کاربر نهایی، «سرعت پاسخ» در کاربردهای بصری (مانند دستیارهای UI) ارزشمندتر از «عمق استدلال» است. این رویکرد، پارادایم مدل‌های چندوجهی را از شبیه‌سازی تفکر انسانی به سمت تبدیل شدن به یک موتور پردازش سریع داده‌های بصری سوق می‌دهد. در واقع، ما شاهد تولد مدل‌هایی هستیم که به‌جای «فکر کردن»، «واکنش» نشان می‌دهند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.