تصور کنید دستیاری بصری دارید که صفحه نمایش شما را در میلیثانیه میخواند و بدون ارسال حتی یک بایت داده به سرورهای ابری، دستورات شما را اجرا میکند. این تجربه اکنون با مدل LFM2.5-VL-3B به واقعیت تبدیل شده است.
یک واحد پردازش گرافیکی H100 در روز قادر است نزدیک به یک میلیارد توکن خروجی با این مدل تولید کند. Liquid AI در ۱۲ اوت ۲۰۲۶ این مدل را منتشر کرد تا کفِ عملکرد مدلهای بینایی-زبانی در رایانش لبه (Edge Computing) — یعنی همان پردازش روی لپتاپ، گوشی هوشمند یا سرورهای محلی، جایی که حافظه محدود و توان مصرفی پایین است — را بازتعریف کند. این رویکرد بهینهسازی برای سختافزارهای محلی، مشابه استراتژی انویدیا در مدل Cosmos 3 Edge برای پیشبینی اقدامات فیزیکی در لبه است که بر کاهش تأخیر در محیطهای عملیاتی تمرکز دارد. این مدل بهجای زنجیرههای استدلالی کند، بر پاسخهای مستقیم تمرکز دارد تا تأخیر را به حداقل برساند و پاسخها برای برنامههای بلادرنگ و روی-دستگاه سریع باقی بمانند.
بسیاری از مدلهای بینایی برای پاسخدهی سریع به خوشههای عظیم ابری نیاز دارند تا کاربر احساس سرعت کند، اما هدف Liquid AI سختافزارهای محلی است. همانطور که در تحلیلهای پیشین ما دربارهی مدلهای زبانی کوچک (SLM) اشاره کردیم، گرایش صنعت به سمت مدلهایی است که بدون نیاز به اینترنت، هوشمندی را به دستگاه کاربر بیاورند.
به نقل از گزارش رسمی Liquid AI، این مدل از یک رمزگذار بینایی SigLIP2 400M NaFlex و یک بدنه متنی ۲.۶ میلیارد پارامتری استفاده میکند. این مدل روی ۳۴ تریلیون توکن پیشآموزش دیده است که حجم دادههای بینایی آن چهار برابر نسخههای قبلی است. این دادهها از مجموعههای منتخب و مصنوعی شامل شرح تصاویر (image-caption)، نویسهخوانی نوری (OCR) — شبیه به اسکنری که متن چاپ شده را به متن دیجیتال تبدیل میکند —، مبنیسازی (grounding) و مجموعههای دنبالکردن دستورالعملها استخراج شدهاند. در همین راستا، ابزارهایی مانند Oxlo.ai نیز با تبدیل زبان طبیعی به مختصات مکانی، فرآیند قطعهبندی تصویر را خودکار کردهاند تا دقت مبنیسازی بصری افزایش یابد.
برای پشتیبانی از زبانهای غیرلاتین، تیم توسعه توکنساز را به ۱۲۸ هزار ورودی گسترش داد تا بدون نیاز به آموزش مجدد از ابتدا، پشتیبانی چندزبانه در میان خطوط متنوع بهبود یابد. این دو برابر شدن حجم واژگان، تضمینکننده پشتیبانی بهتر از زبانهای مختلف است.
فرآیند پسآموزش در دو مرحله مجزا انجام شد: ابتدا تنظیم نظارتشده (SFT) — مثل وقتی به یک پزشک عمومی، تخصص پوست میدهیم تا روی یک حوزه دقیق شود — با استفاده از روش Antidoom و distillation (تقطیر دانش) از یک مدل معلم بزرگتر صورت گرفت. در مرحله دوم، مدل از طریق یادگیری تقویتی با پاداشهای چندگانه (RL) پالایش و بهینه شد.
قابلیتهای فنی و بنچمارکها
مدل LFM2.5-VL-3B بر چهار محور اصلی بهبود معماری تمرکز دارد:
- درک صفحه و رابط کاربری (UI): مهارت بالا در تفسیر محیطهای دیجیتال در دستگاههای موبایل و دسکتاپ.
- مبنیسازی (Grounding): تشخیص دقیقتر اشیا با استفاده از پرسوجوهای زبان طبیعی.
- ورودی چند-تصویری: استدلال بهبودیافته هنگام پردازش چندین فریم بصری به صورت همزمان.
- فراخوانی تابع (Function Calling): توانایی قویتر در استفاده از ابزارها، هم در سناریوهای صرفاً متنی و هم در سناریوهای ترکیبی متن و تصویر.

بر اساس مستندات منتشر شده، این مدل در تستهای رودررو، در وظایف واقعی تصویری پیشتاز کلاس وزنی خود است. این مدل در محک RefCOCO-avg امتیاز ۸۷.۹ و در ScreenSpot-v2 Mobile امتیاز ۸۱.۲ را کسب کرد و از چندین مدل بزرگتر در بازه ۴ تا ۸ میلیارد پارامتر پیشی گرفت. همچنین در خواندن اسناد و نمودارها با امتیاز ۹۱.۱ در DocVQA (val) و ۸۱.۳ در ChartQA (test) عملکرد درخشانی داشت.
تحلیل معیارهای عملکرد
ارزیابیها با استفاده از vLLM 0.26.0 در حالت غیر استدلالی (non-reasoning mode) انجام شده است. نتایج در حوزههای تخصصی به شرح زیر است:
- درک بصری: امتیاز ۶۳.۳ در MMStar و ۷۳.۱ در MME. همچنین امتیاز ۷۷.۷ در SEED-Bench (image) و ۸۱.۰ در MMBench (dev EN v1.1) را به دست آورد.
- توانایی چندزبانه: مدل به امتیاز ۸۳.۰ در Multilingual MMMB و ۷۹.۵ در Multilingual MMBench رسید.
- منطق و STEM: امتیاز ۶۸.۵ در MathVista (mini)، ۳۷.۴ در LogicVista و ۴۸.۴ در MMMU (val) ثبت شد.
- OCR و اسناد: امتیاز ۸۴.۲ در OCRBench v1، ۸۴.۳ در TextVQA (val) و ۷۰.۲ در InfographicVQA (val) کسب شد.
- درک GUI: امتیاز ۷۸.۷ در ScreenSpot-v2 Desktop و ۸۲.۲ در ScreenSpot-v2 Web به دست آمد.
- چند-تصویری: امتیاز ۶۱.۵ در BLINK و ۵۸.۳ در MuirBench ثبت شد.
- کنترل توهم: امتیاز ۸۸.۷ در POPE برای کاهش توهم (Hallucination) — وقتی مدل با اطمینان چیزی میگوید که اصلاً وجود ندارد — و ۴۷.۲ در HallusionBench کسب شد.
علاوه بر بینایی، توانایی دنبالکردن دستورات متنی و استفاده از ابزارها نیز بهشدت بهبود یافته است. در محک ToolSandbox، این مدل امتیاز ۵۹.۵ را کسب کرد که آن را در رده مدلهای بزرگتری مثل Gemma-4-E2B و Qwen3.5-2B قرار میدهد. همچنین امتیاز ۸۲.۳ در IFEval و ۳۲.۵ در BFCL V4 برای فراخوانی توابع ثبت شد.
عملکرد سختافزاری
بهینگی، وجه تمایز اصلی این مدل است. این مدل در ۳ گیگابایت حافظه جای میگیرد و روی یک Galaxy S26 Ultra با سرعت ۲۰ توکن بر ثانیه اجرا میشود. در سختافزارهای قدرتمندتر، سرعت به ۲۲۸ توکن بر ثانیه در M5 Max و ۱۱۶ توکن بر ثانیه در Ryzen AI Max+ 395 میرسد.


برای استقرار در سطح سازمانی، توان عملیاتی (Throughput) بهشدت افزایش مییابد. در حالت همزمانی بالا، مدل به ۱۱,۰۰۰ توکن بر ثانیه میرسد که تقریباً دو برابر مدلهای کلاس ۴ میلیارد پارامتری است. این ویژگی، LFM2.5 را به سریعترین مدل آزمایششده برای ورودیهای چند-فریمی تبدیل میکند.

پیادهسازی
توسعهدهندگان میتوانند این مدل را از طریق کتابخانه transformers (نسخه ۵.۱۰.۱ یا بالاتر) مستقر کنند. این مدل با اکوسیستمهای استنتاج گستردهای از جمله vLLM، llama.cpp، MLX، SGLang و ONNX سازگار است.

چرخش به سمت مدلهای بینایی کوچک با توان عملیاتی بالا، این فرض را که «هوشمندی» مستلزم مقیاس عظیم است، به چالش میکشد. Liquid AI با بهینهسازی سرعت خروجی و حافظه محلی، اولویت را از «اول-ابر» به «اول-محلی» تغییر داده است. برای کاربر نهایی، این یعنی تأخیر کمتر، حریم خصوصی بیشتر و برنامههایی که آفلاین کار میکنند.
گام بعدی شما
- اگر توسعهدهنده هستید، مدل را از Hugging Face دانلود کنید تا برای اتوماسیون رابطهای کاربری (UI) خاص، آن را تنظیم دقیق (Fine-tuning) کنید.
- قابلیتهای مدل را از طریق دموی WebGPU در مرورگر تست کنید تا سرعت استنتاج محلی را تجربه کنید.
- در پروژههای خود، جایگزینی مدلهای ابری سنگین با LFM2.5 را برای کاهش هزینه استنتاج بررسی کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو