قابلیتهای عاملمحور دیگر نیازمند خوشههای عظیم ابری نیستند تا بهطور مؤثر عمل کنند. مدل LFM2.5-2.6B ثابت میکند که برنامهریزی پیچیده و فراخوانی ابزارها میتواند بهطور کامل روی گوشیها، لپتاپها و رباتها، بدون خروج دادهها از سختافزار، رخ دهد. این مدل با بهینهسازی برای اجرای روی دستگاه (On-device)، اجازه میدهد تا عملیاتهای پیچیده بدون نیاز به ارسال داده به سرورهای خارجی انجام شود.
این عرضه در حالی صورت میگیرد که صنعت به سمت مدلهای کوچکتر و تخصصی برای کاهش تأخیر (Latency) و هزینههای API حرکت میکند. همانطور که در تحلیلهای پیشین ما دربارهی لایههای زیرساختی عاملهای هوش مصنوعی اشاره کردیم، نیاز به کانالهای ارتباطی متنوع وجود دارد؛ اکنون LFM2.5-2.6B میتواند بهعنوان یک گره محلی در این ساختار عمل کرده و هزینه توکنهای مربوط به عاملهای پسزمینه را که بهطور مداوم در حال اجرا هستند، بهطور کامل حذف کند. این رویکرد در راستای رقابت با مدلهای پیشرو در عملیاتهای عاملمحور است، مشابه آنچه اخیراً در مورد برتری مدل Inkling نسبت به رقبای داخلی مشاهده شد.
زمینه و معماری
به نقل از گزارش Marktechpost، این مدل دارای ۲.۶۹ میلیارد پارامتر در ۳۰ لایه است و از معماری ترکیبی شامل ۲۲ بلوک کانولوشن کوتاه با گیت دوگانه (Double-gated short convolution blocks) و ۸ بلوک توجه پرسوجوی گروهی (Grouped-Query Attention) استفاده میکند. این مدل روی حدود ۳۴ تریلیون توکن پیشآموزش (Pre-training) دیده شده و از یک پنجره زمینه (Context Window) با ظرفیت ۱۳۱,۰۷۲ توکن پشتیبانی میکند.
برای دستیابی به این سطح از عملکرد، Liquid AI واژگان مدل را به ۱۲۸,۰۰۰ مورد افزایش داد. این کار از طریق گسترش توکنایزر موجود در همان محل انجام شد، بهجای آنکه مدل از ابتدا دوباره آموزش ببیند. سپس یک مرحله آموزش میانی (Mid-training) اختصاصی برای گسترش پنجره متنی به ۱۲۸ هزار توکن طی شد. خروجی این فرآیند، مدلی است که از ۱۶ زبان پشتیبانی میکند و صرفاً متنی است.
این شرکت دو نسخه مختلف ارائه کرده است: LFM2.5-2.6B-Base برای کسانی که قصد انجام تنظیم دقیق (Fine-tuning) شخصی مدل را دارند، و LFM2.5-2.6B که بهطور خاص برای گردشکارهای عاملمحور (Agentic workloads) پسآموزش دیده است.
جزئیات فنی و استقرار
مشخصات فنی و استقرار این مدل به شرح زیر است:
- عملکرد: سرعت رمزگشایی ۲۲۰ توکن در ثانیه روی تراشه M5 Max با مصرف کمتر از ۲.۵ گیگابایت حافظه؛ و ۳۰ توکن در ثانیه روی گوشیهای موبایل.
- فرمتها: پشتیبانی از فرمتهای native، GGUF، MLX و ONNX و سازگاری کامل از روز اول با llama.cpp، vLLM، SGLang و LM Studio.
- فرآیند آموزش: یک مسیر چهارمرحلهای پسآموزش شامل: دو دور تنظیم نظارتشده (SFT) با ترکیبی از دادهها که هفت برابر بزرگتر از مدل LFM2.5-8B-A1B بود؛ تخصصیافتگی معلم از طریق یادگیری تقویتی (RL) با پاداشهای قابل تأیید؛ تقطیر (Distillation) چنددامنه بر اساس سیاست (On-policy)؛ و در نهایت RL عاملمحور با استفاده از GRPO در محیطهایی مانند Hermes Agent و OpenClaw.
- مقیاسپذیری: توسعهدهندگان مستقل میتوانند روی سختافزار شخصی خود مدل را تست کنند و تیمهای بازار متوسط میتوانند با استفاده از یک کارت NVIDIA H100 SXM5، روزانه حدود ۱.۳ میلیارد توکن سرویسدهی کنند.

بررسی نتایج بنچمارکها
بر اساس بررسی نتایج بنچمارکها، مدل LFM2.5-2.6B در چندین حوزه کلیدی از رقبای بزرگتر مانند gemma-4-E4B-it (۸ میلیارد پارامتر) و Qwen3.5-9B (۹.۷ میلیارد پارامتر) پیشی گرفته است. این مدل در آزمون ToolSandbox امتیاز ۷۷.۸ را کسب کرد، در حالی که این عدد برای gemma-4-E4B-it برابر ۶۵.۰ و برای Qwen3.5-9B برابر ۷۶.۴۴ بود. همچنین در معیارهای Multi-IF (۸۰.۰۷) و IFStruct (۸۵.۴۹) پیشتاز بود، هرچند در BFCLv4 با امتیاز ۵۶.۸۸، اندکی عقبتر از Qwen3.5-9B (۶۰.۱۳) قرار گرفت.
برای متخصصان فنی، این نتیجه فرضیه وابستگی شدید قابلیتهای عاملمحور به تعداد پارامترها را به چالش میکشد. توانایی رقابت با مدلهایی که چهار برابر بزرگتر هستند، نشان میدهد کیفیت خط لوله پسآموزش — بهویژه استفاده از پاداشهای قابل تأیید و معلمان تخصصی در هر دامنه — برای وظایف استفاده از ابزار (Tool Use) حیاتیتر از مقیاس خام مدل است. این تمرکز بر بهینهسازی عملکرد در محیطهای چندزبانه و پیچیده، یادآور دستاوردهای اخیر در مدلهای تخصصی است، مانند مدل Laguna S 2.1 که در بنچمارک SWE-bench چندزبانه جایگاه نخست را به دست آورد.
کاربردهای صنعتی
این مدل برای صنایع با حساسیت بالا مانند خودروسازی، لوازم الکترونیکی مصرفی، رباتیک صنعتی، بهداشت و درمان، خدمات مالی، تجارت الکترونیک و دفاعی طراحی شده است؛ جایی که محیطهای تنظیمشده و ایزوله (Air-gapped) بیشترین بهره را میبرند، زیرا هیچ پرامپتی به APIهای شخص ثالث ارسال نمیشود و حریم خصوصی کاملاً حفظ میگردد.
کاربردهای پیشنهادی عبارتند از:
- گردشکارهای عاملمحور: دستیارهای محلی روی دستگاه و عاملهای پسزمینه.
- پردازش داده: تفکیک آفلاین اسناد در ورودیهای ۱۲۸ هزار توکنی و استخراج داده از فرمها و فاکتورها.
- رباتیک: تجزیه و تحلیل دستورات برای سختافزارهای صنعتی.
- تولید بازیابیافزا (RAG): استخراج داده و گردشکارهای با زمینه طولانی.
با این حال، این مدل جایگزینی برای همه کاربردها نیست. Liquid AI صراحتاً هشدار داده است که برای وظایف دانشمحور یا کدنویسی پیچیده، مدلهای بزرگتر مانند Qwen3.5-9B همچنان برتری قابلتوجهی دارند؛ برای مثال در LiveCodeBenchv6، مدل Qwen با امتیاز ۶۹.۸۶ در برابر ۵۹.۴۱ مدل LFM قرار دارد.
توسعهدهندگان اکنون میتوانند این مدل را از طریق Hugging Face تحت لایسنس lfm1.0 اجرا کنند. همچنین تنظیم دقیق از طریق لورا (LoRA) با ابزارهای TRL و Unsloth امکانپذیر است. کسانی که در صنایع تحت نظارت فعالیت میکنند، میتوانند این وزنها را روی ناوگان دستگاههای ایزوله مستقر کنند تا از حریم خصوصی مطلق دادهها اطمینان حاصل کنند.
باید منتظر ماند و دید این مدل چگونه با اکوسیستم نوظهور چارچوبهای عامل محلی (Local-first) ادغام میشود، بهویژه اکنون که پشتیبانی از GGUF و ONNX استقرار گستردهتر آن را در لوازم الکترونیکی مصرفی ممکن میسازد.
گام بعدی شما
- تست مدل LFM2.5-2.6B روی سختافزارهای لبه (Edge) برای سنجش تأخیر در فراخوانی ابزارها.
- بررسی جایگزینی مدلهای ابری گرانقیمت با این مدل در وظایف استخراج داده از اسناد محلی.
- آزمایش قابلیتهای RAG در پنجره متنی ۱۲۸ هزار توکنی برای تحلیل مجموعهای از فایلهای آفلاین.




گفتگو