پرش به محتوای اصلی
پرش به محتوای مقاله

مدل LFM2.5-2.6B؛ برتری مدل‌های کوچک در فراخوانی ابزارها

·۱۶ مرداد ۱۴۰۵۳ دقیقه مطالعه۱ بازدید
ال‌اف‌ام ۲.۵-۲.۶ بی: مدل عامل محلی با کانتکست ۱۲۸ هزار، فراخوانی ابزار و وزن‌های باز
ال‌اف‌ام ۲.۵-۲.۶ بی: مدل عامل محلی با کانتکست ۱۲۸ هزار، فراخوانی ابزار و وزن‌های باز
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

دستیابی به عملکرد برتر در فراخوانی ابزارها توسط مدلی با ۲.۶ میلیارد پارامتر در برابر مدل‌های ۴ برابر بزرگ‌تر؛ این موضوع نشان می‌دهد مقیاس مدل دیگر شرط لازم برای قابلیت‌های Agentic نیست.

قابلیت‌های عامل‌محور دیگر نیازمند خوشه‌های عظیم ابری نیستند تا به‌طور مؤثر عمل کنند. مدل LFM2.5-2.6B ثابت می‌کند که برنامه‌ریزی پیچیده و فراخوانی ابزارها می‌تواند به‌طور کامل روی گوشی‌ها، لپ‌تاپ‌ها و ربات‌ها، بدون خروج داده‌ها از سخت‌افزار، رخ دهد. این مدل با بهینه‌سازی برای اجرای روی دستگاه (On-device)، اجازه می‌دهد تا عملیات‌های پیچیده بدون نیاز به ارسال داده به سرورهای خارجی انجام شود.

این عرضه در حالی صورت می‌گیرد که صنعت به سمت مدل‌های کوچک‌تر و تخصصی برای کاهش تأخیر (Latency) و هزینه‌های API حرکت می‌کند. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی لایه‌های زیرساختی عامل‌های هوش مصنوعی اشاره کردیم، نیاز به کانال‌های ارتباطی متنوع وجود دارد؛ اکنون LFM2.5-2.6B می‌تواند به‌عنوان یک گره محلی در این ساختار عمل کرده و هزینه توکن‌های مربوط به عامل‌های پس‌زمینه را که به‌طور مداوم در حال اجرا هستند، به‌طور کامل حذف کند. این رویکرد در راستای رقابت با مدل‌های پیشرو در عملیات‌های عامل‌محور است، مشابه آنچه اخیراً در مورد برتری مدل Inkling نسبت به رقبای داخلی مشاهده شد.

زمینه و معماری

به نقل از گزارش Marktechpost، این مدل دارای ۲.۶۹ میلیارد پارامتر در ۳۰ لایه است و از معماری ترکیبی شامل ۲۲ بلوک کانولوشن کوتاه با گیت دوگانه (Double-gated short convolution blocks) و ۸ بلوک توجه پرس‌وجوی گروهی (Grouped-Query Attention) استفاده می‌کند. این مدل روی حدود ۳۴ تریلیون توکن پیش‌آموزش (Pre-training) دیده شده و از یک پنجره زمینه (Context Window) با ظرفیت ۱۳۱,۰۷۲ توکن پشتیبانی می‌کند.

برای دستیابی به این سطح از عملکرد، Liquid AI واژگان مدل را به ۱۲۸,۰۰۰ مورد افزایش داد. این کار از طریق گسترش توکنایزر موجود در همان محل انجام شد، به‌جای آنکه مدل از ابتدا دوباره آموزش ببیند. سپس یک مرحله آموزش میانی (Mid-training) اختصاصی برای گسترش پنجره متنی به ۱۲۸ هزار توکن طی شد. خروجی این فرآیند، مدلی است که از ۱۶ زبان پشتیبانی می‌کند و صرفاً متنی است.

این شرکت دو نسخه مختلف ارائه کرده است: LFM2.5-2.6B-Base برای کسانی که قصد انجام تنظیم دقیق (Fine-tuning) شخصی مدل را دارند، و LFM2.5-2.6B که به‌طور خاص برای گردش‌کارهای عامل‌محور (Agentic workloads) پس‌آموزش دیده است.

جزئیات فنی و استقرار

مشخصات فنی و استقرار این مدل به شرح زیر است:

  • عملکرد: سرعت رمزگشایی ۲۲۰ توکن در ثانیه روی تراشه M5 Max با مصرف کمتر از ۲.۵ گیگابایت حافظه؛ و ۳۰ توکن در ثانیه روی گوشی‌های موبایل.
  • فرمت‌ها: پشتیبانی از فرمت‌های native، GGUF، MLX و ONNX و سازگاری کامل از روز اول با llama.cpp، vLLM، SGLang و LM Studio.
  • فرآیند آموزش: یک مسیر چهارمرحله‌ای پس‌آموزش شامل: دو دور تنظیم نظارت‌شده (SFT) با ترکیبی از داده‌ها که هفت برابر بزرگ‌تر از مدل LFM2.5-8B-A1B بود؛ تخصص‌یافتگی معلم از طریق یادگیری تقویتی (RL) با پاداش‌های قابل تأیید؛ تقطیر (Distillation) چنددامنه بر اساس سیاست (On-policy)؛ و در نهایت RL عامل‌محور با استفاده از GRPO در محیط‌هایی مانند Hermes Agent و OpenClaw.
  • مقیاس‌پذیری: توسعه‌دهندگان مستقل می‌توانند روی سخت‌افزار شخصی خود مدل را تست کنند و تیم‌های بازار متوسط می‌توانند با استفاده از یک کارت NVIDIA H100 SXM5، روزانه حدود ۱.۳ میلیارد توکن سرویس‌دهی کنند.

GenOffice: مجموعه اداری رایگان و بدون تبلیغات Genspark با اسناد، صفحات، ارائه و PDF برای macOS و Windows

بررسی نتایج بنچمارک‌ها

بر اساس بررسی نتایج بنچمارک‌ها، مدل LFM2.5-2.6B در چندین حوزه کلیدی از رقبای بزرگ‌تر مانند gemma-4-E4B-it (۸ میلیارد پارامتر) و Qwen3.5-9B (۹.۷ میلیارد پارامتر) پیشی گرفته است. این مدل در آزمون ToolSandbox امتیاز ۷۷.۸ را کسب کرد، در حالی که این عدد برای gemma-4-E4B-it برابر ۶۵.۰ و برای Qwen3.5-9B برابر ۷۶.۴۴ بود. همچنین در معیارهای Multi-IF (۸۰.۰۷) و IFStruct (۸۵.۴۹) پیشتاز بود، هرچند در BFCLv4 با امتیاز ۵۶.۸۸، اندکی عقب‌تر از Qwen3.5-9B (۶۰.۱۳) قرار گرفت.

برای متخصصان فنی، این نتیجه فرضیه وابستگی شدید قابلیت‌های عامل‌محور به تعداد پارامترها را به چالش می‌کشد. توانایی رقابت با مدل‌هایی که چهار برابر بزرگ‌تر هستند، نشان می‌دهد کیفیت خط لوله پس‌آموزش — به‌ویژه استفاده از پاداش‌های قابل تأیید و معلمان تخصصی در هر دامنه — برای وظایف استفاده از ابزار (Tool Use) حیاتی‌تر از مقیاس خام مدل است. این تمرکز بر بهینه‌سازی عملکرد در محیط‌های چندزبانه و پیچیده، یادآور دستاوردهای اخیر در مدل‌های تخصصی است، مانند مدل Laguna S 2.1 که در بنچمارک SWE-bench چندزبانه جایگاه نخست را به دست آورد.

کاربردهای صنعتی

این مدل برای صنایع با حساسیت بالا مانند خودروسازی، لوازم الکترونیکی مصرفی، رباتیک صنعتی، بهداشت و درمان، خدمات مالی، تجارت الکترونیک و دفاعی طراحی شده است؛ جایی که محیط‌های تنظیم‌شده و ایزوله (Air-gapped) بیشترین بهره را می‌برند، زیرا هیچ پرامپتی به APIهای شخص ثالث ارسال نمی‌شود و حریم خصوصی کاملاً حفظ می‌گردد.

کاربردهای پیشنهادی عبارتند از:

  • گردش‌کارهای عامل‌محور: دستیارهای محلی روی دستگاه و عامل‌های پس‌زمینه.
  • پردازش داده: تفکیک آفلاین اسناد در ورودی‌های ۱۲۸ هزار توکنی و استخراج داده از فرم‌ها و فاکتورها.
  • رباتیک: تجزیه و تحلیل دستورات برای سخت‌افزارهای صنعتی.
  • تولید بازیابی‌افزا (RAG): استخراج داده و گردش‌کارهای با زمینه طولانی.

با این حال، این مدل جایگزینی برای همه کاربردها نیست. Liquid AI صراحتاً هشدار داده است که برای وظایف دانش‌محور یا کدنویسی پیچیده، مدل‌های بزرگ‌تر مانند Qwen3.5-9B همچنان برتری قابل‌توجهی دارند؛ برای مثال در LiveCodeBenchv6، مدل Qwen با امتیاز ۶۹.۸۶ در برابر ۵۹.۴۱ مدل LFM قرار دارد.

توسعه‌دهندگان اکنون می‌توانند این مدل را از طریق Hugging Face تحت لایسنس lfm1.0 اجرا کنند. همچنین تنظیم دقیق از طریق لورا (LoRA) با ابزارهای TRL و Unsloth امکان‌پذیر است. کسانی که در صنایع تحت نظارت فعالیت می‌کنند، می‌توانند این وزن‌ها را روی ناوگان دستگاه‌های ایزوله مستقر کنند تا از حریم خصوصی مطلق داده‌ها اطمینان حاصل کنند.

باید منتظر ماند و دید این مدل چگونه با اکوسیستم نوظهور چارچوب‌های عامل محلی (Local-first) ادغام می‌شود، به‌ویژه اکنون که پشتیبانی از GGUF و ONNX استقرار گسترده‌تر آن را در لوازم الکترونیکی مصرفی ممکن می‌سازد.

گام بعدی شما

  • تست مدل LFM2.5-2.6B روی سخت‌افزارهای لبه (Edge) برای سنجش تأخیر در فراخوانی ابزارها.
  • بررسی جایگزینی مدل‌های ابری گران‌قیمت با این مدل در وظایف استخراج داده از اسناد محلی.
  • آزمایش قابلیت‌های RAG در پنجره متنی ۱۲۸ هزار توکنی برای تحلیل مجموعه‌ای از فایل‌های آفلاین.
چرا این موضوع مهم است؟

این مدل با انتقال قابلیت‌های عامل‌محور به سخت‌افزار محلی، حریم خصوصی داده‌ها را تضمین و هزینه‌های استنتاج را به شدت کاهش می‌دهد. اعتبار این ادعا از طریق برتری در بنچمارک‌های Tool-use در برابر مدل‌های ۸ و ۹ میلیارد پارامتری تأیید شده است.

تأثیر برای ایران

به دلیل وزن‌های باز و قابلیت اجرا روی سخت‌افزارهای معمولی، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به پرداخت هزینه API یا درگیر شدن با تحریم‌ها، عامل‌های محلی قدرتمند بسازند.

·نگاه ما
تحریریه دات‌هوش

تمرکز Liquid AI بر پاداش‌های قابل تأیید (Verifiable Rewards) در مرحله پس‌آموزش، نشان می‌دهد که آینده مدل‌های کوچک در «تخصص‌یافتگی عملیاتی» است نه «دانش عمومی». این مدل ثابت می‌کند که برای تبدیل یک LLM به یک عامل (Agent) کارآمد، کیفیت داده‌های آموزشی و متدولوژی RL بسیار مؤثرتر از افزایش تعداد پارامترهاست.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.