پرش به محتوای اصلی
پرش به محتوای مقاله

LFM2.5-8B-A1B: نمره ۹۱.۸۴ در IFEval با تنها ۱.۵ میلیارد پارامتر فعال

·۸ خرداد ۱۴۰۵۳ دقیقه مطالعه
اشتراک‌گذاری

اگر در حال توسعه‌ی عامل‌های محلی هستید، محدودیت‌های سخت‌افزاری شما همین امروز تغییر کرد. تصور کنید یک مدل استدلالی قدرتمند را بدون نیاز به اینترنت و سرورهای ابری، مستقیماً روی گوشی خود داشته باشید.

این تحول به معنای پایان وابستگی به پردازنده‌های عظیم است. مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — اکنون می‌تواند روی سخت‌افزارهای کوچک جای بگیرد. همان‌طور که در تحلیل قبلی ما درباره‌ی مدل‌های کوچک و بهینه اشاره کردیم، بازدهی در حال جایگزینی حجم مطلق است.

شرکت Liquid AI در ۲۸ مه ۲۰۲۶ مدل LFM2.5-8B-A1B را معرفی کرد. طبق اعلام این شرکت، مدل از معماری ترکیبی متخصصان (MoE) — شبیه تیمی از متخصصان که فقط فرد مورد نیاز برای هر سؤال فراخوانده می‌شود — استفاده می‌کند. این رویکرد یادآور پیشرفت‌های اخیر در بهینه‌سازی مدل‌هاست، مانند مدل EMO که توانست با حذف بخش بزرگی از متخصصان، عملکرد خود را حفظ کند. این مدل در مجموع ۸.۳ میلیارد پارامتر دارد، اما برای هر توکن تنها ۱.۵ میلیارد پارامتر فعال می‌شود تا هزینه‌ی محاسبات کاهش یابد.

بر اساس مستندات فنی این شرکت، ویژگی‌های کلیدی مدل عبارتند از:

  • پنجره متنی (Context Window) — مثل میز کاری که جا برای چند ورق دارد — به اندازه ۱۳۱,۰۷۲ توکن.
  • مقیاس پیش‌آموزش از ۱۲ تریلیون به ۳۸ تریلیون توکن.
  • افزایش نرخ عدم توهم (Hallucination) از ۷.۴۶ به ۶۳.۴۷.

رونمایی Liquid AI از مدل MoE روی‌دستگاه LFM2.5-8B-A1B با ۸.۳ میلیارد پارامتر کل و ۱.۵ میلیارد فعال

در بخش سخت‌افزار، این مدل بسیار بهینه است. به گزارش Liquid AI، مدل روی تراشه M5 Max با سرعت ۲۵۳ توکن در ثانیه اجرا می‌شود و کمتر از ۶ گیگابایت رم اشغال می‌کند. روی یک گوشی معمولی نیز سرعت ۳۰ توکن در ثانیه را حفظ می‌کند. همچنین در بنچمارک IFEval، عملکرد آن با مدل بسیار بزرگ‌تر Gemma-4-26B-A4B-IT برابری می‌کند. پیش از این، گزارش‌های فنی درباره‌ی اجرای بهینه مدل Gemma 4 26B روی سخت‌افزارهای تک‌پردازشی نشان داده بود که بهینه‌سازی سرعت استنتاج در مدل‌های بزرگ‌تر نیز در حال پیشرفت است.

این یعنی شما می‌توانید یک عامل (Agent) استدلالی را روی لپ‌تاپ خود بدون کلید API اجرا کنید. این مدل از زنجیره تفکر (Chain-of-Thought) — مثل وقتی شاگرد ریاضی پای تخته بلند بلند فکر می‌کند تا به جواب برسد — برای هر پاسخ استفاده می‌کند. اگرچه این روش تعداد توکن‌ها را زیاد می‌کند، اما به دلیل پایین بودن تعداد پارامترهای فعال، هزینه استنتاج (Inference) — یعنی لحظه‌ای که مدل واقعاً جواب تولید می‌کند — ناچیز باقی می‌ماند.

رونمایی Liquid AI از مدل MoE روی‌دستگاه LFM2.5-8B-A1B با ۸.۳ میلیارد پارامتر کل و ۱.۵ میلیارد فعال

گام بعدی شما

  • مدل را از طریق vLLM یا llama.cpp تست کنید تا ببینید آیا جایگزین ابزارهای ابری شما می‌شود یا خیر.
  • بررسی کنید که آیا مدل در وظایف خاص شما، نرخ توهم را کاهش می‌دهد.
  • منتظر ادغام این مدل در پلتفرم لبه‌ی LEAP باشید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است؛ اثر این بهینه‌سازی بر مصرف باتری دستگاه‌های لبه را در گزارش بعدی بررسی خواهیم کرد.

چرا این موضوع مهم است؟

این مدل با تکیه بر اعتبار بنچمارک IFEval ثابت کرد که استدلال سطح بالا را می‌توان از مراکز داده به جیب کاربر منتقل کرد. این تغییر، حریم خصوصی مطلق و سرعت پاسخ‌دهی آنی را برای کاربر نهایی به واقعیت تبدیل می‌کند.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.