پرش به محتوای اصلی
پرش به محتوای مقاله

مدل LFM2.5: پردازش متون طولانی بدون نیاز به GPU

·۷ مرداد ۱۴۰۵۵ دقیقه مطالعه
نمودار مقایسه سرعت استنتاج LFM2.5 با مدل‌های دیگر در متن‌های بلند روی CPU
نمودار مقایسه سرعت استنتاج LFM2.5 با مدل‌های دیگر در متن‌های بلند روی CPU
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

دستیابی به سرعت ۳.۷ برابری در استنتاج CPU برای متون طولانی (۸ هزار توکن) بدون افت کیفیت در مقایسه با مدل‌های ده برابر بزرگ‌تر؛ این اولین باری است که یک رمزگذار باز-وزنی این سطح از بهینه-سازی را روی CPU ارائه می‌دهد.

تصور کنید یک قرارداد حقوقی حجیم یا هزاران پیام پشتیبانی مشتری را در کمتر از ۳۰ ثانیه و تنها با یک لپ‌تاپ معمولی تحلیل کنید. در ۲۸ جولای ۲۰۲۶، شرکت Liquid AI دو مدل رمزگذار (Encoder) جدید با وزن‌های باز به نام‌های LFM2.5-Encoder-230M و LFM2.5-Encoder-350M را معرفی کرد که هدف آن‌ها استنتاج سریع در بسترهای متنی طولانی بدون نیاز به پردازشگر گرافیکی است.

بسیاری از کارهای عملیاتی در پردازش زبان طبیعی (NLP) — مانند مسیریابی قصد کاربر، شناسایی اطلاعات حساس (PII) یا فیلتر کردن محتوای ایمنی — به‌صورت شبانروزی و مداوم در پس‌زمینه اجرا می‌شوند. این وظایف معمولاً برای کاهش هزینه‌ها روی واحد پردازش مرکزی (CPU) اجرا می‌شوند، اما با افزایش طول متن ورودی، این سیستم‌ها به‌شدت دچار مشکل می‌شوند. در حالی که صنعت به سمت مدل‌های زبانی بزرگ (LLM) مولد حرکت کرد، مدل‌های کلاس «رمزگذار» که از دوران BERT تثبیت شدند، همچنان ابزار اصلی برای این حجم بالای کارهای طبقه‌بندی هستند. برای درک عمیق‌تر از نحوه عملکرد این سیستم‌ها، می‌توان به کالبدشکافی مهندسی مدل‌های زبانی پرداخت که مفاهیمی چون توکن‌سازی و توجه را بررسی می‌کند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی مدل‌های کوچک اشاره کردیم، تعادل بین سرعت و دقت کلید پذیرش این ابزارها در صنعت است. طبق گزارش Liquid AI، اگرچه بنچمارک‌های اخیر ModernBERT مرزهای سرعت و زمینه را جابه‌جا کرده بودند، اما معماری جدید LFM ادعا می‌کند که مقیاس‌پذیری را به‌طور بهینه‌تری مدیریت می‌کند. این مدل‌ها با بهره‌گیری از یک بدنه ترکیبی (Hybrid Backbone)، تضمین می‌کنند که هزینه‌های محاسباتی با افزایش طول ورودی، به‌کندی رشد کنند.

چرا یک رمزگذار همه‌منظوره؟

شرکت Liquid AI پیش‌تر مدل‌های LFM2.5-Retrievers را عرضه کرده بود که به‌طور تخصصی برای جست‌وجوی چندزبانه طراحی شده بودند. با این حال، جست‌وجو تنها یکی از عملکردهای یک رمزگذار است. مدل‌های جدید LFM2.5-Encoder برای طیف گسترده‌تری از کاربردهایی در محیط عملیاتی NLP طراحی شده‌اند، از جمله:

  • طبقه‌بندها (Classifiers): دسته‌بندی متون در گروه‌های یا دسته‌های از پیش تعریف‌شده.
  • مسیریاب‌های قصد (Intent Routers): هدایت پرسش‌های کاربران به منطق (Logic) صحیح در سیستم.
  • فیلترهای ایمنی: شناسایی محتوای مضر یا موارد نقض قوانین و خط‌مشی‌ها.

به نقل از مستندات این شرکت، این مدل‌ها با استفاده از هدف «مدل‌سازی زبان ماسک‌شده» (Masked-Language Objective)، می‌توانند برای طبقه‌بندی، جست‌وجو و وظایف در سطح توکن تنظیم دقیق (Fine-tuning) شوند و دیگر محدود به بازیابی (Retrieval) نباشند؛ شبیه وقتی که به یک پزشک عمومی تخصص پوست می‌دهیم تا روی یک حوزه دقیق شود.

معماری و آموزش

تیم Liquid AI این رمزگذارها را با تغییر دادن بدنه‌های رمزگشای (Decoder) موجود LFM2 (یعنی مدل‌های LFM2.5-230M و LFM2.5-350M) ساخت. برای تبدیل یک رمزگشای علت-معلولی (Causal Decoder) به یک رمزگذار دوجهتی (Bidirectional Encoder)، تیم توسعه سه تغییر کلیدی را اعمال کرد:

  • ماسک‌های توجه دوجهتی: توکن‌ها اکنون می‌توانند زمینه را از هر دو طرف ببینند، نه اینکه فقط توکن‌های پیشین را مشاهده کنند.
  • کانولوشن‌های کوتاه غیرعلتی: استفاده از Padding متقارن به توکن‌ها اجازه می‌دهد تا اطلاعات را از همسایگان هر دو طرف ترکیب کنند.
  • مدل‌سازی زبان ماسک‌شده (MLM): مدل‌ها با ماسک کردن ۳۰٪ از توکن‌ها آموزش دیدند تا نمایش‌های کلی زبان را بیاموزند.

معماری رمزگذار LFM2.5 برای استنتاج سریع متن بلند در پردازنده مرکزی

فرآیند آموزش در دو مرحله متمایز رخ داد:

۱. صلاحیت کلی زبان: یک هدف مدل‌سازی زبان ماسک‌شده با زمینه کوتاه (۱,۰۲۴ توکن) روی یک مجموعه داده بزرگ از وب اجرا شد.
۲. تطبیق با زمینه طولانی: پنجره زمینه با استفاده از ترکیب کامل داده‌ها به ۸,۱۹۲ توکن گسترش یافت. این مرحله به‌طور خاص صلاحیت مدل را در زمینه‌های واقعی، حقوقی و چندزبانه تقویت کرد. این رویکرد در مدیریت پنجره‌های متنی گسترده، مشابه استراتژی‌هایی است که در توسعه LongCat-2.0 توسط Meituan برای پردازش متون بسیار طولانی به کار گرفته شد.

بنچمارک‌های عملکرد

در یک آزمون رودررو شامل ۱۴ مدل در ۱۷ وظیفه مختلف که از مجموعه‌های GLUE، SuperGLUE و طبقه‌بندی‌های چندزبانه استخراج شده بود، مدل LFM2.5-Encoder-350M رتبه چهارم را کسب کرد. نکته شگفت‌انگیز این است که کیفیت این مدل تقریباً با مدل‌هایی که ۱۰ برابر بزرگ‌تر بودند، از جمله رقیبی با ۳.۵ میلیارد پارامتر، برابری می‌کند.

رمزگذارهای LFM2.5 برای استنتاج سریع متن بلند در CPU

برای تضمین پایداری نتایج، Liquid AI میانگین داده‌ها را در پنج دانه (Seed) جداشده گزارش کرد. مدل کوچک‌تر (LFM2.5-Encoder-230M) توانست از ModernBERT-base و تمامی مدل‌های EuroBERT پیشی بگیرد، در حالی که اثر انگشت پارامتری (Parameter Footprint) کوچک‌تری داشت. شرکت صراحتاً اشاره کرد که این رمزگذارها در وظایف عمومی امتیازات به‌مراتب بالاتری نسبت به مدل‌های LFM2.5-Retrievers قبلی خود کسب می‌کنند. چارچوب کامل و نتایج خام این آزمایش‌ها به‌صورت متن‌باز منتشر شده است.

برتری در سخت‌افزار CPU

ادعای اصلی Liquid AI کاهش شدید تأخیر در سخت‌افزارهای CPU است. از آنجایی که هر دو مدل LFM و ModernBERT از پنجره متنی ۸,۱۹۲ توکن پشتیبانی می‌کنند، تیم توسعه سرعت را در کل این محدوده اندازه گرفت. بیشترین برتری در محیط CPU مشاهده می‌شود.

نمودار مقایسه سرعت استنتاج LFM2.5 با مدل‌های دیگر در متن‌های بلند روی CPU

در حالی که ModernBERT-base برای یک پاس پیشرو (Forward Pass) در ۸,۱۹۲ توکن بیش از ۹۰ ثانیه (تقریباً یک دقیقه و نیم) زمان نیاز دارد، مدل LFM2.5-Encoder-230M همین کار را در حدود ۲۸ ثانیه انجام می‌دهد. این یعنی افزایش سرعت ۳.۷ برابری در استنتاج (Inference) برای زمینه‌های طولانی روی CPU — لحظه‌ای که مدل واقعاً جواب تولید می‌کند، شبیه خودِ آشپزی و نه دوره آموزش آشپز.

در سخت‌افزارهای GPU، حاشیه تفاوت کمتر است. ModernBERT-base برای ورودی‌های زیر ۱,۰۰۰ توکن روی GPUهای اپل پیشتاز است. با این حال، مدل‌های LFM2.5-Encoder از محدوده تقریبی ۲,۰۰۰ توکن به بعد، جایگاه برتر را به دست می‌گیرند.

معماری رمزگذار LFM2.5 برای استنتاج سریع متن بلند در پردازنده مرکزی

موارد استقرار و کاربرد

به دلیل اندازه کوچک و سرعت بالا، این مدل‌ها برای وظایف «درک» با حجم بالا ایده‌آل هستند. شرکت دموهای زنده‌ای را در فضای CPU-only Hugging Face ارائه کرده که پنج کاربرد خاص را نمایش می‌دهند:

  • مسیریابی پرامپت Zero-shot: کاربران مسیرهای مسیریابی را به‌صورت متن آزاد تعریف می‌کنند و مدل در یک پاس، پرامپت را در برابر هر مسیر امتیازدهی می‌کند.
  • بررسی قوانین Zero-shot: متن در برابر قوانین شرکت (که به‌صورت متن آزاد نوشته شده‌اند) بررسی می‌شود و هر توکن در برابر هر قانون در یک پاس امتیاز می‌گیرد.
  • غلط‌گیری املایی: اصلاح غلط‌های املایی به‌صورت توکن-به-توکن.
  • شناسایی PII: یافتن و حذف ۴۰ نوع اطلاعات شخصی در ۱۶ زبان مختلف.
  • تولید ماسک-دیفیوژن (Masked-diffusion generation): یک کاربرد اضافی که در آن رمزگذار به‌عنوان چت‌بات عمل کرده و متن را به‌جای حرکت چپ-به-راست، از طریق باز کردن مکرر ماسک‌ها تولید می‌کند.

ادغام برای توسعه‌دهندگان

توسعه‌دهندگان می‌توانند این مدل‌ها را با استفاده از کتابخانه transformers و دستور pip install -U transformers پیاده‌سازی کنند. نسخه 350M زمانی که دقت در اولویت است توصیه می‌شود، در حالی که نسخه 230M برای محدودیت‌های سخت‌افزاری شدیدتر یا نرخ انتقال (Throughput) بالاتر ساخته شده است.

برای کسانی که سخت‌افزار سازگار دارند، Liquid AI پیشنهاد می‌کند برای دستیابی به بالاترین بهره‌وری، flash-attn را نصب کرده تا از Flash Attention 2 استفاده کنند. فرآیند ادغام شامل بارگذاری مدل با AutoModelForMaskedLM برای پیش‌بینی ماسک‌ها، یا استفاده از AutoModel برای اتصال یک لایه‌ی سفارشی (Custom Head) جهت طبقه‌بندی، رگرسیون یا بازیابی است.

این تحول، عقربه AI سازمانی را جابه‌جا می‌کند؛ زیرا ثابت می‌کند پردازش در «مقیاس سند» نیازی به خوشه‌ای از GPUهای H100 ندارد. این امر به توسعه‌دهندگان اجازه می‌دهد تا طبقه‌بندها و مسیریاب‌های پیچیده را روی زیرساخت‌های سروری موجود، بدون افزایش شدید هزینه‌های ابری مستقر کنند.

اگر در حال حاضر از یک مدل زبانی مولد (Generative LLM) برای طبقه‌بندی‌های ساده یا مسیریابی استفاده می‌کنید، احتمالاً در هر دو موردِ تأخیر و هزینه، مبلغی بیش از حد پرداخت می‌کنید. تست این رمزگذارها در برابر خط لوله (Pipeline) فعلی شما می‌تواند منجر به صرفه‌جویی‌های هزینه چشمگیری شود. توسعه‌دهندگان علاقه‌مند باید مدل‌های وزن‌باز را در Hugging Face و همچنین آموزش‌های مربوط به تنظیم دقیق برای اسناد حقوقی طولانی بررسی کنند.

گام بعدی شما

  • مدل‌های ۲۳۰ و ۳۵۰ میلیون پارامتری را از Hugging Face دریافت و در خط لوله (Pipeline) فعلی خود جایگزین کنید.
  • برای پردازش اسناد حقوقی طولانی، آموزش‌های مربوط به تنظیم دقیق (Fine-tuning) این مدل‌ها را بررسی کنید.
  • در صورت دسترسی به سخت‌افزار سازگار، Flash Attention 2 را برای کاهش بیشتر تأخیر فعال نمایید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص در معماری‌های ترکیبی، وابستگی سازمان‌ها به مراکز داده گران‌قیمت برای کارهای طبقه‌بندی را کاهش می‌دهد. این یعنی democratize شدن استقرار مدل‌های NLP در سطح لبه (Edge).

تأثیر برای ایران

به دلیل باز بودن وزن‌ها، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به پرداخت هزینه API یا درگیر شدن با تحریم‌ها، این مدل‌ها را به‌صورت محلی (On-premises) روی سرورهای معمولی مستقر کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز Liquid AI بر سرعت CPU نشان‌دهنده یک چرخش استراتژیک است؛ در حالی که همه به دنبال مدل‌های غول‌آسا برای استدلال پیچیده هستند، این شرکت روی «لایه درک» (Understanding Layer) تمرکز کرده است. این رویکرد نشان می‌دهد که برای بسیاری از شرکت‌ها، داشتن یک مدل «به اندازه کافی خوب» که روی سخت‌افزارهای ارزان اجرا شود، بسیار ارزشمندتر از یک مدل «کامل» است که هزینه استنتاج نجومی دارد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.