تصور کنید یک قرارداد حقوقی حجیم یا هزاران پیام پشتیبانی مشتری را در کمتر از ۳۰ ثانیه و تنها با یک لپتاپ معمولی تحلیل کنید. در ۲۸ جولای ۲۰۲۶، شرکت Liquid AI دو مدل رمزگذار (Encoder) جدید با وزنهای باز به نامهای LFM2.5-Encoder-230M و LFM2.5-Encoder-350M را معرفی کرد که هدف آنها استنتاج سریع در بسترهای متنی طولانی بدون نیاز به پردازشگر گرافیکی است.
بسیاری از کارهای عملیاتی در پردازش زبان طبیعی (NLP) — مانند مسیریابی قصد کاربر، شناسایی اطلاعات حساس (PII) یا فیلتر کردن محتوای ایمنی — بهصورت شبانروزی و مداوم در پسزمینه اجرا میشوند. این وظایف معمولاً برای کاهش هزینهها روی واحد پردازش مرکزی (CPU) اجرا میشوند، اما با افزایش طول متن ورودی، این سیستمها بهشدت دچار مشکل میشوند. در حالی که صنعت به سمت مدلهای زبانی بزرگ (LLM) مولد حرکت کرد، مدلهای کلاس «رمزگذار» که از دوران BERT تثبیت شدند، همچنان ابزار اصلی برای این حجم بالای کارهای طبقهبندی هستند. برای درک عمیقتر از نحوه عملکرد این سیستمها، میتوان به کالبدشکافی مهندسی مدلهای زبانی پرداخت که مفاهیمی چون توکنسازی و توجه را بررسی میکند.
همانطور که در تحلیلهای پیشین ما دربارهی بهینهسازی مدلهای کوچک اشاره کردیم، تعادل بین سرعت و دقت کلید پذیرش این ابزارها در صنعت است. طبق گزارش Liquid AI، اگرچه بنچمارکهای اخیر ModernBERT مرزهای سرعت و زمینه را جابهجا کرده بودند، اما معماری جدید LFM ادعا میکند که مقیاسپذیری را بهطور بهینهتری مدیریت میکند. این مدلها با بهرهگیری از یک بدنه ترکیبی (Hybrid Backbone)، تضمین میکنند که هزینههای محاسباتی با افزایش طول ورودی، بهکندی رشد کنند.
چرا یک رمزگذار همهمنظوره؟
شرکت Liquid AI پیشتر مدلهای LFM2.5-Retrievers را عرضه کرده بود که بهطور تخصصی برای جستوجوی چندزبانه طراحی شده بودند. با این حال، جستوجو تنها یکی از عملکردهای یک رمزگذار است. مدلهای جدید LFM2.5-Encoder برای طیف گستردهتری از کاربردهایی در محیط عملیاتی NLP طراحی شدهاند، از جمله:
- طبقهبندها (Classifiers): دستهبندی متون در گروههای یا دستههای از پیش تعریفشده.
- مسیریابهای قصد (Intent Routers): هدایت پرسشهای کاربران به منطق (Logic) صحیح در سیستم.
- فیلترهای ایمنی: شناسایی محتوای مضر یا موارد نقض قوانین و خطمشیها.
به نقل از مستندات این شرکت، این مدلها با استفاده از هدف «مدلسازی زبان ماسکشده» (Masked-Language Objective)، میتوانند برای طبقهبندی، جستوجو و وظایف در سطح توکن تنظیم دقیق (Fine-tuning) شوند و دیگر محدود به بازیابی (Retrieval) نباشند؛ شبیه وقتی که به یک پزشک عمومی تخصص پوست میدهیم تا روی یک حوزه دقیق شود.
معماری و آموزش
تیم Liquid AI این رمزگذارها را با تغییر دادن بدنههای رمزگشای (Decoder) موجود LFM2 (یعنی مدلهای LFM2.5-230M و LFM2.5-350M) ساخت. برای تبدیل یک رمزگشای علت-معلولی (Causal Decoder) به یک رمزگذار دوجهتی (Bidirectional Encoder)، تیم توسعه سه تغییر کلیدی را اعمال کرد:
- ماسکهای توجه دوجهتی: توکنها اکنون میتوانند زمینه را از هر دو طرف ببینند، نه اینکه فقط توکنهای پیشین را مشاهده کنند.
- کانولوشنهای کوتاه غیرعلتی: استفاده از Padding متقارن به توکنها اجازه میدهد تا اطلاعات را از همسایگان هر دو طرف ترکیب کنند.
- مدلسازی زبان ماسکشده (MLM): مدلها با ماسک کردن ۳۰٪ از توکنها آموزش دیدند تا نمایشهای کلی زبان را بیاموزند.

فرآیند آموزش در دو مرحله متمایز رخ داد:
۱. صلاحیت کلی زبان: یک هدف مدلسازی زبان ماسکشده با زمینه کوتاه (۱,۰۲۴ توکن) روی یک مجموعه داده بزرگ از وب اجرا شد.
۲. تطبیق با زمینه طولانی: پنجره زمینه با استفاده از ترکیب کامل دادهها به ۸,۱۹۲ توکن گسترش یافت. این مرحله بهطور خاص صلاحیت مدل را در زمینههای واقعی، حقوقی و چندزبانه تقویت کرد. این رویکرد در مدیریت پنجرههای متنی گسترده، مشابه استراتژیهایی است که در توسعه LongCat-2.0 توسط Meituan برای پردازش متون بسیار طولانی به کار گرفته شد.
بنچمارکهای عملکرد
در یک آزمون رودررو شامل ۱۴ مدل در ۱۷ وظیفه مختلف که از مجموعههای GLUE، SuperGLUE و طبقهبندیهای چندزبانه استخراج شده بود، مدل LFM2.5-Encoder-350M رتبه چهارم را کسب کرد. نکته شگفتانگیز این است که کیفیت این مدل تقریباً با مدلهایی که ۱۰ برابر بزرگتر بودند، از جمله رقیبی با ۳.۵ میلیارد پارامتر، برابری میکند.

برای تضمین پایداری نتایج، Liquid AI میانگین دادهها را در پنج دانه (Seed) جداشده گزارش کرد. مدل کوچکتر (LFM2.5-Encoder-230M) توانست از ModernBERT-base و تمامی مدلهای EuroBERT پیشی بگیرد، در حالی که اثر انگشت پارامتری (Parameter Footprint) کوچکتری داشت. شرکت صراحتاً اشاره کرد که این رمزگذارها در وظایف عمومی امتیازات بهمراتب بالاتری نسبت به مدلهای LFM2.5-Retrievers قبلی خود کسب میکنند. چارچوب کامل و نتایج خام این آزمایشها بهصورت متنباز منتشر شده است.
برتری در سختافزار CPU
ادعای اصلی Liquid AI کاهش شدید تأخیر در سختافزارهای CPU است. از آنجایی که هر دو مدل LFM و ModernBERT از پنجره متنی ۸,۱۹۲ توکن پشتیبانی میکنند، تیم توسعه سرعت را در کل این محدوده اندازه گرفت. بیشترین برتری در محیط CPU مشاهده میشود.

در حالی که ModernBERT-base برای یک پاس پیشرو (Forward Pass) در ۸,۱۹۲ توکن بیش از ۹۰ ثانیه (تقریباً یک دقیقه و نیم) زمان نیاز دارد، مدل LFM2.5-Encoder-230M همین کار را در حدود ۲۸ ثانیه انجام میدهد. این یعنی افزایش سرعت ۳.۷ برابری در استنتاج (Inference) برای زمینههای طولانی روی CPU — لحظهای که مدل واقعاً جواب تولید میکند، شبیه خودِ آشپزی و نه دوره آموزش آشپز.
در سختافزارهای GPU، حاشیه تفاوت کمتر است. ModernBERT-base برای ورودیهای زیر ۱,۰۰۰ توکن روی GPUهای اپل پیشتاز است. با این حال، مدلهای LFM2.5-Encoder از محدوده تقریبی ۲,۰۰۰ توکن به بعد، جایگاه برتر را به دست میگیرند.

موارد استقرار و کاربرد
به دلیل اندازه کوچک و سرعت بالا، این مدلها برای وظایف «درک» با حجم بالا ایدهآل هستند. شرکت دموهای زندهای را در فضای CPU-only Hugging Face ارائه کرده که پنج کاربرد خاص را نمایش میدهند:
- مسیریابی پرامپت Zero-shot: کاربران مسیرهای مسیریابی را بهصورت متن آزاد تعریف میکنند و مدل در یک پاس، پرامپت را در برابر هر مسیر امتیازدهی میکند.
- بررسی قوانین Zero-shot: متن در برابر قوانین شرکت (که بهصورت متن آزاد نوشته شدهاند) بررسی میشود و هر توکن در برابر هر قانون در یک پاس امتیاز میگیرد.
- غلطگیری املایی: اصلاح غلطهای املایی بهصورت توکن-به-توکن.
- شناسایی PII: یافتن و حذف ۴۰ نوع اطلاعات شخصی در ۱۶ زبان مختلف.
- تولید ماسک-دیفیوژن (Masked-diffusion generation): یک کاربرد اضافی که در آن رمزگذار بهعنوان چتبات عمل کرده و متن را بهجای حرکت چپ-به-راست، از طریق باز کردن مکرر ماسکها تولید میکند.
ادغام برای توسعهدهندگان
توسعهدهندگان میتوانند این مدلها را با استفاده از کتابخانه transformers و دستور pip install -U transformers پیادهسازی کنند. نسخه 350M زمانی که دقت در اولویت است توصیه میشود، در حالی که نسخه 230M برای محدودیتهای سختافزاری شدیدتر یا نرخ انتقال (Throughput) بالاتر ساخته شده است.
برای کسانی که سختافزار سازگار دارند، Liquid AI پیشنهاد میکند برای دستیابی به بالاترین بهرهوری، flash-attn را نصب کرده تا از Flash Attention 2 استفاده کنند. فرآیند ادغام شامل بارگذاری مدل با AutoModelForMaskedLM برای پیشبینی ماسکها، یا استفاده از AutoModel برای اتصال یک لایهی سفارشی (Custom Head) جهت طبقهبندی، رگرسیون یا بازیابی است.
این تحول، عقربه AI سازمانی را جابهجا میکند؛ زیرا ثابت میکند پردازش در «مقیاس سند» نیازی به خوشهای از GPUهای H100 ندارد. این امر به توسعهدهندگان اجازه میدهد تا طبقهبندها و مسیریابهای پیچیده را روی زیرساختهای سروری موجود، بدون افزایش شدید هزینههای ابری مستقر کنند.
اگر در حال حاضر از یک مدل زبانی مولد (Generative LLM) برای طبقهبندیهای ساده یا مسیریابی استفاده میکنید، احتمالاً در هر دو موردِ تأخیر و هزینه، مبلغی بیش از حد پرداخت میکنید. تست این رمزگذارها در برابر خط لوله (Pipeline) فعلی شما میتواند منجر به صرفهجوییهای هزینه چشمگیری شود. توسعهدهندگان علاقهمند باید مدلهای وزنباز را در Hugging Face و همچنین آموزشهای مربوط به تنظیم دقیق برای اسناد حقوقی طولانی بررسی کنند.
گام بعدی شما
- مدلهای ۲۳۰ و ۳۵۰ میلیون پارامتری را از Hugging Face دریافت و در خط لوله (Pipeline) فعلی خود جایگزین کنید.
- برای پردازش اسناد حقوقی طولانی، آموزشهای مربوط به تنظیم دقیق (Fine-tuning) این مدلها را بررسی کنید.
- در صورت دسترسی به سختافزار سازگار، Flash Attention 2 را برای کاهش بیشتر تأخیر فعال نمایید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو