پرش به محتوای اصلی
پرش به محتوای مقاله

مدل d1-3B شرکت Liquid AI در محک تصمیم‌گیری از مدل‌های ۳۵ میلیارد پارامتری پیشی

·۱۵ مهر ۱۴۰۵۴ دقیقه مطالعه
مدل‌های تصمیم‌گیری چندوجهی D1 باز برای لبه شبکه
مدل‌های تصمیم‌گیری چندوجهی D1 باز برای لبه شبکه
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی مدل‌هایی که به‌جای پیش‌بینی توکن، در یک گذر واحد تصمیم ساختاریافته می‌گیرند و با ۳ میلیارد پارامتر، مدل‌های ۳۵ میلیارد پارامتری را در طبقه‌بندی شکست می‌دهند.

اگر برای پیاده‌سازی هوش مصنوعی در سخت‌افزارهای کوچک با تأخیر زیاد دست‌وپنجه نرم می‌کنید، مدل‌های جدید Liquid AI قواعد بازی را تغییر می‌دهند. این مدل‌ها ثابت کردند که برای تصمیمات سریع و دقیق، نیازی به غول‌های چند ده میلیارد پارامتری نیست.

به نقل از گزارش‌های منتشر شده، مدل d1-3B در محک Decision Index 0.2.1 امتیاز ۴۸.۵۷ را کسب کرد و از تمامی مدل‌های ۴ و ۹ میلیارد پارامتری و حتی مدل Decider 35B-A3B با امتیاز ۴۷.۱۱ پیشی گرفت. این مدل که در سال ۲۰۲۶ عرضه شد، تمرکز را از تولید متن به تصمیمات ساختاریافته در یک گذر واحد تغییر داده است تا پاسخ‌های آنی روی سخت‌افزارهای لبه (Edge Hardware) ممکن شود.

بیشتر مدل‌های امروزی مولد هستند؛ یعنی مثل نویسنده‌ای که کلمه به کلمه داستان می‌بافد و زمان و پردازش زیادی می‌برد، توکن بعدی را پیش‌بینی می‌کنند. اما Liquid AI به دنبال نیاز متفاوتی است: طبقه‌بندی سریع و تصمیم‌گیری ساختاریافته. تصور کنید سیستمی که به‌جای نوشتن یک پاراگراف درباره علت عصبانیت مشتری، فوراً تیکت را «فوری» برچسب می‌زند و به بخش «حسابداری» می‌فرستد.

زمینه و معماری

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی مدل‌های کوچک اشاره کردیم، حذف لایه‌های اضافی تولید متن، راه را برای سرعت خیره‌کننده باز می‌کند. طبق مستندات Liquid AI، این مدل‌ها بر پایه مدل‌های بنیادی لیکوئید (LFMs) ساخته شده‌اند. برخلاف مدل‌های زبانی بزرگ (LLM) — که شبیه کتابخانه‌داری است که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — مدل‌های تصمیم‌گیرنده در یک گذر مستقیم (Single Forward Pass) و بدون تولید توکن، پاسخ می‌دهند.

این معماری منجر به کارایی فوق‌العاده‌ای شده است. خانواده d1 شامل دو نسخه با ساختارهای متفاوت است:

  • d1-3B: یک مدل فقط-رمزگشا (Decoder-only) که از LFM2.5-VL-3B آموزش دیده است. LFM2.5-VL-3B جدیدترین مدل بینایی-زبانی (VLM) شرکت Liquid AI است. این مدل ورودی‌های متنی و تصویری را می‌پذیرد. این پیشرفت در کنار بهینه‌سازی‌های مدل DSpark برای افزایش سرعت تولید توکن در دستگاه‌های لبه، استقرار مدل‌های چندوجهی را روی سخت‌افزارهای محدود تسهیل می‌کند.
  • d1-omni-600M: یک نسخه پژوهشی تجربی بر پایه LFM2.5-Encoder-350M است که یک رمزگشای دوطرفه (Bidirectional Encoder) محسوب می‌شود. این مدل با افزودن رمزگذارهای بینایی و صوتی، هر سه مودالیته را پشتیبانی می‌کند و می‌تواند ورودی‌های «متن و تصویر» یا «متن و صوت» را بپذیرد.

معماری کارآمد LFM2.5-VL-DSpark برای تسریع مدل‌های بینایی-زبانی با کاهش محاسبات و حفظ دقت.

جزئیات عملکرد و بنچمارک‌ها

در بررسی‌های متقابل روی هفت مجموعه داده عمومی — شامل درک مطلب، تشخیص سمّیت، طبقه‌بندی قصد (Intent Classification)، پرسش‌وپاسخ پزشکی و درک متنی چندزبانه — مدل d1-3B میانگین امتیاز ۸۲.۹ را به دست آورد و مدل Decider 4B را شکست داد. حتی مدل کوچک‌تر d1-omni-600M با امتیاز ۷۸.۴، مدل Decider 2B (با امتیاز ۷۷.۱) را پشت سر گذاشت، در حالی که تنها یک‌چهارم پارامترهای آن را دارد.

نتایج دقیق برای هر مجموعه داده به شرح زیر است:

  • SQuAD 2.0: امتیاز ۸۳.۳ برای d1-3B در برابر ۷۶.۰ برای Decider 4B.
  • BoolQ: امتیاز ۸۶.۳ برای d1-3B.
  • PAWS-X: امتیاز ۷۶.۴ برای d1-3B، که به‌طور قابل‌توجهی بالاتر از امتیاز ۵۹.۵ مدل Decider 2B است.
  • PubMedQA: امتیاز ۶۸.۳ برای d1-3B.
  • Civil Comments: امتیاز ۹۵.۸ برای d1-omni-600M.
  • XNLI: امتیاز ۸۵.۶ برای d1-3B.
  • MASSIVE intent: امتیاز ۸۶.۹ برای d1-3B.

شرکت Liquid AI تأیید کرد که d1-3B قابلیت‌های بینایی مدل پایه خود (LFM2.5-VL-3B) را حفظ کرده است. اگرچه d1-omni-600M هر سه مودالیته را مدیریت می‌کند، اما بنچمارک‌های تصمیم‌گیری صوتی همچنان یک مسئله باز در این حوزه است و نسخه v0.3 از Decision Index در حال حاضر از یک بخش بینایی خصوصی استفاده می‌کند.

استنتاج تا ۳.۲ برابر سریع‌تر با LFM2.5-DSpark

سرعت و استنتاج در لبه (Edge Inference)

سرعت، مزیت اصلی برای استقرار در لبه است. در همکاری با NVIDIA، مدل d1-3B روی سخت‌افزارهای مختلف تست شد و نتایج نشان می‌دهد که این مدل در هر دستگاه اندازه‌گیری شده، به یک سؤال در کمتر از ۵۰ میلی‌ثانیه پاسخ می‌دهد:

  • NVIDIA Jetson AGX Thor: ۱۶ میلی‌ثانیه
  • NVIDIA Jetson AGX Orin 64 GB: ۲۶ میلی‌ثانیه
  • NVIDIA Jetson Orin Nano: ۵۰ میلی‌ثانیه
  • Apple M5 Pro: ۳۰ میلی‌ثانیه

روی پردازنده‌های گرافیکی رده‌بالا، این اعداد حتی خیره‌کننده‌ترند. در NVIDIA RTX 4090، پاسخ به یک سؤال تنها ۸ میلی‌ثانیه و پردازش یک تصویر ۳۸۴ پیکسلی ۱۷ میلی‌ثانیه زمان می‌برد. در AMD MI325X، زمان پاسخ‌دهی ۹ میلی‌ثانیه و پردازش تصاویر ۱۸ میلی‌ثانیه است.

این معماری در مقیاس بالا نیز بسیار بهینه است. برای مثال، پردازش سه سؤال روی AGX Thor تنها ۱.۳ برابر زمان پردازش یک سؤال را می‌گیرد (افزایش از ۱۶ به ۲۰ میلی‌ثانیه). برای حالت‌های بزرگ‌تر، AGX Thor یک وضعیت با ۳.۴ هزار توکن را در ۲۲۰ میلی‌ثانیه پردازش می‌کند و می‌تواند ۶۴ وضعیت بسته‌بندی شده را با نرخ ۲۶۲ مورد در ثانیه مدیریت کند.

این تغییر به سمت مدل‌های «فقط-تصمیم‌گیرنده»، این فرض را که برای طبقه‌بندی‌های ساده به ظرفیت‌های عظیم مولد نیاز داریم، تغییر می‌دهد. Liquid AI با حذف لایه تولید توکن، ابزاری ساخته است که برای رباتیک در زمان واقعی (Real-time Robotics) و تریاژ روی دستگاه، جایی که تأخیر (Latency) یک عامل تعیین‌کننده است، کاملاً کاربردی است.

برای توسعه‌دهندگان، این به معنای امکان اجرای منطق تصمیم‌گیری چندوجهی — یعنی درک هم‌زمان متن و تصویر — مستقیماً روی یک Jetson Nano بدون نیاز به APIهای ابری است. این تحول، «هوش» سیستم را از یک رابط گفتگوی کند به یک ماشه واکنش‌گرای سریع تبدیل کرده است.

کاربران اکنون می‌توانند به وزن‌های باز (Open Weights) هر دو مدل در Hugging Face دسترسی داشته باشند. برای پیاده‌سازی، توسعه‌دهندگان به نسخه transformers>=5.14 نیاز دارند و باید گزینه trust_remote_code=True را برای بارگذاری منطق سفارشی مدل فعال کنند. این مدل‌ها از پرس‌وجوهای ساختاریافته پیچیده، مانند امتیازدهی به فوریت یا طبقه‌بندی مسائل فنی در مقابل مسائل حسابداری، در یک گذر واحد پشتیبانی می‌کنند.

گام بعدی شما

  • اگر روی رباتیک یا سیستم‌های تریاژ آنی کار می‌کنید، مدل d1-3B را جایگزین مدل‌های مولد سنگین کنید.
  • برای اجرا، کتابخانه transformers را به نسخه ۵.۱۴ یا بالاتر به‌روزرسانی کرده و trust_remote_code=True را فعال کنید.
  • قابلیت‌های طبقه‌بندی چندوجهی مدل را در محیط‌های بدون دسترسی به اینترنت (Offline) تست کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص Liquid AI در معماری‌های غیرترنسفورمری، هزینه و تأخیر استنتاج را در سیستم‌های بلادرنگ به شدت کاهش می‌دهد. این تغییر، استقرار هوش مصنوعی در رباتیک و تجهیزات IoT را از حالت آزمایشی به کاربرد صنعتی واقعی می‌برد.

تأثیر برای ایران

به دلیل وزن‌های باز بودن مدل‌ها در Hugging Face، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به APIهای تحریمی، سیستم‌های تصمیم‌گیر سریع را روی سخت‌افزارهای لبه مستقر کنند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی مدل‌های مولد با مدل‌های «فقط تصمیم‌گیرنده» یک چرخش استراتژیک در لبه است. این رویکرد فرض رایج مبنی بر نیاز به ظرفیت تولید متن برای طبقه‌بندی‌های ساده را می‌شکند و نشان می‌دهد که با حذف لایه توکن‌سازی، می‌توان دقت مدل‌های غول‌پیکر را در ابعادی بسیار کوچک‌تر بازتولید کرد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.