پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Needle 2 فراخوانی ابزارها را در ۲۸ مگابایت رم ممکن کرد

·۲۳ مرداد ۱۴۰۵۴ دقیقه مطالعه
ملاقات با Needle 2: مدل ۴۵ میلیون پارامتری متن‌باز با حجم ۱۴ مگابایت و مصرف ۲۸ مگابایت RAM
ملاقات با Needle 2: مدل ۴۵ میلیون پارامتری متن‌باز با حجم ۱۴ مگابایت و مصرف ۲۸ مگابایت RAM
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استقرار مدل فراخوانی ابزار در سقف ثابت ۲۸ مگابایت رم و حذف کامل نیاز به محیط‌های اجرای خارجی (Runtime) از طریق باینری‌های استاتیک.

تنها ۲۸ مگابایت رم برای اینکه یک مدل ۴۵ میلیون پارامتری بتواند دستورات پیچیده کنترل دستگاه و فراخوانی ابزارها را مدیریت کند، کافی است. این استانداردی است که Needle 2، مدل تخصصی شرکت Cactus Compute، تعریف کرده است؛ مدلی که در قالب یک فایل باینری ۱۴ مگابایتی عرضه می‌شود تا نیاز به محیط‌های اجرای خارجی یا دانلود در زمان استنتاج را به‌طور کامل حذف کند.

این عرضه در حالی رخ می‌دهد که صنعت هوش مصنوعی از چت‌بات‌های ساده به سمت عامل‌های کاربردی (Functional Agents) حرکت می‌کند. همان‌طور که پیش‌تر در مورد OpenWork به عنوان یک جایگزین متن‌باز برای جریان‌های کاری عامل‌محور بحث کردیم، Needle 2 تمرکز را از ارکستراسیون سطح بالا به «لبه‌های افراطی» (Extreme Edge) منتقل می‌کند؛ یعنی سخت‌افزارهایی که هیچ GPU یا NPU ندارند. تصور کنید یک توستر هوشمند یا یک گجت پوشیدنی ساده، دستورات صوتی را کاملاً آفلاین و بدون ارسال حتی یک بایت داده به ابر اجرا کند.

زمینه و استقرار
Needle 2 برای هر تیمی طراحی شده است که فریم‌ور یا اپلیکیشن‌های خود را روی سخت‌افزارهای محدود عرضه می‌کند. این طیف شامل استارتاپ‌های مراحل اولیه (Seed-stage) در حوزه پوشیدنی‌ها و اینترنت اشیا (IoT)، تولیدکنندگان لوازم الکترونیکی مصرفی در بازار متوسط و تیم‌های رباتیک است. این مدل به‌ویژه برای سازندگانی کاربرد دارد که به یک سیستم جایگزین آفلاین (Offline Fallback) نیاز دارند یا در محیط‌های نظارتی و قانونی فعالیت می‌کنند که خروج داده‌های صوتی از دستگاه ممنوع است. این رویکرد مکمل استراتژی‌های گسترده‌تری است که در آن استقرار ترکیبی مدل‌های زبانی برای موازنه میان تأخیر لبه و قدرت ابر به کار گرفته می‌شود تا بهینه‌ترین تجربه کاربری ایجاد شود.

صنایعی نظیر خانه هوشمند، موبایل‌های رده‌پایین، کنترل‌های داخلی خودرو، ربات‌های خدماتی، کیوسک‌های خرده‌فروشی، سیستم‌های POS و همچنین روترها یا دوربین‌های IP هدف اصلی این فناوری هستند. کاربردهای آن از تبدیل صوت به عمل در دستگاه‌های بدون صفحه نمایش و کنترل آفلاین لوازم خانگی تا برچسب‌گذاری Enum و استخراج فیلدهای رسیدها را شامل می‌شود. در واقع، شرکت Cactus اعلام کرده است که گجت Pebble در حال حاضر از Needle 2 در اپلیکیشن Index 01 برای اجرای آفلاین اکشن‌های صوتی استفاده می‌کند.

به گزارش وب‌سایت marktechpost.com، معماری Needle 2 بر پایه یک «شبکه توجه ساده» (Simple Attention Network) بنا شده که در آن شبکه پیش‌خور (FFN) استاندارد با یک Hadamard MLP جایگزین شده است. این معماری شامل ۲۷ لایه با عرض ۵۱۲ است و از یک پنجره لغزان ۲۵۶ توکنی استفاده می‌کند تا مصرف حافظه را فارغ از طول گفتگو، ثابت نگه دارد. همچنین از مکانیزم GQA، حافظه کلید-مقدار engram (برگرفته از جداول n-gram هش شده) و ابراتصالات چندمسیره (Multi-lane hyper-connections) بهره می‌برد. جزئیات این پژوهش در مطالعه arXiv با عنوان «مطالعه کنترل‌شده ترنسفورمرهای صرفاً توجه‌محور» منتشر شده است.

مشخصات فنی

  • وزن‌ها: آموزش و استقرار در حالت CQ2-bit با استفاده از Cactus Quants؛ وزن‌ها هرگز در رم باز (Decompress) نمی‌شوند و کدهای ۲ بیتی مستقیماً در ثبات‌های برداری گسترش یافته و در ضرب‌های داخلی int8 ادغام می‌شوند.
  • توان عملیاتی: ۵۰۰ توکن در ثانیه روی Raspberry Pi 5؛ بین ۴۰۰ تا ۱۵۰۰ توکن در ثانیه روی Meta Quest 3S و Apple Vision Pro؛ و ۳۰۰ تا ۷۰۰ توکن در ثانیه روی گوشی‌های زیر ۲۰۰ دلاری.
  • حافظه: سقف ثابت ۲۸ مگابایت رم از طریق pinned KV sinks.
  • کارایی: ۷۰ MFLOPs به ازای هر توکن، در حالی که ۳۵ میلیون از ۴۵ میلیون پارامتر مدل در عملیات matmul فعال هستند. برای مقایسه، مدل LFM2.5 230M حدود ۴۶۰ MFLOPs و مدل Apple FM نزدیک به ۶۰۰۰ MFLOPs مصرف می‌کند.
  • آموزش: پیش‌آموزش روی مجموعه‌ای اختصاصی از ۱۱۵ میلیارد توکن و ۳۸ میلیارد توکن پس‌آموزش (Post-training).

معرفی Dyna-2: مدل جهان-عمل رباتیکی با پیش‌آموزش بر یک میلیون ساعت ویدیوی انسانی

بنچمارک‌های عملکرد
Needle 2 روی پنج محک عمومی فراخوانی تابع (Function Calling) با معیار «تطابق دقیق سخت‌گیرانه» ارزیابی شد. این مدل در بخش‌های درون-دامنه (۳۲.۶) و بیرون-دامنه (۲۸.۷) آزمون Seal-Tools پیشتاز بود. همچنین در آزمون Mobile Actions به صحت ۹۸.۳ در تشخیص نام تابع (با امتیاز ۶۳.۷) دست یافت.

با این حال، در محک کلی BFCL v4، این مدل با امتیاز ۴۲.۶ در برابر LFM2.5 (امتیاز ۶۰.۸) و Apple FM (امتیاز ۶۱.۷) قرار گرفت. تیم توسعه‌دهنده این موضوع را به تخصص مدل در اکشن‌های دستگاه‌های مصرفی، به‌جای APIهای عمومی سازمانی نسبت می‌دهد. با این وجود، نرخ خروجی‌های ساختاریافته (Well-formed) در ۳۶۴۱ ردیف BFCL برابر با ۹۳.۴ درصد است.

جزئیات موتور و منطق

  • بهینه‌سازی سخت‌افزاری: باینری مدل در هنگام اجرا، CPU را بررسی کرده تا مناسب‌ترین سطح کرنل را انتخاب کند: SDOT، NEON، AVX2، برداری‌های RISC-V، wasm SIMD یا Scalar.
  • محدودیت‌های گرامری: یک گرامر در سطح بایت که از طرح‌های JSON کامپایل شده، هر توکن را محدود می‌کند. این کار باعث می‌شود موتور مدل بتواند تا ۹۸٪ از پیش‌بینی‌های واژگان (Vocabulary Projection) را در توکن‌های ساختاری نادیده بگیرد.
  • مدیریت ابزار: اگر تعداد ابزارهای تعریف شده ۵ یا کمتر باشد، مستقیماً رندر می‌شوند؛ در غیر این صورت، یک سرِ بازیابی تضادی (Contrastive Retrieval Head) هر طرح را جاسازی (Embed) کرده و تنها ۵ مورد برتر را می‌پذیرد؛ ابزارهای انتخاب نشده غیرقابل دسترس خواهند بود.
  • امتیاز اطمینان: هر پاسخ دارای یک مقدار اطمینان است که بر اساس یک سرِ پس‌ینی (Post-hoc head) کالیبره شده و احتمال رمزگشایی محاسبه می‌شود. درخواست‌های خارج از موضوع با یک فراخوانی خالی [ ] پاسخ داده می‌شوند.

این تغییر در معماری، این فرض را که فراخوانی ابزار نیازمند دانش گسترده از جهان است، به چالش می‌کشد. Cactus Compute ثابت کرد که برای کنترل دستگاه، تبدیل یک «جمله نامنظم» به یک امضای تابع تایپ‌شده، نیازی به مدل‌های حجیم ندارد. این دستاورد، هوش مصنوعی با کارایی بالا را برای استارتاپ‌های پوشیدنی و کنترل‌های داخلی خودرو که تأخیر و حریم خصوصی در آن‌ها غیرقابل مذاکره است، ممکن می‌کند.

برای توسعه‌دهندگان، انعطاف‌پذیری در استقرار بزرگ‌ترین مزیت است. Needle 2 به صورت باینری‌های پیش‌ساخته و کتابخانه استاتیک برای macOS، لینوکس (x86-64, ARM64, ARMv7, RISC-V, MIPS32el)، ویندوز، اندروید، iOS/watchOS/tvOS و WebAssembly عرضه می‌شود. وجود مقدار اطمینان برای هر پاسخ به تیم‌ها اجازه می‌دهد مسیرهای ارتقای صریح (Escalation Paths) بسازند؛ به‌طوری که دستگاه تنها زمانی با ابر ارتباط برقرار کند که اطمینان محلی از یک حد مشخص پایین‌تر بیاید.

منتظر ادغام Needle 2 در فریم‌ورهای بیشتر IoT و ظهور نسل جدیدی از هوش مصنوعی «نامرئی» باشید که کاملاً در قالب کتابخانه‌های استاتیک سخت‌افزار عمل می‌کند.

چرا این موضوع مهم است؟

این مدل با تکیه بر تخصص در کنترل دستگاه، سد سخت‌افزاری را برای استقرار عامل‌های هوشمند در لبه (Edge) می‌شکند. این یعنی حریم خصوصی کامل و تأخیر نزدیک به صفر برای میلیاردها دستگاه IoT که پیش از این توان پردازشی لازم را نداشتند.

تأثیر برای ایران

به دلیل ماهیت آفلاین و عدم نیاز به APIهای ابری، این مدل برای توسعه‌دهندگان سخت‌افزار و IoT در ایران که با محدودیت‌های دسترسی به سرویس‌های خارجی مواجه‌اند، ابزاری ایده‌آل است.

·نگاه ما
تحریریه دات‌هوش

تخصص‌گرایی در مدل‌های کوچک (SLM) در حال جایگزینی رویکرد «یک مدل برای همه» است. Needle 2 ثابت می‌کند که برای وظایف خاص مانند کنترل سخت‌افزار، نیازی به مدل‌های با دانش عمومی گسترده نیست و می‌توان با حذف لایه‌های زائد، کارایی را در سخت‌افزارهای بسیار ارزان افزایش داد. این رویکرد احتمالاً منجر به ظهور نسل جدیدی از گجت‌های «هوشمندِ واقعاً آفلاین» می‌شود که وابستگی به APIهای ابری را به صفر می‌رساند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.