تنها ۲۸ مگابایت رم برای اینکه یک مدل ۴۵ میلیون پارامتری بتواند دستورات پیچیده کنترل دستگاه و فراخوانی ابزارها را مدیریت کند، کافی است. این استانداردی است که Needle 2، مدل تخصصی شرکت Cactus Compute، تعریف کرده است؛ مدلی که در قالب یک فایل باینری ۱۴ مگابایتی عرضه میشود تا نیاز به محیطهای اجرای خارجی یا دانلود در زمان استنتاج را بهطور کامل حذف کند.
این عرضه در حالی رخ میدهد که صنعت هوش مصنوعی از چتباتهای ساده به سمت عاملهای کاربردی (Functional Agents) حرکت میکند. همانطور که پیشتر در مورد OpenWork به عنوان یک جایگزین متنباز برای جریانهای کاری عاملمحور بحث کردیم، Needle 2 تمرکز را از ارکستراسیون سطح بالا به «لبههای افراطی» (Extreme Edge) منتقل میکند؛ یعنی سختافزارهایی که هیچ GPU یا NPU ندارند. تصور کنید یک توستر هوشمند یا یک گجت پوشیدنی ساده، دستورات صوتی را کاملاً آفلاین و بدون ارسال حتی یک بایت داده به ابر اجرا کند.
زمینه و استقرار
Needle 2 برای هر تیمی طراحی شده است که فریمور یا اپلیکیشنهای خود را روی سختافزارهای محدود عرضه میکند. این طیف شامل استارتاپهای مراحل اولیه (Seed-stage) در حوزه پوشیدنیها و اینترنت اشیا (IoT)، تولیدکنندگان لوازم الکترونیکی مصرفی در بازار متوسط و تیمهای رباتیک است. این مدل بهویژه برای سازندگانی کاربرد دارد که به یک سیستم جایگزین آفلاین (Offline Fallback) نیاز دارند یا در محیطهای نظارتی و قانونی فعالیت میکنند که خروج دادههای صوتی از دستگاه ممنوع است. این رویکرد مکمل استراتژیهای گستردهتری است که در آن استقرار ترکیبی مدلهای زبانی برای موازنه میان تأخیر لبه و قدرت ابر به کار گرفته میشود تا بهینهترین تجربه کاربری ایجاد شود.
صنایعی نظیر خانه هوشمند، موبایلهای ردهپایین، کنترلهای داخلی خودرو، رباتهای خدماتی، کیوسکهای خردهفروشی، سیستمهای POS و همچنین روترها یا دوربینهای IP هدف اصلی این فناوری هستند. کاربردهای آن از تبدیل صوت به عمل در دستگاههای بدون صفحه نمایش و کنترل آفلاین لوازم خانگی تا برچسبگذاری Enum و استخراج فیلدهای رسیدها را شامل میشود. در واقع، شرکت Cactus اعلام کرده است که گجت Pebble در حال حاضر از Needle 2 در اپلیکیشن Index 01 برای اجرای آفلاین اکشنهای صوتی استفاده میکند.
به گزارش وبسایت marktechpost.com، معماری Needle 2 بر پایه یک «شبکه توجه ساده» (Simple Attention Network) بنا شده که در آن شبکه پیشخور (FFN) استاندارد با یک Hadamard MLP جایگزین شده است. این معماری شامل ۲۷ لایه با عرض ۵۱۲ است و از یک پنجره لغزان ۲۵۶ توکنی استفاده میکند تا مصرف حافظه را فارغ از طول گفتگو، ثابت نگه دارد. همچنین از مکانیزم GQA، حافظه کلید-مقدار engram (برگرفته از جداول n-gram هش شده) و ابراتصالات چندمسیره (Multi-lane hyper-connections) بهره میبرد. جزئیات این پژوهش در مطالعه arXiv با عنوان «مطالعه کنترلشده ترنسفورمرهای صرفاً توجهمحور» منتشر شده است.
مشخصات فنی
- وزنها: آموزش و استقرار در حالت CQ2-bit با استفاده از Cactus Quants؛ وزنها هرگز در رم باز (Decompress) نمیشوند و کدهای ۲ بیتی مستقیماً در ثباتهای برداری گسترش یافته و در ضربهای داخلی int8 ادغام میشوند.
- توان عملیاتی: ۵۰۰ توکن در ثانیه روی Raspberry Pi 5؛ بین ۴۰۰ تا ۱۵۰۰ توکن در ثانیه روی Meta Quest 3S و Apple Vision Pro؛ و ۳۰۰ تا ۷۰۰ توکن در ثانیه روی گوشیهای زیر ۲۰۰ دلاری.
- حافظه: سقف ثابت ۲۸ مگابایت رم از طریق pinned KV sinks.
- کارایی: ۷۰ MFLOPs به ازای هر توکن، در حالی که ۳۵ میلیون از ۴۵ میلیون پارامتر مدل در عملیات matmul فعال هستند. برای مقایسه، مدل LFM2.5 230M حدود ۴۶۰ MFLOPs و مدل Apple FM نزدیک به ۶۰۰۰ MFLOPs مصرف میکند.
- آموزش: پیشآموزش روی مجموعهای اختصاصی از ۱۱۵ میلیارد توکن و ۳۸ میلیارد توکن پسآموزش (Post-training).

بنچمارکهای عملکرد
Needle 2 روی پنج محک عمومی فراخوانی تابع (Function Calling) با معیار «تطابق دقیق سختگیرانه» ارزیابی شد. این مدل در بخشهای درون-دامنه (۳۲.۶) و بیرون-دامنه (۲۸.۷) آزمون Seal-Tools پیشتاز بود. همچنین در آزمون Mobile Actions به صحت ۹۸.۳ در تشخیص نام تابع (با امتیاز ۶۳.۷) دست یافت.
با این حال، در محک کلی BFCL v4، این مدل با امتیاز ۴۲.۶ در برابر LFM2.5 (امتیاز ۶۰.۸) و Apple FM (امتیاز ۶۱.۷) قرار گرفت. تیم توسعهدهنده این موضوع را به تخصص مدل در اکشنهای دستگاههای مصرفی، بهجای APIهای عمومی سازمانی نسبت میدهد. با این وجود، نرخ خروجیهای ساختاریافته (Well-formed) در ۳۶۴۱ ردیف BFCL برابر با ۹۳.۴ درصد است.
جزئیات موتور و منطق
- بهینهسازی سختافزاری: باینری مدل در هنگام اجرا، CPU را بررسی کرده تا مناسبترین سطح کرنل را انتخاب کند: SDOT، NEON، AVX2، برداریهای RISC-V، wasm SIMD یا Scalar.
- محدودیتهای گرامری: یک گرامر در سطح بایت که از طرحهای JSON کامپایل شده، هر توکن را محدود میکند. این کار باعث میشود موتور مدل بتواند تا ۹۸٪ از پیشبینیهای واژگان (Vocabulary Projection) را در توکنهای ساختاری نادیده بگیرد.
- مدیریت ابزار: اگر تعداد ابزارهای تعریف شده ۵ یا کمتر باشد، مستقیماً رندر میشوند؛ در غیر این صورت، یک سرِ بازیابی تضادی (Contrastive Retrieval Head) هر طرح را جاسازی (Embed) کرده و تنها ۵ مورد برتر را میپذیرد؛ ابزارهای انتخاب نشده غیرقابل دسترس خواهند بود.
- امتیاز اطمینان: هر پاسخ دارای یک مقدار اطمینان است که بر اساس یک سرِ پسینی (Post-hoc head) کالیبره شده و احتمال رمزگشایی محاسبه میشود. درخواستهای خارج از موضوع با یک فراخوانی خالی [ ] پاسخ داده میشوند.
این تغییر در معماری، این فرض را که فراخوانی ابزار نیازمند دانش گسترده از جهان است، به چالش میکشد. Cactus Compute ثابت کرد که برای کنترل دستگاه، تبدیل یک «جمله نامنظم» به یک امضای تابع تایپشده، نیازی به مدلهای حجیم ندارد. این دستاورد، هوش مصنوعی با کارایی بالا را برای استارتاپهای پوشیدنی و کنترلهای داخلی خودرو که تأخیر و حریم خصوصی در آنها غیرقابل مذاکره است، ممکن میکند.
برای توسعهدهندگان، انعطافپذیری در استقرار بزرگترین مزیت است. Needle 2 به صورت باینریهای پیشساخته و کتابخانه استاتیک برای macOS، لینوکس (x86-64, ARM64, ARMv7, RISC-V, MIPS32el)، ویندوز، اندروید، iOS/watchOS/tvOS و WebAssembly عرضه میشود. وجود مقدار اطمینان برای هر پاسخ به تیمها اجازه میدهد مسیرهای ارتقای صریح (Escalation Paths) بسازند؛ بهطوری که دستگاه تنها زمانی با ابر ارتباط برقرار کند که اطمینان محلی از یک حد مشخص پایینتر بیاید.
منتظر ادغام Needle 2 در فریمورهای بیشتر IoT و ظهور نسل جدیدی از هوش مصنوعی «نامرئی» باشید که کاملاً در قالب کتابخانههای استاتیک سختافزار عمل میکند.




گفتگو