اگر امروز یک دستگاه رزبری پای ۵ در دست دارید، میتوانید سرعت تولید متن را به ۵۰۰ توکن در ثانیه برسانید، بدون اینکه به هیچ ابررایانهای متصل باشید. این جهش خیرهکننده نتیجهی انتشار مدل Needle 2 در ۱۰ آگوست ۲۰۲۶ است؛ یک مدل ۴۵ میلیون پارامتری که قابلیتهای عاملمحور (Agentic) — یعنی توانایی تصمیمگیری و اجرای دستورات — را به سختافزارهایی با قیمت زیر ۲۰۰ دلار میآورد. این رویکرد عاملمحور در مقیاسهای بزرگتر نیز دیده میشود، مانند مدل Inkling-Small که اخیراً در کدنویسی پیچیده نتایج درخشانی داشته است. طبق گزارش وبسایت cactuscompute.com، این مدل در سقف سختگیرانهی ۲۸ مگابایت رم فعالیت میکند و همین موضوع آن را با میکروکنترلرهایی مانند ESP32-S3 سازگار میکند.
این انتشار در زمانی رخ میدهد که صنعت هوش مصنوعی برای خروج از حصار پردازندههای گرافیکی (GPU) و واحدهای پردازش عصبی (NPU) گرانقیمت دستوپا میزند. در حالی که هوش مصنوعی لبه (Edge AI) سطح بالا معمولاً مک یا پیسی را هدف قرار میدهد، واقعیت این است که اکثریت مطلق ۲۱ میلیارد دستگاه اینترنت اشیا (IoT) متصل، چنین توانی ندارند. در بازارهای نوظهور، اکثر گوشیهای تلفنی که عرضه میشوند قیمتی زیر ۲۰۰ دلار دارند. تقریباً چهار مورد از هر پنج دستگاه لبه — شامل گوشیهای اقتصادی، رزبری پایها، گجتهای پوشیدنی و رباتهای کوچک مانند Reachy Mini — قیمتی زیر ۲۰۰ دلار دارند. همانطور که در تحلیلهای قبلی ما دربارهی استارتاپهایی که معماری ترنسفورمر را برای کاهش هزینه به چالش میکشند اشاره کردیم، مدل Needle 2 تمرکز را از چتهای عمومی به تعاملات ساختاریافته و خاص با دستگاهها تغییر داده است.
تصور کنید یک انگشتر هوشمند یا یک گوشی ارزانقیمت داشته باشید که برای روشن کردن چراغ یا تنظیم تایمر، نیازی به ابر (Cloud) نداشته باشد. شرکت Cactus با حذف نیاز به دانش جهانی و نثر باز، تعداد پارامترهای مورد نیاز را از میلیاردها به تنها ۴۵ میلیون رسانده است. شرط آنها این است: روشن کردن یک چراغ نیازی به یک مدل پیشرو (Frontier Model) ندارد؛ فقط باید بتواند یک جملهی نامفهوم یا نامنظم را به توابعی با پارامترهای تایپشده (Typed Parameters) نگاشت کند.
معماری بهرهوری
مدل Needle 2 یک ترنسفورمر استاندارد نیست. این مدل از یک شبکه توجه ساده (Simple Attention Network) استفاده میکند که جایگزین تصویرسازیهای متراکم (Dense Projections) با یک تبدیل والش-هادامارد ثابت شده است. این سازوکار اجازه میدهد ترکیب کانالها تقریباً بدون هزینه پارامتری انجام شود. معماری مدل از جریانهای باقیماندهی چندمسیره استفاده میکند تا به یک شبکهی ۲۷ لایه با عرض ۵۱۲، انعطافپذیری مدلهای بسیار عریضتر را ببخشد، در حالی که تنها چند ضرب داخلی (Dot Product) به هر لایه اضافه میکند.

مشخصات فنی کلیدی عبارتاند از:
- حجم فایل: یک فایل باینری واحد ۱۴ مگابایتی
- رم مورد نیاز: سقف قطعی و دترمینیستی ۲۸ مگابایت برای هر جلسه
- دقت: CQ2-bit (کوانتهای ککتوس) که از پیشآموزش تا پسآموزش با همین دقت اجرا شده است
- پنجره متنی: یک پنجره لغزان ۲۵۶ توکنی برای محدود کردن حافظه KV cache
- دادههای آموزش: پیشآموزش روی یک کورپوس اختصاصی ۱۱۵ میلیارد توکنی و پسآموزش روی ۳۸ میلیارد توکن با استفاده از ردپاهای استدلالی فشرده
- لایسنس: Apache 2.0 با دسترسی به وزنها در Hugging Face
برای جلوگیری از فراموشی هدف اصلی، اعلانهای ابزار و پرامپتهای سیستمی (System Prompts) به عنوان سینکهای دائمی (Permanent Sinks) در سیستم حافظه تثبیت شدهاند. این کار تضمین میکند که توانایی مدل در فراخوانی توابع، از نظر ساختاری در برابر حذف شدن (Eviction) از حافظه در طول یک جلسه محافظت شود.
بررسی عمیق سازوکارهای شبکه توجه ساده
مدل Needle 2 برای کسب قابلیتها بدون مصرف پهنای باند، از چندین مکانیزم غیر-استاندارد استفاده میکند:
- Hadamard MLP: جایگزینی تصویرسازیهای متراکم معمولیِ بالا-پایین با یک تبدیل والش ثابت و قطریهای یادگرفتهشده. این کار خواندن وزنها را در هنگام ترکیب کانالها به حداقل میرساند. تبدیل والش-هادامارد یک ماتریس ثابت است که در زمان n log n اعمال میشود و هیچ وزنی برای خواندن ندارد.
- جداول انگرام (Engram Tables): انتقال دانش جهانی از پشتهی اصلی به جداول n-gram هششده. این جداول در زمان استنتاج (Inference) به صورت چند ردیف در هر توکن خوانده میشوند و ظرفیتی را فراهم میکنند که در زمان رمزگشایی تقریباً رایگان است. این موضوع برای دستگاههایی که هر مگابایت خواندن از حافظه فلش روی تأخیر و باتری اثر میگذارد، حیاتی است.
- بهینهسازی انرژی: یک ترنسفورمر معمولی با این عرض، ۱۶۴ MFLOPs برای هر توکن مصرف میکند. یک نسخه فشرده ۸۷ MFLOPs هزینه دارد. اما Needle تنها ۷۰ MFLOPs مصرف میکند، زیرا یکپنجم پارامترهایش را به عنوان حافظه جمعآوریشده نگه میدارد که هیچ هزینه محاسباتی (Arithmetic) ندارد.
- طراحی حافظهمحور: سیستم از روی دستگاههای با رم ثابت بهصورت معکوس طراحی شده است. سقف ۲۸ مگابایتی اجازه میدهد مدل روی ESP32-P4 با ۳۲ مگابایت PSRAM، یا بردهای STM32H7 و NXP i.MX RT با SDRAM اجرا شود. موتور مدل برای سختافزارهای Bare metal به صورت تکرشتهای (Single-threaded) کامپایل شده و به صورت یک کتابخانه استاتیک برای Cortex-M4، M7 و M55 عرضه میشود.
- مسیریابی و نرمالسازی: شبکه از تخطئه نرمالشدهی RMS برای چهار جریان باقیمانده استفاده میکند. لاجیتهای مسیریابی از طریق نرمالسازی دو-تصادفی (Double-stochastic) که توسط تکرار sinkhorn محاسبه میشود، پردازش میشوند. هر دو بخش باقیماندهی توجه و MLP به صورت Sandwich-norm شده و گیتدار (Gated) هستند.
عملکرد و بنچمارکها
در تستهای رودررو، Needle 2 با مدلهای بسیار بزرگتر رقابت میکند. در محک Google Mobile Actions (با ۹۶۱ ردیف)، این مدل با FunctionGemma 270M، LFM2.5 230M و Apple FM رقابت میکند، در حالی که ۵ تا ۷۰ برابر کوچکتر است. این رقابت با مدلهای کوچکتر اما قدرتمند، یادآور موفقیتهای مدل LFM2.5-2.6B در بهینهسازی فراخوانی ابزارهاست. نکته جالب این است که مدل LFM2.5-230M روی ۱۹ تریلیون توکن آموزش دیده (تقریباً ۱۲۰ برابر Needle)، اما هر دو مدل در استفاده از ابزار نتایج مشابهی دارند و پیروزیها را با هم رد و بدل میکنند.
سرعت اجرا بسته به سختافزار متفاوت اما در همه موارد بسیار بالاست:
- رزبری پای ۵: بیش از ۵۰۰ توکن در ثانیه برای رمزگشایی (Decode) و ۸۰۰ توکن برای پیشپُرکردن (Prefill)
- Apple Vision Pro و Meta Quest 3S: بین ۴۰۰ تا ۱۵۰۰ توکن در ثانیه
- گوشیهای سری A سامسونگ (زیر ۲۰۰ دلار): بین ۳۰۰ تا ۷۰۰ توکن در ثانیه
معیارهای ارزیابی و محدوده
شرکت Cactus مدل Needle 2 را روی پنج محک عمومی ارزیابی کرد: Google Mobile Actions، DroidCall، Seal-Tools (در دامنه و خارج از دامنه) و BFCL v4 تک-مرحلهای. امتیازدهی بر اساس «تطابق دقیق سخت ترتیبیافته» (Ordered Strict Exact Match) بود؛ یعنی نام تابع، ترتیب فراخوانی و مقدار هر آرگومان باید دقیقاً و به ترتیب درست باشند.
دو عدمتقارن (Asymmetry) کلیدی در این تستها وجود دارد:
۱. دقت: مدلهای پایه با دقت f16 اجرا شدند در حالی که Needle روی CQ2-bit بود. این موضوع به نفع مدلهای پایه است، زیرا کوانتاسیون پسآموزش معمول به ۲ بیت، مدلهایی را که برای آن آموزش ندیدهاند فرو میپاشاند.
۲. محدوده: مدل Needle برای فراخوانی ابزار عاملمحور تخصصی شده، در حالی که مدلهای پایه، مدلهای زبانی عمومی هستند. این موضوع به نفع Needle است.
در محک BFCL v4، مدل Needle 2 قدرت تعمیمپذیری (Extrapolation) بالایی نشان داد. با وجود اینکه روی APIهای سازمانی آموزش ندیده و تمرکزش روی اقدامات مصرفکننده (مثل خانه هوشمند، تلویزیون و خودرو) است، در فراخوانیهای ساده پایتون تنها یک امتیاز با FunctionGemma فاصله داشت و نرخ شکلدهی صحیح ۹۳.۴٪ را در ۳۶۴۱ ردیف حفظ کرد. شکافها تنها در دستههای جاوا، جاوااسکریپت و فراخوانیهای موازی چندگانه دیده شد.
قمار روی ۲-بیت بدون افت کیفیت
بسیاری از مدلهای کوچک هنگام کوانتاسیون (Quantization) پس از آموزش فرو میپاشند. Cactus این مشکل را با آموزش Needle 2 از ابتدا با استفاده از Cactus Quants حل کرد. وزنها، فعالسازها و حافظه KV cache همگی برای دقت ۲-بیت آموزش دیدهاند. مدل ۲-بیتی که مستقر شده، دقیقاً همان مدلی است که آموزش دیده، و این امر از افت کیفی معمول در فشردهسازیهای پسینی جلوگیری میکند.
موتور استنتاج یک باینری C++ بدون وابستگی است. این موتور در هنگام شروع، CPU را بررسی میکند تا بهترین کرنل را انتخاب کند؛ از SDOT، NEON و AVX2 گرفته تا بردارهای RISC-V و wasm SIMD. این طراحی مشترک تضمین میکند که وزنها هرگز در رم باز (Decompress) نشوند، بلکه مستقیماً در ثبارهای برداری گسترش یافته و به ضربهای داخلی صحیح (Integer dot products) ادغام شوند. مسیر محاسباتی از ابتدا تا انتها int8 باقی میماند.
برای افزایش بیشتر سرعت، استخر رشتهها (Thread pool) به جای خوابیدن (Sleep)، بخشهای سریال کوتاه یک توکن را میچرخاند (Spin) که سرعت رمزگشایی را تقریباً دو برابر کرد. هر بهینهسازی توکن-به-توکن با مسیر مرجع اعتبارسنجی شده تا تضمین شود هیچ تغییری در خروجی ایجاد نشده است.
خروجی با محدودیت گرامری
مدل Needle 2 در مورد فرمت پاسخهایش حدس نمیزند. این مدل از یک گرامر در سطح بایت استفاده میکند که از شمای تعریفشده (Declared Schemas) کامپایل شده است تا هر توکن را محدود کند. این یعنی موتور فقط امتیاز توکنهای قانونی را محاسبه میکند و تا ۹۸٪ از تصویرسازی واژگان را در مراحل ساختاری حذف میکند. در برخی مراحل، خروجی اجباری است و کل فرآیند تصویرسازی نادیده گرفته میشود.
این رویکرد مدل را به یک ابزار نگاشته تبدیل میکند: یک جمله «نامفهوم» از کاربر میگیرد و آن را روی پارامترهای typed نگاشت میکند. اگر امتیاز اطمینان مدل پایینتر از یک آستانه مشخص بیاید، یک فراخوانی خالی برمیگرداند تا سیستم درخواست را به ابر (Cloud) ارجاع دهد. این همکاری لبه-ابر تضمین میکند که کنترلهای روتین خصوصی و فوری بمانند و درخواستهای نادر و پیچیده توسط مدلهای بزرگتر مدیریت شوند.
استقرار در دنیای واقعی
شرکت Pebble مدل Needle 2 را در اپلیکیشن Index 01 برای انگشتر Pebble Index Ring ادغام کرده است. چون این انگشتر صفحه نمایش ندارد، هوش مصنوعی باید درخواستهای صوتی را بهصورت محلی و بدون اتصال به شبکه با قابلیت اطمینان اجرا کند. Pebble اعلام کرد که اثرِ ناچیز (Footprint) و عملکرد بالای این مدل برای کاربردی بودن دستگاه ضروری است.
توسعهدهندگان میتوانند مدل را روی یک مک یا پیسی استاندارد تنظیم دقیق (Fine-tuning) کنند. به دلیل داشتن تنها ۴۵ میلیون پارامتر، بازآموزی مدل برای یادگیری واژگان ابزار یک محصول خاص، با استفاده از مخزن کد و پکیج پایتون ارائه شده، تنها چند دقیقه تا چند ساعت زمان میبرد. این به شرکتها اجازه میدهد Needle مخصوص به خود را عرضه کنند که به جای یک دستیار عمومی، با ابزارهای خاص دستگاه آنها صحبت کند.
تحلیل: بازتعریف لبه
این تغییر، این فرض بنیادی را که «هوش مصنوعی لبه» نیازمند یک NPU اختصاصی است، تغییر میدهد. با بهینهسازی برای «بایت-در-هر-توکن» به جای تمرکز صرف بر FLOPs، شرکت Cactus ثابت کرد که قابلیتهای عاملمحور میتواند روی سختافزارهای Bare-metal وجود داشته باشد. بهرهوری این موتور از چیزهایی میآید که مدل تصمیم میگیرد محاسبه نکند؛ با اجتناب از بازسازی (Rematerialization) و استفاده از هرس گرامری (Grammar Pruning)، مدل هر تکه ۱۴ مگابایتی را در هر توکن حداکثر یک بار میخواند.
برای کاربر نهایی، این به معنای گذار به سمت «هوش مصنوعی نامرئی» است. وقتی مدل اینقدر کوچک و سریع باشد، میتواند همیشه روشن بماند بدون اینکه باتری را تخلیه کند یا حریم خصوصی را به خطر اندازد. Needle 2 برای هر توکن ۷ تا ۸۵ برابر میلیوات-ساعت کمتری نسبت به مدلهایی که با آنها مقایسه شده مصرف میکند. این یک استدلال انرژی حیاتی است: در سیلیکونهای روی دستگاه، جابجایی یک بایت از فلش یا DRAM چندین مرتبه گرانتر از یک عملیات ضرب-جمع (Multiply-accumulate) است.
منتظر پذیرش این معماری در بخشهای خودرویی و پوشیدنی باشید، جایی که تأخیر و قابلیت اطمینان آفلاین غیرقابل مذاکره است. نبرد بعدی بر سر این خواهد بود که آیا این مدلهای ۴۵ میلیون پارامتری میتوانند استدلالهای چندمرحلهای پیچیده را بدون ارجاع به ابر مدیریت کنند یا خیر.




گفتگو