پرش به محتوای اصلی
پرش به محتوای مقاله

Raspberry Pi 5 در برابر مدل‌های سنگین؛ نمایش قدرت Needle 2

·۲۰ مرداد ۱۴۰۵۱۰ دقیقه مطالعه۲ بازدید
عنوان: "Needle 2 - The 14 MB Agentic LLM for Tiny Devices | Cactus"

ترجمه فارسی مختصر (حداکثر ۱۲۵ کاراکتر):

«نیدل ۲: مدل زب
عنوان: "Needle 2 - The 14 MB Agentic LLM for Tiny Devices | Cactus" ترجمه فارسی مختصر (حداکثر ۱۲۵ کاراکتر): «نیدل ۲: مدل زب
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی مدلی که با دقت ۲-بیت از ابتدا آموزش دیده تا از فروپاشی مدل‌های کوانتیده جلوگیری کند و بتواند با حجم ۱۴ مگابایت بر روی سخت‌افزارهای بسیار ارزان (مانند ESP32) با سرعت بسیار بالا اجرا شود.

اگر امروز یک دستگاه رزبری پای ۵ در دست دارید، می‌توانید سرعت تولید متن را به ۵۰۰ توکن در ثانیه برسانید، بدون اینکه به هیچ ابررایانه‌ای متصل باشید. این جهش خیره‌کننده نتیجه‌ی انتشار مدل Needle 2 در ۱۰ آگوست ۲۰۲۶ است؛ یک مدل ۴۵ میلیون پارامتری که قابلیت‌های عامل‌محور (Agentic) — یعنی توانایی تصمیم‌گیری و اجرای دستورات — را به سخت‌افزارهایی با قیمت زیر ۲۰۰ دلار می‌آورد. این رویکرد عامل‌محور در مقیاس‌های بزرگ‌تر نیز دیده می‌شود، مانند مدل Inkling-Small که اخیراً در کدنویسی پیچیده نتایج درخشانی داشته است. طبق گزارش وب‌سایت cactuscompute.com، این مدل در سقف سختگیرانه‌ی ۲۸ مگابایت رم فعالیت می‌کند و همین موضوع آن را با میکروکنترلرهایی مانند ESP32-S3 سازگار می‌کند.

این انتشار در زمانی رخ می‌دهد که صنعت هوش مصنوعی برای خروج از حصار پردازنده‌های گرافیکی (GPU) و واحدهای پردازش عصبی (NPU) گران‌قیمت دست‌وپا می‌زند. در حالی که هوش مصنوعی لبه (Edge AI) سطح بالا معمولاً مک یا پی‌سی را هدف قرار می‌دهد، واقعیت این است که اکثریت مطلق ۲۱ میلیارد دستگاه اینترنت اشیا (IoT) متصل، چنین توانی ندارند. در بازارهای نوظهور، اکثر گوشی‌های تلفنی که عرضه می‌شوند قیمتی زیر ۲۰۰ دلار دارند. تقریباً چهار مورد از هر پنج دستگاه لبه — شامل گوشی‌های اقتصادی، رزبری پای‌ها، گجت‌های پوشیدنی و ربات‌های کوچک مانند Reachy Mini — قیمتی زیر ۲۰۰ دلار دارند. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی استارتاپ‌هایی که معماری ترنسفورمر را برای کاهش هزینه به چالش می‌کشند اشاره کردیم، مدل Needle 2 تمرکز را از چت‌های عمومی به تعاملات ساختاریافته و خاص با دستگاه‌ها تغییر داده است.

تصور کنید یک انگشتر هوشمند یا یک گوشی ارزان‌قیمت داشته باشید که برای روشن کردن چراغ یا تنظیم تایمر، نیازی به ابر (Cloud) نداشته باشد. شرکت Cactus با حذف نیاز به دانش جهانی و نثر باز، تعداد پارامترهای مورد نیاز را از میلیاردها به تنها ۴۵ میلیون رسانده است. شرط آن‌ها این است: روشن کردن یک چراغ نیازی به یک مدل پیشرو (Frontier Model) ندارد؛ فقط باید بتواند یک جمله‌ی نامفهوم یا نامنظم را به توابعی با پارامترهای تایپ‌شده (Typed Parameters) نگاشت کند.

معماری بهره‌وری

مدل Needle 2 یک ترنسفورمر استاندارد نیست. این مدل از یک شبکه توجه ساده (Simple Attention Network) استفاده می‌کند که جایگزین تصویرسازی‌های متراکم (Dense Projections) با یک تبدیل والش-هادامارد ثابت شده است. این سازوکار اجازه می‌دهد ترکیب کانال‌ها تقریباً بدون هزینه پارامتری انجام شود. معماری مدل از جریان‌های باقی‌مانده‌ی چندمسیره استفاده می‌کند تا به یک شبکه‌ی ۲۷ لایه با عرض ۵۱۲، انعطاف‌پذیری مدل‌های بسیار عریض‌تر را ببخشد، در حالی که تنها چند ضرب داخلی (Dot Product) به هر لایه اضافه می‌کند.

عنوان: سوزن ۲ - مدل زبانی عامل ۱۴ مگابایتی برای دستگاه‌های کوچک | کاکتوس

مشخصات فنی کلیدی عبارت‌اند از:

  • حجم فایل: یک فایل باینری واحد ۱۴ مگابایتی
  • رم مورد نیاز: سقف قطعی و دترمینیستی ۲۸ مگابایت برای هر جلسه
  • دقت: CQ2-bit (کوانت‌های ککتوس) که از پیش‌آموزش تا پس‌آموزش با همین دقت اجرا شده است
  • پنجره متنی: یک پنجره لغزان ۲۵۶ توکنی برای محدود کردن حافظه KV cache
  • داده‌های آموزش: پیش‌آموزش روی یک کورپوس اختصاصی ۱۱۵ میلیارد توکنی و پس‌آموزش روی ۳۸ میلیارد توکن با استفاده از ردپاهای استدلالی فشرده
  • لایسنس: Apache 2.0 با دسترسی به وزن‌ها در Hugging Face

برای جلوگیری از فراموشی هدف اصلی، اعلان‌های ابزار و پرامپت‌های سیستمی (System Prompts) به عنوان سینک‌های دائمی (Permanent Sinks) در سیستم حافظه تثبیت شده‌اند. این کار تضمین می‌کند که توانایی مدل در فراخوانی توابع، از نظر ساختاری در برابر حذف شدن (Eviction) از حافظه در طول یک جلسه محافظت شود.

بررسی عمیق سازوکارهای شبکه توجه ساده

مدل Needle 2 برای کسب قابلیت‌ها بدون مصرف پهنای باند، از چندین مکانیزم غیر-استاندارد استفاده می‌کند:

  • Hadamard MLP: جایگزینی تصویرسازی‌های متراکم معمولیِ بالا-پایین با یک تبدیل والش ثابت و قطری‌های یادگرفته‌شده. این کار خواندن وزن‌ها را در هنگام ترکیب کانال‌ها به حداقل می‌رساند. تبدیل والش-هادامارد یک ماتریس ثابت است که در زمان n log n اعمال می‌شود و هیچ وزنی برای خواندن ندارد.
  • جداول انگرام (Engram Tables): انتقال دانش جهانی از پشته‌ی اصلی به جداول n-gram هش‌شده. این جداول در زمان استنتاج (Inference) به صورت چند ردیف در هر توکن خوانده می‌شوند و ظرفیتی را فراهم می‌کنند که در زمان رمزگشایی تقریباً رایگان است. این موضوع برای دستگاه‌هایی که هر مگابایت خواندن از حافظه فلش روی تأخیر و باتری اثر می‌گذارد، حیاتی است.
  • بهینه‌سازی انرژی: یک ترنسفورمر معمولی با این عرض، ۱۶۴ MFLOPs برای هر توکن مصرف می‌کند. یک نسخه فشرده ۸۷ MFLOPs هزینه دارد. اما Needle تنها ۷۰ MFLOPs مصرف می‌کند، زیرا یک‌پنجم پارامترهایش را به عنوان حافظه جمع‌آوری‌شده نگه می‌دارد که هیچ هزینه محاسباتی (Arithmetic) ندارد.
  • طراحی حافظه‌محور: سیستم از روی دستگاه‌های با رم ثابت به‌صورت معکوس طراحی شده است. سقف ۲۸ مگابایتی اجازه می‌دهد مدل روی ESP32-P4 با ۳۲ مگابایت PSRAM، یا بردهای STM32H7 و NXP i.MX RT با SDRAM اجرا شود. موتور مدل برای سخت‌افزارهای Bare metal به صورت تک‌رشته‌ای (Single-threaded) کامپایل شده و به صورت یک کتابخانه استاتیک برای Cortex-M4، M7 و M55 عرضه می‌شود.
  • مسیریابی و نرمال‌سازی: شبکه از تخطئه نرمال‌شده‌ی RMS برای چهار جریان باقی‌مانده استفاده می‌کند. لاجیت‌های مسیریابی از طریق نرمال‌سازی دو-تصادفی (Double-stochastic) که توسط تکرار sinkhorn محاسبه می‌شود، پردازش می‌شوند. هر دو بخش باقی‌مانده‌ی توجه و MLP به صورت Sandwich-norm شده و گیت‌دار (Gated) هستند.

عملکرد و بنچمارک‌ها

در تست‌های رودررو، Needle 2 با مدل‌های بسیار بزرگ‌تر رقابت می‌کند. در محک Google Mobile Actions (با ۹۶۱ ردیف)، این مدل با FunctionGemma 270M، LFM2.5 230M و Apple FM رقابت می‌کند، در حالی که ۵ تا ۷۰ برابر کوچک‌تر است. این رقابت با مدل‌های کوچک‌تر اما قدرتمند، یادآور موفقیت‌های مدل LFM2.5-2.6B در بهینه‌سازی فراخوانی ابزارهاست. نکته جالب این است که مدل LFM2.5-230M روی ۱۹ تریلیون توکن آموزش دیده (تقریباً ۱۲۰ برابر Needle)، اما هر دو مدل در استفاده از ابزار نتایج مشابهی دارند و پیروزی‌ها را با هم رد و بدل می‌کنند.

سرعت اجرا بسته به سخت‌افزار متفاوت اما در همه موارد بسیار بالاست:

  • رزبری پای ۵: بیش از ۵۰۰ توکن در ثانیه برای رمزگشایی (Decode) و ۸۰۰ توکن برای پیش‌پُرکردن (Prefill)
  • Apple Vision Pro و Meta Quest 3S: بین ۴۰۰ تا ۱۵۰۰ توکن در ثانیه
  • گوشی‌های سری A سامسونگ (زیر ۲۰۰ دلار): بین ۳۰۰ تا ۷۰۰ توکن در ثانیه

معیارهای ارزیابی و محدوده

شرکت Cactus مدل Needle 2 را روی پنج محک عمومی ارزیابی کرد: Google Mobile Actions، DroidCall، Seal-Tools (در دامنه و خارج از دامنه) و BFCL v4 تک-مرحله‌ای. امتیازدهی بر اساس «تطابق دقیق سخت ترتیب‌یافته» (Ordered Strict Exact Match) بود؛ یعنی نام تابع، ترتیب فراخوانی و مقدار هر آرگومان باید دقیقاً و به ترتیب درست باشند.

دو عدم‌تقارن (Asymmetry) کلیدی در این تست‌ها وجود دارد:
۱. دقت: مدل‌های پایه با دقت f16 اجرا شدند در حالی که Needle روی CQ2-bit بود. این موضوع به نفع مدل‌های پایه است، زیرا کوانتاسیون پس‌آموزش معمول به ۲ بیت، مدل‌هایی را که برای آن آموزش ندیده‌اند فرو می‌پاشاند.
۲. محدوده: مدل Needle برای فراخوانی ابزار عامل‌محور تخصصی شده، در حالی که مدل‌های پایه، مدل‌های زبانی عمومی هستند. این موضوع به نفع Needle است.

در محک BFCL v4، مدل Needle 2 قدرت تعمیم‌پذیری (Extrapolation) بالایی نشان داد. با وجود اینکه روی APIهای سازمانی آموزش ندیده و تمرکزش روی اقدامات مصرف‌کننده (مثل خانه هوشمند، تلویزیون و خودرو) است، در فراخوانی‌های ساده پایتون تنها یک امتیاز با FunctionGemma فاصله داشت و نرخ شکل‌دهی صحیح ۹۳.۴٪ را در ۳۶۴۱ ردیف حفظ کرد. شکاف‌ها تنها در دسته‌های جاوا، جاوااسکریپت و فراخوانی‌های موازی چندگانه دیده شد.

قمار روی ۲-بیت بدون افت کیفیت

بسیاری از مدل‌های کوچک هنگام کوانتاسیون (Quantization) پس از آموزش فرو می‌پاشند. Cactus این مشکل را با آموزش Needle 2 از ابتدا با استفاده از Cactus Quants حل کرد. وزن‌ها، فعال‌سازها و حافظه KV cache همگی برای دقت ۲-بیت آموزش دیده‌اند. مدل ۲-بیتی که مستقر شده، دقیقاً همان مدلی است که آموزش دیده، و این امر از افت کیفی معمول در فشرده‌سازی‌های پسینی جلوگیری می‌کند.

موتور استنتاج یک باینری C++ بدون وابستگی است. این موتور در هنگام شروع، CPU را بررسی می‌کند تا بهترین کرنل را انتخاب کند؛ از SDOT، NEON و AVX2 گرفته تا بردارهای RISC-V و wasm SIMD. این طراحی مشترک تضمین می‌کند که وزن‌ها هرگز در رم باز (Decompress) نشوند، بلکه مستقیماً در ثبارهای برداری گسترش یافته و به ضرب‌های داخلی صحیح (Integer dot products) ادغام شوند. مسیر محاسباتی از ابتدا تا انتها int8 باقی می‌ماند.

برای افزایش بیشتر سرعت، استخر رشته‌ها (Thread pool) به جای خوابیدن (Sleep)، بخش‌های سریال کوتاه یک توکن را می‌چرخاند (Spin) که سرعت رمزگشایی را تقریباً دو برابر کرد. هر بهینه‌سازی توکن-به-توکن با مسیر مرجع اعتبارسنجی شده تا تضمین شود هیچ تغییری در خروجی ایجاد نشده است.

خروجی با محدودیت گرامری

مدل Needle 2 در مورد فرمت پاسخ‌هایش حدس نمی‌زند. این مدل از یک گرامر در سطح بایت استفاده می‌کند که از شمای تعریف‌شده (Declared Schemas) کامپایل شده است تا هر توکن را محدود کند. این یعنی موتور فقط امتیاز توکن‌های قانونی را محاسبه می‌کند و تا ۹۸٪ از تصویرسازی واژگان را در مراحل ساختاری حذف می‌کند. در برخی مراحل، خروجی اجباری است و کل فرآیند تصویرسازی نادیده گرفته می‌شود.

این رویکرد مدل را به یک ابزار نگاشته تبدیل می‌کند: یک جمله «نامفهوم» از کاربر می‌گیرد و آن را روی پارامترهای typed نگاشت می‌کند. اگر امتیاز اطمینان مدل پایین‌تر از یک آستانه مشخص بیاید، یک فراخوانی خالی برمی‌گرداند تا سیستم درخواست را به ابر (Cloud) ارجاع دهد. این همکاری لبه-ابر تضمین می‌کند که کنترل‌های روتین خصوصی و فوری بمانند و درخواست‌های نادر و پیچیده توسط مدل‌های بزرگ‌تر مدیریت شوند.

استقرار در دنیای واقعی

شرکت Pebble مدل Needle 2 را در اپلیکیشن Index 01 برای انگشتر Pebble Index Ring ادغام کرده است. چون این انگشتر صفحه نمایش ندارد، هوش مصنوعی باید درخواست‌های صوتی را به‌صورت محلی و بدون اتصال به شبکه با قابلیت اطمینان اجرا کند. Pebble اعلام کرد که اثرِ ناچیز (Footprint) و عملکرد بالای این مدل برای کاربردی بودن دستگاه ضروری است.

توسعه‌دهندگان می‌توانند مدل را روی یک مک یا پی‌سی استاندارد تنظیم دقیق (Fine-tuning) کنند. به دلیل داشتن تنها ۴۵ میلیون پارامتر، بازآموزی مدل برای یادگیری واژگان ابزار یک محصول خاص، با استفاده از مخزن کد و پکیج پایتون ارائه شده، تنها چند دقیقه تا چند ساعت زمان می‌برد. این به شرکت‌ها اجازه می‌دهد Needle مخصوص به خود را عرضه کنند که به جای یک دستیار عمومی، با ابزارهای خاص دستگاه آن‌ها صحبت کند.

تحلیل: بازتعریف لبه

این تغییر، این فرض بنیادی را که «هوش مصنوعی لبه» نیازمند یک NPU اختصاصی است، تغییر می‌دهد. با بهینه‌سازی برای «بایت-در-هر-توکن» به جای تمرکز صرف بر FLOPs، شرکت Cactus ثابت کرد که قابلیت‌های عامل‌محور می‌تواند روی سخت‌افزارهای Bare-metal وجود داشته باشد. بهره‌وری این موتور از چیزهایی می‌آید که مدل تصمیم می‌گیرد محاسبه نکند؛ با اجتناب از بازسازی (Rematerialization) و استفاده از هرس گرامری (Grammar Pruning)، مدل هر تکه ۱۴ مگابایتی را در هر توکن حداکثر یک بار می‌خواند.

برای کاربر نهایی، این به معنای گذار به سمت «هوش مصنوعی نامرئی» است. وقتی مدل اینقدر کوچک و سریع باشد، می‌تواند همیشه روشن بماند بدون اینکه باتری را تخلیه کند یا حریم خصوصی را به خطر اندازد. Needle 2 برای هر توکن ۷ تا ۸۵ برابر میلی‌وات-ساعت کمتری نسبت به مدل‌هایی که با آن‌ها مقایسه شده مصرف می‌کند. این یک استدلال انرژی حیاتی است: در سیلیکون‌های روی دستگاه، جابجایی یک بایت از فلش یا DRAM چندین مرتبه گران‌تر از یک عملیات ضرب-جمع (Multiply-accumulate) است.

منتظر پذیرش این معماری در بخش‌های خودرویی و پوشیدنی باشید، جایی که تأخیر و قابلیت اطمینان آفلاین غیرقابل مذاکره است. نبرد بعدی بر سر این خواهد بود که آیا این مدل‌های ۴۵ میلیون پارامتری می‌توانند استدلال‌های چندمرحله‌ای پیچیده را بدون ارجاع به ابر مدیریت کنند یا خیر.

چرا این موضوع مهم است؟

این مدل با تکیه بر تخصص در بهینه‌سازی سطح پایین (Low-level)، اثبات می‌کند که قابلیت‌های عامل‌محور نیازی به NPUهای گران‌قیمت ندارند. این تغییر، مسیر تولید گجت‌های پوشیدنی و IoT را از وابستگی به ابر به سمت استقلال کامل سخت‌افزاری می‌برد.

تأثیر برای ایران

به‌دلیل انتشار مدل تحت لایسنس Apache 2.0 و دسترسی به وزن‌ها در Hugging Face، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به APIهای پولی، سیستم‌های کنترل محلی و گجت‌های هوشمند بسازند.

·نگاه ما
تحریریه دات‌هوش

پایبندی Cactus به «حذف دانش جهانی» برای رسیدن به سرعت ۵۰۰ توکن در ثانیه، یک چرخش استراتژیک در تعریف هوش مصنوعی لبه است. این رویکرد ثابت می‌کند که برای کاربردهای Agentic، تخصص در یک دامنه محدود (Domain Specific) بسیار کارآمدتر از تلاش برای کوچک‌سازی مدل‌های general-purpose است. در واقع، Needle 2 بیشتر شبیه به یک کامپایلر هوشمند از زبان طبیعی به کد است تا یک مدل زبانی به معنای رایج آن.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.