اگر قصد دارید یک مدل زبانی را روی سختافزاری به اندازه کف دست اجرا کنید، تا امروز با دیواری به نام «پهنایباند» روبرو بودید. حالا با معرفی AI HAT+ 2، رزبری پای ۵ میتواند مدلهای زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب میدهد — و مدلهای بینایی-زبانی (VLM) با حداکثر ۶ میلیارد پارامتر را بهصورت محلی اجرا کند. این تغییر، یک چرخش بنیادین در نحوه مدیریت هوش مصنوعی در لبه است و امکان اجرای هوش مصنوعی مولد (Generative AI) را بهصورت کاملاً محلی فراهم میکند.
سالهاست که رایانش لبه (Edge Computing) در رزبری پای، نبردی برای کسب پهنایباند بوده است. همانطور که در تحلیل قبلی ما دربارهی مدلهای بسیار کوچک مثل Cactus Needle 2 اشاره کردیم، برخی مدلها میتوانستند به سرعتهای خیرهکننده ۵۰۰ توکن بر ثانیه روی رزبری پای ۵ برسند، اما اکثر مدلهای زبانی استاندارد بهشدت کند و sluggish باقی ماندند؛ زیرا آنها برای هر عملیات به حافظه مشترک DRAM سیستم وابسته بودند.
طبق مستنداتی که در ۱۳ اوت ۲۰۲۶ منتشر شد، AI HAT+ 2 این مشکل را با ادغام تراشه Hailo-10H حل کرده است. تفاوت کلیدی این سختافزار با نسلهای قبلی، وجود ۸ گیگابایت حافظه داخلی (Onboard Memory) است. این حافظه محلی اجازه میدهد شتابدهنده، وزنهای مدل را درون خود نگه دارد و برای تولید هر توکن (Token) — تکههای کوچکی از متن، شبیه برشهای یک کیک طولانی که مدل تکهتکه میخورد — نیازی نباشد دادهها را در هر مرحله از مسیر باریک گذرگاه PCIe فراخوانی کند.
مشخصات سختافزاری
برای درک تفاوتها، نگاهی به مقایسه سه نسخه موجود بیندازیم:
- AI HAT+ (13 TOPS): از تراشه Hailo-8L با دقت INT8 استفاده میکند. این مدل هیچ حافظه داخلی ندارد و کاملاً به حافظه سیستم رزبری پای ۵ وابسته است؛ بنابراین از مدلهای زبانی بزرگ (LLMs) پشتیبانی نمیکند.
- AI HAT+ (26 TOPS): از تراشه Hailo-8 با دقت INT8 استفاده میکند. این نسخه نیز فاقد حافظه داخلی است و از حافظه سیستم استفاده میکند، لذا برای اجرای LLMها مناسب نیست.
- AI HAT+ 2 (40 TOPS): از تراشه Hailo-10H با دقت INT4 استفاده میکند. این مدل دارای ۸ گیگابایت حافظه داخلی است و میتواند مدلهایی تا حدود ۶ میلیارد پارامتر را پشتیبانی کند.
مکانیسم شتابدهی
بسیار مهم است که درک کنیم این HATها، پردازندههای گرافیکی (GPU) یا کمکپردازندههای چندمنظوره در معنای سنتی آن نیستند. آنها رزبری پای را در همه زمینهها سریعتر نمیکنند. در عوض، این سختافزارها تنها یک گراف شبکه عصبی (Neural Network Graph) که از پیش کامپایل شده باشد را اجرا میکنند و هیچ کار دیگری انجام نمیدهند.
این شتابدهندهها یک شبکه عصبی را میگیرند که قبلاً به فرمت باینری اختصاصی سازنده تبدیل شده است. آنها وزنها را نگه داشته و آنها را روی تنسورهایی که توسط میزبان (Host) ارائه شده، اجرا میکنند. هر چیزی خارج از آن گراف خاص — از جمله تصمیمگیریها، کدهای رابط (Glue Code) و عملیات ورودی/خروجی (I/O) — همچنان روی CPU رزبری پای باقی میماند.
اگر معماری یک مدل در مجموعه اپراتورهای پشتیبانیشده یا «باغ مدل» (Model Zoo) سازنده نباشد، مدل بهسادگی اجرا نخواهد شد. پاسخ این نیست که مدل «کندتر» اجرا میشود، بلکه اصلاً هیچ فایل قابل بارگذاری (Artefact) برای آن وجود نخواهد داشت. این محدودیتی مشابه با مجموعه اپراتورهایی است که در تراشه RK3588 دیده میشود. این چالش در پیادهسازیهای سختافزاری، یادآور اهمیت تعریف قراردادهای معماری برای جلوگیری از بدهی فنی در توسعه سیستمهای هوشمند است تا سازگاری مدلها با سختافزار تضمین شود.
تفاوت بارهای کاری بینایی و زبانی
در کارهای بینایی (Vision) — مانند تشخیص اشیا (Detection)، قطعهبندی (Segmentation)، تخمین ژست (Pose Estimation) و طبقهبندی (Classification) — نسخههای ۱۳ و ۲۶ TOPS همچنان بسیار مؤثر هستند. این وظایف متعلق به خانواده بینایی کانولوشنال (Convolutional Vision) هستند. این مدلها نسبت محاسبات به هر بایت خوانده شده (Arithmetic per byte read) بالایی دارند و وزنهای آنها به اندازه کافی کوچک است که در حافظه تراشه باقی بماند.
اما مدلهای زبانی متفاوت هستند زیرا در زمان رمزگشایی (Decode time) به پهنایباند وابسته (Bandwidth-bound) هستند. برای تولید هر توکن، مدل باید کل مجموعه وزنهای خود را بخواند. یک شتابدهنده بدون حافظه داخلی باید این وزنها را در هر گام از طریق گذرگاه میزبان فراخوانی کند. از آنجایی که یک تکلاین PCIe چندین مرتبه کندتر از DRAM خود رزبری پای است، در هنگام اجرای یک مدل چت روی نسخههای ۱۳ و ۲۶ TOPS، شتابدهنده عملاً بیکار میماند و بار روی چهار هسته Cortex-A76 میافتد.
تجهیز AI HAT+ 2 به ۸ گیگابایت حافظه محلی، پاسخ را از «نه» به «بله، تا حدود ۶ میلیارد پارامتر» تغییر داده است. این یک اتفاق تصادفی نیست؛ ۸ گیگابایت تقریباً همان مقداری است که ۶ میلیارد پارامتر با دقت ۴-بیت به همراه یک پنجره زمینه (Working Context) فعال نیاز دارند. این توانمندی در لبه، ما را به یاد سلسلهمراتب هوشمندی مدلهای پیشرفتهای مثل Claude Opus 5 میاندازد که اکنون تلاش میشود نسخههای بهینهشدهای از چنین استانداردهایی روی سختافزارهای کوچکتر پیاده شود.
گلوگاه CPU و خط لوله پردازشی
حتی برای بارهای کاری بینایی، شتابدهنده تنها یک مرحله از یک خط لوله (Pipeline) است. هستههای Cortex-A76 در Raspberry Pi 5 همچنان باید بقیه فرآیند را مدیریت کنند:
- کپچر و رمزگشایی: استخراج فریمها از دوربین یا دموکس کردن استریمهای ویدئویی قبل از اینکه شتابدهنده دادهای ببیند، اتفاق میافتد.
- پیشپردازش: این مرحله شامل تغییر اندازه (Resizing) به اندازه ورودی ثابت شبکه، تبدیل فضای رنگی، نرمالسازی و تغییرات چیدمان (Layout) است. این حجم از کار متناسب با رزولوشن است و در نرخهای فریم بالا، اغلب گلوگاه واقعی سیستم است.
- پسپردازش: بسته به نحوه کامپایل، رمزگشایی تنسورهای خامِ سرِ تشخیص (Detection Head) به جعبهها (Boxes) و اجرای Non-Maximum Suppression ممکن است روی CPU انجام شود.
- منطق برنامه: ردیابی (Tracking)، منطق تجاری، ذخیرهسازی و شبکه بههیچوجه شتابدهی نمیشوند.
اگر یک خط لوله در مرحله شتابدهنده از ۵ فریم بر ثانیه به ۳۰ فریم برسد، اما روی CPU برای تغییر اندازه هر فریم ۲۰ میلیثانیه زمان صرف کند، گلوگاه صرفاً جابهجا شده است، نه اینکه حذف شود.
توان، حرارت و اتصالات
کاربران باید نسبت به محدودیتهای توان هوشیار باشند. این شتابدهندهها چندین وات برق از طریق هدر رزبری پای یا کانکتور PCIe میکشند. این مقدار به بودجه توانی اضافه میشود که از قبل محدود است. افت ولتاژ (Undervoltage) در رزبری پای به صورت کاهش سرعت CPU (Throttling) ظاهر میشود؛ این یعنی شتابدهنده میتواند در واقع باعث کندتر شدن بقیه خط لوله شما شود. حتماً از منبع تغذیه مشخص شده استفاده کنید و برای تأیید عملکرد، دستور vcgencmd get_throttled را بررسی کنید.
اتصالات نیز یک فاکتور حیاتی هستند. رزبری پای ۵ از یک کانکتور FFC تکلاین PCIe استفاده میکند. هر چیزی که شتابدهنده دریافت یا ارسال میکند، از این یک لاین عبور میکند. اگر همزمان یک SSD NVMe را از طریق یک M.2 HAT اجرا کنید، این پهنایباند به اشتراک گذاشته میشود. در حالی که یک تنسور ورودی uint8 با اندازه ۶۴۰x۶۴۰ (حدود ۱.۲ مگابایت) در ۳۰ فریم بر ثانیه بهراحتی در یک لاین جای میگیرد، اما استریم کردن وزنها در هر استنتاج برای عملکرد سیستم مرگبار است.
چگونه قبل از خرید تصمیم بگیریم؟
قبل از سفارش، این سه سوال را به ترتیب بپرسید:
۱. آیا مدل شما برای این قطعه کامپایل میشود؟ مدل باید از طریق زنجیره ابزار (Toolchain) شرکت Hailo از فرمت ONNX یا TensorFlow قابل تبدیل باشد.
۲. آیا این یک مدل زبانی است؟ اگر بله، تنها AI HAT+ 2 کاربرد دارد؛ سقف پارامترها را در مستندات بررسی کنید.
۳. در حال حاضر زمان شما کجا صرف میشود؟ تفکیک هزینه زمانی هر فریم را اندازهگیری کنید. اگر زمان استنتاج کمتر از نیمی از زمان کل است، یک شتابدهنده بهبود شما را به زیر ۲ برابر محدود میکند، فارغ از اینکه چند TOPS قدرت داشته باشد.
جدول مقایسهای فعلی در مستندات لوازم جانبی رزبری پای را بررسی کنید، زیرا AI HAT+ 2 بیش از آنکه صرفاً نسخهای سریعتر باشد، دستگاهی اساساً متفاوت از AI HAT+ اصلی است.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو