پرش به محتوای اصلی
پرش به محتوای مقاله

حافظه اختصاصی در برابر حافظه سیستم؛ تغییر سرعت بارگذاری وزن‌های مدل

·۲۳ مرداد ۱۴۰۵۵ دقیقه مطالعه۳ بازدید
تصویر: هت‌های شتاب‌دهنده هوش مصنوعی برای رزبری پای
تصویر: هت‌های شتاب‌دهنده هوش مصنوعی برای رزبری پای
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

افزودن ۸ گیگابایت حافظه Onboard به شتاب‌دهنده؛ این اولین بار است که یک HAT برای رزبری پای اجازه می‌دهد مدل‌های زبانی تا ۶ میلیارد پارامتر بدون گلوگاه PCIe اجرا شوند.

اگر قصد دارید یک مدل زبانی را روی سخت‌افزاری به اندازه کف دست اجرا کنید، تا امروز با دیواری به نام «پهنای‌باند» روبرو بودید. حالا با معرفی AI HAT+ 2، رزبری پای ۵ می‌تواند مدل‌های زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — و مدل‌های بینایی-زبانی (VLM) با حداکثر ۶ میلیارد پارامتر را به‌صورت محلی اجرا کند. این تغییر، یک چرخش بنیادین در نحوه مدیریت هوش مصنوعی در لبه است و امکان اجرای هوش مصنوعی مولد (Generative AI) را به‌صورت کاملاً محلی فراهم می‌کند.

سال‌هاست که رایانش لبه (Edge Computing) در رزبری پای، نبردی برای کسب پهنای‌باند بوده است. همان‌طور که در تحلیل قبلی ما درباره‌ی مدل‌های بسیار کوچک مثل Cactus Needle 2 اشاره کردیم، برخی مدل‌ها می‌توانستند به سرعت‌های خیره‌کننده ۵۰۰ توکن بر ثانیه روی رزبری پای ۵ برسند، اما اکثر مدل‌های زبانی استاندارد به‌شدت کند و sluggish باقی ماندند؛ زیرا آن‌ها برای هر عملیات به حافظه مشترک DRAM سیستم وابسته بودند.

طبق مستنداتی که در ۱۳ اوت ۲۰۲۶ منتشر شد، AI HAT+ 2 این مشکل را با ادغام تراشه Hailo-10H حل کرده است. تفاوت کلیدی این سخت‌افزار با نسل‌های قبلی، وجود ۸ گیگابایت حافظه داخلی (Onboard Memory) است. این حافظه محلی اجازه می‌دهد شتاب‌دهنده، وزن‌های مدل را درون خود نگه دارد و برای تولید هر توکن (Token) — تکه‌های کوچکی از متن، شبیه برش‌های یک کیک طولانی که مدل تکه‌تکه می‌خورد — نیازی نباشد داده‌ها را در هر مرحله از مسیر باریک گذرگاه PCIe فراخوانی کند.

مشخصات سخت‌افزاری

برای درک تفاوت‌ها، نگاهی به مقایسه سه نسخه موجود بیندازیم:

  • AI HAT+ (13 TOPS): از تراشه Hailo-8L با دقت INT8 استفاده می‌کند. این مدل هیچ حافظه داخلی ندارد و کاملاً به حافظه سیستم رزبری پای ۵ وابسته است؛ بنابراین از مدل‌های زبانی بزرگ (LLMs) پشتیبانی نمی‌کند.
  • AI HAT+ (26 TOPS): از تراشه Hailo-8 با دقت INT8 استفاده می‌کند. این نسخه نیز فاقد حافظه داخلی است و از حافظه سیستم استفاده می‌کند، لذا برای اجرای LLMها مناسب نیست.
  • AI HAT+ 2 (40 TOPS): از تراشه Hailo-10H با دقت INT4 استفاده می‌کند. این مدل دارای ۸ گیگابایت حافظه داخلی است و می‌تواند مدل‌هایی تا حدود ۶ میلیارد پارامتر را پشتیبانی کند.

مکانیسم شتاب‌دهی

بسیار مهم است که درک کنیم این HATها، پردازنده‌های گرافیکی (GPU) یا کمک‌پردازنده‌های چندمنظوره در معنای سنتی آن نیستند. آن‌ها رزبری پای را در همه زمینه‌ها سریع‌تر نمی‌کنند. در عوض، این سخت‌افزارها تنها یک گراف شبکه عصبی (Neural Network Graph) که از پیش کامپایل شده باشد را اجرا می‌کنند و هیچ کار دیگری انجام نمی‌دهند.

این شتاب‌دهنده‌ها یک شبکه عصبی را می‌گیرند که قبلاً به فرمت باینری اختصاصی سازنده تبدیل شده است. آن‌ها وزن‌ها را نگه داشته و آن‌ها را روی تنسورهایی که توسط میزبان (Host) ارائه شده، اجرا می‌کنند. هر چیزی خارج از آن گراف خاص — از جمله تصمیم‌گیری‌ها، کدهای رابط (Glue Code) و عملیات ورودی/خروجی (I/O) — همچنان روی CPU رزبری پای باقی می‌ماند.

اگر معماری یک مدل در مجموعه اپراتورهای پشتیبانی‌شده یا «باغ مدل» (Model Zoo) سازنده نباشد، مدل به‌سادگی اجرا نخواهد شد. پاسخ این نیست که مدل «کندتر» اجرا می‌شود، بلکه اصلاً هیچ فایل قابل بارگذاری (Artefact) برای آن وجود نخواهد داشت. این محدودیتی مشابه با مجموعه اپراتورهایی است که در تراشه RK3588 دیده می‌شود. این چالش در پیاده‌سازی‌های سخت‌افزاری، یادآور اهمیت تعریف قراردادهای معماری برای جلوگیری از بدهی فنی در توسعه سیستم‌های هوشمند است تا سازگاری مدل‌ها با سخت‌افزار تضمین شود.

تفاوت بارهای کاری بینایی و زبانی

در کارهای بینایی (Vision) — مانند تشخیص اشیا (Detection)، قطعه‌بندی (Segmentation)، تخمین ژست (Pose Estimation) و طبقه‌بندی (Classification) — نسخه‌های ۱۳ و ۲۶ TOPS همچنان بسیار مؤثر هستند. این وظایف متعلق به خانواده بینایی کانولوشنال (Convolutional Vision) هستند. این مدل‌ها نسبت محاسبات به هر بایت خوانده شده (Arithmetic per byte read) بالایی دارند و وزن‌های آن‌ها به اندازه کافی کوچک است که در حافظه تراشه باقی بماند.

اما مدل‌های زبانی متفاوت هستند زیرا در زمان رمزگشایی (Decode time) به پهنای‌باند وابسته (Bandwidth-bound) هستند. برای تولید هر توکن، مدل باید کل مجموعه وزن‌های خود را بخواند. یک شتاب‌دهنده بدون حافظه داخلی باید این وزن‌ها را در هر گام از طریق گذرگاه میزبان فراخوانی کند. از آنجایی که یک تک‌لاین PCIe چندین مرتبه کندتر از DRAM خود رزبری پای است، در هنگام اجرای یک مدل چت روی نسخه‌های ۱۳ و ۲۶ TOPS، شتاب‌دهنده عملاً بیکار می‌ماند و بار روی چهار هسته Cortex-A76 می‌افتد.

تجهیز AI HAT+ 2 به ۸ گیگابایت حافظه محلی، پاسخ را از «نه» به «بله، تا حدود ۶ میلیارد پارامتر» تغییر داده است. این یک اتفاق تصادفی نیست؛ ۸ گیگابایت تقریباً همان مقداری است که ۶ میلیارد پارامتر با دقت ۴-بیت به همراه یک پنجره زمینه (Working Context) فعال نیاز دارند. این توانمندی در لبه، ما را به یاد سلسله‌مراتب هوشمندی مدل‌های پیشرفته‌ای مثل Claude Opus 5 می‌اندازد که اکنون تلاش می‌شود نسخه‌های بهینه‌شده‌ای از چنین استانداردهایی روی سخت‌افزارهای کوچک‌تر پیاده شود.

گلوگاه CPU و خط لوله پردازشی

حتی برای بارهای کاری بینایی، شتاب‌دهنده تنها یک مرحله از یک خط لوله (Pipeline) است. هسته‌های Cortex-A76 در Raspberry Pi 5 همچنان باید بقیه فرآیند را مدیریت کنند:

  • کپچر و رمزگشایی: استخراج فریم‌ها از دوربین یا دموکس کردن استریم‌های ویدئویی قبل از اینکه شتاب‌دهنده داده‌ای ببیند، اتفاق می‌افتد.
  • پیش‌پردازش: این مرحله شامل تغییر اندازه (Resizing) به اندازه ورودی ثابت شبکه، تبدیل فضای رنگی، نرمال‌سازی و تغییرات چیدمان (Layout) است. این حجم از کار متناسب با رزولوشن است و در نرخ‌های فریم بالا، اغلب گلوگاه واقعی سیستم است.
  • پس‌پردازش: بسته به نحوه کامپایل، رمزگشایی تنسورهای خامِ سرِ تشخیص (Detection Head) به جعبه‌ها (Boxes) و اجرای Non-Maximum Suppression ممکن است روی CPU انجام شود.
  • منطق برنامه: ردیابی (Tracking)، منطق تجاری، ذخیره‌سازی و شبکه به‌هیچ‌وجه شتاب‌دهی نمی‌شوند.

اگر یک خط لوله در مرحله شتاب‌دهنده از ۵ فریم بر ثانیه به ۳۰ فریم برسد، اما روی CPU برای تغییر اندازه هر فریم ۲۰ میلی‌ثانیه زمان صرف کند، گلوگاه صرفاً جابه‌جا شده است، نه اینکه حذف شود.

توان، حرارت و اتصالات

کاربران باید نسبت به محدودیت‌های توان هوشیار باشند. این شتاب‌دهنده‌ها چندین وات برق از طریق هدر رزبری پای یا کانکتور PCIe می‌کشند. این مقدار به بودجه توانی اضافه می‌شود که از قبل محدود است. افت ولتاژ (Undervoltage) در رزبری پای به صورت کاهش سرعت CPU (Throttling) ظاهر می‌شود؛ این یعنی شتاب‌دهنده می‌تواند در واقع باعث کندتر شدن بقیه خط لوله شما شود. حتماً از منبع تغذیه مشخص شده استفاده کنید و برای تأیید عملکرد، دستور vcgencmd get_throttled را بررسی کنید.

اتصالات نیز یک فاکتور حیاتی هستند. رزبری پای ۵ از یک کانکتور FFC تک‌لاین PCIe استفاده می‌کند. هر چیزی که شتاب‌دهنده دریافت یا ارسال می‌کند، از این یک لاین عبور می‌کند. اگر هم‌زمان یک SSD NVMe را از طریق یک M.2 HAT اجرا کنید، این پهنای‌باند به اشتراک گذاشته می‌شود. در حالی که یک تنسور ورودی uint8 با اندازه ۶۴۰x۶۴۰ (حدود ۱.۲ مگابایت) در ۳۰ فریم بر ثانیه به‌راحتی در یک لاین جای می‌گیرد، اما استریم کردن وزن‌ها در هر استنتاج برای عملکرد سیستم مرگبار است.

چگونه قبل از خرید تصمیم بگیریم؟

قبل از سفارش، این سه سوال را به ترتیب بپرسید:

۱. آیا مدل شما برای این قطعه کامپایل می‌شود؟ مدل باید از طریق زنجیره ابزار (Toolchain) شرکت Hailo از فرمت ONNX یا TensorFlow قابل تبدیل باشد.
۲. آیا این یک مدل زبانی است؟ اگر بله، تنها AI HAT+ 2 کاربرد دارد؛ سقف پارامترها را در مستندات بررسی کنید.
۳. در حال حاضر زمان شما کجا صرف می‌شود؟ تفکیک هزینه زمانی هر فریم را اندازه‌گیری کنید. اگر زمان استنتاج کمتر از نیمی از زمان کل است، یک شتاب‌دهنده بهبود شما را به زیر ۲ برابر محدود می‌کند، فارغ از اینکه چند TOPS قدرت داشته باشد.

جدول مقایسه‌ای فعلی در مستندات لوازم جانبی رزبری پای را بررسی کنید، زیرا AI HAT+ 2 بیش از آنکه صرفاً نسخه‌ای سریع‌تر باشد، دستگاهی اساساً متفاوت از AI HAT+ اصلی است.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این سخت‌افزار با حذف وابستگی به حافظه سیستم، اجرای محلی LLMها را در لبه (Edge) به واقعیت تبدیل می‌کند. این دستاورد بر اساس تخصص مهندسی سخت‌افزار Hailo در بهینه‌سازی جریان داده است و هزینه استنتاج را برای کاربر نهایی به شدت کاهش می‌دهد.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که به دلیل هزینه‌های بالای APIهای ابری به دنبال میزبانی شخصی (Self-hosting) هستند، این سخت‌افزار راهکاری ارزان برای اجرای مدل‌های محلی و خصوصی فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

انتقال حافظه به روی خودِ شتاب‌دهنده در ابعاد کوچک، نشان می‌دهد که صنعت از تمرکز بر افزایش TOPS (قدرت محاسباتی خام) به سمت حل بحران پهنای‌باند حرکت کرده است. این سخت‌افزار عملاً رزبری پای را از یک برد آموزشی به یک گره عملیاتی برای مدل‌های زبانی کوچک (SLM) تبدیل می‌کند، به شرطی که کاربر در تله‌ی «قدرت خام» نیفتد و گلوگاه‌های CPU را نادیده نگیرد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.