پرش به محتوای اصلی
پرش به محتوای مقاله

«حذف هزینه‌های ابری»؛ هدف AMD از عرضه Ryzen AI Halo برای دسکتاپ

·۱۹ تیر ۱۴۰۵۶ دقیقه مطالعه
بررسی عملی AMD Ryzen AI Halo: هوش مصنوعی محلی با سرعت ۴۵ توکن در ثانیه
بررسی عملی AMD Ryzen AI Halo: هوش مصنوعی محلی با سرعت ۴۵ توکن در ثانیه
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

دستیابی به سرعت ۴۵ توکن بر ثانیه برای مدل ۱۲۰ میلیارد پارامتری در یک سخت‌افزار دسکتاپی کامپکت؛ این اولین باری است که حافظه یکپارچه ۱۲۸ گیگابایتی در این ابعاد، شکاف بین سخت‌افزارهای خانگی و سرورهای سازمانی را می‌شکند.

اگر امروز برای استفاده از مدل‌های زبانی غول‌پیکر هزینه اشتراک ماهانه می‌پردازید، سخت‌افزار جدید AMD می‌تواند این صورت‌حساب را به یک سرمایه‌گذاری یک‌باره تبدیل کند. تصور کنید مدل‌هایی با ۱۲۰ میلیارد پارامتر که پیش از این نیازمند رک‌های عظیم سرور بودند، اکنون در یک جعبه ۱.۲ کیلوگرمی روی میز شما با سرعت ۴۵ توکن بر ثانیه اجرا شوند. این تغییر سخت‌افزاری، مدل‌های زبانی بزرگ (LLMs) و خط‌لوله‌های انتشار (diffusion pipelines) را مستقیماً روی میز شما می‌آورد و هزینه‌های تکرار شونده ابری را حذف می‌کند.

برای بسیاری از کاربران، هوش مصنوعی محلی همواره با گلوگاه حافظه ویدیویی (VRAM) درگیر بوده است؛ وضعیتی که کاربر را مجبور می‌کرد بین استفاده از مدل‌های کوچک و سریع یا مدل‌های بزرگ و کند یکی را انتخاب کند. همان‌طور که در تحلیل قبلی ما درباره‌ی استقرار مدل‌های خصوصی و سامانه‌های تولید بازیابی‌افزا (RAG) با استفاده از Ollama اشاره کردیم، دسترسی به حافظه کلیدی‌ترین چالش است. AMD Ryzen AI Halo با بهره‌گیری از یک استخر حافظه مشترک و عظیم، این شکاف حافظه را پر کرده و هوش مصنوعی را از یک سرویس وابسته به API به یک قطعه سخت‌افزار حاکمیتی تبدیل می‌کند. این رویکرد یادآور تلاش‌های جامعه‌ی متن‌باز برای تبدیل سخت‌افزارهای کوچک به دروازه‌های شخصی هوش مصنوعی است تا کنترل کامل بر داده‌ها فراهم شود.

زمینه سیستم و دسترسی

این دستگاه به عنوان یک دسکتاپ تخصصی با تمرکز بر هوش مصنوعی طراحی شده تا در هر فضای کاری استاندارد جای بگیرد. طبق گزارش Micro Center در ۱۰ جولای ۲۰۲۶، این محصول به‌صورت انحصاری توسط این retailer عرضه می‌شود. برای پاسخ به نیازهای مختلف کاربران، این دستگاه در هر دو نسخه لینوکس و ویندوز در دسترس است، هرچند انتظار می‌رود اکثر توسعه‌دهندگان هوش مصنوعی محیط لینوکس را ترجیح دهند.

برای کسانی که از صفر شروع می‌کنند، سیستم شامل برنامه AMD Ryzen AI Developer Center است. این برنامه به عنوان یک مرکز فرماندهی مرکزی عمل می‌کند و مجموعه‌ای از نرم‌افزارها و کتاب‌های راهنمایی (playbooks) را ارائه می‌دهد که با خودکارسازی پیکربندی‌هایی که در حالت عادی نیاز به تنظیمات دستی داشتند، در زمان توسعه‌دهندگان صرفه‌جویی می‌کند. این تسهیل در استقرار، مشابه رویکردهایی است که غول‌های نرم‌افزاری برای کاهش زمان استقرار ربات‌های تولیدی به کار گرفته‌اند تا سرعت توسعه افزایش یابد.

بر اساس مستندات فنی، قلب تپنده این سیستم پردازنده AMD Ryzen AI Max+ 395 است. این تراشه شامل ۱۶ هسته پردازشی با عملکرد بالا Zen 5 و ۴۰ واحد پردازش گرافیکی RDNA 3.5 است. همچنین برای انجام تکالیف اختصاصی هوش مصنوعی، یک واحد پردازش عصبی (NPU) پیشرفته XDNA 2 در آن تعبیه شده که تا ۵۰ TOPS توان محاسباتی اختصاصی برای AI فراهم می‌کند.

مزیت استراتژیک حافظه

ویژگی تعیین‌کننده Halo، حافظه یکپارچه ۱۲۸ گیگابایتی LPDDR5x با پهنای باند ۲۵۶ گیگابیت بر ثانیه است. برخلاف رایانه‌های شخصی سنتی که در آن‌ها VRAM توسط پردازنده گرافیکی محدود شده است، Halo به کاربران اجازه می‌دهد این استخر حافظه را به‌صورت دستی تقسیم‌بندی کنند. این قابلیت حیاتی است زیرا طول پنجرهٔ زمینه (Context Length) و حافظه KV Cache به اندازه اندازه مدل پایه برای عملکرد سیستم اهمیت دارند.

  • تخصیص VRAM: کاربران می‌توانند پیکربندی تقسیم حافظه را به‌گونه‌ای تنظیم کنند که تا ۹۶ گیگابایت به‌طور صریح به عنوان حافظه گرافیکی (VRAM) اختصاص یابد.
  • سربار سیستم: ۳۲ گیگابایت باقی‌مانده برای مدیریت سیستم‌عامل و سربار اجرای برنامه‌ها (Application Runtime) استفاده می‌شود.
  • ظرفیت گسترده: این بافر ۹۶ گیگابایتی اجازه می‌دهد سیستم مدل‌های حجیم با پارامترهای بالا، مانند GPT-OSS-120b با حجم ۵۹ گیگابایت را بارگذاری کند یا تکالیف سنگین Stable Diffusion چندمدلی را به‌طور کامل درون حافظه اجرا نماید.

عملکرد واقعی مدل‌های زبانی

آزمون‌های انجام شده از طریق LM Studio نشان می‌دهد که این سخت‌افزار حتی با مدل‌های عظیم نیز توان عملیاتی (Throughput) بالایی دارد. کاربر می‌توانند با استفاده از برنامه Developer Center برای اجرای LM Studio، فایل‌های متن‌باز مانند GPT-OSS-120b یا دستیارهای کدنویسی مانند Qwen3-Coder-30B را دانلود و اجرا کنند.

به نقل از توصیه‌های AMD برای بهینه‌سازی عملکرد، افزایش تنظیمات Context Length برای حافظه عمیق‌تر در گفتگوها و رساندن GPU Offload به حداکثر توصیه می‌شود. بنچمارک‌های مربوط به مسائل کلامی، مسائل علمی و تکالیف ریاضی/منطقی نتایج زیر را نشان دادند:

  • GPT-OSS-120b: این مدل در سه آزمون مختلف میانگین ۴۵.۰۹ تا ۴۵.۱۸ توکن در ثانیه (TPS) را ثبت کرد. زمان تا نخستین توکن (TTFT) تنها ۰.۵۱ ثانیه بود که عملکردی مشابه بسیاری از ابزارهای پیشرو هوش مصنوعی ابری دارد.
  • Gemma-4-31b: این مدل با سرعت تقریبی ۱۱.۴۰ تا ۱۱.۷۴ توکن در ثانیه و زمان واکنش (TTFT) بین ۰.۴۵ تا ۰.۷۱ ثانیه اجرا شد.

تولید تصویر محلی و کاربرد سروری

سیستم شامل یک کتاب راهنمای (playbook) پیش‌نصب شده ComfyUI برای تولید هنر آفلاین است.

با استفاده از مدل انتشار Z Image Turbo، این دستگاه تصاویر را تنها در چند ثانیه تولید می‌کند. چون تمام المان‌های مدل در بافر ۹۶ گیگابایتی حافظه گرافیکی قرار دارند، دیگر نیازی به پرداخت هزینه برای هر توکن، هر بار تولید یا استفاده از اعتبار تصویر (Credits) نیست.

برای کسانی که به یک رابط مشترک نیاز دارند، قابلیت Open WebUI اجازه می‌دهد Halo به عنوان یک سرور بدون نمایشگر (headless) عمل کند و رابطی مبتنی بر مرورگر، شبیه به ChatGPT یا Claude فراهم آورد. این سطح از تعامل با سیستم، در حالی است که قابلیت‌های کنترل بومی کامپیوتر در مدل‌هایی نظیر Gemini 3.5 Flash در حال تکامل است تا مرز بین سخت‌افزار و مدل‌های هوشمند کمرنگ‌تر شود.

  • میزبانی بک‌اند: سیستم از یک سرور Lemonade پیش‌نصب شده برای میزبانی محلی بک‌اند مدل زبانی استفاده می‌کند.
  • دسترسی شبکه‌ای: کاربران با تایپ کردن IP محلی دستگاه و افزودن پورت :8080 در مرورگر، می‌توانند از هر کامپیوتر مجزایی که به همان شبکه WiFi متصل است، به هوش مصنوعی دسترسی داشته باشند.

سخت‌افزار و اتصالات

بدنه دستگاه بسیار کم‌حجم است و حدود ۱.۲ کیلوگرم (۲.۶۵ پوند) وزن دارد. ابعاد آن تنها ۱۵۰ در ۱۵۰ در ۴۵.۴ میلی‌متر است. قطعات داخلی در یک جعبه کوچک قرار گرفته‌اند و دستگاه همراه با یک آداپتور تغذیه و راهنمای سریع عرضه می‌شود.

در پنل جلویی، یک نوار LED تشخیصی (که معمولاً یک نور سفید ثابت را نشان می‌دهد) برای نمایش وضعیت سیستم تعبیه شده است. پنل I/O در پشت دستگاه برای انتقال سریع داده طراحی شده و شامل موارد زیر است:

  • شبکه: یک پورت اترنت RJ-45 با سرعت ۱۰ گیگابیت بر ثانیه برای انتقال سریع داده‌های محلی.
  • USB: سه پورت با پهنای باند بالای USB-C®، شامل یک پورت USB-C® 3.2 و دو پورت USB-C® 4.0.
  • تصویر: یک خروجی ویدئویی HDMI 2.1 برای پشتیبانی از نمایشگرهای خارجی.

چرخش به سوی هوش مصنوعی حاکمیتی

این سخت‌افزار سیگنالی از تغییر اقتصاد هوش مصنوعی برای توسعه‌دهندگان است. با حذف هزینه هر توکن در هر بار تولید، Ryzen AI Halo به کاربران اجازه می‌دهد بدون اصطکاک مالی، روی خط‌لوله‌های چندمدلی و گفتگوهای با بستر متنی طولانی آزمایش کنند.

برای یک متخصص، این به معنای حریم خصوصی مطلق و عدم وابستگی به قطعی‌های ابری (Cloud Outages) است. توانایی اجرای یک مدل ۱۲۰ میلیارد پارامتری با سرعت ۴۵ توکن بر ثانیه روی دسکتاپ، تجربه مدل‌های سطح پیشرو (frontier-class) را برای کسانی که بودجه خرید خوشه‌های GPU سازمانی را ندارند، دموکراتیزه می‌کند.

در حالی که هوش مصنوعی ابری راحت است، Halo ثابت می‌کند سقف حافظه در حال فروپاشی است. ما وارد عصری می‌شویم که محدودیت اصلی دیگر بودجه ابری نیست، بلکه مقدار فیزیکی حافظه یکپارچه روی میز شماست.

برای درک بهتر اینکه این سیستم چگونه در یک جریان کاری بزرگتر جای می‌گیرد، باید بررسی کنید که تخصیص ۹۶ گیگابایت VRAM چگونه بر اندازه پنجره زمینه (Context Window) هنگام اجرای خط‌لوله‌های RAG با اسناد بسیار طولانی تأثیر می‌گذارد.

گام بعدی شما

  • بررسی نحوه تخصیص ۹۶ گیگابایت VRAM برای بهینه‌سازی پنجرهٔ زمینه در سامانه‌های RAG با اسناد بسیار طولانی.
  • تست مدل‌های تخصصی کدنویسی مثل Qwen3 بر روی Llama.cpp برای مقایسه سرعت استنتاج محلی در برابر APIها.
  • راه‌اندازی Open WebUI برای تبدیل دسکتاپ شخصی به یک مرکز پردازش هوش مصنوعی برای سایر اعضای تیم.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این محصول با تکیه بر اعتبار مهندسی AMD، ثابت می‌کند که پردازش مدل‌های غول‌پیکر نیازی به مراکز داده ندارد. این تغییر پارادایم، حریم خصوصی داده‌ها و هزینه استنتاج را برای متخصصان به‌طور کلی بازتعریف می‌کند.

تأثیر برای ایران

به‌دلیل قیمت بالای سخت‌افزارهای تخصصی AI و محدودیت‌های واردات، دسترسی مستقیم به این دستگاه برای کاربران ایرانی دشوار است؛ اما امکان اجرای مدل‌های غول‌پیکر محلی، راهکاری برای دور زدن تحریم‌های API و هزینه‌های دلاری سرویس‌های ابری است.

·نگاه ما
تحریریه دات‌هوش

سقوط سد حافظه در سخت‌افزارهای مصرفی، مدل‌های زبانی بزرگ را از حالت «سرویس‌های اجاره‌ای» به «دارایی‌های محلی» تبدیل می‌کند. وقتی استنتاج مدل‌های ۱۲۰ میلیارد پارامتری با سرعت ابری در یک جعبه ۱ کیلوگرمی ممکن شود، مدل‌های کوچک (SLM) دیگر تنها گزینه برای Edge نیستند، بلکه ابزاری برای تکالیف ساده‌تر می‌شوند. این یعنی تمرکز توسعه‌دهندگان از بهینه‌سازی حجم مدل به سمت بهینه‌سازی مدیریت حافظه یکپارچه منتقل خواهد شد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.