پرش به محتوای اصلی
پرش به محتوای مقاله

پردازش محلی در برابر ابری؛ برتری صنعتی M5 Ultra در اجرای AI

·۳۰ شهریور ۱۴۰۵۱۵ دقیقه مطالعه
بررسی M5 Ultra مک استودیو: مک رویایی برای هوش مصنوعی محلی
بررسی M5 Ultra مک استودیو: مک رویایی برای هوش مصنوعی محلی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی معماری چهار-تراشه‌ای (Quad-die) در مک استودیو که پهنای باند حافظه را به ۱.۲ ترابایت بر ثانیه رسانده و سرعت پیش-پر کردن پرامپت‌ها را ۱۵۰٪ افزایش داده است.

اگر امروز برای اجرای مدل‌های زبانی هزینه اشتراک ماهانه می‌پردازید، سخت‌افزار جدید اپل می‌تواند این صورت‌حساب را به صفر برساند. یک دستگاه مک استودیو M5 Ultra با ۲۵۶ گیگابایت رم، اکنون می‌تواند پرامپت‌های هوش مصنوعی را ۱۵۰٪ سریع‌تر از نسل قبلی پردازش کند و عملاً زمان انتظار برای پاسخ‌های عامل‌های محلی (Local Agents) را حذف کند. این تغییر به کاربران اجازه می‌دهد تا دستیارهای شخصی پیچیده را به‌طور کامل روی دستگاه خود اجرا کنند و هزینه‌های ابری و نگرانی‌های مربوط به حریم خصوصی را دور بزنند. برای نویسنده، این ماشین به یک «ماشین رؤیایی» برای عامل‌های هوش مصنوعی محلی تبدیل شده است که اجرای دستیاران شخصی با عملکرد عالی و بدون هزینه‌های اضافی ابری را ممکن می‌سازد. اگر تا به حال در تست OpenClaw یا Hermes Agent با مدل‌های محلی تردید داشتید، چون فکر می‌کردید هرگز به هوشمندی و سرعت مدل‌های ابری نزدیک نمی‌شوند، این مک نظر شما را تغییر خواهد داد.

این جهش سخت‌افزاری در حالی رخ می‌دهد که صنعت با هزینه‌های سرسام‌آور گردش‌های کاری «همیشه روشن» (Always-on) دست‌وپنجه نرم می‌کند. در حالی که مدل‌های پیشرو در ابر همچنان هوشمندتر هستند، فشار مالی ناشی از پردازش‌های پس‌زمینه — مثل تحلیل ۲۴ ساعته اسناد — کاربران حرفه‌ای را به سمت میزبانی شخصی (Self-hosting) سوق داده است. نویسنده که بیش از یک سال است با مدل‌های محلی کار می‌کند، اشاره می‌کند که اگرچه برخی از هوش مصنوعی محلی برای حریم خصوصی یا صرفاً به دلیل «جالب بودن» استفاده می‌کنند، اما کاربرد عملی برای حجم بالای کار، محرک واقعی این تغییر است.

همان‌طور که در تحلیل قبلی ما درباره‌ی اینکه چگونه مسیریاب‌های شغلی (Job Routers) از نشت اسرار عامل‌های محلی جلوگیری می‌کنند اشاره کردیم، تمرکز توسعه‌دهندگان اکنون از بحث‌های امنیتی به سمت عملکرد خام جابه‌جا شده است. برای کاربر معمولی، این یعنی تفاوت بین ۱۰ ثانیه انتظار برای یک پاسخ و دریافت آن به‌صورت آنی. تصور کنید یک دستیار پژوهشی که ۳۰۰ فایل PDF را می‌خواند و آن‌ها را در لحظه سازماندهی می‌کند، بدون اینکه حتی یک بایت داده از دستگاه شما خارج شود و به سرورهای شرکتی ارسال گردد.

به نقل از گزارش MacStories در ۲۱ سپتامبر ۲۰۲۶، مدل M5 Ultra از یک معماری چهار-تراشه‌ای (Quad-die) پیشگام استفاده می‌کند. این ساختار از طریق فناوری UltraFusion ایجاد شده که دو تراشه M5 Max را به هم متصل می‌کند تا برای نخستین بار در اکوسیستم اپل، یک معماری چهار-تراشه‌ای شکل بگیرد. اگرچه ظاهر دستگاه با مدل M3 Ultra یکسان است، اما سیلیکون داخلی آن بنیاداً متفاوت است.

دو ارتقای سخت‌افزاری کلیدی، موتور محرک این عملکرد هستند:

  • محاسبات GPU: پردازنده گرافیکی ۸۰ هسته‌ای نسل جدید در هر هسته خود دارای شتاب‌دهنده‌های عصبی (Neural Accelerators) است که تا ۴.۵ برابر محاسبات هوش مصنوعی M3 Ultra را افزایش می‌دهد.
  • پهنای باند حافظه: پهنای باند از ۸۱۹ گیگابایت بر ثانیه به ۱.۲ ترابایت بر ثانیه رسیده است؛ جهشی ۵۰ درصدی که مستقیماً سرعت تولید توکن (Token) — تکه‌های کوچکی از متن که مدل تکه‌تکه می‌خورد — را بالا می‌برد. این بهبود در پهنای باند، همان عاملی است که در تحلیل مقایسه‌ای عملکرد M5 Ultra در برابر انویدیا به عنوان نقطه قوت اصلی برای استنتاج مدل‌های محلی مورد بررسی قرار گرفت.

بررسی M5 Ultra مک استودیو: مک رویایی برای هوش مصنوعی محلی

در تست‌های عملی با مدل Qwen3.8-Flash-Next، مدل M5 Ultra به‌طور متوسط ۷۰٪ سریع‌تر از M3 Ultra عمل کرد. در پرامپت‌های کوتاه، سرعت مدل به ۱۰۰ توکن در ثانیه رسید. حتی با پنجره‌های متنی (Context Window) — میزان متنی که مدل هم‌زمان در ذهن نگه می‌دارد — بسیار بزرگ (۶۴ تا ۲۵۶ هزار توکن)، خروجی دستگاه بین ۶۰ تا ۸۵ توکن در ثانیه باقی ماند. این پایداری برای «حلقه‌های عامل‌محور» (Agentic Loops) حیاتی است؛ جایی که مدل باید استدلال کند، ابزارها را فراخوانی کند و چندین بار تکرار کند تا تکلیف را به پایان برساند، بدون اینکه با رشد طول جلسه، سرعت آن به شدت افت کند.

بررسی M5 Ultra مک استودیو: مک رویایی برای هوش مصنوعی محلی

یک مورد استفاده واقعی، اپلیکیشن داخلی Desk بود. بین ژوئن و سپتامبر ۲۰۲۶، تیمی از عامل‌ها بر پایه DeepSeek V4 Flash و olmOCR (برای نویسه‌خوانی نوری PDF) به‌مدت ۹۹ روز به‌صورت شبانه‌روزی فعال بودند. این ساختار برای تأمین پژوهش‌ها و نوشته‌های مربوط به بررسی iOS و iPadOS 27 استفاده شد. این پروژه شامل ۳۱۰ سند از جمله یادداشت‌ها، جلسات، اسناد PDF و صفحات وب ذخیره شده بود.

این عامل‌ها وظایف دقیقی را انجام دادند:

  • پیاده‌سازی جلسات مورد علاقه WWDC با استفاده از ترکیب خلاصه‌سازی و پردازش مدل زبانی (LLM).
  • استخراج ویژگی‌های iOS و iPadOS 27 از صفحات وب، جلسات، راهنماهای PDF و یادداشت‌های شخصی.
  • تطبیق ویژگی‌ها در منابع مختلف و ردیابی اینکه هر ویژگی به کدام فصل از بررسی تعلق دارد.
  • استخراج ویژگی‌ها و باگ‌ها از اسکرین‌شات‌های آپلود شده.
  • تعامل با API نوتشن (Notion) برای سازماندهی داده‌ها در چندین پایگاه داده مختلف.

بررسی M5 Ultra مک استودیو: مک رویایی برای هوش مصنوعی محلی

بررسی M5 Ultra Mac Studio: مک رویایی برای هوش مصنوعی محلی

در مقایسه با یک PC مجهز به RTX 5090، مدل M5 Ultra توازن متفاوتی بین سرعت خام و ظرفیت ایجاد می‌کند. کارت گرافیک ۵۰۹۰ در دو مورد برتری دارد:

۱. پردازش پرامپت: پردازش پرامپت توسط قدرت محاسباتی تعیین می‌شود. مدل کل پرامپت را در یک ضرب ماتریسی عظیم می‌خواند، کاری که هسته‌های Tensor انویدیا برای آن ساخته شده‌اند. در یک پرامپت ۶ هزار توکنی، ۵۰۹۰ به سرعت خیره‌کننده حدود ۳۰۰۰ توکن در ثانیه رسید، در حالی که M5 Ultra حدود ۱۷۰۰ توکن در ثانیه ثبت کرد.
۲. تولید توکن: تولید توکن به پهنای باند بستگی دارد. مدل برای هر توکن، کل مدل را دوباره از حافظه فراخوانی می‌کند. با پهنای باند ۱.۷۹ ترابایت بر ثانیه در مقابل ۱.۲ ترابایت بر ثانیه در M5 Ultra، کارت ۵۰۹۰ در مدل‌های کوچک حدود ۲۵٪ برتری در سرعت نوشتن دارد.

اما نقطه ضعف ۵۰۹۰، حافظه ۳۲ گیگابایتی VRAM آن است. در پنجره‌های متنی ۲۵۶ هزار توکنی، ۵۰۹۰ فقط می‌تواند با یک حافظه موقت توجه (Attention Cache) ۸ بیتی کار را به پایان برساند. برای اجرای مدل‌های بزرگ‌تر یا کوانتایزیشن‌های بالاتر، PC مجبور است داده‌ها را از طریق PCIe به رم سیستم که بسیار کندتر است منتقل کند، که نویسنده می‌گوید «این روشی برای زندگی نیست». در مقابل، حافظه یکپارچه M5 Ultra اجازه می‌دهد مدل‌های بزرگ‌تری مثل GLM-5.3-Flash با سرعت ثابت اجرا شوند.

بررسی M5 Ultra مک استودیو: مک رویایی برای هوش مصنوعی محلی

علاوه بر این، مک استودیو در سکوت کامل کار می‌کند. در حالی که PC گیمینگ (که در یک کیس کوچک Lian-Li A3 قرار داشت) در حین بنچمارک‌ها گرمای زیادی تولید می‌کرد تا جایی که دمای اتاق را به‌طور محسوسی بالا می‌برد، مک استودیو خنک ماند. در استفاده روزمره با مدل Flash-Next oQ4e، صدای فن استودیو تقریباً غیرقابل شنیدن بود، مگر اینکه گوش را مستقیماً روی کامپیوتر بگذارید. نویسنده اشاره می‌کند که مک استودیو به دلیل اندازه، عملکرد حرارتی و سیستم‌عاملی که «افتضاح نیست»، انتخاب ترجیحی او نسبت به سیستم PC است.

کاربران اکنون از oMLX (نسخه 0.7.0.dev2) برای اجرای مدل‌های محلی روی macOS Golden Gate 27.0 استفاده می‌کنند. این ساختار اجازه می‌دهد زیر-عامل‌های محلی توسط یک مدل پیشرو مثل GPT-6 Astra مدیریت شوند. کوانتایزیشن (Quantization) — یعنی کاهش دقت اعداد برای اشغال فضای کمتر — در سطح ۵ بیت، نقطه تعادل ایده‌آلی برای رم ۲۵۶ گیگابایتی ایجاد می‌کند و بین هوشمندی، عملکرد و حافظه تعادل برقرار می‌کند. در حالی که کوانتایزیشن ۵-بیت کاملاً در رم اجرا می‌شود، نسخه‌های ۶ و ۸-بیت می‌توانند به لطف معماری جدید، جداول n-gram را به SSD منتقل کنند.

بررسی M5 Ultra Mac Studio: مک رویایی برای هوش مصنوعی محلی

پیاده‌سازی‌های عملی فعلی عبارتند از:

  • Open Minis for iOS: استفاده از مدل‌های محلی به‌عنوان بک‌اند پیش‌فرض برای دستیارهای موبایل. نویسنده اکنون از Flash-Next به جای Siri AI استفاده می‌کند.
  • Codex: سپردن کارهای کدنویسی ساده به زیر-عامل‌های محلی Flash-Next و بررسی نهایی توسط یک مدل ابری. این روش اجازه می‌دهد تا سه جلسه هم‌زمان Flash-Next با زیر-عامل‌ها در oMLX ایجاد شود.
  • Hermes Agent: اجرای حلقه‌های استدلالی پیچیده و چندمرحله‌ای به‌صورت محلی. هنگام استفاده از RemCTL برای دریافت وظایف هفتگی، عامل در عرض چند ثانیه پرامپت را پردازش کرده و استدلال را آغاز می‌کند.

بررسی M5 Ultra Mac Studio: مک رویایی برای هوش مصنوعی محلی

بررسی M5 Ultra مک استودیو: مک رویایی برای هوش مصنوعی محلی

بر اساس مستندات متدولوژی تست، این اعداد طی چهار روز با یک سیستم خودکار ساخته شده توسط GPT-6 Astra به دست آمده‌اند. این سیستم چندین نمونه از Codex را در M3 Ultra، M5 Ultra و PC دارای RTX 5090 هماهنگ کرد.

در مک، مدل‌های اصلی تست شده عبارت بودند از:

  • Qwen3.8-Flash-Next-oQ4e-mtp
  • GLM-5.3-Flash-MLX-mixed-4_8bit
  • Qwen3.8-27B-oQ4e-mtp

در ویندوز، از LM Studio با مدل Qwen3.8-27B-GGUF و محیط CUDA 12 استفاده شد. برای تست‌های تمام-GPU، تمام ۶۶ لایه به کارت گرافیک منتقل شدند و تست‌های جداگانه‌ای برای تقسیم مدل بین GPU و رم سیستم انجام شد. داده‌ها توسط Astra جمع‌آوری و با Claude Fable 5.1 و Opus 5 با استفاده از قابلیت Projects شرکت Anthropic بصری‌سازی شدند. بصری‌سازی‌های نهایی تعاملی با HTML و CSS خالص بر اساس استایل MacStories ساخته شدند.

این تحول سخت‌افزاری، اقتصاد توسعه هوش مصنوعی را تغییر می‌دهد. وقتی هزینه استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند — به قیمت برق کاهش یابد، انگیزه ساخت عامل‌های «همیشه روشن» افزایش می‌یابد. ما از پارادایم «جعبه چت» به سمت «کارگر پس‌زمینه» حرکت می‌کنیم. برای یک متخصص، این به معنای توانایی ساخت پشته‌های پژوهشی بسیار شخصی و خصوصی است که نیازی به اشتراک ماهانه یا اعتبار API ندارند. این تمایل به استفاده گسترده از سخت‌افزارهای اپل برای زیرساخت‌های AI، حتی در سطح سازمان‌های بزرگ دیده می‌شود؛ برای مثال، استراتژی OpenAI برای خرید انبوه مک‌مینی‌ها نشان‌دهنده تغییر رویکرد این شرکت به سمت بهره‌گیری از اکوسیستم اپل است.

در حالی که ارائه‌دهندگان ابری خاص مثل Inco (که Kimi K3 را با سرعت ۳۰۰ توکن در ثانیه ارائه می‌دهد) یا Cerebras (که Qwen3.8-27B را با سرعت ۱۸۰۰ توکن در ثانیه ارائه می‌کند) سرعت‌های خیره‌کننده‌ای دارند، اما بسیار گران هستند؛ نویسنده در ۱۰ دقیقه ۲۰ دلار از اعتبار Inco را مصرف کرد. M5 Ultra جایگزینی محلی است که داده‌ها در آن روی دستگاهی می‌مانند که کاربر می‌تواند آن را ببیند و ری‌بوت کند.

با بهینه‌سازی‌های جامعه MLX، انتظار می‌رود مدل‌های پیشرو بزرگ‌تری در حافظه ۲۵۶ یا ۵۱۲ گیگابایتی جای بگیرند. اکتشافات آینده ممکن است شامل موارد زیر باشد:

  • DwarfStar: پروژه‌ای از ایتالیا که مدل‌های پیشرو محلی را روی پیکربندی‌های مک با حافظه حتی کمتر ممکن می‌سازد.
  • Inco Splash: یک موتور استنتاج جدید که مخصوصاً برای سیلیکون اپل و مدل‌های خاص طراحی شده است.
  • Exo: ابزاری که پیاده‌سازی RDMA آن می‌تواند تئوریکاً استنتاج را بین M3 Ultra و M5 Ultra از طریق Thunderbolt 5 و با استفاده از یک سرور سازگار با OpenAI توزیع کند.

منتظر عرضه نسخه ۵۱۲ گیگابایتی M5 Ultra در اواخر اکتبر باشید که احتمالاً اجازه کوانتایزیشن ۸-بیت را بدون نیاز به انتقال داده به SSD می‌دهد و احتمالاً شکاف با سیستم‌های رده‌بالای انویدیا را برای مدل‌های بزرگ‌تر می‌بندد. این ارتقای حافظه می‌تواند همان‌طور که در تحلیل حافظه ۵۱۲ گیگابایتی M5 Ultra اشاره شد، مک استودیو را به یک ایستگاه کاری واقعی برای مدل‌های Frontier تبدیل کند.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، کتابخانه oMLX را برای مدیریت زیر-عامل‌های محلی بررسی کنید.
  • برای کاهش هزینه API، مدل‌های Flash-Next را روی سخت‌افزارهای اپل سیلیکون تست کنید.
  • استراتژی کوانتایزیشن ۵-بیت را برای بهینه‌سازی مصرف رم در مدل‌های بزرگ جایگزین کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این سخت‌افزار با حذف گلوگاه حافظه، استقرار عامل‌های محلی را از حالت آزمایشی به کاربرد صنعتی می‌برد. تکیه بر اعتبار معماری UltraFusion، حریم خصوصی و هزینه را به متغیری تبدیل می‌کند که دیگر در برابر عملکرد قربانی نمی‌شود.

تأثیر برای ایران

به‌دلیل قیمت بسیار بالای سخت‌افزارهای سری Ultra، دسترسی به این سطح از توان پردازشی برای اکثر توسعه‌دهندگان ایرانی دشوار است؛ اما بهینه‌سازی‌های oMLX برای مدل‌های کوچک‌تر روی مک‌های موجود، فرصت مناسبی برای اجرای محلی مدل‌ها فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

انتقال قدرت از GPUهای مجزا به حافظه یکپارچه (Unified Memory) در مقیاس ترابایتی، مدل‌های زبانی را از ابزارهای پاسخ‌دهنده به زیرساخت‌های عملیاتی تبدیل می‌کند. وقتی محدودیت VRAM حذف شود، عامل‌های هوش مصنوعی می‌توانند بدون نیاز به حافظه خارجی، کل بستر داده یک پروژه را در لحظه پردازش کنند. این یعنی پایان عصر 'فراموشی' مدل‌ها در پروژه‌های طولانی.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.