پرش به محتوای اصلی
پرش به محتوای مقاله

«بهینه‌ترین گزینه برای استنتاج»؛ تحلیل عملکرد M5 Ultra در برابر انویدیا

·۴ شهریور ۱۴۰۵۷ دقیقه مطالعه۱ بازدید
مک استودیو M5 اولترا در برابر انویدیا DGX اسپارک: شرط ۵۵۰۰ دلاری هوش مصنوعی محلی
مک استودیو M5 اولترا در برابر انویدیا DGX اسپارک: شرط ۵۵۰۰ دلاری هوش مصنوعی محلی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تولید سخت‌افزاری پهنای‌باند ۱.۲ ترابایت بر ثانیه در یک دستگاه رومیزی — این عدد شکاف عملکردی میان سیستم‌های شخصی و سرورهای استنتاج تخصصی را برای مدل‌های زبانی بزرگ به شدت کاهش می‌دهد.

اگر امروز برای اجرای مدل‌های زبانی بزرگ هزینه می‌کنید، سرعت تولید توکن در سخت‌افزارهای رومیزی در حال تغییر است. تفاوت میان یک ماشین سریع و یک ماشین کند، دیگر در تعداد هسته‌ها نیست، بلکه در سرعت جابه‌جایی داده‌هاست.

یک دستگاه مک استودیو M5 Ultra (Mac Studio M5 Ultra) با پهنای‌باند حافظه ۱.۲ ترابایت بر ثانیه، توکن‌ها را به‌مراتب سریع‌تر از انویدیا DGX Spark (NVIDIA DGX Spark) تولید می‌کند که سقف آن ۲۷۳ گیگابایت بر ثانیه است. این شکاف برای توسعه‌دهندگانی که نیاز به اجرای مدل‌های ۲۰۰ میلیارد پارامتری بدون اتکا به توکن‌های ابری دارند، بازی را تغییر می‌دهد.

سال‌هاست که توسعه‌دهندگان برای یافتن سخت‌افزاری در سطح مصرف‌کننده که بتواند مدل‌های عظیم را بدون ذوب کردن سیم‌کشی برق خانه یا تخریب بودجه اجرا کند، در تکاپو بوده‌اند. اکثر سیستم‌های مبتنی بر GPU یا حافظه VRAM کافی ندارند یا برق مصرفی آن‌ها کمرشکن است. ورود M5 Ultra و در دسترس بودن DGX Spark، یک نبرد مستقیم برای عنوان «ماشین هوش مصنوعی روی میز» در بازه قیمتی ۵۵۰۰ دلار ایجاد کرده است.

به عنوان یک توسعه‌دهنده بک‌اِند که با Java و Spring Boot کار می‌کند، نگاه من به زیرساخت‌های عملی است، نه پژوهش‌های محض. من زیرساخت عامل‌های هوش مصنوعی خودم را مدیریت می‌کنم و انتخاب بین این دو جعبه به فیزیک سخت‌افزار برمی‌گردد: ظرفیت حافظه و پهنای‌باند حافظه.

گلوگاه پهنای‌باند

استنتاج (Inference) — مثل لحظه‌ای که یک آشپز واقعاً غذا می‌پزد، نه زمانی که دستور پخت را می‌خواند — در مدل‌های زبانی اساساً یک مسئله پهنای‌باند حافظه است. طبق اعلام تحلیلگران سخت‌افزاری، پس از بارگذاری مدل، سرعتی که سیستم می‌تواند وزن‌ها را بخواند، تعداد توکن در ثانیه را تعیین می‌کند. در مرحله رمزگشایی (Decode)، جایی که مدل در هر لحظه تنها یک توکن تولید می‌کند، هر توکن تولید شده نیازمند یک گذر کامل از روی تمام وزن‌های مدل است.

  • مک استودیو M5 Ultra: تا ۵۱۲ گیگابایت حافظه یکپارچه با پهنای‌باند ۱.۲ ترابایت بر ثانیه ارائه می‌دهد. مدل پایه با ۹۶ گیگابایت از ۵۴۹۹ دلار شروع می‌شود.
  • انویدیا DGX Spark: حافظه ۱۲۸ گیگابایتی LPDDR5x با پهنای‌باند ۲۷۳ گیگابایت بر ثانیه را به قیمت ۴۶۹۹ دلار عرضه می‌کند.

همان‌طور که در تحلیل‌های قبلی ما درباره بهینه‌سازی حافظه در مدل‌های بازمتن اشاره کردیم، پهنای‌باند M5 Ultra تقریباً ۴.۴ برابر بیشتر است و مرحله رمزگشایی را بسیار بهینه‌تر مدیریت می‌کند. این برتری مستقیماً به افزایش سرعت تولید توکن در مدل‌های بزرگ منجر می‌شود. بنچمارک‌های جامعه کاربری نشان می‌دهد مالکان M3 Ultra (با ۸۰۰ گیگابایت بر ثانیه) پیش از این سرعت‌های بالایی در مدل‌های کلاس ۷۰ میلیارد پارامتری گزارش کرده بودند؛ M5 Ultra این سقف را ۵۰ درصد بالاتر می‌برد.

ظرفیت و دقت

ظرفیت حافظه تعیین می‌کند که آیا مدل اصلاً روی دستگاه جا می‌شود یا خیر. حافظه ۱۲۸ گیگابایتی DGX Spark برای یک مدل ۲۰۰ میلیارد پارامتری با کوانتایزیشن (Quantization) ۴ بیتی کافی است؛ این همان ادعای اصلی بازاریابی انویدیاست: «پشتیبانی از مدل‌های تا ۲۰۰ میلیارد پارامتر».

سقف اپل بسیار بالاتر است. پیکربندی ۵۱۲ گیگابایتی که در اواخر اکتبر ۲۰۲۵ عرضه می‌شود، اجازه می‌دهد مدل‌های بسیار بزرگ‌تر یا دقت‌های بالاتر با پنجره متنی (Context Window) — شبیه میز کاری که جا برای چندین ورق دارد، نه کل کتابخانه — طولانی‌تر اجرا شوند. با این حال، قیمت‌گذاری اپل تهاجمی است:

  • مدل پایه: ۵۴۹۹ دلار برای ۹۶ گیگابایت.
  • ارتقای ۲۵۶ گیگابایتی: ۴۰۰۰ دلار هزینه اضافی نسبت به مدل پایه.
  • پیکربندی ۵۱۲ گیگابایتی: قیمت اعلام نشده، اما انتظار می‌رود بالای ۹۵۰۰ دلار باشد.

شکاف CUDA در برابر MLX

در حالی که اپل در سرعت خام استنتاج پیروز است، انویدیا در پلتفرم توسعه برنده است. DGX Spark از تمام پشته هوش مصنوعی انویدیا، از جمله CUDA، CUDA-X، TensorRT-LLM و میکروسرویس‌های NIM پشتیبانی می‌کند.

بیشتر سرورهای استنتاج حرفه‌ای مانند vLLM بر پایه CUDA متولد شده‌اند. از دیدگاه جاوا، سرویس‌های Spring Boot من با این سرورهای استنتاج صحبت می‌کنند، نه مستقیماً با هسته‌های GPU. اکوسیستم MLX اپل به سرعت در حال رشد است اما همچنان یک حلقه بسته است. این اکوسیستم اغلب کوچک‌تر است و در مقایسه با خط لوله انویدیا، دیرتر پشتیبانی روز اول از مدل‌های جدید با وزن‌های باز (Open Weights) — یعنی مدل‌هایی که دستور پختشان علناً منتشر شده — را دریافت می‌کند.

تنظیم دقیق و آموزش

برای توسعه‌دهندگانی که نیاز به آموزش یا تنظیم دقیق (Fine-tuning) — مثل وقتی به یک پزشک عمومی، تخصص پوست می‌دهیم تا روی یک حوزه دقیق شود — دارند، DGX Spark تنها گزینه عملی است. بر اساس مستندات انویدیا، تنظیم دقیق QLoRA برای مدل Llama 3.3 70B به توان عملیاتی ۵۰۷۹ توکن در ثانیه در آموزش رسیده است. این یک کار تولیدی واقعی است، نه یک دموی تبلیغاتی.

اپل مسیرهای آموزشی Core ML و MLX را ارائه می‌دهد، اما آن‌ها فاقد جریان کاری بالغی هستند که انویدیا پیرامون Spark ساخته است. اگر استراتژی شما «نمونه‌سازی محلی و استقرار در ابر GPU یا خوشه‌های DGX» است، سازگاری Spark با ابزارهای انویدیا یک مزیت حیاتی است. این رویکرد در راستای استراتژی کلان‌تر انویدیا برای تثبیت جایگاه سخت‌افزارهایش در بازار است، مشابه آنچه در برنامه‌های این شرکت برای تبدیل ارزش سخت‌افزار به وثیقه بانکی مشاهده می‌کنیم.

واقعیت‌های عملکرد در دنیای واقعی

اعداد بازاریابی اغلب حقیقت را پنهان می‌کنند. ادعای «تا ۱ پتافلاپ» انویدیا به سقف محاسباتی FP4 اشاره دارد، نه سرعت واقعی تولید توکن. طبق گزارش Hardware Corner، مدل GPT-OSS 120B در حالت MXFP4 تنها ۳۸.۶ توکن در ثانیه تولید می‌کند، هرچند سرعت پردازش پرامپت آن ۱۷۲۳ توکن در ثانیه است.

به همین ترتیب، Level1Techs سرعت مدل Llama 3.3 70B را در TensorRT-LLM تنها ۵.۴ توکن در ثانیه اندازه‌گیری کرد که تقریباً برابر با سرعت خواندن یک انسان است.

ادعاهای اپل مبنی بر «عملکرد ۴.۳ برابر سریع‌تر در هوش مصنوعی» نیز مربوط به پردازش پرامپت (Prefill) است، نه تولید توکن (Decode). در متن ریز تبلیغات آن‌ها ذکر شده که پردازش پرامپت در LM Studio چهار برابر سریع‌تر و تولید متن به تصویر ۴.۳ برابر سریع‌تر شده است. از آنجا که بررسی‌کنندگان تا ۲۲ سپتامبر ۲۰۲۵ به دستگاه‌ها دسترسی ندارند، اعداد رسمی رمزگشایی در دست نیست، اما فیزیک ۱.۲ ترابایت در برابر ۲۷۳ گیگابایت نشان می‌دهد M5 Ultra بسیار بالاتر از Spark قرار خواهد گرفت.

واقعیت‌های توان و حرارت

هر دو دستگاه با پریزهای برق استاندارد کار می‌کنند، به این معنی که هیچ‌کدام نیازمند ارتقای مدار برق خانه نیستند. اما مدیریت حرارت آن‌ها متفاوت است:

  • DGX Spark: با شکایت‌هایی درباره سقف ۱۰۰ وات عرضه شد که باعث کاهش سرعت (Thermal Throttling) تحت فشار می‌شد. جان کارماک به طور علنی به شکاف میان بازاریابی پتافلاپ و عملکرد واقعی دستگاه‌های ارسالی اشاره کرد.
  • مک استودیو: وات بیشتری مصرف می‌کند اما بدون مشکلات مشابه کاهش سرعت، عملکرد را حفظ می‌کند.

مقیاس‌پذیری و خوشه‌بندی

هر دو شرکت راه‌هایی برای گسترش فراتر از یک دستگاه واحد ارائه می‌دهند. اپل از خوشه‌بندی تاندربولت ۵ (Thunderbolt 5 clustering) پشتیبانی می‌کند که اجازه می‌دهد چندین مک استودیو از طریق RDMA به هم متصل شوند. اپل ادعا می‌کند این کار می‌تواند استنتاج توزیع‌شده را در یک خوشه چهار گره‌ای تا ۳ برابر سریع‌تر کند. انویدیا نیز شبکه ConnectX-7 را برای جفت کردن دو Spark ارائه می‌دهد تا امکان استفاده از مدل‌های تا ۴۰۵ میلیارد پارامتر فراهم شود.

ماتریس تصمیم‌گیری توسعه‌دهنده

شما باید مک استودیو M5 Ultra را انتخاب کنید اگر:

  • حجم کاری شما متمرکز بر استنتاج است (عامل‌ها، نمونه‌سازی RAG، دستیارهای کدنویسی محلی برای تیم).
  • می‌خواهید یک دستگاه داشته باشید که در کنار هوش مصنوعی، کارهای بهره‌وری عمومی مک را هم انجام دهد.
  • مدل‌های شما دارای وزن‌های باز و کوانتیده هستند.
  • می‌توانید تا عرضه اکتبر منتظر بمانید یا هزینه بالای ارتقای حافظه را بپذیرید.

شما باید DGX Spark را انتخاب کنید اگر:

  • به طور فعال روی تنظیم دقیق (Fine-tuning) کار می‌کنید.
  • به ابزارهای انحصاری CUDA وابسته هستید (TensorRT یا فرمت‌های خاص کوانتایزیشن).
  • مسیر کاری شما «نمونه‌سازی محلی و استقرار در ابر GPU» است.
  • همین امروز به ۱۲۸ گیگابایت حافظه تضمین‌شده نیاز دارید.

برای کسانی که تنها به یک دستیار کدنویسی ساده نیاز دارند، هیچ‌کدام از این‌ها ضروری نیست. یک مک مینی M6 با قیمت ۸۹۹ دلار یا یک M5 Pro mini با قیمت ۱۶۹۹ دلار — که هر دو دارای شتاب‌دهنده‌های عصبی در هر هسته GPU هستند — می‌توانند مدل‌های کوانتیده ۱۴ تا ۳۰ میلیارد پارامتری را با سرعت‌های قابل قبول اجرا کنند. این موضوع با یافته‌های اخیر دانشگاه استنفورد همسو است که نشان می‌دهد مدل‌های زبانی کوچک در بسیاری از وظایف با مدل‌های ابری عظیم برابری می‌کنند. برای باز کردن یک شیشه مربا، نیازی به خرید لیفتراک نیست.

تحلیل نهایی

اگر بخواهم از صفر سیستم را طراحی کنم، دیگر به فلاپس (FLOPs) فکر نمی‌کنم و در عوض به «پهنای‌باند به ازای هر دلار» و «ظرفیت به ازای هر دلار» می‌پردازم. در بحث پهنای‌باند به ازای هر دلار در سطح ۵ هزار دلار، M5 Ultra decisively پیروز است. اما در بحث ظرفیت به ازای هر دلار در حال حاضر، Spark برنده است زیرا قیمت‌گذاری حافظه اپل بی‌رحمانه است.

اپل جعبه استنتاج بهتری ساخته است؛ انویدیا پلتفرم توسعه بهتری ساخته است. تفاوت ۱.۲ ترابایت بر ثانیه M5 Ultra در برابر ۲۷۳ گیگابایت بر ثانیه Spark، یک شکاف نسلی است که دقیقاً در جایی خودش را نشان می‌دهد که اهمیت دارد: تولید توکن از مدل‌های بزرگ. اما مشخصات فنی خط لوله TensorRT شما را اجرا نمی‌کنند، بلکه CUDA این کار را می‌کند.

هر دو شرکت شرط بسته‌اند که پنج سال آینده محاسبات توسعه‌دهندگان، روی میز، خصوصی و بدون محدودیت توکن خواهد بود. این آینده‌ای است که من با اطمینان با آن موافقم.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این رقابت نشان می‌دهد که استنتاج محلی در حال تبدیل شدن به استاندارد جدید توسعه است. برتری اپل در پهنای‌باند، هزینه و تأخیر استنتاج را برای تیم‌های کوچک کاهش می‌دهد، در حالی که انویدیا همچنان مرجع اعتبار در آموزش مدل‌هاست.

تأثیر برای ایران

به‌دلیل قیمت بسیار بالا و محدودیت‌های واردات، دسترسی به این سخت‌افزارها برای توسعه‌دهندگان ایرانی دشوار است؛ اما برتری M5 Ultra در استنتاج، مسیر استفاده از مدل‌های بازمتن را روی مک‌های موجود در بازار ایران بهینه‌تر می‌کند.

·نگاه ما
تحریریه دات‌هوش

تمرکز صنعت از تعداد عملیات در ثانیه (FLOPs) به سمت پهنای‌باند حافظه در استقرار محلی تغییر کرده است. اپل با یکپارچه کردن حافظه در مقیاس ترابایتی، عملاً گلوگاه اصلی استنتاج را دور زده و سخت‌افزار مصرف‌کننده را به سطح سرورهای استنتاج نزدیک کرده است. با این حال، تا زمانی که اکوسیستم MLX به انعطاف‌پذیری CUDA نرسد، این برتری سخت‌افزاری برای توسعه‌دهندگان حرفه‌ای ناقص خواهد ماند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.