اگر امروز برای استفاده از مدلهای زبانی پیشرفته هزینه پرداخت میکنید، احتمالاً به زودی نیازی به پرداخت توکن به شرکتهای ابری نخواهید داشت. در ۲۵ اوت ۲۰۲۶، اپل (Apple) با عرضه تراشههای M6 و M5 Ultra، هویت مک را از یک ابزار خلاقانه به یک دستگاه تخصصی استنتاج (Inference) — شبیه به آشپزی واقعی در خانه به جای سفارش غذا از رستوران — تغییر داد. بیانیهی مطبوعاتی اپل در این مورد، کمتر شبیه به معرفی یک تراشه و بیشتر شبیه به یک استراتژی زیرساختی برای هوش مصنوعی است که تمرکز اصلی آن بر توان محاسباتی، حافظه و اندازه مدلهاست.
این حرکت پاسخی مستقیم به افزایش هزینههای عاملهای کدنویسی ابری است که توسعهدهندگان را به شدت به چالش کشیده است. در حالی که صنعت به طور کلی بر روی GPUهای اجارهای تکیه کرده، گروهی از مهندسان برای دور زدن کنتورهای ابری، شروع به متصل کردن زنجیرهای مک مینیها کردهاند. به گزارش Ars Technica، توسعهدهندگان از معماری حافظه یکپارچه اپل به عنوان یک جایگزین عملی برای سیستمهای GPU انویدیا استفاده میکنند. کیف لسوینگ از CNBC اشاره میکند که توسعهدهندگانی که با ابزارهایی مانند OpenClaw عاملهای هوشمند میسازند، ترجیح میدهند آنها را روی یک مک مینی اختصاصی اجرا کنند تا در فضای ابری. اپل اکنون با تبدیل ظرفیت حافظه به مزیت رقابتی اصلی خود، این رفتار را رسمی کرده و مک مینی را «پیشرو در محاسبات عاملمحور همیشهروشن» و مک استودیو را «نهایت دستگاه برای هوش مصنوعی محلی» مینامد.
زمینه: چرخش استراتژیک
اعلامیه اپل چند هفته پیش از عرضه مورد انتظار آیفون منتشر شد. CNBC این زمانبندی را سیگنالی میبیند که نشان میدهد دسکتاپها برای اپل به جایگاهی استراتژیک تبدیل شدهاند تا بتواند جای پایی در دنیای توسعه هوش مصنوعی داشته باشد. پیام این دستگاهها روشن است: اپل شرط بسته است که عصر بعدی مک با «تعداد توکن در ثانیه» اندازهگیری شود، نه با ویژگیهای نرمافزارهای خلاقانه.
Ars Technica صراحتاً بیان میکند که در این نسخه ویژگیهای جدید و انقلابی وجود ندارد و صرفاً شاهد افزایش مشخصات فنی (Specs Bump) هستیم. با این حال، ارائه اپل دقیقاً روی کاربردهایی متمرکز است که در زمان طراحی نسلهای قبلی وجود نداشتند. هدف نهایی این است که مرکز ثقل توسعه هوش مصنوعی از مراکز داده (Data Centers) به میز کار کاربران منتقل شود.
M6: ورود به دنیای محاسبات عاملمحور
تراشه M6 نخستین پردازنده ۲ نانومتری اپل است که برای دانشجویان، علاقهمندان، سازمانها و کاربران عادی طراحی شده است. این تراشه دارای یک CPU ۱۲ هستهای است که شامل ۲ هسته فوق-قدرتمند (Super Cores)، ۴ هسته عملکرد (Performance) و ۶ هسته بهرهوری (Efficiency) است. طبق ادعای اپل، این اولین SoC است که میتواند هر سه نوع هسته را بهطور همزمان به کار بگیرد و دارای سریعترین هسته تکرشتهای (Single-threaded) جهان است.
در بخش هوش مصنوعی، M6 مجهز به یک موتور عصبی (Neural Engine) دوگانه ۱۶ هستهای است که توان محاسباتی اوج آن ۲ برابر نسل قبل است. اپل میگوید فریمورکهای سیستم میتوانند هر دو موتور عصبی را بهطور همزمان برای اجرای سریعتر مدلها به کار بگیرند. GPU این تراشه ۳۰٪ افزایش توان در محاسبات هوش مصنوعی نسبت به M5 و جهشی ۸ برابری نسبت به M1 دارد. این موضوع منجر به پردازش بسیار سریعتر پرامپتها برای مدلهای زبانی محلی (LLMs) میشود. همچنین گرافیک با پشتیبانی از Ray Tracing سختافزاری و نرخ هندسه ۵۰ درصد بالاتر برای بارهای کاری سهبعدی ارتقا یافته است.
با این حال، M6 توسط حافظه محدود شده است. این تراشه حداکثر تا ۳۲ گیگابایت حافظه یکپارچه با پهنای باند ۱۷۰ گیگابایت بر ثانیه را پشتیبانی میکند که ۱۰٪ بیشتر از M5 و ۲.۵ برابر M1 است. در مک مینی، ۱۶ گیگابایت رم استاندارد است و تا ۳۲ گیگابایت قابل ارتقاست. اپل ادعا میکند دستگاه M6 تا ۴ برابر عملکرد هوش مصنوعی سریعتر، ۲ برابر گرافیک و ذخیرهسازی سریعتر و ۴۰٪ عملکرد CPU بهتر نسبت به مدل M4 دارد. اگرچه برای مدلهای کوچک توانمند است، اما به قلمرو مدلهای پیشرو (Frontier Models) نمیرسد.
M5 Ultra: غول ۵۱۲ گیگابایتی
تراشه M5 Ultra قدرتمندترین محصول اپل و نخستین طراحی چهار-دای (Quad-die) این شرکت است. این تراشه با استفاده از فناوری UltraFusion، دو تراشه M5 Max را با پهنای باند بیش از ۴.۴ ترابایت بر ثانیه به هم متصل میکند تا چهار دای مانند یک تکتراشه عمل کنند.
نقطه عطف این سختافزار، ۵۱۲ گیگابایت حافظه یکپارچه با پهنای باند ۱.۲ ترابایت بر ثانیه است. به تأیید MacRumors، این مقدار حافظه ۵۰٪ بیشتر از M3 Ultra است. این ظرفیت به کاربران اجازه میدهد مجموعهدادههای عظیم را در حافظه محلی ذخیره کرده و مدلهای زبانی با صدها میلیارد پارامتر را کاملاً محلی اجرا کنند، بدون اینکه نیازی به تکیه بر مرکز داده داشته باشند. این معماری پیشرفته در تحلیل مقایسهای عملکرد M5 Ultra در برابر سیستمهای انویدیا مورد بررسی قرار گرفته تا شکاف پهنای باند در استنتاجهای سنگین تحلیل شود.
بهرهوریها بسیار چشمگیر است. اپل ادعا میکند توان محاسباتی اوج GPU برای هوش مصنوعی ۴.۵ برابر M3 Ultra است. همچنین عملکرد CPU در حالت تکرشتهای ۱.۲۵ برابر و در حالت چندرشتهای ۱.۳ برابر شده و گرافیک ۴۰٪ سریعتر شده است. این تراشه دارای یک موتور عصبی ۳۲ هستهای برای Apple Intelligence محلی است. در تستهای واقعی با LM Studio، سرعت پردازش پرامپتها تا ۹.۸ برابر سریعتر از نسل M1 Ultra است. در مک استودیو، این یعنی توان محاسباتی ۴.۳ برابر بیشتر از M3 Ultra و تقریباً ۱۰ برابر M1 Ultra برای کارهای هوش مصنوعی.
مشخصات فنی و زیرساختها
اپل برای پشتیبانی از گردشهای کاری عاملمحور (Agentic) که باید همواره روشن باشند، اتصالات و سختافزار داخلی را بهروز کرد:
- اتصالات: استاندارد Wi-Fi 7 و بلوتوث ۶؛ در مدل M5 Pro، اترنت ۲.۵ گیگابیت بهصورت پیشفرض ارائه شده و گزینه ۱۰ گیگابیت نیز موجود است.
- پورتها: پورتهای Thunderbolt 5 در مدلهای M5 Ultra و M5 Pro گنجانده شدهاند. فدریکو ویتچی از MacStories اشاره میکند که مک مینی M6 از Thunderbolt 5 بهره نمیبرد.
- ذخیرهسازی: حافظههای PCIe Gen 6 سرعتهایی تا ۲ برابر سریعتر از نسلهای قبلی فراهم میکنند.
- قدرت پردازش: M5 Ultra دارای CPU ۳۶ هستهای و GPU ۸۰ هستهای است که برای نخستین بار در یک قطعه Ultra، دارای شتابدهندههای عصبی است.
- موتور رسانهای: سیستم میتواند تا ۳۳ استریم همزمان 8K ProRes 422 با نرخ ۳۰ فریم بر ثانیه را پخش کند.
- سختافزار کمکی: تراشه N1 مدیریت اتصالات Wi-Fi 7 و بلوتوث ۶ را بر عهده دارد.
اقتصاد استنتاج محلی
اپل با فروش سختافزاری با رم عظیم، مستقیماً به جنگ مدل کسبوکار APIها رفته است. این رویکرد اجازه میدهد مدلها با حریم خصوصی کامل و بدون نگرانی از شمارش توکنها یا افزایش هزینههای ابری اجرا شوند.
این یک تغییر اقتصادی بنیادین است. Ars Technica اشاره میکند که هزینههای عاملهای کدنویسی ابری چنان بالا رفته که توسعهدهندگان در مورد کاربردی بودن آنها تردید دارند. مدلهای وزنهای باز (Open Weights) مانند نسخههای اخیر Qwen و DeepSeek میتوانند بخش زیادی از این کارها را بدون پرداخت مبالغ هنگفت برای توکنها انجام دهند. عاملهای کدنویسی کلیدیترین مورد استفاده هستند زیرا بهطور مداوم در حال اجرا هستند و استفاده مداوم دقیقاً همان چیزی است که سیستمهای پرداخت به ازای توکن جریمه میکنند.
در حالی که ارائهدهندگان ابری به ازای هر توکن هزینه میگیرند، مک استودیو نیازمند یک سرمایهگذاری سختافزاری یکباره است. پس از خرید، هزینه نهایی استنتاج تنها به مقدار برق مصرفی محدود میشود. البته این قدرت بهای زیادی دارد؛ CNBC گزارش میدهد که قیمت مک مینی در طول تابستان به دلیل هزینه حافظه از ۵۹۹ دلار به ۷۹۹ دلار رسید و اکنون از ۸۹۹ دلار شروع میشود.
قیمتگذاری و دسترسی
قیمتها نشاندهنده جایگاهسازی اپل از این دستگاهها به عنوان ابزارهای حرفهای است، نه گجتهای مصرفی:
- مک مینی (M6): شروع از ۸۹۹ دلار (۱۶ گیگابایت رم استاندارد).
- مک مینی (M5 Pro): شروع از ۱,۶۹۹ دلار (با CPU ۱۸ هستهای و GPU ۲۰ هستهای؛ پردازش پرامپتهای LLM تا ۸.۵ برابر سریعتر از مدلهای Pro قدیمی).
- مک استودیو (M5 Max): شروع از ۲,۴۹۹ دلار.
- مک استودیو (M5 Ultra): شروع از ۵,۴۹۹ دلار (افزایش نسبت به ۵,۲۹۹ دلار M3 Ultra).
- پیکربندیهای ردهبالا: مدل با ۵۱۲ گیگابایت رم بیش از ۲۰,۰۰۰ دلار قیمت دارد و تا اواخر اکتبر عرضه نخواهد شد.
- اجاره (Leasing): اپل مدل M5 Max Studio را از ۴۸.۹۹ دلار و M5 Ultra را از ۱۱۰.۱۰ دلار در ماه ارائه میدهد.
پیشسفارشها از ۲۵ اوت در ۳۰ کشور آغاز شد و دستگاهها در ۲۲ سپتامبر به دست کاربران میرسند. قیمتهای دانشجویی برای مدلهای استودیو ۲,۲۹۹ و ۵,۰۹۹ دلار است.
خوشهبندی و استنتاج توزیعشده
اپل با درک این موضوع که حتی ۵۱۲ گیگابایت هم سقفی دارد، از هوش مصنوعی توزیعشده پشتیبانی میکند. macOS 26.2 که دسامبر گذشته عرضه شد، ارتباط کم-تاخیر Thunderbolt 5 را برای تجمیع حافظه بین چندین سیستم با استفاده از فریمورک MLX فعال کرد. این همان محرک فنی برای روند اتصال زنجیرهای بود که Ars Technica گزارش داد.
اکنون اپل رسماً اعلام کرده است که مک استودیوها را میتوان از طریق Thunderbolt 5 با استفاده از RDMA خوشهبندی کرد تا حافظه آنها تجمیع شود. این به تیمها اجازه میدهد «بزرگترین و سختترین مدلهای بازمتن پیشرو موجود امروز» را بارگذاری کنند. یک خوشه چهار-دستگاهی میتواند سرعت استنتاج هوش مصنوعی را تا ۳ برابر نسبت به یک سیستم واحد افزایش دهد. در حالی که ابزارهایی مانند exo پیش از این بهطور غیررسمی این کار را انجام میدادند، اپل اکنون آن را به یک ویژگی پشتیبانیشده تبدیل کرده است.
این استراتژی سقف حافظه را به دلیلی برای خرید سختافزار بیشتر تبدیل میکند. به جای اجاره ظرفیت ابری، اپل کاربران را تشویق میکند تا ردیفی از جعبههای دسکتاپ را با حاشیه سود اپل بسازند.
پیشبینی عملکرد در دنیای واقعی
تحلیلهای مستقل MacStories جهشی عظیم در توان عملیاتی توکنها را پیشبینی میکند. فدریکو ویتچی که یک سال است از M3 Ultra با ۵۱۲ گیگابایت رم استفاده میکند و فضای کاری خود را با DeepSeek-V4-Flash از طریق MLX مدیریت میکند، سرعت تولید حدود ۳۵ توکن در ثانیه را گزارش کرده است. اگر ادعای ۴ برابری اپل بهطور خطی مقیاسپذیر باشد، M5 Ultra میتواند از ۱۲۰ توکن در ثانیه عبور کند.
این سرعت، استنتاج محلی را سریعتر از اکثر چتباتهای مبتنی بر وب میکند و تنها پس از خوشههای اختصاصی انویدیا یا ارائهدهندگان تخصصی مانند Cerebras و Groq قرار میگیرد. لایههای معمولی نیز مقیاسپذیر هستند: مدل Mixture-of-Experts مانند Qwen 3.5-35B-A3B که روی مک مینی M4 پایه با ۱۷ توکن در ثانیه اجرا میشود، میتواند روی M6 به ۶۰ توکن در ثانیه برسد.
حتی مدلهای عظیم به اهدافی ممکن تبدیل میشوند. مدل GLM-5.2 با ۷۴۴ میلیارد پارامتر روی M3 Ultra با سرعت ۱۷ توکن در ثانیه و مدل عظیم Kimi K3 با سرعت ۳ توکن در ثانیه اجرا میشدند. روی M5 Ultra با ۵۱۲ گیگابایت رم، اینها دیگر آزمایشهای آماتوری نیستند بلکه اهدافی کاربردی برای ایستگاههای کاری هستند. با این حال، Ars Technica هشدار میدهد که اکثر سختافزارهای مصرفی استاندارد هنوز فاصله زیادی دارند تا این موضوع برای همه به واقعیت تبدیل شود؛ استودیو ۵۱۲ گیگابایتی یک استثنا است، نه قاعده.
چرخش استراتژیک در استراتژی هوش مصنوعی
اپل در ساخت مدلهای پیشرو اختصاصی از رقبای خود عقب مانده است و آماندا سیلبرلینگ از TechCrunch اشاره میکند که ارتقای مورد انتظار سیری توسط Gemini گوگل پشتیبانی میشود. در عوض، اپل بر روی «نقطه انتهایی» — یعنی محاسبات امن و محلی — متمرکز شده است.
اپل در حال ساخت یک پشته نرمافزاری جامع برای تقویت این شرطبندی است:
- فریمورک Core AI: یک فریمورک کاملاً جدید برای ساخت، اجرا و استقرار مدلها روی سیلیکون اپل.
- MLX: یک فریمورک متنباز برای اجرای بهینه مدلهای محلی.
- مدلهای پایه اپل و App Intents: ابزارهایی برای یکپارچهسازی Apple Intelligence.
- ابزارهای Xcode: طراحی شده برای اینکه توسعهدهندگان بتوانند مدلهای هوش مصنوعی بزرگ را بهطور محلی با استفاده از مدلهای اختصاصی خود اجرا کرده و تنظیم دقیق (Fine-tuning) — شبیه به وقتی که به یک پزشک عمومی، تخصص پوست میدهیم تا روی یک حوزه دقیق شود — کنند.
این استراتژی بر این باور است که جنگ پلتفرم هوش مصنوعی در میز کار برده میشود، نه در مرکز داده. در حالی که انویدیا سیلیکون را به صورت رک (Rack) میفروشد و ابر-مقیاسها توکنها را میلیونمیلیون میشمارند، اپل نقطه انتهایی را با داستان حریم خصوصی و قیمت سختافزاری یکباره تصاحب میکند.
برای کاربر عادی، نتیجه این تحول با macOS 27 و نسل بعدی Apple Intelligence در پاییز امسال ظاهر خواهد شد. برای توسعهدهنده، مک رسماً به یک دستگاه استنتاج تبدیل شده است. همانطور که جانی سروجی، مدیر سختافزار اپل میگوید، این «قدرتمندترین مک تاریخ ما» است.
باید منتظر بنچمارکهای مستقل در اواخر اکتبر باشیم تا ببینیم آیا پیکربندیهای ۵۱۲ گیگابایتی واقعاً وعده ۱۲۰ توکن در ثانیه را محقق میکنند یا خیر.
گام بعدی شما
- اگر توسعهدهنده هستید، فریمورک MLX را برای تست مدلهای بازمتن روی سختافزارهای فعلی مک بررسی کنید.
- برای مدیریت هزینههای API، مدلهای Qwen یا DeepSeek را روی سیستمهای محلی آزمایش کنید.
- در صورت خرید M5 Ultra، قابلیت خوشهبندی (Clustering) را برای اجرای مدلهای بالای ۱۰۰ میلیارد پارامتر در نظر بگیرید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو