اگر امروز از یک مکبوک یا آیفون استفاده میکنید، احتمالاً میدانید که مدلهای هوش مصنوعی پیشرفته معمولاً حافظه سیستم را بهسرعت میبلعند. اما اپل راهی یافته تا مدلهای غولپیکر را بدون کراش کردن سیستم، مستقیماً روی سختافزار شما اجرا کند.
طبق اعلام اپل در ۱۳ سپتامبر ۲۰۲۶، این دستاورد از طریق نسل سوم مدلهای بنیادی اپل (Apple Foundation Models یا AFM) محقق شده است؛ خانوادهای متشکل از پنج مدل که با همکاری گوگل توسعه یافتهاند.
این تحول در حالی رخ میدهد که کل صنعت با «دیوار حافظه» دستوپنجه نرم میکند؛ وضعیتی که در آن مدلهای بزرگ به رم (DRAM) بسیار بیشتری نیاز دارند تا آنچه در یک لپتاپ یا گوشی وجود دارد. همانطور که در تحلیل قبلی ما دربارهی لایههای ارکستراسیون در مقیاس سازمانی اشاره کردیم، مدیریت منابع کلید موفقیت است، اما اپل این بار مشکل را از ریشه و در سطح معماری حل کرده است. اپل بهجای استفاده از مدلهای متراکم — که مثل یک کتابخانه هستند که باید تمام کتابهایش را همزمان روی میز باز کنید — به سراغ مدلهای پراکنده رفته تا قابلیتهای استدلالی بالا را به لبه یا همان رایانش لبه (Edge Computing) بیاورد.
جهش فنی در اجرای داخلی
مهمترین دستاورد فنی اپل، مدل AFM 3 Core Advanced است. این مدل ۲۰ میلیارد پارامتری از یک معماری پراکنده استفاده میکند که در هر درخواست، تنها ۱ تا ۴ میلیارد پارامتر را فعال میکند. این مدل بهصورت پیشفرض چندوجهی (Multimodal) — شبیه به انسان که همزمان میبیند و میشنود — است و این موضوع دقت تبدیل گفتار به متن و طبیعیتر شدن صداها را افزایش میدهد.
برای حل گلوگاه حافظه، پژوهشگران اپل تکنیکی به نام هرس دستوری (Instruction-Following Pruning یا IFP) را ابداع کردند. در مدلهای زبانی بزرگ (LLM) — که مثل کتابخانهداری هستند که میلیاردها صفحه را خوانده و حالا با همان لحن جواب میدهد — تمام وزنها باید در حافظه فعال (DRAM) باشند. این موضوع باعث اشغال فضای عظیم حافظه میشود و مقیاسپذیری روی سختافزارهای مصرفکننده را محدود میکند. در مقابل، مدل AFM 3 Core Advanced بخش بزرگی از وزنهای خود را در حافظه فلش (NAND) ذخیره میکند.
از آنجا که سرعت انتقال داده از NAND به DRAM برای جابهجایی توکنبه-توکن (آنطور که در مدلهای استاندارد Mixture-of-Experts یا MoE نیاز است) بسیار کند است، مدل تصمیمات مسیریابی را بر اساس هر پرامپت میگیرد. یک بلوک متراکم و سبک، مجموعهای از «خبرهها» را در ابتدای پردازش انتخاب میکند و در طول تولید متن، آنها را بهصورت دورهای مجدداً انتخاب و بهروزرسانی میکند.
برای کاهش جابهجایی دادهها، این معماری بر درصد بالایی از «خبرههای مشترک» تکیه دارد که همیشه فعال هستند. اینها با «خبرههای مسیریابیشده» جفت میشوند که فقط هنگام نیاز به DRAM منتقل میشوند. در واقع مدل، زیرمجموعه کوچکی از خبرهها را بهصورت انتخابی بارگذاری کرده و آنها را با وزنهای استاتیک و مشترک ترکیب میکند تا یک مدل متراکم در رم شکل بگیرد.

این طراحی باعث ایجاد «انعطافپذیری در زمان استنتاج» میشود. استنتاج (Inference) — لحظهای که مدل واقعاً جواب تولید میکند، مثل خودِ آشپزی و نه دورهی آموزش آشپز — در اینجا بر اساس سختی هر درخواست مقیاس میپذیرد. بهجای مدیریت مجموعهای از مدلهای کوچکتر یا استفاده از یک مدل واحد برای همه کارها، AFM 3 Core Advanced از تعداد مشخصی پارامتر فعال استفاده میکند که برای هر مورد کاربرد خاص تنظیم شده است. این یعنی وزنها میتوانند بهصورت تدریجی در درخواستهای با دشواری متفاوت بارگذاری شوند و اندازه مدل را بسیار فراتر از محدودیتهای سنتی رم ببرند، در حالی که تأخیر (Latency) را پایین نگه میدارند.
در کنار این مدل، AFM 3 Core به عنوان یک مدل متراکم ۳ میلیارد پارامتری نسل جدید عمل میکند. این مدل یک گام در کیفیت پیش رفته و به عنوان یک خط پایه (Baseline) برای کارهای روزمره و سادهتر که در سیستمعامل ادغام شدهاند، عمل میکند. این رویکرد اجرای محلی، مشابه استراتژی استفاده از مدلهای MLX برای حذف ریسکهای حریم خصوصی در محیطهای حساس است که امنیت دادهها را از طریق پردازش داخلی تضمین میکند.
زیرساخت محاسبات ابری خصوصی
برای کارهایی که برای گوشی یا لپتاپ سنگین هستند، اپل از محاسبات ابری خصوصی (Private Cloud Compute) استفاده میکند. این زیرساخت تضمین میکند که دادههای کاربر هرگز ذخیره یا به اشتراک گذاشته نشوند، حتی با خودِ اپل. سه مدل سروری این لایه را مدیریت میکنند:
- AFM 3 Cloud: اسب بارکش اصلی سرور که برای سرعت، کارایی و عملکرد بهینه شده است.
- ADM 3 Cloud (Image): مدلی تخصصی برای تولید تصویر، ویرایش و قابلیت کاملاً جدید Image Playground.
- AFM 3 Cloud Pro: توانمندترین مدل سروری برای سختترین موارد کاربرد، مانند استدلالهای پیچیده و استفاده از ابزارهای عاملمحور (Agentic).
بر اساس مستندات اپل، در حالی که AFM 3 Core، AFM 3 Core Advanced، AFM 3 Cloud و ADM 3 Cloud همگی بهطور اختصاصی برای تراشههای اپل (Apple Silicon) ساخته شدهاند، مدل AFM 3 Cloud Pro یک تلاش هیبریدی است. اپل با همکاری گوگل و انویدیا، این سرویس را به GPUهای انویدیا در گوگلکلاود گسترش داده است، در حالی که همان تضمینهای حریم خصوصی را حفظ کرده است. این مدل توزیعشده از وظایف بین لبه و ابر، یادآور رویکرد جدید پراپلسیتی در مدیریت دادههای حساس است که برای بهینهسازی عملکرد و امنیت، محاسبات را تقسیم میکند. جزئیات بیشتر در این زمینه در وبسایت تحقیقات امنیتی اپل موجود است.
تولید تصویر و استدلال چندوجهی
جزئیات ADM 3 Cloud
مدل ADM 3 Cloud مسئول ساخت تصاویر واقعگرایانه، Genmoji و ویرایش تصاویر است. این مدل برای کنترلپذیری بالا و کارایی پارامترها طراحی شده تا بتواند در رزولوشنها و نسبتهای تصویر مختلف تعمیم یابد.
- قابلیتهای محوری: مدل پایه بهطور بومی تولید تصویر و Genmoji را مدیریت میکند و واقعگرایی بالایی را در موضوعات متنوع و شرایط نورپردازی پیچیده نشان میدهد.
- آداپتورهای تخصصی: اپل از آداپتورها برای فعال کردن تجربههای خاص پاییندستی استفاده میکند؛ برای مثال، قابلیت Spatial Reframing در اپلیکیشن Photos توسط این آداپتورها مدیریت میشود.
- تعامل کاربر: این مدل امکان تغییرات تصویری مبتنی بر لمس و شخصیسازی را در محیط Image Playground فراهم میکند.

استدلال در سمت سرور
در بخش استدلال، AFM 3 Cloud گامی بزرگ در استدلال چندوجهی است. اپل برای رسیدن به این هدف، چندین ارتقای کلیدی در معماری ترکیب خبرههای مسیر-موازی (Parallel-Track Mixture-of-Experts یا PT-MoE) که سال گذشته معرفی کرده بود، اعمال کرد. این اصلاحات معماری باعث پایداری بیشتر در آموزش و بهبود توانایی مدل در استدلال و بازیابی دقیق اطلاعات در پنجره زمینه (Context Window) — میزان متنی که مدل همزمان در ذهن نگه میدارد — برای پرسوجوهای پیچیده سروری شده است.
ارزیابی انسانی و عملکرد
بر اساس گزارشهای داخلی اپل، ارزیابان انسانی مدلها را در زمینههای پیروی از دستورات (Instruction Following)، صداقت (Truthfulness) و نحوه ارائه (Presentation) سنجیدهاند. برای پرامپتهای تصویری، آنها «درک تصویر» (توانایی شناسایی، استخراج و استدلال درباره محتوای بصری) را نیز اندازهگیری کردند. نتایج نشاندهنده جهشی نسبت به استانداردهای ۲۰۲۵ است:
- AFM 3 Core: در ۴۵.۶٪ از پرامپتهای متنی عمومی، کاربران آن را به نسل قبل ترجیح دادند (در مقابل ۲۳.۳٪ در سال ۲۰۲۵). در درک تصاویر، کاربران در بیش از ۶۱٪ موارد آن را به نسل قبلی ترجیح دادند.
- AFM 3 Cloud: در ۶۴.۷٪ موارد برنده بود، در حالی که مدل AFM Server سال ۲۰۲۵ تنها ۸.۷٪ ترجیح داشت. این جهش در تمام مناطق زبانی از جمله انگلیسی، PFIGSCJK (پرتغالی، فرانسوی، ایتالیایی، آلمانی، اسپانیایی، چینی، ژاپنی، کرهای)، DDNSTV (دانمارکی، هلندی، نروژی، سوئدی، ترکی، ویتنامی) و AFIHHMPRTU (عربی، فنلاندی، اندونزیایی، عبری، هندی، مالایی، لهستانی، روسی، تایلندی، اوکراینی) یکسان بود.
- AFM 3 Cloud Pro: در مسائل ریاضی ۱۴٪ بهبود نسبی نسبت به مدل Cloud معمولی داشت. همچنین رضایت کلی کاربران از پاسخها را تقریباً ۱۰٪ برای متن و ۱۴٪ برای درک تصاویر نسبت به AFM 3 Cloud افزایش داد.
علاوه بر این، AFM 3 Cloud در مقایسه با مدل AFM Server سال ۲۰۲۵، بهبود نسبی ۳۶ درصدی در رضایت کلی از پاسخها و ۲۱ درصدی در عملکرد پیروی از دستورات نشان داد. در درک تصاویر، این مدل در ۳۷.۸٪ پرامپتها ترجیح داده شد، در حالی که خط پایه سال ۲۰۲۵ تنها ۹.۶٪ بود.
پیشرفت در صوت و دیکته
مدل AFM 3 Core Advanced قابلیتهای صوتی سیستم را دگرگون کرده است. در تست MOS (امتیاز میانگین نظر) ۵ امتیازی، این مدل در برابر سیستم تبدیل متن به گفتار (TTS) فعلی اپل سنجیده شد. در حالت بهینه با ۱ میلیارد پارامتر فعال، نمره ۴.۱۵ را برای صدای عمومی کسب کرد (افزایش ۰.۲۸ نسبت به خط پایه ۳.۸۷).
این فاصله در سناریوهای مکالمهای، مانند بلند خواندن یک متن، بیشتر است؛ جایی که AFM 3 Core Advanced نمره ۴.۲۴ را در برابر ۳.۸۲ سیستم فعلی گرفت (اختلاف ۰.۴۲). از آنجا که افزایش ۰.۱ در مقیاس MOS یک بهبود بسیار محسوس تلقی میشود، این یعنی تجربه کاربر به شدت طبیعیتر شده است.
در تبدیل گفتار به متن (Speech-to-Text)، مدل جدید شکاف بزرگی در کیفیت کلی ایجاد کرد. در اندازه ۱ میلیارد پارامتر فعال، این مدل در ۴۴.۷٪ موارد به سیستم دیکته قبلی ترجیح داده شد (در مقابل ۱۷.۶٪). این برتری بهطور مداوم در شش بعد دیگر نیز مشاهده شد: نقطهگذاری (Punctuation)، حروف بزرگ (Casing)، چیدمان (Layout)، ثبت معنا (Meaning Capture)، مدیریت لکنت و تپق (Disfluency Handling) و سبک (Style).
حفاظها و آموزش
اپل این مدلها را با ترکیبی از دادههای عمومی، دادههای لایسنسدار یا خریداریشده از شخص ثالث، دادههای متنباز، دادههای حاصل از مطالعات اختصاصی و دادههای مصنوعی (Synthetic Data) آموزش داده است. شرکت صراحتاً اعلام کرده که از دادههای شخصی خصوصی یا تعاملات کاربران برای آموزش استفاده نمیکند و حق انصراف ناشران وب را به رسمیت میشناسد.
برای پشتیبانی از این تجربهها، اپل پیشآموزش (Pre-training) را روی آخرین نسل شتابدهندههای TPU ابری مقیاسبندی کرد. تمام مدلها پیش از تخصصی شدن برای معماریهای مربوطه، یک بنیاد مشترک داشتند و سپس قابلیتهایی مانند صوت، درک تصویر، استدلال با زمینه طولانی و تولید بصری با کیفیت بالا به آنها اضافه شد.
بهینهسازی و ایمنی
اصلاحات فنی
- پسآموزش: اپل تنظیم نظارتشده (SFT) را با یادگیری تقویتی (RL) چندمرحلهای ترکیب کرد.
- بهینهسازی سختافزاری: مدلهای AFM 3 Core، AFM 3 Core Advanced، AFM 3 Cloud و ADM 3 Cloud برای تراشههای اپل بهینه شدند؛ اما AFM 3 Cloud Pro برای GPUهای انویدیا بهینه شده است.
- فشردهسازی: با استفاده از آموزش آگاه از کوانتش (Quantization Aware Training)، اپل مدلها را بهشدت فشرده کرد در حالی که دقت بالا را حفظ نمود.
اصول هوش مصنوعی مسئولانه
اپل مجموعهای از اصول را برای هدایت توسعه به کار میگیرد:
- توانمندسازی کاربران: شناسایی کاربردهای مسئولانه برای ایجاد ابزارهایی که نیازهای کاربر را برطرف کند و در عین حال به نحوه رسیدن کاربر به اهدافش احترام بگذارد.
- نمایندگی: ساخت محصولاتی که کاربران جهانی را بهطور اصیل نمایندگی کنند و از سوگیریهای سیستماتیک یا کلیشهها دوری کنند.
- طراحی دقیق: استفاده از اقدامات احتیاطی در آموزش و ارزیابی برای شناسایی سوءاستفاده یا آسیب احتمالی، همراه با نظارت مستمر از طریق بازخوردهای کاربران.
- حریم خصوصی بهصورت پیشفرض: استفاده از پردازش روی دستگاه و محاسبات ابری خصوصی تا حریم خصوصی چیزی نباشد که کاربر مجبور به مدیریت آن باشد.
پیادهسازی ایمنی
اپل از یک تاکسونومی ایمنی برای شناسایی محتوای حساس استفاده میکند. برای اطمینان از رعایت مرزها در فرهنگهای مختلف، آنها همراستاسازی پسآموزش چندزبانه انجام میدهند، از مدلهای حفاظتی (Guardrail) مخصوص هر زبان استفاده میکنند و تیمهای قرمز (Red Teaming) انسانی را به کار میگیرند که توسط بومیان زبانهای پشتیبانیشده اصلاح شدهاند.
چرخش راهبردی اپل
اپل با نزدیک کردن «هوش» به سختافزار، وابستگی خود به اتصال دائمی ابری برای هوش مصنوعی سطح بالا را کاهش میدهد. استفاده از IFP نشان میدهد که در آینده، اندازه مدل دیگر توسط رم دستگاه محدود نمیشود، بلکه به کارایی مکانیزم مسیریابی بستگی دارد.
برای کاربر، این یعنی سیری و ابزارهای سیستمی سریعتر پاسخ میدهند و بدون تأخیرهای سروری، استدلالهای پیچیده انجام میدهند. این استراتژی، قلعه حریم خصوصی اپل را مستحکمتر میکند، زیرا شخصیترین دادهها هرگز دستگاه را ترک نمیکنند. این سیستم اکنون در iOS 18، iPadOS 18 و macOS Sequoia ادغام شده است و برای کارهایی مثل نوشتن، خلاصهسازی اعلانها و انجام اقدامات درونبرنامهای بهصورت لحظهای سازگار میشود.
منتظر گزارش فنی کامل در اواخر تابستان باشید که بنچمارکهای دقیق و ارزیابیهایی را ارائه میدهد تا جامعه گستردهتر یادگیری ماشین (ML) بتواند این ادعاهای معماری را تأیید کند.
گام بعدی شما
- اگر توسعهدهنده هستید، مستندات Security Research اپل را برای درک نحوه تعامل مدلهای لبه با ابری مطالعه کنید.
- در بهروزرسانیهای جدید سیستمعامل، سرعت پاسخدهی سیری را در حالت آفلاین با کارهای پیچیده تست کنید.
- منتظر گزارش فنی کامل در اواخر تابستان باشید تا بنچمارکهای دقیق این معماری را بررسی کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell و رقابت با Apple Silicon مراجعه کنید.




گفتگو