پرش به محتوای اصلی
پرش به محتوای مقاله

اپل با تکنیک هرس دستوری مصرف حافظه AI را در دستگاه‌های کاربر کاهش داد

·۲۲ شهریور ۱۴۰۵۱۲ دقیقه مطالعه
معرفی نسل سوم مدل‌های بنیادی اپل
معرفی نسل سوم مدل‌های بنیادی اپل
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی تکنیک هرس دستوری (IFP) که اجازه می‌دهد مدل‌های ۲۰ میلیارد پارامتری با بارگذاری انتخابی وزن‌ها از حافظه فلش، روی رم محدود دستگاه‌های مصرف‌کننده اجرا شوند.

اگر امروز از یک مک‌بوک یا آیفون استفاده می‌کنید، احتمالاً می‌دانید که مدل‌های هوش مصنوعی پیشرفته معمولاً حافظه سیستم را به‌سرعت می‌بلعند. اما اپل راهی یافته تا مدل‌های غول‌پیکر را بدون کراش کردن سیستم، مستقیماً روی سخت‌افزار شما اجرا کند.

طبق اعلام اپل در ۱۳ سپتامبر ۲۰۲۶، این دستاورد از طریق نسل سوم مدل‌های بنیادی اپل (Apple Foundation Models یا AFM) محقق شده است؛ خانواده‌ای متشکل از پنج مدل که با همکاری گوگل توسعه یافته‌اند.

این تحول در حالی رخ می‌دهد که کل صنعت با «دیوار حافظه» دست‌وپنجه نرم می‌کند؛ وضعیتی که در آن مدل‌های بزرگ به رم (DRAM) بسیار بیشتری نیاز دارند تا آنچه در یک لپ‌تاپ یا گوشی وجود دارد. همان‌طور که در تحلیل قبلی ما درباره‌ی لایه‌های ارکستراسیون در مقیاس سازمانی اشاره کردیم، مدیریت منابع کلید موفقیت است، اما اپل این بار مشکل را از ریشه و در سطح معماری حل کرده است. اپل به‌جای استفاده از مدل‌های متراکم — که مثل یک کتابخانه هستند که باید تمام کتاب‌هایش را هم‌زمان روی میز باز کنید — به سراغ مدل‌های پراکنده رفته تا قابلیت‌های استدلالی بالا را به لبه یا همان رایانش لبه (Edge Computing) بیاورد.

جهش فنی در اجرای داخلی

مهم‌ترین دستاورد فنی اپل، مدل AFM 3 Core Advanced است. این مدل ۲۰ میلیارد پارامتری از یک معماری پراکنده استفاده می‌کند که در هر درخواست، تنها ۱ تا ۴ میلیارد پارامتر را فعال می‌کند. این مدل به‌صورت پیش‌فرض چندوجهی (Multimodal) — شبیه به انسان که هم‌زمان می‌بیند و می‌شنود — است و این موضوع دقت تبدیل گفتار به متن و طبیعی‌تر شدن صداها را افزایش می‌دهد.

برای حل گلوگاه حافظه، پژوهشگران اپل تکنیکی به نام هرس دستوری (Instruction-Following Pruning یا IFP) را ابداع کردند. در مدل‌های زبانی بزرگ (LLM) — که مثل کتابخانه‌داری هستند که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — تمام وزن‌ها باید در حافظه فعال (DRAM) باشند. این موضوع باعث اشغال فضای عظیم حافظه می‌شود و مقیاس‌پذیری روی سخت‌افزارهای مصرف‌کننده را محدود می‌کند. در مقابل، مدل AFM 3 Core Advanced بخش بزرگی از وزن‌های خود را در حافظه فلش (NAND) ذخیره می‌کند.

از آنجا که سرعت انتقال داده از NAND به DRAM برای جابه‌جایی توکن‌به-توکن (آن‌طور که در مدل‌های استاندارد Mixture-of-Experts یا MoE نیاز است) بسیار کند است، مدل تصمیمات مسیریابی را بر اساس هر پرامپت می‌گیرد. یک بلوک متراکم و سبک، مجموعه‌ای از «خبره‌ها» را در ابتدای پردازش انتخاب می‌کند و در طول تولید متن، آن‌ها را به‌صورت دوره‌ای مجدداً انتخاب و به‌روزرسانی می‌کند.

برای کاهش جابه‌جایی داده‌ها، این معماری بر درصد بالایی از «خبره‌های مشترک» تکیه دارد که همیشه فعال هستند. این‌ها با «خبره‌های مسیریابی‌شده» جفت می‌شوند که فقط هنگام نیاز به DRAM منتقل می‌شوند. در واقع مدل، زیرمجموعه کوچکی از خبره‌ها را به‌صورت انتخابی بارگذاری کرده و آن‌ها را با وزن‌های استاتیک و مشترک ترکیب می‌کند تا یک مدل متراکم در رم شکل بگیرد.

نسل سوم مدل‌های پایه اپل: معرفی معماری چندوجهی پیشرفته برای دستگاه‌های محلی

این طراحی باعث ایجاد «انعطاف‌پذیری در زمان استنتاج» می‌شود. استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند، مثل خودِ آشپزی و نه دوره‌ی آموزش آشپز — در اینجا بر اساس سختی هر درخواست مقیاس می‌پذیرد. به‌جای مدیریت مجموعه‌ای از مدل‌های کوچک‌تر یا استفاده از یک مدل واحد برای همه کارها، AFM 3 Core Advanced از تعداد مشخصی پارامتر فعال استفاده می‌کند که برای هر مورد کاربرد خاص تنظیم شده است. این یعنی وزن‌ها می‌توانند به‌صورت تدریجی در درخواست‌های با دشواری متفاوت بارگذاری شوند و اندازه مدل را بسیار فراتر از محدودیت‌های سنتی رم ببرند، در حالی که تأخیر (Latency) را پایین نگه می‌دارند.

در کنار این مدل، AFM 3 Core به عنوان یک مدل متراکم ۳ میلیارد پارامتری نسل جدید عمل می‌کند. این مدل یک گام در کیفیت پیش رفته و به عنوان یک خط پایه (Baseline) برای کارهای روزمره و ساده‌تر که در سیستم‌عامل ادغام شده‌اند، عمل می‌کند. این رویکرد اجرای محلی، مشابه استراتژی استفاده از مدل‌های MLX برای حذف ریسک‌های حریم خصوصی در محیط‌های حساس است که امنیت داده‌ها را از طریق پردازش داخلی تضمین می‌کند.

زیرساخت محاسبات ابری خصوصی

برای کارهایی که برای گوشی یا لپ‌تاپ سنگین هستند، اپل از محاسبات ابری خصوصی (Private Cloud Compute) استفاده می‌کند. این زیرساخت تضمین می‌کند که داده‌های کاربر هرگز ذخیره یا به اشتراک گذاشته نشوند، حتی با خودِ اپل. سه مدل سروری این لایه را مدیریت می‌کنند:

  • AFM 3 Cloud: اسب بارکش اصلی سرور که برای سرعت، کارایی و عملکرد بهینه شده است.
  • ADM 3 Cloud (Image): مدلی تخصصی برای تولید تصویر، ویرایش و قابلیت کاملاً جدید Image Playground.
  • AFM 3 Cloud Pro: توانمندترین مدل سروری برای سخت‌ترین موارد کاربرد، مانند استدلال‌های پیچیده و استفاده از ابزارهای عامل‌محور (Agentic).

بر اساس مستندات اپل، در حالی که AFM 3 Core، AFM 3 Core Advanced، AFM 3 Cloud و ADM 3 Cloud همگی به‌طور اختصاصی برای تراشه‌های اپل (Apple Silicon) ساخته شده‌اند، مدل AFM 3 Cloud Pro یک تلاش هیبریدی است. اپل با همکاری گوگل و انویدیا، این سرویس را به GPUهای انویدیا در گوگل‌کلاود گسترش داده است، در حالی که همان تضمین‌های حریم خصوصی را حفظ کرده است. این مدل توزیع‌شده از وظایف بین لبه و ابر، یادآور رویکرد جدید پراپلسیتی در مدیریت داده‌های حساس است که برای بهینه‌سازی عملکرد و امنیت، محاسبات را تقسیم می‌کند. جزئیات بیشتر در این زمینه در وب‌سایت تحقیقات امنیتی اپل موجود است.

تولید تصویر و استدلال چندوجهی

جزئیات ADM 3 Cloud
مدل ADM 3 Cloud مسئول ساخت تصاویر واقع‌گرایانه، Genmoji و ویرایش تصاویر است. این مدل برای کنترل‌پذیری بالا و کارایی پارامترها طراحی شده تا بتواند در رزولوشن‌ها و نسبت‌های تصویر مختلف تعمیم یابد.

  • قابلیت‌های محوری: مدل پایه به‌طور بومی تولید تصویر و Genmoji را مدیریت می‌کند و واقع‌گرایی بالایی را در موضوعات متنوع و شرایط نورپردازی پیچیده نشان می‌دهد.
  • آداپتورهای تخصصی: اپل از آداپتورها برای فعال کردن تجربه‌های خاص پایین‌دستی استفاده می‌کند؛ برای مثال، قابلیت Spatial Reframing در اپلیکیشن Photos توسط این آداپتورها مدیریت می‌شود.
  • تعامل کاربر: این مدل امکان تغییرات تصویری مبتنی بر لمس و شخصی‌سازی را در محیط Image Playground فراهم می‌کند.

معرفی نسل سوم مدل‌های بنیادی اپل

استدلال در سمت سرور
در بخش استدلال، AFM 3 Cloud گامی بزرگ در استدلال چندوجهی است. اپل برای رسیدن به این هدف، چندین ارتقای کلیدی در معماری ترکیب خبره‌های مسیر-موازی (Parallel-Track Mixture-of-Experts یا PT-MoE) که سال گذشته معرفی کرده بود، اعمال کرد. این اصلاحات معماری باعث پایداری بیشتر در آموزش و بهبود توانایی مدل در استدلال و بازیابی دقیق اطلاعات در پنجره زمینه (Context Window) — میزان متنی که مدل هم‌زمان در ذهن نگه می‌دارد — برای پرس‌وجوهای پیچیده سروری شده است.

ارزیابی انسانی و عملکرد

بر اساس گزارش‌های داخلی اپل، ارزیابان انسانی مدل‌ها را در زمینه‌های پیروی از دستورات (Instruction Following)، صداقت (Truthfulness) و نحوه ارائه (Presentation) سنجیده‌اند. برای پرامپت‌های تصویری، آن‌ها «درک تصویر» (توانایی شناسایی، استخراج و استدلال درباره محتوای بصری) را نیز اندازه‌گیری کردند. نتایج نشان‌دهنده جهشی نسبت به استانداردهای ۲۰۲۵ است:

  • AFM 3 Core: در ۴۵.۶٪ از پرامپت‌های متنی عمومی، کاربران آن را به نسل قبل ترجیح دادند (در مقابل ۲۳.۳٪ در سال ۲۰۲۵). در درک تصاویر، کاربران در بیش از ۶۱٪ موارد آن را به نسل قبلی ترجیح دادند.
  • AFM 3 Cloud: در ۶۴.۷٪ موارد برنده بود، در حالی که مدل AFM Server سال ۲۰۲۵ تنها ۸.۷٪ ترجیح داشت. این جهش در تمام مناطق زبانی از جمله انگلیسی، PFIGSCJK (پرتغالی، فرانسوی، ایتالیایی، آلمانی، اسپانیایی، چینی، ژاپنی، کره‌ای)، DDNSTV (دانمارکی، هلندی، نروژی، سوئدی، ترکی، ویتنامی) و AFIHHMPRTU (عربی، فنلاندی، اندونزیایی، عبری، هندی، مالایی، لهستانی، روسی، تایلندی، اوکراینی) یکسان بود.
  • AFM 3 Cloud Pro: در مسائل ریاضی ۱۴٪ بهبود نسبی نسبت به مدل Cloud معمولی داشت. همچنین رضایت کلی کاربران از پاسخ‌ها را تقریباً ۱۰٪ برای متن و ۱۴٪ برای درک تصاویر نسبت به AFM 3 Cloud افزایش داد.

علاوه بر این، AFM 3 Cloud در مقایسه با مدل AFM Server سال ۲۰۲۵، بهبود نسبی ۳۶ درصدی در رضایت کلی از پاسخ‌ها و ۲۱ درصدی در عملکرد پیروی از دستورات نشان داد. در درک تصاویر، این مدل در ۳۷.۸٪ پرامپت‌ها ترجیح داده شد، در حالی که خط پایه سال ۲۰۲۵ تنها ۹.۶٪ بود.

پیشرفت در صوت و دیکته

مدل AFM 3 Core Advanced قابلیت‌های صوتی سیستم را دگرگون کرده است. در تست MOS (امتیاز میانگین نظر) ۵ امتیازی، این مدل در برابر سیستم تبدیل متن به گفتار (TTS) فعلی اپل سنجیده شد. در حالت بهینه با ۱ میلیارد پارامتر فعال، نمره ۴.۱۵ را برای صدای عمومی کسب کرد (افزایش ۰.۲۸ نسبت به خط پایه ۳.۸۷).

این فاصله در سناریوهای مکالمه‌ای، مانند بلند خواندن یک متن، بیشتر است؛ جایی که AFM 3 Core Advanced نمره ۴.۲۴ را در برابر ۳.۸۲ سیستم فعلی گرفت (اختلاف ۰.۴۲). از آنجا که افزایش ۰.۱ در مقیاس MOS یک بهبود بسیار محسوس تلقی می‌شود، این یعنی تجربه کاربر به شدت طبیعی‌تر شده است.

در تبدیل گفتار به متن (Speech-to-Text)، مدل جدید شکاف بزرگی در کیفیت کلی ایجاد کرد. در اندازه ۱ میلیارد پارامتر فعال، این مدل در ۴۴.۷٪ موارد به سیستم دیکته قبلی ترجیح داده شد (در مقابل ۱۷.۶٪). این برتری به‌طور مداوم در شش بعد دیگر نیز مشاهده شد: نقطه‌گذاری (Punctuation)، حروف بزرگ (Casing)، چیدمان (Layout)، ثبت معنا (Meaning Capture)، مدیریت لکنت و تپق (Disfluency Handling) و سبک (Style).

حفاظ‌ها و آموزش

اپل این مدل‌ها را با ترکیبی از داده‌های عمومی، داده‌های لایسنس‌دار یا خریداری‌شده از شخص ثالث، داده‌های متن‌باز، داده‌های حاصل از مطالعات اختصاصی و داده‌های مصنوعی (Synthetic Data) آموزش داده است. شرکت صراحتاً اعلام کرده که از داده‌های شخصی خصوصی یا تعاملات کاربران برای آموزش استفاده نمی‌کند و حق انصراف ناشران وب را به رسمیت می‌شناسد.

برای پشتیبانی از این تجربه‌ها، اپل پیش‌آموزش (Pre-training) را روی آخرین نسل شتاب‌دهنده‌های TPU ابری مقیاس‌بندی کرد. تمام مدل‌ها پیش از تخصصی شدن برای معماری‌های مربوطه، یک بنیاد مشترک داشتند و سپس قابلیت‌هایی مانند صوت، درک تصویر، استدلال با زمینه طولانی و تولید بصری با کیفیت بالا به آن‌ها اضافه شد.

بهینه‌سازی و ایمنی

اصلاحات فنی

  • پس‌آموزش: اپل تنظیم نظارت‌شده (SFT) را با یادگیری تقویتی (RL) چندمرحله‌ای ترکیب کرد.
  • بهینه‌سازی سخت‌افزاری: مدل‌های AFM 3 Core، AFM 3 Core Advanced، AFM 3 Cloud و ADM 3 Cloud برای تراشه‌های اپل بهینه شدند؛ اما AFM 3 Cloud Pro برای GPUهای انویدیا بهینه شده است.
  • فشرده‌سازی: با استفاده از آموزش آگاه از کوانتش (Quantization Aware Training)، اپل مدل‌ها را به‌شدت فشرده کرد در حالی که دقت بالا را حفظ نمود.

اصول هوش مصنوعی مسئولانه
اپل مجموعه‌ای از اصول را برای هدایت توسعه به کار می‌گیرد:

  • توانمندسازی کاربران: شناسایی کاربردهای مسئولانه برای ایجاد ابزارهایی که نیازهای کاربر را برطرف کند و در عین حال به نحوه رسیدن کاربر به اهدافش احترام بگذارد.
  • نمایندگی: ساخت محصولاتی که کاربران جهانی را به‌طور اصیل نمایندگی کنند و از سوگیری‌های سیستماتیک یا کلیشه‌ها دوری کنند.
  • طراحی دقیق: استفاده از اقدامات احتیاطی در آموزش و ارزیابی برای شناسایی سوءاستفاده یا آسیب احتمالی، همراه با نظارت مستمر از طریق بازخوردهای کاربران.
  • حریم خصوصی به‌صورت پیش‌فرض: استفاده از پردازش روی دستگاه و محاسبات ابری خصوصی تا حریم خصوصی چیزی نباشد که کاربر مجبور به مدیریت آن باشد.

پیاده‌سازی ایمنی
اپل از یک تاکسونومی ایمنی برای شناسایی محتوای حساس استفاده می‌کند. برای اطمینان از رعایت مرزها در فرهنگ‌های مختلف، آن‌ها همراستاسازی پس‌آموزش چندزبانه انجام می‌دهند، از مدل‌های حفاظتی (Guardrail) مخصوص هر زبان استفاده می‌کنند و تیم‌های قرمز (Red Teaming) انسانی را به کار می‌گیرند که توسط بومیان زبان‌های پشتیبانی‌شده اصلاح شده‌اند.

چرخش راهبردی اپل

اپل با نزدیک کردن «هوش» به سخت‌افزار، وابستگی خود به اتصال دائمی ابری برای هوش مصنوعی سطح بالا را کاهش می‌دهد. استفاده از IFP نشان می‌دهد که در آینده، اندازه مدل دیگر توسط رم دستگاه محدود نمی‌شود، بلکه به کارایی مکانیزم مسیریابی بستگی دارد.

برای کاربر، این یعنی سیری و ابزارهای سیستمی سریع‌تر پاسخ می‌دهند و بدون تأخیرهای سروری، استدلال‌های پیچیده انجام می‌دهند. این استراتژی، قلعه حریم خصوصی اپل را مستحکم‌تر می‌کند، زیرا شخصی‌ترین داده‌ها هرگز دستگاه را ترک نمی‌کنند. این سیستم اکنون در iOS 18، iPadOS 18 و macOS Sequoia ادغام شده است و برای کارهایی مثل نوشتن، خلاصه‌سازی اعلان‌ها و انجام اقدامات درون‌برنامه‌ای به‌صورت لحظه‌ای سازگار می‌شود.

منتظر گزارش فنی کامل در اواخر تابستان باشید که بنچمارک‌های دقیق و ارزیابی‌هایی را ارائه می‌دهد تا جامعه گسترده‌تر یادگیری ماشین (ML) بتواند این ادعاهای معماری را تأیید کند.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، مستندات Security Research اپل را برای درک نحوه تعامل مدل‌های لبه با ابری مطالعه کنید.
  • در به‌روزرسانی‌های جدید سیستم‌عامل، سرعت پاسخ‌دهی سیری را در حالت آفلاین با کارهای پیچیده تست کنید.
  • منتظر گزارش فنی کامل در اواخر تابستان باشید تا بنچمارک‌های دقیق این معماری را بررسی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell و رقابت با Apple Silicon مراجعه کنید.

چرا این موضوع مهم است؟

این معماری با شکستن سد حافظه، استدلال‌های پیچیده را از سرورها به جیب کاربران می‌برد. اعتبار این ادعا با تکیه بر همکاری انویدیا و گوگل و انتشار گزارش‌های فنی در آینده تقویت می‌شود.

تأثیر برای ایران

به‌دلیل محدودیت‌های دسترسی به برخی سرویس‌های ابری اپل، کاربران ایرانی احتمالاً بیشترین بهره را از قابلیت‌های آفلاین و On-device این مدل‌ها خواهند برد.

·نگاه ما
تحریریه دات‌هوش

تمرکز اپل بر جابه‌جایی وزن‌ها بین NAND و DRAM نشان می‌دهد که جنگ بعدی AI نه بر سر تعداد پارامترها، بلکه بر سر مدیریت پهنای‌باند حافظه است. این رویکرد عملاً مفهوم «محدودیت سخت‌افزاری» را برای مدل‌های لبه تغییر می‌دهد و اجازه می‌دهد مدل‌های بزرگتر بدون نیاز به ارتقای فیزیکی رم، روی دستگاه‌های موجود اجرا شوند. به نظر ما، این حرکت اپل برای به حاشیه راندن مدل‌های ابری کوچک و تبدیل دستگاه‌های شخصی به گره‌های پردازشی مستقل است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.