پرش به محتوای اصلی
پرش به محتوای مقاله

افزایش ۳ تا ۶ برابری سرعت استنتاج مدل‌های PyTorch در مک‌های اپل سیلیکون

·۲۸ اردیبهشت ۱۴۰۵۲ دقیقه مطالعه۲ بازدید
افزایش ۳ تا ۶ برابری سرعت استنتاج مدل‌های PyTorch در مک‌های اپل سیلیکون
اشتراک‌گذاری

اگر مدل‌های هوش مصنوعی را به‌صورت محلی روی مک اجرا می‌کنید، سرعت استنتاج شما همین حالا ۳ تا ۶ برابر بیشتر شده است. این جهش خیره‌کننده نتیجه‌ی انتشار ابزار ExecuTorch MLX Delegate توسط PyTorch در ۱۸ آوریل ۲۰۲۶ است تا تمام ظرفیت GPU در تراشه‌های اپل سیلیکون آزاد شود.

اپل سیلیکون اکنون یکی از بهترین گزینه‌ها برای اجرای مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — به‌صورت محلی است. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی مدل‌های لبه اشاره کردیم، حذف گلوگاه‌های سخت‌افزاری کلید موفقیت است. تا پیش از این، کاربران یا باید به پردازنده‌های مرکزی (CPU) کندتر بسنده می‌کردند یا از ابزارهای محدود Metal استفاده می‌کردند. این ابزار جدید با اتصال مستقیم به چارچوب MLX (MLX Framework) اپل، این شکاف را پر می‌کند.

بر اساس مستندات فنی، این ابزار با پشته‌ی خروجی PyTorch 2 سازگار است و از TorchAO برای کوانتیزاسیون استفاده می‌کند. این سیستم از فرمت‌های داده‌ای BF16، FP16 و حتی NVFP4 انویدیا پشتیبانی می‌کند.

این به‌روزرسانی طیف گسترده‌ای از مدل‌ها را پوشش می‌دهد:

  • مدل‌های ترنسفورمر متراکم مثل Llama 3.2 1B و Gemma 3.
  • مدل‌های ترکیبی متخصص (MoE) مانند Qwen 3.5 35B-A3B.
  • ابزارهای تبدیل گفتار به متن از جمله OpenAI Whisper و Mistral Voxtral.

به باور تحلیلگران، این تغییر «مالیات انتقال» را برای توسعه‌دهندگان مک حذف می‌کند. دیگر نیازی نیست بین انعطاف‌پذیری PyTorch و سرعت MLX یکی را انتخاب کنید. با یکپارچه‌سازی APIهای زمان اجرا، توسعه‌دهندگان می‌توانند بدون بازنویسی کد، مدل‌های خود را روی بستر‌های مختلف مثل CUDA یا Vulkan اجرا کنند.

گام بعدی شما

  • دستورالعمل‌های دقیق خروجی برای مدل‌های Llama و Whisper را در فایل README پروژه بررسی کنید.
  • برای درخواست پشتیبانی از مدل‌های خاص خود، به مخزن گیت‌هاب ExecuTorch مراجعه کنید.
  • اگر از مدل‌های کوانتیزه شده استفاده می‌کنید، اثر تغییر فرمت داده بر دقت مدل را بسنجید.

اما تأثیر این بهینه‌سازی بر مصرف باتری در لپ‌تاپ‌های M4 هنوز ناشناخته است — تحلیل ما درباره‌ی معماری تراشه‌های جدید اپل را بخوانید.

چرا این موضوع مهم است؟

این به‌روزرسانی با تکیه بر اعتبار فنی چارچوب MLX اپل، مک را به ابزاری جدی‌تر برای استقرار محلی مدل‌های بزرگ تبدیل می‌کند. در نتیجه، هزینه و زمان محاسباتی برای پژوهشگران AI در محیط‌های محلی به‌شدت کاهش می‌یابد.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.