پرش به محتوای اصلی
پرش به محتوای مقاله

چگونه PyTorch 2.12 سرعت محاسبات CUDA را ۱۰۰ برابر کرد؟

·۲۵ اردیبهشت ۱۴۰۵۲ دقیقه مطالعه۲ بازدید
چگونه PyTorch 2.12 سرعت محاسبات CUDA را ۱۰۰ برابر کرد؟
اشتراک‌گذاری

اگر امروز مدل‌های زبانی بزرگ را در مقیاس صنعتی مستقر می‌کنید، هزینه‌های استنتاج (Inference) — که مثل خودِ آشپزی است، نه دوره‌ی آموزش آشپز — قرار است به‌شدت کاهش یابد. PyTorch در ۱۳ مه ۲۰۲۶ نسخه ۲.۱۲ را منتشر کرد که سرعت عملیات تجزیه مقادیر ویژه (Eigendecomposition) در CUDA را ۱۰۰ برابر می‌کند.

برای سال‌ها، PyTorch استاندارد طلایی پژوهش بود اما در لایه‌ی سخت‌افزاری برای محیط‌های عملیاتی ضعف داشت. این نسخه ادامه یک چرخش راهبردی است تا اکوسیستم از ابزارهای قدیمی مثل TorchScript فاصله بگیرد. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی بهینه‌سازی مدل‌های بازمتن اشاره کردیم، هدف اکنون رسیدن به پلتفرمی است که روی هر تراشه‌ای یکسان اجرا شود.

به نقل از مستندات رسمی این نسخه، تغییرات کلیدی عبارتند از:

  • عملکرد CUDA: عملیات linalg.eigh اکنون از بک‌اند cuSolver استفاده می‌کند. طبق گزارش Meta، این تغییر زمان پردازش بسیاری از حجم‌های کاری علمی را از چند دقیقه به چند ثانیه رسانده است.
  • کوانتایزیشن (Quantization) — شبیه تبدیل یک عکس باکیفیت به فرمت JPEG برای کاهش حجم بدون از دست دادن معنای کلی — اکنون از فرمت‌های Microscaling (MX) پشتیبانی می‌کند. این یعنی مدل‌ها را می‌توان روی سخت‌افزارهای لبه (Edge) با محدودیت هزینه مستقر کرد.
  • یکپارچگی سخت‌افزاری: API جدید torch.accelerator.Graph باعث می‌شود ثبت و بازپخش گراف‌ها روی تراشه‌های NVIDIA، Intel XPU و سایر بک‌اندها یکسان شود.
  • اپل سیلیکون: شیدرهای Metal-4 اکنون پیش‌کامپایل شده‌اند تا تأخیر شروع به کار در MPS حذف شود.

این تغییرات صرفاً چند وصله فنی نیستند؛ بلکه تلاشی برای شکستن انحصار سخت‌افزاری (Vendor Lock-in) است. Meta با یکسان‌سازی API، اجازه می‌دهد شرکت‌ها بدون بازنویسی کل کدها، سخت‌افزار خود را تغییر دهند. تمرکز بر فرمت‌های MX نیز نشان می‌دهد که هدف، اجرای مدل‌های عظیم روی سخت‌افزارهای ارزان و کم‌مصرف است.

گام بعدی شما

  • آخرین نسخه را از PyPI نصب کنید تا افزایش سرعت در عملیات linalg را تست کنید.
  • اگر از سخت‌افزارهای لبه استفاده می‌کنید، فرمت‌های MXFP4 و MXFP8 را برای کاهش حافظه بررسی کنید.
  • منتظر نسخه ۲.۱۳ باشید، جایی که torchcomms برای آموزش توزیع‌شده پیش‌فرض خواهد شد.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این به‌روزرسانی با کاهش وابستگی به یک فروشنده خاص، قدرت چانه‌زنی شرکت‌ها در برابر غول‌های سخت‌افزاری را افزایش می‌دهد. تخصص Meta در لایه‌ی زیرساختی، استقرار مدل‌های عظیم را روی سخت‌افزارهای ارزان‌تر و در دسترس‌تر ممکن می‌کند.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

موضوع‌ها

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.