پرش به محتوای اصلی
پرش به محتوای مقاله

NVLink در برابر PCIe؛ برتری پهنای باند در سخت‌افزارهای دو کارت گرافیک

·۳۱ تیر ۱۴۰۵۷ دقیقه مطالعه۲ بازدید
بررسی کارایی NVLink در یادگیری عمیق: آیا ارزش هزینه دارد؟
بررسی کارایی NVLink در یادگیری عمیق: آیا ارزش هزینه دارد؟
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کشف اینکه پچ‌های نرم‌افزاری P2P می‌توانند تا ۹۰٪ شکاف سرعت NVLink را در حالت x16 پر کنند، اما در سخت‌افزارهای خانگی با پهنای باند محدود (x8/x4)، همچنان هیچ جایگزین نرم‌افزاری برای پل فیزیکی NVLink وجود ندارد.

اگر با دو کارت گرافیک RTX 3090 در خانه مدل‌های زبانی آموزش می‌دهید، احتمالاً بخش زیادی از قدرت سخت‌افزارتان را به دلیل محدودیت‌های مسیر انتقال داده از دست می‌دهید. طبق یافته‌های منتشرشده در ۲۲ جولای ۲۰۲۶ توسط platform-fools.com، استفاده از یک پل NVLink می‌تواند سرعت آموزش در متد FSDP را تا نزدیک به ۳ برابر افزایش دهد. این یافته‌ها یک گلوگاه سخت‌افزاری حیاتی را برای علاقه‌مندان به هوش مصنوعی محلی برجسته می‌کند.

انویدیا دیگر از NVLink در پردازنده‌های گرافیکی مصرف‌کننده پشتیبانی نمی‌کند و RTX 3090 آخرین کارت گرافیک مصرفی بود که این قابلیت را داشت. در نتیجه، پل‌های NVLink اکنون به اقلام قدیمی و گران‌قیمتی تبدیل شده‌اند که بسته به اندازه و در دسترس بودن در بازار خرده‌فروشی، قیمتی بین ۲۰۰ تا ۴۰۰ دلار دارند.

bسیاری از کاربران خانگی از مادربوردهایی استفاده می‌کنند که تعداد خطوط PCIe آن‌ها بسیار کمتر از سرورها است. در این شرایط، حتی مادربوردهای گران‌قیمتی مثل MSI MEG X870E GODLIKE X EDITION با قیمت ۱,۳۰۰ دلار یا Gigabyte Z890 AORUS XTREME AI TOP که قیمتی بین ۱,۰۰۰ تا ۱,۸۰۰ دلار دارند و برای هوش مصنوعی بازاریابی می‌شوند، اغلب دو کارت گرافیک را در حالت تقسیم پهنای باند x8/x8 قرار می‌دهند. این محدودیت فیزیکی یک گلوگاه ارتباطی ایجاد می‌کند که نرم‌افزار به تنهایی نمی‌تواند آن را حل کند.

تصور کنید دو کارمند سریع دارید که برای رد و بدل کردن مدارک باید از یک راهروی بسیار باریک عبور کنند؛ هر چقدر هم آن‌ها سریع باشند، سرعت نهایی پروژه به عرض آن راهرو (یعنی باس PCIe) بستگی دارد. NVLink شبیه به یک درِ داخلی و سریع بین دو اتاق است که راهرو را کاملاً دور می‌زند و اجازه می‌دهد داده‌ها بدون واسطه و مستقیم جابه‌جا شوند. همان‌طور که در تحلیل‌های قبلی ما درباره امنیت مدل‌های بازمتن اشاره کردیم، بهینه‌سازی لایه‌ی سخت‌افزاری همواره پیش‌نیاز دستیابی به حداکثر کارایی در مقیاس محلی است.

محیط آزمایش و سخت‌افزار

برای اندازه‌گیری دقیق این اثرات و جداسازی متغیر NVLink از محدودیت‌های PCIe، آزمایش‌ها روی یک زیرساخت سروری سطح بالا انجام شد تا بتوان اثرات هر متغیر را به صورت مجزا بررسی کرد:

  • پردازنده: AMD Epyc 7532 (۳۲ هسته، ۱۲۸ خط PCIe)
  • مادربورد: Supermicro H12SSL-i با ۵ اسلات PCIe 4.0 x16
  • رم: مجموعاً ۲۵۶ گیگابایت (۸ کاناله، ۳۲ گیگابایت DDR4-3200)
  • کارت گرافیک: دو عدد EVGA RTX 3090، نصب شده در اسلات‌های ۳ و ۶، که هر دو با پهنای باند کامل x16 اجرا می‌شدند
  • سیستم‌عامل: اوبونتو ۲۴.۰۴ با درایور ۵۹۵ انویدیا

تحلیل شکاف عملکرد

بر اساس مستندات این آزمایش که روی مدل‌های Llama 3.3 70B و Gemma 4 31B اجرا شده، مشخص شد که همه حجم‌های کاری هوش مصنوعی به طور یکسان از NVLink بهره نمی‌برند. تأثیر این تکنولوژی به شدت به نحوه توزیع مدل روی GPUها بستگی دارد:

  • استنتاج با تقسیم لایه‌ای (Layer Split Inference): عملکرد در این حالت تأثیری نداشت. این تست‌ها شامل ارتباطات بسیار کمی بین دو GPU هستند و پهنای باند PCIe برای این مقدار داده کاملاً کافی است.
  • استنتاج موازی تانسور (Tensor Parallel Inference): این روش نیازمند همگام‌سازی در هر لایه است. NVLink سرعت پردازش پرامپت (Prompt Processing) را تقریباً ۳۰٪ افزایش داد. به طور غافلگیرکننده‌ای، سرعت تولید توکن (Token Generation) کاملاً یکسان باقی ماند؛ هرچند این معیار معمولاً در تیتر اخبار قرار می‌گیرد، اما برای عوامل کدنویسی که از پنجره‌های زمینه (Context Windows) طولانی استفاده می‌کنند، کمتر حیاتی است.
  • آموزش DDP: در آموزش مدل TinyLlama 1.1B با متد Distributed Data Parallel، بهبود چشم‌گیری دیده نشد. به این دلیل که DDP تنها یک‌بار در هر گام برای محاسبه گرادیان‌ها همگام‌سازی می‌کند و در نتیجه پهنای باند گلوگاه نیست.
  • آموزش FSDP: برای مدل Qwen2.5 3B، آموزش با متد کاملاً تکه‌تکه شده‌ی موازی داده (FSDP) — که به دلیل نیاز به انتقال دائمی داده‌ها بین کارت‌ها است — جهشی نزدیک به ۳ برابری در سرعت داشت.

دو پردازنده گرافیکی با اتصال NVLink در کنار هم

تلهٔ SHM و محدودیت‌های درایور

یکی از کلیدی‌ترین یافته‌ها، نحوه محدود کردن سخت‌افزارهای مصرفی توسط Nvidia است. به طور پیش‌فرض، انویدیا ارتباط نظیر-به-نظیر (P2P) روی PCIe را در کارت‌های گرافیک خانگی مسدود کرده است. این یک محدودیت مصنوعی در سطح درایور است که هدف آن جداسازی محصولات (Product Segmentation) و سوق دادن کاربران به سمت کارت‌های سروری گران‌قیمت است.

وقتی P2P غیرفعال است، سیستم به اجبار به حافظه مشترک میزبان (SHM) رجوع می‌کند. این یعنی داده‌ها باید یک مسیر کامل را تا رم سیستم طی کرده و سپس بازگردند که جریمه عملکردی سنگینی را تحمیل می‌کند. در طول آزمایش، لاگ‌های سیستم عبارت NCCL INFO Channel 03 : 0[0] -> 1[1] via SHM/direct/direct را نشان دادند که تأیید می‌کرد ترافیک از این مسیر کند عبور می‌کند.

نکته بسیار مهم این است که غیرفعال کردن NVLink از طریق نرم‌افزار (مثلاً با استفاده از دستور NCCL_P2P_DISABLE=1) برای مجبور کردن سیستم به استفاده از P2P غیرممکن است. تنظیم این پرچم (Flag) هم NVLink و هم P2P روی PCIe را غیرفعال کرده و تمام ترافیک را به SHM می‌راند. برای به‌دست آوردن یک خط مبنای واقعی از P2P، پل NVLink باید به صورت فیزیکی از روی کارت‌ها جدا شود.

بررسی کارایی NVLink در یادگیری عمیق: آیا ارزش هزینه دارد؟

دور زدن گلوگاه

برای کاربران لینوکس یک راهکار نرم‌افزاری وجود دارد: پچ open-gpu-kernel-modules. این پچ شخص ثالث با دور زدن محدودیت‌های درایوری انویدیا، ارتباط P2P را فعال می‌کند.

پس از نصب این پچ، لاگ‌های NCCL تغییر را تأیید می‌کنند: NCCL INFO Channel 00/0 : 1[1] -> 0[0] via P2P/direct pointer. وقتی P2P از طریق این پچ فعال شود، شکاف عملکرد به طور قابل توجهی بسته می‌شود. سرعت پردازش پرامپت تقریباً با NVLink برابر شده و آموزش FSDP به بیش از ۹۰٪ سرعت NVLink می‌رسد — البته به شرطی که سیستم پهنای باند کامل x16 را برای هر کارت فراهم کند.

واقعیت سخت‌افزارهای خانگی

در حالی که برای کاربرانی که از پلتفرم‌های سروری مانند AMD Epyc 7532 استفاده می‌کنند NVLink اغلب غیرضروری است (زیرا هر GPU پهنای باند کامل x16 دریافت می‌کند)، کاربر متوسط خانگی توسط CPUهای مصرفی با خطوط PCIe کمتر محدود شده است. حتی یک مادربورد اقتصادی مانند Asus ProArt B650 Creator (حدود ۲۳۰ دلار) همان محدودیت مادربورد ۱۳۰۰ دلاری Godlike را دارد: پشتیبانی از x16 یا تقسیم x8/x8.

برای شبیه‌سازی این شرایط، اسلات‌های PCIe به x8 و x4 محدود شدند. نتایج نشان داد که اگرچه پچ P2P کمک می‌کند، اما در نهایت به یک دیوار سخت‌افزاری برخورد می‌کند:

  • استنتاج موازی تانسور: در حالت P2P، با کاهش پهنای باند به x8 افت ۵ درصدی و در حالت x4 افت ۱۵ درصدی مشاهده شد. در مقابل، NVLink بدون توجه به سرعت اسلات، عملکرد ثابتی داشت.
  • آموزش FSDP: در حالت x8/x8، NVLink حدود ۵۰٪ سریع‌تر از P2P بود و زمانی که GPUها به پهنای باند x4 محدود شدند، سرعت آموزش را ۲ برابر کرد.

این اتفاق به این دلیل می‌افتد که تست p2pBandwidthLatencyTest نشان می‌دهد NVLink یک پهنای باند ثابت ۱۰۰ گیگابایت بر ثانیه را فراهم می‌کند، در حالی که عملکرد P2P به صورت خطی با تعداد خطوط PCIe کاهش می‌یابد.

نکته جالب این است که نتایج SHM به شدت افت نکردند و در حالت x4 تنها ۵٪ جریمه سرعت داشتند. این امر نشان می‌دهد که گلوگاه در SHM تعداد خطوط PCIe نیست، بلکه مسیر دسترسی به حافظه اصلی (Main Memory) است.

بررسی کارایی NVLink در پردازش موازی GPU

تحلیل نهایی ارزش خرید

پل‌های NVLink در حال حاضر بین ۲۰۰ تا ۴۰۰ دلار قیمت دارند. برای اکثر کاربران، این هزینه برای یک مزیت خاص (Niche) بسیار زیاد است. اما این سرمایه‌گذاری در صورتی منطقی است که هر سه معیار زیر را داشته باشید:

۱. از لینوکس استفاده نمی‌کنید یا تمایلی به نصب پچ‌های غیررسمی و شخص ثالث برای درایور P2P ندارید.
۲. از پلتفرم مصرفی استفاده می‌کنید که در آن چندین GPU باعث کاهش خطوط PCIe به x8/x8 یا کمتر می‌شوند.
۳. حجم کاری شما دقیقاً آموزش FSDP یا پردازش سنگین پرامپت در حالت موازی تانسور است.

این تغییر رویکرد نشان می‌دهد که برای توسعه سطح بالای هوش مصنوعی محلی، کاربر باید بین پرداخت ۳۰۰ دلار برای یک پل سخت‌افزاری یا سرمایه‌گذاری روی یک پلتفرم کامل ورک‌استیشن مانند Threadripper یا Xeon برای دستیابی به خطوط x16 بومی تصمیم بگیرد. کسانی که مشکل خطوط PCIe را نادیده می‌گیرند، در واقع هزینه سخت‌افزاری را پرداخت می‌کنند که نمی‌توانند به طور کامل از آن بهره‌برداری کنند. در کنار این بهینه‌سازی‌های سخت‌افزاری، مدیریت هزینه‌های عملیاتی نیز اهمیت دارد؛ برای example، استفاده از سیستم‌های مسیریابی لایه‌ای می‌تواند به سازمان‌ها کمک کند تا بدون کاهش کیفیت، هزینه‌های APIهای هوش مصنوعی را بهینه‌تر کنند.

گام بعدی شما

  • اگر از دو کارت RTX 3090 استفاده می‌کنید، ابتدا وضعیت پهنای باند اسلات‌های خود را چک کنید تا مطمئن شوید در حالت x8/x8 نیستید.
  • کاربران لینوکس پیش از خرید سخت‌افزار گران‌قیمت، پچ open-gpu-kernel-modules را برای تست فعال‌سازی P2P امتحان کنند.
  • در استقرار مدل‌های بزرگ، متد آموزش خود را بررسی کنید؛ اگر از FSDP استفاده نمی‌کنید، شاید NVLink هزینه اضافی باشد.

اما تأثیر این گلوگاه‌ها بر مدل‌های کوچک‌تر و بهینه‌سازی‌های کوانتش حتی پیچیده‌تر است — در تحلیل ما درباره اثرات Quantization بر سرعت استنتاج بخوانید.

چرا این موضوع مهم است؟

این یافته‌ها بر اساس تجربه عملی نشان می‌دهد که محدودیت‌های نرم‌افزاری انویدیا، عملکرد سخت‌افزارهای مصرفی را به‌طور مصنوعی کاهش می‌دهد. برای متخصصان آموزش مدل، این یعنی تفاوت بین یک پروژه که در یک هفته تمام می‌شود یا سه هفته.

تأثیر برای ایران

به‌دلیل قیمت بالای پل‌های NVLink و نبود دسترسی به مدل‌های Workstation پیشرفته، توسعه‌دهندگان ایرانی در محیط‌های خانگی باید حتماً از پچ‌های لینوکسی برای فعال‌سازی P2P استفاده کنند تا از اتلاف منابع سخت‌افزاری گران‌قیمت جلوگیری شود.

·نگاه ما
تحریریه دات‌هوش

سرمایه‌گذاری روی سخت‌افزارهای قدیمی مثل NVLink برای RTX 3090، نشان می‌دهد که در دنیای AI، پهنای باند انتقال داده (Interconnect) اغلب از قدرت خام پردازش (Compute) مهم‌تر است. این موضوع فرضیه «افزایش تعداد GPU برابر با افزایش خطی سرعت» را در سیستم‌های خانگی رد می‌کند. استراتژی درست برای توسعه‌دهندگان محلی، یا پذیرش محدودیت‌های سخت‌افزاری است یا انتقال کامل به معماری‌های Workstation که در آن پهنای باند به عنوان یک کالای لوکس تعریف نشده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.