پرش به محتوای اصلی
پرش به محتوای مقاله

بنچمارک تسلا: V100 در گره‌های ارزان‌قیمت از T40 پیشی گرفت

·۲۲ تیر ۱۴۰۵۹ دقیقه مطالعه
معیارسنجی پردازنده‌های گرافیکی تسلا - esologic
معیارسنجی پردازنده‌های گرافیکی تسلا - esologic
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تأیید عددی برتری V100-16GB در برابر T40 و اثبات مقیاس‌پذیری خطی سخت‌افزارهای نسل ولتا (Volta) در گره‌های ارزان‌قیمت برای کارهای بینایی ماشین و صوت.

تصور کنید با هزینه‌ای کمتر از ۲۰۰ دلار، به حافظه VRAM دسترسی داشته باشید که زمانی مخصوص مراکز دادهٔ غول‌پیکر بود. برای توسعه‌دهندگانی که می‌خواهند بدون پرداخت هزینه‌های کمرشکن ابری، مدل‌های محلی اجرا کنند، سخت‌افزارهای قدیمی اما قدرتمند تنها راه نجات هستند.

طبق گزارشی از وب‌سایت esologic.com که در ۱۳ جولای ۲۰۲۶ منتشر شد، GPUهای بازنشسته‌ی سازمانی انویدیا اکنون یکی از ارزان‌ترین منابع برای دستیابی به حافظهٔ ویدیویی (VRAM) بالا هستند. در واقع، قیمت یک کارت K80 با ۲۴ گیگابایت حافظه به حدود ۶۰ دلار، P100-16GB به ۷۵ دلار و V100-16GB به زیر ۲۰۰ دلار رسیده است. این موضوع باعث شده تا استراتژی «جعبه GPU» — یعنی پر کردن یک شاسی سرور با چندین کارت ارزان و قدیمی — جایگزینی واقعی برای خرید یک GPU مدرن و گران‌قیمت باشد.

این استراتژی بر پایه استفاده از سخت‌افزارهای قدیمی مانند پردازنده‌های Intel E5-2690 و مادربردهای Supermicro X10DRG-Q بنا شده است. برای مثال، تنها با ۴۰ دلار می‌توان ۵۶ رشته (Thread) پردازشی با فرکانس ۳.۵ گیگاهرتز به دست آورد. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی سخت‌افزاری برای مدل‌های محلی اشاره کردیم، بهره‌وری در لایه‌ی سخت‌افزار قدیمی، بیش از هر چیز به مدیریت صحیح جریان داده وابسته است.

اما اجرای این سیستم‌ها بدون چالش نیست. این کارت‌ها دیگر به‌روزرسانی رسمی CUDA یا درایورهای جدید دریافت نمی‌کنند. با این حال، نویسنده مقاله استدلال می‌کند که این محدودیت‌ها با استفاده از داکر (Docker) — که شبیه به یک کپسول ایزوله است و اجازه می‌دهد نرم‌افزار در هر محیطی بدون تغییر اجرا شود — قابل رفع است. ابزارهایی مانند llama.cpp را می‌توان به‌صورت دستی از روی کد منبع ساخت تا روی معماری‌های قدیمی سال ۲۰۱۴ نیز اجرا شوند.

تنها نقطه ضعف جدی، مصرف انرژی است. این کارت‌ها برای هر توکن (Token) — تکه‌های کوچکی از متن که شبیه به برش‌های یک کیک هستند و مدل آن‌ها را می‌خورد — برق بسیار بیشتری مصرف می‌کنند. بنابراین، این سیستم‌ها برای تولیدات ۲۴ ساعته مناسب نیستند، اما برای کاربران خانگی که می‌توانند سیستم را در زمان عدم استفاده خاموش کنند، ایده‌آل‌اند.

برای رسیدن به نتایج دقیق، یک مجموعه‌ی محک (Benchmark) اختصاصی در گیت‌هاب منتشر شد که هر آزمایش را در قالب یک فایل داکر اجرا می‌کند تا سازگاری بین نسل‌های مختلف سخت‌افزار تضمین شود.

فرآیند تست برای شناسایی گلوگاه‌ها به این ترتیب پیش می‌رود:

  • پایه تک‌هسته: ابتدا هر هسته GPU به‌صورت مجزا تست می‌شود.
  • اجرای موازی: کانتینر روی تمامی هسته‌های تمام GPUهای متصل به‌طور هم‌زمان اجرا می‌شود.
  • بومی چند-GPU: اگر ابزار از چند GPU پشتیبانی کند، یک کانتینر با دسترسی کامل به تمام هسته‌ها ساخته می‌شود.

این مجموعه متغیرهای دقیقی را محاسبه می‌کند؛ از جمله theoretical_multi_gpu_sum که مجموع امتیازات تئوری است و forced_multi_gpu_sum که نتیجه واقعی اجرای موازی را نشان می‌دهد. برای مثال، در آموزش مدل ResNet50 با سه کارت P100، مقدار اجرای موازی ۶۱۶.۳ تصویر در ثانیه ثبت شد.

کاربردهای بررسی شده در این پژوهش عبارت بودند از:

  • بینایی ماشین (Computer Vision): آموزش و استنتاج ResNet50 برای طبقه‌بندی تصاویر.
  • ترنسفورمرهای بینایی (Vision Transformers): اندازه‌گیری توان عملیاتی در تحلیل تصاویر و تولید نقشه‌های توجه (Attention Map).
  • مدل‌های زبانی بزرگ (LLM): بررسی سرعت پیش‌پُرکردن (Prefill) و تولید متن در مدل‌های Qwen2.5 1.5B و Llama 3 8B.
  • بازشناسی گفتار: تست مدل Whisper برای تبدیل گفتار به متن.
  • محاسبات علمی و رندرینگ: شبیه‌سازی‌های دینامیک مولکولی F@H، هش SHA-256 و رندرینگ در Blender.
  • زیرساخت: اندازه‌گیری سرعت انتقال داده از حافظه به GPU (gdsio).

نتایج نشان داد که با معرفی معماری Volta، جهش عملکردی عظیمی رخ داد که تمام پیشرفت‌های تدریجی نسل‌های قبل را به حاشیه راند.

مقایسه عملکرد GPUهای تسلا - esologic

نکته حیاتی این است که V100-16GB در تقریباً تمام تست‌ها عملکردی برابر با T40 (که کمیاب‌تر و گران‌تر است) داشت. این یعنی V100 بهینه‌ترین انتخاب از نظر قیمت به عملکرد است.

معیارسنجی پردازنده‌های گرافیکی تسلا - esologic

یافته‌های خاص دیگر:

  • کارت M60 برای تبدیل گفتار به متن در Whisper فوق‌العاده بود و با قیمت ۵۰ دلاری، انتخابی بی‌رقیب است.
  • برای اجرای مدل‌های زبانی، کارت P40 اغلب ترجیح داده می‌شود تا P100.

مقایسه عملکرد GPUهای تسلا - esologic

بررسی مقیاس‌پذیری نشان داد که در کارهایی مثل آموزش ResNet50 و هشینگ، افزایش تعداد کارت‌ها باعث افزایش خطی عملکرد می‌شود.

معیارسنجی پردازنده‌های گرافیکی تسلا - esologic

این یعنی پر کردن یک شاسی 4U با GPUهای قدیمی، باعث اتلاف منابع به دلیل سربار ارتباطی نمی‌شود. البته در مورد LLMها، سرعت تولید متن با افزایش تعداد کارت‌ها ثابت ماند که احتمالاً به دلیل خطای تنظیمات در llama.cpp بود و نه محدودیت سخت‌افزاری.

معیارسنجی پردازنده‌های گرافیکی تسلا - esologic

در تست‌های ترکیبی، اضافه کردن یک V100 قدرتمند به خوشه‌ای از P100ها، باعث کاهش شدید عملکرد V100 در مدل‌های زبانی شد. با این حال، در سایر بنچمارک‌ها، قانون ساده بود: تعداد بیشتر GPU، فارغ از نسل، نتیجه بهتری می‌دهد.

معیارسنجی پردازنده‌های گرافیکی تسلا - esologic

انتخاب CPU نیز تأثیرگذار است. مقایسه‌ی E5-2687W (۱۲ هسته) و E5-1680 (۸ هسته) نشان داد که سرعت تک‌هسته‌ای بیشتر از تعداد هسته‌ها اهمیت دارد. در کارهای پیچیده بینایی و Whisper، هرچه تعداد هسته‌ها بالا می‌رفت و سرعت تک‌هسته‌ای کم می‌شد، عملکرد افت می‌کرد.

مقایسه عملکرد GPUهای تسلا - esologic

بنابراین برای پردازش صدا و توجه‌های پیچیده در بینایی، پردازنده‌ای با هسته‌های کمتر اما سریع‌تر، برنده است. در مورد مادربردها، تفاوت عملکردی چشمگیری بین مدل‌های ورک‌استیشن مشاهده نشد.

معیارسنجی پردازنده‌های گرافیکی تسلا - esologic

نویسنده برای پروژه خود به نام streamarize (که لایواستریم‌های طولانی توئیچ را به ویدیوهای کوتاه یوتیوب تبدیل می‌کند) این ترکیب را پیشنهاد می‌دهد:

  • GPU: سه کارت V100
  • CPU: یک پردازنده E5-1680 (۸ هسته)
  • Motherboard: مدل Asus X99-WS

این رویکرد «باستان‌شناسی دیجیتال» ثابت می‌کند که سیلیکون‌های ۱۰ سال پیش، اگر لایه‌ی نرم‌افزار درست مدیریت شوند، هنوز می‌توانند استنتاج‌های پیچیده ترنسفورمری را به‌بهترین شکل اجرا کنند.

گام بعدی شما

  • اگر به دنبال搭建 یک گره AI ارزان هستید، به جای خرید کارت‌های جدید سری T، روی V100 متمرکز شوید.
  • برای کارهای مربوط به صوت و Whisper، پردازنده‌هایی با فرکانس تک‌هسته‌ای بالاتر (حتی با تعداد هسته کمتر) را انتخاب کنید.
  • از کانتینرهای داکر برای دور زدن محدودیت‌های درایورهای قدیمی استفاده کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مطالعه با تکیه بر تجربه عملی و اعداد واقعی، مسیر کاهش هزینه‌های زیرساخت برای توسعه‌دهندگان مستقل را ترسیم می‌کند. اثبات برتری V100 بر T40 نشان می‌دهد که تخصص در مدیریت نرم‌افزارهای قدیمی می‌تواند جایگزین سرمایه‌گذاری‌های میلیونی در سخت‌افزارهای جدید شود.

تأثیر برای ایران

با توجه به قیمت بالای سخت‌افزارهای جدید و تحریم‌ها، استفاده از GPUهای بازنشسته سازمانی (مانند V100) ارزان‌ترین راه برای تیم‌های AI و دانشجویان ایرانی جهت دستیابی به VRAM بالا است.

·نگاه ما
تحریریه دات‌هوش

این داده‌ها فرضیه «مرگ سخت‌افزارهای قدیمی» را در عصر LLM‌ها به چالش می‌کشد. نکته کلیدی این است که برای استنتاج (Inference)، پهنای باند حافظه و مقدار VRAM اهمیت بیشتری نسبت به آخرین دستورالعمل‌های پردازشی دارند. این یعنی بازار دست‌دوم GPUهای سازمانی می‌تواند تا سال‌ها به عنوان یک «دموکراتیزه‌کننده» محاسبات AI عمل کند و مانعی برای توسعه‌دهندگانی باشد که بودجه خرید H100 ندارند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.