پرش به محتوای اصلی
پرش به محتوای مقاله

مدیریت GPU در کوبرنتیز؛ از شناسایی سخت‌افزار تا تخصیص پویا

·۲۲ مرداد ۱۴۰۵۲ دقیقه مطالعه
راهنما
روز ۱۸: ۱۰۰ روز GenAI برای DevOps: Kubernetes و GPUها
روز ۱۸: ۱۰۰ روز GenAI برای DevOps: Kubernetes و GPUها
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تمرکز بر قابلیت DRA در کوبرنتیز ۱.۳۶؛ تغییر پارادایم از درخواست تعداد GPU به توصیف دقیق نیازهای سخت‌افزاری برای بارهای کاری هوش مصنوعی زاینده.

اگر یک مهندس پلتفرم هستید و می‌خواهید مدل‌های زبانی بزرگ را در مقیاس صنعتی مستقر کنید، باید بدانید که درخواست GPU در کوبرنتیز هرگز به سادگیِ درخواست CPU یا حافظه نیست. طبق گزارش منتشر شده در ۱۳ اوت ۲۰۲۶ از سوی ideaweaver.ai، انتقال یک مدل از سخت‌افزار فیزیکی به یک کانتینر فعال، نیازمند یک خط لوله (Pipeline) دقیق و چندمرحله‌ای است.

برای متخصصان DevOps، واحد پردازش گرافیکی (GPU) دیگر یک شتاب‌دهنده جانبی نیست، بلکه زیرساختی حیاتی است. این سیستم را شبیه به یک شبکه برق تخصصی تصور کنید؛ شما نمی‌توانید یک دستگاه پرولتاژ را بدون ترانسفورماتورها و فیوزهای مناسب به برق بزنید، چون کل سیستم سقوط می‌کند.

روز ۱۸: ۱۰۰ روز GenAI برای DevOps: Kubernetes و GPUها

بر اساس مستندات فنی، فرآیند استقرار از یک توcatenin سخت‌گیرانه پیروی می‌کند: GPU فیزیکی ← شناسایی ← نمایش ← زمان‌بندی ← تخصیص ← اجرا ← نظارت. این پشته (Stack) به چندین جزء کلیدی متکی است:

پشته شناسایی و تخصیص

  • Node Feature Discovery (NFD) و GPU Feature Discovery (GFD): این ابزارها سخت‌افزار و ویژگی‌های خاص انویدیا مثل معماری و میزان حافظه را شناسایی می‌کنند.
  • NVIDIA Device Plugin: این افزونه، GPUها را به عنوان منابع قابل درخواست برای بارهای کاری نمایش می‌دهد.
  • NVIDIA GPU Operator: کل پشته نرم‌افزاری، از جمله درایورها و مدیریت MIG را خودکار می‌کند.
  • تخصیص منابع پویا (Dynamic Resource Allocation یا DRA): این قابلیت که در نسخه ۱.۳۶ کوبرنتیز تکامل یافت، به بارهای کاری اجازه می‌دهد نیازهای دقیق سخت‌افزاری خود را توصیف کنند، به جای اینکه صرفاً تعداد کلی GPU را درخواست کنند.

همان‌طور که در تحلیل‌های قبلی ما درباره بهینه‌سازی مراکز داده اشاره کردیم، مدیریت بهینه سخت‌افزار، کلید کاهش هزینه‌های استنتاج است. این بهینه‌سازی در لایه‌ی زیرساختی، مکمل پیشرفت‌های نرم‌افزاری است؛ برای مثال، مدل‌هایی مانند GPT-5.6 Sol با کاهش چشمگیر مصرف توکن‌ها فشار روی منابع پردازشی را کاهش داده‌اند. برای محافظت از سخت‌افزارهای گران‌قیمت، مهندسان از nodeSelector و Node Affinity استفاده می‌کنند. همچنین برای افزایش بهره‌وری، روش Time Slicing در برابر GPU چند-نمونه‌ای (Multi-Instance GPU یا MIG) برای اشتراک منابع مقایسه می‌شود. نظارت بر سلامت سیستم نیز از طریق زنجیره‌ای از DCGM Exporter، Prometheus و Grafana برای رصد دما و توان مصرفی انجام می‌گیرد.

این چرخش به سمت DRA و اپراتورهای خودکار به این معناست که صنعت در حال فاصله گرفتن از تخصیص‌های ایستا است. برای شما به عنوان کاربر، این یعنی کاهش ریسک «به حاشیه راندن منابع»؛ وضعیتی که در آن GPUهای گران‌قیمت به دلیل ناتوانی زمان‌بند در تطبیق آن‌ها با بار کاری مناسب، بدون استفاده می‌مانند. این زیرساخت‌های منعطف، استقرار مدل‌های تخصصی را تسهیل می‌کنند، مشابه آنچه در قابلیت‌های جدید مدل GLM-5.2 برای توسعه‌دهندگان مشاهده می‌کنیم که نیازمند محیط‌های اجرایی بهینه هستند.

گام بعدی شما

  • بررسی کنید که آیا خوشه‌های فعلی شما از کوبرنتیز ۱.۳۶ پشتیبانی می‌کنند یا خیر.
  • ارزیابی کنید که آیا بارهای کاری شما به جای تعداد GPU، به ویژگی‌های خاص سخت‌افزاری (از طریق DRA) نیاز دارند.
  • پیاده‌سازی خط لوله نظارتی DCGM برای جلوگیری از تخریب سخت‌افزار در اثر گرمای بیش از حد.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این معماری با تکیه بر تخصص مهندسی پلتفرم، از اتلاف منابع مالی در مراکز داده جلوگیری می‌کند. استفاده از DRA باعث می‌شود بهره‌وری سخت‌افزارهای گران‌قیمت به حداکثر برسد و زمان استقرار مدل‌ها کاهش یابد.

تأثیر برای ایران

برای تیم‌های DevOps ایرانی که از خوشه‌های On-premises استفاده می‌کنند، به‌روزرسانی به نسخه ۱.۳۶ کوبرنتیز تنها راه بهینه‌سازی مصرف GPUهای محدود و گران‌قیمت است.

·نگاه ما
تحریریه دات‌هوش

انتقال به DRA نشان می‌دهد که مدل‌های زبانی بزرگ دیگر نمی‌توانند به عنوان بارهای کاری عمومی دیده شوند. این تغییر معماری، مدیریت سخت‌افزار را از حالت «تخصیص ظرفیت» به «تخصیص قابلیت» تغییر می‌دهد و در واقع لایه‌ی انتزاعی کوبرنتیز را با واقعیت‌های فیزیکی سخت‌افزارهای AI هم‌راستا می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.