پرش به محتوای اصلی
پرش به محتوای مقاله

استقرار Bare Metal هزینه خروجی داده‌های DeepSeek-V3 را حذف می‌کند

·۱۰ شهریور ۱۴۰۵۷ دقیقه مطالعه۱ بازدید
راهنما
نقشه راه دیپ‌سیک وی۳ روی چند گره GPU: راهنمای اجرای مستقیم روی سخت‌افزار
نقشه راه دیپ‌سیک وی۳ روی چند گره GPU: راهنمای اجرای مستقیم روی سخت‌افزار
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ارائه یک نقشه راه عملی برای حذف کامل هزینه‌های خروجی داده (Egress Fees) در مدل‌های MoE بسیار بزرگ از طریق ترکیب vLLM و سخت‌افزار اختصاصی.

اگر بودجه هوش مصنوعی شرکت شما هر ماه توسط هزینه‌های پنهان ابری بلعیده می‌شود، زمان آن رسیده که از مدل‌های اشتراکی فاصله بگیرید. برای مدل‌های غول‌پیکری مثل DeepSeek-V3، تفاوت بین سودآوری و ورشکستگی در نحوه مدیریت سخت‌افزار نهفته است.

بسیاری از سازمان‌ها برای دسترسی سریع، به سراغ نمونه‌های ابری می‌روند، اما نرخ‌های ساعتی GPU و هزینه‌های خروجی داده (Egress Fees) به‌سرعت هزینه‌ها را غیرقابل‌کنترل می‌کند. برای مدل‌هایی با ۶۷۱ میلیارد پارامتر، انتقال به سرورهای Bare Metal (سخت‌افزار اختصاصی بدون لایه مجازی‌سازی) تنها مسیر اقتصادی برای مقیاس‌پذیری است.

این چرخش در حالی رخ می‌دهد که صنعت به سمت مدل‌های وزن‌های باز (Open Weights) — یعنی مدل‌هایی که «دستور پخت» آن‌ها علناً منتشر شده و نه فقط غذای آماده — حرکت می‌کند تا با سیستم‌های انحصاری رقابت کنند. در حالی که ما پیش‌تر گسترش استراتژیک آزمایشگاه‌هایی مانند OpenAI در منطقه آسیا-پاسیفیک را پوشش دادیم، اکنون گلوگاه اصلی برای اکثر توسعه‌دهندگان دیگر دسترسی به مدل نیست، بلکه هزینه فیزیکی استنتاج (Inference) — یعنی همان لحظه تولید جواب توسط مدل — است. برای مدلی در این ابعاد، «مالیات ابری» به یک مانع عملیاتی اصلی تبدیل می‌شود.

نقشه راه اجرای DeepSeek-V3 روی چند سرور GPU: راهنمای عملیاتی بومی

زیرساخت سخت‌افزاری

به نقل از مستندات فنی منتشر شده در ۱ سپتامبر ۲۰۲۶ توسط eServers، استقرار DeepSeek-V3 در دقت‌های FP8 یا BF16 نیازمند یک پشته سخت‌افزاری سخت‌گیرانه است. پیکربندی پیشنهادی، یک سرور اختصاصی با ۸ عدد واحد پردازش گرافیکی (GPU) انویدیا است که هر کدام ۸۰ گیگابایت حافظه ویدیویی (VRAM) دارند. این استخر عظیم از VRAM برای جای دادن ۶۷۱ میلیارد پارامتر مدل در معماری ترکیب خبره‌ها (Mixture of Experts یا MoE) ضروری است. برای درک دقیق‌تر از نحوه تخمین این منابع، راهنمای محاسبه حافظه VRAM برای مدل‌های محلی دیدگاه جامع‌تری درباره نیازهای سخت‌افزاری سال ۲۰۲۶ ارائه می‌دهد.

ذخیره‌سازی در اینجا یک گلوگاه حیاتی برای بارگذاری وزن‌های مدل در این ابعاد است. راهنمای فنی صراحتاً استفاده از SSDهای NVMe با استاندارد PCIe Gen 4 یا ۵ را برای تضمین بارگذاری مدل در حافظه بدون تأخیرهای بیش از حد توصیه می‌کند. ذخیره‌سازهای کند می‌توانند منجر به زمان‌های بوت طولانی و جابجایی ناکارآمد مدل (Model Swapping) شوند.

محیط نرم‌افزاری برای تضمین پایداری سیستم بر این پشته استوار است:

  • سیستم‌عامل: Ubuntu 24.04 LTS
  • درایورها: CUDA 12.x
  • کانتینرسازی: Docker و NVIDIA Container Toolkit

حل مشکل گرسنگی GPU

وقتی یک مدل بین چندین کارت گرافیک تقسیم می‌شود، سرعت ارتباط همه چیز است. اگر GPUها نتوانند با سرعت کافی با یکدیگر ارتباط برقرار کنند، سیستم دچار «گرسنگی GPU» (GPU Starvation) می‌شود؛ وضعیتی که در آن تراشه‌های قدرتمند در حالی که منتظر دریافت داده‌ها هستند، بیکار می‌مانند. این تأخیر می‌تواند توان عملیاتی (Throughput) یک نقطه انتهایی (Endpoint) هوش مصنوعی سازمانی را به‌طور کامل فلج کند.

بر اساس مستندات، برای جلوگیری از این اتفاق باید کتابخانه ارتباطات جمعی انویدیا (NCCL) بهینه شود. این کتابخانه ستون فقرات ارتباطات چند-GPU است. مدیران سیستم می‌توانند با اجرای دستور nvidia-smi topo -m توپولوژی سخت‌افزاری را بررسی کنند.

در ماتریس خروجی، شما باید به دنبال نشانگرهای "NV" (مربوط به NVLink) یا "PIX" (مربوط به پل PCIe) بگردید. این نشانه‌ها تأیید می‌کنند که GPUها مستقیماً با هم ارتباط دارند و برای حفظ سرعت بالای انتقال داده، CPU را دور می‌زنند. اگر توپولوژی بهینه نباشد، سیستم در طول محاسبات سنگین ماتریسی مورد نیاز برای استنتاج، دچار افت عملکرد شدید خواهد شد.

موتور استنتاج vLLM

برای سرویس‌دهی به مدل، از vLLM استفاده می‌شود که موتوری طراحی شده برای استنتاج با توان عملیاتی بالا است. سازوکار اصلی در اینجا موازی‌سازی تنسور (Tensor Parallelism یا TP) است که محاسبات سنگین ماتریسی معماری Mixture-of-Experts را به‌طور هم‌زمان بین تمام GPUهای موجود تقسیم می‌کند.

استقرار از طریق Docker Compose انجام می‌شود تا یکسانی محیط در گره‌های مختلف تضمین شود. این پیکربندی نیازمند یک فایل docker-compose.yml خاص است که تمام دستگاه‌های انویدیا را رزرو کرده و حافظه کش Hugging Face را به ماشین میزبان متصل (Map) می‌کند تا از دانلودهای تکراری و بیهوده جلوگیری شود. در محیط‌های با ترافیک بالا، مدیریت صف درخواست‌ها برای جلوگیری از اشباع حافظه حیاتی است؛ در همین راستا، استفاده از BullMQ و Redis راهکاری مؤثر برای کنترل بارهای سنگین و جلوگیری از تخلیه VRAM است.

جزئیات فنی استقرار

فایل docker-compose.yml باید با مشخصات زیر تنظیم شود:

  • Image: vllm/vllm-openai:latest
  • Container Name: deepseek-v3-server
  • Runtime: nvidia
  • Ports: 8000:8000
  • Volumes: ~/.cache/huggingface:/root/.cache/huggingface

پارامترهای کلیدی در دستور vLLM عبارت‌اند از:

  • --tensor-parallel-size 8: این دستور مدل را مجبور می‌کند به‌طور مساوی بین ۸ پردازنده گرافیکی تقسیم شود تا ۶۷۱ میلیارد پارامتر توزیع گردند.
  • --max-model-len 8192: تعیین پنجره زمینه (Context Window) بر اساس VRAM موجود.
  • --trust-remote-code: برای بارگذاری معماری خاص و اختصاصی DeepSeek-V3 ضروری است.
  • --enforce-eager: برای مدیریت پیش‌بینی‌پذیرتر تخصیص حافظه و اجتناب از برخی سربارهای CUDA graph استفاده می‌شود.

پس از ایجاد فایل، مدل با اجرای دستور docker-compose up -d در ترمینال اجرا می‌شود.

نظارت در محیط تولید

استنتاج با توان بالا روی ۸ پردازنده گرافیکی، گرمای شدید و مصرف برق بسیار زیادی ایجاد می‌کند. راهنمای فنی هشدار می‌دهد که محیط‌های تولید نمی‌توانند تنها به لاگ‌های ساده تکیه کنند، زیرا کاهش سرعت ناشی از گرمای بیش از حد (Thermal Throttling) می‌تواند به‌طور خاموش و بدون هشدار، عملکرد را تخریب کند.

استفاده از یک پشته نظارتی حرفه‌ای متشکل از Prometheus و Grafana توصیه می‌شود. با ادغام DCGM-Exporter (مدیریت GPU مرکز داده)، تیم‌ها می‌توانند این معیارها را به‌صورت لحظه‌ای رصد کنند:

  • مصرف VRAM: برای اطمینان از اینکه مدل با خطاهای Out-of-Memory (OOM) مواجه نمی‌شود.
  • مصرف توان: نظارت بر میزان جریان برق در کل آرایه چند-GPU.
  • محدودیت‌های حرارتی: جلوگیری از خرابی سخت‌افزار یا کاهش خودکار فرکانس ساعت (Clock-speed) به دلیل گرم شدن بیش از حد.

مزیت سخت‌افزار اختصاصی

انتخاب Bare Metal به‌جای ابرهای عمومی (Hyperscalers)، منابع ۱۰۰٪ اختصاصی و تک-مستأجری را فراهم می‌کند. این کار اثر «همسایه پرسرصدا» را حذف می‌کند؛ وضعیتی که در آن کاربران دیگر ابر، پهنای باند مسیر PCIe یا سیکل‌های CPU شما را تحت تأثیر قرار می‌دهند.

برای کسب‌وکارها، این یعنی جایگزینی صورت‌حساب‌های ساعتی نوسانی با یک نرخ ماهانه ثابت و پیش‌بینی‌پذیر. برای مثال، در یک مرکز داده در لندن، این ساختار پهنای باند ۱۰ گیگابیت بر ثانیه بدون محدودیت (Unmetered) فراهم می‌کند. این موضوع برای دانلود وزن‌های عظیم مدل و پردازش میلیون‌ها درخواست API بدون پرداخت «مالیات ابری» در قالب هزینه‌های خروجی (Egress Fees) حیاتی است.

علاوه بر این، زیرساخت اختصاصی قابلیت اطمینان بالاتری دارد. برای نمونه، eServers زمان پاسخگویی سخت‌افزاری ۱۵ تا ۳۰ دقیقه‌ای را تضمین می‌کند تا APIهای حیاتی هوش مصنوعی با کمترین زمان توقف فعال بمانند.

این تغییر، پیش‌فرض‌های صنعت درباره دسترسی به مدل‌های بالای ۶۰۰ میلیارد پارامتر را عوض می‌کند. ثابت می‌شود که مانع ورود دیگر پیچیدگی مدل نیست، بلکه کارایی ارکستراسیون سخت‌افزاری است.

با نزدیک کردن محاسبات به سخت‌افزار (Metal)، توسعه‌دهندگان کنترل کامل زیرساخت خود را بدون تخلیه مالی توسط هزینه‌های خروجی ابر به دست می‌گیرند. این امر عملاً توانایی میزبانی مدل‌های پیشرفته MoE را دموکراتیزه می‌کند و به آژانس‌های هوش مصنوعی و پژوهشگران اجازه می‌دهد بدون محدودیت‌های بودجه ابری مقیاس بگیرند.

گام بعدی شما

  • توپولوژی GPUهای خود را با دستور nvidia-smi topo -m بررسی کنید تا از پشتیبانی NVLink مطمئن شوید.
  • برای کاهش تأخیر بارگذاری، درایوهای NVMe Gen 4 یا ۵ را جایگزین ذخیره‌سازهای قدیمی کنید.
  • پشته نظارتی Prometheus را برای رصد دمای GPUها مستقر کنید تا از افت عملکرد ناگهانی جلوگیری شود.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد با حذف هزینه‌های متغیر ابری، استقرار مدل‌های Frontier را برای شرکت‌های متوسط اقتصادی می‌کند. تکیه بر تخصص در ارکستراسیون سخت‌افزاری جایگزین تکیه بر APIهای بسته می‌شود.

تأثیر برای ایران

به‌دلیل هزینه‌های بالای ارزی و محدودیت‌های پرداخت در ابرهای جهانی، استقرار مدل‌های وزن‌باز روی سخت‌افزارهای اختصاصی داخلی، تنها راه عملی برای سازمان‌های ایرانی جهت داشتن مدل‌های سطح اول است.

·نگاه ما
تحریریه دات‌هوش

انتقال از مدل‌های Pay-as-you-go به Bare Metal نشان می‌دهد که در مقیاس‌های صنعتی، بهینه‌سازی سخت‌افزاری بر بهینه‌سازی مدل اولویت می‌یابد. این رویکرد عملاً مدل‌های غول‌پیکر را از حالت «سرویس‌های ابری گران‌قیمت» به «دارایی‌های زیرساختی» تبدیل می‌کند. در واقع، برنده نهایی این رقابت کسی نیست که مدل بزرگ‌تری دارد، بلکه کسی است که ارزان‌ترین هزینه استنتاج را برای هر توکن فراهم می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.