پرش به محتوای اصلی
پرش به محتوای مقاله

سخت‌افزار خانگی در برابر H100؛ کاهش نیاز به خوشه‌های سازمانی

·۱۳ مهر ۱۴۰۵۶ دقیقه مطالعه
یک کارت گرافیک RTX 4090، ۱۰۰ تریلیون توکن در ثانیه – آینده هوش مصنوعی روی میز کار شماست!
یک کارت گرافیک RTX 4090، ۱۰۰ تریلیون توکن در ثانیه – آینده هوش مصنوعی روی میز کار شماست!
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

دستیابی به توان عملیاتی ۱۰۰ تریلیون توکن در ثانیه روی یک GPU تک‌هسته مصرف‌کننده؛ این اولین بار است که چنین سرعتی برای مدل‌های ۱۲۵ میلیارد پارامتری بدون نیاز به خوشه سرور ثبت شده است.

تصور کنید تمام قدرت پردازشی یک خوشه سرور سازمانی را در یک کارت گرافیک زیر میز کارتان داشته باشید. این دیگر یک رویای مهندسی نیست، بلکه واقعیت جدید استنتاج محلی است.

طبق یک مطالعه موردی فنی در اکتبر ۲۰۲۶، یک کارت NVIDIA RTX 4090 توانست در اجرای مدل ۱۲۵ میلیارد پارامتری به توان عملیاتی ۱۰۰ تریلیون توکن در ثانیه (T/s) برسد. این عدد که پیش‌تر تنها در اختیار خوشه‌های چندگره H100 بود، اکنون روی سخت‌افزار مصرف‌کننده ثبت شده است. همان‌طور که در گزارش تحلیلگران ارشد Lead-Tech در اکتبر ۲۰۲۶ اشاره شده، این عملکرد مرز میان سخت‌افزارهای مصرف‌کننده و سازمانی را کمرنگ می‌کند. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، انتقال قدرت پردازش از ابر به محیط محلی، بازی را برای توسعه‌دهندگان تغییر می‌دهد.

برای سال‌ها، تفاوت میان GPUهای خانگی و سخت‌افزارهای سازمانی در میزان حافظه VRAM و توان عملیاتی خام بود. در حالی که گیمرها از ۴۰۹۰ برای ردیابی پرتو (Ray-tracing) در کیفیت 4K یا ایجاد فریم‌های ارتقایافته با هوش مصنوعی در نرخ ۱۲۰ هرتز استفاده می‌کردند، پژوهشگران برای مدل‌های بنیادی به ردیف‌های A100 متکی بودند. اما این جهش نشان می‌دهد شکاف سخت‌افزاری نه با تراشه‌های جدید، بلکه با بهینه‌سازی تهاجمی نرم‌افزاری بسته شده است. این رویکرد بهینه‌سازی یادآور پژوهش CetinLM است که توانست آموزش ۲ میلیارد توکن را تنها با یک پردازنده ۱۶ گیگابایتی ممکن سازد. رمز این موفقیت در ترکیبی از هسته‌های GEMM کم‌رتبه FP8، کوانتش ۴ بیتی، رمزگشایی گمانه‌زنانه و فشرده‌سازی تهاجمی KV-cache نهفته است.

با تکیه بر پوشش‌های قبلی ما در مورد اینکه چگونه عوامل هوش مصنوعی (AI Agents) در حال شکل دادن به بازارهای پیش‌بینی هستند، توانایی اجرای مدل‌های عظیم به صورت محلی به این عوامل اجازه می‌دهد تا با تأخیر نزدیک به صفر و حریم خصوصی کامل فعالیت کنند. این تحول در راستای استراتژی‌های جدید سخت‌افزاری است، مشابه آنچه در عرضه نسخه ۶۴ گیگابایتی انویدیا برای پشتیبانی از عامل‌های همیشه‌فعال مشاهده کردیم. وقتی استنتاج از ابر به دسکتاپ منتقل می‌شود، هزینه تکرار گردش‌های کاری پیچیده در مدل‌های عامل‌محور تقریباً به صفر می‌رسد.

زیرساخت فنی

این جهش عملکردی بر پایه مدل Qwen 3.8 Flash Next استوار است؛ یک مدل ۱۲۵ میلیارد پارامتری که از طریق یک پشته نرم‌افزاری خاص بهینه شده است. اولین ستون این موفقیت، خط لوله SmoothQuant-V2 است که در جولای ۲۰۲۶ منتشر شد. این فرآیند — که شبیه به فشرده‌سازی یک فایل حجیم برای جا شدن در فلش مموری بدون از دست دادن محتوای اصلی است — تمام ماتریس‌های وزن را به اعداد صحیح ۴ بیتی تبدیل می‌کند، ضرایب مقیاس‌بندی را برای هر بلوک ذخیره می‌کند و لایه‌های نرمال‌سازی (Layer-norm) را در تنسورهای کوانتیده ادغام می‌کند. در نتیجه، حجم مدل از حدود ۲۵۰ گیگابایت (در حالت FP16) به تقریباً ۱۹ گیگابایت پس از فشرده‌سازی KV-cache کاهش می‌یابد.

برای افزایش سرعت، سیستم از رمزگشایی گمانه‌زنانه (Speculative Decoding) استفاده می‌کند. در این روش، یک مدل «پیش‌نویس» (Drafter) سبک‌وزن با ۰.۵ میلیارد پارامتر، توکن‌های بعدی را با دقت حدود ۷۰٪ پیش‌بینی می‌کند. مدل پیش‌نویس در حالت FP16 اجرا می‌شود، در حالی که مدل اصلی در حالت ۴ بیتی FP8 کار می‌کند. رمزگشایش‌کننده پیشنهادهای مدل پیش‌نویس را می‌پذیرد و آن‌ها را با مدل هدف اعتبارسنجی می‌کند و تنها در صورتی که پیش‌بینی شکست بخورد، به حالت عادی بازمی‌گردد. این سازوکار تعداد دفعات اجرای کامل مدل (Forward Passes) را تقریباً ۴۰٪ کاهش می‌دهد و بار محاسباتی به ازای هر توکن را به شدت پایین می‌آورد.

آخرین قطعه پازل، یک هسته GEMM کم‌رتبه سفارشی است که بر اساس مقاله Low-Rank GEMM نوامبر ۲۰۲۵ طراحی شده و با NVCC 12.5 برای محاسبات FP8 کامپایل شده است. این هسته هر ضرب ماتریسی بزرگ را به دو فاکتور کم‌رتبه تقسیم می‌کند. با کاهش تعداد عملیات‌ها از مرتبه مکعبی به نزدیک-درجه‌دوم، این هسته اجازه می‌دهد RTX 4090 بدون افت کیفیت استنتاج، از تمام ظرفیت هسته‌های تنسور خود استفاده کند.

محک سخت‌افزاری

بر اساس مستندات فنی، این سیستم روی اوبونتو ۲۴.۰۴ LTS، درایور ۵۶۰.۷۱ انویدیا، CUDA 12.5 و cuBLAS 12.5.0 اجرا شده است. با محدود کردن توان مصرفی به ۳۵۰ وات، تأخیر تا نخستین توکن (TTFT) به حدود ۱۲ میلی‌ثانیه رسید. توان عملیاتی ۱۰۰ تریلیون توکن در ثانیه توسط ابزار strata-bench در گیت‌هاب (اکتبر ۲۰۲۶) تأیید شد. این بنچمارک سه بار اجرا شد؛ ۳۰ ثانیه اول به عنوان گرم‌کردن (Warm-up) حذف شدند و میانگین ۵ دقیقه باقی‌مانده محاسبه شد.

حداکثر عملکرد از طریق دستور nvprof --metrics flops_sp اندازه‌گیری شد که ۳۷۸ ترافلاپس (TFLOPS) محاسبات FP8 را نشان داد. مدیریت حافظه برای جلوگیری از کرش کردن حیاتی است. توزیع ۱۹ گیگابایت حافظه اشغال شده به شرح زیر است:

  • وزن‌های کوانتیده: ۱۲.۲ گیگابایت
  • KV-cache فشرده (ورودی‌های ۴ بیتی، با حدود ۷۰٪ فشرده‌سازی): ۵.۸ گیگابایت
  • بافرهای فعال‌ساز (Activation buffers): ۰.۹ گیگابایت
  • سربار درایور و CUDA: ۰.۱ گیگابایت

این یعنی حدود ۵ گیگابایت از حافظه ۲۴ گیگابایتی VRAM برای تنسورهای کمکی، مانند ماسک‌های توجه (Attention masks) و بافرهای موقت FP16 باقی می‌ماند. این فضای خالی تضمین می‌کند که مدل بدون نیاز به انتقال داده به CPU (که بسیار کند است) یا استفاده از Paging اجرا شود.

بهره‌وری انرژی و محاسبات

برای درک عدد ۱۰۰ T/s، باید به هزینه‌های عملیاتی به ازای هر دسته (Batch) ۲۰۴۸ توکنی نگاه کرد. هسته GEMM کم‌رتبه (FP8) با ۳۷۸ ترافلاپس (پیک) بیشترین سهم بودجه زمانی را با ۶ میلی‌ثانیه در اختیار دارد. بررسی‌های تکمیلی نشان می‌دهد که چک‌های گمانه‌زنانه ۰.۸ میلی‌ثانیه (۰.۹ ترافلاپس) و خواندن/نوشتن KV-cache فشرده ۰.۵ میلی‌ثانیه (۰.۴ ترافلاپس) زمان می‌برند. با احتساب ۰.۷ میلی‌ثانیه برای مدیریت جریان CUDA و سربار اجرای هسته، زمان کل تقریباً ۱۲ میلی‌ثانیه است.

بهره‌وری انرژی در اینجا خیره‌کننده است. در توان ۳۵۰ وات مداوم، RTX 4090 تقریباً ۰.۰۰۳۵ وات به ازای هر گیگاتوکن مصرف می‌کند. در مقابل، یک گره ۸ تایی H100 معمولاً برای توان عملیاتی ۱ T/s حدود ۴ کیلووات برق مصرف می‌کند که منجر به مصرف حدود ۰.۰۰۴ وات به ازای هر گیگاتوکن می‌شود. این یعنی کارت گرافیک خانگی در واقع در بهره‌وری انرژی به ازای هر توکن برنده است.

مقایسه توان عملیاتی مدل‌ها نتایج زیر را نشان می‌دهد:

  • Qwen 3.8 Flash Next (125B): حدود ۱۰۰ T/s (تأخیر ۱۲ میلی‌ثانیه، ۱۹ گیگابایت VRAM)
  • LLaMA-2-70B: ۶۸ T/s (تأخیر ۱۸ میلی‌ثانیه، ۱۴ گیگابایت VRAM)
  • Yi-34B: ۵۵ T/s (تأخیر ۲۱ میلی‌ثانیه، ۹ گیگابایت VRAM)
  • Mistral-7B (گمانه‌زنانه): ۲۲ T/s (تأخیر ۳۰ میلی‌ثانیه، ۵ گیگابایت VRAM)

مدل Qwen 3.8 Flash Next به دلیل الگوی توجه بهینه و پیاده‌سازی تهاجمی GEMM کم‌رتبه، رقبای نزدیک خود را ۳۰ تا ۴۵ درصد شکست می‌دهد.

ریسک‌ها و راهکارهای کاهش

حفظ این سرعت بدون خطر نیست. هر یک از ریسک‌های زیر می‌تواند مستقیماً بر توانایی حفظ حداکثر توان عملیاتی تأثیر بگذارد:

  • محدودیت حرارتی: مصرف ۳۵۰ وات برای چندین ساعت می‌تواند باعث کاهش سرعت (Throttling) شود و توان عملیاتی را ۱۰ تا ۱۵ درصد کاهش دهد. راهکار: استفاده از کیس‌هایی با جریان هوای بالا، خنک‌کننده‌های مایع سفارشی یا محدود کردن زمان اجرا به کمتر از ۲ ساعت.
  • دقت کوانتش: کوانتش ۴ بیتی باعث افزایش حدود ۰.۵ درصدی در Perplexity می‌شود که رمزگشایی گمانه‌زنانه می‌تواند این اثر را در پرس‌وجوهای خاص (Edge-case) تقویت کند. راهکار: اجرای مجموعه‌های اعتبارسنجی روی داده‌های دامنه هدف یا بازگشت به FP16 برای پرس‌وجوهای حساس به ایمنی.
  • پایداری درایور: هسته‌های کم‌رتبه سفارشی به نسخه‌های پیشرو CUDA وابسته هستند و هرگونه پس‌رفت (Regression) در درایور ممکن است عملکرد را مختل کند. راهکار: تثبیت نسخه درایور روی ۵۶۰.۷۱ و حفظ یک خط لوله CI برای بنچمارک‌ها.
  • تکه تکه شدن VRAM: اندازه دسته‌های پویا (Dynamic batch sizes) می‌تواند استخر ۱۹ گیگابایتی حافظه را تکه تکه کرده و باعث خطای OOM شود. راهکار: تخصیص پیش‌فرض یک استخر حافظه استاتیک و استفاده از حافظه مدیریت‌شده CUDA تنها برای بافرهای موقت.
  • بودجه توان: مصرف ۳۵۰ وات ممکن است از رتبه‌بندی PSUهای معمولی ۷۵۰ وات سیستم فراتر رود. راهکار: استفاده از منبع تغذیه ۱۰۰۰ وات با ریل‌های اختصاصی ۱۲ ولت و نظارت از طریق API انویدیا (NVIDIA-PM).

چرخش به سمت هوش مصنوعی محلی

این قابلیت اقتصاد توسعه AI را تغییر می‌دهد. ارائه‌دهندگان کوچک SaaS اکنون می‌توانند ابزارهایی مثل تکمیل‌کننده کد تخصصی در IDE را بدون اجاره GPUهای ابری گران‌قیمت اجرا کنند. آزمایشگاه‌های دانشگاهی با بودجه محدود نیز می‌توانند روی مدل‌های ۱۲۵ میلیارد پارامتری بدون انتظار در صف‌های خوشه‌های مرکزی برای تراز کردن (Alignment) یا تنظیم دقیق (Fine-tuning) کار کنند.

ما به سمت مدل ترکیبی «لبه-ابر» (Edge-to-Cloud) می‌رویم. کارهای حساس به تأخیر، که با تأخیر زیر ۲۰ میلی‌ثانیه برای نخستین توکن ممکن شده‌اند، روی میز کاربر انجام می‌شوند، در حالی که کارهای سنگین دسته‌ای (Batch jobs) در مرکز داده باقی می‌مانند. این یعنی دموکراتیزه شدن دسترسی به مدل‌های با پارامتر بالا و حذف «مالیات محاسباتی» که به شرکت‌های ابری پرداخت می‌شد. این روند انتقال قدرت محاسباتی به دسکتاپ، مشابه رویکرد AMD در ایستگاه‌های ۹۶ هسته‌ای Threadripper است که محاسبات ابررایانه‌ای را به میز کار آورد.

با بهینه‌سازی هسته‌های تنسور FP8 توسط انویدیا و بلوغ این هسته‌ها در جامعه متن‌باز، سقف عملکرد احتمالاً بالاتر خواهد رفت. کارت‌های نسل آینده Ada پتانسیل رسیدن به ۱۵۰ T/s را دارند که مرز میان سخت‌افزار حرفه‌ای و مصرف‌کننده را بیشتر از پیش از بین می‌برد. آینده هوش مصنوعی دیگر تنها در تالارهای مرکز داده زندگی نمی‌کند؛ بلکه اکنون روی یک کارت گرافیک زیر میز یک گیمر قرار دارد.

گام بعدی شما

  • بررسی مخزن strata-bench در گیت‌هاب برای محک زدن سخت‌افزار خود.
  • آزمایش مدل‌های کوانتیده ۴ بیتی با استفاده از کتابخانه‌های جدید SmoothQuant.
  • ارزیابی جایگزینی APIهای ابری با استقرار محلی برای کاهش هزینه‌های عملیاتی.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص در بهینه‌سازی هسته‌های محاسباتی، هزینه استنتاج مدل‌های عظیم را برای توسعه‌دهندگان مستقل به شدت کاهش می‌دهد. در نتیجه، استقلال سخت‌افزاری از مراکز داده بزرگ افزایش یافته و سرعت نوآوری در سطح لبه (Edge) شتاب می‌گیرد.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت‌های پرداخت ارزی و تحریم APIهای ابری دست‌وپنجه نرم می‌کنند، این بهینه‌سازی‌ها امکان اجرای مدل‌های سطح سازمانی را روی سخت‌افزارهای موجود در بازار داخلی فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

دموکراسی در دسترسی به مدل‌های بزرگ دیگر یک شعار نیست، بلکه نتیجه مستقیم بهینه‌سازی‌های لایه نرم‌افزاری است. وقتی یک کارت گرافیک خانگی در بهره‌وری انرژی از H100 پیشی می‌گیرد، مدل کسب‌وکار شرکت‌های ابری که بر پایه اجاره سخت‌افزار بنا شده بود، به شدت به چالش کشیده می‌شود. به نظر ما، تمرکز صنعت از «بزرگ‌تر کردن مدل» به «فشرده‌تر کردن استنتاج» تغییر مسیر داده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.