تصور کنید تمام قدرت پردازشی یک خوشه سرور سازمانی را در یک کارت گرافیک زیر میز کارتان داشته باشید. این دیگر یک رویای مهندسی نیست، بلکه واقعیت جدید استنتاج محلی است.
طبق یک مطالعه موردی فنی در اکتبر ۲۰۲۶، یک کارت NVIDIA RTX 4090 توانست در اجرای مدل ۱۲۵ میلیارد پارامتری به توان عملیاتی ۱۰۰ تریلیون توکن در ثانیه (T/s) برسد. این عدد که پیشتر تنها در اختیار خوشههای چندگره H100 بود، اکنون روی سختافزار مصرفکننده ثبت شده است. همانطور که در گزارش تحلیلگران ارشد Lead-Tech در اکتبر ۲۰۲۶ اشاره شده، این عملکرد مرز میان سختافزارهای مصرفکننده و سازمانی را کمرنگ میکند. همانطور که در تحلیلهای قبلی ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، انتقال قدرت پردازش از ابر به محیط محلی، بازی را برای توسعهدهندگان تغییر میدهد.
برای سالها، تفاوت میان GPUهای خانگی و سختافزارهای سازمانی در میزان حافظه VRAM و توان عملیاتی خام بود. در حالی که گیمرها از ۴۰۹۰ برای ردیابی پرتو (Ray-tracing) در کیفیت 4K یا ایجاد فریمهای ارتقایافته با هوش مصنوعی در نرخ ۱۲۰ هرتز استفاده میکردند، پژوهشگران برای مدلهای بنیادی به ردیفهای A100 متکی بودند. اما این جهش نشان میدهد شکاف سختافزاری نه با تراشههای جدید، بلکه با بهینهسازی تهاجمی نرمافزاری بسته شده است. این رویکرد بهینهسازی یادآور پژوهش CetinLM است که توانست آموزش ۲ میلیارد توکن را تنها با یک پردازنده ۱۶ گیگابایتی ممکن سازد. رمز این موفقیت در ترکیبی از هستههای GEMM کمرتبه FP8، کوانتش ۴ بیتی، رمزگشایی گمانهزنانه و فشردهسازی تهاجمی KV-cache نهفته است.
با تکیه بر پوششهای قبلی ما در مورد اینکه چگونه عوامل هوش مصنوعی (AI Agents) در حال شکل دادن به بازارهای پیشبینی هستند، توانایی اجرای مدلهای عظیم به صورت محلی به این عوامل اجازه میدهد تا با تأخیر نزدیک به صفر و حریم خصوصی کامل فعالیت کنند. این تحول در راستای استراتژیهای جدید سختافزاری است، مشابه آنچه در عرضه نسخه ۶۴ گیگابایتی انویدیا برای پشتیبانی از عاملهای همیشهفعال مشاهده کردیم. وقتی استنتاج از ابر به دسکتاپ منتقل میشود، هزینه تکرار گردشهای کاری پیچیده در مدلهای عاملمحور تقریباً به صفر میرسد.
زیرساخت فنی
این جهش عملکردی بر پایه مدل Qwen 3.8 Flash Next استوار است؛ یک مدل ۱۲۵ میلیارد پارامتری که از طریق یک پشته نرمافزاری خاص بهینه شده است. اولین ستون این موفقیت، خط لوله SmoothQuant-V2 است که در جولای ۲۰۲۶ منتشر شد. این فرآیند — که شبیه به فشردهسازی یک فایل حجیم برای جا شدن در فلش مموری بدون از دست دادن محتوای اصلی است — تمام ماتریسهای وزن را به اعداد صحیح ۴ بیتی تبدیل میکند، ضرایب مقیاسبندی را برای هر بلوک ذخیره میکند و لایههای نرمالسازی (Layer-norm) را در تنسورهای کوانتیده ادغام میکند. در نتیجه، حجم مدل از حدود ۲۵۰ گیگابایت (در حالت FP16) به تقریباً ۱۹ گیگابایت پس از فشردهسازی KV-cache کاهش مییابد.
برای افزایش سرعت، سیستم از رمزگشایی گمانهزنانه (Speculative Decoding) استفاده میکند. در این روش، یک مدل «پیشنویس» (Drafter) سبکوزن با ۰.۵ میلیارد پارامتر، توکنهای بعدی را با دقت حدود ۷۰٪ پیشبینی میکند. مدل پیشنویس در حالت FP16 اجرا میشود، در حالی که مدل اصلی در حالت ۴ بیتی FP8 کار میکند. رمزگشایشکننده پیشنهادهای مدل پیشنویس را میپذیرد و آنها را با مدل هدف اعتبارسنجی میکند و تنها در صورتی که پیشبینی شکست بخورد، به حالت عادی بازمیگردد. این سازوکار تعداد دفعات اجرای کامل مدل (Forward Passes) را تقریباً ۴۰٪ کاهش میدهد و بار محاسباتی به ازای هر توکن را به شدت پایین میآورد.
آخرین قطعه پازل، یک هسته GEMM کمرتبه سفارشی است که بر اساس مقاله Low-Rank GEMM نوامبر ۲۰۲۵ طراحی شده و با NVCC 12.5 برای محاسبات FP8 کامپایل شده است. این هسته هر ضرب ماتریسی بزرگ را به دو فاکتور کمرتبه تقسیم میکند. با کاهش تعداد عملیاتها از مرتبه مکعبی به نزدیک-درجهدوم، این هسته اجازه میدهد RTX 4090 بدون افت کیفیت استنتاج، از تمام ظرفیت هستههای تنسور خود استفاده کند.
محک سختافزاری
بر اساس مستندات فنی، این سیستم روی اوبونتو ۲۴.۰۴ LTS، درایور ۵۶۰.۷۱ انویدیا، CUDA 12.5 و cuBLAS 12.5.0 اجرا شده است. با محدود کردن توان مصرفی به ۳۵۰ وات، تأخیر تا نخستین توکن (TTFT) به حدود ۱۲ میلیثانیه رسید. توان عملیاتی ۱۰۰ تریلیون توکن در ثانیه توسط ابزار strata-bench در گیتهاب (اکتبر ۲۰۲۶) تأیید شد. این بنچمارک سه بار اجرا شد؛ ۳۰ ثانیه اول به عنوان گرمکردن (Warm-up) حذف شدند و میانگین ۵ دقیقه باقیمانده محاسبه شد.
حداکثر عملکرد از طریق دستور nvprof --metrics flops_sp اندازهگیری شد که ۳۷۸ ترافلاپس (TFLOPS) محاسبات FP8 را نشان داد. مدیریت حافظه برای جلوگیری از کرش کردن حیاتی است. توزیع ۱۹ گیگابایت حافظه اشغال شده به شرح زیر است:
- وزنهای کوانتیده: ۱۲.۲ گیگابایت
- KV-cache فشرده (ورودیهای ۴ بیتی، با حدود ۷۰٪ فشردهسازی): ۵.۸ گیگابایت
- بافرهای فعالساز (Activation buffers): ۰.۹ گیگابایت
- سربار درایور و CUDA: ۰.۱ گیگابایت
این یعنی حدود ۵ گیگابایت از حافظه ۲۴ گیگابایتی VRAM برای تنسورهای کمکی، مانند ماسکهای توجه (Attention masks) و بافرهای موقت FP16 باقی میماند. این فضای خالی تضمین میکند که مدل بدون نیاز به انتقال داده به CPU (که بسیار کند است) یا استفاده از Paging اجرا شود.
بهرهوری انرژی و محاسبات
برای درک عدد ۱۰۰ T/s، باید به هزینههای عملیاتی به ازای هر دسته (Batch) ۲۰۴۸ توکنی نگاه کرد. هسته GEMM کمرتبه (FP8) با ۳۷۸ ترافلاپس (پیک) بیشترین سهم بودجه زمانی را با ۶ میلیثانیه در اختیار دارد. بررسیهای تکمیلی نشان میدهد که چکهای گمانهزنانه ۰.۸ میلیثانیه (۰.۹ ترافلاپس) و خواندن/نوشتن KV-cache فشرده ۰.۵ میلیثانیه (۰.۴ ترافلاپس) زمان میبرند. با احتساب ۰.۷ میلیثانیه برای مدیریت جریان CUDA و سربار اجرای هسته، زمان کل تقریباً ۱۲ میلیثانیه است.
بهرهوری انرژی در اینجا خیرهکننده است. در توان ۳۵۰ وات مداوم، RTX 4090 تقریباً ۰.۰۰۳۵ وات به ازای هر گیگاتوکن مصرف میکند. در مقابل، یک گره ۸ تایی H100 معمولاً برای توان عملیاتی ۱ T/s حدود ۴ کیلووات برق مصرف میکند که منجر به مصرف حدود ۰.۰۰۴ وات به ازای هر گیگاتوکن میشود. این یعنی کارت گرافیک خانگی در واقع در بهرهوری انرژی به ازای هر توکن برنده است.
مقایسه توان عملیاتی مدلها نتایج زیر را نشان میدهد:
- Qwen 3.8 Flash Next (125B): حدود ۱۰۰ T/s (تأخیر ۱۲ میلیثانیه، ۱۹ گیگابایت VRAM)
- LLaMA-2-70B: ۶۸ T/s (تأخیر ۱۸ میلیثانیه، ۱۴ گیگابایت VRAM)
- Yi-34B: ۵۵ T/s (تأخیر ۲۱ میلیثانیه، ۹ گیگابایت VRAM)
- Mistral-7B (گمانهزنانه): ۲۲ T/s (تأخیر ۳۰ میلیثانیه، ۵ گیگابایت VRAM)
مدل Qwen 3.8 Flash Next به دلیل الگوی توجه بهینه و پیادهسازی تهاجمی GEMM کمرتبه، رقبای نزدیک خود را ۳۰ تا ۴۵ درصد شکست میدهد.
ریسکها و راهکارهای کاهش
حفظ این سرعت بدون خطر نیست. هر یک از ریسکهای زیر میتواند مستقیماً بر توانایی حفظ حداکثر توان عملیاتی تأثیر بگذارد:
- محدودیت حرارتی: مصرف ۳۵۰ وات برای چندین ساعت میتواند باعث کاهش سرعت (Throttling) شود و توان عملیاتی را ۱۰ تا ۱۵ درصد کاهش دهد. راهکار: استفاده از کیسهایی با جریان هوای بالا، خنککنندههای مایع سفارشی یا محدود کردن زمان اجرا به کمتر از ۲ ساعت.
- دقت کوانتش: کوانتش ۴ بیتی باعث افزایش حدود ۰.۵ درصدی در Perplexity میشود که رمزگشایی گمانهزنانه میتواند این اثر را در پرسوجوهای خاص (Edge-case) تقویت کند. راهکار: اجرای مجموعههای اعتبارسنجی روی دادههای دامنه هدف یا بازگشت به FP16 برای پرسوجوهای حساس به ایمنی.
- پایداری درایور: هستههای کمرتبه سفارشی به نسخههای پیشرو CUDA وابسته هستند و هرگونه پسرفت (Regression) در درایور ممکن است عملکرد را مختل کند. راهکار: تثبیت نسخه درایور روی ۵۶۰.۷۱ و حفظ یک خط لوله CI برای بنچمارکها.
- تکه تکه شدن VRAM: اندازه دستههای پویا (Dynamic batch sizes) میتواند استخر ۱۹ گیگابایتی حافظه را تکه تکه کرده و باعث خطای OOM شود. راهکار: تخصیص پیشفرض یک استخر حافظه استاتیک و استفاده از حافظه مدیریتشده CUDA تنها برای بافرهای موقت.
- بودجه توان: مصرف ۳۵۰ وات ممکن است از رتبهبندی PSUهای معمولی ۷۵۰ وات سیستم فراتر رود. راهکار: استفاده از منبع تغذیه ۱۰۰۰ وات با ریلهای اختصاصی ۱۲ ولت و نظارت از طریق API انویدیا (NVIDIA-PM).
چرخش به سمت هوش مصنوعی محلی
این قابلیت اقتصاد توسعه AI را تغییر میدهد. ارائهدهندگان کوچک SaaS اکنون میتوانند ابزارهایی مثل تکمیلکننده کد تخصصی در IDE را بدون اجاره GPUهای ابری گرانقیمت اجرا کنند. آزمایشگاههای دانشگاهی با بودجه محدود نیز میتوانند روی مدلهای ۱۲۵ میلیارد پارامتری بدون انتظار در صفهای خوشههای مرکزی برای تراز کردن (Alignment) یا تنظیم دقیق (Fine-tuning) کار کنند.
ما به سمت مدل ترکیبی «لبه-ابر» (Edge-to-Cloud) میرویم. کارهای حساس به تأخیر، که با تأخیر زیر ۲۰ میلیثانیه برای نخستین توکن ممکن شدهاند، روی میز کاربر انجام میشوند، در حالی که کارهای سنگین دستهای (Batch jobs) در مرکز داده باقی میمانند. این یعنی دموکراتیزه شدن دسترسی به مدلهای با پارامتر بالا و حذف «مالیات محاسباتی» که به شرکتهای ابری پرداخت میشد. این روند انتقال قدرت محاسباتی به دسکتاپ، مشابه رویکرد AMD در ایستگاههای ۹۶ هستهای Threadripper است که محاسبات ابررایانهای را به میز کار آورد.
با بهینهسازی هستههای تنسور FP8 توسط انویدیا و بلوغ این هستهها در جامعه متنباز، سقف عملکرد احتمالاً بالاتر خواهد رفت. کارتهای نسل آینده Ada پتانسیل رسیدن به ۱۵۰ T/s را دارند که مرز میان سختافزار حرفهای و مصرفکننده را بیشتر از پیش از بین میبرد. آینده هوش مصنوعی دیگر تنها در تالارهای مرکز داده زندگی نمیکند؛ بلکه اکنون روی یک کارت گرافیک زیر میز یک گیمر قرار دارد.
گام بعدی شما
- بررسی مخزن strata-bench در گیتهاب برای محک زدن سختافزار خود.
- آزمایش مدلهای کوانتیده ۴ بیتی با استفاده از کتابخانههای جدید SmoothQuant.
- ارزیابی جایگزینی APIهای ابری با استقرار محلی برای کاهش هزینههای عملیاتی.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو