پرش به محتوای اصلی
پرش به محتوای مقاله

سرمایه‌گذاری انویدیا و آمازون بر سخت‌افزارهای حافظه‌محور برای رفع گلوگاه استنتاج

·۲۴ شهریور ۱۴۰۵۱۵ دقیقه مطالعه۲ بازدید
نمای درونی انقلاب سخت‌افزار استنتاج در ۲۰۲۶
نمای درونی انقلاب سخت‌افزار استنتاج در ۲۰۲۶
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

انتقال استراتژیک از GPUهای همه‌منظوره به پشته‌های ترکیبی (GPU + LPU/Wafer-scale) برای تفکیک فازهای پیش‌پُرکردن و رمزگشایی در استنتاج.

اگر امروز برای اجرای مدل‌های زبانی هزینه می‌پردازید، احتمالاً متوجه شده‌اید که سرعت تولید متن با سرعت پردازش اولیه فاصله زیادی دارد. نبرد برای سلطه بر هوش مصنوعی از «چه کسی بزرگ‌ترین مدل را آموزش می‌دهد» به «چه کسی سریع‌ترین اجرا را دارد» تغییر کرده است. انویدیا (Nvidia) و آمازون (Amazon) اکنون در حال استقرار پشته‌های سخت‌افزاری ترکیبی هستند که GPUهای سنتی را با تراشه‌های تخصصی حافظه‌محور ادغام می‌کند تا تأخیرهای گسترده در زمان پاسخ‌دهی مدل‌ها را از بین ببرد.

سال‌هاست که صنعت بر فاز «آموزش» — یعنی فرآیند سنگین محاسباتی برای یاد دادن مدل — متمرکز بود. از سال ۲۰۲۰، تمرکز بر ساخت مدل‌های بزرگ‌تر و بهتر بود و مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — از میلیون‌ها پارامتر به تریلیون‌ها پارامتر رسید. این مقیاس‌پذیری در عمل مؤثر بود؛ برای مثال، بزرگ‌ترین نسخه GPT-3 شرکت OpenAI که در سال ۲۰۲۰ منتشر شد، تنها به ۴۳.۹ درصد از سوالات یک بنچمارک محبوب دانش و استدلال پاسخ درست داد. اما تنها چهار سال بعد، مدل GPT-4o در همان آزمون به نمره ۸۸.۷ درصد رسید و به‌طور مؤثری با سطح متخصصان انسانی برابری کرد. این پیشرفت‌ها در کنار تلاش‌های OpenAI برای توسعه سیستم‌های خودبه‌بهبود بازگشتی، افق‌های جدیدی را برای مقیاس‌پذیری هوش مصنوعی گشوده است.

اما در سال ۲۰۲۶، بحث اصلی به «استنتاج» (Inference) — یعنی استفاده واقعی از این مدل‌ها برای تولید کد، نوشتن مقاله یا ساخت تصاویری از خودمان در نقش الف‌ها — منتقل شده است. مت کیمبال، تحلیلگر ارشد مراکز داده در Moor Insights & Strategy، اشاره می‌کند که «آموزش دیگر خبر تازه‌ای نیست» و مدیران ارشد فناوری (CIOs) اکنون تقریباً به‌طور انحصاری روی استنتاج تمرکز کرده‌اند. جنسن هوانگ، مدیرعامل انویدیا، در کنفرانس GTC ۲۰۲۶ این تغییر را «نقطه عطف استنتاج» نامید.

این چرخش به دلیل ظهور مدل‌های استدلالی و عامل‌های خودمختار است که ۲۴ ساعته فعال‌اند. بسیاری از مدل‌های مدرن، مدل استدلالی (Reasoning Model) — مدلی که قبل از جواب، یک قدم درنگ می‌کند و فکر می‌کند، مثل شطرنج‌بازی که چند حرکت جلوتر را می‌بیند — هستند که برای یک پرسش، چندین بار استنتاج می‌کنند و در فرآیندی به نام زنجیره تفکر (Chain-of-Thought) — مثل وقتی شاگرد ریاضی پای تخته بلند بلند فکر می‌کند تا به جواب برسد — خودشان را بازپرامپت می‌کنند. مدل‌هایی با تلاش استدلالی بالا می‌توانند تا ۲۰ برابر بیشتر از مدل‌های معمولی یا بدون تلاش، متن تولید کنند. علاوه بر این، هوش مصنوعی عامل‌محور (Agentic AI) اکنون به‌صورت شبانه‌روزی کار می‌کند و به‌جای پاسخ‌های لحظه‌ای ساده، به‌طور خودمختار برای رسیدن به اهداف تعریف‌شده توسط کاربر تلاش می‌کند.

تصور کنید یک موتور فوق‌سریع (GPU) دارید که داده‌ها را فوراً پردازش می‌کند، اما لوله سوخت (حافظه) آن بیش از حد نازک است. موتور بیشتر وقت خود را در حالت درجا می‌گذراند و منتظر رسیدن داده‌ها می‌ماند. بر اساس گزارشی از spectrum.ieee.org، پژوهشگران دریافتند که GPUهای Nvidia H100 هنگام اجرای مدل‌های بازمتن، ۵۰ تا ۸۰ درصد زمان خود را به دلیل کمبود پهنای‌باند حافظه در حالت بیکار می‌گذرانند.

معماری گلوگاه

برای درک نیاز به سخت‌افزار جدید، باید نحوه تولید پاسخ توسط یک LLM را بررسی کرد. یک مدل آموزش‌ندیده شبیه به مجموعه‌ای از مهره‌های پراکنده است؛ تکه‌هایی از کلمات که توکن (Token) — مثل برش‌های یک کیک طولانی که مدل تکه‌تکه می‌خورد — نامیده می‌شوند. آموزش، این آشفتگی را از طریق یک بازی حدس‌زنی روی میلیاردها متن سازماندهی می‌کند. در این فرآیند، متن واقعی به مدل نشان داده می‌شود اما توکن بعدی پنهان می‌ماند و از مدل خواسته می‌شود پیش‌بینی کند چه چیزی می‌آید. پس از هر حدس، توکن درست فاش شده و با پیش‌بینی مقایسه می‌شود تا میزان دقت محاسبه گردد.

آموزش به دلیل فرآیند پس‌انتشار (Backpropagation) از نظر محاسباتی بسیار سنگین است، زیرا مدل باید میلیاردها یا تریلیون‌ها پارامتر (Parameters) خود را به‌طور مکرر به‌روزرسانی کند تا پیش‌بینی بعدی بهتر شود. به همین دلیل است که غول‌های فناوری مراکز داده‌ای بزرگ‌تر از هر زمان دیگری می‌سازند. اما پس از اینکه پارامترها تثبیت و از طریق تنظیم دقیق (Fine-tuning) — مثل وقتی به یک پزشک عمومی، تخصص پوست می‌دهیم تا روی یک حوزه دقیق شود — روی داده‌های کوچک‌تر و تخصصی‌تر بهینه‌ شدند، مدل برای استنتاج مستقر می‌شود.

سودیپ بوجا، بنیان‌گذار و مدیر فنی d-Matrix، توضیح می‌دهد که مدل‌ها «خودبازگشتی» (Autoregressive) هستند؛ یعنی خروجی بعدی به خروجی قبلی وابسته است. برای تولید توکن بعدی، تراشه باید تمام وزن‌ها و زمینه (Context) — شامل پرامپت‌ها، پاسخ‌های قبلی و فایل‌های آپلود شده — را بخواند. این حجم عظیمی از داده و پردازش است.

این فرآیند در دو فاز متمایز رخ می‌دهد:

  • پیش‌پُرکردن (Prefill): مدل پرامپت را می‌خواند و تمام توکن‌ها را یک‌باره پردازش می‌کند. در این مرحله از عملیاتی به نام «توجه» (Attention) استفاده می‌شود تا محاسبه شود هر توکن چگونه با دیگران در جمله و پاراگراف مرتبط است. این کار شامل ارسال پرس‌وجوهایی (Queries) است که منجر به ایجاد کلیدها (Keys) و مقادیر (Values) می‌شود و در یک «KV Cache» ذخیره می‌گردند. این حافظه موقت مانند یک تخته یادداشت عمل می‌کند و می‌تواند تا ده‌ها گیگابایت رشد کند. پیش‌پُرکردن یک وظیفه موازی است که GPUها به دلیل معماری مشابه با رسترایزاسیون گرافیکی، به‌خوبی از پس آن برمی‌آیند.
  • رمزگشایی (Decode): مدل پاسخ را توکن به توکن تولید می‌کند. در هر گام، توکن اخیر را می‌گیرد، آن را در برابر KV Cache می‌سنجد، توکن بعدی را پیش‌بینی می‌کند و کلید و مقدار توکن جدید را دوباره به حافظه کش اضافه می‌کند.

چون فاز رمزگشایی خودبازگشتی است، یک مشکل عظیم در جابه‌جایی داده ایجاد می‌کند. پیش‌بینی هر توکن مستلزم خواندن کل مدل از حافظه است — احتمالاً ده‌ها تا صدها گیگابایت پارامتر — علاوه بر KV Cache. جابه‌جایی این حجم از داده اغلب از پهنای‌باند موجود فراتر می‌رود و واحدهای پردازشی را بیکار می‌کند.

اتحادهای سخت‌افزاری جدید

این گلوگاه باعث همکاری‌های غیرمنتظره و سرمایه‌گذاری‌های کلان شده است. شرکت Anthropic در حال حاضر ماهانه بیش از یک میلیارد دلار به رقیب خود، SpaceXAI، برای اجاره توان محاسباتی مازاد می‌پردازد. در همین حال، Amazon Web Services (AWS) تراشه‌های Trainium خود را با موتورهای مقیاس-ویفری Cerebras ترکیب کرده است. در حالی که Trainium در ابتدا برای آموزش طراحی شده بود، AWS اکنون از آن برای بخش پیچیده محاسباتی پیش‌پُرکردن در استنتاج استفاده می‌کند و بخش رمزگشایی که به حافظه شدید نیاز دارد را به Cerebras می‌سپارد. برای مدیریت بهینه این جریان‌های داده در محیط‌های عملیاتی، ابزارهایی مانند سرور استنتاج Triton انویدیا به اتوماسیون و بهینه‌سازی توزیع مدل‌ها کمک می‌کنند.

تراشه Cerebras WSE-3 به اندازه یک بشقاب غذاخوری است و یک ویفر سیلیکونی کامل را به تک‌تراشه‌ای با بیش از ۴ تریلیون ترانزیستور تبدیل کرده است. این تراشه ۴۴ گیگابایت SRAM را مستقیماً در سیلیکون حک کرده و نیاز به جابه‌جایی داده به حافظه خارجی را حذف می‌کند. جیمز وانگ، متخصص سابق Cerebras و عضو فعلی SpaceXAI، اشاره می‌کند که این معماری اجازه می‌دهد ۴۰ تا ۸۰ میلیارد پارامتر روی یک تراشه قرار گیرند. OpenAI از WSE-3 برای مدل GPT-5.3-Codex-Spark استفاده کرد که بیش از ۱۰۰۰ توکن در ثانیه تولید می‌کند؛ در حالی که نسخه‌های استاندارد GPT-5.4 تنها ۵۰ تا ۱۲۵ توکن در ثانیه می‌سازند.

سی‌ربرس همچنین می‌تواند پیش‌پُرکردن را با شبکه کردن چندین تراشه WSE-3 برای ایجاد یک استخر واحد از حافظه مدیریت کند. وانگ اشاره می‌کند که آن‌ها به‌طور تجاری تا ۵۰۰ میلیارد پارامتر را برای مشتریان پشتیبانی کرده‌اند و این معماری هیچ محدودیت ذاتی در تعداد پارامترها ندارد.

انویدیا مسیر متفاوتی را انتخاب کرد و در اواخر سال ۲۰۲۵، مالکیت معنوی و استعدادهای استارتاپ Groq را در یک معامله جنجالی ۲۰ میلیارد دلاری تصاحب کرد. جنسن هوانگ در کنفرانس GTC ۲۰۲۶ از Nvidia Groq 3 پرده‌برداری کرد. این واحد پردازش زبان (LPU)، برخلاف GPU، پهنای‌باند حافظه را بر قدرت محاسباتی خام ترجیح می‌دهد و دارای ۵۰۰ مگابایت SRAM روی تراشه است که مستقیماً به واحدهای ریاضی ممیز شناور متصل شده است. ایان باک از انویدیا می‌گوید LPU هفت برابر پهنای‌باند حافظه بیشتری نسبت به GPU دارد. انویدیا ۲۵۶ عدد از این LPUها را در سیستم رک Groq 3 LPX جای می‌دهد.

رویکردهای جایگزین برای حافظه

فراتر از غول‌ها، استارتاپ‌ها در حال آزمایش روش‌های رادیکال برای جابه‌جایی داده‌ها جهت حل مشکل «گرسنگی حافظه» هستند که توسط شهریار «شا» ربیعی از Majestic Labs توصیف شده است. ربیعی اشاره می‌کند که رویکردهای مبتنی بر GPU، توان محاسباتی را بیش از حد تامین می‌کنند اما حافظه را تشنه می‌گذارند، که این امر نیاز به یک «مقیاس‌افزایی حافظه» (Memory Scale Out) را ایجاد می‌کند:

  • d-Matrix: شتاب‌دهنده Raptor آن‌ها واحد محاسباتی را مستقیماً روی لایه DRAM قرار می‌دهد. در حالی که GPUهای سنتی حافظه با پهنای‌باند بالا (HBM) را در محیط اطراف قرار می‌دهند، رویه انباشت عمودی Raptor فاصله جابه‌جایی داده را از میلی‌متر به میکرومتر می‌رساند. این رویکرد «آسمان‌خراشان» اجازه می‌دهد در همان فضای فیزیکی، کارهای بیشتری انجام شود.
  • Majestic Labs: آن‌ها به‌جای کوتاه کردن فاصله، رابط را با استفاده از یک لینک مسی اختصاصی و یک تراشه تجمیع‌کننده حافظه بهبود بخشیدند. این کار به آن‌ها اجازه می‌دهد بیت‌ها را تا فاصله یک متر منتقل کنند و محدودیت ۲ تا ۳ میلی‌متری لبه‌های HBM را از بین ببرند. این فناوری باعث می‌شود یک رک سرور بتواند ۱۲۸ ترابایت DRAM را پشتیبانی کند، که بسیار بیشتر از ۲۰ ترابایت HBM3E موجود در رک GB300 NVL72 انویدیا است.
  • Tensordyne: تراشه Napier آن‌ها از یک سیستم اعداد لگاریتمی استفاده می‌کند. چون لگاریتم A ضربدر B برابر است با لگاریتم A به‌علاوه لگاریتم B، تراشه می‌تواند در جایی که باید ضرب کند، جمع بزند. از آنجایی که جمع‌کننده‌ها فضای کمتر و توان کمتری نسبت به ضرب‌کننده‌ها مصرف می‌کنند، Napier می‌تواند ۱۳۰۰ توکن در ثانیه برای هر کاربر تولید کند در حالی که کمتر از یک‌دهم توان مصرفی سخت‌افزارهای مشابه انویدیا را دارد.
  • Etched: تراشه Sohu این شرکت، معماری ترنسفورمر را مستقیماً در سیلیکون سخت‌افزاری (Hard-wire) کرده است. با سیم‌کشی اتصالات خاص مورد نیاز برای محاسبات ترنسفورمر، انعطاف‌پذیری را فدای کارایی شدید کرده است. Sohu می‌تواند مدل Llama 70B متا را با سرعت ۵۰۰,۰۰۰ توکن در ثانیه اجرا کند، هرچند نمی‌تواند مدل‌هایی را که از معماری ترنسفورمر فاصله می‌گیرند، اجرا کند.

بسیاری از این استارتاپ‌ها، از جمله d-Matrix و Majestic، از DRAMهای موجود در بازار استفاده می‌کنند چون هزینه آن‌ها دو تا سه برابر کمتر از HBM است. با این حال، طرفداران HBM مانند سامسونگ و SK Hynix در حال مقابله هستند. هوشیک کیم از SK Hynix می‌گوید HBM4 که در راه است، حداکثر پهنای‌باند حافظه را دو برابر کرده و مقدار حافظه در هر پشته را افزایش می‌دهد تا گلوگاه‌های فعلی را «به‌طور قاطع بشکند». HBM4 در GPU مدل Vera Rubin انویدیا استفاده خواهد شد که انتظار می‌رود در نیمه دوم ۲۰۲۶ عرضه شود.

لایه بهینه‌سازی نرم‌افزاری

سخت‌افزار تنها اهرم موجود نیست. پژوهشگران از «کوانتیزاسیون» (Quantization) برای کوچک کردن مدل‌ها استفاده می‌کنند. اکثر کامپیوترها اعداد را در فرمت‌های ۳۲ بیتی یا ۶۴ بیتی ذخیره می‌کنند، اما این‌ها فضای بیشتر و انرژی بیشتری می‌گیرند. کوانتیزاسیون این‌ها را به فرمت‌های کم‌دقت‌تر تبدیل می‌کند تا در حافظه صرفه‌جویی شود.

تنش دائمی بین اندازه مدل و دقت وجود دارد. ژیل بکهاس از Tensordyne اشاره می‌کند که رویکرد ۴ بیتی اجازه می‌دهد دو برابر «سیناپس» نسبت به رویکرد ۸ بیتی در همان فضای حافظه جای بگیرد و پژوهشگران دریافته‌اند که این سبک‌سازی اغلب ارزشش را دارد.

رهبران صنعت اکنون حول فرمت‌های جدیدی متمرکز شده‌اند:

  • NVFP4: یک فرمت ۴ بیتی جدید که توسط انویدیا ایجاد شده است.
  • MXFP4: یک فرمت ۴ بیتی رقیب که توسط AMD، اینتل، کوالکام و انویدیا توسعه یافته است.

وقتی انویدیا مدل DeepSeek-R1 را از FP8 به NVFP4 کوانتیزه کرد، گزارش داد که عملکرد ۳ برابر بهبود یافت در حالی که نمرات بنچمارک در هفت محک اصلی کمتر از یک درصد کاهش یافت. ایان باک این فرآیند را «هنر سیاه هوش مصنوعی» می‌نامد.

چرخش راهبردی

این تکامل نشان می‌دهد عصر «یک تراشه برای همه کارها» به پایان رسیده است. آینده زیرساخت هوش مصنوعی یک رویکرد سیستمی است. همان‌طور که ایان باک می‌گوید: «برای اجرای استنتاج مدرن هوش مصنوعی، شما به همه این تراشه‌ها نیاز دارید.» یک مرکز داده احتمالاً به ترکیبی از GPUها برای پردازش اولیه پرامپت (پیش‌پُرکردن) و LPUها یا موتورهای ویفری برای تولید توکن (رمزگشایی) نیاز خواهد داشت.

برای کسب‌وکارها، این یعنی هزینه استقرار عامل‌های هوش مصنوعی با بهینه شدن استنتاج کاهش می‌یابد. تقاضا اساساً سیری‌ناپذیر است؛ با استقرار میلیون‌ها عامل خودمختار که ۲۴ ساعته کار می‌کنند، فشار بر پهنای‌باند حافظه فقط بیشتر خواهد شد. این مسیر دقیقاً شبیه تکامل CPU است که در آن نوآوری از مقیاس‌بندی ساده ترانزیستورها به معماری‌های پیچیده سیستمی تغییر یافت.

منتظر عرضه GPU Vera Rubin انویدیا در نیمه دوم ۲۰۲۶ باشید که از حافظه HBM4 برای جابه‌جایی مرزهای پهنای‌باند استفاده خواهد کرد. در همین حال، Tensordyne انتظار دارد اولین سخت‌افزارهایش در سال ۲۰۲۷ در دسترس باشد و Etched اولین رک خود را در اوت ۲۰۲۶ ارسال کرده است.

چرا این موضوع مهم است؟

این تغییر معماری باعث کاهش شدید هزینه و تأخیر در اجرای عامل‌های هوش مصنوعی می‌شود. بر اساس تخصص مهندسان سخت‌افزار، حذف گلوگاه حافظه تنها راه رسیدن به پاسخ‌های آنی در مدل‌های استدلالی پیچیده است.

تأثیر برای ایران

به‌دلیل تحریم‌ها و محدودیت‌های دسترسی به سخت‌افزارهای پیشرفته، توسعه‌دهندگان ایرانی باید بیشتر بر لایه‌ی نرم‌افزاری و تکنیک‌های کوانتیزاسیون تمرکز کنند تا از سخت‌افزارهای موجود بیشترین بهره را ببرند.

·نگاه ما
تحریریه دات‌هوش

تمرکز صنعت بر سخت‌افزارهای حافظه‌محور نشان می‌دهد که ما از فاز «کشف قابلیت» به فاز «بهینه‌سازی اقتصادی» رسیده‌ایم. دیگر بحث بر سر این نیست که مدل چه کاری می‌تواند انجام دهد، بلکه بحث بر سر این است که هر توکن تولید شده چقدر هزینه دارد. این تغییر، قدرت را از کسانی که فقط مدل‌های بزرگ می‌سازند به کسانی منتقل می‌کند که می‌توانند استنتاج را در مقیاس میلیونی ارزان و سریع کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.