اگر شما یک مدیر زیرساخت هستید که با هزینههای سرسامآور و تأخیر در اجرای مدلهای زبانی دستوپنجه نرم میکنید، باید بدانید که جنگ سختافزاری اکنون به میدان نرمافزار منتقل شده است. قدرت خام تراشهها دیگر کافی نیست؛ مسئله اصلی اکنون مدیریت هوشمندانه ترافیک دادهها در مقیاس واقعی است. اگرچه عملکرد خام تراشه حیاتی است، اما پیچیدگی عملیاتی اجرای هوش مصنوعی در مقیاس بالا به یک مسئله نرمافزاری تبدیل شده است.
به همین دلیل، شرکت d-Matrix مستقر در سانتا کلارا، در ۳ اوت ۲۰۲۶، متخصص سازماندهی استنتاج، یعنی شرکت Wallaroo.ai را خرید تا شکاف بین سیلیکون و استقرار در دنیای واقعی را پر کند. این معامله باعث میشود پلتفرم، مالکیت معنوی و تیم مهندسی Wallaroo بهطور کامل در ساختار این شرکت سازنده تراشه ادغام شوند.
بیشتر زیرساختهای فعلی بر پایه واحد پردازش گرافیکی (GPU) هستند. اما این تراشهها در مرحله «رمزگشایی» (Decoding) — یعنی همان لحظهای که مدل توکنها را یکییکی تولید میکند — دچار چالش میشوند. d-Matrix شتابدهندههای Corsair را دقیقاً برای مدیریت این مرحله طراحی کرده است؛ در حالی که کارهای سنگین «پیشپر» (Prefill) را به GPU میسپارد. این رویکرد ترکیبی سیلیکونی در تئوری بسیار بهینه است، اما نیاز به یک «پلیس راهنمایی و رانندگی» پیچیده دارد تا تصمیم بگیرد کدام تراشه کدام بخش از یک درخواست را مدیریت کند، بستر دادههای تجمیعه شده (Accumulated Context) را بین آنها جابهجا کند و هر دو لایه را بهصورت مستقل با تغییر ترافیک مقیاسبندی نماید.
اینجاست که Wallaroo وارد عمل میشود. طبق گفته این شرکت، این خرید یک محیط زمان-اجرا (Runtime) و یک صفحه کنترل (Control Plane) فراهم میکند که قادر است مدلها را روی سختافزارهای x86، Arm و GPU در محیطهای ابری، لبه (Edge) یا حتی محیطهای ایزوله (Air-gapped) مستقر کند. این پلتفرم همچنین از محیطهای رایج مثل vLLM و SGLang پشتیبانی میکند. طبق اعلام d-Matrix، تخصص Wallaroo در معماری نرمافزار، محاسبات با کارایی بالا (HPC) و عملیات کوبرنتیز (Kubernetes) دلیل اصلی این خرید بوده است.
همافزایی فنی و نتایج عملکردی
این دو شرکت پیش از خرید، دیدگاه مشترکی در مورد یک چشمانداز معماری داشتند. بر اساس پست مورخ ۱۶ مارس ۲۰۲۶، وید جین (Vid Jain)، مدیرعامل Wallaroo، و دو همکارش توضیح دادند که ترافیک عاملهای هوش مصنوعی (Agentic Traffic) در سه اندازه متمایز میرسد:
- حدود ۸۴٪ درخواستهای کوتاه با طول تقریبی ۲,۰۰۰ توکن.
- حدود ۱۵٪ در محدوده ۸,۰۰۰ تا ۶۴,۰۰۰ توکن.
- کمتر از ۱٪ درخواستهای حجیم شامل ۱۲۸,۰۰۰ توکن یا بیشتر.
همین مقدار اندک ترافیک (زیر ۱٪) میتواند تمام زمان GPU را به انحصار بگیرد و هر آنچه در صف انتظار است را مسدود کند. شرکت Wallaroo گزارش داد که با استفاده از مسیریابی آگاه از حافظه (Cache-aware routing) برای تقسیم این حجم از کاری، توانست «زمان تا نخستین توکن» (Time to First Token) را در بدترین حالت برای ترافیک عاملمحور در تستهای داخلی خود تا ۷۵٪ کاهش دهد.
سید شث (Sid Sheth)، بنیانگذار و مدیرعامل d-Matrix، بیان کرد که مشتریان، پیچیدگی عملیاتی را به عنوان مانع اصلی عملکرد شناسایی کردهاند. جین افزود که آنها در این دیدگاه مشترک بودند که استنتاج به همان اندازه که یک مسئله سختافزاری است، یک مسئله استقرار (Deployment) نیز هست. این لایه نرمافزاری اجازه میدهد سختافزار Corsair درخشان ظاهر شود و بهطور مشخص از ۲ گیگابایت SRAM روی تراشه و پهنای باند حافظه ۱۵۰ ترابایت بر ثانیه بهره ببرد.
الگوی گسترش سریع
این دومین خرید d-Matrix در چهار ماه اخیر است. در آوریل ۲۰۲۶، این شرکت بخش مراکز داده GigaIO را خرید تا سیستم SuperNODE و ساختار حافظه مبتنی بر PCIe شرکت FabreX را به دست آورد. همچنین در این معامله، تیمی از متخصصان سیستمهای مقیاس رک (Rack-scale) در کارلسبد کالیفرنیا به d-Matrix پیوستند. لازم به ذکر است که GigaIO همچنان در حوزه محاسبات لبه بهصورت مستقل به فعالیت خود ادامه میدهد. این رویکرد به دنبال بهینهسازی جریان داده در مقیاس شبکه است، مشابه آنچه شرکت Xsight Labs برای تغییر معماری شبکه مراکز داده دنبال میکند.
این توسعه تهاجمی توسط سرمایه ۲۷۵ میلیون دلاری دور سری C که در ۱۲ نوامبر ۲۰۲۵ بسته شد و ارزش شرکت را به ۲ میلیارد دلار رساند، تأمین شده است. این دور سرمایهگذاری توسط BullhoundCapital, Triatomic Capital و Temasek رهبری شد. علاوه بر این، d-Matrix یک مشارکت زیرساختی با تأخیر کم با شرکت Infineon برقرار کرده است.
شتابدهندههای Corsair در ۹ ژوئن ۲۰۲۶ وارد تولید انبوه شدند. مشخصات فنی این سختافزار عبارت است از:
- تولید توسط Alchip بر روی گره N6 شرکت TSMC.
- استفاده از چیپلتهای محاسباتی در حافظه (In-memory compute chiplets) مبتنی بر SRAM روی زیرلایههای ارگانیک.
- بهرهگیری از حافظه LP-DDR5 به جای پشتههای HBM.
- حذف بستهبندی CoWoS و استفاده از رکینگهای خنکشونده با هوا برای کاهش پیچیدگی و هزینه.
چرخش کلی در صنعت
خرید لایهی استقرار در حال تبدیل شدن به استراتژی استاندارد (Playbook) برای فروشندگان سختافزاری است که رقیب انویدیا هستند. در جولای ۲۰۲۶، Qualcomm شرکت Modular را در یک معامله تمامسهامی خرید که هدف از این اقدام کنترل پل ارتباطی بین تراشه و برنامهنویس بود، Nscale شرکت Anyscale را تصاحب کرد تا در پشته محاسباتی به سطوح بالاتر صعود کند و Nebius با قراردادی ۶۴۳ میلیون دلاری با Eigen AI موافقت کرد تا زیرساخت استنتاج خود را تقویت کند. در واقع، سختافزاری که برای کاربردی شدن به یک پشته نرمافزاری شخص ثالث نیاز دارد، نمیتواند با سختافزاری رقابت کند که با یک پشته نرمافزاری یکپارچه عرضه میشود.
اعتبار این رویکرد در دنیای واقعی توسط Parasail (یک ابر استنتاج) در حال مشاهده است. در ۷ جولای ۲۰۲۶، Parasail استقرار Corsair را در کنار ناوگان Hopper و Blackwell انویدیا در بیش از ۴۰ مرکز داده در ۱۵ کشور آغاز کرد. آنها با تقسیم پیشپُرکردن (Prefill) به GPU و رمزگشایی (Decode) به شتابدهندهها، دقیقاً همان گردشکاری را اجرا میکنند که d-Matrix اکنون با خرید Wallaroo آن را بهصورت داخلی در اختیار دارد، هرچند Parasail پیشتر از فناوری مسیریابی هسته (Kernel-routing) خود برای توزیع درخواستها استفاده میکرد.
همچنین بر اساس بنچمارکهای Gimlet Labs در ۱۱ مارس ۲۰۲۶، مدل gpt-oss-120b با یک مدل پیشنویس (Draft model) ۱.۶ میلیارد پارامتری تست شد. با انتقال مرحله رمزگشایی گمانهزنانه (Speculative Decoding) از GPU به Corsair و در عین حال نگه داشتن پیشپر و تاییدیه (Verification) روی GPU، این مؤسسه گزارش داد که سرعت درخواستهای سرتاسری ۲ تا ۱۰ برابر افزایش یافته است، در حالی که بهرهوری انرژی یکسان باقی ماند. سودیپ بهوجا (Sudeep Bhoja)، مدیر فنی d-Matrix، یکی از نویسندگان این مطالعه بود.
برای خریداران سازمانی، ارزش یک رک سختافزاری ترکیبی دیگر با حداکثر ترافلاپس (TFLOPS) سنجیده نمیشود، بلکه معیار اصلی این است که یک مدل با چه سرعتی از مرحله ارزیابی به سرویسدهی ترافیک زنده میرسد. در حالی که d-Matrix مهندسانی را برای ترکیب این دو سازمان استخدام میکند، زمانسنج این سرعت استقرار اکنون بر روی نرمافزاری میچرخد که d-Matrix مالک آن است.
گام بعدی شما
- اگر از زیرساختهای ترکیبی استفاده میکنید، روی ابزارهای سازماندهی (Orchestration) متمرکز شوید تا گلوگاههای رمزگشایی را شناسایی کنید.
- بررسی کنید آیا مدلهای شما در محدوده ترافیک زیر ۱٪ (درخواستهای بسیار حجیم) دچار توقف در صف میشوند یا خیر.
- چشم خود را به ادغامهای مشابه بین سازندگان ASIC و شرکتهای لایه نرمافزاری بدHyld، زیرا استانداردهای استقرار در حال تغییر است.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما درباره تراشههای Blackwell مراجعه کنید.




گفتگو