پرش به محتوای اصلی
پرش به محتوای مقاله

«تقلیل پیچیدگی عملیاتی»؛ هدف d-Matrix از خرید شرکت Wallaroo.ai

·۱۲ مرداد ۱۴۰۵۴ دقیقه مطالعه۱ بازدید
خرید والارو توسط دی-ماتریکس برای هماهنگ‌سازی استنتاج در میان تراشه‌ها
خرید والارو توسط دی-ماتریکس برای هماهنگ‌سازی استنتاج در میان تراشه‌ها
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

انتقال استراتژی از «تولید تراشه سریع‌تر» به «یکپارچه‌سازی عمودی لایه استقرار». d-Matrix اکنون مالک سازوکاری است که می‌تواند ترافیک مدل‌ها را بر اساس حجم توکن‌ها بین GPU و ASIC توزیع کند.

اگر شما یک مدیر زیرساخت هستید که با هزینه‌های سرسام‌آور و تأخیر در اجرای مدل‌های زبانی دست‌وپنجه نرم می‌کنید، باید بدانید که جنگ سخت‌افزاری اکنون به میدان نرم‌افزار منتقل شده است. قدرت خام تراشه‌ها دیگر کافی نیست؛ مسئله اصلی اکنون مدیریت هوشمندانه ترافیک داده‌ها در مقیاس واقعی است. اگرچه عملکرد خام تراشه حیاتی است، اما پیچیدگی عملیاتی اجرای هوش مصنوعی در مقیاس بالا به یک مسئله نرم‌افزاری تبدیل شده است.

به همین دلیل، شرکت d-Matrix مستقر در سانتا کلارا، در ۳ اوت ۲۰۲۶، متخصص سازمان‌دهی استنتاج، یعنی شرکت Wallaroo.ai را خرید تا شکاف بین سیلیکون و استقرار در دنیای واقعی را پر کند. این معامله باعث می‌شود پلتفرم، مالکیت معنوی و تیم مهندسی Wallaroo به‌طور کامل در ساختار این شرکت سازنده تراشه ادغام شوند.

بیشتر زیرساخت‌های فعلی بر پایه واحد پردازش گرافیکی (GPU) هستند. اما این تراشه‌ها در مرحله «رمزگشایی» (Decoding) — یعنی همان لحظه‌ای که مدل توکن‌ها را یکی‌یکی تولید می‌کند — دچار چالش می‌شوند. d-Matrix شتاب‌دهنده‌های Corsair را دقیقاً برای مدیریت این مرحله طراحی کرده است؛ در حالی که کارهای سنگین «پیش‌پر» (Prefill) را به GPU می‌سپارد. این رویکرد ترکیبی سیلیکونی در تئوری بسیار بهینه است، اما نیاز به یک «پلیس راهنمایی و رانندگی» پیچیده دارد تا تصمیم بگیرد کدام تراشه کدام بخش از یک درخواست را مدیریت کند، بستر داده‌های تجمیعه شده (Accumulated Context) را بین آن‌ها جابه‌جا کند و هر دو لایه را به‌صورت مستقل با تغییر ترافیک مقیاس‌بندی نماید.

اینجاست که Wallaroo وارد عمل می‌شود. طبق گفته این شرکت، این خرید یک محیط زمان-اجرا (Runtime) و یک صفحه کنترل (Control Plane) فراهم می‌کند که قادر است مدل‌ها را روی سخت‌افزارهای x86، Arm و GPU در محیط‌های ابری، لبه (Edge) یا حتی محیط‌های ایزوله (Air-gapped) مستقر کند. این پلتفرم همچنین از محیط‌های رایج مثل vLLM و SGLang پشتیبانی می‌کند. طبق اعلام d-Matrix، تخصص Wallaroo در معماری نرم‌افزار، محاسبات با کارایی بالا (HPC) و عملیات کوبرنتیز (Kubernetes) دلیل اصلی این خرید بوده است.

هم‌افزایی فنی و نتایج عملکردی

این دو شرکت پیش از خرید، دیدگاه مشترکی در مورد یک چشم‌انداز معماری داشتند. بر اساس پست مورخ ۱۶ مارس ۲۰۲۶، وید جین (Vid Jain)، مدیرعامل Wallaroo، و دو همکارش توضیح دادند که ترافیک عامل‌های هوش مصنوعی (Agentic Traffic) در سه اندازه متمایز می‌رسد:

  • حدود ۸۴٪ درخواست‌های کوتاه با طول تقریبی ۲,۰۰۰ توکن.
  • حدود ۱۵٪ در محدوده ۸,۰۰۰ تا ۶۴,۰۰۰ توکن.
  • کمتر از ۱٪ درخواست‌های حجیم شامل ۱۲۸,۰۰۰ توکن یا بیشتر.

همین مقدار اندک ترافیک (زیر ۱٪) می‌تواند تمام زمان GPU را به انحصار بگیرد و هر آنچه در صف انتظار است را مسدود کند. شرکت Wallaroo گزارش داد که با استفاده از مسیریابی آگاه از حافظه (Cache-aware routing) برای تقسیم این حجم از کاری، توانست «زمان تا نخستین توکن» (Time to First Token) را در بدترین حالت برای ترافیک عامل‌محور در تست‌های داخلی خود تا ۷۵٪ کاهش دهد.

سید شث (Sid Sheth)، بنیان‌گذار و مدیرعامل d-Matrix، بیان کرد که مشتریان، پیچیدگی عملیاتی را به عنوان مانع اصلی عملکرد شناسایی کرده‌اند. جین افزود که آن‌ها در این دیدگاه مشترک بودند که استنتاج به همان اندازه که یک مسئله سخت‌افزاری است، یک مسئله استقرار (Deployment) نیز هست. این لایه نرم‌افزاری اجازه می‌دهد سخت‌افزار Corsair درخشان ظاهر شود و به‌طور مشخص از ۲ گیگابایت SRAM روی تراشه و پهنای باند حافظه ۱۵۰ ترابایت بر ثانیه بهره ببرد.

الگوی گسترش سریع

این دومین خرید d-Matrix در چهار ماه اخیر است. در آوریل ۲۰۲۶، این شرکت بخش مراکز داده GigaIO را خرید تا سیستم SuperNODE و ساختار حافظه مبتنی بر PCIe شرکت FabreX را به دست آورد. همچنین در این معامله، تیمی از متخصصان سیستم‌های مقیاس رک (Rack-scale) در کارلس‌بد کالیفرنیا به d-Matrix پیوستند. لازم به ذکر است که GigaIO همچنان در حوزه محاسبات لبه به‌صورت مستقل به فعالیت خود ادامه می‌دهد. این رویکرد به دنبال بهینه‌سازی جریان داده در مقیاس شبکه است، مشابه آنچه شرکت Xsight Labs برای تغییر معماری شبکه مراکز داده دنبال می‌کند.

این توسعه تهاجمی توسط سرمایه ۲۷۵ میلیون دلاری دور سری C که در ۱۲ نوامبر ۲۰۲۵ بسته شد و ارزش شرکت را به ۲ میلیارد دلار رساند، تأمین شده است. این دور سرمایه‌گذاری توسط BullhoundCapital, Triatomic Capital و Temasek رهبری شد. علاوه بر این، d-Matrix یک مشارکت زیرساختی با تأخیر کم با شرکت Infineon برقرار کرده است.

شتاب‌دهنده‌های Corsair در ۹ ژوئن ۲۰۲۶ وارد تولید انبوه شدند. مشخصات فنی این سخت‌افزار عبارت است از:

  • تولید توسط Alchip بر روی گره N6 شرکت TSMC.
  • استفاده از چیپلت‌های محاسباتی در حافظه (In-memory compute chiplets) مبتنی بر SRAM روی زیرلایه‌های ارگانیک.
  • بهره‌گیری از حافظه LP-DDR5 به جای پشته‌های HBM.
  • حذف بسته‌بندی CoWoS و استفاده از رکینگ‌های خنک‌شونده با هوا برای کاهش پیچیدگی و هزینه.

چرخش کلی در صنعت

خرید لایه‌ی استقرار در حال تبدیل شدن به استراتژی استاندارد (Playbook) برای فروشندگان سخت‌افزاری است که رقیب انویدیا هستند. در جولای ۲۰۲۶، Qualcomm شرکت Modular را در یک معامله تمام‌سهامی خرید که هدف از این اقدام کنترل پل ارتباطی بین تراشه و برنامه‌نویس بود، Nscale شرکت Anyscale را تصاحب کرد تا در پشته محاسباتی به سطوح بالاتر صعود کند و Nebius با قراردادی ۶۴۳ میلیون دلاری با Eigen AI موافقت کرد تا زیرساخت استنتاج خود را تقویت کند. در واقع، سخت‌افزاری که برای کاربردی شدن به یک پشته نرم‌افزاری شخص ثالث نیاز دارد، نمی‌تواند با سخت‌افزاری رقابت کند که با یک پشته نرم‌افزاری یکپارچه عرضه می‌شود.

اعتبار این رویکرد در دنیای واقعی توسط Parasail (یک ابر استنتاج) در حال مشاهده است. در ۷ جولای ۲۰۲۶، Parasail استقرار Corsair را در کنار ناوگان Hopper و Blackwell انویدیا در بیش از ۴۰ مرکز داده در ۱۵ کشور آغاز کرد. آن‌ها با تقسیم پیش‌پُرکردن (Prefill) به GPU و رمزگشایی (Decode) به شتاب‌دهنده‌ها، دقیقاً همان گردش‌کاری را اجرا می‌کنند که d-Matrix اکنون با خرید Wallaroo آن را به‌صورت داخلی در اختیار دارد، هرچند Parasail پیش‌تر از فناوری مسیریابی هسته (Kernel-routing) خود برای توزیع درخواست‌ها استفاده می‌کرد.

همچنین بر اساس بنچ‌مارک‌های Gimlet Labs در ۱۱ مارس ۲۰۲۶، مدل gpt-oss-120b با یک مدل پیش‌نویس (Draft model) ۱.۶ میلیارد پارامتری تست شد. با انتقال مرحله رمزگشایی گمانه‌زنانه (Speculative Decoding) از GPU به Corsair و در عین حال نگه داشتن پیش‌پر و تاییدیه (Verification) روی GPU، این مؤسسه گزارش داد که سرعت درخواست‌های سرتاسری ۲ تا ۱۰ برابر افزایش یافته است، در حالی که بهره‌وری انرژی یکسان باقی ماند. سودیپ بهوجا (Sudeep Bhoja)، مدیر فنی d-Matrix، یکی از نویسندگان این مطالعه بود.

برای خریداران سازمانی، ارزش یک رک سخت‌افزاری ترکیبی دیگر با حداکثر ترافلاپس (TFLOPS) سنجیده نمی‌شود، بلکه معیار اصلی این است که یک مدل با چه سرعتی از مرحله ارزیابی به سرویس‌دهی ترافیک زنده می‌رسد. در حالی که d-Matrix مهندسانی را برای ترکیب این دو سازمان استخدام می‌کند، زمان‌سنج این سرعت استقرار اکنون بر روی نرم‌افزاری می‌چرخد که d-Matrix مالک آن است.

گام بعدی شما

  • اگر از زیرساخت‌های ترکیبی استفاده می‌کنید، روی ابزارهای سازمان‌دهی (Orchestration) متمرکز شوید تا گلوگاه‌های رمزگشایی را شناسایی کنید.
  • بررسی کنید آیا مدل‌های شما در محدوده ترافیک زیر ۱٪ (درخواست‌های بسیار حجیم) دچار توقف در صف می‌شوند یا خیر.
  • چشم خود را به ادغامهای مشابه بین سازندگان ASIC و شرکت‌های لایه نرم‌افزاری بدHyld، زیرا استانداردهای استقرار در حال تغییر است.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این معامله نشان می‌دهد که برای رقابت با انویدیا، داشتن سخت‌افزاری بهینه کافی نیست و لایه‌ی نرم‌افزاری مدیریت ترافیک (Orchestration) به یک ضرورت تبدیل شده است. این تغییر باعث می‌شود سازمان‌ها بتوانند با ترکیب تراشه‌ها، هزینه‌های استنتاج را بدون افت کیفیت کاهش دهند.

تأثیر برای ایران

این تحولات بیشتر برای پژوهشگران زیرساخت‌های مدل‌های بنیادی اهمیت دارد تا بازار مصرف ایران؛ چرا که دسترسی به این سخت‌افزارها برای شرکت‌های داخلی محدود است و تأثیری بر APIs جاری ندارد.

·نگاه ما
تحریریه دات‌هوش

بسیاری از تلاش‌های سخت‌افزاری برای جایگزینی انویدیا در سطح سیلیکون شکست می‌خورند چون نادیده می‌گیرند که CUDA یک مزیت سخت‌افزاری نیست، بلکه یک مزیت اکوسیستمی است. d-Matrix با خرید Wallaroo، در واقع در حال خرید «زبان مشترک» برای صحبت با مراکز داده است. این حرکت نشان می‌دهد که در سال ۲۰۲۶، برنده میدان کسی نیست که سریع‌ترین تراشه را دارد، بلکه کسی است که کمترین اصطکاک را در مسیر استقرار مدل ایجاد کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.