تصور کنید یک مدیر محصول هستید که میبیند کاربرانش بهدلیل چند میلیثانیه تأخیر در دریافت جواب، از ابزار هوش مصنوعی او فاصله میگیرند. برای پراپلکسیتی (Perplexity)، حذف این وقفههای کوتاه، مرز بین یک ابزار کاربردی و یک تجربه ناامیدکننده است. برای از بین بردن این تأخیرهای میلیثانیهای که کاربران هوش مصنوعی را کلافه میکند، پراپلکسیتی به یک زیرساخت با توان عملیاتی بالا نیاز داشت.
به نقل از بیانیه رسمی این شرکت، در ۱۵ سپتامبر ۲۰۲۶، قراردادی چندساله میان پراپلکسیتی و Crusoe Cloud امضا شد تا تمام مراحل چرخه حیات مدل — از آموزش (Training) تا تولید و استقرار (Production) — به این زیرساخت منتقل شود. این جابجایی در حالی رخ میدهد که شرکتهای هوش مصنوعی از بنچمارکهای تئوریک به سمت واقعیت سختِ مقیاس تولید حرکت میکنند. همانطور که در تحلیل قبلی ما دربارهی ادغام مدلهای Gemini گوگل در محتواهای پربیننده مانند ویدیوهای MrBeast اشاره کردیم، تمرکز در این قرارداد بر لایهی مخالف پشته (Stack) است: یعنی محاسبات خام و برق مورد نیاز برای پاسخ به میلیونها پرسش در لحظه. این گام زیرساختی در ادامه نزدیکی استراتژیک این شرکت با غولهای سختافزاری است، بهویژه پس از آنکه اخبار مذاکرات انویدیا برای سرمایهگذاری در پراپلکسیتی با ارزشگذاری ۳۰ میلیارد دلاری منتشر شد.
آراویند سرینیواس، مدیرعامل پراپلکسیتی، تأکید کرد که در مقیاس فعلی آنها، هر میلیثانیه تأخیر (Latency) — یعنی همان فاصله زمانی بین ارسال درخواست و دریافت اولین توکن — مستقیماً توسط کاربر حس میشود. این همکاری برای حل این محدودیت از طریق استنتاج (Inference) — که شبیه لحظه آشپزی واقعی است، نه دورهی آموزش آشپز — با توان عملیاتی بالا و تأخیر کم طراحی شده است.
طبق اعلام چیس لاکمیلر، همبنیانگذار و مدیرعامل Crusoe، شرکتهای پیشرو در حوزه هوش مصنوعی به زیرساختی نیاز دارند که در تمام چرخه حیات مدل مقیاسپذیر باشد. او نقش Crusoe را به عنوان یک شریک کلیدی در ممکن ساختن آیندهی «یافتن پاسخها» توصیف کرد و گفت این همکاری «از اولین الکترون تا آخرین توکن» را پوشش میدهد.
پراپلکسیتی مدلهای پیشرو (Frontier Models) خود را روی خوشههای اختصاصی NVIDIA GB300 NVL72 آموزش میدهد. این سیستمها واحدهایی در مقیاس رک با خنککننده مایع هستند که ۷۲ پردازنده گرافیکی Blackwell Ultra و ۳۶ پردازنده Grace مبتنی بر Arm را یکپارچه میکنند. بر اساس مستندات انویدیا، این معماری پهنای باند NVLink را به ۱۳۰ ترابایت بر ثانیه و حافظه GPU را به ۲۰ ترابایت میرساند.
مشخصات فنی دقیق GB300 NVL72 شامل موارد زیر است:
- محاسبات: ۲۵۹۲ هسته CPU Arm Neoverse V2 و ۳۷ ترابایت حافظه سریع.
- اتصالات: ۸۰۰ گیگابیت بر ثانیه برای هر GPU از طریق ConnectX-8 SuperNIC IO، با بهرهگیری از Quantum-X800 InfiniBand یا Spectrum-X Ethernet.
- عملکرد: انویدیا ادعا میکند خروجی «کارخانه هوش مصنوعی» در این پلتفرم تا ۵۰ برابر بیشتر از پلتفرمهای مبتنی بر Hopper است.
- بهرهوری: پیشبینی میشود پاسخدهی به کاربر (تعداد توکن در ثانیه به ازای هر کاربر) ۱۰ برابر و توان عملیاتی (Throughput) به ازای هر مگاوات برق ۵ برابر نسبت به Hopper بهبود یابد.
دایون هریس از انویدیا افزود که ترکیب GB300 NVL72 و NVIDIA InfiniBand به پراپلکسیتی اجازه میدهد مدلها را با سرعتی آموزش دهد، تنظیم دقیق (Fine-tuning) کند — شبیه وقتی که به یک پزشک عمومی تخصص پوست میدهیم تا روی یک حوزه دقیق شود — و آنها را برای عاملهای هوش مصنوعی (AI Agents) مستقر کند.
در بخش تولید، پراپلکسیتی از Crusoe Managed Inference استفاده میکند. این سرویس که در ۲۰ نوامبر ۲۰۲۵ بهصورت عمومی عرضه شد، بر موتور اختصاصی MemoryAlloy متکی است. این موتور با ایجاد یک حافظه موقت (Cache) کلید-مقدار (Key-Value) در سطح خوشه، از تکرار پیشپُرکردن (Prefill) جلوگیری میکند؛ زیرا به GPUها اجازه میدهد حافظههای پیشوند (Prefix Caches) را از گرههای محلی و دوردست فراخوانی کنند. طبق ادعای Crusoe، این موتور در مدلهای Llama-3.3-70B در یک استقرار چهار گرهای، زمان تا نخستین توکن را ۹.۹ برابر سریعتر و توان عملیاتی را ۵ برابر بیشتر از vLLM میکند.
گزینههای استقرار در این سرویس عبارتند از:
- استنتاج بدون سرور (Serverless Inference): مصرف بر اساس استفاده از مدلهای باز از طریق API برای حجمهای کاری مراحل اولیه و آزمایشهای سریع.
- استقرارهای خودسرویس (Self-Serve Deployments): مدلهای بهینهشده برای توان عملیاتی یا پاسخدهی سریع، شامل مدلهایی که از Serverless Fine-Tuning شرکت Crusoe استفاده میکنند.
- استقرارهای سفارشی (Tailored Deployments): نقاط انتهایی (Endpoints) اختصاصی و بنچمارک شده که بهطور خاص برای مدلهای انحصاری طراحی شدهاند.
توسعهدهندگان از طریق Crusoe Intelligence Foundry به این ابزارها دسترسی دارند تا کلیدهای API را مدیریت کنند، متریکها را رصد نمایند و توان عملیاتی رزرو شده (Provisioned Throughput) را فعال کنند. این مرکز از مدلهای آزمایشگاههای مختلف از جمله Meta, OpenAI, Google, DeepSeek, Z.ai, Alibaba و NVIDIA پشتیبانی میکند.
علاوه بر این، Crusoe در حال ادغام پراپلکسیتی در عملیات شرکتی خود است. این شرکت در حال استقرار نسخههای Perplexity Enterprise Pro و Max برای ۱۸۰۰ کارمند خود است تا از آنها برای جستوجوی دانش داخلی، تحقیقات چندمرحلهای، تحلیل دادهها و دسترسی به مدلهای پیشرو استفاده کند.
این شراکت نشاندهنده چرخش به سمت «ادغام عمودی» در آزمایشگاههای هوش مصنوعی است. پراپلکسیتی با کنترل زیرساخت «از اولین الکترون تا آخرین توکن» (به گفته چیس لاکمیلر)، وابستگی خود به ارائهدهندگان عمومی ابر را که ممکن است برای نیازهای شدید تأخیرِ یک موتور جستوجوی هوش مصنوعی بهینه نشده باشند، کاهش میدهد. در این مسیر، پایداری زیرساختها به یک اولویت تبدیل شده است، مشابه رویکرد شرکتهایی نظیر Empirik که برای پیشبینی قطعی زیرساختها سرمایهگذاری جذب کرده است تا از توقفات ناگهانی در مقیاس تولید جلوگیری شود.
برای کاربر نهایی، این یعنی فاصله بین پرسیدن سؤال و دریافت پاسخ کوتاه میشود. در دنیای مدلهای عاملمحور (Agentic AI) که مدلها چندین گام را در پسزمینه اجرا میکنند، هر میلیثانیه صرفهجویی شده، اثر مرکب میگذارد و تجربه کاربری را بهشدت سریعتر میکند.
اگر در حال ساخت یک محصول هوش مصنوعی در مقیاس تولید هستید، درس این اتفاق این است که مدل تنها نیمی از نبرد است. مزیت رقابتی واقعی اکنون در گرو حرکت به سمت خوشههای سختافزاری تخصصی و لایههای حافظه موقت انحصاری مثل MemoryAlloy است تا هزینهها با رشد ترافیک کنترل شوند.
باید منتظر ماند و دید سایر شرکتهای هوش مصنوعی متمرکز بر جستوجو چگونه به این بازی زیرساختی پاسخ میدهند، بهویژه زمانی که سختافزار Blackwell Ultra انویدیا به استاندارد جدید برای استنتاج در مقیاس تولید تبدیل شود.
گام بعدی شما
- اگر از vLLM برای استقرار مدل استفاده میکنید، معماریهای مبتنی بر KV Cache توزیعشده را بررسی کنید تا گلوگاههای استنتاج را بشناسید.
- روی کاهش زمان تا نخستین توکن (TTFT) به عنوان یک شاخص کلیدی تجربه کاربری تمرکز کنید.
- استراتژیهای ادغام عمودی (سختافزار-نرمافزار) را در نقشه راه مقیاسدهی محصول خود بگنجانید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو