پرش به محتوای اصلی
پرش به محتوای مقاله

انتقال Perplexity به Crusoe چه تأثیری بر سرعت استنتاج مدل‌ها دارد؟

·۲۴ شهریور ۱۴۰۵۴ دقیقه مطالعه۲ بازدید
کروزو قرارداد چندساله برای تأمین قدرت پردازش آموزش و استنتاج پرپلکسیتی امضا کرد
کروزو قرارداد چندساله برای تأمین قدرت پردازش آموزش و استنتاج پرپلکسیتی امضا کرد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

انتقال کامل چرخه حیات مدل از آموزش تا استنتاج به یک زیرساخت تخصصی (به جای ابرهای عمومی) و استفاده از موتور MemoryAlloy برای حذف پیش‌پُرکردهای تکراری.

تصور کنید یک مدیر محصول هستید که می‌بیند کاربرانش به‌دلیل چند میلی‌ثانیه تأخیر در دریافت جواب، از ابزار هوش مصنوعی او فاصله می‌گیرند. برای پراپلکسیتی (Perplexity)، حذف این وقفه‌های کوتاه، مرز بین یک ابزار کاربردی و یک تجربه ناامیدکننده است. برای از بین بردن این تأخیرهای میلی‌ثانیه‌ای که کاربران هوش مصنوعی را کلافه می‌کند، پراپلکسیتی به یک زیرساخت با توان عملیاتی بالا نیاز داشت.

به نقل از بیانیه رسمی این شرکت، در ۱۵ سپتامبر ۲۰۲۶، قراردادی چندساله میان پراپلکسیتی و Crusoe Cloud امضا شد تا تمام مراحل چرخه حیات مدل — از آموزش (Training) تا تولید و استقرار (Production) — به این زیرساخت منتقل شود. این جابجایی در حالی رخ می‌دهد که شرکت‌های هوش مصنوعی از بنچمارک‌های تئوریک به سمت واقعیت سختِ مقیاس تولید حرکت می‌کنند. همان‌طور که در تحلیل قبلی ما درباره‌ی ادغام مدل‌های Gemini گوگل در محتواهای پربیننده مانند ویدیوهای MrBeast اشاره کردیم، تمرکز در این قرارداد بر لایه‌ی مخالف پشته (Stack) است: یعنی محاسبات خام و برق مورد نیاز برای پاسخ به میلیون‌ها پرسش در لحظه. این گام زیرساختی در ادامه نزدیکی استراتژیک این شرکت با غول‌های سخت‌افزاری است، به‌ویژه پس از آنکه اخبار مذاکرات انویدیا برای سرمایه‌گذاری در پراپلکسیتی با ارزش‌گذاری ۳۰ میلیارد دلاری منتشر شد.

آراویند سرینیواس، مدیرعامل پراپلکسیتی، تأکید کرد که در مقیاس فعلی آن‌ها، هر میلی‌ثانیه تأخیر (Latency) — یعنی همان فاصله زمانی بین ارسال درخواست و دریافت اولین توکن — مستقیماً توسط کاربر حس می‌شود. این همکاری برای حل این محدودیت از طریق استنتاج (Inference) — که شبیه لحظه آشپزی واقعی است، نه دوره‌ی آموزش آشپز — با توان عملیاتی بالا و تأخیر کم طراحی شده است.

طبق اعلام چیس لاک‌میلر، هم‌بنیان‌گذار و مدیرعامل Crusoe، شرکت‌های پیشرو در حوزه هوش مصنوعی به زیرساختی نیاز دارند که در تمام چرخه حیات مدل مقیاس‌پذیر باشد. او نقش Crusoe را به عنوان یک شریک کلیدی در ممکن ساختن آینده‌ی «یافتن پاسخ‌ها» توصیف کرد و گفت این همکاری «از اولین الکترون تا آخرین توکن» را پوشش می‌دهد.

پراپلکسیتی مدل‌های پیشرو (Frontier Models) خود را روی خوشه‌های اختصاصی NVIDIA GB300 NVL72 آموزش می‌دهد. این سیستم‌ها واحدهایی در مقیاس رک با خنک‌کننده مایع هستند که ۷۲ پردازنده گرافیکی Blackwell Ultra و ۳۶ پردازنده Grace مبتنی بر Arm را یکپارچه می‌کنند. بر اساس مستندات انویدیا، این معماری پهنای باند NVLink را به ۱۳۰ ترابایت بر ثانیه و حافظه GPU را به ۲۰ ترابایت می‌رساند.

مشخصات فنی دقیق GB300 NVL72 شامل موارد زیر است:

  • محاسبات: ۲۵۹۲ هسته CPU Arm Neoverse V2 و ۳۷ ترابایت حافظه سریع.
  • اتصالات: ۸۰۰ گیگابیت بر ثانیه برای هر GPU از طریق ConnectX-8 SuperNIC IO، با بهره‌گیری از Quantum-X800 InfiniBand یا Spectrum-X Ethernet.
  • عملکرد: انویدیا ادعا می‌کند خروجی «کارخانه هوش مصنوعی» در این پلتفرم تا ۵۰ برابر بیشتر از پلتفرم‌های مبتنی بر Hopper است.
  • بهره‌وری: پیش‌بینی می‌شود پاسخ‌دهی به کاربر (تعداد توکن در ثانیه به ازای هر کاربر) ۱۰ برابر و توان عملیاتی (Throughput) به ازای هر مگاوات برق ۵ برابر نسبت به Hopper بهبود یابد.

دایون هریس از انویدیا افزود که ترکیب GB300 NVL72 و NVIDIA InfiniBand به پراپلکسیتی اجازه می‌دهد مدل‌ها را با سرعتی آموزش دهد، تنظیم دقیق (Fine-tuning) کند — شبیه وقتی که به یک پزشک عمومی تخصص پوست می‌دهیم تا روی یک حوزه دقیق شود — و آن‌ها را برای عامل‌های هوش مصنوعی (AI Agents) مستقر کند.

در بخش تولید، پراپلکسیتی از Crusoe Managed Inference استفاده می‌کند. این سرویس که در ۲۰ نوامبر ۲۰۲۵ به‌صورت عمومی عرضه شد، بر موتور اختصاصی MemoryAlloy متکی است. این موتور با ایجاد یک حافظه موقت (Cache) کلید-مقدار (Key-Value) در سطح خوشه، از تکرار پیش‌پُرکردن (Prefill) جلوگیری می‌کند؛ زیرا به GPUها اجازه می‌دهد حافظه‌های پیشوند (Prefix Caches) را از گره‌های محلی و دوردست فراخوانی کنند. طبق ادعای Crusoe، این موتور در مدل‌های Llama-3.3-70B در یک استقرار چهار گره‌ای، زمان تا نخستین توکن را ۹.۹ برابر سریع‌تر و توان عملیاتی را ۵ برابر بیشتر از vLLM می‌کند.

گزینه‌های استقرار در این سرویس عبارتند از:

  • استنتاج بدون سرور (Serverless Inference): مصرف بر اساس استفاده از مدل‌های باز از طریق API برای حجم‌های کاری مراحل اولیه و آزمایش‌های سریع.
  • استقرارهای خودسرویس (Self-Serve Deployments): مدل‌های بهینه‌شده برای توان عملیاتی یا پاسخ‌دهی سریع، شامل مدل‌هایی که از Serverless Fine-Tuning شرکت Crusoe استفاده می‌کنند.
  • استقرارهای سفارشی (Tailored Deployments): نقاط انتهایی (Endpoints) اختصاصی و بنچ‌مارک شده که به‌طور خاص برای مدل‌های انحصاری طراحی شده‌اند.

توسعه‌دهندگان از طریق Crusoe Intelligence Foundry به این ابزارها دسترسی دارند تا کلیدهای API را مدیریت کنند، متریک‌ها را رصد نمایند و توان عملیاتی رزرو شده (Provisioned Throughput) را فعال کنند. این مرکز از مدل‌های آزمایشگاه‌های مختلف از جمله Meta, OpenAI, Google, DeepSeek, Z.ai, Alibaba و NVIDIA پشتیبانی می‌کند.

علاوه بر این، Crusoe در حال ادغام پراپلکسیتی در عملیات شرکتی خود است. این شرکت در حال استقرار نسخه‌های Perplexity Enterprise Pro و Max برای ۱۸۰۰ کارمند خود است تا از آن‌ها برای جست‌وجوی دانش داخلی، تحقیقات چندمرحله‌ای، تحلیل داده‌ها و دسترسی به مدل‌های پیشرو استفاده کند.

این شراکت نشان‌دهنده چرخش به سمت «ادغام عمودی» در آزمایشگاه‌های هوش مصنوعی است. پراپلکسیتی با کنترل زیرساخت «از اولین الکترون تا آخرین توکن» (به گفته چیس لاک‌میلر)، وابستگی خود به ارائه‌دهندگان عمومی ابر را که ممکن است برای نیازهای شدید تأخیرِ یک موتور جست‌وجوی هوش مصنوعی بهینه نشده باشند، کاهش می‌دهد. در این مسیر، پایداری زیرساخت‌ها به یک اولویت تبدیل شده است، مشابه رویکرد شرکت‌هایی نظیر Empirik که برای پیش‌بینی قطعی زیرساخت‌ها سرمایه‌گذاری جذب کرده است تا از توقفات ناگهانی در مقیاس تولید جلوگیری شود.

برای کاربر نهایی، این یعنی فاصله بین پرسیدن سؤال و دریافت پاسخ کوتاه می‌شود. در دنیای مدل‌های عامل‌محور (Agentic AI) که مدل‌ها چندین گام را در پس‌زمینه اجرا می‌کنند، هر میلی‌ثانیه صرفه‌جویی شده، اثر مرکب می‌گذارد و تجربه کاربری را به‌شدت سریع‌تر می‌کند.

اگر در حال ساخت یک محصول هوش مصنوعی در مقیاس تولید هستید، درس این اتفاق این است که مدل تنها نیمی از نبرد است. مزیت رقابتی واقعی اکنون در گرو حرکت به سمت خوشه‌های سخت‌افزاری تخصصی و لایه‌های حافظه موقت انحصاری مثل MemoryAlloy است تا هزینه‌ها با رشد ترافیک کنترل شوند.

باید منتظر ماند و دید سایر شرکت‌های هوش مصنوعی متمرکز بر جست‌وجو چگونه به این بازی زیرساختی پاسخ می‌دهند، به‌ویژه زمانی که سخت‌افزار Blackwell Ultra انویدیا به استاندارد جدید برای استنتاج در مقیاس تولید تبدیل شود.

گام بعدی شما

  • اگر از vLLM برای استقرار مدل استفاده می‌کنید، معماری‌های مبتنی بر KV Cache توزیع‌شده را بررسی کنید تا گلوگاه‌های استنتاج را بشناسید.
  • روی کاهش زمان تا نخستین توکن (TTFT) به عنوان یک شاخص کلیدی تجربه کاربری تمرکز کنید.
  • استراتژی‌های ادغام عمودی (سخت‌افزار-نرم‌افزار) را در نقشه راه مقیاس‌دهی محصول خود بگنجانید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این همکاری با تکیه بر تخصص سخت‌افزاری Crusoe و تراشه‌های Blackwell، استاندارد جدیدی برای سرعت پاسخ‌دهی در مقیاس میلیونی تعریف می‌کند. کاهش تأخیر در این سطح، پیش‌شرط لازم برای تبدیل چت‌بات‌ها به عامل‌های خودکار و سریع است.

تأثیر برای ایران

به‌دلیل تحریم‌ها و محدودیت‌های دسترسی به سخت‌افزارهای Blackwell، این تحول زیرساختی اثر مستقیمی بر توسعه‌دهندگان ایرانی ندارد و بیشتر یک رقابت استراتژیک بین غول‌های آمریکایی است.

·نگاه ما
تحریریه دات‌هوش

تمرکز پراپلکسیتی بر لایه سخت‌افزاری نشان می‌دهد که رقابت در موتورهای جست‌وجوی AI از «کیفیت مدل» به «بهینگی استنتاج» منتقل شده است. وقتی مدل‌ها به سطح اشباع کیفیت می‌رسند، برنده کسی است که بتواند پاسخ را سریع‌تر و ارزان‌تر به کاربر برساند. این حرکت، مدل‌های زبانی را از یک نرم‌افزار ابری به یک محصول سخت‌افزاری-نرم‌افزاری تبدیل می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.