اگر امروز هزینههای استنتاج مدلهای زبانی در مقیاس سازمانی برای شما کمرشکن است، این همکاری میتواند بازی را تغییر دهد. طبق اعلام رسمی در ۸ سپتامبر ۲۰۲۶، کوالکام (Qualcomm) و آمازون وب سرویسز (AWS) وارد یک مشارکت چندنسلی شدند تا سختافزاری طراحی کنند که هم سریعتر باشد و هم برق کمتری مصرف کند. آمازون پیش از این تراشههای سفارشی برای استنتاج هوش مصنوعی در مقیاس بزرگ را به یکی از ستونهای اصلی استراتژی زیرساختی خود تبدیل کرده بود و اکنون با این قرارداد، اکوسیستم سختافزاری خود را گسترش میدهد.
این توافق در حالی رخ میدهد که صنعت هوش مصنوعی با دیوارِ مصرف انرژی برخورد کرده است. در حالی که GPUها موتور محرک این موج بودند، هزینه برق برای اجرای مدلها در مقیاس وسیع، غولهای ابری را مجبور کرده تا به سمت تراشههای اختصاصی بروند؛ درست مثل جایگزین کردن یک موتور بنزینی پرمصرف با یک موتور برقی مهندسیشده و دقیق برای مدیریت مرکز داده. این تلاش برای استقلال سختافزاری در حالی صورت میگیرد که انویدیا استراتژیهای پیچیدهای را برای حفظ سلطه خود بر مراکز داده و جلوگیری از استقلال غولهای فناوری در پیش گرفته است.
زمینه استراتژیک
کوالکام این توافق را در چارچوب تقاضاهای شدید بارهای کاری در حال رشد هوش مصنوعی تعریف کرده است. گسترش این بارهای کاری، تقاضایی فوری و حیاتی برای توان محاسباتی، ذخیرهسازی، شبکهسازی، پهنای باند حافظه و زیرساختهای بهینه از نظر انرژی ایجاد کرده است.
این همکاری، زیرساختهای هوش مصنوعی آمازون را با تخصص کوالکام در پردازشهای کممصرف، طراحی سیلیکون و یکپارچهسازی در سطح سیستم پیوند میزند. به نقل از پراساد کالیانارامان، نایبرئیس AWS، هدف این همکاری ارائه زیرساختی است که برای مشتریان هم کارآمدتر باشد و هم هزینه کمتری داشته باشد. همانطور که در تحلیلهای قبلی ما دربارهی بهینهسازی سختافزاری مدلهای بازمتن اشاره کردیم، کاهش وابستگی به سختافزارهای عمومی، تنها راه بقای اقتصادی مراکز داده است.
بر اساس گزارش unite.ai، این مشارکت روی دو محور فنی متمرکز است:
تراشههای اختصاصی و محاسبات
- استنتاج (Inference) — لحظهای که مدل واقعاً جواب تولید میکند، شبیه خودِ آشپزی و نه دورهی آموزش آشپز — در این پروژه با طراحی تراشههای سفارشی برای چندین نسل آینده بهینهتر میشود.
- بهرهوری انرژی: هدف این است که مقیاس عظیم آمازون با تاریخچه کوالکام در پردازشهای کممصرف ترکیب شود تا ردپای انرژی خوشههای عظیم هوش مصنوعی کاهش یابد.
- چشمانداز مدیریتی: کریستیانو آمون، مدیرعامل کوالکام، تأکید کرد که زیرساختهای مرکز داده برای رسیدن به عملکرد بالاتر با بهرهوری بیشتر، همزمان به پیشرفت در هر دو حوزه محاسبات و اتصال نیاز دارند.
اتصال با سرعت بالا
- راهکارهای نوری: این همکاری شامل اتصال نوری تا ۱.۶ ترابیت (1.6T) و همچنین راهکارهای اتصال برای نسلهای آینده است.
- تکنولوژی هسته: کوالکام از فناوریهای SerDes و DSP نوری خود برای ایجاد اتصالات با پهنای باند بالا در شبکههای آمازون استفاده میکند.
- دامنه فنی: این زیرساخت از سبد محصولات گستردهای شامل اتصالات Die-to-Die، مسی، نوری و اتصالات Campus-reach بهره میبرد که با استفاده از PAM4 و coherent-lite DSP، بردهای ارتباطی تا ۲۰ کیلومتر را پوشش میدهد. این پیشرفت در لایه اتصال، پاسخی به چالشهای مقیاسپذیری است که پروژههایی مانند Cloverleaf نیز سعی دارند با بهینهسازی خوشههای محاسباتی آنها را حل کنند.
این استراتژی بخشی از تهاجم گسترده کوالکام به بازار مراکز داده است. در روز سرمایهگذاران (۲۴ ژوئن ۲۰۲۶) در نیویورک، کوالکام از نقشه راه خود پرده برداشت که شامل Dragonfly C1000 CPU (یک طراحی چیپلت ۲۵۰ هستهای با استفاده از هستههای Oryon که انتظار میرود در سال ۲۰۲۸ عرضه شود) و شتابدهنده استنتاج AI300 است.
به ادعای کوالکام، AI300 در زمینه پهنای باند حافظه به ازای هر وات در هر کارت، ۴ تا ۸ برابر عملکرد بهتری نسبت به معماریهای فعلی مبتنی بر GPU دارد. AI300 در واقع سومین نسل از پلتفرمهای سطح رک (Rack-level) است که پس از AI200 و AI250 عرضه میشود. علاوه بر این، انتظار میرود نمونههای High Bandwidth Compute Gen 1 با تراشه AI250 در اواسط سال ۲۰۲۷ عرضه شوند.
نکته جالب این است که کوالکام در اینجا فقط تأمینکننده نیست، بلکه مشتری هم هست. این شرکت قصد دارد از Amazon Bedrock و سایر زیرساختهای هوش مصنوعی AWS برای مدیریت بارهای کاری اتوماسیون طراحی الکترونیکی (EDA) استفاده کند؛ هدفی که قصد دارد زمان لازم برای طراحی تراشههای جدید را بهطور قابل توجهی کوتاه کند.
برای مدیران کسبوکار، این اتفاق پایان عصر «یک سختافزار برای همه» (GPU-centric) است. ما وارد دورانی از ادغام عمودی میشویم که در آن ارائهدهنده ابر و طراح تراشه، نقشههای راه خود را یکی میکنند تا حتی چند سنت از هزینه هر پرسوجوی هوش مصنوعی کم کنند. این روند در قراردادهای دیگر کوالکام نیز دیده میشود، مانند توافق چندساله با متا برای تجهیز ناوگان سرورهای نسل بعد متا به Dragonfly C1000.
اگر کوالکام بتواند وعده خود را برای ارائه عملکردی بیش از دو برابر بنچمارکهای فعلی CPUهای سرور با C1000 عملی کند، هزینه اجرای مدلهای زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب میدهد — در مقیاس صنعتی بهشدت کاهش مییابد. این یعنی هوش مصنوعی پیشرفته برای کاربردهای سازمانی که پیشتر به دلیل هزینههای بالا غیرممکن بودند، در دسترستر میشود.
برای تأیید این ادعاها، باید منتظر عرضه تجاری AI300 در سال ۲۰۲۸ باشیم تا ببینیم آیا این بهرهوری انرژی در برابر سختافزارهای نسل بعد انویدیا دوام میآورد یا خیر.
گام بعدی شما
- اگر در حال برنامهریزی برای استقرار مدلهای سنگین در ابر هستید، تغییرات قیمت استنتاج در AWS را پس از عرضه AI300 رصد کنید.
- بررسی کنید که آیا مدلهای شما برای اجرا روی سختافزارهای غیر از GPU بهینهسازی شدهاند یا خیر.
- نقشه راه تراشههای Oryon را دنبال کنید تا زمان جایگزینی CPUهای سنتی در سرورهای خود را تخمین بزنید.
اما نبرد واقعی در لایه سختافزاری تازه آغاز شده است؛ برای درک اینکه انویدیا چگونه به این تهدید پاسخ میدهد، تحلیل ما درباره تراشههای Blackwell را بخوانید.




گفتگو