وقتی هزینه هر توکن تولیدشده در مدلهای زبانی بزرگ برای شرکتها به یک بحران مالی تبدیل شود، سختافزار عمومی دیگر پاسخگو نیست. اگر امروز برای اجرای مدلهای سنگین از GPUهای گرانقیمت استفاده میکنید، باید بدانید که یک بازی جدید در حال شکلگیری است تا هزینههای استنتاج را به شدت کاهش دهد.
طبق اعلام رابرت واچن (COO شرکت)، استارتآپ Etched پس از جذب ۳۰۰ میلیون دلار سرمایه در راند Series C، به ارزش ۱۰.۳ میلیارد دلاری رسید. این شرکت روی این فرضیه شرطبندی کرده است که واحدهای پردازش گرافیکی (GPU) — که ابزارهایی همهکاره هستند — برای عصر هوش مصنوعی بیش از حد ناکارآمدند. این رشد سریع در حالی رخ میدهد که کل صنعت با هزینههای عظیم انرژی و پردازشی برای اجرای مدلهای زبانی بزرگ (LLM) دستوپنجه نرم میکند.
در حالی که انویدیا ابزارهای منعطفی برای آموزش مدلها میدهد، Etched در حال ساخت یک «بزرگراه اختصاصی» برای مرحلهی استنتاج (Inference) است؛ یعنی همان فرآیند تولید پاسخ پس از ارسال پرامپت توسط کاربر. برای درک بهتر، تفاوت این دو را شبیه به تفاوت بین یک چاقوی سوئیسی و یک تیغ جراحی حرفهای تصور کنید. اکثر سختافزارهای هوش مصنوعی سعی میکنند هر کاری را انجام دهند، اما Etched صرفاً بر روی الگوهای ریاضی معماریهای ترنسفورمر تمرکز کرده است.
همانطور که در تحلیلهای قبلی ما دربارهی بهینهسازی هزینههای استنتاج اشاره کردیم، صنعت در حال گذار از سختافزارهای عمومی به سمت ASICهاست. رشد Etched انفجاری بوده است؛ ارزش این شرکت از ۵ میلیارد دلار در دسامبر ۲۰۲۳ — زمانی که راند ۵۰۰ میلیون دلاری خود را جمعآوری کرد — به بیش از ۱۰ میلیارد دلار در تنها هفت ماه رسید. به گزارش منابع صنعتی، این بالاترین ارزشی است که تاکنون برای یک راند Series C تحت هدایت Sequoia ثبت شده است.
زمینه و سرمایهگذاری
بر اساس مستندات این شرکت، راند جدید سرمایه (Series C) توسط Sequoia رهبری شد و مجموعهای از نامهای重量دار و شرکتهای معتبر در آن حضور داشتند. این لیست شامل Andreessen Horowitz، SK Hynix، Jane Street و Diffusion Capital در کنار سرمایهگذاران قبلی است. حضور شرکتهایی مانند SK Hynix در این لیست با استراتژیهای گستردهتر این غول حافظه در بازار آمریکا همسو است، چرا که این شرکت با برنامهی IPO ۲۸ میلیارد دلاری خود بهدنبال تأمین سرمایه برای مدیریت بحران کمبود حافظههای AI است. همچنین حامیان این شرکت شامل چهرههای برجستهای نظیر پیتر تیل، اندری کارپاتی، دیلن فیلد و امجاد مساد است.
Etched در سال ۲۰۲۲ فعالیت خود را آغاز کرد؛ زمانی که ایده ساخت تراشهای که صرفاً برای تکنولوژی ترنسفورمر — معماری زیربنایی ChatGPT و Claude — طراحی شده باشد، یک ایده «وحشیانه» یا «عجیب و غریب» (wacky) به نظر میرسید. با این حال، با وجود تمام شککها، شرکت اعلام کرده که تولید تراشههای بومی خود را با موفقیت به سرانجام رسانده و تاکنون سفارشاتی به ارزش ۱ میلیارد دلار را ثبت کرده است.
جزئیات پیشرفت سختافزاری
به گزارش TechCrunch، فرآیند استنتاج در دو مرحله اصلی ساخته میشود: پیشپُرکردن (Prefill) و رمزگشایی (Decoding). شرکت Etched برای رفع گلوگاههای موجود در هر یک از این مراحل، دو جزء مجزای سختافزاری را از پایه طراحی کرده است:
- تراشه پیشپُرکردن (Prefill Chip): این جزء مسئول درک اولیه پرامپت است که از نظر ریاضی و محاسباتی بسیار سنگین است. این تراشه از تکنولوژی «استنتاج کمولتاژ» استفاده میکند. این روش گرمای کمتری تولید میکند و در نتیجه اجازه میدهد ترانزیستورهای بیشتری در تراشه جای بگیرند، که باعث میشود سرعت آن نسبت به تراشههای استاندارد هوش مصنوعی بهطور چشمگیری افزایش یابد.
- حافظه در مقیاس خوشه (Cluster Scale Memory): برای مدیریت مرحله رمزگشایی — که توکنهای خروجی را تولید میکند و نیازمند حافظهای عظیم است — Etched نوع جدیدی از تکنولوژی حافظه و interconnect ابداع کرده است. این نوآوری اجازه میدهد تا تعداد زیادی تراشه به یکدیگر متصل شده و از یک استخر حافظه مشترک با سرعت بسیار بالا و تأخیر (latency) بسیار کم استفاده کنند.
رابرت واچن توضیح میدهد که این سیستمها برخلاف تصور عموم که فکر میکنند فقط برای مدلهای زبانی خاصی طراحی شدهاند، انعطافپذیری کافی برای اجرای هر مدل هوش مصنوعی را دارند. این مدلها شامل موارد زیر است:
- ترکیب خبرهها (Mixture of Experts یا MoE): معماریهایی مانند DeepSeek و Qwen که وظایف را بین زیرمدلهای تخصصی تقسیم میکنند.
- طرحهای غیرترنسفورمری: معماریهایی مانند Mamba که بر پایه مدلهای فضای حالت (state-space models) ساخته شدهاند.
از گاراژ تا مراکز داده
سفر به این ارزش میلیاردی از سال ۲۰۲۲ آغاز شد. بنیانگذاران شرکت یعنی گاوین اوبرتی (CEO)، رابرت واچن و کریس ژو (CTO)، مسیر مشهوری را طی کردند و تحصیل در دانشگاه هاروارد را رها کردند تا این شرکت را تأسیس کنند. در روزهای ابتدایی، آنها هیچ ایدهای نداشتند که چگونه مبالغ هنگفت مورد نیاز برای تولید تراشه را جذب کنند یا چگونه نیروهای متخصص استخدام نمایند.
واچن به یاد میآورد که وقتی به منطقه خلیج سانفرانسیسکو رسید، نه دفتر داشت و نه آپارتمانی؛ او روی زمین خانه یکی از دوستانش که هیچ وسیلهای نداشت میخوابید و از یک حوله به جای پتو استفاده میکرد. در آن دوران، آنها سرورهای ابزارهای طراحی تراشه خود را در گاراژ یکی از کارکنان اولیه مستقر کردند. واچن با خنده میگوید هر بار که سیستم نیاز به ریبوت (راه-اندازی مجدد) داشت، همسر آن کارمند مجبور بود به گاراژ برود و دکمه ریبوت را فشار دهد.
امروز این عملیات به شدت مقیاسبندی شده است. Etched اکنون ۴۰۰ کارمند دارد و یک مرکز داده ۲ مگاواتی را اداره میکند. واچن به شوخی میگوید که بالاخره یک تشک و چندین بالش دارد، هرچند اعتراف میکند که تیم آنها هنوز باید در برابر سختیهای مسیر برای رسیدن به مقیاس کامل تولید، متواضع بمانند.
شکاف شکاکیت
برای سالها، منتقدان میگفتند ایدهی «حک کردن» (Etching) منطق ترنسفورمر روی سیلیکون بیش از حد ریسکی است. با این حال، این روند در حال تبدیل شدن به جریان اصلی (mainstream) است؛ گزارشها حاکی از آن است که گوگل نیز با تراشه Frozen v2 برای Gemini، مفهوم مشابهی را دنبال میکند.
به دلیل اینکه دسترسی به سیستمهای Etched تا کنون محدود به سرمایهگذاران و مشتریان اولیه بوده، شکاکیتها حتی پس از اعلام خبر تولید اولین سری تراشهها توسط TSMC ادامه یافت. برای پر کردن این شکاف، Etched دموهای خصوصی را در دفتر خود برگزار کرد. واچن اشاره میکند که چهرههای برجستهای مانند اندری کارپاتی (از Anthropic)، نوآم براون (از OpenAI) و جفری هینتون شخصاً سختافزار را تست کردهاند و از نتایج آن «بسیار هیجانزده» هستند.
پیامدهای بازار
برای کاربر نهایی، این تغییر به سمت سیلیکونهای تخصصی استنتاج به این معناست که پاسخهای هوش مصنوعی میتوانند بهطور قابلتوجهی ارزانتر و سریعتر شوند. اگر Etched بتواند سیستمهای رک (rack) خود را بهصورت انبوه تولید و به مشتریان تحویل دهد، وابستگی صنعت به GPUهای گرانقیمت و پرمصرف برای استقرار مدلها خواهد شکست.
این موضوع نشان میدهد که «خندق دفاعی» (moat) انویدیا نه در خودِ تراشه، بلکه در اکوسیستم نرمافزاری آن است. Etched با بهینهسازی سختافزاری برای غالبترین معماری فعلی (ترنسفورمر)، تلاش میکند تا از نظر بهرهوری مطلق، شرکتهای پیشرو را شکست دهد.
باید منتظر اعلام تاریخهای اولین تحویل تولید انبوه و گزارشهای بنچمارک عمومی از سوی مشتریان اولیه بود تا مشخص شود آیا ادعاهای مربوط به «ولتاژ پایین» واقعاً به کاهش هزینههای واقعی در دنیای عملی تبدیل میشود یا خیر.
گام بعدی شما
- گزارشهای بنچمارک عمومی مشتریان اولیه Etched را دنبال کنید تا ببینید ادعای «ولتاژ پایین» در عمل چقدر هزینه استنتاج را کاهش میدهد.
- اگر در حال طراحی زیرساخت استقرار مدل هستید، تفاوت بین ASICهای تخصصی و GPUهای عمومی را در مدلهای هزینه (TCO) خود لحاظ کنید.
- تحولات مربوط به تراشههای اختصاصی گوگل (Frozen v2) را رصد کنید تا بفهمید آیا غولهای فناوری نیز به سمت سختافزارهای غیرمنعطف میروند یا خیر.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell انویدیا مراجعه کنید.




گفتگو