پرش به محتوای اصلی
پرش به محتوای مقاله

Tenstorrent هزینه استنتاج صوتی را ۴ برابر کمتر از GPUهای انویدیا کرد

·۹ مهر ۱۴۰۵۵ دقیقه مطالعه۲ بازدید
عوامل صوتی محلی مسیر سخت‌افزاری جدیدی می‌یابند: Smallest.ai به Tenstorrent می‌پیوندد
عوامل صوتی محلی مسیر سخت‌افزاری جدیدی می‌یابند: Smallest.ai به Tenstorrent می‌پیوندد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نخستین استقرار تجاری مدل TTS با دقت BF8 روی سخت‌افزار ASIC که هزینه استنتاج را بدون افت کیفیت محسوس، ۴ برابر کمتر از استاندارد L40S انویدیا می‌کند.

اگر امروز برای اجرای عامل‌های صوتی باکیفیت در سرورهای شخصی هزینه می‌پردازید، احتمالاً با قبض‌های سنگین انویدیا دست‌وپنجه نرم می‌کنید. اما حالا راهی برای کاهش ۴ برابری این هزینه‌ها بدون افت کیفیت صدا پیدا شده است. در ۱ اکتبر ۲۰۲۶، شرکت‌های Tenstorrent و Smallest.ai یک پشتهٔ صوتی در سطح تولید را معرفی کردند که امکان اجرای مدل‌های تبدیل متن به گفتار (TTS) — شبیه به یک گویندهٔ مجازی که متن را به صدای طبیعی تبدیل می‌کند — را به‌صورت محلی و در لحظه فراهم می‌کند.

برای اکثر سازمان‌ها، انتخاب همواره بین هزینه بالای خوشه‌های GPU یا ریسک‌های امنیتی و حریم خصوصی در فضای ابری بوده است. این همکاری جدید با هدف تأمین هوش مصنوعی حاکمیتی (Sovereign AI) برای بخش‌های حساس مانند بهداشت، مخابرات و مالی طراحی شده تا سازمان‌ها بتوانند حاکمیت کامل بر داده‌های خود داشته باشند. این زیرساخت اجازه می‌دهد تا سازمان‌ها حجم بالای پردازش‌های صوتی را کاملاً درون دیوارهای خود و بدون خروج داده‌ها مدیریت کنند. این تلاش برای بهینه‌سازی هزینه‌ها در حالی صورت می‌گیرد که رقابت در بازار مدل‌های صوتی شدت یافته و حتی غول‌هایی مانند علی‌بابا قیمت‌های خدمات صوتی خود را تا ۹۵ درصد کاهش داده‌اند تا سهم بازار خود را حفظ کنند.

به نقل از عمرو الاشماوی، نایب‌رئیس استراتژی و توسعه کسب‌وکار Tenstorrent، نباید بین عملکرد و هزینه انتخابی صورت گیرد. او تأکید کرد که Tenstorrent محاسباتی مقیاس‌پذیر و کارآمد ساخته است که نه تنها هزینه‌های جاری گردش‌کارهای موجود را کم می‌کند، بلکه اجرای حجم‌های کاملاً جدیدی از پردازش را که پیش از این غیرعملی بودند، ممکن می‌سازد.

قلب تپندهٔ این سامانه، مدل Lightning V2 است که به‌صورت بومی روی سرورهای Tenstorrent Galaxy Blackhole اجرا می‌شود. این مدل هم‌اکنون روی سخت‌افزارهای Tenstorrent با مدل قیمت‌گذاری بر اساس میزان مصرف و بدون نیاز به تعهدات مالی اولیه در دسترس است.

طبق مستندات فنی Smallest.ai، این دستاورد از طریق استفاده از دقت محاسباتی BlockFloat8 (BF8) به دست آمده است. آن‌ها دریافتند که بیش از ۸۰٪ مدل می‌تواند در حالت BF8 مستقر شود بدون اینکه افت کیفیت قابل اندازه‌گیری در صدا رخ دهد. همچنین، بیش از ۹۵٪ لایه‌های Lightning V2 در حالت دقت محاسباتی پایین (LoFi) اجرا می‌شوند. این رویکرد بهینه‌سازی حافظه یادآور دستاوردهای اخیر در مدل‌های زبانی است، مشابه آنچه در پروژه PrismML برای کاهش ۹ برابری اثر حافظه با حفظ دقت بالا مشاهده شد.

مشخصات سخت‌افزاری

پلتفرم Galaxy Blackhole یک نیروگاه پردازشی است که برای مقیاس‌های بزرگ طراحی شده است:

  • محاسبات: ۳۲ تراشه ASIC (مدار مجتمع کاربردی‌ویژه) Blackhole که توان ۲۳ PFLOPS محاسبات Block FP8 را ارائه می‌دهند.
  • حافظه: ۶.۲ گیگابایت SRAM روی تراشه (با سرعت ۲.۹ پتابایت بر ثانیه) و ۱ ترابایت حافظه GDDR6 (با سرعت ۱۶ ترابایت بر ثانیه).
  • اتصالات: ۱۰ لینک 400 GbE برای هر ASIC جهت ایجاد یک شبکه شتاب‌دهنده (Fabric) با سرعت ۳۲ ترابایت بر ثانیه. سیستم‌ها از طریق حداکثر ۵۶ پورت 800 GbE QSFP-DD مقیاس‌پذیر می‌شوند.
  • میزبان: پردازنده AMD EPYC 9004 با حداکثر ۵۷۶ گیگابایت حافظه DDR5 که روی سیستم‌عامل اوبونتو ۲۲.۰۴ اجرا می‌شود.
  • توان و قیمت: شاسی ۶ واحدی با خنک‌کننده هوا که به‌طور متوسط ۸ تا ۱۰ کیلووات برق مصرف می‌کند و قیمت لیست شده آن ۱۶۰,۰۰۰ دلار است.

اقتصاد استنتاج

بر اساس پژوهشی که توسط Smallest.ai در ۲۴ مارس ۲۰۲۶ ارائه و در ۷ آوریل ۲۰۲۶ بازبینی شد، شکاف قیمتی بزرگی در هزینه‌های خرید تجهیزات وجود دارد. این مقاله توسط رانجیت ام اس (مهندس ارشد عملکرد استنتاج)، اکشات ماندلوی (مدیر فنی) و سودارشان کامات (مدیرعامل) نوشته شده است.

در حالی که GPUهای مدرن با قابلیت BF8 اغلب حدود ۴۰,۰۰۰ دلار قیمت دارند، Tenstorrent اجرای مشابه را روی سخت‌افزاری در ردهٔ ۱,۰۰۰ دلاری ممکن کرده است. رانجیت اشاره کرد که با کار روی شبکه روی تراشه (NoC) و استفاده از SRAM بزرگ‌تر، آن‌ها توانستند به ۴ برابر بهره‌وری بیشتر با کسری از هزینهٔ زیرساخت‌های GPU برسند.

در مدل‌سازی مقیاس وسیع برای ۵۵۰ درخواست هم‌زمان ۵ ثانیه‌ای TTS در حالت بهره‌وری کامل، نویسندگان محاسبه کردند که ۱۱ عدد GPU L40S حدود ۱۰۰,۰۰۰ دلار هزینه دارد. در مقابل، ۲۷ شتاب‌دهنده P100 تنها ۲۷,۰۰۰ دلار و ۲۷ شتاب‌دهنده P150 حدود ۳۷,۰۰۰ دلار هزینه می‌برند. این یعنی کاهش ۳ تا ۴ برابری هزینه‌های سرمایه‌ای اولیه (CapEx).

تحلیل دستاوردهای عملکردی

علاوه بر هزینه‌های خرید، این همکاری منجر به کاهش شدید نیاز به محاسبات (Compute) شده است:

  • مدل انتشار صوتی (Diffusion Acoustic Model): ۴ برابر کاهش محاسبات.
  • وکودر عصبی (Neural Vocoder): ۸ برابر کاهش محاسبات.
  • اندازه مدل: تقریباً ۲ برابر کاهش.
  • انتقال حافظه: ۱.۸ برابر کاهش در حجم داده‌های منتقل شده.

در تست‌های تک‌دستگاهی، L40S توانست هم‌زمانی (Concurrency) ۳ را با تأخیر ۳۰۰ میلی‌ثانیه مدیریت کند (با هزینه ۹,۰۰۰ دلار). در مقابل، P150 و P100 هر کدام هم‌زمانی ۱ را با تأخیر ۲۵۰ میلی‌ثانیه اجرا کردند، در حالی که قیمت لیست شده آن‌ها به ترتیب ۱,۴۰۰ و ۱,۰۰۰ دلار بود. این منجر به سودآوری هزینه‌ای گزارش شده به میزان ۲.۶ و ۳.۶ برابری شد.

در سطح هسته (Kernel)، یک لایه بهینه‌شده با حدود ۶ میلیارد عملیات ضرب-جمع (MAC) در P150 در ۳۱ میکروثانیه اجرا می‌شود، در حالی که همین کار در L40S حدود ۶۰ میکروثانیه زمان می‌برد. نویسندگان پیش‌بینی می‌کنند با گسترش این بهینه‌سازی، بهبود ۸ تا ۱۲ برابری نسبت به خط پایه L40S ممکن است.

شاخص‌های عملکردی نیز رقابتی باقی مانده‌اند. امتیاز ادراکی DNSMOS برای این سیستم ۳.۸۰۱ ثبت شد، در حالی که برای انویدیا ۳.۸۷۲ بود؛ تفاوتی جزئی (۰.۰۷۱) که نویسندگان آن را یک تغییر ادراکی جزئی می‌دانند. همچنین نرخ خطای کلمه (WER) نرمال‌شده بین دو سیستم تنها ۰.۰۰۹ بود.

شکنندگی عددی و چالش PCC

اما مسیر رسیدن به این بهره‌وری ساده نبود. تیم متوجه شد که مدل‌های TTS نسبت به مدل‌های زبانی بزرگ (LLM) «شکننده‌تر» هستند؛ زیرا موج‌های صوتی پیوسته را از طریق پالایش‌های تکراری می‌سازند. خطاهای عددی کوچک در مراحل حذف نویز می‌توانند به صورت نویزهای شنیداری (Artifacts) ظاهر شوند.

آن‌ها دریافتند که معیارهای استاندارد شباهت تانسوری، مانند ضریب همبستگی پیرسون (PCC)، غیرقابل اعتماد هستند. در یک مورد، خروجی‌های L40S و CPU مدل AMD EPYC 7352 ضریب تنها ۰.۷۲ داشتند با وجود ورودی‌های یکسان، اما صداها از نظر ادراکی غیرقابل تشخیص بودند. در مقابل، لایه‌ای با ضریب ۱.۰ باعث خرابی صوتی شد که شناسایی و جداسازی آن بیش از یک ماه زمان برد.

این یعنی توسعه‌دهندگان نمی‌توانند برای تأیید صحت مدل پس از کوانتایزیشن (Quantization) — یعنی تبدیل اعداد دقیق به فرمت‌های کوتاه‌تر برای سرعت بیشتر — به ریاضیات سنتی تکیه کنند. در عوض، باید از اعتبارسنجی ادراکی پایان-به-پایان استفاده کنند تا مطمئن شوند صدا برای گوش انسان خراب نیست. این چالش‌های فنی در سنتز صدا، اهمیت رویکردهای جدید را دوچندان می‌کند؛ برای مثال استارتاپ Treble با سرمایه‌ای ۱۸ میلیون دلاری در حال توسعه شبیه‌سازهای فیزیکی صداست تا با عبور از مدل‌های صرفاً آماری، به کیفیت و پایداری بیشتری دست یابد.

محدودیت‌ها و چشم‌انداز آینده

نویسندگان پذیرفته‌اند که برخی لایه‌ها هنوز برای اجرای با دقت پایین بیش از حد حساس هستند و بدون افت کیفیت قابل اجرا نیستند. همچنین پیکربندی‌های کامپایلر و برنامه هنوز به طور کامل بهینه نشده‌اند.

برای یک مدیر کسب‌وکار، این تغییر یعنی تبدیل هوش مصنوعی صوتی از یک آزمایش لوکس به یک ابزار کاربردی. Tenstorrent با کاهش کفِ هزینه سخت‌افزاری، استقرار هزاران عامل صوتی در لحظه را بدون پرداخت «مالیات انویدیا» ممکن کرده است.

شرکت Smallest.ai از همین حالا به آینده نگاه می‌کند. در پستی در ۲۸ سپتامبر ۲۰۲۶، این شرکت اشاره کرد که Lightning V2 نخستین مدل TTS است که سنتز باکیفیت را تحت کوانتایزیشن BF8 و محاسبات با دقت کاهش‌یافته ارائه می‌دهد. همچنین مدل جدیدتر آن‌ها، Lightning V3، در حال حاضر از نظر بهره‌وری از V2 پیشی گرفته است و قصد دارند همین اصول طراحی مشترک (Co-design) را برای دستیابی به پیشرفت‌های هزینه‌ای بیشتر در V3 به کار بگیرند.

گام بعدی شما

  • اگر در حال طراحی سیستم‌های پاسخگویی صوتی هستید، بررسی کنید که آیا مدل‌های شما قابلیت اجرا در حالت BF8 را دارند یا خیر.
  • برای کاهش هزینه‌های زیرساخت، جایگزینی GPUهای عمومی با شتاب‌دهنده‌های ASIC را در معماری خود بسنجید.
  • در ارزیابی مدل‌های صوتی، به جای معیارهای ریاضی (مانند PCC)، روی تست‌های ادراکی انسانی تمرکز کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell و رقابت با ASICها مراجعه کنید.

چرا این موضوع مهم است؟

این پیشرفت با تکیه بر تخصص در طراحی ASIC، انحصار انویدیا در بازار استنتاج صوتی را می‌شکند و هزینه ورود به دنیای عامل‌های صوتی را برای سازمان‌ها به شدت کاهش می‌دهد. اعتماد به این سیستم‌ها از طریق اعتبارسنجی ادراکی به جای ریاضیات محض تأمین شده است.

تأثیر برای ایران

به‌دلیل تحریم‌ها و محدودیت‌های دسترسی به سخت‌افزارهای تخصصی Tenstorrent، این راهکار در حال حاضر اثر مستقیمی بر زیرساخت‌های داخلی ایران ندارد.

·نگاه ما
تحریریه دات‌هوش

جایگزینی GPUهای همه‌منظوره با ASICهای تخصصی برای استنتاج صوتی، نشان می‌دهد که عصر «یک سخت‌افزار برای همه مدل‌ها» در حال پایان است. نکته کلیدی اینجاست که بهینه‌سازی در لایه سخت‌افزار (SRAM بزرگ‌تر) می‌تواند اثرات منفی کوانتایزیشن را خنثی کند. این رویکرد احتمالاً به سمت مدل‌های بینایی-زبانی (VLM) نیز گسترش خواهد یافت تا هزینه استنتاج در لبه کاهش یابد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.