۵۰ میلیون دلار؛ این مبلغ سرمایهگذاری سری A در Nuance Labs است که نشان میدهد صنعت به سمتی میرود که هوش مصنوعی بتواند احساسات انسانی را در لحظه درک و ابراز کند. طبق اعلام شرکت در ۱۴ سپتامبر ۲۰۲۶، این دور از تأمین سرمایه برای این آزمایشگاه مستقر در سیاتل توسط Lightspeed Venture Partners رهبری شد و شرکتهایی مثل NVIDIA، Accel، Define Ventures و South Park Commons نیز در آن مشارکت کردند.
تأمین سرمایه و رشد
شرکت Lightspeed Venture Partners اولین بار در سال ۲۰۲۵، یعنی همان سالی که Nuance Labs تأسیس شد، در مرحله Seed (بذری) روی این شرکت سرمایهگذاری کرد. در حال حاضر نام شرکای این مجموعه، یعنی Guru Chahal و Nnamdi Iregbulem، در لیست مدیران و حامیان شرکت دیده میشود. سرمایه جدیدی که جذب شده است، برای شتاب بخشیدن به توسعه مدلها، گسترش تیم تحقیقاتی و پشتیبانی از اولین پیشنمایش تحقیقاتی عمومی (Public Research Preview) هزینه خواهد شد. این شرکت در حال حاضر بهطور فعال در حال استخدام پژوهشگران و مهندسانی در زمینههای مدلسازی، دادهها، ارزیابی، استنتاج (Inference) و سرویسدهی در لحظه (Real-time serving) است.
بسیاری از آواتارهای فعلی شبیه به یک مسابقهی امدادی عمل میکنند؛ یعنی ابتدا یک سیستم صدا را به متن تبدیل میکند (Transcribe)، سپس یک مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب میدهد — پاسخی متنی میسازد، یک موتور صوتی آن را میخواند و در نهایت ابزاری دیگر صورت را تکان میدهد. همانطور که در تحلیلهای پیشین ما دربارهی تکامل رابطهای کاربری صوتی اشاره کردیم، این ساختار تکهتکه و گسسته باعث ایجاد تجربهای «منجمد» یا بریدهبریده میشود که در آن هوش مصنوعی اغلب روی حرف کاربر میپرد یا واکنشهای غیرکلامی را نادیده میگیرد. این چالشها در مدلهای صوتی پیشین منجر به نوسانات شدیدی در جذب سرمایه شد، مشابه آنچه در سقوط سرمایهگذاری Listen Labs مشاهده کردیم.
Nuance Labs قصد دارد کل این فرآیند را در یک مدل بنیادی (Foundation Model) — شبیه به یک مغز واحد که تمام حسها را همزمان پردازش میکند — ادغام کند. به جای توالی از تحویل دادن دادهها از یک ابزار به ابزار دیگر، سیستم آنها از معماری «تمام-دوطرفه» (Full-Duplex) استفاده میکند. این به این معناست که جریانهای ادراکی صوتی و تصویری همزمان با تولید پاسخ وارد مدل میشوند. در نتیجه، هوش مصنوعی میتواند در حالی که شما هنوز در حال صحبت هستید، با تکان دادن سر یا تولید صداهای تأیید، نشان دهد که شما را میفهمد و به شما گوش میدهد.
معماری فنی و اهداف
به گزارش این شرکت، معماری فنی آنها بر چهار محور اصلی استوار است:
- چندوجهی (Multimodal) ذاتی: مدل کلمات، لحن، نگاه، ژست و زمانبندی را به عنوان یک جریان دادهای واحد میبیند — مثل ما که با چند حس دنیا را میخوانیم.
- پاسخدهی آنی: تأخیر (Latency) به جای اینکه به عنوان یک لایه اضافی به سیستم اضافه شود، در خودِ معماری حل شده است تا حالت «رباتیک» و وقفه در پاسخ حذف شود.
- یادگیری رفتاری: سیستم به جای تکیه بر متون نوشتاری ایستا (Static Transcripts)، از الگوهای واقعی و زنده گفتگوهای انسانی یاد میگیرد.
- جریان دوطرفه (Full-Duplex Streaming): ادراک و پاسخ صوتی-تصویری همزمان رخ میدهند تا سیستم بتواند از طریق نشانههای کلامی و غیرکلامی اعلام کند که کاربر را دنبال میکند.
طبق صفحه «درباره ما» در وبسایت این شرکت، این نخستین مدل صوتی-تصویری در نوع خود است که میتواند در یک لحظه واحد، ببیند، بشنود، استدلال کند و احساسات را ابراز نماید. تیم مؤسس شامل Fangchang Ma (مدیرعامل)، Edward Zhang (مدیر فنی) و Karren Yang (دانشمند ارشد)، سالها در Apple روی بازسازی دیجیتال انسانها برای حضور از راه دور (Telepresence) تحقیق کردهاند. آنها توسط یاسر شیخ (Yaser Sheikh) به عنوان مشاور و کادری از دانشمندانی حمایت میشوند که مقالات آنها در برترین کنفرانسهای علمی چاپ شده و محصولاتی با تأخیر بسیار کم را برای میلیونها کاربر عرضه کردهاند.
عنصر انسانی و فلسفه طراحی
مؤسسان این شرکت در دوران فعالیتشان در اپل متوجه شدند که بازسازی دقیق یک فرد برای حضور از راه دور همچنان یک چالش بزرگ است. آنها بهطور خاص با تعامل پیچیده بین نشانههای کلامی و غیرکلامی در گفتگوهای زنده دستوپنجه نرم میکردند. آنها Nuance Labs را تأسیس کردند تا ابراز احساسات را بهطور ذاتی از سیگنالهای صوتی و تصویری خلق کنند، نه اینکه اجزایی را که برای همکاری با یکدیگر ساخته نشدهاند، کنار هم بچسبانند.
آنها استدلال میکنند هوش مصنوعیهایی که صرفاً به متن تکیه میکنند، از یک تصویر ناقص از ارتباطات انسانی استفاده میکنند. وقتی یک هوش مصنوعی بتواند از طریق نشانههای کلامی و غیرکلامی نشان دهد که کاربر را دنبال میکند، مردم تمایل دارند آزادانهتر صحبت کنند و اطلاعات بیشتری ارائه دهند. Fangchang Ma معتقد است آواتارهای فعلی هرگز طبیعی نبودهاند چون انسانها مجبور بودند نحوه ارتباط خود را با ماشین تطبیق دهند و خود را محدود کنند. او میگوید: «ما در حال ساخت هوش مصنوعیای هستیم که روشهای مختلف ابراز وجود ما را بفهمد و درست مثل یک انسان، در لحظه پاسخ دهد.»
برای کاربران تجاری، این تغییر یعنی تبدیل هوش مصنوعی از ابزاری که باید به آن «پرامپت» داد به شریکی که با او تعامل میکنند. این شرکت محیطهای حساس و پرمخاطرهای که نیاز به ابراز احساسات دقیق دارند، مثل فروش، خدمات مشتری، کوچینگ حرفهای و آموزش را هدف قرار داده است.
سرمایهگذاری Lightspeed نشان میدهد که صنعت از عصر «چتباتها» به سمت هوش مصنوعی «تجسمیافته» (Embodied AI) حرکت میکند. این رویکرد با استراتژیهای شرکتهایی چون Skild AI برای استقرار رباتهای هوشمند همسو است که به دنبال ادغام هوش مصنوعی با دنیای فیزیکی هستند. Nnamdi Iregbulem از Lightspeed Venture Partners بیان کرد که این شرکت، مدل Nuance Labs را به عنوان یک لایه هستهای برای محصولات هوش مصنوعی میبیند که هوش اجتماعی و عاطفی را به صدا، چهره و بدن میآورد.
اگر این رویکرد موفق شود، زنجیره ابزارهای فعلی آواتارها منسوخ خواهد شد. شرکتها دیگر نیازی ندارند برای ساخت یک انسان دیجیتال از چهار تأمینکننده مختلف استفاده کنند و تنها یک مدل بنیادی را مستقر میکنند. در این راستا، دسترسی به زیرساختهای مدلهای باز، مانند آنچه پس از تصاحب Hugging Face توسط انویدیا تسهیل شده، میتواند سرعت توسعه این مدلهای بنیادی را افزایش دهد. Nuance Labs قصد دارد پیشنمایش تحقیقاتی عمومی خود را در اواخر سال جاری میلادی افتتاح کند. کاربران علاقهمند در حال حاضر میتوانند در لیست انتظار وبسایت آنها ثبتنام کنند تا قابلیتهای آنی سیستم را آزمایش نمایند.
گام بعدی شما
- اگر در حوزه خدمات مشتری یا آموزش فعال هستید، مدلهای Full-Duplex را به عنوان جایگزین سیستمهای TTS/STT دنبال کنید.
- برای تجربه قابلیتهای آنی این سیستم، در لیست انتظار وبسایت Nuance Labs ثبتنام کنید.
- بررسی کنید که آیا جریانهای کاری شما به درک عاطفی و غیرکلامی نیاز دارند یا صرفاً تبادل متن کافی است.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell و بهینهسازی استنتاج مراجعه کنید.




گفتگو