پرش به محتوای اصلی
پرش به محتوای مقاله

«تعاملات انسانی طبیعی»؛ هدف Nuance Labs از مدل‌های بنیادین بصری-شنیداری

·۲۴ شهریور ۱۴۰۵۴ دقیقه مطالعه
پژوهشگران سابق اپل، استارتاپ نوآنس لبز را تأسیس کردند که ۵۰ میلیون دلار سرمایه از انویدیا دریافت کرد.
پژوهشگران سابق اپل، استارتاپ نوآنس لبز را تأسیس کردند که ۵۰ میلیون دلار سرمایه از انویدیا دریافت کرد.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی زنجیره پردازش (Pipeline) با یک مدل بنیادی واحد که ادراک و پاسخ صوتی-تصویری را به صورت هم‌زمان و دوطرفه (Full-Duplex) مدیریت می‌کند.

۵۰ میلیون دلار؛ این مبلغ سرمایه‌گذاری سری A در Nuance Labs است که نشان می‌دهد صنعت به سمتی می‌رود که هوش مصنوعی بتواند احساسات انسانی را در لحظه درک و ابراز کند. طبق اعلام شرکت در ۱۴ سپتامبر ۲۰۲۶، این دور از تأمین سرمایه برای این آزمایشگاه مستقر در سیاتل توسط Lightspeed Venture Partners رهبری شد و شرکت‌هایی مثل NVIDIA، Accel، Define Ventures و South Park Commons نیز در آن مشارکت کردند.

تأمین سرمایه و رشد

شرکت Lightspeed Venture Partners اولین بار در سال ۲۰۲۵، یعنی همان سالی که Nuance Labs تأسیس شد، در مرحله Seed (بذری) روی این شرکت سرمایه‌گذاری کرد. در حال حاضر نام شرکای این مجموعه، یعنی Guru Chahal و Nnamdi Iregbulem، در لیست مدیران و حامیان شرکت دیده می‌شود. سرمایه جدیدی که جذب شده است، برای شتاب بخشیدن به توسعه مدل‌ها، گسترش تیم تحقیقاتی و پشتیبانی از اولین پیش‌نمایش تحقیقاتی عمومی (Public Research Preview) هزینه خواهد شد. این شرکت در حال حاضر به‌طور فعال در حال استخدام پژوهشگران و مهندسانی در زمینه‌های مدل‌سازی، داده‌ها، ارزیابی، استنتاج (Inference) و سرویس‌دهی در لحظه (Real-time serving) است.

بسیاری از آواتارهای فعلی شبیه به یک مسابقه‌ی امدادی عمل می‌کنند؛ یعنی ابتدا یک سیستم صدا را به متن تبدیل می‌کند (Transcribe)، سپس یک مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — پاسخی متنی می‌سازد، یک موتور صوتی آن را می‌خواند و در نهایت ابزاری دیگر صورت را تکان می‌دهد. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی تکامل رابط‌های کاربری صوتی اشاره کردیم، این ساختار تکه‌تکه و گسسته باعث ایجاد تجربه‌ای «منجمد» یا بریده‌بریده می‌شود که در آن هوش مصنوعی اغلب روی حرف کاربر می‌پرد یا واکنش‌های غیرکلامی را نادیده می‌گیرد. این چالش‌ها در مدل‌های صوتی پیشین منجر به نوسانات شدیدی در جذب سرمایه شد، مشابه آنچه در سقوط سرمایه‌گذاری Listen Labs مشاهده کردیم.

Nuance Labs قصد دارد کل این فرآیند را در یک مدل بنیادی (Foundation Model) — شبیه به یک مغز واحد که تمام حس‌ها را هم‌زمان پردازش می‌کند — ادغام کند. به جای توالی از تحویل دادن داده‌ها از یک ابزار به ابزار دیگر، سیستم آن‌ها از معماری «تمام-دوطرفه» (Full-Duplex) استفاده می‌کند. این به این معناست که جریان‌های ادراکی صوتی و تصویری هم‌زمان با تولید پاسخ وارد مدل می‌شوند. در نتیجه، هوش مصنوعی می‌تواند در حالی که شما هنوز در حال صحبت هستید، با تکان دادن سر یا تولید صداهای تأیید، نشان دهد که شما را می‌فهمد و به شما گوش می‌دهد.

معماری فنی و اهداف

به گزارش این شرکت، معماری فنی آن‌ها بر چهار محور اصلی استوار است:

  • چندوجهی (Multimodal) ذاتی: مدل کلمات، لحن، نگاه، ژست و زمان‌بندی را به عنوان یک جریان داده‌ای واحد می‌بیند — مثل ما که با چند حس دنیا را می‌خوانیم.
  • پاسخ‌دهی آنی: تأخیر (Latency) به جای اینکه به عنوان یک لایه اضافی به سیستم اضافه شود، در خودِ معماری حل شده است تا حالت «رباتیک» و وقفه در پاسخ حذف شود.
  • یادگیری رفتاری: سیستم به جای تکیه بر متون نوشتاری ایستا (Static Transcripts)، از الگوهای واقعی و زنده گفتگوهای انسانی یاد می‌گیرد.
  • جریان دوطرفه (Full-Duplex Streaming): ادراک و پاسخ صوتی-تصویری هم‌زمان رخ می‌دهند تا سیستم بتواند از طریق نشانه‌های کلامی و غیرکلامی اعلام کند که کاربر را دنبال می‌کند.

طبق صفحه «درباره ما» در وب‌سایت این شرکت، این نخستین مدل صوتی-تصویری در نوع خود است که می‌تواند در یک لحظه واحد، ببیند، بشنود، استدلال کند و احساسات را ابراز نماید. تیم مؤسس شامل Fangchang Ma (مدیرعامل)، Edward Zhang (مدیر فنی) و Karren Yang (دانشمند ارشد)، سال‌ها در Apple روی بازسازی دیجیتال انسان‌ها برای حضور از راه دور (Telepresence) تحقیق کرده‌اند. آن‌ها توسط یاسر شیخ (Yaser Sheikh) به عنوان مشاور و کادری از دانشمندانی حمایت می‌شوند که مقالات آن‌ها در برترین کنفرانس‌های علمی چاپ شده و محصولاتی با تأخیر بسیار کم را برای میلیون‌ها کاربر عرضه کرده‌اند.

عنصر انسانی و فلسفه طراحی

مؤسسان این شرکت در دوران فعالیتشان در اپل متوجه شدند که بازسازی دقیق یک فرد برای حضور از راه دور همچنان یک چالش بزرگ است. آن‌ها به‌طور خاص با تعامل پیچیده بین نشانه‌های کلامی و غیرکلامی در گفتگوهای زنده دست‌وپنجه نرم می‌کردند. آن‌ها Nuance Labs را تأسیس کردند تا ابراز احساسات را به‌طور ذاتی از سیگنال‌های صوتی و تصویری خلق کنند، نه اینکه اجزایی را که برای همکاری با یکدیگر ساخته نشده‌اند، کنار هم بچسبانند.

آن‌ها استدلال می‌کنند هوش مصنوعی‌هایی که صرفاً به متن تکیه می‌کنند، از یک تصویر ناقص از ارتباطات انسانی استفاده می‌کنند. وقتی یک هوش مصنوعی بتواند از طریق نشانه‌های کلامی و غیرکلامی نشان دهد که کاربر را دنبال می‌کند، مردم تمایل دارند آزادانه‌تر صحبت کنند و اطلاعات بیشتری ارائه دهند. Fangchang Ma معتقد است آواتارهای فعلی هرگز طبیعی نبوده‌اند چون انسان‌ها مجبور بودند نحوه ارتباط خود را با ماشین تطبیق دهند و خود را محدود کنند. او می‌گوید: «ما در حال ساخت هوش مصنوعی‌ای هستیم که روش‌های مختلف ابراز وجود ما را بفهمد و درست مثل یک انسان، در لحظه پاسخ دهد.»

برای کاربران تجاری، این تغییر یعنی تبدیل هوش مصنوعی از ابزاری که باید به آن «پرامپت» داد به شریکی که با او تعامل می‌کنند. این شرکت محیط‌های حساس و پرمخاطره‌ای که نیاز به ابراز احساسات دقیق دارند، مثل فروش، خدمات مشتری، کوچینگ حرفه‌ای و آموزش را هدف قرار داده است.

سرمایه‌گذاری Lightspeed نشان می‌دهد که صنعت از عصر «چت‌بات‌ها» به سمت هوش مصنوعی «تجسم‌یافته» (Embodied AI) حرکت می‌کند. این رویکرد با استراتژی‌های شرکت‌هایی چون Skild AI برای استقرار ربات‌های هوشمند هم‌سو است که به دنبال ادغام هوش مصنوعی با دنیای فیزیکی هستند. Nnamdi Iregbulem از Lightspeed Venture Partners بیان کرد که این شرکت، مدل Nuance Labs را به عنوان یک لایه هسته‌ای برای محصولات هوش مصنوعی می‌بیند که هوش اجتماعی و عاطفی را به صدا، چهره و بدن می‌آورد.

اگر این رویکرد موفق شود، زنجیره ابزارهای فعلی آواتارها منسوخ خواهد شد. شرکت‌ها دیگر نیازی ندارند برای ساخت یک انسان دیجیتال از چهار تأمین‌کننده مختلف استفاده کنند و تنها یک مدل بنیادی را مستقر می‌کنند. در این راستا، دسترسی به زیرساخت‌های مدل‌های باز، مانند آنچه پس از تصاحب Hugging Face توسط انویدیا تسهیل شده، می‌تواند سرعت توسعه این مدل‌های بنیادی را افزایش دهد. Nuance Labs قصد دارد پیش‌نمایش تحقیقاتی عمومی خود را در اواخر سال جاری میلادی افتتاح کند. کاربران علاقه‌مند در حال حاضر می‌توانند در لیست انتظار وب‌سایت آن‌ها ثبت‌نام کنند تا قابلیت‌های آنی سیستم را آزمایش نمایند.

گام بعدی شما

  • اگر در حوزه خدمات مشتری یا آموزش فعال هستید، مدل‌های Full-Duplex را به عنوان جایگزین سیستم‌های TTS/STT دنبال کنید.
  • برای تجربه قابلیت‌های آنی این سیستم، در لیست انتظار وب‌سایت Nuance Labs ثبت‌نام کنید.
  • بررسی کنید که آیا جریان‌های کاری شما به درک عاطفی و غیرکلامی نیاز دارند یا صرفاً تبادل متن کافی است.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell و بهینه‌سازی استنتاج مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد با تکیه بر تخصص تیم مؤسس در Apple، احتمالاً استانداردهای جدیدی برای تعاملات صوتی-تصویری تعریف می‌کند. موفقیت این مدل می‌تواند کل بازار ابزارهای تکه‌تکه‌ی آواتارها را به نفع مدل‌های بنیادی یکپارچه نابود کند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم به پیش‌نمایش این مدل برای توسعه‌دهندگان ایرانی دشوار است، اما مدل‌های مشابه متن‌باز می‌توانند از این معماری الگو بگیرند.

·نگاه ما
تحریریه دات‌هوش

تمرکز بر معماری Full-Duplex نشان می‌دهد که گلوگاه فعلی هوش مصنوعی دیگر قدرت استدلال نیست، بلکه «حضور» (Presence) است. با حذف لایه‌های واسط تبدیل صدا به متن، Nuance Labs در واقع دارد مفهوم «تأخیر» را از یک مشکل مهندسی به یک ویژگی روان‌شناختی تبدیل می‌کند تا تعاملات انسانی‌تر شوند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.