پرش به محتوای اصلی
پرش به محتوای مقاله

عامل‌های صوتی سالمندان را ۲ تا ۵ برابر بیشتر از جوانان قطع می‌کنند

·۱۶ مرداد ۱۴۰۵۱۰ دقیقه مطالعه۴ بازدید
مخزن گیت‌هاب: تشخیص گفتار با سن گوینده تغییر نمی‌کند، اما نوبت‌گیری عامل صوتی ۲ تا ۵ برابر کندتر می‌شود.
مخزن گیت‌هاب: تشخیص گفتار با سن گوینده تغییر نمی‌کند، اما نوبت‌گیری عامل صوتی ۲ تا ۵ برابر کندتر می‌شود.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اثبات آماری این موضوع که دقت بازشناسی گفتار در سالمندان حتی بیشتر از جوانان است و مشکل اصلی، نرخ قطع شدن حرف (Turn-taking) به دلیل آستانه‌های سکوت ثابت است.

تصور کنید در میانهٔ یک جمله هستید و دستیار صوتی شما، پیش از آنکه فرصت کنید نفس بکشید، حرفتان را قطع کرده و پاسخ می‌دهد. برای بسیاری از سالمندان، این تجربه نه یک اتفاق، بلکه یک الگوی تکرارشونده است که باعث می‌شود به‌طور کلی از فناوری‌های صوتی دلسرد شوند.

بر اساس تحلیل فنی منتشر شده در ۷ اوت ۲۰۲۶ توسط کیوان ظاهری (Kayvan Zahiri)، آنچه تا امروز به عنوان «شکاف بازشناسی» برای افراد مسن شناخته می‌شد، در واقع یک توهم است. این پژوهش نشان می‌دهد که مشکل اصلی نه در گوشِ هوش مصنوعی، بلکه در ساعتِ اوست؛ یعنی سیستمی که تصمیم می‌گیرد چه زمانی کاربر صحبتش را تمام کرده است و این شکست در منطق نوبت‌گیری (Turn-taking logic) رخ می‌دهد.

برای سال‌ها، فرض بر این بود که مدل‌های بازشناسی گفتار (Speech Recognition/ASR) یا مدل‌های تبدیل گفتار به متن (STT) با ویژگی‌های آکوستیک صدای افراد مسن مشکل دارند. این باور باعث شد توسعه‌دهندگان تمام تمرکز خود را روی دقت بازشناسی کلمات بگذارند و زمان‌بندی تعامل را نادیده بگیرند. اما واقعیت این است که شکست در نقطهٔ پایان (Endpoint) رخ می‌دهد؛ همان لحظه‌ای که هوش مصنوعی تصمیم می‌گیرد انسان صحبتش را تمام کرده است.

افسانهٔ ضعف در بازشناسی

این پژوهش با استفاده از ۲۷۶۰ کلیپ صوتی متناظر از مجموعه Common Voice، گویندگان دهه ۲۰ زندگی را با افراد دهه ۶۰ و ۷۰ مقایسه کرد. نتایج برخلاف باور عموم و به‌طور غیرمنتظره‌ای بود: مدل Whisper (نسخه large-v3، پهنای باند wideband) در واقع صدای سالمندان را دقیق‌تر از جوانان بازشناسی کرد. بازه‌های اطمینان ۹۵٪ (Speaker-bootstrapped) عدد صفر را شامل نمی‌شدند، که تأیید می‌کند این روند از نظر آماری معنادار است.

نرخ خطای کلمه (Word Error Rate - WER) به شرح زیر بود:

  • دهه ۲۰ سالگی (n=920): ۶.۵۳٪ [۵.۷۷, ۷.۴۰]
  • دهه ۶۰ سالگی (n=920): ۵.۲۳٪ (کاهش ۱.۳۱ واحد درصدی) [۴.۶۵, ۵.۸۶]
  • دهه ۷۰ سالگی (n=920): ۴.۶۷٪ (کاهش ۱.۸۶ واحد درصدی) [۴.۱۲, ۵.۳۱]

این نتیجه حاصلِ پوشاندن یک نوع خطا توسط خطای دیگر نیست. هر دسته از انواع خطاها با افزایش سن کاهش یافته است. برای افراد دهه ۲۰ سالگی، نرخ جایگزینی (Substitutions) ۵.۲۲٪، حذف (Deletions) ۰.۵۷٪ و درج (Insertions) ۰.۷۴٪ بود. برای دهه ۶۰ سالگی، این اعداد به ترتیب ۴.۱۹٪، ۰.۴۱٪ و ۰.۶۴٪ رسید. برای دهه ۷۰ سالگی، این مقادیر به ۳.۶۷٪، ۰.۴۱٪ و ۰.۵۹٪ کاهش یافت. به‌ویژه نرخ «حذف» کلمات افزایش نیافت؛ اگر صدای لرزان، ضعیف یا نفس‌آلود سالمندان باعث حذف کلمات می‌شد، باید نرخ حذف بالا می‌رفت، اما اتفاقاً کمتر شد. این موضوع تأیید می‌کند که مشکل یک نقص فنی در مدل Whisper نیست.

برای اطمینان از اینکه این نتیجه حاصلِ «اصلاح متنی» توسط مدل زبانی (LM) داخلی Whisper نیست، پژوهشگر همان کلیپ‌ها را از مدل wav2vec2 عبور داد. wav2vec2 یک مدل خالص CTC (فریم‌به‌فریم و حریصانه) است که بدون رمزگشا (Decoder) یا مدل زبانی ضمنی عمل می‌کند. اگرچه به دلیل آموزش مدل wav2vec2 تنها روی مجموعه LibriSpeech، نرخ خطای مطلق (WER) بسیار بالاتر بود، اما روند نسبی همچنان پابرجا بود. در واقع اثر در اینجا شدیدتر بود: دهه ۶۰ سالگی کاهش ۳.۹۴ واحد درصدی [ -۵.۵۲, -۲.۴۰] و دهه ۷۰ سالگی کاهش ۳.۷۲ واحد درصدی [ -۵.۴۹, -۲.۰۸] را نسبت به دهه ۲۰ سالگی نشان دادند. این ثابت می‌کند که برتری در بازشناسی، ریشه در ویژگی‌های آکوستیک دارد، نه زبانی.

جریمهٔ نوبت‌گیری

در حالی که بازشناسی پایدار است، «جریمهٔ نوبت‌گیری» (Turn-taking Penalty) بسیار شدید است. اکثر پشته‌های صوتی (Voice Stacks) از یک آستانهٔ سکوت ثابت (Fixed Silence Threshold) برای تحریک پاسخ استفاده می‌کنند. اگر گوینده در میانهٔ جمله بیش از این حد مکث کند، عامل صوتی حرف او را قطع می‌کند. نرخ WER نسبت به این اتفاق کور است؛ مدل می‌تواند کلماتی را که دریافت کرده است به‌طور کامل و درست بازشناسی کند، در حالی که تماس‌گیرنده در هر بار مکث، قطع شده است.

سالمندان به‌طور طبیعی مکث‌های داخلی بیشتری دارند و زمان بیشتری را در این مکث‌ها می‌گذرانند. داده‌ها نشان می‌دهد افراد دهه ۶۰ و ۷۰، دو برابر جوانان مکث داخلی می‌کنند (۲.۰ مکث در هر کلیپ در مقابل ۱.۰ برای جوانان) و مدت زمان هر مکث آن‌ها (۴۸۰ و ۴۲۰ میلی‌ثانیه) تقریباً دو برابر جوانان (۲۴۰ میلی‌ثانیه) است. همچنین تعداد کلمات در هر ثانیهٔ صوتی (Words per voiced-second) از ۲.۴۷ در دهه ۲۰ به ۲.۲۰ در دهه‌های ۶۰ و ۷۰ کاهش می‌یابد.

در آستانه‌های مختلف سکوت، سهم جملاتی که حاوی مکث داخلی پیش از موعد هستند، شکافی عمیق را نشان می‌دهد:

  • ۴۰۰ میلی‌ثانیه: جوانان ۲۳.۳٪ | دهه ۶۰ سالگی ۴۱.۵٪ | دهه ۷۰ سالگی ۳۷.۳٪
  • ۵۰۰ میلی‌ثانیه: جوانان ۱۷.۳٪ | دهه ۶۰ سالگی ۳۳.۷٪ | دهه ۷۰ سالگی ۲۸.۶٪
  • ۷۰۰ میلی‌ثانیه: جوانان ۸.۰٪ | دهه ۶۰ سالگی ۱۹.۷٪ (افزایش ۱۱.۶ واحد درصدی) | دهه ۷۰ سالگی ۱۶.۶٪ (افزایش ۸.۵ واحد درصدی)
  • ۱۰۰۰ میلی‌ثانیه: جوانان ۲.۰٪ | دهه ۶۰ سالگی ۸.۷٪ | دهه ۷۰ سالگی ۶.۲٪

تمام شش تفاوت بین گروه‌های سنی و خط پایه، عدد صفر را رد می‌کنند. در آستانه ۷۰۰ میلی‌ثانیه‌ای، شکاف برای دهه ۶۰ سالگی در بازه [+۷.۷, +۱۵.۷] و برای دهه ۷۰ سالگی در بازه [+۴.۰, +۱۳.۶] قرار دارد.

برای قدیمی‌ترین گروه (دهه ۸۰ سالگی)، این شکاف حتی شدیدتر است. به دلیل اینکه تطبیق با این گروه باعث کوچک شدن هشت‌برابری سایر دسته‌ها می‌شد، آن‌ها به‌طور جداگانه بررسی شدند (n=14 گوینده). اگرچه بازه‌های اطمینان به دلیل تعداد کم گسترده هستند، اما اثر همچنان مشهود است:

  • ۴۰۰ میلی‌ثانیه: جوانان ۲۷.۹٪ | دهه ۸۰ سالگی ۴۹.۲٪ (شکاف ۲۱.۸٪ [۶.۳٪, ۳۶.۶٪])
  • ۵۰۰ میلی‌ثانیه: جوانان ۱۵.۶٪ | دهه ۸۰ سالگی ۴۰.۲٪ (شکاف ۲۴.۸٪ [۸.۹٪, ۳۸.۷٪])
  • ۷۰۰ میلی‌ثانیه: جوانان ۴.۱٪ | دهه ۸۰ سالگی ۲۲.۱٪ (شکاف ۱۸.۱٪ [۷.۹٪, ۲۷.۲٪])
  • ۱۰۰۰ میلی‌ثانیه: جوانان ۰.۰٪ | دهه ۸۰ سالگی ۶.۶٪ (شکاف ۶.۵٪ [۱.۷٪, ۱۴.۵٪])

در آستانه ۷۰۰ میلی‌ثانیه‌ای، این یک شکاف ۵.۴ برابری است. با این حال، نرخ WER آن‌ها ۶.۲۴٪ در مقابل ۶.۰۱٪ برای جوانان بود؛ تفاوتی ۰.۱۵ واحد درصدی که به‌راحتی عدد صفر را شامل می‌شود. بازشناسی ثابت می‌ماند در حالی که نوبت‌گیری با افزایش سن به‌طور مداوم بدتر می‌شود.

راهکار: مدل‌های معنایی

مارک بکمن از Daily/Pipecat اشاره کرد که پشته‌های تولیدی اغلب برای اجتناب از آستانه‌های VAD ثابت، به مدل‌های معنایی روی می‌آورند. این مطالعه مدل smart-turn v3 متعلق به Pipecat را آزمایش کرد که به شکل موج (Waveform) گوش می‌دهد و زمانی که به نظر می‌رسد نوبت صحبت تمام نشده است، زمان بیشتری اختصاص می‌دهد.

در اندازه‌گیری روی همان نمونه‌ها، نتایج بهبود قابل‌توجهی را نشان داد. برای هر کلیپ، صدا تا لحظه مکث داخلی به مدل داده شد تا بررسی شود آیا مدل به‌اشتباه سیگنال «پایان نوبت» صادر می‌کند یا خیر:

  • آستانه ثابت ۷۰۰ میلی‌ثانیه‌ای: شکاف ۱۱.۶ واحد درصدی برای دهه ۶۰ سالگی
  • مدل Pipecat smart-turn v3: شکاف ۵.۹ واحد درصدی برای دهه ۶۰ سالگی (بازه [-۰.۹, +۱۲.۹] که دیگر عدد صفر را رد نمی‌کند)
  • شکاف دهه ۷۰ سالگی: از ۸.۵ واحد درصدی به ۴.۰ واحد درصدی کاهش یافت (بازه [-۳.۶, +۱۱.۶])

اگرچه شکاف تقریباً نصف شد و دیگر از نظر آماری معنادار نبود، اما تخمین‌های نقطه‌ای همچنان مثبت باقی ماندند. این نشان می‌دهد که اگرچه پایان‌بندی معنایی (Semantic Endpointing) به‌طور مؤثری شکاف سنی را کاهش می‌دهد، اما آن را به‌طور کامل از بین نمی‌برد. کنترل مثبت روی جملات کامل در تمام گروه‌ها در سطح ۹۰-۹۱٪ ثابت ماند. نکته قابل توجه این است که ترکیب آموزشی بنچمارک smart-turn بر روی TTS مصنوعی متکی است که مانند یک فرد ۸۰ ساله مکث نمی‌کند.

خطر نشانگرهای زیستی صوتی

فراتر از تعامل، این پژوهش نسبت به محصولاتی که ادعای تشخیص زوال شناختی از طریق «نشانگرهای زیستی صوتی» (Voice Biomarkers) دارند، هشدار می‌دهد. مطالعه یک سؤال بنیادی را مطرح کرد: گفتار یک فرد سالم بین جملات مختلف چقدر تغییر می‌کند؟ یک آشکارساز رانش (Drift detector) تنها می‌تواند تغییراتی را ببیند که از نویزِ خودِ گوینده فراتر رود.

در بررسی ۳۶ گوینده با بیش از ۴۰ کلیپ برای هر نفر، ضریب تغییرات (Coefficient of Variation - CV) درون‌گوینده به شرح زیر بود:

  • نرخ گفتار: حدود ۱۸٪
  • مدت زمان جمله: حدود ۲۳٪
  • تعداد مکث‌های داخلی: حدود ۷۶٪
  • زمان کل مکث‌ها: ۹۶ تا ۱۱۱٪

ویژگی‌های مکث — که رایج‌ترین نشانگر زیستی صوتی هستند — در یک گوینده واحد، حتی در یک جلسه ضبط، حدود ۱۰۰٪ نوسان دارند. برای تشخیص یک تغییر ۱۰ درصدی در زمان کل مکث با توان ۸۰٪، یک سیستم به ۷۵۸ جمله یا تقریباً ۱۹ تماس (با فرض ۴۰ جمله در هر تماس) نیاز دارد. این بدان معناست که یک «روند شش هفته‌ای» اغلب تنها دو یا سه اندازه‌گیری نویزی است. در حالی که نرخ گفتار و مدت زمان جمله قابل استفاده هستند (به ترتیب به ۲۵ و ۴۱ جمله نیاز دارند)، نشانگرهای مبتنی بر مکث با یک «کف نویز» عظیم روبروستند. این‌ها کف‌ها هستند؛ واریانس واقعی روزمره احتمالاً بیشتر است زیرا کلیپ‌های Common Voice اغلب در یک جلسه ضبط شده‌اند.

متدولوژی و کنترل‌ها

برای جلوگیری از سوگیری لهجه، پژوهشگر گروه‌ها را بر اساس جفت‌های (لهجه، جنسیت) متوازن کرد. گروه دهه ۲۰ سالگی شامل ۱۱.۹٪ انگلیسی هند و جنوب آسیا و ۴۶.۹٪ انگلیسی‌زبانان بومی بود، در حالی که در دهه ۶۰ سالگی این رقم ۶۴.۴٪ بومی بود. با تطبیق ۹۲۰ کلیپ در هر گروه در ۸ لهجه (۳۹۲ مرد / ۵۲۸ زن)، متغیر لهجه حذف شد.

حتی با حذف این کنترل‌ها و گسترش به ۳۰ لهجه در ۳۱۸۹ کلیپ و ۱۴۳۴ گوینده، نرخ‌های قطع شدن تقریباً یکسان ماند:

  • دهه ۲۰ سالگی: تطبیق‌یافته ۸.۰٪ | تطبیق‌نیافته ۷.۵٪
  • دهه ۶۰ سالگی: تطبیق‌یافته ۱۹.۷٪ | تطبیق‌نیافته ۱۹.۳٪
  • دهه ۷۰ سالگی: تطبیق‌یافته ۱۶.۶٪ | تطبیق‌نیافته ۱۶.۶٪

این بازبینی ۵۲٪ از گویندگان و ۱۸٪ از کلیپ‌ها را به اشتراک داشت، که نشان می‌دهد اعداد حاصل یک نمونه‌گیری خاص نیستند. سایر متغیرهای مزاحم نیز رد شدند:

  • کیفیت ضبط: میانه SNR در تمام گروه‌های سنی ثابت بود (۵۳.۲ / ۵۵.۷ / ۵۵.۹ دسی‌بل)، یعنی نتیجه اثر میکروفون نیست.
  • طول جملات: میانه طول جملات برای دهه ۲۰ و ۶۰ برابر ۱۱ کلمه و برای دهه ۷۰ برابر ۱۰ کلمه بود. از آنجایی که جملات کوتاه‌تر سخت‌تر بازشناسی می‌شوند (WER ۷.۷۲٪ برای ۱-۷ کلمه در مقابل ۴.۲۴٪ برای ۱۴+ کلمه)، دهه ۷۰ در واقع جملات سخت‌تری داشت. حتی با ثابت نگه داشتن طول، روند پابرجا بود: برای ۱-۷ کلمه، دهه ۷۰ دارای ۶.۰۴٪ WER بود در حالی که برای دهه ۲۰ این عدد ۸.۷۵٪ بود.
  • اعتبارسنجی کلیپ‌ها: کلیپ‌های قدیمی‌تر در واقع نرخ رای مخالف (Downvote) کمتری داشتند (۱۰.۱٪ در مقابل ۱۴.۲٪).
  • تعداد مشارکت گویندگان: برای جلوگیری از سوگیری ناشی از چند مشارکت‌کننده پرکار (یکی ۹۷۹۲ کلیپ داشت)، سهم هر گوینده به ۲۵ کلیپ محدود شد و برای بازه‌های اطمینان، گویندگان مجدداً نمونه‌برداری شدند.

پیاده‌سازی فنی و محدودیت‌ها

دقت VAD و بررسی‌های صحت:

  • دقت VAD: مطالعه در ابتدا از یک VAD مبتنی بر انرژی نسبی استفاده کرد که گزارش داد دهه ۸۰ سالگی در ۴۲.۹٪ موارد قطع شده‌اند. اما گفتار لرزان و نفس‌آلود در انتهای جملات زیر کف انرژی می‌رود. تغییر به WebRTC VAD (که در پشته‌های تولیدی واقعی استفاده می‌شود) این مورد را اصلاح کرد، زیرا در ۳۶٪ از آن کلیپ‌ها نظر متفاوتی داشت و میانه طولانی‌ترین مکث دقیق‌تری (۳۴۵ میلی‌ثانیه) ارائه داد.
  • دقت محاسباتی: برای افزایش سرعت ۲.۶ برابری نسبت به CPU، از fp16 روی MPS استفاده شد. این مورد با یک مرجع تأیید شد تا اطمینان حاصل شود هیچ کاهش دقتی رخ نداده است (WER یکسان ۰.۰۲۷۴)، زیرا کوانتایز کردن KV cache می‌تواند باعث جهش شدید در WER شود.
  • زیرساخت: تحلیل از مجموعه انگلیسی Common Voice 17 (نسخه CC-0) از طریق آینه fsicoli/common_voice_17_0 (حدود ۱۹ گیگابایت) استفاده کرد. این زیرساخت شامل ۲۳ تست برای تأیید هر ادعا، از بررسی‌های دقت تا کف رانش بود.

دامنه و محدودیت‌ها:
محدودیت‌های مهمی برای این یافته‌ها وجود دارد. داوطلبان Common Voice با فناوری راحت هستند و احتمالاً سالم‌تر از یک فرد ۷۵ ساله معمولی هستند. اختلالات تکلم (Dysarthria)، گفتار پس از سکته مغزی و زوال شناختی به‌طور ساختاری در این داده‌ها غایب هستند. بنابراین، این مطالعه «پیری سالم» را اندازه‌گیری می‌کند، نه «پیری بالینی». برداشت درست این است که «سن به تنهایی بازشناسی را خراب نمی‌کند»، نه اینکه بازشناسی برای تمام بیماران سالمند عالی است.

علاوه بر این، گفتار خوانده شده (Read speech) با گفتار محاوره‌ای متفاوت است. اگرچه گفتار خوانده شده باید مکث‌های طبیعی را کمتر نشان دهد، اما همچنان شکاف نوبت‌گیری را آشکار می‌کند. گروه دهه ۸۰ سالگی به دلیل اندازه نمونه کوچک (۲۷ گوینده در تقسیم‌بندی) به عنوان یک گزارش جداگانه باقی ماند تا باعث کوچک شدن هشت‌برابری سایر گروه‌ها نشود.

این تحلیل، معیار شمولیت در هوش مصنوعی را تغییر می‌دهد. این مسئله را از یک مشکل «شنیداری» به یک مشکل «زمان‌بندی» تبدیل می‌کند و ثابت می‌کند که ابزارهای فنی برای حل دسترسی سالمندان در حال حاضر در مدل‌های نوبت‌گیری معنایی وجود دارند.

گام بعدی شما

  • اگر توسعه‌دهندهٔ عامل‌های صوتی هستید، آستانه‌های سکوت ثابت (VAD) را با مدل‌های نوبت‌گیری معنایی جایگزین کنید.
  • در طراحی رابط‌های کاربری صوتی، گزینه‌ای برای تنظیم «صبرِ مدل» (Patience Level) برای کاربران مسن اضافه کنید.
  • در تحلیل داده‌های صوتی، نوسانات درونی هر کاربر را پیش از استنتاج دربارهٔ وضعیت سلامت او در نظر بگیرید.

اما تأثیر این مدل‌های نوبت‌گیری بر تعاملات چندنفره حتی پیچیده‌تر است — به تحلیل ما درباره‌ی مدیریت گفتگو در سیستم‌های چندعاملی مراجعه کنید.

چرا این موضوع مهم است؟

این یافته بر اساس اعتبار داده‌های Common Voice ثابت می‌کند که تبعیض در فناوری‌های صوتی نه در سطح مدل‌های بازشناسی، بلکه در منطق تعاملی است. اصلاح این مورد، دسترسی میلیون‌ها سالمند به خدمات حیاتی هوش مصنوعی را تسهیل می‌کند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که در حال ساخت دستیارهای صوتی فارسی هستند، این یک هشدار است تا در طراحی VAD برای زبان فارسی (که مکث‌های متفاوتی دارد)، از آستانه‌های ثابت دوری کنند.

·نگاه ما
تحریریه دات‌هوش

این پژوهش فرضیهٔ رایج دربارهٔ «سخت بودن» صدای سالمندان برای مدل‌های ASR را با داده‌های سخت رد می‌کند و انگشت اتهام را به سمت لایه‌ی مدیریت گفتگو (Dialogue Management) می‌گیرد. نکتهٔ کلیدی این است که ما اغلب نقص‌های سیستمی در لایه‌های بالایی را به اشتباه به ضعف مدل‌های بنیادی نسبت می‌دهیم. این یافته نشان می‌دهد که برای رسیدن به شمولیت واقعی، باید از بهینه‌سازی دقت (Accuracy) به سمت بهینه‌سازی تجربه (Experience) حرکت کنیم.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.