پرش به محتوای اصلی
پرش به محتوای مقاله

گفتار در برابر تایپ؛ افت شدید کیفیت LLM در وظایف پیچیده

·۲۱ مرداد ۱۴۰۵۸ دقیقه مطالعه۳ بازدید
مردی در حال صحبت کردن با گوشی هوشمند، با حالت ناامیدی و سردرگمی.
مردی در حال صحبت کردن با گوشی هوشمند، با حالت ناامیدی و سردرگمی.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کشف این نکته که «پاک‌سازی» متن صوتی (حذف اممم و تکرارها) عامل اصلی تخریب استدلال است، نه خودِ نویزهای صوتی؛ در واقع تلاش برای حرفه‌ای کردن متن، دقت مدل را می‌کشد.

تصور کنید برای حل یک مسئله پیچیده برنامه‌نویسی با هوش مصنوعی صحبت می‌کنید؛ در واقعیت، این بدترین راه ممکن برای رسیدن به نتیجه است. طبق مطالعه‌ای که در ۱۲ اوت ۲۰۲۶ منتشر شد و با عنوان «آیا باید به عامل‌های LLM تایپ کنیم یا صحبت کنیم؟ مطالعه‌ای جامع درباره اختلالات ورودی صوتی و کیبورد» به چاپ رسید، ورودی‌های صوتی تقریباً سه برابر بیشتر از خطاهای تایپی، به صحت (Accuracy) مدل‌ها آسیب می‌زنند. به نقل از پژوهشگران کالج سانتا مونیکا (Santa Monica College) و دانشگاه کالیفرنیا جنوبی (USC)، رابط‌های صوتی که در فیلم‌های علمی-تخیلی به عنوان نماد هوش پیشرفته نمایش داده می‌شدند، در عمل نتایجی ضعیف‌تر از پرامپت‌هایی با غلط‌های تایپی شدید تولید می‌کنند.

دهه‌هاست که سینما و فرهنگ عامه، گفتار را رابط نهایی هوش مصنوعی می‌دانند. از HAL 9000 و Deep Thought گرفته تا C3P0 و Wall-E، کلمات spoken همواره نشانه agency و هوش بوده‌اند. این سوگیری فرهنگی از زمانی شکل گرفت که تایپ کردن، فعالیتی «نیمه‌ماهرانه» تلقی می‌شد؛ کاری که تقریباً به‌طور انحصاری توسط زنانی انجام می‌شد که به‌ندرت نویسنده یا پدیدآورنده محتوایی بودند که تایپ می‌کردند. در آن دوران، قدرت با «گفتمان»، جلسات و نشست‌های عالی تعریف می‌شد. همین رویکرد باعث شد سیستم‌هایی مثل Siri و Alexa بر صوت متمرکز شوند و مدل‌های پیشرو امروز نیز رابط‌های صوتی بومی را دنبال کنند.

مردی در حال صحبت کردن با گوشی هوشمند، با حالتی ناامید از پاسخ‌های نادرست هوش مصنوعی صوتی

حتی سینمای قدیمی این گذار را پیش‌بینی کرده بود. در فیلم هیجان‌انگیز ۱۹۷۰ Colossus: The Forbin Project، ابرکامپیوتری به تصویر کشیده شد که ابتدا به دستورات صوتی با متن پاسخ می‌داد، اما با تبدیل شدن به یک دیکتاتور، کاملاً به پاسخ‌های صوتی روی آورد؛ گویی پیچیدگی زبان و هوش، لزوماً باید در قالب گفتار ظاهر شود.

اما واقعیتِ خط لوله تبدیل گفتار به متن (Transcription Pipeline)، شکاف عمیقی میان قصد کاربر و ورودی مدل ایجاد می‌کند. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، هر لایه‌ی واسط می‌تواند داده‌ها را تغییر دهد. این چالش‌ها در بررسی دقیق‌تر خط‌لوله‌های مدرن تبدیل گفتار به متن و نحوه مدیریت نویز که پیش‌تر منتشر کردیم، به تفصیل مورد بحث قرار گرفته است. وقتی شما صحبت می‌کنید، کلمات از لایه‌ای عبور می‌کنند که «ناپیوستگی‌های گفتاری» (Disfluencies) — مثل «اممم»، «مثل اینکه» (likes) یا شروع‌های اشتباه در صحبت کردن — را حذف می‌کند. این کار متن را برای انسان تمیزتر می‌کند، اما روابط ساختاری را که مدل استدلالی (Reasoning Model) برای استنتاج به آن‌ها نیاز دارد، نابود می‌کند.

نویسندگان مقاله اشاره می‌کنند که اکنون صحبت کردن یک «مسیر درجه‌یک» برای ورود به مدل‌هاست و عامل‌های کدنویسی مثل Claude Code و Codex دستورات صوتی را می‌پذیرند، اما مدل در نهایت متنی را دریافت می‌کند که کاربر به‌ندرت آن را بازبینی می‌کند.

چارچوب تست HIVE

پژوهشگران برای اندازه‌گیری این اثر، موتور تغییرات ورودی انسانی یا HIVE را توسعه دادند. این ابزار سه مسیر مختلف رسیدن پرامپت به مدل را شبیه‌سازی می‌کند:

  • کپی-پیست مستقیم: مرجع «پاک» و بدون تغییر که سایر ورودی‌ها با آن مقایسه می‌شوند.
  • کیبورد QWERTY: شبیه‌سازی خطاهای قطعی مانند جابه‌جایی حروف، تکرار حروف، حذف فاصله‌ها و خطاهای کلیدهای مجاور.
  • تبدیل صوتی: شبیه‌سازی تبدیل صوت به متن با استفاده از ترکیبی از قوانین قطعی و انتقال سبک (Style Transfer) توسط مدل Qwen2.5-7B. این مسیر شامل «پاک‌سازی» و بازنویسی متنی توسط هوش مصنوعی است.

مردی در حال صحبت کردن با گوشی هوشمند، با چهره‌ای درمانده از پاسخ‌های نادرست هوش مصنوعی صوتی

تیم تحقیق برای اطمینان از استواری نتایج، دو کنترل تجربی دیگر را نیز اجرا کرد: تغییر ترتیب سؤال و زمینه (Context)، و جابه‌جایی گزینه‌های پاسخ‌های چندگزینه‌ای. این کار اجازه داد اثرات تخریب ورودی از سایر متغیرها تفکیک شود.

شرایط آزمایش و نتایج

این ورودی‌ها روی پنج مدل اصلی شامل Llama-3.1-8B، Qwen2.5-7B، Qwen3-8B، Mistral-7B-v0.3 و Phi-4 تست شدند. برای اطمینان از ثبات نتایج، از پنج seed برای هر مدل استفاده شد. ارزیابی‌ها بر اساس شش محک (Benchmark) تخصصی صورت گرفت:

  • GSM8K، GSM-Symbolic و GSM1k (ریاضیات و استدلال)
  • HumanEval (تولید کد)
  • MMLU-Pro STEM (علوم، فناوری، مهندسی و ریاضی)
  • TruthfulQA MC1 (صداقت و واقع‌گرایی)

در این آزمایش، از ۲۰۰ مورد برای هر محک و ۱۶۴ مورد برای مجموعه کامل HumanEval استفاده شد. با استفاده از رمزگشایی حریصانه (Greedy decoding) برای مقایسه هر پرامپت تغییریافته با نسخه پاک خود، ۵۵۰,۰۰۰ پاسخ در ۱۷ تغییر پرامپت و دو تست کنترلی امتیازدهی شد. محققان تدابیر سخت‌گیرانه‌ای گرفتند تا از نشت داده‌های آزمون (Contamination) جلوگیری کنند و مطمئن شوند مدل‌ها صرفاً داده‌های آموزشی را بازخوانی نمی‌کنند.

چرا خطاهای تایپی بخشیده می‌شوند؟

یکی از غافلگیرکننده‌ترین یافته‌ها، تاب‌آوری بالای مدل‌های زبانی در برابر خطاهای تایپی است. مطالعه نشان داد که جابه‌جایی یک حرف یا نبود یک فاصله، تأثیر اندکی بر عملکرد دارد؛ زیرا سطح کلمه به اندازه کافی دست‌نخورده می‌ماند تا مدل بتواند معنا را از بستر متن استنتاج کند. در واقع، مدل استدلالی خطاها را «جذب» می‌کند.

در مقابل، تبدیل صوتی یک عمل «تفسیری» است. وقتی سیستم یک درخواست صوتی را برای موجزتر شدن «پاک‌سازی» می‌کند، اغلب عبارت اصلی کاربر را با نسخه‌ای جایگزین می‌کند که روابط واقعی بین حقایق را ندارد. محققان دریافتند که افزودن کلمات پرکننده (مثل «اممم» و «مثل اینکه») به پرامپت‌های پاک، دقت را کم می‌کند، اما حذف آن‌ها از متن‌های صوتی، عملکرد را بهبود نمی‌بخشد. این ثابت می‌کند آسیب از «زباله‌های گفتاری» نیست، بلکه ناشی از بازسازی ساختار پرامپت است.

مردی در حال صحبت کردن با دستیار هوشمند صوتی با چهره‌ای ناامید

خطر متن‌های «پاک‌سازی شده»

طبق این مطالعه، شدیدترین افت عملکرد زمانی رخ داد که درخواست‌های صوتی به‌طور خودکار بازنویسی شدند تا «حرفه‌ای‌تر» به نظر برسند. این تبدیلِ فشرده‌شده توسط هوش مصنوعی، بیشترین کاهش دقت را در وظایف استدلالی و تولید کد ایجاد کرد. مشکل اصلی این است که متن پاک‌سازی شده، ممکن است روابط بین واقعیت‌ها را تغییر دهد.

یک مثال خاص در مقاله به عبارت «او مقدار مساوی [کتاب] به فرزندانش داد» اشاره می‌کند. در فرآیند تبدیل، کلمه «مقدار» از مرجع خود (کتاب) جدا شد و به رایج‌ترین تداعی ذهنی‌اش یعنی «پول» متصل شد. در نتیجه، مدل مسئله را بر اساس پول حل کرد، نه کتاب. این نشان می‌دهد چگونه یک مرجع در مسیر رسیدن از کاربر به مدل گم می‌شود.

این اثر در وظایف مولد شدیدتر است. در حالی که آزمون‌های چندگزینه‌ای کمتر آسیب دیدند (چون گزینه‌ها از پیش موجود بودند)، وظایف محاسباتی و کدنویسی به‌شدت ضربه خوردند، زیرا به حفظ دقیق روابط در درخواست وابسته هستند.

شکاف خط لوله تبدیل

ابزارهای دیکته مدرن مانند Typeless یا زیرساخت‌های Google Assistant و Siri اغلب یک لایه مدل زبانی را برای بازنویسی درخواست‌های صوتی قبل از ارسال به مدل اصلی اضافه می‌کنند. پژوهشگران استدلال می‌کنند که این لایه بازنویسی، بزرگ‌ترین منبع آسیب است. از آنجا که کاربران به‌ندرت متنی را که واقعاً به AI ارسال شده بازبینی می‌کنند، متوجه نمی‌شوند که نسخه «پاک» پرامپت آن‌ها، فاقد ظرافت‌های لازم برای پاسخ درست است. این موضوع با شکاف عمیق میان نمرات فنی و کیفیت انسانی در مدل‌های صوتی همسو است، جایی که معیارهای استاندارد اغلب توانایی واقعی مدل در درک قصد کاربر را بیش از حد تخمین می‌زنند.

این تحقیق درک ما از ورودی «بومی» را تغییر می‌دهد. تایپ کردن برتر نیست چون بومی است — چرا که متن‌ها اغلب پیش از ارسال بازنویسی می‌شوند و زبان متنی تنها یکی از اجزای فضای نهانی است که پاسخ را برمی‌گرداند. بلکه برتر است چون توکن‌سازی (Tokenization) اصلی کاربر را مؤثرتر از خط لوله‌های صوتی فعلی حفظ می‌کند.

پیامدهای فنی و نتیجه‌گیری

توصیه برای توسعه‌دهندگان ابزارهای دیکته روشن است: ناپیوستگی‌های گفتاری را به حداقل برسانید و کلمات هم‌آوا (Homophones) را تغییر ندهید. بازسازی گفتار کاربر عملیاتی پرهزینه است که توانایی مدل در بازسازی قصد کاربر را تخریب می‌کند. نویسندگان نتیجه می‌گیرند که گران‌ترین کانال ارتباطی، «صحبت کردن» است و هزینه اصلی آن، تخریب توکن‌سازی اصلی سؤال است.

این تجربه شبیه به خبرنگارانی است که مصاحبه‌ها را دستی پیاده می‌کنند؛ این فرآیند ذاتاً تفسیری است. ما انسان‌ها به‌طور خودکار ناپیوستگی‌ها را نادیده می‌گیریم و معنا را در لحظه محاسبه می‌کنیم. پل‌های صوتی به مدل‌های زبانی در همین شکاف تفسیری شکست می‌خورند و اغلب در حفظ معنای اصلی گوینده ناتوان‌اند.

تا زمانی که مدل‌های «صوت-به-فضای-نهان» (Audio-to-latent-space) استاندارد شوند، رابط‌های صوتی فقط برای دستورات کوتاه و ساده مناسب‌اند، نه استدلال‌های پیچیده یا دستورات فنی. چارچوب‌های آینده احتمالاً به مجموعه‌داده‌های بسیار بزرگ‌تری نیاز دارند تا این شکاف را پر کنند، اما در حال حاضر، کیبورد قابل‌اعتمادترین ابزار برای دقت است.

گام بعدی شما

  • برای کارهای حساس (کدنویسی، تحلیل داده)، از ورودی صوتی پرهیز کنید یا حتماً متن تبدیل‌شده را پیش از ارسال بازبینی کنید.
  • اگر توسعه‌دهنده هستید، لایه‌های بازنویسی (Rewriting) را در مسیر تبدیل صوت به متن حذف یا به حداقل برسانید.
  • در پرامپت‌های صوتی، از کلمات صریح و بدون ابهام استفاده کنید تا احتمال جایگزینی مرجع‌ها توسط لایه پاک‌سازی کم شود.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پژوهش با تکیه بر متدولوژی HIVE ثابت می‌کند که اتکای بیش از حد به رابط‌های صوتی در ابزارهای Agentic، ریسک خطای منطقی را به‌شدت افزایش می‌دهد. اعتبار نتایج مدل در دست کاربر است، نه در لایه‌های پاک‌سازی خودکار.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که در حال ساخت دستیارهای صوتی فارسی هستند، این هشدار مهم است که بازنویسی خودکار متن کاربر می‌تواند منجر به توهمات مدل شود.

·نگاه ما
تحریریه دات‌هوش

این یافته‌ها فرضیه «رابط صوتی به عنوان جایگزین کیبورد» را در کوتاه‌مدت رد می‌کند. مشکل اصلی نه در بازشناسی گفتار (ASR)، بلکه در وسواسِ لایه‌های واسط برای «تمیز کردن» متن است که منجر به تخریب معنایی می‌شود. تا زمانی که مدل‌ها مستقیماً روی موج‌های صوتی (بدون تبدیل به متن) آموزش نبینند، دقت در استدلال‌های پیچیده صوتی دست‌یافتنی نیست.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.