پرش به محتوای اصلی
پرش به محتوای مقاله

Kyutai: دقت حل مسائل ریاضی صوتی به ۷۷.۱٪ رسید

·۱ مهر ۱۴۰۵۴ دقیقه مطالعه
مدل صوتی Kyutai با یادگیری تقویتی مسائل ریاضی گفتاری را حل می‌کند
مدل صوتی Kyutai با یادگیری تقویتی مسائل ریاضی گفتاری را حل می‌کند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نخستین کاربرد یادگیری تقویتی (RL) برای بهبود استدلال ریاضی مستقیماً روی توکن‌های صوتی — حذف نیاز به تبدیل صوت به متن برای انجام محاسبات منطقی.

تصور کنید دستیار صوتی شما به‌جای تبدیل صدای شما به متن و سپس فکر کردن، مستقیماً با همان موج‌های صوتی استدلال کند. این یعنی حذف تأخیرهای آزاردهنده و حفظ تمام ظرافت‌های لحن و احساس در پاسخ‌های پیچیده.

مدل‌های Voice of Reason از شرکت Kyutai موفق شدند در محک GSM8K، صحت پاسخ‌های ریاضی صوتی را به ۷۷.۱٪ برسانند. این دستاورد یک چرخش راهبردی است؛ چراکه مدل را از وابستگی به خط لوله‌های متوالی (Cascaded Pipelines) — که بر مراحل مجزای تبدیل گفتار به متن (Speech-to-Text) و متن به گفتار (Text-to-Speech) تکیه دارند — رها می‌کند.

زمینه و بستر استدلال صوتی

اکثر دستیارهای صوتی فعلی از یک فرآیند سه‌مرحله‌ای استفاده می‌کنند: ابتدا صوت را به متن تبدیل (Transcribe) می‌کنند، سپس آن را با یک مدل زبانی بزرگ (LLM) پردازش کرده و در نهایت نتیجه را دوباره به گفتار تبدیل می‌کنند. طبق گزارش‌های فنی، اگرچه این روش مؤثر است، اما علاوه بر ایجاد تأخیر (Latency)، نشانه‌های فرازبانی مانند لحن، آهنگ صدا و احساسات را کاملاً حذف می‌کند. در همین راستا، تلاش برای بهینه‌سازی لایه‌ی اول این فرآیند ادامه دارد؛ برای مثال مدل Muse Voice متا توانست نرخ خطای تبدیل گفتار به متن را به ۳.۱٪ برساند.

مدل‌های بومیِ صوت (Speech-native) با چالشی منحصر‌به‌فرد روبرو هستند: آن‌ها باید خروجی صوتی را در فواصل زمانی منظم تولید کنند تا تعاملی باقی بمانند. این محدودیت باعث می‌شود تعداد توکن‌های استدلالی نهان (Hidden Reasoning Tokens) که مدل می‌تواند تولید کند، بسیار محدود شود. برای درک این شکاف، باید به اعداد نگاه کرد: مدل پایه GLM-4-Voice تنها ۲۷.۳٪ صحت در GSM8K داشت، در حالی که متد STITCH پیشین با افزودن تکه‌های استدلالی، این عدد را به ۵۸.۷٪ رسانده بود. این رویکرد استفاده از توکن‌های نهان برای بهبود استدلال، یادآور مدل BDH-CQ است که با بهره‌گیری از استدلال نهان توانست هزینه‌های استنتاج در محک ARC-AGI را به شدت کاهش دهد.

با تکیه بر منطق یادگیری تقویتی (RL) که پیش‌تر در تحلیل مدل‌های معاملات کمی (Quantitative Trading) بررسی کردیم، Kyutai اصول بهینه‌سازی مشابهی را در دامنه صوتی به کار گرفت تا شکاف استدلالی را پر کند. این پژوهش در واقع اولین کاربرد یادگیری تقویتی برای استدلال ریاضی در مدل‌های بومیِ صوت است.

به نقل از گزارش فنی Marktechpost، پژوهشگران با استفاده از مدل پایه GLM-4-Voice-9B و یک فرآیند آموزشی دو مرحله‌ای پیش رفتند.

جزئیات آموزش

در مرحله اول، آن‌ها از تنظیم نظارت‌شده (SFT) با استفاده از ۱۵۰,۶۱۶ مسئله از مجموعه Orca-Math بهره بردند. این مسائل توسط مدل Qwen3-235B برای قالب صوتی بازنویسی شدند و سپس از طریق DSM TTS با صداهای متنوع تولید شدند. این گام اولیه به‌تنهایی صحت پاسخ‌ها را از ۲۷.۳٪ به ۶۱.۷٪ افزایش داد.

در مرحله دوم، یک هدف یادگیری تقویتی از نوع group-relative REINFORCE پیاده‌سازی شد. سازوکار این مرحله به شرح زیر بود:

  • نمونه‌گیری: برای هر سؤال صوتی، مدل ۴ پاسخ مختلف با دمای (Temperature) ۰.۹ تولید کرد.
  • داوری: مدل Qwen3-235B-A22B-2507 به‌عنوان داور، متن رمزگشایی شده را بدون دیدن پاسخ مرجع، با یک پاداش باینری (صفر و یک) امتیازدهی کرد. در ۱۰۰ مورد که به‌صورت دستی بررسی شد، این داور در ۸۸٪ موارد با انسان‌ها هم‌نظر بود.
  • بهینه‌سازی: پاداش‌ها در هر گروه مرکزیت یافتند. این متد با GRPO مرتبط است اما برش‌های PPO (PPO clipping) و منظم‌سازی KL را حذف می‌کند.

این فاز یادگیری تقویتی روی ۱۶ پردازنده H100 طی ۱,۵۰۰ به‌روزرسانی انجام شد. دو مکانیزم فنی کلیدی در این موفقیت نقش داشتند:

اول، اصلاح دما؛ لاجیت‌ها پیش از تابع زیان log-softmax بر دمای نمونه‌گیری تقسیم شدند. بدون این اصلاح، صحت در GSM8K از ۶۵.۵٪ به ۱۲.۳٪ سقوط می‌کرد. دوم، ادغام توکن‌های صوتی (Audio-Token Merging)؛ در هر موقعیت صوتی، تمام احتمالات واژگان صوتی در یک توکن انتزاعی جمع شدند. در اینجا تابع زیان فقط می‌پرسد که آیا «صوت» در جایگاه بعدی قرار دارد یا خیر، نه اینکه دقیقاً کدام توکن صوتی استفاده شده است. ثابت شده است که این تخمین‌گر بدون سوگیری (Unbiased) است و واریانس کمتری دارد.

شرکت Kyutai دو نقطه بازرسی (Checkpoint) متمایز را در Hugging Face منتشر کرد. مدل glm-4-voice-of-reason-9b مستقیماً به سؤالات پاسخ می‌دهد. اما مدل glm-4-voice-of-reason-stitch-9b از تکه‌های استدلالی ۱۰۰ توکنی «ساکت» بین بلوک‌های صوتی استفاده می‌کند. از آنجا که این تکه‌ها هم‌زمان با پخش صدای قبلی تولید می‌شوند، فرآیند «تفکر» هیچ تأخیر محسوسی برای تجربه کاربر ایجاد نمی‌کند.

عملکرد و بنچمارک‌ها

داده‌های عملکردی نشان می‌دهد مدل Stitch به صحت ۷۷.۱٪ در GSM8K (نسخه منتشر شده) رسیده است که به‌طور قابل‌توجهی از عدد ۵۸.۷٪ در متد STITCH قدیمی بالاتر است. برای مقایسه، مدل مستقیم (Direct) به صحت ۷۰.۳٪ رسید.

در حالی که سیستم‌های بزرگ‌تری مانند Qwen3-Omni (۳۰ میلیارد پارامتری) با ۹۴.۶٪ در خروجی متنی پیشتاز هستند و سیستم‌های متوالی ASR-LLM-TTS به ۹۵.۷٪ رسیده‌اند، مدل‌های ۹ میلیاردی Kyutai ثابت کردند که استدلال سطح بالا در معماری‌های کوچک‌تر و بومیِ صوت نیز ممکن است. یافته‌های دیگر عبارتند از:

  • گفتار واقعی: در تست با Qwen3-ASR-1.7B، مدل Stitch امتیاز ۷۲.۰ ± ۱.۹٪ کسب کرد. این در حالی است که رقبا نیز در حال ارتقای زیرساخت‌های خود هستند و مثلاً مدل Grok Voice Transcribe 2.0 توانسته است دقت تبدیل گفتار به متن را دو برابر کند.
  • طبیعی بودن: امتیاز UTMOSv2 تقریباً ثابت ماند و برای مدل مستقیم از ۴.۰۶۷ به ۴.۰۶۹ تغییر کرد.
  • کارایی: یادگیری تقویتی در واقع میانگین طول پاسخ‌های مدل مستقیم را از ۴۱.۹ به ۳۶.۴ ثانیه کاهش داد.
  • بهره‌وری داده: با استفاده از تنها ۱۰٪ از داده‌های SFT، یک اجرای طولانی‌تر RL توانست به صحت ۵۸.۵٪ برسد، در حالی که SFT به‌تنهایی تنها ۴۳.۹٪ صحت داشت.

این پیشرفت معیار تعامل با هوش مصنوعی را تغییر می‌دهد و ثابت می‌کند که یادگیری تقویتی را می‌توان مستقیماً روی توکن‌های صوتی اعمال کرد تا منطق مدل بهبود یابد. این یعنی «مالیات استدلال» — یعنی همان تأخیری که معمولاً با تفکر پیچیده همراه است — می‌تواند از طریق تولید متناوب صوت و متن پنهان شود.

البته این پیشرفت هزینه‌ای داشت. پژوهشگران متوجه افت در دانش عمومی شدند؛ امتیاز Spoken TriviaQA از ۴۰.۶٪ به ۳۴.۰٪ کاهش یافت که این اثر جانبی عمدتاً به فرآیند SFT با داده‌های کامل نسبت داده شد، نه فاز RL. برای اطمینان از اعتبار ارزیابی، تیم موارد AddSub, MultiArith, SingleEQ و SVAMP را از ارزیابی حذف کرد. از ۶۷۸ سؤال بررسی شده، ۵۴.۰٪ آن‌ها در سطح بازنویسی (Paraphrase) با Orca-Math هم‌پوشانی داشتند.

برای استقرار، هر دو نقطه بازرسی BF16 روی یک GPU H100 قابل اجرا هستند. کاربران برای توکن‌ساز و رمزگشای صوتی به مخزن GLM-4-Voice نیاز دارند و وزن‌ها تحت لایسنس GLM-4-Voice منتشر شده‌اند.

گام بعدی شما

  • اگر روی دستیارهای صوتی کار می‌کنید، مدل Stitch را برای کاهش تأخیر در استدلال‌های پیچیده تست کنید.
  • معماری ادغام توکن‌های صوتی (Audio-Token Merging) را برای کاهش واریانس در مدل‌های مولد صوت بررسی کنید.
  • توازن بین استدلال ریاضی و دانش عمومی (General Knowledge) را در مدل‌های کوچک‌تر پایش کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص Kyutai در یادگیری تقویتی، ثابت می‌کند که استدلال پیچیده نیازی به واسطه متنی ندارد. این تغییر باعث می‌شود دستیارهای صوتی از حالت «تکرارکننده متن» به «متفکر بومی صوت» تبدیل شوند.

تأثیر برای ایران

این مدل‌ها به‌دلیل وزن‌های باز (Open Weights)، فرصتی برای پژوهشگران ایرانی در حوزه پردازش گفتار فراهم می‌کند تا بدون نیاز به APIهای گران‌قیمت، مدل‌های استدلالی صوتی را روی سخت‌افزارهای موجود بهینه کنند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی خط لوله‌های متوالی با مدل‌های بومی صوت، مفهوم «تأخیر» را در تعاملات انسانی-ماشین بازتعریف می‌کند. استفاده از توکن‌های استدلالی ساکت (Silent Reasoning) نشان می‌دهد که می‌توان هزینه محاسباتی تفکر را در زمان پخش خروجی پنهان کرد. این رویکرد احتمالاً استاندارد جدیدی برای مدل‌های Omni خواهد بود تا بدون قربانی کردن سرعت، دقت منطقی را حفظ کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.