پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Audex انویدیا دلیل افت استدلال متنی در سیستم‌های چندوجهی را حل کرد

·۱۷ تیر ۱۴۰۵۵ دقیقه مطالعه۲ بازدید
انتشار Audex توسط انویدیا: مدل زبانی یکپارچه صدا-متن با حفظ هوشمتدی متنی مدل پایه
انتشار Audex توسط انویدیا: مدل زبانی یکپارچه صدا-متن با حفظ هوشمتدی متنی مدل پایه
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معماری Audex برای نخستین بار با استفاده از یک برنامه آموزشی چندمرحله‌ای (Multi-stage SFT)، اثر منفی قابلیت‌های صوتی بر استدلال متنی را حذف کرد و توانست صداهای محیطی غیرگفتاری را در یک مدل وزن‌باز تولید کند.

بسیاری از توسعه‌دهندگان مدل‌های چندوجهی با پدیده‌ای به نام «مالیات متنی» (text tax) دست‌وپنجه نرم می‌کنند؛ وضعیتی مزمن در هوش مصنوعی چندوجهی که در آن اضافه کردن قابلیت‌های صوتی یا تصویری، به‌طور معمول باعث افت عملکرد و سقوط نمرات مدل در بنچمارک‌های متنی می‌شود. انویدیا با معرفی Audex (مدل Nemotron-Labs-Audex-30B-A3B)، یک مدل زبانی بزرگ unified (یکپارچه) صوتی-متنی، قصد دارد این بازگشت رو به عقب یا رگرسیون را متوقف کند. هدف اصلی این مدل، حفظ هوش و توانمندی‌های استدلالی مدل پایه است. نقاط بازرسی (Checkpoints) برای مدل اصلی و یک نسخه کوچک‌تر به نام Audex-2B تحت یک لایسنس غیرتجاری منتشر شده‌اند.

طبق گزارش پژوهشی انویدیا، اکثر مدل‌های چندوجهی هنگام انتقال از قابلیت‌های «فقط متن» به خروجی‌های گفتاری، دچار زوال استدلالی (reasoning decay) می‌شوند. نکته قابل توجه این است که این اتفاق حتی برای مدل‌هایی که فقط خروجی گفتار دارند نیز رخ می‌دهد. انویدیا برای حل این مشکل، ورودی‌های صوتی را به‌عنوان تصویرهایی (projections) در فضای بردار معنایی (Embedding) متنی و خروجی‌های صوتی را به‌عنوان توکن‌های متنی تعریف کرده است. این معماری به مدل اجازه می‌دهد تا از این سبک تبادل یا trade-off رایج اجتناب کرده و در عین پردازش صداهای پیچیده، نمرات بالای استدلالی خود را حفظ کند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی مدل‌های زبانی اشاره کردیم، حفظ تعادل بین تخصص‌های مختلف در یک مدل واحد همواره یک چالش مهندسی بوده است. این تلاش برای دستیابی به تعادل در استدلال، یادآور عملکرد مدل Nemotron 3 Ultra بود که در مقایسه با مدل‌های بسته، توان استدلالی مشابهی را به نمایش گذاشت. بر اساس مستندات فنی وب‌سایت marktechpost.com، مدل Audex یک دکودر ترنسفورمر با معماری ترکیب خبره‌ها (Mixture-of-Experts یا MoE) است که در مجموع ۳۰ میلیارد پارامتر دارد، اما برای هر توکن تنها ۳ میلیارد پارامتر فعال می‌شود. هسته‌ی این مدل، Nemotron-Cascade-2-30B-A3B است که یک مدل ترکیبی Mamba-Transformer با ۵۲ لایه و ۱۲۸ خبره قابل مسیریابی است که در هر توکن ۶ مورد از آن‌ها فعال می‌شوند.

جزئیات فنی این معماری را می‌توان در موارد زیر بررسی کرد:

  • پردازش صوت: این بخش از AF-Whisper (برگرفته از Audio Flamingo 3) استفاده می‌کند که معماری Whisper Large-v3 را برای مدیریت ورودی‌های ۱۶ کیلوهرتزی به اشتراک می‌گذارد. همچنین آداپتورهای MLP دو لایه، ویژگی‌های صوتی را به ابعاد مدل نگاشت می‌کنند.
  • گسترش واژگان: تعداد توکن‌های اولیه از ۱۳۱,۰۷۲ به ۲۰۵,۳۱۲ افزایش یافت تا توکن‌های گسسته صوتی (discrete audio tokens) را در بر گیرد.
  • کدک‌های خروجی:
    • برای گفتار: از X-Codec2 با سرعت ۵۰ توکن در ثانیه استفاده شده که کوانتزاسیون اسکالر محدود تک‌لایه (FSQ) با یک کدبوک ۶۵,۵۳۶ تایی را اعمال می‌کند.
  • برای صداهای غیرگفتاری: از X-Codec با سرعت ۲۰۰ توکن در ثانیه و چهار لایه کوانتزاسیون بردار باقی‌مانده مسطح (RVQ) استفاده می‌کند. در واقع، برای صداهای پیچیده بودجه توکنی بیشتری نسبت به گفتار در نظر گرفته شده است. این رویکرد در تولید صوت بهینه، مکمل راهکارهای جدید کاهش هزینه صوت از طریق مدل‌های زبانی است که بازدهی تولید را به شدت افزایش می‌دهد.
  • زیرساخت و زمینه: پشتیبانی از پنجره زمینه (Context Window) تا یک میلیون توکن. این مدل با استک‌های استاندارد LLM، شامل Megatron-LM برای آموزش و vLLM برای استنتاج (Inference) سازگار است.
  • حالت‌های عملیاتی: پشتیبانی هم‌زمان از حالت «دستوری» (instruct mode) and حالت «تفکر» (thinking mode).

در بخش مکانیسم آموزش، تیم انویدیا اعلام کرده است که آموزش Audex به هیچ پیش‌آموزش (pretraining) صوتی اولیه نیاز نداشت و مستقیماً از نقطهٔ بازرسی SFT متنی آغاز شد. برای جلوگیری از رگرسیون و فراموشی، یک برنامه آموزشی SFT چندمرحله‌ای شامل: SFT متنی، گرم‌کردن صوتی (audio warmup)، تولید صوت و در نهایت درک صوت اجرا شد.

در مرحله گرم‌کردن صوتی، برداری‌های توکن متنی ثابت (frozen) نگه داشته شدند؛ زیرا تحلیل‌های ابلیشن (ablations) نشان داد که باز کردن قفل این بردارها باعث کاهش کیفیت متنی می‌شود. تیم پژوهشی یک دستورالعمل تک‌مرحله‌ای را نیز آزمایش کرد که در آن تمام داده‌ها به‌طور هم‌زمان ترکیب می‌شدند، اما این روش باعث شکست بازیابی زمینه بلند در بنچمارک NIAH شد. در نتیجه، رویکرد چندمرحله‌ای به عنوان متد پیش‌فرض انتخاب شد.

پس از SFT، مدل تحت یادگیری تقویتی Cascade RL (فقط متنی) و تقطیر on-policy چنددامنه (MOPD) قرار گرفت. پس از این فرآیند، وظایف صوتی رگرسیون اندکی داشتند یا اصلاً دچار افت نشدند، در حالی که نمرات متنی بهبود یافت. ترکیب داده‌های عظیم مورد استفاده، شامل ۱۵۷.۴ میلیارد توکن صوتی و ۳۲۰.۵ میلیارد توکن متنی بود که حوزه‌های ASR (بازشناسی گفتار)، AST (تشخیص صوت)، TTS (تبدیل متن به گفتار)، متن-به-صوت و درک صوتی را پوشش می‌داد.

نتایج بنچمارک‌ها نشان می‌دهد که Audex تقریباً به‌طور کامل از هسته‌ی خود پیروی می‌کند. این مدل در آزمون MMLU-Redux نمره ۸۶.۴ را کسب کرد (کمی بیشتر از ۸۶.۳ هسته) و در IMO AnswerBench با امتیاز ۸۱.۱ در برابر ۷۹.۳ هسته پیشتازی کرد. در رویارویی‌های مستقیم، Audex بر مدل Qwen3.5-35B-A3B در چندین بنچمارک استدلالی و ترازسازی (alignment) غلبه کرد.

مقایسه در استدلال و ترازسازی:

  • HMMT (فوریه ۲۰۲۵): Audex (۹۲.۲) در برابر Qwen3-Omni-30B-A3B-Thinking (۶۰.۴)
  • IMO AnswerBench: Audex (۸۱.۱) در برابر Qwen3-Omni (۵۹.۹)
  • LiveCodeBench v6: Audex (۸۵.۳) در برابر Qwen3-Omni (۵۹.۲)
  • ArenaHard v2: Audex (۸۱.۶) در برابر Qwen3-Omni (۵۵.۱)
  • IFBench (prompt): Audex (۷۷.۸) در برابر Qwen3-Omni (۵۲.۴)

در حوزه صوت نیز، Audex با نرخ خطای کلمه (WER) ۶.۸۲، جایگاه نخست مدل‌های وزن‌باز در OpenASR را به دست آورد و هر دو مدل Step-Audio-R1.1-33B (با ۷.۹) و Qwen3-Omni (۸.۰) را شکست داد. در حالی که این مدل در MMAU (۷۵.۶) و Audio Entailment (۹۵.۰) پیشتاز است، اما در MMAR (۶۳.۲) و MMSU (۶۳.۴) از این مدل‌های پایه عقب‌تر است.

از نظر پیاده‌سازی، اهمیت Audex در سادگی آن است؛ زیرا به‌جای استفاده از ساختارهای آبشاری متوالی یا تفکیک «متفکر-سخنور» (thinker-talker)، به‌عنوان یک مدل واحد یکپارچه عمل می‌کند و بسیار راحت‌تر مستقر (deploy) می‌شود. این سادگی در معماری و بهینه‌سازی در استقرار، مشابه رویکردی است که انویدیا در مدل TwoTower برای افزایش نرخy پردازش (throughput) از طریق رمزگشایی متفاوت به کار گرفت. برای توسعه‌دهندگان، این مدل از قالب ChatML پیروی کرده و از vLLM 0.20.0 به‌عنوان کانتینر مرجع استفاده می‌کند.

این طراحی موارد کاربردی با بهره‌وری بالا را ممکن می‌سازد:

  • مراکز تماس چندزبانه: Audex می‌تواند یک تماس آلمانی را ترانویسی کرده و به انگلیسی ترجمه کند و به‌طور هم‌زمان زبان مبدأ، ترانویسی و ترجمه را خروجی دهد.
  • طراحی صدا: یک کپشن مانند «چهچهه پرندگان در جنگل» از طریق یک VAE تقویت‌کننده برای خروجی ۴۸ کیلوهرتزی، یک کلیپ ۱۰ ثانیه‌ای تولید می‌کند.
  • دسترسی‌پذیری: برای اپلیکیشن‌های خواندن متن، نرخ خطای کلمه انگلیسی Seed-TTS-Eval تنها ۱.۷۰ است.
  • دستیارهای صوتی: تبدیل گفتار به گفتار به‌صورت آبشاری با استفاده از یک نقطه بازرسی اجرا می‌شود و در BigBenchAudio نمره ۹۰.۰ کسب کرده است.

برای استقرار، درک صوتی، ASR و ترجمه همگی از یک فرمت QA با استفاده از جای‌گذار <sound> استفاده می‌کنند. تیم پژوهشی برای «درک صوتی» تنظیمات top_p=0.9 و temperature=0.7 را توصیه می‌کند، در حالی که برای «شناسایی» و «ترجمه» باید از نمونه‌گیری حریصانه (Greedy sampling) استفاده شود. وظایف تولیدی نیز به Classifier-free guidance نیاز دارند.

نقاط قوت مدل شامل رگرسیون متنی بسیار اندک نسبت به هسته و توانایی نادر در تولید صداهای عمومی در میان مدل‌های متن‌باز است. همچنین در وظایف استدلالی به‌طور چشمگیر از Qwen3.5-35B-A3B پیشی می‌گیرد.

نقاط ضعف شامل لایسنس OneWay انویدیا است که استفاده تجاری را محدود می‌کند. درک صوتی در MMAR و MMSU شکاف‌هایی دارد. علاوه بر این، تبدیل گفتار به گفتار در حال حاضر به‌صورت آبشاری است و نه به‌صورت بومی دوطرفه (native full-duplex). از آنجایی که RL فقط متنی بود، یادگیری تقویتی صوتی-متنی در برنامه‌های آینده قرار دارد.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، مدل را از طریق vLLM 0.20.0 و با قالب ChatML تست کنید.
  • برای درک صوتی، تنظیمات top_p=0.9 و temperature=0.7 را به کار ببرید.
  • برای شناسایی و ترجمه، از نمونه‌گیری حریصانه (Greedy sampling) استفاده کنید.

اما اثر این معماری بر کاهش هزینه‌های سخت‌افزاری در مقیاس صنعتی حتی حیاتی‌تر است — به بررسی ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با تکیه بر تخصص انویدیا در سخت‌افزار و نرم‌افزار، ثابت می‌کند که مدل‌های چندوجهی می‌توانند بدون از دست دادن بهره‌وری متنی، در حوزه صوت پیشرو باشند. این دستاورد مسیر ساخت دستیارهای صوتی با استدلال پیشرفته را هموار می‌کند.

تأثیر برای ایران

به‌دلیل لایسنس غیرتجاری انویدیا، این مدل برای پژوهشگران ایرانی در محیط‌های دانشگاهی مفید است، اما برای استارتاپ‌های داخلی که به‌دنبال محصول تجاری هستند، محدودیت‌های حقوقی دارد.

·نگاه ما
تحریریه دات‌هوش

حذف «مالیات متنی» نشان می‌دهد که مشکل مدل‌های چندوجهی نه در کمبود داده، بلکه در تداخل فضاهای برداری است. انویدیا با تثبیت وزن‌های متنی در مراحل اولیه آموزش صوتی، ثابت کرد که می‌توان قابلیت‌های حسی را بدون تخریب هسته استدلالی اضافه کرد. این رویکرد احتمالاً استاندارد جدیدی برای مدل‌های ترکیبی MoE خواهد بود تا از فروپاشی منطقی در هنگام تغییر مود خروجی جلوگیری کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.