پرش به محتوای اصلی
پرش به محتوای مقاله

Qwen3-ASR: کاهش نرخ خطای تبدیل صوت به متن از ۷.۴٪ به ۱.۸۴٪

·۵ خرداد ۱۴۰۵۲ دقیقه مطالعه
اشتراک‌گذاری

اگر متون حساس پزشکی یا حقوقی را دیکته می‌کنید، دیگر نیازی نیست داده‌های صوتی خود را به سرورهای ابری بفرستید.

اکثر ابزارهای تبدیل صوت به متن، صدا را برای پردازش به مراکز داده می‌فرستند. این یعنی ریسک حریم خصوصی و تضاد با استانداردهای GDPR. Brethof Voice Pro 2.0 که در ۲۵ مه ۲۰۲۶ عرضه شد، این معادله را تغییر داد.

این نرم‌افزار از استنتاج (Inference) — مثل لحظه‌ای که یک آشپز واقعاً غذا می‌پزد، نه وقتی دستور پخت را می‌خواند — روی سخت‌افزار کاربر استفاده می‌کند. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی رایانش لبه اشاره کردیم، انتقال پردازش به سخت‌افزار کاربر، امنیت را تضمین می‌کند. بهینه‌سازی سرعت پاسخ‌دهی در مدل‌های صوتی، چالشی است که پیش‌تر در تلاش‌های xAI برای حذف تأخیر استدلال در گروک مورد بررسی قرار گرفت.

به نقل از گزارش dev.to، مدل Qwen3-ASR که روی llama.cpp با مدل‌های کوانتیزه شده‌ی GGUF اجرا می‌شود، نرخ خطای کلمات (WER) ۱.۸۴ درصدی را در آزمون ۱۰ زبانه ثبت کرد. در مقابل، مدل Whisper Large-v3 شرکت OpenAI نرخ خطای ۷.۴ درصدی دارد. رقابت برای دستیابی به دقت و سرعت انسانی در پردازش صوت، اکنون به حوزه‌های مختلفی گسترش یافته است؛ همان‌طور که Mistral با مدل Voxtral سعی کرد استانداردهای ElevenLabs را به چالش بکشد.

ویژگی‌های فنی کلیدی این ابزار عبارتند از:

  • ترجمه در ۳۸ زبان مختلف از طریق مدل Hunyuan-MT2. این رویکرد جامع در مدیریت زبان‌ها، یادآور تحولاتی است که در معماری مدل‌های چندزبانه Flux دیدیم و نحوه پردازش زبان‌های مختلف را دگرگون کرد.
  • کیبورد صوتی که متن ترجمه‌شده را مستقیماً در هر اپلیکیشن سیستم‌عامل وارد می‌کند.
  • سرور MCP برای اتصال ابزارهای تبدیل صوت به عامل‌هایی مثل Claude Desktop و Cursor.
  • پشتیبانی از پردازنده‌های CPU و گرافیک‌های NVIDIA، AMD و Intel از طریق Vulkan.

این عرضه ثابت می‌کند که پردازش محلی دیگر یک «سازش» نیست. طبق اعلام سازندگان، تحول‌آفرین‌ترین قابلیت این ابزار، تنظیم دقیق (Fine-tuning) — شبیه وقتی که به یک پزشک عمومی، تخصص پوست می‌دهیم تا در یک حوزه دقیق شود — به‌صورت محلی است. با آموزش مدل ۰.۶ میلیارد پارامتری روی تنها ۱۱ ساعت صوت شخصی، این مدل در زبان لهستانی از دقت Whisper پیشی گرفت. این یعنی حذف خطاهای ناشی از لهجه‌های غلیظ یا اصطلاحات تخصصی، بدون نشت داده‌ها.

گام بعدی شما

  • تست رایگان ۱۴ روزه در سایت brethof.ai/voice برای بررسی دقت مدل روی دایره لغات تخصصی شما.
  • بررسی سازگاری سخت‌افزاری سیستم خود با Vulkan برای اجرای بهینه.
  • آزمایش تنظیم دقیق محلی (LoRA) برای حذف خطاهای تکراری در تبدیل صوت.

اما این دقت بالا، هزینه‌ی سخت‌افزاری چه تغییری ایجاد می‌کند؟ در تحلیل ما درباره‌ی بهینه‌سازی GGUF پاسخ را بیابید.

چرا این موضوع مهم است؟

این پیشرفت نشان می‌دهد که تخصص در داده‌های محلی (Local Data) می‌تواند جایگزین حجم عظیم داده‌های عمومی شود. این موضوع اعتبار مدل‌های کوچک را در محیط‌های حساس پزشکی و حقوقی افزایش می‌دهد.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.