پرش به محتوای اصلی
پرش به محتوای مقاله

Transcriber ورودی صوتی Whisper را به‌صورت محلی به همه مرورگرها آورد

·۲۸ تیر ۱۴۰۵۲ دقیقه مطالعه۱ بازدید
راهنما
نحوه ساخت Transcriber: موتور تبدیل صدا به متن محلی Whisper برای ابزارهای هوش مصنوعی مرورگر
نحوه ساخت Transcriber: موتور تبدیل صدا به متن محلی Whisper برای ابزارهای هوش مصنوعی مرورگر
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ایجاد یک لایه انتزاع (Abstraction) محلی که ناهماهنگی‌های Web Speech API در مرورگرهای مختلف را با اجرای مدل Whisper روی Node.js به طور کامل حذف می‌کند.

اگر همین حالا در حال توسعه یک ابزار صوتی برای وب هستید، احتمالاً با کابوس ناهماهنگی مرورگرها دست‌وپنجه نرم می‌کنید؛ جایی که کروم عالی عمل می‌کند، اما فایرفاکس تقریباً هیچ کاربردی ندارد.

برای پایان دادن به این وضعیت، توسعه‌دهندگان Machina در ۱۹ ژوئیه ۲۰۲۶ ابزار Transcriber را منتشر کردند. این سیستم در واقع یک سرور محلی Node.js است که مدل Whisper را مستقیماً در محیط پردازشی خود اجرا می‌کند.

اکثر ابزارهای هوش مصنوعی وب از Web Speech API استفاده می‌کنند که داده‌های حساس صوتی را به سرورهای ابری می‌فرستد. برای توسعه‌دهندگانی که حریم خصوصی و پایداری را اولویت می‌دانند، داشتن یک بک‌اند محلی — شبیه به داشتن یک مترجم خصوصی در خانه به‌جای تماس با مرکز ترجمه در شهر دیگر — تنها راه تضمین تجربه یکسان در کروم، فایرفاکس و سافاری است. همان‌طور که در تحلیل قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، انتقال پردازش به لبه، ریسک‌های نشت داده را به‌شدت کاهش می‌دهد. در همین راستا، مقابله با نشت اطلاعات حساس در تعامل با مدل‌ها حیاتی است و ابزارهایی مانند ctxpack برای جلوگیری از افشای کلیدهای امنیتی در پرامپت‌ها توسعه یافته‌اند.

طبق مستندات این پروژه، Transcriber از یک منطق سه‌لایه برای مدیریت صوت استفاده می‌کند:

  • لایه اول: برای کاربران کروم از Web Speech API بومی استفاده می‌کند تا تأخیر (Latency) صفر باشد.
  • لایه دوم: برای فایرفاکس و سایر مرورگرها، صوت را به‌صورت تکه‌های webm ضبط کرده و به نقطه اتصال /transcribe ارسال می‌کند.
  • لایه سوم: در صورت نبود هیچ‌یک از سیستم‌ها، یک کادر متنی دستی برای کاربر نمایش می‌دهد.

به گزارش وب‌سایت dev.to، این سیستم برای تبدیل صوت به فرمت WAV از ffmpeg استفاده می‌کند. کاربران می‌توانند مدل‌ها را بر اساس نیاز تغییر دهند؛ مثلاً مدل Xenova/whisper-tiny با حجم ۷۵ مگابایت برای سرعت بالا یا مدل Xenova/whisper-small با حجم ۴۶۰ مگابایت برای دقت بیشتر. مدل پایه حدود ۱۵۰ مگابایت است و پس از اولین اجرا، به‌صورت محلی ذخیره (Cache) می‌شود.

این تغییر، بار پردازش تبدیل صوت را از APIهای غیرقابل‌اعتماد مرورگر به یک محیط کنترل‌شده محلی منتقل می‌کند. با جداسازی بخش پشتیبان صوتی از مرورگر، توسعه‌دهندگان می‌توانند ابزارهایی بسازند که واقعاً مستقل از پلتفرم باشند و حریم خصوصی کاربر را حفظ کنند، چون هیچ داده صوتی از دستگاه خارج نمی‌شود. این رویکرد بهینه کردن سرعت پاسخ‌دهی در محیط‌های محلی، شباهت زیادی به تلاش‌های اخیر برای کاهش تأخیر در پردازش‌های سنگین دارد، مانند آنچه مدل Wan-Streamer برای تبدیل تعاملات ویدئویی به زمان واقعی به دست آورده است.

گام بعدی شما

  • اگر ابزارهای Local-first می‌سازید، Transcriber را به عنوان بخشی از مجموعه متن‌باز Machina بررسی کنید.
  • مدل‌های Tiny و Small را بر اساس سخت‌افزار کاربران هدف خود تست کنید تا تعادل بین سرعت و دقت برقرار شود.
  • جریان احقاق دسترسی‌های صوتی در سافاری را با این روش جایگزین کنید تا اصطکاک کاربر کاهش یابد.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است؛ به بررسی ما درباره تأثیر شتاب‌دهنده‌های جدید بر استنتاج محلی مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با حذف وابستگی به سرویس‌های ابری، استانداردی جدید برای حریم خصوصی در ابزارهای صوتی وب ایجاد می‌کند. اعتبار این رویکرد در استفاده از مدل‌های Whisper است که در حال حاضر دقیق‌ترین سیستم‌های بازشناسی گفتار جهان هستند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت‌های دسترسی به APIهای ابری گوگل و اپل در مرورگرها مواجه‌اند، این راهکار محلی جایگزینی ایده‌آل و بدون نیاز به VPN برای پیاده‌سازی قابلیت‌های صوتی است.

·نگاه ما
تحریریه دات‌هوش

انتقال Whisper به لایه‌ی Node.js نشان می‌دهد که عصر تکیه به APIهای استاندارد مرورگر برای قابلیت‌های سنگین AI رو به پایان است. این رویکرد عملاً مرورگر را تنها به یک پوسته نمایش تبدیل کرده و منطق اصلی را به محیط لبه (Edge) منتقل می‌کند تا پیش‌بینی‌پذیری سیستم افزایش یابد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.