پرش به محتوای اصلی
پرش به محتوای مقاله

SWT پردازش صوت را با مدل‌های محلی از زنجیرهٔ ابری خارج کرد

·۱۸ تیر ۱۴۰۵۳ دقیقه مطالعه
راهنما
ابزار تبدیل گفتار به متن آفلاین رومیزی SWT — امن، سریع، بدون آپلود داده
ابزار تبدیل گفتار به متن آفلاین رومیزی SWT — امن، سریع، بدون آپلود داده
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

یکپارچه‌سازی چندین مدل رقیب (SENSEVoice و Whisper) در یک رابط کاربری آفلاین واحد که اجازه می‌دهد کاربر بسته به VRAM موجود، مدل را در لحظه تغییر دهد.

اگر حریم خصوصی داده‌های صوتی برای شما خط قرمز است، دیگر لازم نیست بین امنیت و بهره‌وری یکی را انتخاب کنید. ابزار SWT (声文通) اجازه می‌دهد تمام فایل‌های صوتی شما بدون حتی یک بایت تبادل داده با سرورهای خارجی، روی سیستم خودتان به متن تبدیل شوند. این ابزار یک نرم‌افزار دسکتاپ است که تمام پردازش‌ها را به‌صورت محلی انجام می‌دهد و هیچ نیازی به اتصال اینترنت ندارد.

طبق مستندات منتشرشده در ۹ ژوئیه ۲۰۲۶، این پروژه متن‌باز با انتقال کامل خط لوله استنتاج (Inference) — که شبیه به لحظهٔ نهایی آشپزی است، نه دوره‌ی آموزش آشپز — به سخت‌افزار کاربر، هرگونه نگرانی درباره‌ی نشت داده‌ها در فضای ابری را برطرف کرده است. در حالی که اکثر سرویس‌های حرفه‌ای امروزی از APIهای ابری استفاده می‌کنند و ضبط‌های خصوصی شما را به سرورهای خارجی می‌فرستند، SWT این مدل را وارونه می‌کند. این رویکرد یادآور تلاش‌های اخیر برای جایگزینی ابزارهای تجاری با کتابخانه‌های متن‌باز و حریم‌خصوصی‌محور است تا وابستگی کاربران به زیرساخت‌های ابری کاهش یابد.

این ابزار بر پایهٔ چارچوب FunASR توسعه یافته و بازشناسی گفتار (ASR) با دقت بالا را مستقیماً به محیط‌های ویندوز ۱۰ و ۱۱ می‌آورد. در واقع SWT مانند یک گاوصندوق خصوصی برای داده‌های صوتی شما عمل می‌کند. همان‌طور که در تحلیل قبلی ما درباره‌ی رایانش لبه اشاره کردیم، انتقال پردازش از مرکز داده به دستگاه کاربر، کلید دستیابی به حریم خصوصی کامل است.

جزئیات فنی و زمینه توسعه

به گزارش توسعه‌دهنده این پروژه (ydtg1993) که میزبان آن در Gitee است، SWT از پشته‌ای مدرن شامل PySide6 و QFluentWidgets برای رابط کاربری (GUI) و SQLAlchemy 2.x و SQLite برای مدیریت داده‌ها استفاده می‌کند. برای تضمین پایداری سیستم، این ابزار بر پایه پایتون ۳.۱۰ یا نسخه‌های بالاتر اجرا شده و از loguru برای ثبت وقایع (Logging) و همچنین QThreadPool به همراه QRunnable برای مدیریت وظایف در پس‌زمینه بهره می‌برد.

ابزار تبدیل گفتار به متن آفلاین SWT — امن، سریع، بدون آپلود داده

این ابزار طیف متنوعی از مدل‌های داخلی را ارائه می‌دهد که برای سخت‌افزارهای مختلف بهینه‌سازی شده‌اند:

  • Qwen3-ASR (0.6B): تجربه‌ای چندزبانه و سبک که تنها به ۲ گیگابایت حافظه ویدیویی (VRAM) نیاز دارد.
  • Qwen3-ASR (1.7B): مدلی بزرگ‌تر که به بیش از ۶ گیگابایت VRAM نیاز دارد و برای بازشناسی بسیار دقیق زبان چینی طراحی شده است.
  • SenseVoiceSmall: مدلی بسیار سبک (حدود ۰.۵ گیگابایت) که علاوه بر بازشناسی چندزبانه، قادر به تشخیص احساسات و رویدادهای صوتی است.
  • Whisper-large-v3: مدل پرچم‌دار OpenAI با حجم ۳.۱ گیگابایت که به ۸ گیگابایت VRAM یا بیشتر نیاز دارد.
  • faster-whisper-tiny: نسخه‌ای فوق‌سبک (۰.۲ گیگابایت) که از شتاب‌دهنده CTranslate2 استفاده می‌کند.
  • Fun-ASR-Nano: یک مدل ASR سبک (حدود ۱ گیگابایت) که به‌طور ویژه برای زبان چینی بهینه شده است.

جزئیات پردازش پیشرفته

در بخش پردازش‌های پیشرفته، SWT از سازوکارهای پیچیده‌ای برای مدیریت ضبط‌های دشوار و افزایش کیفیت متن بهره می‌برد:

  • تشخیص فعالیت صوتی (VAD): استفاده از FSMN-VAD برای تکه‌بندی هوشمند صوت‌های طولانی با قابلیت تنظیم آستانه سکوت و طول قطعات صوتی.
  • بهبود گفتار: حذف نویز هوشمند از طریق مدل‌های FRCRN و DFSMN، حذف پژواک (Echo Cancellation) با استفاده از DFSMN-AEC و جداسازی گفتار با помощью MossFormer.
  • جداسازی گویندگان (Diarization): شناسایی آزمایشی چندین گوینده مختلف بر اساس مدل CAM++.
  • پس‌پردازش: بازگردانی علائم نگارشی توسط CT-Transformer و استفاده از اصلاحات هوشمند LLM برای رفع غلط‌های املایی و مشکلات گرامری.
  • خروجی‌های متنوع: پشتیبانی از استخراج نتایج در قالب‌های TXT، JSON و SRT جهت ساخت زیرنویس.

ابزار تبدیل گفتار به متن آفلاین SWT — امن، سریع، بدون آپلود داده

این تغییر رویکرد به سمت ASR محلی، لپ‌تاپ‌های معمولی را به ایستگاه‌های کاری امن تبدیل می‌کند. با پشتیبانی از شتاب‌دهنده‌های CPU و NVIDIA GPU (نسخه CUDA 12.1+)، کاربران دیگر مجبور نیستند حریم خصوصی خود را فدای بهره‌وری کنند. در حالی که رقابت بین مدل‌های ابری مانند Gemini Flash-Lite و GPT-4o mini بر سر سهمیه رایگان و سرعت است، ابزارهایی مثل SWT برتری خود را در کنترل کامل داده‌ها تعریف می‌کنند. برای توسعه‌دهندگان، استفاده از PySide6 و SQLAlchemy 2.x نشان‌دهنده یک معماری پایدار و قابل توسعه است. همچنین مجوز MIT تضمین می‌کند که جامعه کاربران بتواند این خط لوله‌ها را برای زبان‌های مختلف از جمله چینی، انگلیسی، ژاپنی، کره‌ای و کانتونزی بهینه کند.

برای شروع کار، ابتدا باید ffmpeg را برای مدیریت فایل‌های ویدئویی (MP4, MKV) و صوتی (MP3, WAV, FLAC) نصب کرده و مخزن پروژه را از Gitee کلون کنید. پس از ایجاد یک محیط مجازی (Virtual Environment) و نصب نیازمندی‌های فایل requirements.txt، می‌توانید از طریق «مدیریت دانلود مدل»، وزن‌های مدل ASR مورد نظر خود را در دایرکتوری llm/ دریافت کنید.

گام بعدی شما

  • اگر از Whisper استفاده می‌کنید، نسخه faster-whisper-tiny را برای تست سرعت روی CPU امتحان کنید.
  • برای فایل‌های صوتی با نویز زیاد، ابتدا فیلترهای FRCRN را فعال کنید و سپس استنتاج را آغاز کنید.
  • خروجی‌های SRT را برای ساخت زیرنویس‌های دقیق بدون نیاز به اینترنت بررسی کنید.

اما چالش اصلی در این مسیر، بهینه‌سازی مدل‌های بزرگ برای سخت‌افزارهای ضعیف‌تر است — به تحلیل ما درباره‌ی کوانتش وزن‌ها مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با تکیه بر اعتبار چارچوب FunASR، استانداردهای حریم خصوصی در تبدیل گفتار به متن را جابه‌جا می‌کند. تخصص در اجرای محلی مدل‌ها باعث می‌شود سازمان‌های حساس به داده، بدون ریسک نشت اطلاعات، از قدرت ASR بهره ببرند.

تأثیر برای ایران

به دلیل متن‌باز بودن و اجرای کاملاً محلی، این ابزار هیچ‌گونه محدودیت دسترسی یا تحریمی برای کاربران و توسعه‌دهندگان ایرانی ندارد و ایده‌آل‌ترین گزینه برای پردازش اسناد صوتی حساس است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی APIهای ابری با مدل‌های محلی در حوزه صوت، آخرین مرحله از «دمکراتیزه شدن» حریم خصوصی در هوش مصنوعی است. SWT با ترکیب مدل‌های متنوع (از Whisper تا Qwen)، نشان می‌دهد که دیگر نیازی به یک مدل واحد برای همه کارها نیست و استراتژی «مدل مناسب برای سخت‌افزار مناسب» در حال پیروزی است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.