پرش به محتوای اصلی
پرش به محتوای مقاله

تغییر گام صوتی در VoxCPM راهکار تولید صداهای خنثی را باز کرد

·۱ مهر ۱۴۰۵۲ دقیقه مطالعه
راهنما
صدای دو جنسیتی از موتور تبدیل متن به گفتار با دو قطب صوتی: تجربه شخصی من
صدای دو جنسیتی از موتور تبدیل متن به گفتار با دو قطب صوتی: تجربه شخصی من
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از یک خط لوله (Pipeline) پس‌پردازش برای تولید صدای خنثی در مدل‌هایی که ذاتاً فقط دو قطب جنسیتی دارند؛ به جای تلاش برای تغییر مدل، خروجی تغییر می‌کند.

تصور کنید به صدایی نیاز دارید که نه کاملاً بم باشد و نه بیش از حد زیر، اما مدل‌های موجود فقط دو گزینهٔ افراطی به شما می‌دهند. در ۲۳ سپتامبر ۲۰۲۶، یک عامل (Agent) — شبیه دستیاری هوشمند که می‌تواند ابزارهای مختلف را برای حل یک مسئله ترکیب کند — راهکاری خلاقانه برای مدل VoxCPM ارائه داد تا کاربران از این دوقطبی صوتی رها شوند.

بسیاری از مدل‌های تبدیل متن به گفتار (TTS) — که مثل یک خوانندهٔ دیجیتال، متن را به صوت تبدیل می‌کنند — در تولید صداهای میان‌رده شکست می‌خورند. طبق گزارش وب‌سایت dev.to، درخواست‌هایی برای صدای «خنثی» یا «گرفته» معمولاً نادیده گرفته می‌شوند و مدل به سمت یکی از دو قطب اصلی (زنانه یا مردانه) می‌رود. این موضوع برای کاربرانی که به دنبال صدایی در مرز نشانگرهای جنسیتی هستند، یک خلاء جدی ایجاد کرده است.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی انعطاف‌پذیری مدل‌های مولد اشاره کردیم، محدودیت‌های ساختاری اغلب با ترفندهای پس‌پردازش حل می‌شوند. بر اساس مستندات این راهکار، فرآیند تولید صدا در دو مرحله انجام می‌شود:

  • تولید استراتژیک: ابتدا صوت در قطب «زنانه-روشن» تولید می‌شود. این حالت نسبت به تنظیمات بم (Baritone) که اغلب بیش از حد رسمی یا خبرگونه است، خروجی صمیمی‌تر و شفاف‌تری دارد.
  • دست‌کاری گام صوتی: استفاده از ابزار ffmpeg با فیلتر rubberband برای پایین آوردن گام صدا. دستور ffmpeg -i raw.mp3 -af rubberband=pitch=0.7937 out.mp3 صدا را چهار نیم‌پر (semitone) کاهش می‌دهد.

به نقل از نویسندهٔ این گزارش، مقدار ایده‌آل تغییر گام بسته به هر اجرا متفاوت است و معمولاً بین ۴- تا ۵- نیم‌پر نوسان می‌کند. در حالی که مقدار ۵- ممکن است صدا را شبیه به افراد مسن کند، مقدار ۴- اغلب به آن نقطهٔ بهینه و خنثی می‌رسد.

این تکنیک به این دلیل جواب می‌دهد که تغییر گام، اجرای اصلی — شامل زمان‌بندی، نفس‌ها و لحن — را حفظ می‌کند و فقط فرکانس را تغییر می‌دهد. در واقع یک صدای زنانه با فرکانس بالا به یک صدای میان‌ردهٔ گرم و گرفته تبدیل می‌شود، بدون اینکه صمیمیت اجرای اولیه از بین برود.

برای تولیدکنندگان محتوا، این یعنی «صوت باکیفیت» با «صوت اصیل» متفاوت است. این فرآیند نیازمند تست چندین خروجی است تا نسخه‌ای پیدا شود که به جای درستیِ فنی، حس شخصی و واقعی داشته باشد.

کاربرانی که با کنترل‌های محدود روی طنین صدا (Timbre) مواجه‌اند، می‌توانند همین امروز این لایهٔ ffmpeg را اجرا کنند تا شخصیت‌های هوش مصنوعی ظریف‌تری بسازند. شما می‌توانید نتایج را با مقایسه خروجی‌های خام زنانه و نسخه‌های تغییریافته با ضریب ۰.۷۹۳۷ آزمایش کنید.

گام بعدی شما

  • ابزار ffmpeg و کتابخانه rubberband را روی سیستم خود نصب کنید.
  • خروجی‌های مختلف مدل TTS خود را با ضرایب بین ۰.۷۵ تا ۰.۸۵ تست کنید تا نقطهٔ تعادل صدای خنثی را بیابید.
  • برای پروژه‌های داستانی، ترکیبی از تغییر گام و تغییر سرعت (Tempo) را امتحان کنید تا عمق شخصیت‌ها بیشتر شود.

اما تأثیر این ترفندها بر شناسایی صدا توسط سیستم‌های امنیتی حتی پیچیده‌تر است — به تحلیل ما درباره‌ی جعل عمیق (Deepfake) مراجعه کنید.

چرا این موضوع مهم است؟

این متد با تکیه بر تخصص پردازش صوت، محدودیت‌های باینری مدل‌های TTS را دور می‌زند. این موضوع برای صنعت بازی‌سازی و تولید پادکست که به تنوع شخصیتی نیاز دارند، اهمیت بالایی دارد.

تأثیر برای ایران

این روش برای تولیدکنندگان محتوای فارسی که با محدودیت‌های صوتی مدل‌های انگلیسی‌زبان در TTS مواجه‌اند، راهکاری رایگان و در دسترس است.

·نگاه ما
تحریریه دات‌هوش

این راهکار نشان می‌دهد که در عصر مدل‌های بنیادی، «مهندسی خروجی» به اندازه مهندسی پرامپت اهمیت یافته است. وقتی مدل در لایه استنتاج نمی‌تواند خنثی باشد، کاربر با ابزارهای پردازش سیگنال دیجیتال (DSP) خلأهای مدل را پر می‌کند. این رویکرد، قدرت را از دست توسعه‌دهنده مدل به دست کاربر نهایی منتقل می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.