تصور کنید تنها با ۱۰ ثانیه از صدای یک فرد، بتوانید یک نسخهی دیجیتال از آن بسازید که دقیقاً با همان لحن و تکیهها صحبت کند. این دیگر یک ابزار گرانقیمت ابری نیست، بلکه با مدل ThonburianTTS، هر توسعهدهندهای میتواند این قابلیت را روی سختافزار شخصی خود اجرا کند.
به نقل از مستندات پروژه، این سامانه به دقت ۸۹٪ در شبیهسازی صدا دست یافته است. مدل ThonburianTTS حاصل همکاری آزمایشگاه دادههای زیستپزشکی دانشگاه ماهیدول و شرکت Looloo Technology است که در کنفرانس iSAI-NLP ۲۰۲۵ معرفی شد. هدف اصلی این پروژه، حذف وابستگی به APIهای ابری هزینهبر و افزایش حریم خصوصی دادههاست.
بسیاری از مدلهای تبدیل متن به گفتار (TTS) — شبیه به یک خوانندهی خارجی که سعی میکند با لهجهای غریب متن را بخواند — در مواجهه با زبانهای آهنگین مثل تایلندی دچار مشکل میشوند و خروجیهای رباتیک تولید میکنند. همانطور که در تحلیلهای پیشین ما دربارهی مدلهای زبانی محلی اشاره کردیم، بومیسازی معماری برای زبانهای خاص، کلید رسیدن به طبیعی بودن است. ThonburianTTS برای حل این مشکل از معماری Flow Matching مبتنی بر مدل انتشار (Diffusion Model) — شبیه به فرآیند زدودن مه از روی یک عکس برای رسیدن به تصویر واضح — استفاده کرده و روی مجموعهدادهی GigaSpeech2 تنظیم دقیق (Fine-tuning) شده است؛ یعنی مثل وقتی به یک پزشک عمومی، تخصص پوست میدهیم تا در یک حوزه خاص خبره شود.
بر اساس مستندات گیتهاب، ویژگیهای فنی این مدل عبارتند از:
- شبیهسازی Zero-shot: کپی صدای هدف با دقت ۸۴ تا ۸۹ درصد، بدون نیاز به آموزش مجدد مدل و تنها با نمونههای کوتاه.
- بهینگی سختافزاری: حجم مدل حدود ۱.۳۵ گیگابایت (۵۰۰ میلیون پارامتر) است و برای استنتاج (Inference) — لحظهای که مدل واقعاً جواب تولید میکند، مثل خودِ آشپزی نه دورهی آموزش آشپز — تنها به ۲ تا ۳ گیگابایت VRAM نیاز دارد.
- کنترل منعطف: امکان تغییر سرعت گفتار و حذف سکوتها بدون تغییر در استایل صدای اصلی.
- دسترسی باز: کدها تحت لایسنس MIT منتشر شدهاند، هرچند وزنهای مدل برای استفادههای تجاری محدود هستند.
با این حال، طبق یک مقاله پژوهشی در سال ۲۰۲۶ دربارهی مدل JaiTTS، این سامانه در تولید متون طولانی دچار ضعف است، زیرا روی جملات کوتاه آموزش دیده است. بنابراین برای روایتهای بلند یا پروژههای تجاری، جایگزینهایی مثل JaiTTS یا Qwen-TTS همچنان اولویت دارند.
برای یک توسعهدهنده، این یعنی ساخت باتهای صوتی و کتابهای صوتی تایلندی اکنون رایگان است و دیگر نیازی به قربانی کردن حریم خصوصی برای رسیدن به صدای طبیعی نیست.
گام بعدی شما
- نصب پکیج از طریق pip برای تست محلی روی سیستم.
- بررسی دموی Gradio در HuggingFace Spaces برای ارزیابی کیفیت شبیهسازی.
- نصب ffmpeg در محیط لینوکس برای مدیریت پردازشهای صوتی.
اما چالش اصلی در این مسیر، مدیریت حافظه در مدلهای بزرگتر است — به تحلیل ما دربارهی تکنیکهای کوانتش وزنها مراجعه کنید. در همین راستا، برای بهینهسازی زیرساختهای مدلهای زبانی و ارتقای استدلال عاملها، میتوانید ۳ مقاله کلیدی از Hugging Face را بررسی کنید که به بهبود عملکرد مدلهای محلی کمک میکنند.




گفتگو