پرش به محتوای اصلی
پرش به محتوای مقاله

مدل ThonburianTTS با ۱۰ ثانیه صوت، صدای تایلندی را با دقت ۸۹٪ شبیه‌سازی می‌کند

·۱۸ مرداد ۱۴۰۵۳ دقیقه مطالعه۳ بازدید
ThonburianTTS — سامانه متن‌به‌گفتار رایگان تایلندی با قابلیت اجرای محلی و شبیه‌سازی صدا، توسعه‌یافته توسط تیم تایلندی
ThonburianTTS — سامانه متن‌به‌گفتار رایگان تایلندی با قابلیت اجرای محلی و شبیه‌سازی صدا، توسعه‌یافته توسط تیم تایلندی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

دستیابی به دقت ۸۹٪ در شبیه‌سازی صدای تایلندی با استفاده از مدلی بسیار کوچک (۵۰۰ میلیون پارامتر) که به‌طور کامل روی سخت‌افزار کاربر اجرا می‌شود و نیازی به ارتباط با سرور ندارد.

تصور کنید تنها با ۱۰ ثانیه از صدای یک فرد، بتوانید یک نسخه‌ی دیجیتال از آن بسازید که دقیقاً با همان لحن و تکیه‌ها صحبت کند. این دیگر یک ابزار گران‌قیمت ابری نیست، بلکه با مدل ThonburianTTS، هر توسعه‌دهنده‌ای می‌تواند این قابلیت را روی سخت‌افزار شخصی خود اجرا کند.

به نقل از مستندات پروژه، این سامانه به دقت ۸۹٪ در شبیه‌سازی صدا دست یافته است. مدل ThonburianTTS حاصل همکاری آزمایشگاه داده‌های زیست‌پزشکی دانشگاه ماهیدول و شرکت Looloo Technology است که در کنفرانس iSAI-NLP ۲۰۲۵ معرفی شد. هدف اصلی این پروژه، حذف وابستگی به APIهای ابری هزینه‌بر و افزایش حریم خصوصی داده‌هاست.

بسیاری از مدل‌های تبدیل متن به گفتار (TTS) — شبیه به یک خواننده‌ی خارجی که سعی می‌کند با لهجه‌ای غریب متن را بخواند — در مواجهه با زبان‌های آهنگین مثل تایلندی دچار مشکل می‌شوند و خروجی‌های رباتیک تولید می‌کنند. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی مدل‌های زبانی محلی اشاره کردیم، بومی‌سازی معماری برای زبان‌های خاص، کلید رسیدن به طبیعی بودن است. ThonburianTTS برای حل این مشکل از معماری Flow Matching مبتنی بر مدل انتشار (Diffusion Model) — شبیه به فرآیند زدودن مه از روی یک عکس برای رسیدن به تصویر واضح — استفاده کرده و روی مجموعه‌داده‌ی GigaSpeech2 تنظیم دقیق (Fine-tuning) شده است؛ یعنی مثل وقتی به یک پزشک عمومی، تخصص پوست می‌دهیم تا در یک حوزه خاص خبره شود.

بر اساس مستندات گیت‌هاب، ویژگی‌های فنی این مدل عبارتند از:

  • شبیه‌سازی Zero-shot: کپی صدای هدف با دقت ۸۴ تا ۸۹ درصد، بدون نیاز به آموزش مجدد مدل و تنها با نمونه‌های کوتاه.
  • بهینگی سخت‌افزاری: حجم مدل حدود ۱.۳۵ گیگابایت (۵۰۰ میلیون پارامتر) است و برای استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند، مثل خودِ آشپزی نه دوره‌ی آموزش آشپز — تنها به ۲ تا ۳ گیگابایت VRAM نیاز دارد.
  • کنترل منعطف: امکان تغییر سرعت گفتار و حذف سکوت‌ها بدون تغییر در استایل صدای اصلی.
  • دسترسی باز: کدها تحت لایسنس MIT منتشر شده‌اند، هرچند وزن‌های مدل برای استفاده‌های تجاری محدود هستند.

با این حال، طبق یک مقاله پژوهشی در سال ۲۰۲۶ درباره‌ی مدل JaiTTS، این سامانه در تولید متون طولانی دچار ضعف است، زیرا روی جملات کوتاه آموزش دیده است. بنابراین برای روایت‌های بلند یا پروژه‌های تجاری، جایگزین‌هایی مثل JaiTTS یا Qwen-TTS همچنان اولویت دارند.

برای یک توسعه‌دهنده، این یعنی ساخت بات‌های صوتی و کتاب‌های صوتی تایلندی اکنون رایگان است و دیگر نیازی به قربانی کردن حریم خصوصی برای رسیدن به صدای طبیعی نیست.

گام بعدی شما

  • نصب پکیج از طریق pip برای تست محلی روی سیستم.
  • بررسی دموی Gradio در HuggingFace Spaces برای ارزیابی کیفیت شبیه‌سازی.
  • نصب ffmpeg در محیط لینوکس برای مدیریت پردازش‌های صوتی.

اما چالش اصلی در این مسیر، مدیریت حافظه در مدل‌های بزرگ‌تر است — به تحلیل ما درباره‌ی تکنیک‌های کوانتش وزن‌ها مراجعه کنید. در همین راستا، برای بهینه‌سازی زیرساخت‌های مدل‌های زبانی و ارتقای استدلال عامل‌ها، می‌توانید ۳ مقاله کلیدی از Hugging Face را بررسی کنید که به بهبود عملکرد مدل‌های محلی کمک می‌کنند.

چرا این موضوع مهم است؟

این مدل با تکیه بر اعتبار پژوهشی دانشگاه ماهیدول، دسترسی به فناوری شبیه‌سازی صدا را از شرکت‌های بزرگ ابری به توسعه‌دهندگان مستقل منتقل می‌کند. این تغییر، هزینه‌ی تولید محتوای صوتی بومی را به شدت کاهش می‌دهد.

تأثیر برای ایران

در حال حاضر اثر مستقیمی بر کاربران ایرانی ندارد، اما معماری بهینه آن برای زبان‌های آهنگین می‌تواند الگویی برای توسعه مدل‌های TTS محلی در زبان فارسی باشد.

·نگاه ما
تحریریه دات‌هوش

تمرکز بر مدل‌های TTS کوچک و محلی نشان می‌دهد که عصر مدل‌های «همه-فن-حریف» در حال جایگزینی با مدل‌های تخصصی است که روی سخت‌افزارهای لبه اجرا می‌شوند. ThonburianTTS ثابت می‌کند که برای رسیدن به دقت بالای ۸۰٪ در شبیه‌سازی صدا، لزوماً به مدل‌های چند میلیارد پارامتری نیاز نیست و بهینه‌سازی روی داده‌های بومی (Domain-specific) اثرگذارتر است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.