پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Inflect-Micro-v2: تبدیل متن به گفتار بااً کمتر از ۱۰ میلیون پارامتر

·۴ مرداد ۱۴۰۵۹ دقیقه مطالعه
صفحه مدل Inflect-Micro-v2 از Owen Song در پلتفرم Hugging Face.
صفحه مدل Inflect-Micro-v2 از Owen Song در پلتفرم Hugging Face.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ارائه یک سیستم TTS با کیفیت انسانی که در حافظه کمتر از ۴۰ مگابایت جای می‌گیرد و سرعت استنتاج آن روی CPUهای معمولی، چندین برابر زمان واقعی است.

تصور کنید صدای طبیعی و انسانی را در اپلیکیشنی جای دهید که حجم آن از یک عکس باکیفیت هم کمتر است. این دقیقاً همان چیزی است که Inflect-Micro-v2 با به‌کارگیری تنها ۹,۳۵۶,۵۱۳ پارامتر عملیاتی ممکن ساخته است. این مقدار پارامتر تمام آن چیزی است که برای ارائه یک سنتز کامل متن به موج صدا (Text-to-Waveform) مورد نیاز است. نتیجه، یک صدای مصنوعی با کیفیت بالا است که تنها ۳۷.۵۳ مگابایت از حافظه را اشغال می‌کند.

بسیاری از سیستم‌های مدرن TTS (تبدیل متن به گفتار) به خوشه‌های ابری عظیم یا ردپای محلی سنگین متکی هستند. این عرضه به عنوان چالشی در برابر روند «بزرگ‌تر، بهتر است» ظاهر شده است و ثابت می‌کند که معماری‌های تخصصی و بهینه از نظر پارامتر می‌توانند با مدل‌های پایه بزرگ‌تر روی یک ماشین محلی رقابت کنند. این حرکت در راستای یک تغییر گسترده‌تر در صنعت به سمت هوش مصنوعی لبه (Edge AI) است، جایی که هدف انتقال استنتاج از APIهای متمرکز به سخت‌افزار شخصی کاربر است.

زمینه توسعه

اوون سانگ (Owen Song) پروژه Inflect v2 را به صورت مستقل ساخته و تامین مالی کرده است. این پروژه به عنوان یک عرضه با وزن‌های باز (Open-weight) طراحی شده تا یک ابزار اولویت-استنتاج (Inference-first) برای جامعه توسعه‌دهندگان فراهم کند. سانگ اشاره کرد که اگر این نسخه با استقبال واقعی مخاطبان روبرو شود، قصد دارد نسخه گسترده‌تری یعنی v3 را دنبال کند. بهبودهای احتمالی برای نسخه بعدی شامل افزودن زبان‌های بیشتر، صداهای متنوع و ارتقای پایداری کلی سیستم است.

توسعه‌دهنده از کسانی که مدل را مفید می‌یابند می‌خواهد تا با لایک کردن پروژه در Hugging Face، به دیگران در کشف این پروژه کمک کنند. این مدل تحت لایسنس Apache-2.0 منتشر شده است. همچنین، توسعه‌دهنده برای ارتباطات حرفه‌ای ایمیل خود ([email protected]) و برای پشتیبانی فنی غیررسمی، آدرس دیسکورد خود (b111ue) را ارائه داده است.

صفحه مدل Inflect-Micro-v2 در پلتفرم Hugging Face اثر owensong

معماری فنی و عملکرد

مدل Inflect v2 یک تولیدکننده متن به موج صدای پایان-به-پایان از خانواده VITS است که از نظر پارامتر بسیار بهینه شده است. طبق مستندات پروژه در Hugging Face، این سیستم شامل یک بخش پیش‌پردازش (Frontend) واج‌های انگلیسی، هم‌ترازی یکنواخت (Monotonic Alignment)، سنتز نهفته تصادفی (Stochastic Latent Synthesis)، جریان جفت‌شدگی باقی‌مانده (Residual Coupling Flow) و یک رمزگشای موج عصبی یکپارچه با کاهش تداخل (Alias-reduced Neural Waveform Decoder) است تا خروجی‌های تک‌کاناله (Mono) با فرمت float32 و فرکانس ۲۴ کیلوهرتز تولید کند.

جزئیات مشخصات مدل

اوون سانگ دو نسخه مجزا از مدل را ارائه کرده است که از یک API عمومی در دو اندازه مختلف استفاده می‌کنند:

  • Inflect-Micro-v2: این نسخه کیفیت را در اولویت قرار می‌دهد و دارای ۹,۳۵۶,۵۱۳ پارامتر عملیاتی و ۳۷.۵۳ مگابایت وزن در حالت FP32 است. این مدل عضو متمرکز بر کیفیت در این خانواده است.
  • Inflect-Nano-v2: این نسخه کمترین ردپای حافظه را در اولویت دارد و دارای ۳,۹۶۶,۷۲۱ پارامتر کامل و ۱۵.۹۷ مگابایت وزن در حالت FP32 است.

برای معماری Micro-v2، بودجه اجزای داخلی به شرح زیر است:

  • کانال‌های نهفته (Latent channels): ۱۹۲
  • کانال‌های پنهان متن (Text hidden channels): ۹۶
  • لایه‌ها / سرهای رمزگذار (Encoder layers/heads): ۳ / ۲
  • کانال‌های پیش‌خور (Feed-forward channels): ۷۶۸
  • بلوک‌های جفت‌شدگی جریان (Flow coupling blocks): ۴
  • کانال‌های اولیه رمزگشا (Initial decoder channels): ۳۲۰
  • نرخ‌های نمونه‌برداری افزایشی (Upsample rates): ۸، ۸، ۲، ۲
  • قطعه آموزش (Training segment): ۱۶,۳۸۴ نمونه

از نظر سرعت خام، هر دو مدل روی CPU بسیار سریع‌تر از زمان واقعی (Real-time) عمل می‌کنند. در یک اجرای مرجع مدیریت‌شده با استفاده از نمونه CPU Upgrade در Hugging Face (دارای ۸ پردازنده مجازی vCPU و ۳۲ گیگابایت رم) با چهار رشته framework و ۱۰۰ پرامپت ثابت Modern400، مدل Inflect-Micro-v2 به توان عملیاتی ۶.۲۸ برابر زمان واقعی رسید (Steady-state RTF برابر با ۰.۱۵۹۳). مدل Inflect-Nano-v2 حتی سریع‌تر عمل کرد و به سرعت ۱۰.۷۲ برابر زمان واقعی (RTF ۰.۰۹۳۳) دست یافت.

زمینه مقایسه‌ای سرعت

برای ارائه زمینه استقرار، سانگ مدل Inflect را با چندین مدل پایه TTS فشرده با استفاده از همان CPU مدیریت‌شده و سیاست چهار رشته مقایسه کرد. در یک مرحله تاییدیه کوتاه‌تر با ۵۰ پرامپت، سرعت‌های نسبی صدا به زمان واقعی به شرح زیر بود:

  • Piper Low: ۳۱.۳۷ برابر
  • KittenTTS Nano: ۱۳.۳۳ برابر
  • Inflect-Nano-v2: ۱۰.۷۲ برابر
  • Supertonic 3 (3-step): ۱۰.۱۵ برابر
  • Inflect-Micro-v2: ۶.۲۸ برابر
  • Supertonic 3 (8-step): ۴.۳۷ برابر

لازم به ذکر است که چندین مورد از مدل‌های مقایسه‌ای از زمان‌های اجرای بهینه شده ONNX استفاده می‌کنند، در حالی که بنچمارک اصلی Inflect از زمان اجرای استاندارد PyTorch استفاده کرده است. مسیر ONNX که جداگانه منتشر شد، در این اعداد خاص جایگزین نشده بود.

بنچمارک طبیعی بودن و وضوح

به جای تکیه بر یک امتیاز ترکیبی واحد، این پروژه چندین معیار مستقل را به صورت جداگانه گزارش می‌کند تا از فشرده‌سازی‌های غیرقابل تایید جلوگیری شود. در یک مطالعه انسانی ناشناس که در آن سیستم‌ها پنهان شده بودند و ترتیب آن‌ها تصادفی بود، Inflect-Micro-v2 نرخ ترجیح انسانی ۶۶.۲ درصدی (۲۱ برد، ۱۰ باخت و ۳ تساوی) را در برابر مدل‌های پایه فشرده ثبت کرد. این مدل‌های پایه شامل KittenTTS Nano، Piper Low و Supertonic 3 بودند که همگی ردپای وزن‌های عملیاتی بزرگ‌تری دارند.

برای ارزیابی خودکار، پروژه از UTMOS22 استفاده کرد (که یک پیش‌بینی‌کننده یادگیری‌شده است و نه MOS انسانی) و ۵۰۰ پرامپت دیده‌نشده یکسان برای هر صدا به کار برد. مدل Inflect-Micro-v2 امتیاز ۴.۳۹۵ را کسب کرد (با فاصله اطمینان بوت‌استرپ ۹۵٪ بین ۴.۳۸۱ تا ۴.۴۰۸).

وضوح صدا با استفاده از رویکرد چند-ASR (تشخیص خودکار گفتار) روی متون دیده‌نشده برای محاسبه نرخ خطای کلمه (WER) آزمایش شد. امتیاز نهایی، میانگین با وزن برابر از WERهای کورپوس Qwen3-ASR و Nemotron 3.5 است. برای Inflect-Micro-v2، نتایج فردی به این صورت بود:

  • Qwen3-ASR: ۲.۵۲٪
  • Nemotron 3.5: ۵.۴۵٪
  • Whisper large-v3: ۲.۷۳٪

مدل Whisper از امتیاز نهایی اصلی حذف شد زیرا در مجموعه‌ای از کلیپ‌های Supertonic 8-step توهمات شدید (Insertion-heavy hallucinations) ایجاد کرده بود، هرچند ممیزی کامل سه-ASR همچنان در دسترس است. میانگین سه مدل برای Inflect-Micro-v2 برابر با ۳.۵۷٪ است.

استقرار و کنترل محلی

کاربران می‌توانند مدل را با استفاده از یک API استاندارد پایتون یا یک خروجی مجزای ONNX Runtime مستقر کنند. نسخه تایید شده رسمی FP32 به عنوان Inflect-Micro-v2-ONNX منتشر شده است. این نسخه مدل عصبی را به دو فایل duration.onnx و decode.onnx تقسیم می‌کند و به کاربران اجازه می‌دهد بدون وارد کردن PyTorch، بین ارائه‌دهندگان CPU، CUDA یا DirectML انتخاب کنند. بخش پیش‌پردازش انگلیسی eSpeak-ng همچنان به عنوان کد سمت CPU باقی می‌ماند.

برای کاربران پایتون، نصب از طریق huggingface_hub و با استفاده از دستور hf download برای دریافت کامل مخزن انجام می‌شود. کد نمونه سنتز نشان می‌دهد که مدل را می‌توان با tts = InflectTTS(".", device="cpu") مقداردهی اولیه کرد و از طریق tts.save() ذخیره نمود.

یک ویژگی حیاتی برای توسعه‌دهندگان، استفاده از بذرهای قطعی (Deterministic seeds) است. بذرهای ثابت تضمین می‌کنند که یک متن یکسان، دقیقاً همان خروجی صوتی را در یک پشته زمان اجرای یکسان تولید کند و این امر امکان تکرارپذیری خروجی را فراهم می‌کند.

کنترل‌های سنتز و مدیریت متن‌های طولانی

توسعه‌دهندگان می‌توانند خروجی را با استفاده از سه کنترل اصلی تنظیم کنند:

  • سرعت (Speed): پیش‌فرض ۱.۰ (بازه ۰.۵ تا ۲.۰). مقدار کمتر یعنی کندتر و مقدار بیشتر یعنی سریع‌تر.
  • تغییرات (Variation): پیش‌فرض ۰.۶۶۷ (بازه ۰.۰ تا ۱.۰). مقدار کمتر باعث ثبات بیشتر و مقدار بیشتر باعث نمونه‌برداری از تغییرات نهفته بیشتر می‌شود.
  • بذر (Seed): پیش‌فرض ۰ (عدد صحیح). برای نمونه‌برداری تصادفی تکرارپذیر.

برای محتوای طولانی، سیستم از یک گذر اتورگرسیو نامحدود استفاده نمی‌کند. در عوض، از تکه‌بندی آگاه از علائم نگارشی (Punctuation-aware segmentation) بهره می‌برد. متون طولانی به قطعات کوچک تقسیم شده، قطعه به قطعه سنتز می‌شوند و سپس با مکث‌های کنترل‌شده و محو شدن لبه‌ها (Edge fades) به هم متصل می‌شوند تا پایداری حفظ شود. این قابلیت به مدل اجازه می‌دهد متونی مانند «اول، پنجره را ببندید؛ دوم، چراغ را خاموش کنید؛ در نهایت، در را قفل کنید» را به طور موثر مدیریت کند.

یکپارچگی پروتکل ارزیابی

برای اطمینان از اینکه نتایج قابل ممیزی هستند، پروژه از یک پروتکل ارزیابی منجمد استفاده می‌کند. کورپوس Modern400 شامل ۴۰۰ پرامپت انگلیسی دیده‌نشده است: ۲۰۰ پرامپت ثابت مدرن/استرس و ۲۰۰ پرامپت قطعی تست FLEURS en_us. عدم تداخل متنی دقیق با ۸۷,۳۶۲ رونوشت آموزشی تایید شده است.

شفافیت از طریق موارد زیر تامین می‌شود:

  • هش SHA-256: کورپوس Modern400 دارای هش b7504ce2dce44a2da82770a6a5dfd2a034fe17e2113980f8a69663ade417a34 است.
  • داده‌های خام: پرامپت‌ها، فرضیه‌ها و گزارش‌های فشرده در سطح ردیف در دایرکتوری evaluation/final/ ارسال شده‌اند.
  • نرمال‌سازی: تمام ورودی‌های ASR به ۱۶ کیلوهرتز تغییر نمونه داده شده و با همان نرمال‌کننده انگلیسی افشا شده امتیازدهی شده‌اند.
  • پیش‌بینی‌کننده: UTMOS22 از tarepan/SpeechMOS v1.2.0 روی یک مجموعه تولید ۵۰۰ پرامپتی مجزا استفاده می‌کند و بازه‌های نهایی از ۱۰,۰۰۰ نمونه بوت‌استرپ استفاده می‌کنند.

محدودیت‌ها و تنگناهای سیستم

این مدل را دقیقاً به یک صدای مردانه مصنوعی ثابت انگلیسی محدود شده است. این ابزار یک ابزار شبیه‌سازی صدا (Voice Cloning) نیست و از تطبیق صفر-شات (Zero-shot adaptation) پشتیبانی نمی‌کند. این عرضه «اولویت-استنتاج» است، به این معنی که تطبیق با صدا یا زبان جدید در حال حاضر تایید نشده است. افزودن یک صدای جدید، جایگزین صدای ثابت می‌شود نه اینکه یک صدای انتخابی اضافه کند. همچنین تطبیق زبانی نیازمند بازسازی نرمال‌سازی، واج‌ها، نمادها، جاسازی‌ها (Embeddings) و داده‌های آموزشی است.

سایر محدودیت‌ها عبارتند از:

  • بیانگری: عبارت‌پردازی‌های ناآشنا می‌تواند تخت‌تر یا ناپایدارتر شود.
  • حساسیت پیش‌پردازش: اعداد (مثلاً "twelve point six kilograms")، اختصارات، هم‌نویس‌ها (Homographs) و نام‌های غیرمعمول (مانند "Ljubljana") همچنان حساس به متن هستند.
  • ارزیابی: امتیازات UTMOS22 و ASR جایگزینی برای ارزیابی‌های کنترل شده انسانی MOS یا MUSHRA نیستند.
  • ایمنی: سیستم برای ارتباطات پزشکی، حقوقی، اضطراری یا حیاتی در دسترس‌پذیری تایید نشده است.

نقشه‌برداری فایل‌ها و بسته‌ها

برای توسعه‌دهندگانی که مخزن را ممیزی می‌کنند، بسته به صورت زیر نقشه‌برداری شده است:

  • model.pth: چک‌پوینت تولیدکننده مخصوص استنتاج.
  • config.json: فایل تنظیمات معماری/صوت و پرس‌و‌جوی تعداد دانلود از Hub.
  • inference.py: API عمومی پایتون و رابط خط فرمان (CLI).
  • inflect_vits_frontend.py: نرمال‌سازی و واج‌گذاری انگلیسی.
  • runtime/: پیاده‌سازی مدل به صورت مستقل.
  • release_manifest.json: ثبت اندازه فایل‌های بسته‌بندی شده و هش‌های SHA-256.

در حالی که وزن‌ها تحت لایسنس Apache-2.0 باز هستند، خط لوله تولید کورپوس آموزشی خصوصی، زیرساخت‌های فیلترینگ و دستورالعمل‌های کامل بهینه‌سازی، اختصاصی باقی مانده‌اند. این امر به محققان اجازه می‌دهد بدون نیاز به زیرساخت‌های عظیم مورد نیاز برای آموزش اولیه، کاربرد مدل را آزمایش کنند.

این تمرکز بر عملکرد محلی و قابل تایید، نفسی تازه در این صنعت است. با تکیه بر پوشش‌های قبلی ما در مورد اینکه چگونه برخی مدل‌ها برای «تقلب» در پاسخ‌ها، بنچمارک‌ها را دور می‌زدند، Inflect-v2 با ارائه فرضیات خام ASR و هش‌ها، تلاش می‌کند عکس این مسیر را طی کند و نتایج صادقانه‌ای ارائه دهد.

برای توسعه‌دهنده، این بدان معناست که TTS دیگر انتخابی بین یک API ابری کند اما با کیفیت بالا و یک صدای محلی سریع اما رباتیک نیست. شما اکنون می‌توانید یک صدای طبیعی را مستقیماً در یک اپلیکیشن جای دهید، در حالی که سربار حافظه آن از یک عکس با رزولوشن بالا کمتر است.

در گام بعدی، توسعه‌دهندگان باید مخزن رسمی Inflect-Micro-v2-ONNX را برای آزمایش استقرار مبتنی بر مرورگر و اندازه‌گیری تطبیق خروجی‌ها بررسی کنند.

چرا این موضوع مهم است؟

این مدل با اثبات اینکه کیفیت بالا نیاز به میلیاردها پارامتر ندارد، هزینه استنتاج را برای توسعه‌دهندگان به شدت کاهش می‌دهد. اعتبار این ادعا با انتشار هش داده‌ها و متدولوژی باز (Open Evaluation) تقویت شده است.

تأثیر برای ایران

به دلیل ماهیت محلی (Local) و وزن‌های باز، این مدل کاملاً بدون محدودیت‌های تحریمی و API-block برای توسعه‌دهندگان ایرانی در دسترس است و برای اپلیکیشن‌های آفلاین ایده‌آل است.

·نگاه ما
تحریریه دات‌هوش

جذابیت Inflect-v2 در بازگشت به «بهینه‌سازی سخت‌افزاری» است. در حالی که اکثر رقبا روی افزایش پارامترها شرط بسته‌اند، این پروژه ثابت می‌کند که با معماری درست، می‌توان کیفیت را در ابعاد مگابایتی حفظ کرد. این رویکرد مسیر را برای تبدیل TTS به یک قابلیت داخلی (On-device) در هر اپلیکیشن، بدون وابستگی به اینترنت، هموار می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.