تصور کنید صدای طبیعی و انسانی را در اپلیکیشنی جای دهید که حجم آن از یک عکس باکیفیت هم کمتر است. این دقیقاً همان چیزی است که Inflect-Micro-v2 با بهکارگیری تنها ۹,۳۵۶,۵۱۳ پارامتر عملیاتی ممکن ساخته است. این مقدار پارامتر تمام آن چیزی است که برای ارائه یک سنتز کامل متن به موج صدا (Text-to-Waveform) مورد نیاز است. نتیجه، یک صدای مصنوعی با کیفیت بالا است که تنها ۳۷.۵۳ مگابایت از حافظه را اشغال میکند.
بسیاری از سیستمهای مدرن TTS (تبدیل متن به گفتار) به خوشههای ابری عظیم یا ردپای محلی سنگین متکی هستند. این عرضه به عنوان چالشی در برابر روند «بزرگتر، بهتر است» ظاهر شده است و ثابت میکند که معماریهای تخصصی و بهینه از نظر پارامتر میتوانند با مدلهای پایه بزرگتر روی یک ماشین محلی رقابت کنند. این حرکت در راستای یک تغییر گستردهتر در صنعت به سمت هوش مصنوعی لبه (Edge AI) است، جایی که هدف انتقال استنتاج از APIهای متمرکز به سختافزار شخصی کاربر است.
زمینه توسعه
اوون سانگ (Owen Song) پروژه Inflect v2 را به صورت مستقل ساخته و تامین مالی کرده است. این پروژه به عنوان یک عرضه با وزنهای باز (Open-weight) طراحی شده تا یک ابزار اولویت-استنتاج (Inference-first) برای جامعه توسعهدهندگان فراهم کند. سانگ اشاره کرد که اگر این نسخه با استقبال واقعی مخاطبان روبرو شود، قصد دارد نسخه گستردهتری یعنی v3 را دنبال کند. بهبودهای احتمالی برای نسخه بعدی شامل افزودن زبانهای بیشتر، صداهای متنوع و ارتقای پایداری کلی سیستم است.
توسعهدهنده از کسانی که مدل را مفید مییابند میخواهد تا با لایک کردن پروژه در Hugging Face، به دیگران در کشف این پروژه کمک کنند. این مدل تحت لایسنس Apache-2.0 منتشر شده است. همچنین، توسعهدهنده برای ارتباطات حرفهای ایمیل خود ([email protected]) و برای پشتیبانی فنی غیررسمی، آدرس دیسکورد خود (b111ue) را ارائه داده است.

معماری فنی و عملکرد
مدل Inflect v2 یک تولیدکننده متن به موج صدای پایان-به-پایان از خانواده VITS است که از نظر پارامتر بسیار بهینه شده است. طبق مستندات پروژه در Hugging Face، این سیستم شامل یک بخش پیشپردازش (Frontend) واجهای انگلیسی، همترازی یکنواخت (Monotonic Alignment)، سنتز نهفته تصادفی (Stochastic Latent Synthesis)، جریان جفتشدگی باقیمانده (Residual Coupling Flow) و یک رمزگشای موج عصبی یکپارچه با کاهش تداخل (Alias-reduced Neural Waveform Decoder) است تا خروجیهای تککاناله (Mono) با فرمت float32 و فرکانس ۲۴ کیلوهرتز تولید کند.
جزئیات مشخصات مدل
اوون سانگ دو نسخه مجزا از مدل را ارائه کرده است که از یک API عمومی در دو اندازه مختلف استفاده میکنند:
- Inflect-Micro-v2: این نسخه کیفیت را در اولویت قرار میدهد و دارای ۹,۳۵۶,۵۱۳ پارامتر عملیاتی و ۳۷.۵۳ مگابایت وزن در حالت FP32 است. این مدل عضو متمرکز بر کیفیت در این خانواده است.
- Inflect-Nano-v2: این نسخه کمترین ردپای حافظه را در اولویت دارد و دارای ۳,۹۶۶,۷۲۱ پارامتر کامل و ۱۵.۹۷ مگابایت وزن در حالت FP32 است.
برای معماری Micro-v2، بودجه اجزای داخلی به شرح زیر است:
- کانالهای نهفته (Latent channels): ۱۹۲
- کانالهای پنهان متن (Text hidden channels): ۹۶
- لایهها / سرهای رمزگذار (Encoder layers/heads): ۳ / ۲
- کانالهای پیشخور (Feed-forward channels): ۷۶۸
- بلوکهای جفتشدگی جریان (Flow coupling blocks): ۴
- کانالهای اولیه رمزگشا (Initial decoder channels): ۳۲۰
- نرخهای نمونهبرداری افزایشی (Upsample rates): ۸، ۸، ۲، ۲
- قطعه آموزش (Training segment): ۱۶,۳۸۴ نمونه
از نظر سرعت خام، هر دو مدل روی CPU بسیار سریعتر از زمان واقعی (Real-time) عمل میکنند. در یک اجرای مرجع مدیریتشده با استفاده از نمونه CPU Upgrade در Hugging Face (دارای ۸ پردازنده مجازی vCPU و ۳۲ گیگابایت رم) با چهار رشته framework و ۱۰۰ پرامپت ثابت Modern400، مدل Inflect-Micro-v2 به توان عملیاتی ۶.۲۸ برابر زمان واقعی رسید (Steady-state RTF برابر با ۰.۱۵۹۳). مدل Inflect-Nano-v2 حتی سریعتر عمل کرد و به سرعت ۱۰.۷۲ برابر زمان واقعی (RTF ۰.۰۹۳۳) دست یافت.
زمینه مقایسهای سرعت
برای ارائه زمینه استقرار، سانگ مدل Inflect را با چندین مدل پایه TTS فشرده با استفاده از همان CPU مدیریتشده و سیاست چهار رشته مقایسه کرد. در یک مرحله تاییدیه کوتاهتر با ۵۰ پرامپت، سرعتهای نسبی صدا به زمان واقعی به شرح زیر بود:
- Piper Low: ۳۱.۳۷ برابر
- KittenTTS Nano: ۱۳.۳۳ برابر
- Inflect-Nano-v2: ۱۰.۷۲ برابر
- Supertonic 3 (3-step): ۱۰.۱۵ برابر
- Inflect-Micro-v2: ۶.۲۸ برابر
- Supertonic 3 (8-step): ۴.۳۷ برابر
لازم به ذکر است که چندین مورد از مدلهای مقایسهای از زمانهای اجرای بهینه شده ONNX استفاده میکنند، در حالی که بنچمارک اصلی Inflect از زمان اجرای استاندارد PyTorch استفاده کرده است. مسیر ONNX که جداگانه منتشر شد، در این اعداد خاص جایگزین نشده بود.
بنچمارک طبیعی بودن و وضوح
به جای تکیه بر یک امتیاز ترکیبی واحد، این پروژه چندین معیار مستقل را به صورت جداگانه گزارش میکند تا از فشردهسازیهای غیرقابل تایید جلوگیری شود. در یک مطالعه انسانی ناشناس که در آن سیستمها پنهان شده بودند و ترتیب آنها تصادفی بود، Inflect-Micro-v2 نرخ ترجیح انسانی ۶۶.۲ درصدی (۲۱ برد، ۱۰ باخت و ۳ تساوی) را در برابر مدلهای پایه فشرده ثبت کرد. این مدلهای پایه شامل KittenTTS Nano، Piper Low و Supertonic 3 بودند که همگی ردپای وزنهای عملیاتی بزرگتری دارند.
برای ارزیابی خودکار، پروژه از UTMOS22 استفاده کرد (که یک پیشبینیکننده یادگیریشده است و نه MOS انسانی) و ۵۰۰ پرامپت دیدهنشده یکسان برای هر صدا به کار برد. مدل Inflect-Micro-v2 امتیاز ۴.۳۹۵ را کسب کرد (با فاصله اطمینان بوتاسترپ ۹۵٪ بین ۴.۳۸۱ تا ۴.۴۰۸).
وضوح صدا با استفاده از رویکرد چند-ASR (تشخیص خودکار گفتار) روی متون دیدهنشده برای محاسبه نرخ خطای کلمه (WER) آزمایش شد. امتیاز نهایی، میانگین با وزن برابر از WERهای کورپوس Qwen3-ASR و Nemotron 3.5 است. برای Inflect-Micro-v2، نتایج فردی به این صورت بود:
- Qwen3-ASR: ۲.۵۲٪
- Nemotron 3.5: ۵.۴۵٪
- Whisper large-v3: ۲.۷۳٪
مدل Whisper از امتیاز نهایی اصلی حذف شد زیرا در مجموعهای از کلیپهای Supertonic 8-step توهمات شدید (Insertion-heavy hallucinations) ایجاد کرده بود، هرچند ممیزی کامل سه-ASR همچنان در دسترس است. میانگین سه مدل برای Inflect-Micro-v2 برابر با ۳.۵۷٪ است.
استقرار و کنترل محلی
کاربران میتوانند مدل را با استفاده از یک API استاندارد پایتون یا یک خروجی مجزای ONNX Runtime مستقر کنند. نسخه تایید شده رسمی FP32 به عنوان Inflect-Micro-v2-ONNX منتشر شده است. این نسخه مدل عصبی را به دو فایل duration.onnx و decode.onnx تقسیم میکند و به کاربران اجازه میدهد بدون وارد کردن PyTorch، بین ارائهدهندگان CPU، CUDA یا DirectML انتخاب کنند. بخش پیشپردازش انگلیسی eSpeak-ng همچنان به عنوان کد سمت CPU باقی میماند.
برای کاربران پایتون، نصب از طریق huggingface_hub و با استفاده از دستور hf download برای دریافت کامل مخزن انجام میشود. کد نمونه سنتز نشان میدهد که مدل را میتوان با tts = InflectTTS(".", device="cpu") مقداردهی اولیه کرد و از طریق tts.save() ذخیره نمود.
یک ویژگی حیاتی برای توسعهدهندگان، استفاده از بذرهای قطعی (Deterministic seeds) است. بذرهای ثابت تضمین میکنند که یک متن یکسان، دقیقاً همان خروجی صوتی را در یک پشته زمان اجرای یکسان تولید کند و این امر امکان تکرارپذیری خروجی را فراهم میکند.
کنترلهای سنتز و مدیریت متنهای طولانی
توسعهدهندگان میتوانند خروجی را با استفاده از سه کنترل اصلی تنظیم کنند:
- سرعت (Speed): پیشفرض ۱.۰ (بازه ۰.۵ تا ۲.۰). مقدار کمتر یعنی کندتر و مقدار بیشتر یعنی سریعتر.
- تغییرات (Variation): پیشفرض ۰.۶۶۷ (بازه ۰.۰ تا ۱.۰). مقدار کمتر باعث ثبات بیشتر و مقدار بیشتر باعث نمونهبرداری از تغییرات نهفته بیشتر میشود.
- بذر (Seed): پیشفرض ۰ (عدد صحیح). برای نمونهبرداری تصادفی تکرارپذیر.
برای محتوای طولانی، سیستم از یک گذر اتورگرسیو نامحدود استفاده نمیکند. در عوض، از تکهبندی آگاه از علائم نگارشی (Punctuation-aware segmentation) بهره میبرد. متون طولانی به قطعات کوچک تقسیم شده، قطعه به قطعه سنتز میشوند و سپس با مکثهای کنترلشده و محو شدن لبهها (Edge fades) به هم متصل میشوند تا پایداری حفظ شود. این قابلیت به مدل اجازه میدهد متونی مانند «اول، پنجره را ببندید؛ دوم، چراغ را خاموش کنید؛ در نهایت، در را قفل کنید» را به طور موثر مدیریت کند.
یکپارچگی پروتکل ارزیابی
برای اطمینان از اینکه نتایج قابل ممیزی هستند، پروژه از یک پروتکل ارزیابی منجمد استفاده میکند. کورپوس Modern400 شامل ۴۰۰ پرامپت انگلیسی دیدهنشده است: ۲۰۰ پرامپت ثابت مدرن/استرس و ۲۰۰ پرامپت قطعی تست FLEURS en_us. عدم تداخل متنی دقیق با ۸۷,۳۶۲ رونوشت آموزشی تایید شده است.
شفافیت از طریق موارد زیر تامین میشود:
- هش SHA-256: کورپوس Modern400 دارای هش
b7504ce2dce44a2da82770a6a5dfd2a034fe17e2113980f8a69663ade417a34است. - دادههای خام: پرامپتها، فرضیهها و گزارشهای فشرده در سطح ردیف در دایرکتوری
evaluation/final/ارسال شدهاند. - نرمالسازی: تمام ورودیهای ASR به ۱۶ کیلوهرتز تغییر نمونه داده شده و با همان نرمالکننده انگلیسی افشا شده امتیازدهی شدهاند.
- پیشبینیکننده: UTMOS22 از tarepan/SpeechMOS v1.2.0 روی یک مجموعه تولید ۵۰۰ پرامپتی مجزا استفاده میکند و بازههای نهایی از ۱۰,۰۰۰ نمونه بوتاسترپ استفاده میکنند.
محدودیتها و تنگناهای سیستم
این مدل را دقیقاً به یک صدای مردانه مصنوعی ثابت انگلیسی محدود شده است. این ابزار یک ابزار شبیهسازی صدا (Voice Cloning) نیست و از تطبیق صفر-شات (Zero-shot adaptation) پشتیبانی نمیکند. این عرضه «اولویت-استنتاج» است، به این معنی که تطبیق با صدا یا زبان جدید در حال حاضر تایید نشده است. افزودن یک صدای جدید، جایگزین صدای ثابت میشود نه اینکه یک صدای انتخابی اضافه کند. همچنین تطبیق زبانی نیازمند بازسازی نرمالسازی، واجها، نمادها، جاسازیها (Embeddings) و دادههای آموزشی است.
سایر محدودیتها عبارتند از:
- بیانگری: عبارتپردازیهای ناآشنا میتواند تختتر یا ناپایدارتر شود.
- حساسیت پیشپردازش: اعداد (مثلاً "twelve point six kilograms")، اختصارات، همنویسها (Homographs) و نامهای غیرمعمول (مانند "Ljubljana") همچنان حساس به متن هستند.
- ارزیابی: امتیازات UTMOS22 و ASR جایگزینی برای ارزیابیهای کنترل شده انسانی MOS یا MUSHRA نیستند.
- ایمنی: سیستم برای ارتباطات پزشکی، حقوقی، اضطراری یا حیاتی در دسترسپذیری تایید نشده است.
نقشهبرداری فایلها و بستهها
برای توسعهدهندگانی که مخزن را ممیزی میکنند، بسته به صورت زیر نقشهبرداری شده است:
model.pth: چکپوینت تولیدکننده مخصوص استنتاج.config.json: فایل تنظیمات معماری/صوت و پرسوجوی تعداد دانلود از Hub.inference.py: API عمومی پایتون و رابط خط فرمان (CLI).inflect_vits_frontend.py: نرمالسازی و واجگذاری انگلیسی.runtime/: پیادهسازی مدل به صورت مستقل.release_manifest.json: ثبت اندازه فایلهای بستهبندی شده و هشهای SHA-256.
در حالی که وزنها تحت لایسنس Apache-2.0 باز هستند، خط لوله تولید کورپوس آموزشی خصوصی، زیرساختهای فیلترینگ و دستورالعملهای کامل بهینهسازی، اختصاصی باقی ماندهاند. این امر به محققان اجازه میدهد بدون نیاز به زیرساختهای عظیم مورد نیاز برای آموزش اولیه، کاربرد مدل را آزمایش کنند.
این تمرکز بر عملکرد محلی و قابل تایید، نفسی تازه در این صنعت است. با تکیه بر پوششهای قبلی ما در مورد اینکه چگونه برخی مدلها برای «تقلب» در پاسخها، بنچمارکها را دور میزدند، Inflect-v2 با ارائه فرضیات خام ASR و هشها، تلاش میکند عکس این مسیر را طی کند و نتایج صادقانهای ارائه دهد.
برای توسعهدهنده، این بدان معناست که TTS دیگر انتخابی بین یک API ابری کند اما با کیفیت بالا و یک صدای محلی سریع اما رباتیک نیست. شما اکنون میتوانید یک صدای طبیعی را مستقیماً در یک اپلیکیشن جای دهید، در حالی که سربار حافظه آن از یک عکس با رزولوشن بالا کمتر است.
در گام بعدی، توسعهدهندگان باید مخزن رسمی Inflect-Micro-v2-ONNX را برای آزمایش استقرار مبتنی بر مرورگر و اندازهگیری تطبیق خروجیها بررسی کنند.




گفتگو