اگر از ابزارهای تبدیل گفتار به متن استفاده میکنید، احتمالاً با متونی مواجه شدهاید که پر از «اممم»، «آآآ» و تکرارهای عصبی است. این مشکل که به عنوان «چالش مایل آخر» (last mile problem) در بازشناسی خودکار گفتار (ASR) شناخته میشود، باعث میشود خروجیهای خام با لکنتها و کلمات پرکننده شلوغ شوند. مدل S1-mini دقیقاً برای حل این مشکل طراحی شده است؛ یک فایل ۴۶۲ مگابایتی که روی CPU لپتاپ اجرا میشود و متنهای نامرتب صوتی را به متونی صیقلخورده و نوشتاری تبدیل میکند.
بسیاری از خط لولههای تبدیل صوت به متن، پس از مرحلهی بازشناسی متوقف میشوند و کاربر باید ساعتها وقت صرف پاک کردن تپقها، «اممم»ها، «آآآ»ها و شروعهای اشتباه (false starts) کند. در حالی که مدلهای زبانی بزرگ (LLM) ابری میتوانند این متن را پاکسازی کنند، اما برای استفادههای آنی و بلادرنگ، بیش از حد کند یا گران هستند. S1-mini مانند یک لایهی میانی اختصاصی عمل میکند: صوت ابتدا به موتورهای بازشناسی گفتار (ASR) مثل Whisper یا Parakeet میرود و سپس متن خام حاصل برای نرمالسازی نهایی به S1-mini منتقل میشود.
همانطور که در تحلیلهای پیشین ما دربارهی بهینهسازی مدلهای لبه اشاره کردیم، جابهجایی پردازش از ابر به دستگاه کاربر، امنیت و سرعت را بهشدت افزایش میدهد. شرکت Superwhisper خانواده مدلهای S1 را برای پوشش کامل این مسیر معرفی کرده است. این خانواده شامل S1-Voice (یک مدل تبدیل گفتار به متن مبتنی بر ابر) و S1-Language (یک مدل پیروی از دستورات ابری که برای پاکسازی و فرمتبندی استفاده میشود) است. در حالی که دو مدل اخیر به صورت سرویسهای میزبانی شده (Hosted) ارائه میشوند، S1-mini با وزنهای باز (Open Weights) در Hugging Face منتشر شده است.
این تفکیک استراتژیک به کاربران اجازه میدهد خط لولهی خود را انتخاب کنند. Superwhisper پیشنهاد میکند یا از یک رویکرد ترکیبی استفاده کنید (بهکارگیری Cohere Transcribe به همراه S1-mini به صورت آفلاین) و یا از رویکرد کاملاً ابری با جفت کردن S1-Voice و S1-Language بهره ببرید.

بر اساس مستندات فنی منتشر شده در این ماه، S1-mini یک مدل ۰.۶ میلیارد پارامتری است که از مدل Qwen/Qwen3-0.6B از طریق تنظیم دقیق (Fine-tuning) — شبیه وقتی که به یک پزشک عمومی، تخصص پوست میدهیم تا روی یک حوزه دقیق شود — بهینه شده است. این مدل یک ترنسکرایبر (تبدیلکننده صوت به متن) یا یک چتبات نیست، بلکه یک نرمالساز متن تخصصی است.
از نظر فنی، این مدل شامل ۵۹۶ میلیون پارامتر منحصربهفرد (۰.۴۴ میلیارد پارامتر غیر-embedding) در ۲۸ لایه است. این مدل از ۱۶ سر پرسوجو (query heads) و ۸ سر کلید/مقدار (key/value heads) با مکانیزم توجه گروهی (Grouped Query Attention - GQA) و وزنهای BF16 استفاده میکند. اگر در نوار کناری Hugging Face تعداد پارامترها ۰.۸ میلیارد گزارش شده است، دلیل آن این است که embeddingهای متصل (tied embedding) دو بار ذخیره شدهاند.
وظایف تخصصی S1-mini عبارتند از:
- حذف کلمات پرکننده (filler words) و حل تضادهای ناشی از اصلاحات خودبهخودی گوینده برای رسیدن به قصد نهایی او.
- اعمال صحیح علائم نگارشی و حروف بزرگ (Capitalization).
- تبدیل اعداد، تاریخها، ارزها و آدرسهای ایمیل گفتهشده به فرمت نوشتاری (مثلاً تبدیل عبارت «support at superwhisper dot com» به [email protected]).

کنترل این مدل از طریق یک خط فرمان سهمحوره سختگیرانه صورت میگیرد که در بالای متن قرار میگیرد. مدل یک پرامپت سیستمی ثابت را دریافت کرده و سپس این سه محور مستقل را دنبال میکند:
- سبک (Styling): گزینههای غیررسمی (casual)، نیمهغیررسمی (semi-casual)، نیمهرسمی (semi-formal) یا رسمی (formal).
- ساختار (Structure): گزینههای متنی (prose) یا لیستی (lists).
- زمینه (Context): گزینههای عمومی (general) یا ایمیلی (email).
سازندگان اعلام کردهاند که هر ترکیبی از این محورها آموزش دیده است. با این حال، کاربران باید از تغییر عبارتبندی پرامپت سیستمی یا ارسال مقادیری خارج از این مجموعهها خودداری کنند، زیرا میتواند خروجی را بههم بریزد. نکته قابل توجه این است که اگرچه اپلیکیشن Superwhisper از یک لغزنده (slider) پنجمرحلهای شامل پیشفرض «متعادل» (balanced) استفاده میکند، اما مستندات مدل وزنهای باز تنها چهار مقدار آموزشدیده برای «سبک» را ذکر کردهاند.
در بخش ارزیابی و عملکرد، Superwhisper صحت توکنها را ۹۴.۸٪ در یک مجموعه دادهی مجزا شامل ۷۵۱۹ مورد در ۱۰۴ متن گزارش کرده است. این اندازهگیری به صورت greedy روی بیلد کوانتیزه شدهی Q4_K_M انجام شده است. نرخ خطای ویرایش متن (text-edit error rate) نیز ۱۱.۶٪ است.
برای وظایف خاص ایمیلی، مدل دقت بسیار بالایی دارد:
- شناسایی خط greeting (سلام و احوالپرسی): ۹۹.۳٪
- شناسایی خط sign-off (بخش پایانی و خداحافظی): ۹۷.۹٪
- ساختار خروجی صحیح (لیست در مقابل پاراگراف): ۹۷.۶٪
- تولید دقیق آدرس ایمیل: ۹۲٪
علاوه بر این، مدل در ۹۸.۶٪ مواقع زمانی که ورودی فقط شامل کلمات پرکننده است، بهدرستی خروجی را خالی نگه میدارد و کمتر از ۱٪ از تولیدات دچار قطع شدن (truncation) یا تکرار (looping) میشوند.
برای استقرار این مدل، دو تنظیم حیاتی وجود دارد تا از شکست خروجی جلوگیری شود. اول، گزینه enable_thinking باید روی False تنظیم شود. از آنجایی که S1-mini از قالب چت Qwen3 استفاده میکند، بهطور پیشفرض در حالت «تفکر» (thinking) قرار میگیرد؛ اما S1-mini با حالت تفکر خاموش آموزش دیده است. نوبت دستیار (assistant turn) باید با یک بلوک <think> خالی شروع شود، در غیر این صورت خروجی غیرقابل استفاده خواهد بود.
دوم، توسعهدهندگان باید از رمزگشایی حریصانه (Greedy decoding) با دمای (Temperature) صفر استفاده کنند. بیلدهای GGUF متادیتای Qwen3 (temp = 0.6, top_p = 0.95, top_k = 0.95) را به ارث میبرند، اما تنظیم do_sample: false الزامی است. در llama.cpp، کاربران باید به جای --reasoning-budget 0 از --jinja به همراه --chat-template-kwargs '{"enable_thinking":false}' استفاده کنند تا کیفیت خروجی کاهش نیابد.
این عرضه، بار پردازشی پاکسازی متن را از ابر به رایانش لبه (Edge Computing) منتقل میکند. با انتشار تحت لایسنس Apache 2.0 (به همراه یک بند نامگذاری)، Superwhisper به سازمانها اجازه میدهد نرمالسازی را در پشت یک شبکه خصوصی مجازی (VPC) اجرا کنند. این موضوع تضمین میکند که متنهای حساس صوتی هرگز شبکه داخلی را ترک نکنند، که برای حوزههای زیر حیاتی است:
- مستندات پزشکی و بالینی
- خدمات حقوقی و مالی
- پشتیبانی مشتریان و ابزارهای توسعهدهندگان
- دسترسیپذیری (Accessibility) و زیرنویسهای زنده
برای توسعهدهندگان مستقل، ردپای کوچک (small footprint) این مدل به این معناست که این قابلیت را میتوان مستقیماً درون یک اپلیکیشن دسکتاپ برای استفاده در برنامههای دیکته، ابزارهای یادداشت جلسات یا ورود صوتی به CRM گنجاند.
در حالی که S1-mini باز است، سایر مدلهای شرکت همچنان سرویسهای میزبانی شده هستند. S1-Voice یک مدل STT با سرعت بسیار بالاست که سرعت تبدیل را تا ۴۶ برابر سریعتر از زمان صحبت کردن گزارش میکند. اکثر دیکتههای زیر ۳۰ ثانیه، تنها ۰.۳۲ ثانیه پس از صحبت ظاهر میشوند. این تمرکز بر مدلهای صوتی کوچک، همراستا با تلاشهای شرکتهای دیگر برای ساخت مدلهای صوتی با شبیهسازی دقیق رفتار انسانی است تا تعاملات ماشینی طبیعیتر شوند. در هشت مجموعه داده، این مدل بهطور متوسط ۶.۸٪ نرخ خطای کلمه (WER) دارد (که در LibriSpeech به ۲.۲٪ میرسد)؛ Superwhisper ادعا میکند این کمترین میزان در بین ۱۵ مدل تست شده است.
باید دید این رویکرد تخصصی «نرمالسازی» چگونه بر سایر مدلهای زبانی کوچک (SLM) تأثیر میگذارد، زیرا صنعت در حال حرکت از مدلهای چت همهمنظوره به سمت متخصصان کوچک تک-وظیفهای برای جریانهای کاری روی دستگاه (on-device) است. این روند به ویژه در مدلهای وزنباز شدت گرفته است، مشابه آنچه در صدرنشینی مدل MiniMax H3 در رتبهبندی ویدیوهای AI مشاهده کردیم که نشاندهنده قدرت مدلهای تخصصی باز است.
گام بعدی شما
- اگر توسعهدهنده هستید، مدل S1-mini را از Hugging Face دریافت کرده و با llama.cpp روی CPU تست کنید.
- برای کاهش هزینههای API، لایهی نرمالسازی را از مدلهای بزرگ به این مدل کوچک منتقل کنید.
- تنظیمات
do_sample: falseرا برای جلوگیری از توهمات مدل در متون رسمی اعمال کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو