پرش به محتوای اصلی
پرش به محتوای مقاله

مدل S1-mini متون خام بازشناسی گفتار را به نوشته‌های صیقل‌خورده تبدیل می‌کند

·۳۰ مرداد ۱۴۰۵۵ دقیقه مطالعه۱ بازدید
اس۱-مینی: نرمال‌ساز متن باز ۴۶۲ مگابایتی سوپرویسپر که رونویسی خام گفتار را به متن تمیز تبدیل می‌کند
اس۱-مینی: نرمال‌ساز متن باز ۴۶۲ مگابایتی سوپرویسپر که رونویسی خام گفتار را به متن تمیز تبدیل می‌کند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ارائه یک مدل تخصصی نرمال‌ساز با وزن‌های باز که به‌جای تولید محتوا، بر اصلاح ساختاری متن‌های ASR تمرکز دارد و روی CPU لپ‌تاپ اجرا می‌شود.

اگر از ابزارهای تبدیل گفتار به متن استفاده می‌کنید، احتمالاً با متونی مواجه شده‌اید که پر از «اممم»، «آآآ» و تکرارهای عصبی است. این مشکل که به عنوان «چالش مایل آخر» (last mile problem) در بازشناسی خودکار گفتار (ASR) شناخته می‌شود، باعث می‌شود خروجی‌های خام با لکنت‌ها و کلمات پرکننده شلوغ شوند. مدل S1-mini دقیقاً برای حل این مشکل طراحی شده است؛ یک فایل ۴۶۲ مگابایتی که روی CPU لپ‌تاپ اجرا می‌شود و متن‌های نامرتب صوتی را به متونی صیقل‌خورده و نوشتاری تبدیل می‌کند.

بسیاری از خط لوله‌های تبدیل صوت به متن، پس از مرحله‌ی بازشناسی متوقف می‌شوند و کاربر باید ساعت‌ها وقت صرف پاک کردن تپق‌ها، «اممم»‌ها، «آآآ»ها و شروع‌های اشتباه (false starts) کند. در حالی که مدل‌های زبانی بزرگ (LLM) ابری می‌توانند این متن را پاک‌سازی کنند، اما برای استفاده‌های آنی و بلادرنگ، بیش از حد کند یا گران هستند. S1-mini مانند یک لایه‌ی میانی اختصاصی عمل می‌کند: صوت ابتدا به موتورهای بازشناسی گفتار (ASR) مثل Whisper یا Parakeet می‌رود و سپس متن خام حاصل برای نرمال‌سازی نهایی به S1-mini منتقل می‌شود.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی مدل‌های لبه اشاره کردیم، جابه‌جایی پردازش از ابر به دستگاه کاربر، امنیت و سرعت را به‌شدت افزایش می‌دهد. شرکت Superwhisper خانواده مدل‌های S1 را برای پوشش کامل این مسیر معرفی کرده است. این خانواده شامل S1-Voice (یک مدل تبدیل گفتار به متن مبتنی بر ابر) و S1-Language (یک مدل پیروی از دستورات ابری که برای پاک‌سازی و فرمت‌بندی استفاده می‌شود) است. در حالی که دو مدل اخیر به صورت سرویس‌های میزبانی شده (Hosted) ارائه می‌شوند، S1-mini با وزن‌های باز (Open Weights) در Hugging Face منتشر شده است.

این تفکیک استراتژیک به کاربران اجازه می‌دهد خط لوله‌ی خود را انتخاب کنند. Superwhisper پیشنهاد می‌کند یا از یک رویکرد ترکیبی استفاده کنید (به‌کارگیری Cohere Transcribe به همراه S1-mini به صورت آفلاین) و یا از رویکرد کاملاً ابری با جفت کردن S1-Voice و S1-Language بهره ببرید.

معرفی Dyna-2: مدل جهان-عمل رباتیکی با پیش‌آموزش بر یک میلیون ساعت ویدیوی انسانی

بر اساس مستندات فنی منتشر شده در این ماه، S1-mini یک مدل ۰.۶ میلیارد پارامتری است که از مدل Qwen/Qwen3-0.6B از طریق تنظیم دقیق (Fine-tuning) — شبیه وقتی که به یک پزشک عمومی، تخصص پوست می‌دهیم تا روی یک حوزه دقیق شود — بهینه شده است. این مدل یک ترنسکرایبر (تبدیل‌کننده صوت به متن) یا یک چت‌بات نیست، بلکه یک نرمال‌ساز متن تخصصی است.

از نظر فنی، این مدل شامل ۵۹۶ میلیون پارامتر منحصربه‌فرد (۰.۴۴ میلیارد پارامتر غیر-embedding) در ۲۸ لایه است. این مدل از ۱۶ سر پرس‌وجو (query heads) و ۸ سر کلید/مقدار (key/value heads) با مکانیزم توجه گروهی (Grouped Query Attention - GQA) و وزن‌های BF16 استفاده می‌کند. اگر در نوار کناری Hugging Face تعداد پارامترها ۰.۸ میلیارد گزارش شده است، دلیل آن این است که embeddingهای متصل (tied embedding) دو بار ذخیره شده‌اند.

وظایف تخصصی S1-mini عبارتند از:

  • حذف کلمات پرکننده (filler words) و حل تضادهای ناشی از اصلاحات خودبه‌خودی گوینده برای رسیدن به قصد نهایی او.
  • اعمال صحیح علائم نگارشی و حروف بزرگ (Capitalization).
  • تبدیل اعداد، تاریخ‌ها، ارزها و آدرس‌های ایمیل گفته‌شده به فرمت نوشتاری (مثلاً تبدیل عبارت «support at superwhisper dot com» به [email protected]).

آشنایی با S1-mini: نرمالایزر متن ۴۶۲ مگابایتی سوپرویسپر که رونویسی‌های خام را به متن تمیز تبدیل می‌کند

کنترل این مدل از طریق یک خط فرمان سه‌محوره سخت‌گیرانه صورت می‌گیرد که در بالای متن قرار می‌گیرد. مدل یک پرامپت سیستمی ثابت را دریافت کرده و سپس این سه محور مستقل را دنبال می‌کند:

  • سبک (Styling): گزینه‌های غیررسمی (casual)، نیمه‌غیررسمی (semi-casual)، نیمه‌رسمی (semi-formal) یا رسمی (formal).
  • ساختار (Structure): گزینه‌های متنی (prose) یا لیستی (lists).
  • زمینه (Context): گزینه‌های عمومی (general) یا ایمیلی (email).

سازندگان اعلام کرده‌اند که هر ترکیبی از این محورها آموزش دیده است. با این حال، کاربران باید از تغییر عبارت‌بندی پرامپت سیستمی یا ارسال مقادیری خارج از این مجموعه‌ها خودداری کنند، زیرا می‌تواند خروجی را به‌هم بریزد. نکته قابل توجه این است که اگرچه اپلیکیشن Superwhisper از یک لغزنده (slider) پنج‌مرحله‌ای شامل پیش‌فرض «متعادل» (balanced) استفاده می‌کند، اما مستندات مدل وزن‌های باز تنها چهار مقدار آموزش‌دیده برای «سبک» را ذکر کرده‌اند.

در بخش ارزیابی و عملکرد، Superwhisper صحت توکن‌ها را ۹۴.۸٪ در یک مجموعه داده‌ی مجزا شامل ۷۵۱۹ مورد در ۱۰۴ متن گزارش کرده است. این اندازه‌گیری به صورت greedy روی بیلد کوانتیزه شده‌ی Q4_K_M انجام شده است. نرخ خطای ویرایش متن (text-edit error rate) نیز ۱۱.۶٪ است.

برای وظایف خاص ایمیلی، مدل دقت بسیار بالایی دارد:

  • شناسایی خط greeting (سلام و احوالپرسی): ۹۹.۳٪
  • شناسایی خط sign-off (بخش پایانی و خداحافظی): ۹۷.۹٪
  • ساختار خروجی صحیح (لیست در مقابل پاراگراف): ۹۷.۶٪
  • تولید دقیق آدرس ایمیل: ۹۲٪

علاوه بر این، مدل در ۹۸.۶٪ مواقع زمانی که ورودی فقط شامل کلمات پرکننده است، به‌درستی خروجی را خالی نگه می‌دارد و کمتر از ۱٪ از تولیدات دچار قطع شدن (truncation) یا تکرار (looping) می‌شوند.

برای استقرار این مدل، دو تنظیم حیاتی وجود دارد تا از شکست خروجی جلوگیری شود. اول، گزینه enable_thinking باید روی False تنظیم شود. از آنجایی که S1-mini از قالب چت Qwen3 استفاده می‌کند، به‌طور پیش‌فرض در حالت «تفکر» (thinking) قرار می‌گیرد؛ اما S1-mini با حالت تفکر خاموش آموزش دیده است. نوبت دستیار (assistant turn) باید با یک بلوک <think> خالی شروع شود، در غیر این صورت خروجی غیرقابل استفاده خواهد بود.

دوم، توسعه‌دهندگان باید از رمزگشایی حریصانه (Greedy decoding) با دمای (Temperature) صفر استفاده کنند. بیلد‌های GGUF متادیتای Qwen3 (temp = 0.6, top_p = 0.95, top_k = 0.95) را به ارث می‌برند، اما تنظیم do_sample: false الزامی است. در llama.cpp، کاربران باید به جای --reasoning-budget 0 از --jinja به همراه --chat-template-kwargs '{"enable_thinking":false}' استفاده کنند تا کیفیت خروجی کاهش نیابد.

این عرضه، بار پردازشی پاک‌سازی متن را از ابر به رایانش لبه (Edge Computing) منتقل می‌کند. با انتشار تحت لایسنس Apache 2.0 (به همراه یک بند نام‌گذاری)، Superwhisper به سازمان‌ها اجازه می‌دهد نرمال‌سازی را در پشت یک شبکه خصوصی مجازی (VPC) اجرا کنند. این موضوع تضمین می‌کند که متن‌های حساس صوتی هرگز شبکه داخلی را ترک نکنند، که برای حوزه‌های زیر حیاتی است:

  • مستندات پزشکی و بالینی
  • خدمات حقوقی و مالی
  • پشتیبانی مشتریان و ابزارهای توسعه‌دهندگان
  • دسترسی‌پذیری (Accessibility) و زیرنویس‌های زنده

برای توسعه‌دهندگان مستقل، ردپای کوچک (small footprint) این مدل به این معناست که این قابلیت را می‌توان مستقیماً درون یک اپلیکیشن دسکتاپ برای استفاده در برنامه‌های دیکته، ابزارهای یادداشت جلسات یا ورود صوتی به CRM گنجاند.

در حالی که S1-mini باز است، سایر مدل‌های شرکت همچنان سرویس‌های میزبانی شده هستند. S1-Voice یک مدل STT با سرعت بسیار بالاست که سرعت تبدیل را تا ۴۶ برابر سریع‌تر از زمان صحبت کردن گزارش می‌کند. اکثر دیکته‌های زیر ۳۰ ثانیه، تنها ۰.۳۲ ثانیه پس از صحبت ظاهر می‌شوند. این تمرکز بر مدل‌های صوتی کوچک، هم‌راستا با تلاش‌های شرکت‌های دیگر برای ساخت مدل‌های صوتی با شبیه‌سازی دقیق رفتار انسانی است تا تعاملات ماشینی طبیعی‌تر شوند. در هشت مجموعه داده، این مدل به‌طور متوسط ۶.۸٪ نرخ خطای کلمه (WER) دارد (که در LibriSpeech به ۲.۲٪ می‌رسد)؛ Superwhisper ادعا می‌کند این کمترین میزان در بین ۱۵ مدل تست شده است.

باید دید این رویکرد تخصصی «نرمال‌سازی» چگونه بر سایر مدل‌های زبانی کوچک (SLM) تأثیر می‌گذارد، زیرا صنعت در حال حرکت از مدل‌های چت همه‌منظوره به سمت متخصصان کوچک تک-وظیفه‌ای برای جریان‌های کاری روی دستگاه (on-device) است. این روند به ویژه در مدل‌های وزن‌باز شدت گرفته است، مشابه آنچه در صدرنشینی مدل MiniMax H3 در رتبه‌بندی ویدیوهای AI مشاهده کردیم که نشان‌دهنده قدرت مدل‌های تخصصی باز است.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، مدل S1-mini را از Hugging Face دریافت کرده و با llama.cpp روی CPU تست کنید.
  • برای کاهش هزینه‌های API، لایه‌ی نرمال‌سازی را از مدل‌های بزرگ به این مدل کوچک منتقل کنید.
  • تنظیمات do_sample: false را برای جلوگیری از توهمات مدل در متون رسمی اعمال کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با انتقال پردازش به لبه، حریم خصوصی داده‌های صوتی را تضمین می‌کند و هزینه استنتاج را برای سازمان‌ها حذف می‌کند. اعتبار این رویکرد از توانایی مدل در رسیدن به دقت بالای ۹۰٪ در وظایف تخصصی ایمیل تأیید می‌شود.

تأثیر برای ایران

به‌دلیل وزن‌های باز بودن مدل، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به API و دور زدن تحریم‌ها، این قابلیت را به‌صورت کاملاً آفلاین در اپلیکیشن‌های داخلی پیاده کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز بر مدل‌های تک‌وظیفه‌ای (Single-task) به‌جای مدل‌های همه‌کاره، نشان‌دهنده بلوغ بازار مدل‌های زبانی کوچک است. S1-mini ثابت می‌کند که برای کارهای تخصصی مثل نرمال‌سازی متن، یک مدل ۰.۶ میلیارد پارامتری می‌تواند با دقت بسیار بالا و هزینه نزدیک به صفر، جایگزین مدل‌های غول‌پیکر ابری شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.