تصور کنید به جای جنگیدن با کیبورد، ایدههایتان را با سرعت ۱۲۰ کلمه در دقیقه — یعنی تقریباً سه برابر سریعتر از میانگین سرعت تایپ — مستقیماً در محیط کارتان جاری کنید. این وعدهٔ Voicy است؛ ابزاری که طبق بررسیهای منتشر شده در ماه جاری توسط unite.ai، قصد دارد گلوگاه اصلی نویسندگان و برنامهنویسان را با تبدیل صوت به متن در بیش از ۲۰ هزار اپلیکیشن و وبسایت از بین ببرد.
بسیاری از ابزارهای دیکتهٔ پیشفرض که توسط سیستمعاملها ارائه میشوند، سخت، بدقلق و محدود هستند. این ابزارها اغلب کاربر را مجبور میکنند تا در منوهای عمیق تنظیمات جستجو کند و معمولاً در مواجهه با علائم نگارشی یا اصطلاحات فنی دچار مشکل میشوند. Voicy اما به عنوان یک لایهٔ اختصاصی در پسزمینه دستگاه شما اجرا میشود و متن را دقیقاً هر جا که مکاننما (Cursor) فعال باشد، قرار میدهد.
گردش کاری را تصور کنید که در آن دیگر نیازی نیست در جیمیل یا اسلک به دنبال دکمهٔ «دیکته» بگردید. در عوض، یک میانبر ساده روی کیبورد، هوش مصنوعی را فعال میکند تا پاکسازی گفتار شما را در لحظه انجام دهد. این تغییر، کاربر را از عمل مکانیکی تایپ به عمل شناختی صحبت کردن منتقل میکند.
قابلیتهای کلیدی و عملکرد
Voicy ادعای صحت (Accuracy) بیش از ۹۹٪ را در بیش از ۵۰ زبان پشتیبانی شده دارد. این لیست شامل زبانهای اصلی جهانی مانند انگلیسی، آلمانی، فرانسوی، اسپانیایی، پرتغالی و چینی (ماندارین) است. این رقم جهشی بزرگ نسبت به ابزارهای داخلی سیستمعاملهاست که طبق ادعای این شرکت، معمولاً در محدوده ۹۰٪ نوسان میکنند.

یکی از برتریهای فنی قابل توجه این ابزار، مدیریت خودکار علائم نگارشی و اصلاح گرامر است. کاربران نیازی ندارند که کلمات «نقطه» یا «کاما» را به زبان بیاورند؛ بلکه هوش مصنوعی ساختار جمله را استنباط کرده و فرمتبندی را بهطور خودکار اعمال میکند.

برای کسانی که در روانیِ گفتار یا تسلط کلامی مشکل دارند، حالت «ویرایش هوش مصنوعی» (Rewrite Mode) تعبیه شده است. این قابلیت کلمات پرکننده (Filler words)، شروعهای اشتباه و عبارتهای نامفهوم را در طول فرآیند تبدیل صوت به متن شناسایی و حذف میکند تا اطمینان حاصل شود که متن نهایی صیقلخورده و حرفهای است.

جزئیات ویژگیها
برای درک تفاوت Voicy با ابزارهای معمولی تبدیل صوت به متن، باید به مکانیزمهای خاص ویژگیهای آن نگاه کرد:
- سازگاری جهانی با اپلیکیشنها: این ابزار در بیش از ۲۰ هزار برنامه و وبسایت، از جمله Notion، ChatGPT، Word و Slack به درستی عمل میکند.
- در دسترس بودن در پلتفرمهای مختلف: نرمافزار برای مک، ویندوز، لینوکس، iOS و اندروید در دسترس است و شامل یک افزونه اختصاصی کروم برای کارهای مبتنی بر مرورگر است.
- جایگزینی متن (Text Replacement): کاربران میتوانند میانبرهایی تعریف کنند که بهطور خودکار یک کلمه یا عبارت کوتاه را با متنی بلندتر جایگزین کند؛ مثلاً تبدیل یک کد کوتاه به آدرس کامل ایمیل یا شماره تلفن.
- تبدیل فایلها (File Transcription): فراتر از دیکته زنده، کاربران میتوانند فایلهای صوتی یا ویدیویی موجود را آپلود کنند تا متن کامل آنها استخراج شود.
- دیکشنری سفارشی: این قابلیت به کاربران اجازه میدهد اصطلاحات فنی خاص یا نامهای غیرمعمول را به سیستم اضافه کنند تا از خطاهای تبدیل صوت به متن جلوگیری شود.
- تعداد نامحدود دستگاه شخصی: در طرح Pro، یک اشتراک واحد میتواند تمام دستگاههای شخصی کاربر را پوشش دهد.
راهاندازی و یکپارچهسازی
فعالسازی این ابزار نیازمند چند دسترسی سیستمی خاص است. کاربران باید اجازه دسترسی به میکروفون و مجوزهای Accessibility (دسترسیپذیری) را در نسخههای دسکتاپ صادر کنند تا نرمافزار بتواند متن را در سایر اپلیکیشنها تزریق کند. ممکن است برای اعمال این تغییرات، نیاز باشد پس از اعطای مجوزها، برنامه را بازراهاندازی کنید.

پس از تنظیم دسترسیها، کاربران زبان اصلی خود را برای افزایش دقت انتخاب میکنند، هرچند ابزار از قابلیت تشخیص خودکار زبان نیز پشتیبانی میکند. با این حال، برای دستیابی به بالاترین سطح دقت ممکن، انتخاب دستی یک زبان خاص توصیه میشود.

گزینههای شخصیسازی به کاربر اجازه میدهد تا حذف کلمات پرکننده و نقطهگذاری خودکار را بر اساس سبک نوشتاری خاص خود فعال یا غیرفعال کند.

مراحل پیادهسازی برای کاربران جدید
برای اطمینان از عملکرد صحیح میانبرها و مجوزها، فرآیند ورود کاربر جدید (Onboarding) توالی زیر را دنبال میکند:
۱. دانلود: مراجعه به usevoicy.com برای دریافت نسخه متناسب با سیستمعامل (مک، ویندوز، لینوکس، iOS یا اندروید).
۲. دسترسیها: تایید دسترسیهای لازم برای میکروفون و Accessibility.
۳. انتخاب زبان: برگزیدن زبان اصلی از میان بیش از ۵۰ گزینه موجود.
۴. تست اول: کلیک روی یک فیلد متنی، فشردن کلید x (یا میانبر انتخابی)، صحبت کردن و سپس فشردن مجدد کلید x برای مشاهده ظهور متن.
۵. تعیین میانبر: تنظیم یک ترکیب کلیدی سفارشی (مثلاً Control+Space) که در حین تایپ عادی بهطور تصادفی فعال نشود.
۶. استفاده عملی: باز کردن هر برنامهای — مانند یک پیام در اسلک یا یک IDE — و فعال کردن میانبر برای شروع دیکته.
ویژگیهای پیشرفته گردشکار
Voicy تنها به جملات ساده محدود نمیشود و از فرمتهای پیچیده از طریق دستورات صوتی خاص پشتیبانی میکند. برای مثال، دیکته عبارت «خط جدید، مورد گلولهای» (new line, bullet point) در واقع یک لیست فرمتشده در برنامه مقصد ایجاد میکند، به جای اینکه خودِ این کلمات را تایپ کند.

سناریویی را در نظر بگیرید که کاربر میگوید: «خط جدید، خط جدید. اولویتهای سه گانه این هفته اینها هستند: خط جدید، مورد گلولهای، اتمام بررسی طراحی، خط جدید، مورد گلولهای، بهروزرسانی اسلایدهای مشتری، خط جدید، مورد گلولهای، ارسال گزارش هفتگی». ابزار Voicy این دستورات را بهطور خودکار به یک لیست مرتب و گلولهای تبدیل میکند.
برای برنامهنویسان، این ابزار بهگونهای طراحی شده که در داخل ترمینالها و IDEها عمل کند. سیستم سینتکس کد و اصطلاحات فنی را میشناسد و این امر آن را برای دیکته پیامهای Commit یا نوشتن کامنتهای کد کاربردی میسازد.

برای پالایش بیشتر دقت، نرمافزار شامل یک دیکشنری سفارشی است. کاربران میتوانند اصطلاحات فنی تخصصی یا نامهای نادر را اضافه کنند تا مطمئن شوند هوش مصنوعی در جلسات آینده آنها را بهدرستی تشخیص میدهد.
حریم خصوصی و مدیریت دادهها
یک تمایز حیاتی برای Voicy، معماری «اول-حریم-خصوصی» آن است. در حالی که بسیاری از ابزارهای هوش مصنوعی دادهها را برای آموزش مدلها به ابر (Cloud) میفرستند، Voicy متون استخراج شده را بهصورت محلی روی دستگاه کاربر ذخیره میکند. این رویکرد مشابه ابزارهای متنبازی است که مانند Yap از APIهای محلی برای پردازش روی دستگاه بهره میبرند تا امنیت دادهها را تضمین کنند.
شرکت صراحتاً اعلام کرده است که ضبطها هرگز برای آموزش مدلهای هوش مصنوعی آنها استفاده نمیشوند و هیچ شخص ثالثی به محتوای دیکته شده دسترسی ندارد. این ویژگی، ابزار را برای متخصصانی که با جزئیات حساس مشتریان، یادداشتهای پزشکی یا مالکیتهای فکری منتشر نشده سر و کار دارند، به گزینهای مناسب تبدیل میکند؛ زیرا از بندهای «دادههای بهبود محصول» که در سایر نرمافزارهای هوش مصنوعی رایج است، اجتناب میکند.
مقایسه با جایگزینها
Voicy در مقایسه با سایر ابزارهای صوتی هوش مصنوعی، جایگاه خاصی را اشغال کرده است:
- Wispr Flow: این ابزار از بیش از ۱۰۰ زبان پشتیبانی میکند (در مقابل ۵۰ زبان در Voicy) و دستورات ویرایشی و بازنویسی پیشرفتهتری ارائه میدهد. در واقع Wispr Flow با قابلیت اصلاح آنی خود استانداردهای جدیدی را در حوزه دیکته AI تعریف کرده است. با این حال، تأکید خاص Voicy بر ذخیرهسازی محلی و ادعای سازگاری با ۲۰ هزار اپلیکیشن را ندارد. سرعت دیکته Wispr Flow حدود ۲۲۰ کلمه در دقیقه است، در حالی که Voicy به ۱۲۰ کلمه میرسد.
- Speechify Dictation: بخشی از یک مجموعه بزرگتر خواندن/نوشتن است که سرعت دیکتهای تقریباً ۴ برابر سریعتر از تایپ ارائه میدهد و در حال حاضر به عنوان سرویس رایگان بدون نیاز به اشتراک بازاریابی میشود. Voicy یک ابزار دیکته تخصصیتر با ویژگیهای نوشتاری ویژه است اما از یک دوره آزمایشی محدود استفاده میکند.
- Otter.ai: ابزاری متمرکز بر جلسات که برای گفتگوهای چندنفره در Zoom، Google Meet و Microsoft Teams طراحی شده و خلاصهها و موارد اجرایی تولید میکند. در مقابل، Voicy برای دیکته تککاربره در برنامههای روزمره ساخته شده است.
قیمتگذاری و دسترسی
Voicy بر اساس یک «سیاست قیمتگذاری منصفانه» عمل میکند که در آن حاشیه سود حداکثر ۲۰٪ هزینههای عملیاتی کل است. آنها برای کسانی که پرداخت یکباره را به اشتراک ماهانه ترجیح میدهند، یک طرح Lifetime (عمر طولانی) ارائه میدهند.
دانشجویان میتوانند از ۲۰٪ تخفیف بهرهمند شوند و طرح Pro اجازه میدهد یک اشتراک واحد تمام دستگاههای شخصی کاربر را پوشش دهد. با این حال، طرح تیمی (Team plan) به حداقل سه کاربر نیاز دارد، به این معنی که برای یک عضو تیم که بهتنهایی قصد ارتقا دارد، طراحی نشده است.
برای کسانی که میخواهند نرمافزار را تست کنند، Voicy یک دوره آزمایشی رایگان با ۳۰ دقیقه زمان ضبط ارائه میدهد. نکته قابل توجه این است که این دوره آزمایشی به کارت اعتباری نیاز ندارد، هرچند این ۳۰ دقیقه یک سقف کلی است و نه یک سهمیه ماهانه تکرار شونده.
تحلیل: تغییر به سمت بهرهوری اول-گفتار
برای یک متخصص معمولی — از جمله نویسندگان، تولیدکنندگان محتوا و دانشجویان — این ابزار نشاندهنده تغییری از «تایپ به عنوان تفکر» به «صحبت به عنوان پیشنویس» است. با حذف گلوگاه فیزیکی کیبورد، کاربران میتوانند ایدهها را با سرعت فکر ثبت کنند و زمان بین ایدهپردازی و اولین پیشنویس را کاهش دهند. این موضوع بهویژه برای افرادی که دچار آرتروز یا سندرم تونل کارپال هستند و تایپ برایشان دردناک است، مفید است.
تأکید بر ذخیرهسازی محلی یک حرکت استراتژیک است. با افزایش نگرانیهای شرکتی در مورد نشت دادههای هوش مصنوعی، ابزارهایی که حریم خصوصی «روی دستگاه» (on-device) را ارائه میدهند، احتمالاً کاربران سازمانی را که از استفاده از LLMهای ابری برای کارهای حساس منع شدهاند، جذب خواهند کرد.
با این حال، اتکا به اتصال اینترنت برای تبدیل صوت به متن همچنان یک نقطه ضعف است؛ این ابزار کاملاً آفلاین نیست. تا زمانی که نرمافزار به سمت استنتاج محلی کاملاً آفلاین حرکت نکند، وابسته به اتصال باقی میماند که کاربرد آن را در محیطهای با امنیت بالا یا مناطق دورافتاده محدود میکند.
اگر متوجه شدهاید که ساعتهای زیادی از روز خود را صرف ایمیلهای تکراری یا مستندسازی میکنید، تست یک گردشکار اول-گفتار میتواند بخش قابل توجهی از روز کاری شما را بازپس گیرد. منتظر ادغام احتمالی مدلهای کاملاً آفلاین در بهروزرسانیهای آینده باشید تا ببینید آیا وعده حریم خصوصی به استقلال کامل از اتصال اینترنت گسترش مییابد یا خیر.




گفتگو