تصور کنید یک مدیر پروژه هستید که باید یادداشتهای محرمانهای را سریعاً تایپ کند، اما نمیخواهید حتی یک بایت از صدای شما برای پردازش به سرورهای ابری ارسال شود. FnScribe دقیقاً برای حل همین چالش طراحی شده است تا دیکتهٔ با دقت بالا را بدون نیاز به اینترنت ممکن کند. ابزاری که به کاربران macOS اجازه میدهد بدون ارسال هیچ دادهای به فضای ابری، متون خود را تبدیل به نوشتار کنند.
به نقل از Algorithmic Research Group، این ابزار در ۲۸ اوت ۲۰۲۶ منتشر شد و با اجرای یک مدل هوش مصنوعی زاینده (Generative AI) — شبیه به دستیاری که تمام دستورالعملها را در حافظهٔ داخلی خود دارد و نیازی به تماس با مرکز نیست — تمام پردازشها را روی سختافزار کاربر انجام میدهد. این برنامه از یک مدل Whisper بستهبندی شده استفاده میکند که بهطور کامل روی دستگاه اجرا میشود تا حریم خصوصی مطلق تضمین گردد.
بسیاری از ابزارهای دیکتهٔ فعلی به APIهای ابری متکی هستند که باعث ایجاد تضاد میان راحتی و امنیت دادهها میشود. همانطور که در تحلیلهای پیشین ما دربارهی امنیت مدلهای محلی اشاره کردیم، وابستگی به ابر برای متخصصانی که با دادههای حساس سروکار دارند، یک مانع جدی است. FnScribe با استقرار در نوار منوی مک و بهرهگیری از توان محاسباتی محلی برای تمام وظایف تبدیل گفتار به متن، این مشکل را حل کرده است.
الزامات سیستم و راهاندازی
طبق مستندات گیتهاب این پروژه، نرمافزار برای اجرا به macOS 13 Ventura یا نسخههای جدیدتر نیاز دارد و از هر دو معماری Apple Silicon و اینتل ۶۴ بیتی پشتیبانی میکند. نصب آن بسیار ساده است و تنها با کشاندن فایل DMG دانلود شده به پوشه Applications انجام میشود.
پس از اجرا، برنامه بهجای ظاهر شدن در Dock، در نوار منوی مک (Menu Bar) مستقر میشود. این ابزار برای عملکرد صحیح به دو دسترسی سیستمی خاص نیاز دارد: دسترسی به میکروفون برای ضبط صدا و دسترسی Accessibility (دسترسیپذیری یا دسترسی به کیبورد) برای شناسایی میانبرهای تعریف شده و درج متن در برنامههای فعال.
نحوه استفاده و کنترلها
کاربران میتوانند تبدیل گفتار به متن را از طریق یک میانبر «فشار برای صحبت» (push-to-talk) فعال کنند که بهصورت پیشفرض روی کلید fn/Globe تنظیم شده است. همچنین میتوان با فشردن ترکیب fn + Space وارد حالت «بدون دست» (hands-free) شد. برای متوقف کردن دیکته در حالت بدون دست، کاربر باید دوباره ترکیب fn + Space را فشار دهد.
برای کسانی که رویکردی ترکیبی را ترجیح میدهند، فشردن کلید Space در حالی که کلید fn نگه داشته شده است، ضبط را از حالت فشار-برای-صحبت به حالت بدون دست تبدیل میکند. اگر کاربر بخواهد ضبطی را لغو کند بدون اینکه متن آن در برنامه درج شود، میتواند در هر لحظه کلید Escape را فشار دهد. یک نوار وضعیت کوچک (flowbar) بازخورد بصری لحظهای از مرحله فعال را نمایش داده و کنترلهای Stop (توقف) و Cancel (لغو) را ارائه میدهد. لازم به ذکر است که حداکثر زمان هر ضبط روی ۲ دقیقه محدود شده است.
قابلیتهای فنی
قابلیتهای فنی این ابزار شامل موارد زیر است:
- پاکسازی هوشمند: این قابلیت بهصورت پیشفرض فعال است و سیستم تکیههای کلامی محافظهکارانه مانند «اممم»، «اوه» و «ارم» را حذف میکند. همچنین دستورات صوتی صریح برای قالببندی مانند «ویرگول»، «نقطه»، «علامت سوال»، «خط جدید» و «پاراگراف جدید» را درک میکند. عبارتهای تکراری مانند «شماره یک، شماره دو» بهطور خودکار به لیست تبدیل میشوند.
- منطق اصلاحی: کاربران میتوانند با گفتن عبارت «scratch that» بخشی از جمله را دور بریزند یا از عبارت «actually make that» برای جایگزینی صریح استفاده کنند. برای اصلاح مقادیر کوتاه، کاربر میتواند بهسادگی بگوید «دو، در واقع سه».
- دیکشنری شخصی: یک فایل تنظیمات محلی به کاربران اجازه میدهد مقادیر «Write as» (بنویس به صورت) و جایگزینیهای «Common mishearing» (اشتباهات شنیداری رایج) را تعریف کنند (مثلاً تبدیل «fn scribe» به «FnScribe»). این ورودیها با مجوزهای دسترسی «فقط مالک» ذخیره میشوند و هرگز منتقل نمیشوند.
- ذخیرهسازی فقط در حافظه: فایلهای صوتی و متنهای تبدیل شده تنها در حافظه موقت (Volatile Memory) نگه داشته میشوند؛ هیچ سیستم حساب کاربری، سرویس ابری یا پایگاهداده دائمی برای ذخیره متون وجود ندارد.
برای حفظ سازگاری با اپلیکیشنهای مختلف، FnScribe از یک ورودی کلیپبورد پنهان و کوتاهمدت برای درج متن استفاده میکند. بلافاصله پس از اتمام درج، محتوای قبلی کلیپبورد کاربر بازیابی میشود. در صورت شکست درج خودکار، گزینههای «Copy Last Transcript» (کپی آخرین متن) و «Original» (متن اصلی و اصلاحنشده) در نوار منو برای بازیابی در دسترس هستند.
آیکون نوار منو وضعیت لحظهای را نمایش میدهد: تصویر میکروفون نشاندهنده آماده بودن است، یک مربع نشاندهنده ضبط در حال اجراست، سه نقطه به معنای پردازش است و علامت تعجب هشدار مربوط به مشکلات دسترسی یا میکروفون را اعلام میکند.
از منظر توسعه، این پروژه تحت مجوز GNU GPL v3 و بهصورت متنباز است. این برنامه با استفاده از Rust 1.85، CMake و Tauri CLI ساخته شده است که امکان ایجاد بستههای بومی برای معماری مک را فراهم میکند. سیستم همچنین از مدلهای سفارشی whisper.cpp GGML از طریق متغیر محیطی FNSCRIBE_MODEL پشتیبانی میکند. توسعهدهندگان میتوانند از ابزار تست (regression harness) ارائه شده برای بررسی مسیرهای درج متن در محیطهای ترمینال، مرورگر و Electron استفاده کنند.
این چرخش به سمت ابزارهای محلی، نشاندهنده ترندی بزرگتر در دنیای هوش مصنوعی است: حرکت از وابستگی به APIهای عظیم به سمت مدلهای زبانی کوچک (SLM) — مثل یک ابزار تخصصی جیبی که فقط یک کار را عالی انجام میدهد، بهجای یک ابرکامپیوتر که همه کار میکند اما کند است. این رویکرد تأخیر و هزینههای اشتراکی را حذف کرده و ریسکهای حریم خصوصی مرتبط با پردازش صوتی ابری را به صفر میرساند.
برای کاربر عادی، این یعنی امکان دیکتهٔ ایمیلها یا کدها در محیطی امن، بدون نگرانی از اینکه صدای آنها برای آموزش مدلهای آینده استفاده شود. در واقع مک به یک ایستگاه کاری تبدیل میشود که تمام پردازشهای تبدیل گفتار به متن را در درون خود جای داده است.
کاربرانی که به این پروژه علاقهمند هستند میتوانند فایل DMG متناسب با معماری پردازنده خود را دانلود کنند یا با استفاده از اسکریپتهای شل ارائه شده، برنامه را از طریق سورس کد بسازند.
گام بعدی شما
- اگر از مک استفاده میکنید، نسخه متناسب با معماری پردازنده خود را از گیتهاب دانلود و تست کنید.
- برای افزایش دقت، بخش دیکشنری شخصی را با اصطلاحات تخصصی شغلی خود بهروز کنید.
- در صورت نیاز به مدلهای سبکتر یا دقیقتر، متغیر محیطی FNSCRIBE_MODEL را برای مدلهای GGML سفارشی تنظیم کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای سری M و بهینهسازیهای Neural Engine مراجعه کنید.




گفتگو