تصور کنید در یک جلسهٔ حساس حقوقی یا پزشکی هستید و کلمات دقیقاً همان لحظه که ادا میشوند، روی صفحه ظاهر شوند. این تجربه با تأخیر ۷ میلیثانیهای در رمزگشایی (Decoding) — یعنی همان لحظهای که مدل واقعاً جواب تولید میکند و شبیه به خودِ آشپزی است، نه دورهی آموزش آشپز — اکنون در دسترس است.
Whisper Notes ابزاری کاملاً آفلاین است که برای ثبت صدای سیستم و میکروفون طراحی شده تا حتی یک بایت داده را به ابر ارسال نکند. برای وکلای دادگاه، پزشکان و مشاورانی که با قوانین سختگیرانه حریم خصوصی مانند HIPAA یا امتیازات محرمانهٔ موکل روبرو هستند، هوش مصنوعی ابری معمولاً یک گزینه غیرقابلقبول است. به همین دلیل، بسیاری از متخصصان این حوزهها مجبور بودند یادداشتبرداری دستی کنند، زیرا سیاستهای دادهای شرکتها، آپلود فایلهای صوتی حساس به سرورهای شخص ثالث را ممنوع میکند. این رویکرد امنیتی یادآور راهکارهای مشابهی است که در پردازش ۱۰۰٪ دادههای صوتی در سیستم محلی Meetily برای حفظ حریم خصوصی جلسات بررسی کرده بودیم.
طبق گزارش فنی منتشر شده در ۳۰ سپتامبر ۲۰۲۶، توسعهدهنده این ابزار از Qualcomm AI Hub برای استقرار مدل Whisper-Small-Quantized استفاده کرده است. همانطور که در تحلیلهای پیشین ما دربارهی رایانش لبه اشاره کردیم، انتقال پردازش از سرور به دستگاه، کلید حاکمیت دادههاست. این سیستم با استفاده از زمانبندی QNN برای واحد پردازش عصبی (NPU) — که شبیه به یک موتور تخصصی برای کارهای سنگین است تا باتری زود خالی نشود — بهینهسازی شده تا فشار کاری را از روی CPU و GPU بردارد.
بر اساس مستندات فنی، معماری این ابزار شامل موارد زیر است:
- ضبط صدا: استفاده از WASAPI loopback برای ثبت همزمان میکروفون و صدای سیستم (Zoom، Teams و Google Meet).
- استنتاج (Inference): مدل Whisper-Small-Quantized وظیفه تبدیل گفتار به متن را بر عهده دارد.
- خلاصهسازی: استخراج موارد اقدام (Action Items) توسط مدل Qwen3-0.6B یا منطق مبتنی بر قوانین.
- امنیت: ذخیره تمام دادهها در پایگاهداده محلی SQLite با رمزنگاری AES-256.
به نقل از دادههای عملکردی، رمزگذار NPU میتواند ۳۰ ثانیه صدا را در حدود ۳۰۸ میلیثانیه پردازش کند. این شتاب سختافزاری است که حس «زنده بودن» متن را ایجاد میکند؛ در حالی که در روشهای مبتنی بر CPU، تأخیر چندین ثانیهای مشهود است.
این تغییر ثابت میکند که برای کاربران سطح بالا، حریم خصوصی یک «ویژگی» اصلی است، نه یک محدودیت. توانایی اجرای یک مدل کوانتیده (Quantized) — یعنی مدلهای فشردهشدهای که مثل یک فایل زیپ، حجمشان کم شده اما کاراییشان حفظ شده — روی یک NPU اختصاصی، دستگاه را از یک ترمینال ساده به یک گاوصندوق امن تبدیل میکند. این روند نشان میدهد که در آینده، «PCهای هوش مصنوعی» را بیشتر بهخاطر حاکمیت دادهها میخواهیم تا سرعت خام.
با این حال، این پروژه یک نقطه ضعف بزرگ در اکوسیستم فعلی AI PC را آشکار میکند: دشواری در استقرار فایلهای باینری کامپایلشده با QNN. اگرچه کد پایتون ساده است، اما تنظیمات اولیه مدل برای کاربران غیرفنی همچنان یک مانع جدی است.
گام بعدی شما
- اگر توسعهدهنده هستید، مخزن عمومی گیتهاب این پروژه را بررسی کنید تا ببینید پارامتر
device_map="qairt"چگونه مدل را به NPU هدایت میکند. - برای ارزیابی سختافزار جدید، بررسی کنید که آیا لپتاپ شما از Runtimeهای QNN پشتیبانی میکند یا خیر.
- مدلهای کوچکتر را برای کاربردهای آفلاین تست کنید تا توازن بین دقت و سرعت را بیابید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو