پرش به محتوای اصلی
پرش به محتوای مقاله

«تولید متن صیقل‌خورده از نجوا»؛ رویکرد جدید Relay برای محیط‌های اداری

·۵ شهریور ۱۴۰۵۶ دقیقه مطالعه۱ بازدید
میکروفون هوشمند با قابلیت تایپ صوتی: دیگر نیازی به صفحه‌کلید نیست
میکروفون هوشمند با قابلیت تایپ صوتی: دیگر نیازی به صفحه‌کلید نیست
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تلفیق یک میکروفون سخت‌افزاری مخصوص نجوا با دسترسی‌های عمیق به سیستم‌عامل برای اجرای اکشن‌ها (Skills)، فراتر از یک تبدیل ساده صوت به متن است و به دنبال حذف فیزیکی کیبورد است.

تصور کنید در یک دفتر کار شلوغ هستید و می‌خواهید سریع‌ترین پیام ممکن را بفرستید، اما نه آن‌قدر بلند که همکاران مزاحم شوند و نه آن‌قدر آرام که لپ‌تاپ صدای شما را نشنود. این همان شکافی است که Relay قصد دارد با تبدیل صدای نجوا به دستورات متنی دقیق، آن را پر کند. تا سال ۲۰۲۷، احتمالاً یک میکروفون سخت‌افزاری اختصاصی می‌تواند در اکثر ارتباطات حرفه‌ای جایگزین کیبورد شما شود.

به گزارش Wired در ۲۷ اوت ۲۰۲۶، استارتاپ لندنی Relay در حال توسعه اکوسیستمی است که هدفش حذف کامل اصطکاک تایپ در محیط‌های کاری شلوغ یا مشترک است. این سیستم از مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — برای تبدیل گفتار به متن و ویرایش هوشمند آن استفاده می‌کند. تکنولوژی تبدیل گفتار به متن با ظهور مدل‌های زبانی بزرگ به سرعت تکامل یافته و از نسخه‌های ساده‌ای که فقط کلمات را می‌نوشتند، به ابزارهای ویرایش هوشمند تبدیل شده است. ابزارهایی مانند Wispr Flow و قابلیت دیکته در گوشی‌های گوگل پیکسل، اکنون می‌توانند کلمات زائد (filler words) را حذف کرده و افکار بدون برنامه‌ریزی را پاکسازی کنند. این ابزارها حتی می‌توانند به طور یکپارچه میان گفتگوهای چندزبانه واسطه‌گری کنند.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی رابط‌های کاربری بدون صفحه (Screenless UI) اشاره کردیم، حذف ورودی‌های فیزیکی همواره با چالش دقت روبرو بوده است. ابزارهایی مثل Wispr Flow پیش از این توانستند کلمات زائد را حذف کنند، اما مشکل اصلی در محیط فیزیکی دفتر کار بود: یا کاربر بیش از حد آرام صحبت می‌کرد و میکروفون لپ‌تاپ چیزی نمی‌شنید، یا صدای او برای همکارانش آزاردهنده می‌شد. در واقع، نرم‌افزار به تنهایی در برابر واقعیت‌های فیزیکی دفتر کار ناتوان است.

این شرکت توسط کوکی شو (Cookie Xu)، مدیر سابق هوش مصنوعی و خدمات در Nothing، و ریموند ژو (Raymond Zhu)، مدیر محصول سخت‌افزار تأسیس شده است. طبق اعلام این دو بنیان‌گذار، آن‌ها متوجه شدند که تکیه بر هندزفری یا میکروفون‌های داخلی برای ایده‌پردازی در محیط کار ناکارآمد است. آن‌ها در زمان فعالیت در شرکت Nothing، از نرم‌افزار Wispr Flow برای «تایپ» اکثر پیام‌های کاری خود استفاده می‌کردند، اما متوجه شدند که ایجاد تعادل در میزان صدا غیرممکن است. ریموند ژو این چالش را چنین توصیف می‌کند: «اگر خیلی آرام نجوا می‌کردم، مک‌بوک نمی‌توانست صدا را دریافت کند؛ و اگر صدایم را بالا می‌بردم، همکار کنارم می‌شنید.» او حتی به جایی رسید که برای ثبت ورودی‌ها، یک هندزفری را مستقیماً جلوی دهانش نگه می‌داشت.

تمرکز بر دسکتاپ و اکوسیستم نرم‌افزاری

سرویس Relay در ابتدا منحصراً برای macOS عرضه می‌شود و برنامه‌هایی برای گسترش به ویندوز، iOS و اندروید دارد. دلیل اولویت‌بندی دسکتاپ این است که ریموند ژو معتقد است پیچیدگی گفتگوها در دسکتاپ بسیار بیشتر است. در حالی که چت‌های تلفنی با خانواده ساده هستند، استفاده از کامپیوتر در محیط کار شامل اشتراک ایده‌ها، طوفان فکری و مدیریت سطوح مختلف از لحن و رسمیت است. این تلاش برای بازگرداندن روانی و انسانیت به ارتباطات دیجیتال، یادآور موفقیت چت‌بات‌های متکی بر تعاملات انسانی است که نشان می‌دهد کاربران همچنان به دنبال تجربه‌ای طبیعی‌تر در محیط‌های مجازی هستند.

اپلیکیشن بتای فعلی از طریق یک کلید میان‌بر (مانند کلید Fn) مستقیماً در هر فیلد متنی یکپارچه می‌شود. کاربران کلید را فشار داده و نگه می‌دارند تا زمانی که مکان‌نما در فیلد متن است و دیکته فعال شود. ویژگی‌های کلیدی این نرم‌افزار عبارتند از:

  • موتور پردازش: پردازش تبدیل صوت به متن توسط مدل‌های Gemini گوگل انجام می‌شود.
  • سفارشی‌سازی: کاربران می‌توانند یادداشت‌هایی را در اپلیکیشن اضافه کنند تا سیستم از الگوهای خاصی پیروی کند. برای مثال، کاربر می‌تواند به Relay دستور دهد که در پیام‌های Slack از گذاشتن نقطه در انتهای جملات خودداری کند.
  • هوش زمینه‌ای: سیستم تشخیص می‌دهد که شما به چه کسی پیام می‌دهید تا لحن را بین حالت حرفه‌ای و دوستانه تنظیم کند. این سیستم حتی می‌تواند پیام‌ها را به زبان مادری همکاری که در کشوری دیگر زندگی می‌کند ترجمه کند.

«مهارت‌ها» و اتوماسیون سیستمی

Relay فراتر از یک ابزار تبدیل صوت به متن است و مفهومی به نام «مهارت‌ها» (Skills) را معرفی کرده است. این‌ها اقداماتی زمینه‌ای هستند که فراتر از متن ساده می‌روند و به هوش مصنوعی اجازه می‌دهند تا دستورات را در سطح سیستم‌عامل اجرا کند:

  • یکپارچگی با اپلیکیشن‌ها: می‌توانید از Relay بخواهید پیامی را در Slack بفرستد؛ در این حالت AI اپلیکیشن را باز کرده، مخاطب را می‌یابد و متن را می‌نویسد. همین روند برای ایجاد رویدادها در تقویم گوگل (Google Calendar) نیز صادق است.
  • گزینه‌های پیش‌فرض: Relay مهارت‌های پیش‌فرستی برای اپلیکیشن‌های محبوبی مثل Gmail و WhatsApp ارائه می‌دهد، هرچند کاربران می‌توانند مهارت‌های خودشان را بسازند و اپلیکیشن‌های دیگر را متصل کنند.
  • چندوظیفگی: مدل می‌تواند چندین درخواست مجزا را در یک نفس پردازش کند. مثلاً کاربر می‌تواند پیامی درباره یک رستوران دیکته کند و هم‌زمان از Relay بخواهد لینک گوگل‌مپ آن مکان را فراهم کند.

برای دستیابی به این سطح از کنترل، Relay به دسترسی‌های گسترده‌ای از جمله ثبت عکس‌های لحظه‌ای (Snapshots) از صفحه نمایش نیاز دارد. شرکت ادعا می‌کند داده‌ها به‌صورت محلی روی دستگاه کاربر ذخیره می‌شوند و می‌توان آن‌ها را به صورت دستی ویرایش یا حذف کرد. اگرچه داده‌ها برای رسیدن به سرورهای گوگل از سرورهای Relay عبور می‌کنند، اما شرکت ادعا می‌کند که این اطلاعات را ذخیره نمی‌کند. با این حال، دادن «چشم» به مدل‌های هوش مصنوعی در سیستم‌عامل، نگرانی‌های حریم خصوصی مشابه قابلیت Recall مایکروسافت را ایجاد می‌کند. در این راستا، بهینه‌سازی دسترسی به داده‌ها و کاهش هزینه‌های عملیاتی مدل‌ها، مشابه رویکرد استارتاپ Keenable برای کاهش هزینه‌های API، یکی از چالش‌های کلیدی در توسعه عامل‌های هوشمند (AI Agents) است.

Image may contain Bottle Blade Razor and Weapon

سخت‌افزار Relay Q: پایان معمای صدا

در حالی که نرم‌افزار اکنون در دسترس است، سخت‌افزار اختصاصی یعنی Relay Q در سه ماهه اول سال ۲۰۲۷ عرضه خواهد شد. این دستگاه یک میکروفون استوانه‌ای است که برای حل معمای حجم صدا در دفاتر باز طراحی شده تا کاربران بتوانند مستقیماً در سخت‌افزار نجوا کنند.

  • طراحی: دستگاه هنگام مشاهده از بالا شبیه حرف Q است و یک دکمه فعال‌ساز (Trigger) روی قسمت بالایی دارد.
  • انعطاف‌پذیری: دکمه فعال‌ساز می‌تواند از استوانه جدا شده و برای استفاده به صورت پوشیدنی (Wearable) به لباس کاربر متصل شود.
  • اتصال: با دو ضربه (Double-tap) روی دکمه، پیام ارسال می‌شود. هدف از این سخت‌افزار، حذف تأخیر کوچک فعال‌سازی است که در حال حاضر هنگام استفاده از کلیدهای میان‌بر کیبورد تجربه می‌شود.
  • لوازم جانبی: دستگاه Q همراه با یک داک شارژ برای نگهداری روی میز عرضه می‌شود. همچنین یک گریپ MagSafe مجزا برای آیفون‌ها و دستگاه‌های دارای استاندارد Qi2 در سه ماهه اول ۲۰۲۷ عرضه خواهد شد تا کاربران بتوانند ورودی صوتی را در موبایل فعال کنند.

رقابت و فلسفه طراحی

Relay تنها تلاش‌کننده در این مسیر نیست؛ سال گذشته Sandbar محصول Stream Ring و شرکت Pebble محصول Index 01 را معرفی کردند. هر دو حلقه‌هایی بودند که برای نجوا کردن افکار طراحی شده بودند. اما ریموند ژو اشاره کرد که Relay طراحی حلقه را بررسی کرد اما به دلیل اشباع شدن بازار حلقه‌های هوشمند، از آن صرف‌نظر کرد.

فلسفه اصلی پشت این دستگاه در پرسشی خلاصه می‌شود که به گفته ژو، راهنمای ساخت محصول بوده است: «چقدر می‌توانیم در طول روز کاری، بدون لمس کیبورد پیش برویم؟»

در تست‌های اولیه نسخه بتا، برخی ناهماهنگی‌ها در مقایسه با ابزارهای سطح بالا مانند قابلیت Rambler در سری پیکسل ۱۱ گوگل دیده شده است. علامت‌گذاری (Punctuation) گاهی نامنظم است و هوش مصنوعی گاهی به‌جای درج نماد ایموجی قلب، عبارت «heart emoji» را تایپ می‌کند. با این حال، مدل به‌خوبی متوجه می‌شود چه زمانی کاربر دچار لکنت شده یا جمله‌ای را دوباره بیان می‌کند و بخش‌های غیرضروری را حذف می‌کند.

قیمت Relay Q حدود ۱۵۰ دلار خواهد بود. این قیمت شامل یک سال دسترسی به نرم‌افزار است و پس از آن، هزینه سرویس ۱۵ دلار در ماه خواهد بود. البته کاربران همچنان می‌توانند بدون خرید سخت‌افزار از نرم‌افزار استفاده کنند.

این رویکرد نشان‌دهنده چرخش به سمت رابط‌های «نامرئی» است که در آن کیبورد به ابزاری ثانویه تبدیل می‌شود. با ترکیب یک میکروفون پوشیدنی و دسترسی‌های سطح سیستم‌عامل، Relay تلاش می‌کند صدای انسان را به یک خط فرمان (Command Line) جهانی برای کامپیوتر تبدیل کند.

برای کاربران حرفه‌ای، این یعنی پایان احتمالی «گلوگاه تایپ» در زمان ایده‌پردازی. اگر سخت‌افزار بتواند واقعاً نجواها را با کیفیت بالا ثبت کند، حریم خصوصی و سرعت ورودی صوتی در نهایت با کاربرد کیبورد برابری خواهد کرد. باید منتظر عرضه سخت‌افزار در سه ماهه اول ۲۰۲۷ بود تا ببینیم آیا تجهیزات جانبی اختصاصی AI می‌توانند بر نگرانی‌های حریم خصوصی مربوط به نظارت دائمی بر صفحه و دسترسی به میکروفون غلبه کنند یا خیر.

گام بعدی شما

  • اگر از macOS استفاده می‌کنید، نسخه بتای Relay را برای تست سرعت تبدیل نجوا به متن امتحان کنید.
  • دسترسی‌های سیستمی مورد نیاز برای «مهارت‌ها» را با استانداردهای حریم خصوصی خود بسنجید.
  • بررسی کنید آیا گردش کارهای شما در Slack و Gmail پتانسیل جایگزینی کامل با ورودی صوتی را دارد یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های پردازش صوتی در لبه (Edge AI) مراجعه کنید.

چرا این موضوع مهم است؟

این محصول با ترکیب سخت‌افزار تخصصی و مدل‌های Gemini، تجربه کاربری را از «تایپ کردن» به «هدایت کردن» سیستم تغییر می‌دهد. اعتبار این پروژه به دلیل پیشینه بنیان‌گذاران در Nothing و تکیه بر زیرساخت گوگل، آن را به یکی از جدی‌ترین رقبای رابط‌های صوتی تبدیل می‌کند.

تأثیر برای ایران

به‌دلیل محدودیت‌های دسترسی به مدل‌های Gemini و احتمالاً تحریم‌های سخت‌افزاری، دسترسی کاربران ایرانی به اکوسیستم کامل Relay دشوار خواهد بود.

·نگاه ما
تحریریه دات‌هوش

تلاش Relay برای جایگزینی کیبورد، در واقع تلاشی برای تبدیل صدا به یک «خط فرمان» (Command Line) جهانی برای سیستم‌عامل است. این رویکرد نشان می‌دهد که مدل‌های استدلالی دیگر تنها برای تولید متن نیستند، بلکه در حال تبدیل شدن به لایه‌ای میان کاربر و APIهای اپلیکیشن‌ها هستند. ریسک اصلی این مدل، وابستگی شدید به دسترسی‌های سطح سیستم است که می‌تواند در محیط‌های سازمانی با سخت‌گیری‌های امنیتی شدید، با مقاومت روبرو شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.