تصور کنید در یک دفتر کار شلوغ هستید و میخواهید سریعترین پیام ممکن را بفرستید، اما نه آنقدر بلند که همکاران مزاحم شوند و نه آنقدر آرام که لپتاپ صدای شما را نشنود. این همان شکافی است که Relay قصد دارد با تبدیل صدای نجوا به دستورات متنی دقیق، آن را پر کند. تا سال ۲۰۲۷، احتمالاً یک میکروفون سختافزاری اختصاصی میتواند در اکثر ارتباطات حرفهای جایگزین کیبورد شما شود.
به گزارش Wired در ۲۷ اوت ۲۰۲۶، استارتاپ لندنی Relay در حال توسعه اکوسیستمی است که هدفش حذف کامل اصطکاک تایپ در محیطهای کاری شلوغ یا مشترک است. این سیستم از مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن کتابها جواب میدهد — برای تبدیل گفتار به متن و ویرایش هوشمند آن استفاده میکند. تکنولوژی تبدیل گفتار به متن با ظهور مدلهای زبانی بزرگ به سرعت تکامل یافته و از نسخههای سادهای که فقط کلمات را مینوشتند، به ابزارهای ویرایش هوشمند تبدیل شده است. ابزارهایی مانند Wispr Flow و قابلیت دیکته در گوشیهای گوگل پیکسل، اکنون میتوانند کلمات زائد (filler words) را حذف کرده و افکار بدون برنامهریزی را پاکسازی کنند. این ابزارها حتی میتوانند به طور یکپارچه میان گفتگوهای چندزبانه واسطهگری کنند.
همانطور که در تحلیلهای قبلی ما دربارهی رابطهای کاربری بدون صفحه (Screenless UI) اشاره کردیم، حذف ورودیهای فیزیکی همواره با چالش دقت روبرو بوده است. ابزارهایی مثل Wispr Flow پیش از این توانستند کلمات زائد را حذف کنند، اما مشکل اصلی در محیط فیزیکی دفتر کار بود: یا کاربر بیش از حد آرام صحبت میکرد و میکروفون لپتاپ چیزی نمیشنید، یا صدای او برای همکارانش آزاردهنده میشد. در واقع، نرمافزار به تنهایی در برابر واقعیتهای فیزیکی دفتر کار ناتوان است.
این شرکت توسط کوکی شو (Cookie Xu)، مدیر سابق هوش مصنوعی و خدمات در Nothing، و ریموند ژو (Raymond Zhu)، مدیر محصول سختافزار تأسیس شده است. طبق اعلام این دو بنیانگذار، آنها متوجه شدند که تکیه بر هندزفری یا میکروفونهای داخلی برای ایدهپردازی در محیط کار ناکارآمد است. آنها در زمان فعالیت در شرکت Nothing، از نرمافزار Wispr Flow برای «تایپ» اکثر پیامهای کاری خود استفاده میکردند، اما متوجه شدند که ایجاد تعادل در میزان صدا غیرممکن است. ریموند ژو این چالش را چنین توصیف میکند: «اگر خیلی آرام نجوا میکردم، مکبوک نمیتوانست صدا را دریافت کند؛ و اگر صدایم را بالا میبردم، همکار کنارم میشنید.» او حتی به جایی رسید که برای ثبت ورودیها، یک هندزفری را مستقیماً جلوی دهانش نگه میداشت.
تمرکز بر دسکتاپ و اکوسیستم نرمافزاری
سرویس Relay در ابتدا منحصراً برای macOS عرضه میشود و برنامههایی برای گسترش به ویندوز، iOS و اندروید دارد. دلیل اولویتبندی دسکتاپ این است که ریموند ژو معتقد است پیچیدگی گفتگوها در دسکتاپ بسیار بیشتر است. در حالی که چتهای تلفنی با خانواده ساده هستند، استفاده از کامپیوتر در محیط کار شامل اشتراک ایدهها، طوفان فکری و مدیریت سطوح مختلف از لحن و رسمیت است. این تلاش برای بازگرداندن روانی و انسانیت به ارتباطات دیجیتال، یادآور موفقیت چتباتهای متکی بر تعاملات انسانی است که نشان میدهد کاربران همچنان به دنبال تجربهای طبیعیتر در محیطهای مجازی هستند.
اپلیکیشن بتای فعلی از طریق یک کلید میانبر (مانند کلید Fn) مستقیماً در هر فیلد متنی یکپارچه میشود. کاربران کلید را فشار داده و نگه میدارند تا زمانی که مکاننما در فیلد متن است و دیکته فعال شود. ویژگیهای کلیدی این نرمافزار عبارتند از:
- موتور پردازش: پردازش تبدیل صوت به متن توسط مدلهای Gemini گوگل انجام میشود.
- سفارشیسازی: کاربران میتوانند یادداشتهایی را در اپلیکیشن اضافه کنند تا سیستم از الگوهای خاصی پیروی کند. برای مثال، کاربر میتواند به Relay دستور دهد که در پیامهای Slack از گذاشتن نقطه در انتهای جملات خودداری کند.
- هوش زمینهای: سیستم تشخیص میدهد که شما به چه کسی پیام میدهید تا لحن را بین حالت حرفهای و دوستانه تنظیم کند. این سیستم حتی میتواند پیامها را به زبان مادری همکاری که در کشوری دیگر زندگی میکند ترجمه کند.
«مهارتها» و اتوماسیون سیستمی
Relay فراتر از یک ابزار تبدیل صوت به متن است و مفهومی به نام «مهارتها» (Skills) را معرفی کرده است. اینها اقداماتی زمینهای هستند که فراتر از متن ساده میروند و به هوش مصنوعی اجازه میدهند تا دستورات را در سطح سیستمعامل اجرا کند:
- یکپارچگی با اپلیکیشنها: میتوانید از Relay بخواهید پیامی را در Slack بفرستد؛ در این حالت AI اپلیکیشن را باز کرده، مخاطب را مییابد و متن را مینویسد. همین روند برای ایجاد رویدادها در تقویم گوگل (Google Calendar) نیز صادق است.
- گزینههای پیشفرض: Relay مهارتهای پیشفرستی برای اپلیکیشنهای محبوبی مثل Gmail و WhatsApp ارائه میدهد، هرچند کاربران میتوانند مهارتهای خودشان را بسازند و اپلیکیشنهای دیگر را متصل کنند.
- چندوظیفگی: مدل میتواند چندین درخواست مجزا را در یک نفس پردازش کند. مثلاً کاربر میتواند پیامی درباره یک رستوران دیکته کند و همزمان از Relay بخواهد لینک گوگلمپ آن مکان را فراهم کند.
برای دستیابی به این سطح از کنترل، Relay به دسترسیهای گستردهای از جمله ثبت عکسهای لحظهای (Snapshots) از صفحه نمایش نیاز دارد. شرکت ادعا میکند دادهها بهصورت محلی روی دستگاه کاربر ذخیره میشوند و میتوان آنها را به صورت دستی ویرایش یا حذف کرد. اگرچه دادهها برای رسیدن به سرورهای گوگل از سرورهای Relay عبور میکنند، اما شرکت ادعا میکند که این اطلاعات را ذخیره نمیکند. با این حال، دادن «چشم» به مدلهای هوش مصنوعی در سیستمعامل، نگرانیهای حریم خصوصی مشابه قابلیت Recall مایکروسافت را ایجاد میکند. در این راستا، بهینهسازی دسترسی به دادهها و کاهش هزینههای عملیاتی مدلها، مشابه رویکرد استارتاپ Keenable برای کاهش هزینههای API، یکی از چالشهای کلیدی در توسعه عاملهای هوشمند (AI Agents) است.

سختافزار Relay Q: پایان معمای صدا
در حالی که نرمافزار اکنون در دسترس است، سختافزار اختصاصی یعنی Relay Q در سه ماهه اول سال ۲۰۲۷ عرضه خواهد شد. این دستگاه یک میکروفون استوانهای است که برای حل معمای حجم صدا در دفاتر باز طراحی شده تا کاربران بتوانند مستقیماً در سختافزار نجوا کنند.
- طراحی: دستگاه هنگام مشاهده از بالا شبیه حرف Q است و یک دکمه فعالساز (Trigger) روی قسمت بالایی دارد.
- انعطافپذیری: دکمه فعالساز میتواند از استوانه جدا شده و برای استفاده به صورت پوشیدنی (Wearable) به لباس کاربر متصل شود.
- اتصال: با دو ضربه (Double-tap) روی دکمه، پیام ارسال میشود. هدف از این سختافزار، حذف تأخیر کوچک فعالسازی است که در حال حاضر هنگام استفاده از کلیدهای میانبر کیبورد تجربه میشود.
- لوازم جانبی: دستگاه Q همراه با یک داک شارژ برای نگهداری روی میز عرضه میشود. همچنین یک گریپ MagSafe مجزا برای آیفونها و دستگاههای دارای استاندارد Qi2 در سه ماهه اول ۲۰۲۷ عرضه خواهد شد تا کاربران بتوانند ورودی صوتی را در موبایل فعال کنند.
رقابت و فلسفه طراحی
Relay تنها تلاشکننده در این مسیر نیست؛ سال گذشته Sandbar محصول Stream Ring و شرکت Pebble محصول Index 01 را معرفی کردند. هر دو حلقههایی بودند که برای نجوا کردن افکار طراحی شده بودند. اما ریموند ژو اشاره کرد که Relay طراحی حلقه را بررسی کرد اما به دلیل اشباع شدن بازار حلقههای هوشمند، از آن صرفنظر کرد.
فلسفه اصلی پشت این دستگاه در پرسشی خلاصه میشود که به گفته ژو، راهنمای ساخت محصول بوده است: «چقدر میتوانیم در طول روز کاری، بدون لمس کیبورد پیش برویم؟»
در تستهای اولیه نسخه بتا، برخی ناهماهنگیها در مقایسه با ابزارهای سطح بالا مانند قابلیت Rambler در سری پیکسل ۱۱ گوگل دیده شده است. علامتگذاری (Punctuation) گاهی نامنظم است و هوش مصنوعی گاهی بهجای درج نماد ایموجی قلب، عبارت «heart emoji» را تایپ میکند. با این حال، مدل بهخوبی متوجه میشود چه زمانی کاربر دچار لکنت شده یا جملهای را دوباره بیان میکند و بخشهای غیرضروری را حذف میکند.
قیمت Relay Q حدود ۱۵۰ دلار خواهد بود. این قیمت شامل یک سال دسترسی به نرمافزار است و پس از آن، هزینه سرویس ۱۵ دلار در ماه خواهد بود. البته کاربران همچنان میتوانند بدون خرید سختافزار از نرمافزار استفاده کنند.
این رویکرد نشاندهنده چرخش به سمت رابطهای «نامرئی» است که در آن کیبورد به ابزاری ثانویه تبدیل میشود. با ترکیب یک میکروفون پوشیدنی و دسترسیهای سطح سیستمعامل، Relay تلاش میکند صدای انسان را به یک خط فرمان (Command Line) جهانی برای کامپیوتر تبدیل کند.
برای کاربران حرفهای، این یعنی پایان احتمالی «گلوگاه تایپ» در زمان ایدهپردازی. اگر سختافزار بتواند واقعاً نجواها را با کیفیت بالا ثبت کند، حریم خصوصی و سرعت ورودی صوتی در نهایت با کاربرد کیبورد برابری خواهد کرد. باید منتظر عرضه سختافزار در سه ماهه اول ۲۰۲۷ بود تا ببینیم آیا تجهیزات جانبی اختصاصی AI میتوانند بر نگرانیهای حریم خصوصی مربوط به نظارت دائمی بر صفحه و دسترسی به میکروفون غلبه کنند یا خیر.
گام بعدی شما
- اگر از macOS استفاده میکنید، نسخه بتای Relay را برای تست سرعت تبدیل نجوا به متن امتحان کنید.
- دسترسیهای سیستمی مورد نیاز برای «مهارتها» را با استانداردهای حریم خصوصی خود بسنجید.
- بررسی کنید آیا گردش کارهای شما در Slack و Gmail پتانسیل جایگزینی کامل با ورودی صوتی را دارد یا خیر.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای پردازش صوتی در لبه (Edge AI) مراجعه کنید.




گفتگو