تصور کنید به جای تایپ کردن، تنها با تکان دادن دستها در برابر دوربین گوشی، پیامهای خود را بنویسید یا با هوش مصنوعی گفتگو کنید. این قابلیت که پیش از این در حد آزمایشگاه بود، حالا با مدل SL2T گوگل دیپمایند به یک ویژگی تجاری در گوشیهای هوشمند تبدیل شده است. تسترهای گوگل دریافتهاند که «اشاره کردن به زبان ASL سریعتر و طبیعیتر از تایپ کردن به زبان انگلیسی است». این یافته بر تأثیر مدل SL2T تأکید میکند؛ اولین هوش مصنوعی تبدیل زبان اشاره به متن که به یک ویژگی کاربردی در گوشیهای مصرفکننده تبدیل شده است.
طبق اعلام گوگل، این ابزار از ۱۲ اوت ۲۰۲۶ روی گوشیهای پیکسل ۱۱ (Pixel 11) عرضه میشود و به کاربران ناشنوا اجازه میدهد جستوجوهای وب، پیامها و پرسوجوهای جمینای (Gemini) را از طریق دوربین دیکته کنند. این فناوری در دو برنامهٔ Gboard و Live Transcribe فعال شده است تا کاربران بتوانند در گفتگوهای متقابل، بهجای تایپ کردن و ارسال پیامهای متوالی، از طریق زبان اشاره پاسخ دهند. این رویکرد در ادامهی تلاشهای گستردهتر برای یکپارچهسازی ابزارهای ارتباطی است، مشابه آنچه در ادغام ترجمه در هسته MeetOye برای حذف افزونههای خارجی شاهد بودیم.
این استقرار بخشی از استراتژی سختافزاری جدید گوگل برای اکوسیستم پیکسل است. همانطور که در تحلیل قبلی ما دربارهی بازگشت پیکسل ۱۱ پرو به مینیمالیسم در اعلانها اشاره کردیم، گوگل اکنون روی ادغام عمیق قابلیتهای دسترسیپذیری تمرکز کرده است. برای اکثر کاربران، این قابلیت شبیه به داشتن یک مترجم همزمان است که در کیبورد آنها تعبیه شده و یک زبان بصری را فوراً به متن دیجیتال تبدیل میکند.
معماری فنی و حریم خصوصی
برای محافظت از حریم خصوصی، این سامانه ویدیوهای خام را پردازش نمیکند. بر اساس مستندات فنی، یک مدل دروندستگاهی به نام MediaPipe Holistic، تعداد ۱۳۰ نقطه کلیدی روی صورت، بدن و دستها را فریمبهفریم ردیابی میکند. تنها این مختصات هندسی برای ترجمه ارسال میشوند و فید دوربین بلافاصله حذف میشود.
مدل SL2T برخلاف سیستمهای قدیمی که بر پایه «گلاسها» (Glosses) — یعنی برچسبهای ثابت برای هر اشاره — بودند، متن انگلیسی را بهطور مستقیم تولید میکند. این تغییر معماری اجازه میدهد تا نشانگرهای غیردستی و ساختارهای فضایی که معنای دستوری دارند و پیش از این در سیستمهای مبتنی بر برچسب از بین میرفتند، حفظ شوند. حذف این گلوگاه باعث میشود کیفیت ترجمه با افزایش دادههای آموزشی رشد کند، نه با ساخت دستی مجموعههای برچسب. این گذار از ترجمه لغوی به درک زمینهای، یادآور نوآوریهای Li Translate در نجات زیرنویسهای هوش مصنوعی از ترجمه لغوی است.
چالشهای ترجمه و بنچمارکها
زبانهای اشاره، زبانهای طبیعی مستقلی با دستور زبان خاص خود هستند و صرفاً نسخهای اشارهای از زبان انگلیسی نیستند. به همین دلیل، SL2T یک مسئلهٔ ترکیبی از ترجمه ماشینی و بینایی ماشین پیچیده است. مدل باید حرکت همزمان سر، صورت، تنه و دستها را با نرخ فریم بالا ردیابی کند. گوگل اشاره کرده است که تلاشهای قبلی، مانند دستکشهای حسگر، در پاسخ به این نیازهای خاص شکست خورده بودند.
به نقل از گوگل، مدل SL2T روی بیش از ۱۰۰ هزار ساعت داده از ۵۰ زبان اشاره آموزش دیده است که حدود یکچهارم آن مربوط به ASL است. آموزش مشترک روی زبانها، گویشها و سطوح مختلف مهارت، مدلی ایجاد کرده است که از سیستمهای تکزبانه برتر است. نتایج ارائه شده توسط شرکت به شرح زیر است:
- FLEURS-ASL: امتیاز ۷۰ BLEURT در حالت صفر-شات (Zero-shot) برای زبانهای پیچیده و انتزاعی که توسط مترجمان ناشنوای دارای گواهینامه ضبط شده است.
- PRESTO-ASL: امتیاز ۸۵ BLEURT برای عبارات سبک دستیار صوتی که به یک تبلت متصل (Docked) اشاره شدهاند.
- FSboard: صحت ۶۴٪ در تطابق دقیق برای هجی کردن انگشتی (Fingerspelling) روی موبایل.
- نسخه تکدستی: امتیاز ۷۴ BLEURT در محک FLEURS-ASL.
محدودیتها و حاکمیت
با وجود پیشرفتها، مدل هنوز دچار خطاهای خاصی میشود. برای مثال، گاهی اشارههای نادر را اشتباه ترجمه میکند (مانند ترجمه کلمه "prey" به "grey" در عبارت "bird of prey") یا وقتی شخص دومی وارد کادر میشود یا اشارهکننده مکث میکند، دچار توهم (Hallucination) میشود. همچنین ممکن است ساختارهای مجهول یا توصیفات طبقهبندیکننده (Classifier depictions) را حذف کند یا در صورت نبود زمینه، زمان فعل را گم کند.
محدودیتهای فنی شامل موارد زیر است:
- محیطی: دقت در نور کم، نور پسزمینه شدید یا زمانی که رنگ لباس تداخل بصری با پوست ایجاد کند، کاهش مییابد.
- موقعیتی: عملکرد در زوایای شدید دوربین یا زمانی که اشارهکننده به صورت خوابیده باشد، افت میکند.
- ظرفیتی: ردیاب وضعیت تنها بزرگترین سوژه در کادر را دنبال میکند و نمیتواند چندین اشارهکننده را مدیریت کند.
- زمانی: کلیپهای ورودی به ۶۰ ثانیه محدود شدهاند و بهطور مستقل ترجمه میشوند و حافظهای از نوبتهای قبلی گفتگو ندارند.
- دموگرافیک: مدل روی اشارهکنندگان زیر ۱۸ سال آموزش ندیده و ارزیابی نشده است.
به دلیل این ریسکها، گوگل «کمیته مشورتی زبان اشاره هوش مصنوعی» را با حضور انجمن ملی ناشنوایان (NAD)، فدراسیون جهانی ناشنوایان، شبکه هنرهای حرفهای ناشنوایان و مؤسسه ملی فنی ناشنوایان RIT تشکیل داد. این کمیته در گزارش اثرگذاری خود، استفاده از این ابزار را در محیطهای حساس مانند معاینات پزشکی، جلسات دادگاه، تعاملات پلیسی، آموزشهای کلاسی، مصاحبههای شغلی و تعیین مزایای دولتی بهطور صریح ممنوع کرده است.
تحلیل میدانی
برای جامعهٔ یادگیری ماشین، SL2T نشاندهندهٔ چرخش از نگاه به زبان اشاره بهعنوان توکنهای مجزا به سمت یک مسئلهٔ ترجمهٔ چندوجهی (Multimodal) پیوسته است. گوگل ثابت کرد که کیفیت ترجمه میتواند با دادههای خام مقیاسپذیر شود، نه با برچسبهای زبانی دستساز.
با این حال، تکیه بر «انسان در حلقه» (Human-in-the-loop) برای ویرایش متن، پیشفرض گرفتن سواد انگلیسی کاربر است که ممکن است کاربرد ابزار را برای برخی محدود کند. هر دو برنامه پیشنمایشی از متن را برای بررسی قبل از ارسال نشان میدهند و در Live Transcribe، کاربر ناشنوا کنترل میکند که چه زمانی متن به طرف مقابل نمایش داده شود. گزارش همچنین تصریح میکند که این ابزار تعهدات قانونی برای تسهیلات معقول تحت قانون ADA را برآورده نمیکند و نباید جایگزین مترجمان انسانی رسمی شود.
انتقال به استخراج مختصات دروندستگاهی، استاندارد بالایی برای هوش مصنوعی حافظ حریم خصوصی در زمینههای حساس بیومتریک تعیین میکند. این پروژه با ابتکار «سم سپاه»، یکی از کارکنان ناشنوای گوگل آغاز شد تا اطمینان حاصل شود که دیدگاههای جامعه ناشنوایان در جمعآوری دادهها و ارزیابیها ادغام شده است.
نقشه راه گوگل شامل افزودن علائم نگارشی، ایموجیها، خطوط جدید و دستورات ویرایشی پایه، و همچنین حافظهٔ گفتگو در کلیپهای متوالی در Live Transcribe است. تحقیقات بلندمدت اکنون روی حساسیت بیشتر به موقعیت ابروها و حالات صورت، پشتیبانی از چندین اشارهکننده و گسترش جمعآوری دادهها برای گویشهای منطقهای ASL و ASL سیاهپوستان متمرکز شده است.
کاربران میتوانند انتظار داشته باشند که این ویژگی بدون هزینه اضافی روی پیکسل ۱۱ عرضه شود و سپس برای دستگاههای گستردهتری منتشر گردد.
گام بعدی شما
- اگر توسعهدهنده هستید، مستندات MediaPipe Holistic را برای درک نحوه استخراج مختصات بدون ذخیره ویدیو بررسی کنید.
- در صورت دسترسی به پیکسل ۱۱، دقت مدل را در محیطهای با نور متفاوت تست کنید تا نقاط شکست آن را بشناسید.
- برای کاربردهای دسترسیپذیری، تفاوت بین ترجمه مستقیم و سیستمهای مبتنی بر برچسب (Gloss-based) را مطالعه کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای NPU جدید گوگل مراجعه کنید.




گفتگو