پرش به محتوای اصلی
پرش به محتوای مقاله

«حفظ حریم خصوصی»؛ اولویت دیپ‌مایند در ترجمهٔ زبان اشاره در Gboard

·۲۱ مرداد ۱۴۰۵۵ دقیقه مطالعه۲ بازدید
مترجم زبان اشاره گوگل دیپ‌مایند برای گوشی‌های هوشمند
مترجم زبان اشاره گوگل دیپ‌مایند برای گوشی‌های هوشمند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نخستین استقرار تجاری مدل ترجمه زبان اشاره در یک گوشی هوشمند که به‌جای پردازش ویدیو، از ردیابی مختصات هندسی برای حفظ حریم خصوصی استفاده می‌کند.

تصور کنید به جای تایپ کردن، تنها با تکان دادن دست‌ها در برابر دوربین گوشی، پیام‌های خود را بنویسید یا با هوش مصنوعی گفتگو کنید. این قابلیت که پیش از این در حد آزمایشگاه بود، حالا با مدل SL2T گوگل دیپ‌مایند به یک ویژگی تجاری در گوشی‌های هوشمند تبدیل شده است. تسترهای گوگل دریافته‌اند که «اشاره کردن به زبان ASL سریع‌تر و طبیعی‌تر از تایپ کردن به زبان انگلیسی است». این یافته بر تأثیر مدل SL2T تأکید می‌کند؛ اولین هوش مصنوعی تبدیل زبان اشاره به متن که به یک ویژگی کاربردی در گوشی‌های مصرف‌کننده تبدیل شده است.

طبق اعلام گوگل، این ابزار از ۱۲ اوت ۲۰۲۶ روی گوشی‌های پیکسل ۱۱ (Pixel 11) عرضه می‌شود و به کاربران ناشنوا اجازه می‌دهد جست‌وجوهای وب، پیام‌ها و پرس‌وجوهای جمینای (Gemini) را از طریق دوربین دیکته کنند. این فناوری در دو برنامهٔ Gboard و Live Transcribe فعال شده است تا کاربران بتوانند در گفتگوهای متقابل، به‌جای تایپ کردن و ارسال پیام‌های متوالی، از طریق زبان اشاره پاسخ دهند. این رویکرد در ادامه‌ی تلاش‌های گسترده‌تر برای یکپارچه‌سازی ابزارهای ارتباطی است، مشابه آنچه در ادغام ترجمه در هسته MeetOye برای حذف افزونه‌های خارجی شاهد بودیم.

این استقرار بخشی از استراتژی سخت‌افزاری جدید گوگل برای اکوسیستم پیکسل است. همان‌طور که در تحلیل قبلی ما درباره‌ی بازگشت پیکسل ۱۱ پرو به مینیمالیسم در اعلان‌ها اشاره کردیم، گوگل اکنون روی ادغام عمیق قابلیت‌های دسترسی‌پذیری تمرکز کرده است. برای اکثر کاربران، این قابلیت شبیه به داشتن یک مترجم هم‌زمان است که در کیبورد آن‌ها تعبیه شده و یک زبان بصری را فوراً به متن دیجیتال تبدیل می‌کند.

معماری فنی و حریم خصوصی

برای محافظت از حریم خصوصی، این سامانه ویدیوهای خام را پردازش نمی‌کند. بر اساس مستندات فنی، یک مدل درون‌دستگاهی به نام MediaPipe Holistic، تعداد ۱۳۰ نقطه کلیدی روی صورت، بدن و دست‌ها را فریم‌به‌فریم ردیابی می‌کند. تنها این مختصات هندسی برای ترجمه ارسال می‌شوند و فید دوربین بلافاصله حذف می‌شود.

مدل SL2T برخلاف سیستم‌های قدیمی که بر پایه «گلاس‌ها» (Glosses) — یعنی برچسب‌های ثابت برای هر اشاره — بودند، متن انگلیسی را به‌طور مستقیم تولید می‌کند. این تغییر معماری اجازه می‌دهد تا نشانگرهای غیردستی و ساختارهای فضایی که معنای دستوری دارند و پیش از این در سیستم‌های مبتنی بر برچسب از بین می‌رفتند، حفظ شوند. حذف این گلوگاه باعث می‌شود کیفیت ترجمه با افزایش داده‌های آموزشی رشد کند، نه با ساخت دستی مجموعه‌های برچسب. این گذار از ترجمه لغوی به درک زمینه‌ای، یادآور نوآوری‌های Li Translate در نجات زیرنویس‌های هوش مصنوعی از ترجمه لغوی است.

چالش‌های ترجمه و بنچمارک‌ها

زبان‌های اشاره، زبان‌های طبیعی مستقلی با دستور زبان خاص خود هستند و صرفاً نسخه‌ای اشاره‌ای از زبان انگلیسی نیستند. به همین دلیل، SL2T یک مسئلهٔ ترکیبی از ترجمه ماشینی و بینایی ماشین پیچیده است. مدل باید حرکت هم‌زمان سر، صورت، تنه و دست‌ها را با نرخ فریم بالا ردیابی کند. گوگل اشاره کرده است که تلاش‌های قبلی، مانند دستکش‌های حسگر، در پاسخ به این نیازهای خاص شکست خورده بودند.

به نقل از گوگل، مدل SL2T روی بیش از ۱۰۰ هزار ساعت داده از ۵۰ زبان اشاره آموزش دیده است که حدود یک‌چهارم آن مربوط به ASL است. آموزش مشترک روی زبان‌ها، گویش‌ها و سطوح مختلف مهارت، مدلی ایجاد کرده است که از سیستم‌های تک‌زبانه برتر است. نتایج ارائه شده توسط شرکت به شرح زیر است:

  • FLEURS-ASL: امتیاز ۷۰ BLEURT در حالت صفر-شات (Zero-shot) برای زبان‌های پیچیده و انتزاعی که توسط مترجمان ناشنوای دارای گواهینامه ضبط شده است.
  • PRESTO-ASL: امتیاز ۸۵ BLEURT برای عبارات سبک دستیار صوتی که به یک تبلت متصل (Docked) اشاره شده‌اند.
  • FSboard: صحت ۶۴٪ در تطابق دقیق برای هجی کردن انگشتی (Fingerspelling) روی موبایل.
  • نسخه تک‌دستی: امتیاز ۷۴ BLEURT در محک FLEURS-ASL.

محدودیت‌ها و حاکمیت

با وجود پیشرفت‌ها، مدل هنوز دچار خطاهای خاصی می‌شود. برای مثال، گاهی اشاره‌های نادر را اشتباه ترجمه می‌کند (مانند ترجمه کلمه "prey" به "grey" در عبارت "bird of prey") یا وقتی شخص دومی وارد کادر می‌شود یا اشاره‌کننده مکث می‌کند، دچار توهم (Hallucination) می‌شود. همچنین ممکن است ساختارهای مجهول یا توصیفات طبقه‌بندی‌کننده (Classifier depictions) را حذف کند یا در صورت نبود زمینه، زمان فعل را گم کند.

محدودیت‌های فنی شامل موارد زیر است:

  • محیطی: دقت در نور کم، نور پس‌زمینه شدید یا زمانی که رنگ لباس تداخل بصری با پوست ایجاد کند، کاهش می‌یابد.
  • موقعیتی: عملکرد در زوایای شدید دوربین یا زمانی که اشاره‌کننده به صورت خوابیده باشد، افت می‌کند.
  • ظرفیتی: ردیاب وضعیت تنها بزرگ‌ترین سوژه در کادر را دنبال می‌کند و نمی‌تواند چندین اشاره‌کننده را مدیریت کند.
  • زمانی: کلیپ‌های ورودی به ۶۰ ثانیه محدود شده‌اند و به‌طور مستقل ترجمه می‌شوند و حافظه‌ای از نوبت‌های قبلی گفتگو ندارند.
  • دموگرافیک: مدل روی اشاره‌کنندگان زیر ۱۸ سال آموزش ندیده و ارزیابی نشده است.

به دلیل این ریسک‌ها، گوگل «کمیته مشورتی زبان اشاره هوش مصنوعی» را با حضور انجمن ملی ناشنوایان (NAD)، فدراسیون جهانی ناشنوایان، شبکه هنرهای حرفه‌ای ناشنوایان و مؤسسه ملی فنی ناشنوایان RIT تشکیل داد. این کمیته در گزارش اثرگذاری خود، استفاده از این ابزار را در محیط‌های حساس مانند معاینات پزشکی، جلسات دادگاه، تعاملات پلیسی، آموزش‌های کلاسی، مصاحبه‌های شغلی و تعیین مزایای دولتی به‌طور صریح ممنوع کرده است.

تحلیل میدانی

برای جامعهٔ یادگیری ماشین، SL2T نشان‌دهندهٔ چرخش از نگاه به زبان اشاره به‌عنوان توکن‌های مجزا به سمت یک مسئلهٔ ترجمهٔ چندوجهی (Multimodal) پیوسته است. گوگل ثابت کرد که کیفیت ترجمه می‌تواند با داده‌های خام مقیاس‌پذیر شود، نه با برچسب‌های زبانی دست‌ساز.

با این حال، تکیه بر «انسان در حلقه» (Human-in-the-loop) برای ویرایش متن، پیش‌فرض گرفتن سواد انگلیسی کاربر است که ممکن است کاربرد ابزار را برای برخی محدود کند. هر دو برنامه پیش‌نمایشی از متن را برای بررسی قبل از ارسال نشان می‌دهند و در Live Transcribe، کاربر ناشنوا کنترل می‌کند که چه زمانی متن به طرف مقابل نمایش داده شود. گزارش همچنین تصریح می‌کند که این ابزار تعهدات قانونی برای تسهیلات معقول تحت قانون ADA را برآورده نمی‌کند و نباید جایگزین مترجمان انسانی رسمی شود.

انتقال به استخراج مختصات درون‌دستگاهی، استاندارد بالایی برای هوش مصنوعی حافظ حریم خصوصی در زمینه‌های حساس بیومتریک تعیین می‌کند. این پروژه با ابتکار «سم سپاه»، یکی از کارکنان ناشنوای گوگل آغاز شد تا اطمینان حاصل شود که دیدگاه‌های جامعه ناشنوایان در جمع‌آوری داده‌ها و ارزیابی‌ها ادغام شده است.

نقشه راه گوگل شامل افزودن علائم نگارشی، ایموجی‌ها، خطوط جدید و دستورات ویرایشی پایه، و همچنین حافظهٔ گفتگو در کلیپ‌های متوالی در Live Transcribe است. تحقیقات بلندمدت اکنون روی حساسیت بیشتر به موقعیت ابروها و حالات صورت، پشتیبانی از چندین اشاره‌کننده و گسترش جمع‌آوری داده‌ها برای گویش‌های منطقه‌ای ASL و ASL سیاه‌پوستان متمرکز شده است.

کاربران می‌توانند انتظار داشته باشند که این ویژگی بدون هزینه اضافی روی پیکسل ۱۱ عرضه شود و سپس برای دستگاه‌های گسترده‌تری منتشر گردد.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، مستندات MediaPipe Holistic را برای درک نحوه استخراج مختصات بدون ذخیره ویدیو بررسی کنید.
  • در صورت دسترسی به پیکسل ۱۱، دقت مدل را در محیط‌های با نور متفاوت تست کنید تا نقاط شکست آن را بشناسید.
  • برای کاربردهای دسترسی‌پذیری، تفاوت بین ترجمه مستقیم و سیستم‌های مبتنی بر برچسب (Gloss-based) را مطالعه کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های NPU جدید گوگل مراجعه کنید.

چرا این موضوع مهم است؟

این پروژه با تکیه بر تخصص اعضای جامعه ناشنوای گوگل، استانداردی جدید برای حریم خصوصی در داده‌های بیومتریک حساس ایجاد کرد. ادغام این فناوری در سطح سیستم‌عامل، دسترسی‌پذیری را از یک ویژگی جانبی به بخشی از تجربه هسته کاربر تبدیل می‌کند.

تأثیر برای ایران

به‌دلیل محدودیت‌های سخت‌افزاری و تحریم‌های گوگل، دسترسی به این قابلیت برای کاربران ایرانی تنها از طریق خرید دستگاه‌های پیکسل ۱۱ و احتمالاً با محدودیت‌های اکوسیستمی ممکن است.

·نگاه ما
تحریریه دات‌هوش

حذف لایه واسطه‌ای «گلاس‌ها» در SL2T، یک پیروزی برای رویکرد داده‌محور بر رویکرد قاعده‌مند در پردازش زبان‌های اشاره است. این مدل ثابت می‌کند که در ترجمه‌های پیچیده، تکیه بر الگوهای آماری در داده‌های حجیم، بسیار کارآمدتر از تعریف دستی قواعد زبانی است. با این حال، محدودیت ۶۰ ثانیه‌ای ورودی نشان می‌دهد که مدل هنوز از مدیریت بافت‌های زمانی طولانی در استنتاج‌های چندوجهی عاجز است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.