پرش به محتوای اصلی
پرش به محتوای مقاله

گوگل با Guided Vision اندروید را به چشم‌های مصنوعی تبدیل کرد

·۹ مهر ۱۴۰۵۴ دقیقه مطالعه
کاربر می‌خواهد یک ترجمه فارسی مختصر برای متن جایگزین تصویر (alt text) در مقاله‌ای با عنوان "Google Brings Real-Time Visual As
کاربر می‌خواهد یک ترجمه فارسی مختصر برای متن جایگزین تصویر (alt text) در مقاله‌ای با عنوان "Google Brings Real-Time Visual As
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر از شرح‌نویسی (Captioning) به راهنمایی فعال (Active Guidance)؛ مدل حالا به کاربر دستور می‌دهد دوربین را جابه‌جا کند تا بهترین زاویه دید را برای تحلیل به دست آورد.

تصور کنید یک کاربر نابینا بخواهد تکه کوچکی از یک هدفون را که روی زمین افتاده پیدا کند؛ حالا این درخواست با یک گفتگوی ساده با گوشی ممکن شده است. در ۱ اکتبر ۲۰۲۶، گوگل قابلیت Guided Vision را در Gemini Live عرضه کرد تا گوشی‌های اندرویدی را به شریکی بصری برای افرادی تبدیل کند که در خواندن برچسب‌های تغذیه در محیط‌های کم‌نور یا شناسایی اشیا مشکل دارند.

این به‌روزرسانی در حالی رخ می‌دهد که هوش مصنوعی از شرح‌نویسی ساده تصاویر به تعامل فعال و در لحظه با محیط تغییر مسیر داده است. این تحول در راستای استراتژی گسترده‌تر گوگل برای تبدیل تعاملات دیجیتال به تجربه‌های زنده است، همان‌طور که پیش‌تر جست‌وجوی گوگل را به یک گفتگوی زنده و چندوجهی تبدیل کرد تا دسترسی به اطلاعات سریع‌تر و طبیعی‌تر شود. همان‌طور که در تحلیل قبلی ما درباره‌ی دقت مدل‌های گوگل در پیش‌بینی‌های بهداشتی — مانند مدلی که در پیش‌بینی‌های بستری ناشی از آنفلوانزا توسط CDC رتبه اول را کسب کرد — اشاره کردیم، Guided Vision اکنون همان قدرت پیش‌بینی را در حوزه دسترسی‌پذیری فیزیکی به کار می‌گیرد. این ابزار برای کاربرانی که رابط‌های متنی استاندارد مبتنی بر صفحه نمایش برایشان غیرقابل استفاده است، یک پل ارتباطی می‌سازد.

به گزارش Unite.AI، این ویژگی برای دستگاه‌هایی با اندروید ۹ و بالاتر در مناطقی که Gemini Live پشتیبانی می‌شود، در دسترس است. سیستم با اشتراک‌گذاری زنده دوربین دستگاه در طول یک جلسه فعال، به هوش مصنوعی اجازه می‌دهد تا توصیفات صوتی و راهنمایی‌های پیش‌دستانه ارائه دهد.

زمینه و توسعه

گوگل نخستین بار در ۱ سپتامبر ۲۰۲۶ و در قالب Android Drop سپتامبر، پیش‌نمایشی از این قابلیت را ارائه کرد. در آن زمان، این ویژگی برای گوشی‌های اندروید ۹ به بالا در کشورهایی که Gemini در آن‌ها در دسترس است، با وضعیت «به‌زودی» لیست شده بود.

ایشا شث (Isha Sheth)، مدیر ارشد محصول Gemini Live، این ابزار را شریکی گفتگومحور می‌داند که به گونه‌ای طراحی شده تا با کمترین اصطکاک در روتین‌های روزانه جای بگیرد. فرآیند توسعه این ابزار شامل تست‌های گسترده و دریافت بازخوردهای مستقیم از جوامع نابینایان و کم‌بینایان در چندین منطقه جهانی، از جمله هند، برزیل، سنگاپور، اندونزی و ژاپن بوده است.

سالی خو (Sally Khoo)، معاون مدیر بخش نوآوری در SG Enable، اشاره کرد که چون گوشی‌های استاندارد برای کاربران بینا ساخته شده‌اند، ارائه توصیفات بصری در لحظه همراه با راهنمایی‌های پیش‌دستانه به پر کردن یک شکاف حیاتی در انجام کارهای روزمره کمک می‌کند. به همین ترتیب، پراشانت ورما از انجمن ملی نابینایان هند تأکید کرد که انجام تست‌ها روی زبان‌های مختلف هندی تضمین می‌کند که این فناوری کمک‌های عملی و قابل‌اعتمادی را ارائه دهد.

سازوکار فنی و آموزش

Guided Vision صرفاً آنچه را می‌بیند توصیف نمی‌کند، بلکه فعالانه کاربر را برای بهبود جریان بصری راهنمایی می‌کند. اگر کاربر دوربین را بیش از حد نزدیک، بیش از حد بالا یا کمی متمایل به یک طرف نگه دارد، Gemini دستورات زبانی طبیعی برای تغییر کادربندی ارائه می‌دهد. برای مثال، از کاربر می‌خواهد که دوربین را به آرامی به سمت راست پان کند، آن را به سمت پایین خم کند یا کمی به عقب برگردد تا هوش مصنوعی زمینه بصری شفافی که برای پاسخ دادن نیاز دارد، به دست آورد.

برای رسیدن به این سطح از درک متنی و گفتگویی، گوگل با شرکت Aira همکاری کرد و از ده‌ها هزار ساعت داده‌های تفسیر بصری بهره برد. این مدل در ادامه توسط بیش از ۱۰۰۰ عضو شبکه «تسترهای مورد اعتماد» (Trusted Tester) شرکت Aira بازبینی و اصلاح شد تا ایمنی و قابلیت اطمینان آن در روتین‌های روزانه تضمین شود. همچنین، متخصصان Aira به عنوان کارشناسان موضوعی مستقیماً با تیم‌های گوگل همکاری کردند تا حفاظ‌های ایمنی (Guardrails) را تدوین و ارزیابی کنند.

کاربردهای مستند

گوگل چندین مورد کاربردی را برجسته کرده است که در آن‌ها تأیید بصری سریع و دقیق حیاتی است:

  • متون ریز: خواندن برچسب‌های کوچک تغذیه روی بسته‌بندی مواد غذایی، خواندن درجه‌های روی دکمه‌های لوازم خانگی، تشخیص چرخه‌های ماشین لباس‌شویی و خواندن منوهای چاپی در رستوران‌هایی با نور کم.
  • مکان‌یابی اشیا: پیدا کردن ظرف فلفل سیاه در یک کابینت ادویه شلوغ یا یافتن یک هدفون که روی زمین افتاده است.
  • تطبیق بصری: شناسایی رنگ‌ها، الگوها و اشکال؛ به عنوان مثال، بررسی اینکه آیا یک پیراهن راه-راه با یک شلوار خاص ست است یا شناسایی رنگ یک ژاکت مشخص.
  • نمای کلی محیط: ارائه توصیفات کلی از فضاهای ناشناخته، چیدمان اتاق‌ها یا شناسایی اشیایی که در طرف دیگر میز قرار دارند.

دسترسی و حفاظ‌های ایمنی

کاربران می‌توانند از سه مسیر اصلی این قابلیت را فعال کنند:

  • اپلیکیشن Gemini: کاربران وارد تنظیمات پروفایل شده، گزینه «Use Guided Vision in Live» را فعال می‌کنند و سپس در Gemini Live روی گزینه اشتراک‌گذاری دوربین ضربه می‌زنند.
  • میان‌بر دسترسی اندروید: این گزینه در مسیر Settings > Accessibility > Vision assistance قرار دارد. این قابلیت را می‌توان از طریق یک دکمه شناور دسترسی‌پذیری، ژست لمسی با دو انگشت یا با فشردن همزمان هر دو کلید تغییر صدا فعال کرد.
  • Google TalkBack: کاربران می‌توانند با ضربه سه انگشتی منوی TalkBack را باز کرده و Guided Vision را مستقیماً انتخاب کنند.

با این حال، گوگل صراحتاً اعلام کرده است که Guided Vision یک ابزار کمکی است و نه یک دستگاه پزشکی. این شرکت هشدار داده که این ابزار جایگزین عصای سفید یا وسایل کمکی جابه‌جایی نیست و نباید برای مسیریابی، راهنمایی در سفرهای ایمن یا تشخیص موانع محیطی استفاده شود. به کاربران توصیه شده است که همچنان به وسایل کمکی جابه‌جایی تثبیت‌شده و روش‌های ایمن سفر تکیه کنند.

برای کاربر عادی، این یک تغییر در تعریف «دوربین» در گوشی است. دوربین دیگر فقط ابزاری برای ثبت خاطرات نیست، بلکه یک افزونه حسی است که دنیای فیزیکی را در لحظه به صدا ترجمه می‌کند. این قابلیت همچنین برای سالمندان و افرادی با سواد پایین گسترش می‌یابد و راهی با اصطکاک کم برای تعامل با دنیایی فراهم می‌کند که اساساً برای بینایان طراحی شده است.

در آینده باید منتظر بود و دید که چگونه این ادغام بازخوردهای چندوجهی زنده بر نسل بعدی عینک‌های هوش مصنوعی پوشیدنی تأثیر می‌گذارد؛ جایی که دستورات «تغییر کادربندی» (reframe) می‌تواند توسط گیمبال‌های خودکار دوربین اجرا شود.

چرا این موضوع مهم است؟

این ابزار با تکیه بر تخصص شرکت Aira در تفسیر بصری، استقلال روزمره میلیون‌ها کاربر را افزایش می‌دهد. تبدیل دوربین به یک حس جایگزین، مرز بین سخت‌افزار موبایل و پروتزهای عصبی را کمرنگ‌تر می‌کند.

تأثیر برای ایران

به‌دلیل محدودیت‌های منطقه‌ای Gemini Live، دسترسی مستقیم کاربران ایرانی به این قابلیت در حال حاضر محدود است و نیاز به تغییر آی‌پی و حساب کاربری دارد.

·نگاه ما
تحریریه دات‌هوش

تغییر رویکرد گوگل از توصیف ایستا به راهنمایی پویا، نشان می‌دهد که مدل‌های بینایی-زبانی در حال تبدیل شدن به «عامل‌های محیطی» هستند. این یعنی AI دیگر فقط مشاهده‌گر نیست، بلکه فعالانه سعی می‌کند کیفیت ورودی را برای رسیدن به پاسخ دقیق‌تر مدیریت کند. این الگو احتمالاً به استانداردی برای تمام ابزارهای کمکی تبدیل خواهد شد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.