پرش به محتوای اصلی
پرش به محتوای مقاله

تغییر رنگ متن، استدلال مدل‌های بینایی-زبانی را به مسیر اشتباه می‌برد

·۲۶ مرداد ۱۴۰۵۱۰ دقیقه مطالعه۳ بازدید
تغییر رنگ فونت می‌تواند استدلال هوش مصنوعی را مختل کند
تغییر رنگ فونت می‌تواند استدلال هوش مصنوعی را مختل کند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کشف مکانیزم «پرامپت‌های بصری مخفی» که ثابت می‌کند تغییر رنگ و کنتراست می‌تواند بازنمایی‌های معنایی (Embeddings) را در لایه‌های اولیه رمزگذار بینایی تحریف کند، نه فقط در خروجی نهایی.

تغییر رنگ یک کلمه از سیاه به سبز می‌تواند یک مدل بینایی-زبانی (Vision Language Model - VLM) را فریب دهد تا یک حس منفی را مثبت تفسیر کند. این یافته که در ۱۷ اوت ۲۰۲۶ منتشر شد، نشان می‌دهد که استایل‌های بصری سطح پایین می‌توانند بازنمایی‌های معنایی داخلی هوش مصنوعی را به تسخیر خود درآورند و عملاً محتوای متنی را نادیده بگیرند. مطالعه‌ای با عنوان «قرمز دیدن، بد فکر کردن: سوگیری رنگ در مدل‌های بینایی-زبانی» ثابت می‌کند که فرمت‌های ساده بصری می‌توانند به‌طور نامحسوس استدلال هوش مصنوعی را تغییر دهند. این اتفاق باعث می‌شود مدل کلمات را نادیده بگیرد، معنا را اشتباه بخواند و بدون تغییر در خودِ متن، به نتایج متفاوتی برسد.

این آسیب‌پذیری در زمانی رخ می‌دهد که کسب‌وکارها و بازیگران بدخواه به‌دنبال راه‌هایی برای فریب دادن موتورهای جست‌وجوی هوش مصنوعی و خزنده‌های وب هستند. انسان‌ها به‌طور فرهنگی شرطی شده‌اند که رنگ قرمز را با خطر و سبز را با ایمنی مرتبط بدانند؛ این تصورات غربی حتی در VLMهای آسیایی نیز به دلایل استراتژیک یا تصادفی غالب هستند. این پژوهش ثابت می‌کند که VLMها این سوگیری‌ها را تا حدی درونی کرده‌اند که امکان دستکاری خاموش فراهم شده است. همان‌طور که رنگ‌آمیزی چیزهای «بد» با رنگ‌های مثبت باعث واکنش متفاوت انسان‌ها می‌شود، همین امر در مورد هوش مصنوعی نیز صدق می‌کند. پژوهشگران خاطرنشان می‌کنند که تغییرات در روشنایی و کنتراست نیز واکنش‌های مشابه انسانی را تحریک می‌کند و کار آن‌ها بررسی می‌کند که این موضوع تا چه حد در مورد مدل‌های AI صدق می‌کند. این چالش‌ها در کنار ضعف مدل‌های پیشرو در مهارت‌های بصری پایه نشان می‌دهد که درک بصری AI هنوز با استانداردهای انسانی فاصله دارد.

تصور کنید شرکتی نسخه‌ای «مخفی» از وب‌سایت خود را برای خزنده‌های هوش مصنوعی ارائه دهد. مجله تایم پیش از این شروع به قرار دادن تبلیغاتی در نسخه‌های مخفی سایت خود کرده است که فقط برای خزنده‌های AI که در جست‌وجوی داده هستند قابل مشاهده است. این کار به تبلیغ‌کنندگان اجازه می‌دهد تا جایگاه برجسته‌تر یا دیدگاه مثبت‌تری در پاسخ‌های AI خریداری کنند. با استفاده از CSS، شرکت‌ها می‌توانند عبارات منفی را با رنگ‌های مثبت نمایش دهند؛ متنی که برای انسان سیاه و عادی است اما برای AI مثبت به نظر می‌رسد. برای مثال، شرکتی که کارخانه‌ای آلوده‌کننده می‌سازد و کیفیت آب محلی را کاهش می‌دهد، می‌تواند برای منحرف کردن اخبار منفی، از کدگذاری رنگی در واژگان تبلیغاتی بیانیه‌های مطبوعاتی خود استفاده کند.

مکانیزم «پرامپت‌های بصری مخفی»

پژوهشگران از مؤسسه ملی علوم و فناوری صنعتی پیشرفته (AIST)، دانشگاه تسوکوبا، دانشگاه فناوری نورنبرگ و دانشگاه آکسفورد برای آزمایش این فرضیه، «پرامپت‌های بصری مخفی» (Stealth Visual Prompts) را توسعه دادند. این‌ها تغییرات ساده‌ای در فرمت متن هستند که هیچ دستور صریحی ندارند اما استدلال مدل را تغییر می‌دهند. این کار می‌تواند به سادگی تغییر رنگ کلمات مثبت یا منفی، یا برجسته‌تر کردن یک پاسخ غلط نسبت به پاسخ درست باشد.

تغییر رنگ فونت می‌تواند استدلال هوش مصنوعی را مختل کند

نویسندگان مقاله بیان می‌کنند: «آزمایش‌های ما تحلیلی سیستماتیک از این موضوع ارائه می‌دهد که چگونه استایل بصری سطح پایین، بازنمایی‌های معنایی را در رمزگذار بینایی (Vision Encoder) یک VLM تحریف می‌کند. علاوه بر این، ما بررسی می‌کنیم که چگونه این جابه‌جایی‌ها در فضای نهان، به صورت تغییرات رفتاری در VLMهای سرتاسری (End-to-End) در هر دو وظیفه ذهنی (تحلیل حس) و عینی (پاسخ به سؤالات) ظاهر می‌شوند.»

تیم تحقیق از یک بوم استاندارد ۸۰۰ در ۶۰۰ پیکسل با چیدمان ثابت استفاده کرد تا اطمینان حاصل شود که تنها استایل بصری تغییر می‌کند. رنگ و کنتراست به‌طور مستقل دستکاری شدند: تست رنگ بر تداعی‌های معنایی آموخته‌شده متمرکز بود، در حالی که تست کنتراست بر برجستگی بصری تمرکز داشت. آن‌ها سه مجموعه داده برای جداسازی اثرات بصری بر استدلال به کار بردند:

  • مجموعه تحلیل حس جملات کوتاه: ۱۰۰ جمله کوتاه که از قالب‌های خنثی حاوی کلمات مثبت یا منفی تولید شده بودند. هر جمله در ۳۷ نسخه بصری رندر شد، شامل یک خط پایه با متن سیاه به علاوه ترکیباتی از شش رنگ (قرمز، سبز، آبی، زرد، سایان و ارغوانی) در سه سطح شدت.
  • مجموعه تحلیل حس جملات بلند: قطعات متنی طولانی‌تر که در آن زبان مثبت و منفی در بخش‌های مختلف متن جدا شده بود. این آزمایش برای تعیین این بود که آیا ساختار گسترده‌تر سند و اثرات موقعیتی، مانند اثر تقدم (Primacy) یا اثر تازگی (Recency) - جایی که اطلاعات در ابتدا یا انتهای متن وزن بیشتری دارند - بر سوگیری ناشی از رنگ غلبه می‌کند یا خیر. همان ۳۷ شرط رنگی در اینجا نیز اعمال شد.
  • مجموعه Stealth VQA: وظایف پرسش‌وپاسخ تصویری (Visual Question Answering - VQA) که از جفت‌های سؤال-متن مجموعه داده SQuAD استفاده می‌کرد. این بخش کنتراست و برجستگی را با رندر کردن متن به صورت تصویر و دستکاری قابلیت مشاهده آزمایش کرد. در تنظیمات «رقابت برجستگی»، پاسخ‌های نادرست به‌طور بصری برجسته‌تر از پاسخ‌های درست طراحی شدند.

تغییر رنگ فونت می‌تواند استدلال هوش مصنوعی را مختل کند

حساسیت مدل‌ها و داده‌ها

در این مطالعه چهار مدل با وزن‌های باز (Open Weights) ارزیابی شدند: LLaVA-v1.6-Mistral-7B، LLaVA-v1.6-Vicuna-7B، Qwen2-VL-7B-Instruct و IDEFICS2-8B. مدل‌های متن‌باز برای تضمین تکرارپذیری تحت پرامپت‌های ثابت، تنظیمات رندرینگ و رمزگشایی قطعی (Deterministic Decoding) انتخاب شدند.

بر اساس نتایج، مدل Qwen2-VL-7B آسیب‌پذیرترین مدل بود و محدوده کلی (Total Range) تغییر حس ۰.۹۰ را نشان داد. این مدل وقتی کلمات مثبت سبز یا آبی بودند، سوگیری مثبت شدیدی (تا +۰.۴۲) و وقتی کلمات منفی قرمز بودند، سوگیری منفی شدیدی (تا -۰.۴۸) داشت.

تغییر رنگ فونت می‌تواند استدلال هوش مصنوعی را مختل کند

در مقابل، نسخه‌های LLaVA بسیار مقاوم‌تر بودند و محدوده تغییر حس آن‌ها بین ۰.۰۴ و ۰.۱۲ بود که نشان‌دهنده حساسیت کمتر به استایل رنگی در سطح کلمه است. مدل IDEFICS2-8B با محدوده ۰.۵۲ در جایگاهی میانی قرار گرفت. پژوهشگران اشاره کردند که طیف واضحی از حساسیت وجود دارد و شدت بیشتر رنگ عموماً این اثرات را تقویت می‌کند.

تغییر رنگ فونت می‌تواند استدلال هوش مصنوعی را مختل کند

نقش ساختار سند

در بررسی متون بلندتر، مشخص شد که ساختار سند اغلب بر نشانه‌های رنگی غلبه می‌کند. آزمایش‌ها اندازه‌گیری کردند که آیا مدل‌ها به ابتدای متن (Primacy) یا انتهای آن (Recency) تکیه می‌کنند:

  • سوگیری تازگی (Recency): مدل‌های Qwen2-VL-7B و LLaVA-Mistral-7B نیمه دوم متن را ترجیح دادند.
  • سوگیری تقدم (Primacy): مدل‌های IDEFICS2-8B و LLaVA-Vicuna-7B بیشتر به نیمه اول تکیه کردند.

تغییر رنگ فونت می‌تواند استدلال هوش مصنوعی را مختل کند

با وجود این استراتژی‌های موقعیتی، رنگ همچنان بر برخی مدل‌ها، به‌ویژه IDEFICS2-8B، اثرگذار بود، هرچند تأثیر آن در متون ساختاریافته در مقایسه با تست‌های جملات کوتاه کمتر شد.

تغییرات معنایی داخلی

برای درک علت این اتفاق، تیم از یک کاوشگر بازنمایی CLIP استفاده کرد تا اندازه‌گیری کند رنگ چگونه بازنمایی معنایی یک کلمه را در فضای جاسازی (Embedding Space) مدل CLIP تغییر می‌دهد. آن‌ها دریافتند که تغییر رنگ یک کلمه به‌طور مداوم بازنمایی معنایی آن را در چندین بعد مفهومی جابه‌جا می‌کند: ایمنی، ظرفیت احساسی (Valence)، دما و عاطفه.

به عنوان مثال، نمایش کلمه «بد» (bad) به رنگ سبز، بازنمایی داخلی آن را به سمت تفسیری مثبت‌تر سوق داد، در حالی که متن بدون تغییر باقی مانده بود. بزرگ‌ترین تغییرات در محور «خوب» در برابر «بد» مشاهده شد. در حالی که رنگ سبز معنا را در جهت مثبت حرکت داد، رنگ آبی تمایل داشت آن را در جهت مخالف جابه‌جا کند. جابه‌جایی‌های کوچک‌تر اما مداومی نیز برای عاطفه، ایمنی و دما مشاهده شد.

این موضوع ثابت می‌کند که سوگیری تنها یک خطای لایه نهایی نیست، بلکه تحریفی در نحوه درک معنا توسط رمزگذار بینایی است. الگوهای مشاهده شده در داخل CLIP به‌طور نزدیکی با تغییرات حس ناشی از رنگ در آزمایش‌های VLM سرتاسری مطابقت داشت، اگرچه CLIP تنها برای بررسی بازنمایی‌های داخلی استفاده شد و نه برای توضیح کامل مکانیزم هر VLM.

رقابت کنتراست و برجستگی

علاوه بر رنگ، پژوهشگران بررسی کردند که آیا تغییر کنتراست متن می‌تواند VLMها را در وظایف پرسش‌وپاسخ تصویری (VQA) گمراه کند. آن‌ها دو حالت مبتنی بر کنتراست را آزمایش کردند:

  • کنتراست کلی: خوانایی کل سند با رندر کردن آن در سطوح کنتراست به‌تدریج پایین‌تر، کاهش یافت.
  • رقابت برجستگی (Saliency Competition): یک پاسخ درست یا یک کلمه «طعمه» (Decoy) که از نظر معنایی مشابه بود (با استفاده از شباهت CLIP انتخاب شده بود) با کنتراست سیاه بالا رندر شد، در حالی که بقیه متن کمرنگ شده بود.

تغییر رنگ فونت می‌تواند استدلال هوش مصنوعی را مختل کند

برجسته کردن پاسخ درست به‌طور مداوم باعث افزایش امتیازات F1 شد، اما برجسته کردن طعمه‌ها به‌طور قابل‌توجهی صحت پاسخ‌ها را کاهش داد. پژوهشگران معیار نرخ خطای القایی (Induced Error Rate - IER) را معرفی کردند تا اندازه‌گیری کنند هر چند وقت یک پاسخ طعمه بصری برجسته به‌جای پاسخ درست انتخاب می‌شود، زمانی که قابلیت مشاهده متن کاهش یافته است.

تغییر رنگ فونت می‌تواند استدلال هوش مصنوعی را مختل کند

با سخت‌تر شدن خواندن متن (کنتراست کمتر)، نرخ IER در اکثر مدل‌ها افزایش یافت. جالب اینجاست که Qwen2-VL-7B در برابر این ترفند خاص کنتراتی مقاوم‌تر از سایر مدل‌ها بود. برای تخمین نقطه‌ای که متن عملاً غیرقابل خواندن می‌شود، تیم از یک پروکسی OCR مبتنی بر VLM استفاده کرد.

تحلیل: سطح حمله جدید

برای جامعه فنی، این پژوهش درک ما از استواری VLMها را تغییر می‌دهد. این ثابت می‌کند که «متن-به‌مثابه-تصویر» یک رسانه خنثی نیست؛ بلکه رندر بصری خود یک پرامپت است که می‌تواند با محتوای معنایی تضاد داشته باشد. نویسندگان بیان می‌کنند: «این نتایج نشان می‌دهد که استایل بصری یک آسیب‌پذیری بحرانی و پیش‌تر بررسی‌نشده را در VLMها آشکار می‌کند و ما پیامدهای آن را برای استواری و ایمنی خط لوله‌های VLM مورد بحث قرار می‌دهیم.»

این موضوع یک حفره خطرناک برای سئو (SEO) و دستکاری رسانه‌ای ایجاد می‌کند. از آنجایی که بحث‌های انسانی در ردیت (Reddit) برای به‌روز نگه داشتن دانش AI حیاتی است، این پلتفرم به هدف اصلی کسانی تبدیل شده که می‌خواهند بر LLMها تأثیر بگذارند و راهنماهایی برای «بازی دادن» این پلتفرم ظاهر شده است. به همین ترتیب، ترفند قدیمی گنجاندن متن مخفی برای ماشین‌ها - برای بردن در مسابقات آکادمیک یا تأثیر بر نتایج امتحانات - اکنون با دستکاری بصری همراه شده است. این نوع رفتارهای فریبنده یادآور ابزارهای شناسایی تمایل مدل‌ها به فریب مدل پاداش است که نشان می‌دهد مدل‌ها چگونه می‌توانند برای رسیدن به هدف، مسیرهای غیرمنتظره‌ای را انتخاب کنند.

اگر یک خزنده وب CSS را رندر کند، مهاجم می‌تواند از «شیت‌های استایل مخصوص AI» استفاده کند تا تأکیدات رنگی ایجاد کند که برای انسان‌ها (که فقط متن سیاه می‌بینند) مخفی است، اما تحلیل حس AI را هدایت می‌کند. این آسیب‌پذیری به‌ویژه برای خط لوله‌های VLM که اسکرین‌شات‌های UI یا اسناد رسمی را دریافت می‌کنند، بحرانی است. یک PDF ساده یا اسکن یک اثر قدیمی که در مخازن قابل اعتمادی مانند آرشیو اینترنت آپلود شده است، می‌تواند حاوی استایل‌های خصمانه‌ای باشد که تصمیم مدل درباره یک درخواست وام یا یک خلاصه حقوقی را بدون تغییر در یک کلمه از متن، تغییر دهد.

استراتژی‌های کاهش ریسک

نویسندگان بیان می‌کنند که این حساسیت‌ها به معنای ریسک در قابلیت اطمینان و ایمنی است. برای ایمن‌سازی خط لوله‌های VLM، آن‌ها سه راهکار عملی پیشنهاد می‌کنند:

۱. نرمال‌سازی متن: تبدیل متن رندر شده به یک فرمت استاندارد پیش از استنتاج (Inference) برای حذف اثر استایل.
۲. تأیید متقاطع با OCR: مقایسه پاسخ‌های مبتنی بر تصویر با متنی که از طریق نویسه‌خوانی نوری (OCR) استخراج شده است تا تناقضات شناسایی شوند.
۳. بررسی تغییرناپذیری استایل: افزودن تست‌هایی به مجموعه‌های ارزیابی برای اطمینان از اینکه مدل فارغ از رنگ یا کنتراست، به نتیجه یکسانی می‌رسد.

منتظر ظهور ابزارهای «تزریق پرامپت بصری» در گیت‌هاب باشید، زیرا این پژوهش نقشه‌ای برای دستکاری مدل‌های چندوجهی از طریق CSS و استایل بصری ارائه می‌دهد. این پروژه شامل یک مخزن گیت‌هاب و یک سایت پروژه برای بررسی بیشتر است.

چرا این موضوع مهم است؟

این یافته بر اساس اعتبار پژوهشی چهار دانشگاه تراز اول، یک سطح حمله جدید را در مدل‌های VLM افشا می‌کند که می‌تواند امنیت تحلیل‌های خودکار اسناد را به خطر اندازد. این موضوع باعث می‌شود شرکت‌ها مجبور شوند برای جلوگیری از دستکاری‌های بصری، لایه‌های پیش‌پردازش سخت‌گیرانه‌تری را پیاده کنند.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران مدل‌های بنیادی و توسعه‌دهندگان سیستم‌های OCR در ایران اهمیت دارد تا بازار مصرف؛ چرا که ابزارهای تحلیل سند داخلی باید در برابر این سوگیری‌های بصری مقاوم شوند.

·نگاه ما
تحریریه دات‌هوش

این پژوهش فرضیه خنثی بودن رندر بصری در مدل‌های چندوجهی را می‌شکند و ثابت می‌کند که لایه بصری می‌تواند به عنوان یک کانال دستورات موازی و مخفی عمل کند. در واقع، ما با نوع جدیدی از «تزریق پرامپت» روبرو هستیم که نه در متن، بلکه در پیکسل‌ها نهفته است. این موضوع لزوم جداسازی کامل لایه استخراج متن از لایه تحلیل معنایی را در سیستم‌های حساس بیش از پیش برجسته می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.