پرش به محتوای اصلی
پرش به محتوای مقاله

Ghost Font: متنی که انسان می‌خواند اما هوش مصنوعی نمی‌بیند

·۲۰ تیر ۱۴۰۵۵ دقیقه مطالعه۱ بازدید
قلم شبح: قلمی ضد هوش مصنوعی که تنها انسان‌ها می‌توانند بخوانند
قلم شبح: قلمی ضد هوش مصنوعی که تنها انسان‌ها می‌توانند بخوانند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی استتار استاتیک با استتار زمانی؛ Ghost Font به جای تغییر شکل حروف، اطلاعات را در «حرکت» پنهان می‌کند تا مدل‌هایی که ویدیو را به صورت فریم-به-فریم می‌بینند، دچار توهم شوند.

تصور کنید متنی بنویسید که هرچه مدل‌های پیشرفته‌تر هوش مصنوعی سعی کنند آن را بخوانند، فقط توهم بزنند، اما هر انسانی با یک نگاه سریع، پیام شما را بفهمد. این دقیقاً همان چیزی است که Ghost Font هدف قرار داده است تا مرزهای ادراکی مدل‌های چندوجهی (Multimodal) — یعنی مدل‌هایی که مثل ما با چند حس دنیا را می‌خوانند و متن، عکس و صدا را هم‌زمان می‌فهمند — را به چالش بکشد.

به نقل از سازنده این پروژه، اریک (Eric)، این سیستم در ۱۱ ژوئیه ۲۰۲۶ منتشر شد تا نشان دهد مدل‌های فعلی در تحلیل «زمان» شکست می‌خورند. برخلاف تایپ‌فیس‌های سنتی، این سیستم از طریق حرکت ارتباط برقرار می‌کند تا اطمینان حاصل شود که پیام‌ها برای مدل‌های هوش مصنوعی که بر تحلیل فریم‌های ایستا (Static) متکی هستند، نامرئی باقی می‌مانند. در حالی که اکثر مدل‌ها تصاویر را تکه‌تکه می‌بینند، Ghost Font پیام را در جریان حرکت پنهان می‌کند.

قلم شبح: تایپ‌فیس ضدهوش‌مصنوعی که تنها انسان‌ها می‌توانند بخوانند

نبرد میان انسان و نرم‌افزارهای نویسه‌خوانی نوری (OCR) — ابزارهایی که متن‌های چاپی را به کد دیجیتال تبدیل می‌کنند — سال‌هاست که شبیه بازی موش و گربه است. در سال ۲۰۱۳، طراحی به نام سانگ مون (Sang Mun) فونت ZXX را معرفی کرد. این فونت با استفاده از نویز و استتار، متن‌ها را برای ماشین‌ها نامرئی می‌کرد. ZXX شامل چهار فونت متمایز بود که به‌گونه‌ای طراحی شده بودند که توسط انسان قابل خواندن باشند اما برای OCR نامرئی بمانند. در این سیستم، حروف با نویز استتار شده بودند، روی آن‌ها خط کشیده شده بود و یا زیر نشانه‌های جعلی دفن شده بودند. در آن زمان، این فونت «ضد نظارت» نامیده شد.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، پیشرفت‌های سریع در معماری مدل‌ها، بسیاری از حفاظ‌های قدیمی را می‌شکند. امروز مدل‌هایی مثل ChatGPT 5.5 در حالت Instant می‌توانند استتارهای پیچیده ZXX را تنها با یک پرامپت رمزگشایی کنند و حتی جزئیات کوچک متن را استخراج نمایند. این یعنی فونت‌های ایستای «ضد هوش مصنوعی» دیگر کارایی ندارند و امنیت باید به سمت «ابعاد زمانی» حرکت کند.

ChatGPT easily reads the text in this image

Ghost Font در واقع یک فونت به معنای سنتی (یا یک فایل TTF) نیست، بلکه یک آزمایش در ارتباطات گرافیکی است که از ترکیب حرکت، ویدیو، نویز و پیام‌های جعلی استفاده می‌کند. این سیستم با متن به عنوان یک «رویداد زمانی» برخورد می‌کند و روشی منحصر‌به‌فرد برای اشتراک‌گذاری پیام‌ها با انسان‌های واقعی ایجاد می‌کند. طبق مستندات این پروژه، این سیستم از سه لایه برای گمراه کردن هوش مصنوعی بهره می‌برد:

  • حرکت پویا: حروف از نقاطی تشکیل شده‌اند که دقیقاً شبیه پس‌زمینه به نظر می‌رسند. چشم انسان حرکت این نقاط را به شکل یک حرف درک می‌کند، اما یک اسکرین‌شات ساده فقط نقاطی پراکنده را نشان می‌دهد که با محیط ترکیب شده‌اند. این مکانیسم تضمین می‌کند که با گرفتن عکس از صفحه، پیام فاش نشود.
  • نویز و پیام‌های جعلی: هر ویدیو حاوی یک پیام «طعمه» (Decoy) است. این یک ترفند نهایی برای مدل‌های مصمم است؛ وقتی یک عامل هوش مصنوعی به دنبال متن پنهان می‌گردد، ممکن است ابتدا پیام جعلی را پیدا کند و به اشتباه آن را به عنوان محتوای اصلی گزارش دهد.
  • اجرای محلی: این ابزار ویدیوها را به‌صورت محلی تولید می‌کند. کاربران می‌توانند پیام خود را تایپ کنند، پیش‌نمایش زنده را ببینند و سپس ویدیو را برای اشتراک‌گذاری دانلود کنند. چون داده‌ها با هیچ سروری به اشتراک گذاشته نمی‌شوند، حریم خصوصی در طول فرآیند خلق حفظ می‌شود.

Trying ChatGPT 5.5 Pro with Ghost Font

در آزمایش‌های انجام شده توسط توسعه‌دهنده، مدل‌های پیشرفته‌ای مثل Claude Fable (در حالت Max Reasoning) و GPT Sol 5.6 Ultra در رمزگشایی این پیام‌های متحرک شکست خوردند. بر اساس گزارش‌های منتشر شده در mixfont.com، حتی این مدل‌های جدید که مجهز به توانایی کدنویسی هستند، نتوانستند متن را بخوانند، مگر اینکه دقیقاً تکنیک جست‌وجوی مورد نظر به آن‌ها دیکته شود.

قلم شبح: قلمی ضد هوش مصنوعی که تنها انسان‌ها می‌توانند بخوانند

Claude Fable with Max reasoning attempting to decode a message written with Ghost Font. The model reads the hidden decoy message, but fails to read the actual moving message.

یک مورد خاص با ChatGPT 5.5 Pro منجر به ۱۹ دقیقه تحلیل شد که در نهایت با یک توهم (Hallucination) — یعنی وقتی مدل با اطمینان چیزی می‌گوید که اصلاً وجود ندارد — به یک پیام ساختگی رسید که در واقعیت وجود نداشت. دلیل این شکست ساده است: مدل‌ها معمولاً ویدیوها را به فریم‌های مجزا تقسیم کرده و هر کدام را یک عکس می‌بینند. آن‌ها درک بومی از «جریان زمان» و حرکت سیال ندارند و نمی‌توانند ترکیب حرکتی را که انسان‌ها به طور طبیعی درک می‌کنند، بازسازی کنند.

این آزمایش یک شکاف بحرانی در هوش مصنوعی فعلی را برجسته می‌کند. اکثر مدل‌های چندوجهی در واقع مدل‌های «تصویر-محور» هستند. آن‌ها هنوز «بومی-ویدئویی» (Video-native) نیستند، به این معنا که نمی‌توانند متن را مستقیماً از جریان حرکت بخوانند.

برای کاربر عادی، این بدان معناست که «برتری انسانی» اکنون در توانایی ما برای پردازش الگوهای زمانی نهفته است که ماشین‌ها هنوز نمی‌توانند شبیه‌سازی کنند. در دنیایی که هوش مصنوعی تولید فونت‌های استاندارد را تسخیر کرده، شاید حفظ یک صدای خلاقانه و انسانی مستلزم شکستن قالب‌های سنتی فایل‌های TTF باشد.

با این حال، اریک هشدار می‌دهد که این یک سپر کامل نیست. در حالی که محیط‌های آنلاین مدل‌ها در جداسازی این متن‌ها مشکل دارند، یک عامل اختصاصی با محیط اجرای کد محلی می‌تواند در نهایت مسیر حرکت نقاط را تحلیل کرده و متن را معکوس‌مهندسی کند. او تأکید می‌کند که برای امنیت واقعی هنوز به رمزنگاری‌های سنتی، کلیدها یا رمزعبورهایی نیاز داریم که فقط انسان‌ها بدانند.

این پروژه بیشتر یک محک برای سنجش ادراک بصری است تا یک محصول امنیتی. اگر مدل‌ها بتوانند در آینده این متن‌های متحرک را بخوانند، این سیگنالی از جهشی به سمت هوش مصنوعی واقعیِ بومی-ویدئویی خواهد بود. البته باید پذیرفت که شکاف در حال بسته شدن است؛ توسعه‌دهنده اعتراف می‌کند که اگرچه خواندن این فونت برای هوش مصنوعی سخت است، اما «برای انسان‌ها هم خواندنش نسبتاً دشوار است!»

در آینده، این تکنولوژی می‌تواند در سیستم‌های کپچا (CAPTCHA) ادغام شود. از آنجا که اکثر کپچاهای فعلی به‌راحتی توسط بات‌ها حل می‌شوند، انتقال به یک سیستم حرکتی-ویدئویی می‌تواند دوباره توازن را به نفع انسان‌ها برگرداند و تشخیص بات‌ها را برای ماشین‌ها سخت و برای انسان‌ها آسان کند.

اریک قصد دارد کد تولید ویدیو را به‌صورت یک پروژه متن‌باز منتشر کند. به‌روزرسانی‌های آینده بر گسترش اندازه و پشتیبانی از رشته‌های متنی طولانی‌تر تمرکز خواهد داشت تا ابزار برای اشتراک‌گذاری کاربردی‌تر شود. علاقه‌مندان می‌توانند او را در X با شناسه @ericlu دنبال کنند.

گام بعدی شما

  • اگر در تولید محتوای بصری فعال هستید، از ابزارهای تولید ویدیو برای پنهان کردن پیام‌های کلیدی در لایه‌های حرکتی استفاده کنید.
  • در هنگام ارزیابی مدل‌های چندوجهی، به جای عکس، ویدیوهای کوتاه با تغییرات سریع را به عنوان تست ادراک زمانی به کار ببرید.
  • منتظر انتشار کد متن‌باز Ghost Font باشید تا مکانیزم‌های ضد-OCR جدید را در پروژه‌های خود پیاده کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص در ادراک بصری، ثابت می‌کند که امنیت داده‌های بصری باید از حالت ایستا به حالت زمانی تغییر کند. این تغییر رویکرد، استانداردهای جدیدی برای سیستم‌های احراز هویت و مقابله با بات‌ها ایجاد می‌کند.

تأثیر برای ایران

این ابزار به‌دلیل اجرای محلی و متن‌باز بودن، برای توسعه‌دهندگان ایرانی که به دنبال پیاده‌سازی سیستم‌های ضد-بات یا کپچاهای مقاوم در برابر AI هستند، کاملاً در دسترس و کاربردی است.

·نگاه ما
تحریریه دات‌هوش

شکست مدل‌های پیشرفته در برابر Ghost Font نشان می‌دهد که «بینایی» در هوش مصنوعی فعلاً به معنای پردازش سریع عکس‌هاست، نه درک واقعی جریان زمان. این شکاف ادراکی، آخرین سنگر انسان در برابر اتوماسیون کامل است و ثابت می‌کند که مدل‌های چندوجهی هنوز «ویدئو-بومی» نیستند و فقط مجموعه‌ای از عکس‌ها را می‌بینند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.