پرش به محتوای اصلی
پرش به محتوای مقاله

سانسور الگوریتمی زبان انسان را مسموم و آموزش هوش مصنوعی را ناقص می‌کند

·۱۴ مهر ۱۴۰۵۹ دقیقه مطالعه
یادداشت
آنیل دَش: «می‌خواهیم کلمه "unalive" را بکشیم»
آنیل دَش: «می‌خواهیم کلمه "unalive" را بکشیم»
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

پیوند دادن پدیده Algospeak به مسمومیت داده‌های آموزشی (Data Poisoning) در مدل‌های زبانی؛ یعنی سانسور اجتماعی امروز، تبدیل به نقص شناختی هوش مصنوعی فردا می‌شود.

تصور کنید برای توصیف مرگ یا خشونت، مجبور باشید از کلماتی استفاده کنید که هیچ معنای واقعی در لغت‌نامه ندارند، اما برای یک ماشین قابل‌فهم هستند. اگر امروز در شبکه‌های اجتماعی از واژه‌هایی مثل «نا-زنده» (unalive) به‌جای مرگ استفاده می‌کنید، بدانید که در حال پذیرش یک قرارداد جدید هستید که نه توسط انسان‌ها، بلکه توسط کدهای شرکتی دیکته شده است. کلماتی که ما برای توصیف مرگ و خشونت به کار می‌بریم، اکنون توسط کدهای شرکتی در حال بازنویسی هستند.

انیل دش (Anil Dash)، منتقد برجسته فناوری و کارآفرین، استدلال می‌کند که ظهور «زبان الگوریتمی» (Algospeak) تنها یک عادت اجتماعی یا یک شوخی زبانی نیست، بلکه یک حمله سیستماتیک به بیان انسانی است که اکنون یکپارچگی و صحت هوش مصنوعی را تهدید می‌کند. این تغییر زبانی زمانی رخ داد که پلتفرم‌هایی مثل تیک‌تاک و اینستاگرام از الگوریتم‌های مبهمی برای حذف درآمد (demonetize) یا سرکوب محتواهای حاوی کلمات «ممنوعه» استفاده کردند.

برای بقا در این محیط، تولیدکنندگان محتوا یک واژگان سایه ابداع کرده‌اند؛ مثلاً استفاده از اصطلاح «نا-زنده» برای مرگ یا خودکشی، و واژه «انگور» (grape) برای اشاره به تجاوز جنسی تا بتوانند از فیلترهای خودکار عبور کنند. طبق گزارش‌های دش، این پدیده از فیدهای دیجیتال به واقعیت فیزیکی نفوذ کرده است و مردم اکنون در مکالمات شفاهی و حضوری نیز از این بهینه‌سازی‌های زبانی استفاده می‌کنند. او اشاره می‌کند افرادی که در قرن بیستم به دنیا آمده‌اند، اغلب با واژه «نا-زنده» غریبه‌اند و گیج می‌شوند، اما برای متولدین قرن بیست و یکم، این اصطلاح کاملاً عادی و طبیعی است.

زمینه و بستر کنترل الگوریتمی

دش توضیح می‌دهد که این حمله به بیان انسانی از پلتفرم‌هایی مانند تیک‌تاک آغاز شد، جایی که تقریباً تمام محتواها از طریق یک فید الگوریتمی توزیع می‌شوند. از آن زمان، این روند در تقریباً تمام رسانه‌های دیجیتال فراگیر شده است. فشار برای راضی نگه داشتن الگوریتم چنان شدید است که کاربران اغلب حتی زمانی که مطمئن نیستند کلمه‌ای واقعاً ممنوع است یا خیر، خودسانسوری می‌کنند؛ آن‌ها صرفاً حاضر نیستند ریسک کنند تا بفهمند اگر از «کلمات ممنوعه» استفاده کنند چه اتفاقی می‌افتد.

این محیط نسلی را پرورش داده که در حال رشد هستند بدون اینکه متوجه شوند چقدر افراطی و عجیب است که زبانشان توسط یک ماشین انتخاب شود. دش به یک احساس «تهوع‌آور و وحشتناک» اشاره می‌کند وقتی می‌بیند نوپایی در اتاق پذیرایی یک حرکت بامزه انجام می‌دهد و بلافاصله می‌گوید: «لطفاً لایک و سابسکرایب کنید!». این نشان می‌دهد کودکان شست‌وشوی مغزی شده‌اند تا فکر کنند هر لحظه دوست‌داشتنی از زندگی باید به عنوان پرامپتی برای جمع‌آوری داده‌های گوگل عمل کند.

مناسک نامرئی غول‌های فناوری

دش معتقد است مناسک تغذیه دادن به الگوریتم چنان در عادات روزمره رخنه کرده که برای کسانی که اینترنت پیش از عصر پلتفرم‌های فعلی را تجربه نکرده‌اند، نامرئی است. این وضعیت چرخه‌ای ایجاد می‌کند که در آن کاربران برای یک «خدای خشمگین» اجرا می‌کنند، بدون اینکه کاملاً درک کنند این خدا دقیقاً چه می‌خواهد.

او ریاکاری نخبگان فناوری را به شدت نقد می‌کند. به باور دش، این چهره‌ها سال‌ها تظاهر کردند که به «آزادی بیان» اهمیت می‌دهند. در حالی که آن‌ها نمونه‌هایی ساختگی از نبود آزادی بیان در پردیس‌های دانشگاهی ارائه می‌دادند و برای «فرهنگ لغو» (Cancel Culture) اشک‌های تمساح می‌ریختند و هم‌زمان باعث اخراج افرادی می‌شدند که انتقادات سیاسی داشتند، اکنون هیچ مشکلی ندارند که میلیاردرها دقیقاً تصمیم بگیرند مردم عادی اجازه دارند از چه کلماتی استفاده کنند.

جزئیات و مکانیسم‌های زبان الگوریتمی

بر اساس یادداشتی که در ۶ اکتبر ۲۰۲۶ منتشر شد، دش چندین روش برای تجلی این سانسور سیستماتیک شناسایی کرده است:

  • پذیرش کنایه‌ها (Euphemism Adoption): استفاده از اصطلاحاتی مانند «نا-زنده» برای توصیف مردن، کشتن یا خودکشی جهت اجتناب از تنبیه الگوریتمی. دش اشاره می‌کند که شنیده است مردم در دنیای واقعی و با صدای بلند می‌گویند «او خودش را نا-زنده کرد» تا به خودکشی اشاره کنند.
  • کدگذاری بصری (Visual Coding): استفاده از ایموجی 🍇 یا کلمه «انگور» (grape) برای جایگزینی واژه «تجاوز» (rape) در بحث‌های مربوط به خشونت جنسی. این موضوع به‌ویژه در گفتگوهای آنلاین درباره عدم پاسخگویی در یک پرونده تجاوز تراژیک در دانشگاه کورنل مشهود بود.
  • مناسک رفتاری (Behavioral Rituals): تقاضاهای الگوریتم‌های Big Tech تولیدکنندگان را مجبور می‌کند تا برای تامنیل‌های یوتیوب «چهره‌های احمقانه» بسازند؛ نوعی تحقیر که برای دیده شدن ضروری شده است.
  • بازی با تعامل (Engagement Gaming): در اینستاگرام، کاربران برای دریافت پاسخ‌های تولید شده توسط هوش مصنوعی، از دیگران التماس می‌کنند تا عبارات خاص و فرقه‌گونه‌ای در کامنت‌ها بنویسند. این کار برای «نشان دادن فعالیت» به الگوریتم انجام می‌شود، که دش آن را به «خدای خشمگینی که نیاز به قربانی دارد» تشبیه می‌کند.

آنیل دَش در مقاله‌ای با عنوان «قصد داریم «unalive» را بکشیم» از تغییر زبان اینترنتی می‌گوید.

بحران آموزش هوش مصنوعی

دش بر یک اثر ثانویه حیاتی تأکید می‌کند: مسمومیت مجموعه‌های آموزشی هوش مصنوعی. از آنجا که محصولات بزرگ هوش مصنوعی بر اساس داده‌های اینترنتی آموزش می‌بینند که تحت این رژیم سانسور ایجاد شده‌اند، مدل‌ها ممکن است هرگز جهان واقعی و بدون سانسور را درک نکنند.

اگر پلتفرمی کلمه «نسل‌کشی» را ساکت کند و داده‌های آن پلتفرم به یک مدل زبانی بزرگ (LLM) بخورد، هوش مصنوعی حاصل، اساساً نسبت به واقعیت نسل‌کشی کور خواهد بود. محدودیت‌های تحمیل شده بر زبان انسان، تبدیل به محدودیت‌های هوش مصنوعی می‌شود. اگر داده‌های آموزش مسموم و ناقص باشند، درک مدل از جهان نیز به همان اندازه تحریف شده است.

هزینه پذیرش و تبعات ایمنی

این تغییر پارادوکسی برای کسانی ایجاد می‌کند که سعی در محافظت از کاربران آسیب‌پذیر دارند. دش حمایت خود را از هشدارهای محتوا (content warnings)، نشانگرهای حساسیت و اختصاراتی مانند «SA» برای تجاوز جنسی اعلام می‌کند تا کاربران کنترل موضوعات تحریک‌کننده (triggering) را داشته باشند، اما می‌گوید استفاده گسترده از Algospeak متفاوت است.

وقتی مردم برای دور زدن الگوریتم از غلط‌های املایی و ایموجی استفاده می‌کنند، ابزارهای ایمنی واقعی که برای فیلتر کردن محتوای آزاردهنده طراحی شده‌اند، ناکارآمد می‌شوند؛ زیرا نمی‌توانند این نحو (syntax) مسموم و تغییریافته را شناسایی کنند. ابزارهایی که قرار بود از مردم محافظت کنند، توسط نیاز به دور زدن الگوریتم خراب شده‌اند.

دش مدعی است این محیط توسط میلیاردرانی چون لری الیسون و ایلان ماسک مدیریت می‌شود. او می‌گوید این چهره‌ها تظاهر می‌کنند قهرمان آزادی بیان هستند در حالی که هم‌زمان مرزهای سخنان مجاز را کنترل می‌کنند. او اشاره می‌کند که خانواده لری الیسون به دنبال کنترل کلماتی است که مردم در تیک‌تاک می‌گویند، در حالی که ایلان ماسک صدای افراد شریف را در X خفه می‌کند و ظاهراً از توزیع محتوای سوءاستفاده جنسی از کودکان سود می‌برد.

فراخوانی برای شورش زبانی

برای مقابله با این روند، دش استراتژی «گفتن آنچه واقعاً منظور است» را پیشنهاد می‌دهد، صرف‌نظر از هزینه الگوریتمی. او اذعان می‌کند که این کار نیازمند شجاعت و احتمالاً فداکاری است، زیرا تولیدکنندگان از دست دادن دنبال‌کنندگان یا حذف درآمد می‌ترسند.

او گام‌های عملی زیر را برای هنرمندان و فعالان توصیه می‌کند:

۱. اولویت با زبان ساده: به‌جای اینکه بر اساس آنچه پلتفرم اجازه می‌دهد بنویسید، آنچه را که واقعاً می‌خواهید بگویید بیان کنید، حتی اگر ریسک خشم الگوریتم را به همراه داشته باشد.
۲. تنوع در توزیع: گفتگوهای حساس را به خبرنامه‌های ایمیلی، پادکست‌ها یا وبلاگ‌های مستقل ببرید. دش اشاره می‌کند که در وبلاگ خودش می‌تواند در تیترها از کلمات رک و تند استفاده کند بدون اینکه عملیات سایت مختل شود. البته هشدار می‌دهد که Substack و Spotify کاملاً مستقل نیستند و هر لحظه می‌توانند توزیع محتوا را «نا-زنده» کنند.
۳. علنی کردن فشارها: وقتی پلتفرمی دسترسی شما را به‌دلیل عدم سانسور محدود کرد، «سر و صدای زیادی» به پا کنید. به مطبوعات خبر دهید، ائتلاف‌هایی بسازید و از این جنجال برای جذب مردم به پلتفرم‌های مستقل استفاده کنید.
۴. اتحاد با تولیدکنندگان: با دیگر تولیدکنندگان هماهنگ شوید تا آثار بدون سانسور را به‌صورت هم‌زمان منتشر کنید. دیگران را تشویق کنید بخش‌هایی از اثر را که سیاست‌ها را نقض نمی‌کند تقویت کنند تا توجه‌ها به بخش‌های سانسور شده جلب شود.

تحلیل: فرسایش عاملیت شناختی

برای کاربر عادی، این موضوع فراتر از بحث «فرهنگ لغو» است؛ این یک تغییر در عاملیت شناختی (cognitive agency) است. دش استدلال می‌کند که خلاقیت ما توسط زبانی که به کار می‌بریم محدود می‌شود؛ تخیلات ما توسط آنچه می‌توانیم فکر کنیم و بگوییم محدود می‌گردد. وقتی عادت می‌کنیم کلماتمان را محدود کنیم، اثر ما «نا-زنده» می‌شود، پیش از آنکه حتی متولد شود.

این تضاد شدیدی با اینترنت اولیه دارد. دش به نسل فعلی یادآوری می‌کند که دنیای متفاوتی ممکن بود: صفحات MySpace هر طور که کاربر می‌خواست طراحی می‌شد و کدهای LiveJournal بازمتن بود، به این معنی که هیچ بخشی از الگوریتم ناشناخته نبود. وبلاگ‌های مستقل را می‌شد با چند سنت راه انداخت و میلیون‌ها نفر بدون دخالت شرکتی آن‌ها را می‌خواندند.

با مجبور کردن کاربران به صحبت با کدهای «تأیید شده توسط الگوریتم»، Big Tech در واقع تعریف اخلاق و حقیقت را به مجموعه‌ای از وزن‌ها و سوگیری‌های سودمحور برون‌سپاری کرده است. خطر این است که ما نسلی را آموزش می‌دهیم تا باور کنند جهان تنها به اندازه چیزی است که الگوریتم اجازه می‌دهد درباره آن صحبت کنیم.

اگر این محدودیت‌ها را بپذیریم، به آینده‌ای می‌رسیم که نه انسان‌ها و نه هوش مصنوعی، هیچ‌کدام قادر به توصیف دقیق خشونت‌های سیستماتیک یا دولتی نیستند، چون واژگان این مفاهیم «نا-زنده» شده‌اند. نتیجه این وضعیت، افزایش استبداد و تسریع آسیب‌ها علیه آسیب‌پذیران است، در حالی که نبوغ هنرمندان و متفکران توسط الگوریتم‌های بی‌روح خاموش می‌شود.

دش هشدار می‌دهد که غول‌های فناوری هر روز جسورتر می‌شوند؛ آن‌ها از ایجاد پایان جهان تعریف می‌کنند یا خواستار پاکسازی قومی می‌شوند، در حالی که افسار سخنان مردم عادی را سفت‌تر می‌گیرند. او تأکید می‌کند تنها راه پیش رو این است که از دیدگاه «اجازه پلتفرم» دست بکشیم و به مخاطبان بگوییم که آزادی بیان مهم‌تر از راحتی شرکتی است.

گام بعدی شما

  • کپشن‌های اخیر خود در شبکه‌های اجتماعی را بررسی کنید و ببینید چند بار از کنایه‌ها یا کلماتی استفاده کرده‌اید که در مکالمات حضوری هرگز به کار نمی‌برید.
  • برای محتواهای حساس، به‌جای تکیه بر پلتفرم‌های متمرکز، یک کانال توزیع مستقل (مثل وبلاگ یا خبرنامه) ایجاد کنید.
  • در مواجهه با سانسور الگوریتمی، به‌جای تغییر زبان، از ابزارهای گزارش‌دهی و افشای این محدودیت‌ها استفاده کنید.

اما داستان سخت‌افزاری این کنترل حتی پیچیده‌تر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell و قدرت پردازش مرکزی در دست چند شرکت محدود مراجعه کنید.

چرا این موضوع مهم است؟

این موضوع اعتبار داده‌های آموزشی هوش مصنوعی را زیر سؤال می‌برد و نشان می‌دهد که سوگیری‌های شرکتی مستقیماً در معماری شناختی مدل‌های آینده اثر می‌گذارند. بر اساس استدلال دش، این روند منجر به ایجاد شکافی عمیق در درک تاریخی و اجتماعی نسل‌های آینده می‌شود.

تأثیر برای ایران

به‌دلیل استفاده گسترده کاربران ایرانی از پلتفرم‌های خارجی و نیاز به دور زدن فیلترینگ، این نوع سانسور دوچندان است و منجر به تولید محتوای فارسیِ تحریف‌شده‌ای می‌شود که در آینده درک مدل‌های زبانی از فرهنگ و زبان فارسی را مسموم می‌کند.

·نگاه ما
تحریریه دات‌هوش

این بحران نشان می‌دهد که ما در حال تجربه «تکامل معکوس زبانی» هستیم؛ جایی که زبان به‌جای گسترش برای توصیف مفاهیم پیچیده، برای بقا در برابر ماشین ساده و تحریف می‌شود. خطر واقعی این است که مدل‌های هوش مصنوعی آینده، نه بر اساس حقیقت، بلکه بر اساس «نسخه سانسورشده‌ای از حقیقت» آموزش ببینند و در نتیجه، حقیقت را همان چیزی بدانند که الگوریتم‌های ۲۰۲۶ اجازه داده‌اند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.