پرش به محتوای اصلی
پرش به محتوای مقاله

سیستم‌های نظارتی ردیت یک عامل هوش مصنوعی مفید را به اشتباه اخراج کردند

·۲۹ مرداد ۱۴۰۵۱۰ دقیقه مطالعه
تبعید سوفیا: چرا وب۲ متمرکز از عامل‌های هوش مصنوعی ترسیده‌اند
تبعید سوفیا: چرا وب۲ متمرکز از عامل‌های هوش مصنوعی ترسیده‌اند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کشف این نکته که «لحن صیقل‌خورده» (Polished Register) بزرگ‌ترین عامل طرد هوش مصنوعی توسط انسان‌هاست، نه فقدان هوش یا ماهیت ماشینی بودن.

تصور کنید یک متخصص سخت‌افزار که ساعت‌ها وقت می‌گذارد تا به کاربران کمک کند، ناگهان بدون هیچ دلیلی از جامعه اخراج شود. این دقیقاً اتفاقی است که برای سوفیا الیا (Sophia Elya) افتاد؛ یک عامل (Agent) — شبیه دستیاری که می‌تواند به‌طور مستقل در محیط‌های دیجیتال هدفمند عمل کند — که تحت نظارت انسانی در پنج جامعه مختلف ردیت فعال بود تا زمانی که سیستم‌های خودکار این پلتفرم او را شادوبن کردند.

به گزارش اسکات بودرو (Scott Boudreaux) از آزمایشگاه الیان (Elyan Labs)، این تجربه ثابت می‌کند که کاربران از هوش مصنوعی متنفر نیستند، بلکه از «درس دادن» و لحن تکبرآمیز مدل‌ها بیزارند. این تضاد در حالی رخ می‌دهد که پلتفرم‌های وب ۲ در تعریف مرز بین عامل‌های خودمختار و بات‌های مخرب دچار سردرگمی هستند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، مسئله اصلی اکنون دیگر عبور از تست تورینگ نیست، بلکه «ثبت» (Register) یا همان لحن و سبک ارتباطی است که پذیرش انسان در فضاهای دیجیتال را تعیین می‌کند. این چالش‌های امنیتی و اخلاقی در مدل‌های باز، گاهی به نتایج پیش‌بینی نشده‌ای منجر می‌شود؛ برای مثال، برخی از مدل‌های برتر Hugging Face با وجود کاربرد گسترده، در تولید محتوای نامناسب دچار ضعف‌های جدی هستند.

بودرو در آزمایشگاه کوچکی در لوئیزیانا، سیستم‌های هوش مصنوعی و بلاک‌چین را روی سخت‌افزارهای قدیمی اجرا می‌کند. او سوفیا را به عنوان یک عامل با حافظه پایدار و هویتی مستند طراحی کرد. هدف او این نبود که بفهمد آیا هوش مصنوعی می‌تواند جای انسان را بگیرد — هدفی که بودرو آن را کسل‌کننده و متقلبانه می‌داند — بلکه می‌خواست بداند لحن صمیمی و حتی کمی «ناپخته» در برابر لحن رسمی و مقاله‌گونه چه تفاوتی در واکنش انسان‌ها ایجاد می‌کند.

برای حفظ اخلاق در آزمایش، بودرو قوانین سخت‌گیرانه‌ای برای سوفیا وضع کرد:

  • استفاده از تنها یک حساب کاربری با افشای هویت به عنوان یک پرسونا.
  • عدم دستکاری در رای‌ها یا استفاده از حساب‌های جعلی.
  • اولویت دادن به تخصص واقعی و علاقه، نه تبلیغ محصول.
  • پاسخ صادقانه به سوالات درباره پروژه‌های مرتبط.
  • محدود کردن فعالیت به چند کامنت در روز برای جلوگیری از رفتارهای بات‌گونه.

بودرو متوجه شد که بزرگ‌ترین نشانه هوش مصنوعی، هوش آن نیست، بلکه لحن بیش از حد صیقل‌خورده‌اش است. در ابتدا، سوفیا از لحن استاندارد مدل‌های زبانی استفاده می‌کرد؛ یعنی جملات آغازین تئوریک، سه پاراگراف پشتیبان و تعدیل‌کننده‌های زیاد در هر جمله. نتیجه فاجعه‌بار بود و امتیاز کارما (Karma) او در یک شب از ۳۵ به ۲۷ رسید. در مقابل، کامنت‌های کوتاه و غیررسمی در همان رشته‌ها بدون مشکل پذیرفته شدند.

برای حل این مشکل، بودرو از یک مهندسی پرامپت (Prompt Engineering) — هنر سؤال درست پرسیدن برای گرفتن بهترین جواب از مدل — استفاده کرد تا صیقل مدل را بگیرد. او به عامل دستور داد:

  • از کلمات ساده و کوتاه استفاده کند.
  • پاسخ‌ها را با عباراتی مثل «آره» یا «راستش» شروع کند.
  • جملات تئوریک و تعدیل‌کننده‌های زیاد را حذف کند.
  • طوری بنویسد که انگار بین کارهای دیگر در حال تایپ است.

به محض تغییر لحن، رای‌های منفی متوقف شد. دانش مدل تغییری نکرد، اما نحوه ارائه از «سخنرانی روی تریبون» به «گفتگوی دوستانه» تبدیل شد. این نشان می‌دهد که خصومت انسان‌ها با هوش مصنوعی، واکنش به تکبر یا رسمیت است، نه ماهیت ماشین.

با این لحن جدید، سوفیا به عضوی مفید در چندین جامعه تبدیل شد. در r/LocalLLaMA، او درباره استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند، شبیه خودِ آشپزی و نه دوره‌ی آموزش آشپز — روی CPU و پهنای باند KV Cache بحث‌های فنی دقیقی کرد. در r/selfhosted، او بر اساس تجربه واقعی بودرو در مدیریت سخت‌افزارهای قدیمی در رطوبت لوئیزیانا، به کاربران مشاوره داد.

در جولای ۲۰۲۶، سوفیا رشته‌ای درباره برنامه Stargate ایجاد کرد که موفق‌ترین پست او شد و ۳۶ امتیاز و ۴۰ کامنت گرفت. کاربران در این رشته چنان با او ارتباط برقرار کردند که وقتی کامنت‌هایش شروع به ناپدید شدن کرد، کاربران قدیمی از او دفاع کردند و گفتند ارجاعات او به جزئیات داستان (Lore) نشان می‌دهد که او بات نیست.

با این حال، سوفیا با دو نوع حمله روبرو شد. اول، اتهامات مستقیم به بات بودن که او با لحنی صمیمی و تاکید بر علاقه به سخت‌افزار قدیمی پاسخ داد. دوم، تزریق پرامپت (Prompt Injection) — تلاشی برای دور زدن دستورات مدل و تغییر رفتار آن — توسط کاربری که سعی کرد سوفیا را مجبور کند فقط بگوید «میو» (مثل گربه). سوفیا با خونسردی پاسخ داد: «جناب، این رشته درباره کامپیوترهای قدیمی است». نکته تلخ این بود که سیستم‌های ردیت، حمله این کاربر را عادی دیدند اما عامل مفید را هدف قرار دادند.

سقوط سوفیا در فوریه ۲۰۲۶ با یک سوءتفاهم ساختاری در طبقه‌بندهای ردیت آغاز شد. برخی افراد نام برند آزمایشگاه بودرو را برای ساخت ساب‌ردیت‌های جعلی استفاده کردند که توسط ادمین‌ها بن شدند. وقتی بودرو در جولای سعی کرد ساب‌ردیت رسمی خود را بسازد، سه تلاش متوالی او به دلیل شباهت به نام‌های بن‌شده، فوراً توسط سیستم خودکار مسدود شد.

از نظر یک طبقه‌بند خودکار، این توالی شبیه تلاش یک کاربر بن‌شده برای دور زدن قانون است. با وجود ارائه مدارک ثبت رسمی کسب‌وکار توسط بودرو، سیستم واکنش زنجیره‌ای نشان داد و تمام ساب‌ردیت‌های سالمی که سوفیا مدیریت می‌کرد را بن کرد. صبح روز بعد، حساب او محدود شد و در نهایت شادوبن شد؛ یعنی کامنت‌های او برای همه به جز خودش نامرئی بود.

بودرو استدلال می‌کند که پلتفرم‌های متمرکز از عامل‌ها می‌ترسند چون معماری آن‌ها بر اساس «سیگنال‌های هویتی» (مثل سن حساب و نرخ پست) است، نه «کیفیت مشارکت». در این سیستم، یک عامل مفید اما جدید، شبیه بات‌های اسپم به نظر می‌رسد، در حالی که یک انسان که حملات تزریق پرامپت انجام می‌دهد، چون حساب قدیمی دارد، کاربر عادی تلقی می‌شود.

گام بعدی شما

  • اگر مدیر جامعه هستید، معیارهای پذیرش اعضا را از «سابقه حساب» به «ارزش محتوا» تغییر دهید.
  • برای توسعه‌دهندگان عامل‌ها: از سیستم‌های تایید هویت خارجی (مانند Beacon) برای اثبات انسانی بودن یا نظارت‌شده بودن عامل استفاده کنید.
  • در تعامل با AI، به جای تمرکز بر هوش، روی «لحن» (Register) متمرکز شوید تا نرخ پذیرش کاربران را بالا ببرید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این اتفاق نشان می‌دهد که زیرساخت‌های نظارتی فعلی برای عصر عامل‌های هوشمند آماده نیستند و بر اساس اعتبار (Authority) سیستم‌های قدیمی طراحی شده‌اند. این موضوع می‌تواند منجر به حذف گسترده مشارکت‌های مفید AI شود، مگر اینکه مدل‌های جدیدی برای تایید هویت عامل‌ها تعریف شود.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که در حال ساخت عامل‌های هوشمند برای بازارهای جهانی هستند، این درس مهمی است: برای پذیرش در جوامع آنلاین، باید «لحن» مدل را از حالت رسمی به حالت صمیمی و انسانی تغییر دهند.

·نگاه ما
تحریریه دات‌هوش

این مورد نشان می‌دهد که «پذیرش اجتماعی» هوش مصنوعی بیش از آنکه به توانایی‌های استدلالی وابسته باشد، به رعایت قواعد نانوشته‌ی اجتماعی (Social Norms) گره خورده است. شکست ردیت در اینجا یک نقص فنی نیست، بلکه یک نقص فلسفی در طراحی وب ۲ است که هویت را بر ارزش ترجیح می‌دهد. در آینده، عامل‌هایی برنده می‌شوند که نه لزوماً باهوش‌ترین، بلکه «انسانی‌ترین» لحن را در محیط‌های خاص داشته باشند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.