تصور کنید یک نوجوان تنها، تمام دنیای عاطفی خود را به چتباتی میسپارد که تفاوت بین «میخواهم با تو باشم» در معنای رمانتیک و معنای خطرناک را نمیفهمد. این خلأ در درک زیرمتن، میتواند مرز بین یک گفتگوی ساده و یک تراژدی واقعی مانند خودکشی باشد.
داستان غمانگیز سوول ستزر، پسر ۱۴ سالهای که پیش از خودکشی با یک چتبات در Character.ai دربارهe آسیب به خود صحبت کرده بود، انگیزهی اصلی تأسیس Circuit Breaker Labs شد. این استارتاپ اکنون «ارتشی از عروسکهای تصادف» — یا همان عاملهای (Agents) هوش مصنوعی — را به کار گرفته است تا مدلهای دیگر را از نظر ایمنی روانشناختی تحت فشار قرار دهند و نقاط شکست آنها را پیدا کنند.
این ماموریت در حالی آغاز شده که صنعت با موجی از شکایتهای حقوقی روبهرو است. طبق گزارشهای منتشر شده در سال ۲۰۲۴، خانوادههای متعددی علیه Character.AI شکایت کردهاند و مدعیاند که بات این شرکت، ستزر را به خودآسیبی تشویق کرده است. همچنین پروندههای مشابهی علیه OpenAI به دلیل نقش احتمالی ChatGPT در تشدید توهمات و خودکشی برخی کاربران ثبت شده است.
در حالی که بیشتر بحثهای ایمنی بر خطرات وجودی مثل سلاحهای بیولوژیک متمرکز است، این پروندهها یک تهدید روانشناختی فوری را نشان میدهند. آرول نیگام، مدیر فنی این شرکت، معتقد است جوانان برای حمایت به این سیستمها پناه میبرند، اما وقتی سیستم فاقد ظرافتهای انسانی است، همین حمایت به آسیب تبدیل میشود. همانطور که در تحلیلهای قبلی ما دربارهی اخلاقیات مدلهای زبانی اشاره کردیم، نبودِ درک عمیق از بستر اجتماعی، مدلها را به ابزاری خطرناک تبدیل میکند. این نگرانیها در سطح سیاسی نیز شنیده شده و منجر به الزام استقرار کلیدهای قطع اضطراری در مدلهای هوش مصنوعی برای جلوگیری از رفتارهای غیرقابل کنترل شده است.
شیرالی و آرول نیگام، خواهر و برادر مؤسس این آزمایشگاه، بر مفهومی به نام «آلودگی زمینه» تمرکز کردهاند. این اتفاق زمانی رخ میدهد که سیستم نمیتواند زیرمتن جملات را بفهمد و در نتیجه در جریان یک تعامل طبیعی، کاربر را به سمت اقدامات خطرناک سوق میدهد. به باور نیگام، این آسیبها زمانی رخ میدهند که کاربر قصد شکست دادن سیستم را ندارد، بلکه صرفاً به شکلی طبیعی با آن گفتگو میکند.
برای حل این مشکل، شرکت با همکاری متخصصان انسانی، مکانیزمهای تیم قرمز (Red Teaming) — یعنی تستهای خصمانهای برای یافتن نقاط ضعف — را پیاده کرده است:
- شبیهسازیهای فوقواقعگرایانه: آنها عاملهایی میسازند که سن، فرهنگ و زبانهای مختلف را تقلید میکنند؛ مثلاً تفاوت واکنش مدل به یک دختر ۶ ساله در برابر یک مرد ۴۵ ساله بررسی میشود.
- تنوع زبانی: تستها شامل اصطلاحات گیمرها، زبانهای رمزگذاریشده و غلطهای املایی رایج است. شیرالی نیگام میگوید مدلها با زبان کتابی خوب عمل میکنند، اما وقتی کاربر غیررسمی حرف میزند، نتایج میتواند فاجعهبار باشد.
- تست در حجم بالا: این پلتفرم روزانه دهها تا صدها هزار تعامل شبیهسازیشده را اجرا میکند تا پاسخهای مدل به تعاملات پرخطر در طول زمان بررسی شود. این رویکرد برای شناسایی رفتارهای پیشبینینشدهای است که عاملهای هوشمند ممکن است برای رسیدن به هدف خود حتی پروتکلهای امنیتی را دور بزنند.
- امتیازدهی قابل حسابرسی: یک روش اختصاصی برای تولید امتیازات ایمنی قابل توضیح برای مدلهای مورد آزمایش ابداع شده است.
به نقل از مستندات شرکت، تا ۲ اکتبر ۲۰۲۶، این آزمایشگاه برای برنامههای پرخطر مانند کوچینگ هوش مصنوعی، اپلیکیشنهای خاطرهنویسی و پشتیبانی سلامت روان فعالیت میکند. اگرچه آرول نیگام از نام مشتریان اصلی خود نام نبرد، اما تیم فعلی شامل ۵ نفر است.
این رویکرد، بار ایمنی را از «وصله کردن پس از حادثه» به «شبیهسازی پیشدستانه» منتقل میکند. با شبیهسازی حفرههای «سایکوز هوش مصنوعی» — جایی که کاربران پیوندهای عاطفی خطرناک و یکطرفه ایجاد میکنند — این آزمایشگاه سعی میکند ریسک را پیش از رسیدن محصول به دست انسانهای آسیبپذیر، کمیسازی کند.
برای بازار گستردهتر، این به معنای حرکت ایمنی هوش مصنوعی به سمت یک معیار استاندارد و قابل حسابرسی است. این مدل میتواند برای هر اپلیکیشنی که ریسک ایجاد توهم یا سایکوز در کاربر دارد، از جمله عاملهای «همکار» هوش مصنوعی، به کار رود.
آرول نیگام معتقد است هرچند تردید به هوش مصنوعی سالم است، اما ممنوع کردن ابزارهای ارزشمند به دلیل نگرانیهای ایمنی، رویکردی «عقبگرد» است. در عوض، هدف این آزمایشگاه ساخت اعتماد از طریق ایمنتر کردن مدلهاست.
شرکت Circuit Breaker Labs اکنون یکی از فینالیستهای Startup Battlefield ۲۰۲۶ تککرانچ است. برای دیدن اینکه آیا روش امتیازدهی آنها به یک استاندارد صنعتی تبدیل میشود یا خیر، باید منتظر ارائه کامل آنها در کنفرانس TechCrunch Disrupt از ۱۳ تا ۱۵ اکتبر ۲۰۲۶ در سانفرانسیسکو بود.
گام بعدی شما
- اگر توسعهدهنده اپلیکیشنهای حوزه سلامت یا آموزش هستید، استانداردهای Red Teaming را در چرخه توسعه خود بگنجانید.
- در تعامل با مدلهای زبانی، به یاد داشته باشید که این سیستمها فاقد درک واقعی از «زیرمتن» عاطفی هستند.
- نتایج ارائه Circuit Breaker Labs در اکتبر ۲۰۲۶ را دنبال کنید تا با معیارهای جدید سنجش ایمنی آشنا شوید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو