پرش به محتوای اصلی
پرش به محتوای مقاله

روش «کاوش گوسی» MIT مدل‌های هوش مصنوعیِ خطرناک را بدون تولید تصویر شناس می‌کند

·۲۳ تیر ۱۴۰۵۴ دقیقه مطالعه
روش جدید MIT مدل‌های هوش مصنوعی آموزش‌دیده بر تصاویر سوءاستفاده از کودکان را بدون تولید آن‌ها شناسایی می‌کند
روش جدید MIT مدل‌های هوش مصنوعی آموزش‌دیده بر تصاویر سوءاستفاده از کودکان را بدون تولید آن‌ها شناسایی می‌کند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

توسعه روش «کاوش گوسی» که شناسایی مدل‌های مضر را از «تولید خروجی و بررسی آن» به «تحلیل اثر انگشت لایه‌های داخلی» تغییر داد و نیاز به تولید تصویر را به‌طور کامل حذف کرد.

تصور کنید مجبور باشید برای پیدا کردن یک بمب، ابتدا آن را منفجر کنید؛ این دقیقاً کابوسی است که بازرسان ایمنی هوش مصنوعی هنگام شناسایی مدل‌های تولید محتوای کودک‌آزار با آن روبرو بودند. در حالت عادی، بازرسان باید تصاویری را تولید کنند تا محتوای مضر را شناسایی نمایند، اما حالا تیمی از MIT راهی یافته است تا بدون «منفجر کردن» یا تولید حتی یک پیکسل تصویر، ماهیت خطرناک این مدل‌ها را برملا کند. این دستاورد توسط وینیت سوریakumar، دانشجوی دکتری، و پروفسورهای اشیا ویلسون و مرضیه قاسمی به دست آمده و پارادوکس اخلاقی و قانونی تست محتوای CSAM را با بررسی تغییرات داخلی مدل‌ها برطرف می‌کند.

این موفقیت در حالی رخ می‌دهد که حجم گزارش‌های مربوط به محتوای کودک‌آزار تولیدشده با هوش مصنوعی به‌شدت در حال افزایش است. طبق گزارش خبرگزاری insideai.news در ۱۳ جولای ۲۰۲۶، تعداد گزارش‌های دریافت‌شده توسط مرکز ملی کودکان مفقود و مورد سواستفاده (NCMEC)، از ۶۷ هزار مورد در سال ۲۰۲۴ به بیش از ۱.۵ میلیون مورد در سال ۲۰۲۵ رسیده است. این موج نگرانی‌ها با هشدارهای سازمان‌هایی نظیر یونیسف هم‌سو است که اخیراً بر عقب‌ماندگی قوانین ایمنی در برابر سرعت پذیرش هوش مصنوعی توسط کودکان تأکید کرده‌اند. طبق این گزارش، مهاجمان معمولاً از تکنیک لورا (LoRA) — که شبیه به نصب یک افزونه‌ی کوچک روی یک نرم‌افزار پیچیده برای تغییر عملکرد آن است — استفاده می‌کنند تا مدل‌های متن‌باز را به‌سرعت برای اهداف غیرقانونی تخصصی کنند.

سوریakumar اشاره کرد که این روش یک «نقطه کور عظیم» را که مجرمان از آن سوءاستفاده می‌کردند، پوشانده و مسیر جدیدی را برای سازمان‌های اجرای قانون و پلتفرم‌های میزبانی فراهم می‌کند تا قابلیت‌های مدل‌ها را بسنجند. این پژوهش تا حدی توسط بورس پژوهشی Bridgewater AIA Labs حمایت شده و با مشارکت لنا استمپفل (پژوهشگر پسادکتری MIT) و همکارانی از دانشگاه بوستون و سازمان غیرانتفاعی Thorn انجام شده است.

همان‌طور که در پوشش پیشین ما درباره‌ی امنیت مدل‌های بازمتن دیدیم، کنترل لایه‌های میانی مدل‌ها دشوارترین بخش نظارت است. مشکل اصلی این بود که طبق قوانین ایالات متحده و بسیاری از کشورهای دیگر، تولید محتوای CSAM — حتی برای اهداف تست و نظارتی — غیرقانونی است. همچنین بررسی دستی این حجم از داده‌ها، مقیاس‌پذیر نیست و باعث ضربه‌های شدید روانی به ناظران انسانی می‌شود.

برای حل این تناقض قانونی، تیم MIT و سازمان Thorn روشی به نام «کاوش گوسی» (Gaussian probing) را ابداع کردند که جزئیات آن در مقاله‌ای در کنفرانس بین‌المللی یادگیری ماشین (ICML) ارائه شد. مکانیزم این روش به شرح زیر است:

  • تزریق نقاط داده‌ی تصادفی به مدل برای مشاهده‌ی نحوه تغییر نمایش‌های (Representations) داخلی.
  • تحلیل دقیق آداپتورهای لورا (LoRA) که لایه‌های سبک‌وزنی برای سفارشی‌سازی مدل‌های پایه هستند.
  • ثبت و میانگین‌گیری از این تغییرات در لایه‌های مختلف برای شناسایی «اثر انگشت» منحصر‌به‌فردِ هدفِ آن مدل.

به نقل از سوریakumar، در این فرآیند مدل هرگز تا مرحله تولید خروجی اجرا نمی‌شود و بنابراین هیچ تصویری ساخته نمی‌شود. در تست‌های انجام‌شده روی سه نوع مدل مختلف، این روش به صحت ۱۰۰ درصدی در شناسایی نسخه‌های تنظیم‌شده روی CSAM دست یافت و حتی توانست آن‌ها را از سایر محتواهای مضر اما غیر CSAM تشخیص دهد.

این قابلیت برای قطب‌های میزبانی مدل مانند Hugging Face یا Civitai یک تغییر استراتژیک است. چون این فرآیند به محاسبات بسیار اندکی نیاز دارد و نیازی به تولید تصویر نیست، پلتفرم‌ها می‌توانند پیش از انتشار مدل‌های خطرناک، آن‌ها را به‌صورت خودکار غربال کنند. همچنین دور زدن این سیستم برای مهاجمان دشوارتر از فیلترهای متنی (Prompt filters) است؛ زیرا یک کاربر بدخواه برای پنهان کردن این اثر انگشت، باید کل معماری مدل پایه را تغییر دهد.

پروفسور ویلسون تأکید کرد که بسیاری از کودکان توسط جعل‌های عمیق (Deepfakes) آسیب می‌بینند و جامعه پژوهشی باید توجه بیشتری به این بحران کند. پروفسور قاسمی افزود که این همکاری به آن‌ها اجازه داده تا با یک «مشکل بسیار سخت» مقابله کنند که کودکان را در سطح ملی و جهانی دچار آسیب می‌کند.

با این حال، این سپر حفاظتی مطلق نیست. تحلیلگران اشاره می‌کنند مدل‌هایی که از ابتدا (from scratch) روی داده‌های سوءاستفاده‌آمیز آموزش دیده‌اند یا از روش‌های جایگزین لورا برای تنظیم استفاده می‌کنند، ممکن است هنوز از این فیلتر عبور کنند. این چالش‌ها یادآور مناقشات حقوقی گسترده‌تری است، مانند شکایت علیه متا بابت استفاده از داده‌های غیرقانونی برای آموزش مدل‌ها که بر پیچیدگی‌های اخلاقی جمع‌آوری داده‌ها تأکید دارد.

در حال حاضر، پژوهشگران قصد دارند دامنه کاربرد این ابزار را گسترش دهند. هدف آن‌ها این است که تشخیص دهند آیا کاوش گوسی می‌تواند قابلیت‌های مضر را در مدل‌های بنیادی، حتی پیش از آغاز هرگونه تنظیم دقیق (Fine-tuning)، شناسایی کند تا احتمال سوءاستفاده را پیش از شروع متوقف نماید. این رویکرد پیش‌گیرانه می‌تواند به تکامل سیستم‌هایی نظیر پلتفرم FLARE-AI کمک کند که هدفش رصد و شفاف‌سازی خطاهای مدل‌های هوش مصنوعی است.

گام بعدی شما

  • اگر مدیر پلتفرم میزبانی مدل هستید، قابلیت‌های شناسایی بدون استنتاج را در نقشه راه امنیتی خود بگنجانید.
  • برای توسعه‌دهندگان، مطالعه‌ی مقاله‌ی Gaussian probing در کنفرانس ICML برای درک تفسیرپذیری مدل‌ها ضروری است.
  • چشم به نسخه‌ی گسترش‌یافته‌ی این ابزار باشید که هدفش شناسایی قابلیت‌های مضر در مدل‌های بنیادی است، حتی پیش از آغاز تنظیم دقیق.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است؛ اثر این روش بر کاهش هزینه‌های GPU در مقیاس صنعتی را در تحلیل بعدی بررسی خواهیم کرد.

چرا این موضوع مهم است؟

این روش با تکیه بر اعتبار علمی MIT و سازمان Thorn، بن‌بست قانونی نظارت بر محتوای غیرقانونی را می‌شکند. نتیجه این است که پلتفرم‌های توزیع مدل اکنون ابزاری برای توقف انتشار مدل‌های خطرناک پیش از دسترسی کاربران دارند.

تأثیر برای ایران

این دستاورد بیشتر برای پژوهشگران مدل‌های بنیادی و متخصصان امنیت سایبری در ایران اهمیت دارد تا کاربران عادی؛ زیرا ابزاری برای شناسایی مدل‌های دست‌کاری شده در محیط‌های متن‌باز فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی «تولید محتوا» با «تحلیل لایه‌ها» برای نظارت، پارادایم ایمنی هوش مصنوعی را از واکنش (Reaction) به پیش‌بینی (Prediction) تغییر می‌دهد. این رویکرد نشان می‌دهد که وزن‌های مدل (Weights) حاوی اطلاعاتی بسیار شفاف‌تر از خروجی‌های مدل هستند و احتمالاً در آینده شاهد ظهور «آنتی‌ویروس‌های مدل» خواهیم بود که بدون اجرای کد، بدافزار یا سوگیری را شناس می‌کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.