پرش به محتوای اصلی
پرش به محتوای مقاله

درون نبرد Cara با اسکرایپرهای هوش مصنوعی و تولد Lantern

·۶ شهریور ۱۴۰۵۷ دقیقه مطالعه۱ بازدید
ساخت ابزار کمکی برای هنرمندان پس از استفاده از آثارشان برای هوش مصنوعی
ساخت ابزار کمکی برای هنرمندان پس از استفاده از آثارشان برای هوش مصنوعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر پارادایم از «جلوگیری از استخراج» (که شکست خورد) به «ردیابی اثر انگشت داده‌ها» در مجموعه‌های AI از طریق ابزار متن‌باز Lantern.

تصور کنید تمام پرتفولیوی دیجیتال شما — حاصل سال‌ها تلاش — تنها با ۱۰ دلار هزینه و در چند دقیقه توسط یک غریبه دزدیده شود. این کابوس برای ۱.۵ میلیون کاربر پلتفرم Cara به واقعیت تبدیل شد. در اوت ۲۰۲۴، یک آرشیو ۱۲ ترابایتی شامل ۱۲ میلیون اثر هنری از این پلتفرم در یک حمله هدفمند استخراج شد. این اتفاق نشان می‌دهد که حتی سایت‌هایی که به‌طور اختصاصی برای محافظت از هنرمندان ساخته شده‌اند، در برابر استخراج داده (Scraping) — شبیه به یک جاروبرقی دیجیتال که هر چه در صفحه می‌بیند را می‌مکد و ذخیره می‌کند — به‌شدت آسیب‌پذیر هستند.

Cara یک اپلیکیشن رسانه اجتماعی و پورتفولیو است که توسط جینگنا ژانگ (Jingna Zhang) و تیمی از داوطلبان تأسیس شد. این تیم از اوایل سال ۲۰۲۳ به‌طور خستگی‌ناپذیری روی این پروژه کار کرده‌اند. این پلتفرم به ۱.۵ میلیون کاربر رسیده است؛ هنرمندانی که به دنبال جایگزینی برای پلتفرم‌های غول‌های فناوری مانند اینستاگرام هستند. در اینستاگرام، محتوا به‌طور صریح در اختیار شرکت متا برای آموزش هوش مصنوعی قرار دارد. انگیزه اصلی این هنرمندان، مخالفت مشترک با استفاده غیرمجاز از آثارشان برای آموزش مدل‌های AI و تمایل به نمایش آثارشان بدون مورد استثمار قرار گرفتن است.

برای مقابله با این استثمار، Cara تصاویر تولید شده توسط هوش مصنوعی را فیلتر می‌کند و ابزارهایی مانند Glaze را ادغام کرده است. Glaze استایل تصاویر را ماسک می‌کند تا تقلید توسط هوش مصنوعی را مختل کند؛ در واقع این ابزار استایل تصاویری که توسط اسکرپرها برداشته می‌شوند را تغییر می‌دهد تا مدل AI نتواند آن را به‌درستی یاد بگیرد. اما به نقل از ژانگ، جلوگیری کامل از خودِ فرآیند استخراج داده‌ها (Scraping) تقریباً غیرممکن است.

زمینه و جزئیات حملات متوالی

با وجود این تدابیر حفاظتی، این پلتفرم از ۱۳ اوت ۲۰۲۴ با سه موج حمله بزرگ مواجه شد. اولین حمله توسط کاربری به نام MandarinDawnPoppy994 انجام شد. او مجموعه‌داده‌ای عظیم را استخراج کرد که در واقع کل کتابخانه تصاویر عمومی موجود در سایت بود و آن را در ساب‌ردیت r/DefendingAIArt منتشر کرد.

این مهاجم در پستی که بعدها حذف شد، این سرقت داده‌ها را یک «پروژه سرگرم‌کننده» توصیف کرد. ژانگ تنها زمانی متوجه این حمله شد که کاربران او را تگ کردند؛ زیرا مهاجم در ردیت در حال «فخرفروشی» بود و به دنبال افراد دیگری می‌گشت تا به او بپیوندند و با این مجموعه‌داده کاری انجام دهند. این اتفاق باعث شکل‌گیری بحث‌های شدیدی در تالارهای گفتگو مربوط به هوش مصنوعی درباره اخلاقیات این نوع برداشت داده‌ها شد. ژانگ این اقدام را هدفمند و آسیب‌زننده توصیف می‌کند و اشاره می‌کند که قوانین فعلی هنوز برای محافظت از خالقان اثر در برابر چنین برداشت‌هایی به‌روز نشده‌اند. این خلأ قانونی به این معناست که اسکرپرها اغلب می‌توانند اقدامات خود را از نظر فنی «قانونی» توجیه کنند.

موج حملات تقلیدی

نقض امنیتی اولیه، بازیگران دیگر را جسور کرد تا از منابع محدود Cara سوءاستفاده کنند. در حالی که برخی طرفداران هوش مصنوعی به این حمله اعتراض کردند، برخی دیگر از اقدام MandarinDawnPoppy994 الهام گرفتند تا حملاتی را انجام دهند که ژانگ آن‌ها را حملات «تقلیدی» می‌نامد.

  • حمله دوم: اسکرپری با نام کاربری CaptiveDreamer حدود ۸.۵ میلیون لینک و متاداده، شامل نام‌های کاربری، عناوین آثار و تگ‌ها را استخراج کرد. این داده‌ها در Hugging Face، که پلتفرمی برای توسعه‌دهندگان هوش مصنوعی است، آپلود شدند. در پاسخ به درخواست‌های متعدد برای حذف، Hugging Face اعلام کرد که به کاربر اطلاع می‌دهد تا متاداده‌های شخصی را حذف کند. با این حال، این پلتفرم از حذف URLها خودداری کرد و استدلال کرد که چون نسخه‌های آثار هنری در سایت آن‌ها میزبانی نمی‌شود و فقط لینک‌هایی به Cara وجود دارد، گزارش‌های کپی‌رایت تأثیری در نتیجه نخواهد داشت.
  • حمله سوم: در ۲۲ اوت ۲۰۲۴، مهاجم سومی موفق شد ۱۲۳ هزار تصویر را به همراه پست‌های متنی و بیوگرافی کاربران که حاوی اطلاعات شخصی بود، به دست آورد. این داده‌ها در سایتی به نام Academic Torrents به اشتراک گذاشته شدند.

از ترولینگ تا همکاری غیرمنتظره

در یک چرخش غیرمنتظره، مهاجم اول — که دانشجوی نرم‌افزار در آمریکای شمالی با علاقه به پروژه‌های آرشیوی و حفظ دیجیتال است و اکنون با نام Heft شناخته می‌شود — پس از مشاهده فشار روانی وارد شده بر هنرمندان، ابراز پشیمانی کرد. او به دلیل دریافت تهدیدهای مرگ و افشای اطلاعات شخصی (Doxing)، درخواست کرد که از نام مستعار استفاده شود.

Heft اعتراف می‌کند که استخراج داده‌های Cara در ابتدا یک پروژه فنی بود و او قصدی برای عمومی کردن داده‌ها نداشت. او تصمیم خود برای پست کردن در ردیت را یک «تصمیم احمقانه» توصیف کرد که هدفش «جلب توجه از طریق ایجاد خشم» (Ragebait) در جامعه بود و اعتراف کرد که در اثر «ترول کردن» در کامنت‌ها، کنترل خود را از دست داده است.

او زمانی تکان خورد که متوجه پیامدهای واقعی شد؛ زمانی که دید هنرمندان گزارش می‌دهند دچار حملات پانیک شده‌اند و تمام پورتفولیوهای خود را از اینترنت پاک می‌کنند. او پذیرفت که هدف قرار دادن Cara و ارائه داده‌ها به آن شکل، «بی‌رحمانه و نسنجیده» بوده است.

اکنون Heft به عنوان یک متخصص رفع اشکال در سرور دیسکورد Cara فعالیت می‌کند. او به ژانگ کمک می‌کند تا نقاط ضعف ساختاری امنیت سایت را شناسایی کند و نشان می‌دهد که دفاع‌های فعلی چقدر راحت دور زده می‌شوند. ژانگ اشاره می‌کند که وقتی ابزار یا طراحی جدیدی پیشنهاد می‌شود، Heft اغلب می‌تواند توضیح دهد که چطور در عرض چند دقیقه، به‌طور واقعی، آن را می‌شکند.

پروژه Lantern: ردیابی به‌جای دیوارکشی

چون Heft معتقد است هیچ سایتی نمی‌تواند به‌طور واقعی «غیرقابل استخراج» باشد، او و ژانگ در حال همکاری روی یک ابزار مقابله‌ای متن‌باز به نام Lantern هستند. این ابزار یک راهکار ناقص است که از خلأهای نظارتی فعلی الهام گرفته شده است.

  • سازوکار: Lantern به هنرمندان اجازه می‌دهد یک «اثر انگشت یک‌طرفه» برای تصاویر خود ایجاد کنند، بدون اینکه خودِ تصاویر در پلتفرم ذخیره شوند.
  • عملکرد: این ابزار به‌طور منظم مجموعه‌داده‌های جدید و عمومی تصاویر هوش مصنوعی را برای یافتن این اثر انگشت‌ها اسکن می‌کند.
  • نتیجه: هرگاه تطابقی پیدا شود، هنرمند یک اعلان و لینک مستقیم به آن مجموعه‌داده دریافت می‌کند تا بتواند درخواست حذف یا ارسال اخطاریه حذف محتوا (Takedown notice) را بدهد.

از آنجایی که این پروژه متن‌باز است، هر کسی می‌تواند در کدنویسی آن مشارکت کند. هدف این است که به هنرمندان آگاهی داده شود که محتوای آن‌ها چگونه در سراسر وب جمع‌آوری می‌شود، فارغ از اینکه شرایط خدمات (Terms of Service) یک وب‌سایت چه باشد.

نبرد حقوقی و مالی

ژانگ برای مبارزه با این حملات، کمپینی در GoFundMe برای پوشش هزینه‌های قانونی راه انداخت و هدفی ۱۲۰ هزار دلاری تعیین کرد. تا اواخر اوت، او بیش از ۱۰۰ هزار دلار جمع‌آوری کرده است تا تمام استراتژی‌های دفاع از Cara را از طریق قوانین سایبری و کپی‌رایت بررسی کند. Cara همچنان به‌طور فعال به دنبال کمک‌های حقوقی بیشتر است.

علاوه بر این، ژانگ در حال حاضر در دو شکایت دسته‌جمعی مجزا که توسط هنرمندان بصری مطرح شده، مشارکت دارد. یکی از این شکایت‌ها Stability AI، Midjourney و دیگران را هدف قرار داده و دومی علیه گوگل است. هر دو شکایت مدعی هستند که ابزارهای تولید تصویر این شرکت‌ها بدون اجازه، روی آثار دارای کپی‌رایت آموزش دیده‌اند.

واقعیت امنیت دیجیتال

ژانگ به کاربران هشدار می‌دهد که هیچ پلتفرمی نمی‌تواند امنیت کامل را تضمین کند. او اشاره می‌کند که پلتفرم‌های بزرگ‌تر حتی بیشتر استخراج می‌شوند، بنابراین جابجایی به یک سایت دیگر لزوماً ایمنی را افزایش نمی‌دهد. او از کسانی که تصمیم می‌گیرند آثار خود را پاک کنند و Cara را ترک کنند تا احساس بهتری داشته باشند حمایت می‌کند، اما نسبت به این تصور غلط که سایت‌های دیگر امن‌تر هستند، هشدار می‌دهد.

تدابیر موقتی مانند «درگاه‌های ورود» (Login gates) اجرا شده‌اند، اما ژانگ این‌ها را وصله‌های موقت می‌بیند و نه راه حلی برای مشکلی که در سطح کل اینترنت وجود دارد. او از سردرگمی درباره آنچه تیم می‌تواند به‌طور واقع‌بینانه برای محافظت از هنرمندان در برابر بازیگران بدخواه انجام دهد، ابراز ناامیدی می‌کند.

ژانگ امیدوار است حوادث Cara سیاست‌گذاران را ترغیب کند تا فراتر از کپی‌رایت — که آن را تنها تکه‌ای از یک پازل پیچیده می‌داند — به موضوع گسترده‌تر «استخراج بدخواهانه داده‌ها» بپردازند. او هشدار می‌دهد که «حمله شدن توسط هوش مصنوعی قرار است بسیار بسیار رایج شود» و اشاره می‌کند که اکثر مهاجمان هرگز عذرخواهی نخواهند کرد یا سعی نخواهند کرد اوضاع را درست کنند. این چالش‌ها در واقع بخشی از یک الگوی بزرگ‌تر از شکست سیستم‌های حفاظتی است؛ مشابه آنچه در تلاش توسعه‌دهندگان برای دور زدن پروتکل‌های شناسایی متون Claude مشاهده شد که نشان داد حتی پیشرفته‌ترین واترمارک‌ها نیز آسیب‌پذیر هستند.

این تغییر رویکرد از «ماسک کردن دفاعی» به «ردیابی فعال»، نشان‌دهنده مرحله جدیدی در تضاد بین هنرمندان و هوش مصنوعی است. به‌جای تلاش برای ساخت دیواری که به‌ناچار شکسته خواهد شد، خالقان آثار به سمت مدلی از «اثبات اصالت» و «سیستم اعلان» حرکت می‌کنند.

گام بعدی شما

  • اگر هنرمند هستید، ابزارهای تغییر استایل مثل Glaze را برای لایه‌بندی حفاظتی روی آثارتان امتحان کنید.
  • برای ردیابی آثار خود در مجموعه‌های AI، منتظر انتشار نسخه نهایی Lantern باشید.
  • بررسی کنید که در تنظیمات حریم خصوصی پلتفرم‌های فعلی‌تان، دسترسی ربات‌ها تا چه حد محدود شده است.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell و قدرت پردازش استخراج داده‌ها مراجعه کنید.

چرا این موضوع مهم است؟

این پرونده نشان می‌دهد که حتی سخت‌گیرانه‌ترین سیاست‌های حفاظتی در برابر ابزارهای استخراج داده ارزان‌قیمت شکست می‌خورند. اعتبار این اتفاق در همکاری مستقیم قربانی و مهاجم است که ثابت می‌کند تنها راه مقابله، درک دقیق سازوکار حمله است.

تأثیر برای ایران

برای هنرمندان و طراحان ایرانی که آثارشان در پلتفرم‌های جهانی منتشر می‌شود، ابزار Lantern می‌تواند تنها راه شناسایی میزان استفاده از آثارشان در مدل‌های خارجی باشد، چرا که دسترسی به مسیرهای حقوقی بین‌المللی برای آن‌ها دشوار است.

·نگاه ما
تحریریه دات‌هوش

تغییر استراتژی Cara از «دیوارکشی» به «ردیابی»، پذیرش یک واقعیت تلخ در عصر وب است: در برابر اسکرپرهای مدرن، هیچ قلع و بوری وجود ندارد. Lantern در واقع پذیرش مدل «شفافیت پس از وقوع» است که به جای توهم امنیت، به هنرمندان ابزار نظارت می‌دهد. این رویکرد احتمالاً به استاندارد جدیدی برای مدیریت مالکیت معنوی در فضای باز تبدیل خواهد شد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.