پرش به محتوای اصلی
پرش به محتوای مقاله

درون پروندهٔ حقوقی Gemini؛ تلاش برای پنهان کردن سرقت داده‌های متنی

·۲۳ تیر ۱۴۰۵۳ دقیقه مطالعه۱ بازدید
شکایت ناشران بزرگ از گوگل بابت آموزش هوش مصنوعی
شکایت ناشران بزرگ از گوگل بابت آموزش هوش مصنوعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اتهام «پاک‌سازی عمدی نشانه‌های کپی‌رایت» برای پنهان کردن سرقت داده‌ها؛ این یعنی بحث از اشتباه در تفسیر قانون فراتر رفته و وارد حوزه «فریب سازمان‌یافته» شده است.

تصور کنید نویسنده‌ای سال‌ها برای خلق یک اثر وقت گذاشته باشد، اما حالا غول‌های فناوری از همان کلمات برای ساخت ماشینی استفاده کنند که جایگزین نویسنده شود. این همان نقطه‌ای است که یک شکایت دسته‌جمعی در ۱۴ ژوئیه ۲۰۲۶، گوگل را در دادگاه نیویورک هدف قرار داد.

به نقل از اسناد دادگاه، ناشران بزرگی چون Hachette، Cengage و Elsevier به همراه نویسندگانی چون اسکات تورو، مدعی شده‌اند که گوگل برای ارتقای هوش مصنوعی زاینده (Generative AI) — تکنولوژی‌ای شبیه به یک نقاش دیجیتال که با یادگیری الگوهای میلیون‌ها اثر، تصاویر یا متون جدید می‌سازد — از آثار protected آن‌ها بدون اجازه استفاده کرده است.

این نبرد حقوقی در حالی رخ می‌دهد که آزمایشگاه‌های AI با موجی از چالش‌های کپی‌رایت مواجه‌اند. این تقابلات در حوزه‌های مختلف ادامه دارد و برای مثال، نبرد Midjourney با استودیوهای هالیوود نیز بر محوریت افشای داده‌های آموزشی مدل‌ها شکل گرفته است. همان‌طور که در تحلیل قبلی ما درباره‌ی ادغام تصاویر AI در جست‌وجوی گوگل اشاره کردیم، تمرکز شرکت‌ها بر خروجی‌ها بود، اما این پرونده مستقیماً «دیتا» یا همان مواد اولیه ساخت مدل‌ها را هدف می‌گیرد. بحث اصلی اینجا است که آیا آموزش مدل‌های بنیادی بر اساس قانون قدیمی «استفاده منصفانه» (Fair Use) آمریکا مجاز است یا خیر.

طبق گزارش ارسال‌شده به دادگاه منطقه جنوبی نیویورک، گوگل از شراکت‌های قبلی خود برای تغذیه مدل Gemini سوءاستفاده کرده است. جزئیات این اتهامات عبارتند از:

  • سوءاستفاده از Google Books: ناشران اجازه نمایش بخش‌های کوتاهی (snippets) را داده بودند، اما گوگل احتمالاً نسخه‌های کامل کتاب‌ها را برای آموزش مدل به کار برد.
  • فروشگاه Google Play: اتهام وارد شده این است که گوگل کتاب‌های آپلودشده در استور خود را بدون اجازه صریح نویسندگان، به خورد مدل داده است.
  • پاک‌سازی داده‌ها (Data Scrubbing): ادعا شده که گوگل برای پنهان کردن منشأ داده‌های سرقتی، نشانه‌های کپی‌رایت را تغییر داده یا حذف کرده است.

بر اساس مستندات داخلی گوگل که در پرونده ذکر شده، این شرکت از ریسک‌های این اقدام آگاه بوده است. در یکی از این اسناد هشدار داده شده که استفاده از کتاب‌های دارای کپی‌رایت می‌تواند «بسیار مشکل‌ساز» باشد و جریمه‌هایی بین ۱۰ تا ۱۰۰ میلیارد دلار در پی داشته باشد.

این پرونده یک تغییر مسیر جدی در فضای حقوقی است. این فشارها در سطح بین‌المللی نیز دیده می‌شود و تلاش گوگل برای تغییر حکم دادگاه مونیخ نشان می‌دهد که این شرکت در اروپا نیز با چالش‌های جدی در مورد مسئولیت حقوقی AI دست و پنجه نرم می‌کند. اگرچه برخی دادگاه‌های کالیفرنیا با شرکت‌های AI همدل بوده‌اند، اما جریمه ۱.۵ میلیارد دلاری Anthropic برای دزدی داده‌های آموزشی نشان می‌دهد که دفاع با عنوان «استفاده منصفانه» دیگر سپر مطلق این شرکت‌ها نیست.

برای هر تولیدکننده محتوا یا صاحب کسب‌وکار، این یعنی دوران «داده‌های آموزشی رایگان» به پایان می‌رسد. اگر دادگاه نیویورک علیه گوگل رأی دهد، شرکت‌های AI مجبور خواهند شد برای هر کتاب، مقاله یا مجموعه داده‌ای که می‌بلعند، هزینه‌های لایسنس سنگینی پرداخت کنند.

گوگل هنوز به این اتهامات پاسخ نداده است. نتیجه این دادگاه مشخص می‌کند که مدل‌ها می‌توانند به رشد با داده‌های وب عمومی ادامه دهند یا باید به سمت مخازن دارای مجوز (Licensed) حرکت کنند.

گام بعدی شما

  • اگر تولیدکننده محتوا هستید، شرایط استفاده از داده‌هایتان در پلتفرم‌های توزیع دیجیتال را بازنگری کنید.
  • رای دادگاه نیویورک درباره «استفاده منصفانه» را دنبال کنید؛ این رای استانداردهای مالی آینده AI را تعیین می‌کند.
  • ابزارهای شناسایی اثر (Watermarking) را بررسی کنید تا متوجه شوید محتوای شما چگونه در داده‌های آموزشی شناسایی می‌شود.

اما اثر این جریمه‌های احتمالی بر قیمت اشتراک‌های ماهانه Gemini چه خواهد بود؟ این موضوع را در بررسی مدل‌های درآمدی AI دنبال کنید.

چرا این موضوع مهم است؟

این پرونده اعتبار سیستم کپی‌رایت جهانی را در برابر محاسبات AI می‌سنجد. اگر گوگل شکست بخورد، هزینه استنتاج و آموزش مدل‌ها به دلیل پرداخت لایسنس‌ها به شدت افزایش می‌یابد.

تأثیر برای ایران

این پرونده اثر مستقیمی بر کاربران ایرانی ندارد، اما می‌تواند باعث شود شرکت‌های AI برای کاهش هزینه‌ها، دسترسی به داده‌های رایگان وب را محدودتر کنند.

·نگاه ما
تحریریه دات‌هوش

این پرونده نشان می‌دهد که استراتژی «اول رشد، بعد پرداخت» برای مدل‌های زبانی دیگر کار نمی‌کند. گوگل با تکیه بر زیرساخت‌های عظیمی مثل Google Books، دسترسی به داده‌ای داشت که رقبای کوچک‌تر را مجبور به خرید لایسنس کرد؛ حالا این مزیت رقابتی به یک نقطه ضعف حقوقی تبدیل شده است. احتمالاً شاهد گذار از «دزدی سیستماتیک» به «کارتل‌های داده» خواهیم بود، جایی که فقط غول‌های مالی می‌توانند به داده‌های باکیفیت دسترسی داشته باشند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.