پرش به محتوای اصلی
پرش به محتوای مقاله

متهمان OpenAI: حذف میلیاردها داده برای پنهان کردن سرقت آثار خبری

·۱۸ تیر ۱۴۰۵۳ دقیقه مطالعه
روزنامه نیویورک تایمز: اوپن‌ای‌ای در دادگاه نقض کپی‌رایت چت‌جی‌پی‌تی، شواهد را پنهان کرده است
روزنامه نیویورک تایمز: اوپن‌ای‌ای در دادگاه نقض کپی‌رایت چت‌جی‌پی‌تی، شواهد را پنهان کرده است
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

افشای وجود «پروژه زرافه» و پایگاه داده‌ای برای ردیابی نقض حق چاپ، نشان می‌دهد OpenAI برخلاف ادعاهای رسمی، از ابتدا ابزار شناسایی سرقت محتوا را داشته اما آن را پنهان کرده است.

تصور کنید شرکتی ادعا کند راهی برای یافتن یک کلمه در کتابخانه عظیم خود ندارد، اما در پشت صحنه، فهرست دقیقی از تمام جملات سرقت‌شده را نگه داشته است. این همان اتهامی است که اکنون نیویورک تایمز (The New York Times) و دیلی نیوز (The Daily News) علیه OpenAI در دادگاه مطرح کرده‌اند. این دو رسانه از قاضی خواسته‌اند تا OpenAI را به دلیل دست‌کاری عمدی در فرآیند «کشف شواهد» (Discovery process) در جریان یک دادگاه جاری مربوط به حق چاپ، تادیب و مجازات کند.

به گزارش این دو رسانه، غول هوش مصنوعی آگاهانه شواهدی را پنهان کرده است که نشان می‌دهد مدل‌هایش چگونه تکه‌هایی از مقالات ژورنالیستی محافظت‌شده را بازتولید می‌کنند. این تقابل حقوقی از دو سال پیش آغاز شد؛ زمانی که ادعا شد OpenAI مدل‌های خود را با محتوای دارای حق چاپ آموزش داده و همچنان این مطالب ژورنالیستی را در خروجی‌های خود به کاربران تحویل می‌دهد. این پرونده یادآور چالش‌های مشابه در صنعت است، مانند زمانی که متا با اتهامات جدی و جریمه‌های احتمالی سنگین به دلیل دانلود غیرقانونی داده‌ها برای آموزش هوش مصنوعی مواجه شد. همان‌طور که در تحلیل قبلی ما درباره‌ی بهینه‌سازی‌های GPT-5.6 Sol اشاره کردیم، تمرکز شرکت بر افزایش بهره‌وری در نسخه‌های جدید است، اما اکنون تمام نگاه‌ها به داده‌های اولیه و «مبنی‌سازی» (Grounding) — یعنی همان فرآیند متصل کردن پاسخ‌های مدل به منابع واقعی برای جلوگیری از توهم — دوخته شده است.

ابهام در توانایی فنی و زمینه پرونده

OpenAI همواره استدلال کرده است که فاقد توانایی فنی برای جست‌وجو در مجموعه داده‌های آموزشی (Training Corpus) خود است. این شرکت ادعا می‌کرد که جست‌وجو در کلکسیون عظیم گفتگوهای ChatGPT از نظر فنی بسیار обреارده و دشوار است. علاوه بر این، OpenAI به نگرانی‌های مربوط به حریم خصوصی کاربران اشاره کرد و مدعی شد که گزارش‌ها (Logs) باید ابتدا بازیابی، پردازش و سپس «ناشناس‌سازی» شوند تا قابل ارائه باشند.

اما شاکیان به دنبال دسترسی به این داده‌ها بودند تا تعیین کنند آیا مقالات ژورنالیستی دارای حق چاپ آن‌ها در مجموعه آموزشی حضور دارد یا خیر. هدف آن‌ها اثبات این نکته است که ChatGPT هر چند وقت یک‌بار با بازتولید عین محتوای آن‌ها، پاسخ‌های خود را تولید کرده است.

طبق گزارش تک‌کرانچ (TechCrunch)، شاکیان ادعا می‌کنند OpenAI توانایی فنی خود برای جست‌وجو در داده‌های آموزشی را انکار کرده بود. با این حال، در یک جلسه بازجویی تحت دستور دادگاه در آوریل ۲۰۲۶، وینی موناکو (Vinnie Monaco)، مهندس حریم خصوصی داده‌ها، ظاهراً فاش کرد که شرکت پیش از این جست‌وجوهای داخلی گسترده‌ای را برای یافتن آثار دارای حق چاپ انجام داده بود.

شکاف شواهد و پروژه زرافه

شاکیان به سازوکارهای فنی خاص و مجموعه‌-داده‌هایی اشاره می‌کنند که معتقدند OpenAI سعی در پنهان کردن آن‌ها داشته است:

  • پایگاه داده داخلی: ادعا شده OpenAI پیش از ثبت شکایت، پایگاه داده‌ای شامل ۷۸ میلیون گفتگوی ناشناس از ChatGPT ساخته بود تا موارد نقض حق چاپ را به‌صورت داخلی ردیابی کند.
  • پروژه زرافه (Project Giraffe): گزارش شده است که این شرکت ابزاری را تحت عنوان «پروژه زرافه» پیاده‌سازی کرد که در آن از یک «فیلتر بلوم» (Bloom filter) برای شناسایی و ثبت هرگونه «بازگشت» (Regurgitation) یا تکرار عین جملات محتوای آموزشی در خروجی‌ها، درست پس از شروع دادگاه، استفاده می‌کرد.
  • پاک‌سازی داده‌ها: در دسامبر ۲۰۲۵، OpenAI نمونه‌ای از ۲۰ میلیون گزارش چت را به دادگاه ارائه کرد، اما دادگاه این نمونه‌ها را به دلیل حذف‌های گسترده و پوشاندن اطلاعات (Redaction)، «غیرقابل استفاده» خواند.

جنگ بر سر دسترسی به داده‌ها و اختلافات حقوقی

تفاوت میان آنچه درخواست شده و آنچه تحویل داده شده بسیار زیاد است. شاکیان در ابتدا نمونه‌ای از ۱۲۰ میلیون گزارش چت را خواسته بودند که پس از مذاکرات، OpenAI این تعداد را به ۲۰ میلیون کاهش داد.

نیویورک تایمز همچنین مدعی است که OpenAI میلیاردها خروجی ChatGPT را در تضاد مستقیم با دستور دادگاه برای «حفظ شواهد» (Preservation order) حذف کرده و میلیون‌ها گزارش دیگر را در نمونه‌های درخواستی با داده‌های جایگزین عوض کرده است.

ایان بی. کراسبی (Ian B. Crosby)، وکیل ارشد شاکیان، در این باره stated: «اگر OpenAI واقعاً باور داشت کپی‌برداری از آثار مشتریان ما منصفانه و قانونی است، حقیقت را درباره انجام این کار پنهان نمی‌کرد.»

این وضعیت نشان‌دهنده یک تلاش سیستماتیک برای مبهم‌سازی نحوه «مبنی‌سازی» پاسخ‌های AI بر اساس مقالات خبری خاص است. اگر دادگاه این ادعاها را بپذیرد، ممکن است OpenAI را از ارائه نمونه‌های فعلی گزارش چت به عنوان مدرک محروم کند و شرکت را مجبور نماید تا هزینه‌های قانونی شاکیان را بپردازد. همچنین شاکیان از دادگاه خواسته‌اند تا این موضوع را به عنوان یک «واقعیت پذیرفته‌شده» قبول کند که گزارش‌ها نشان‌دهنده بازگشت گسترده محتوا بوده‌اند.

برای صنعت هوش مصنوعی، این پرونده از یک بحث ساده درباره «استفاده منصفانه» (Fair Use) به مسئله‌ای در مورد شفافیت شرکتی و صداقت حقوقی تبدیل شده است. اگر ثابت شود شرکتی برای پنهان کردن نقض حق چاپ، شواهد را حذف کرده است، جریمه‌های قضایی حاصله می‌تواند رویه‌ای سخت‌گیرانه برای نحوه حسابرسی تمام مجموعه‌های آموزشی مدل‌های زبانی بزرگ (LLM) ایجاد کند.

در مقابل، درو پوشاتری (Drew Pusateri)، سخنگوی OpenAI، این اتهامات را «دروغ آشکار» خوانده است. او مدعی است نیویورک تایمز در حالی که پرونده حقوقی‌اش ضعیف شده، تلاش می‌کند با این ادعاها به حریم خصوصی افرادی که هیچ ارتباطی با این پرونده ندارند دست‌درازی کند. او تاکید می‌کند که شرکت در حال دفاع از اصول دیرینه و پذیرفته‌شده‌ی «استفاده منصفانه» است.

ناظران صنعت اکنون باید منتظر حکم قاضی درباره آن ۲۰ میلیون نمونه گزارش چت باشند؛ زیرا این رای تعیین می‌کند که آیا دادگاه ادعاهای شاکیان مبنی بر «بازگشت گسترده محتوا» را به عنوان یک حقیقت پذیرفته شده قبول می‌کند یا خیر.

گام بعدی شما

  • رای دادگاه درباره پذیرش «بازگشت محتوا» (Regurgitation) به عنوان یک واقعیت پذیرفته‌شده را دنبال کنید؛ این رای می‌تواند استانداردهای آموزشی تمام LLMها را تغییر دهد.
  • بررسی کنید که آیا ابزارهای شناسایی سرقت ادبی فعلی می‌توانند خروجی‌های مدل‌های زبانی بزرگ را ردیابی کنند یا خیر.
  • مدل‌های جایگزینی را امتحان کنید که از روش‌های شفاف‌تر در بازیابی منابع (RAG) استفاده می‌کنند.

اما داستان سخت‌افزاری این تحول و نحوه ذخیره‌سازی این حجم عظیم از داده‌ها حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید. این تلاش برای بهینه‌سازی زیرساختی در کنار استراتژی‌های OpenAI برای خودکارسازی جریان‌های کاری در نسخه‌های جدید GPT-5.6 قرار دارد تا بهره‌وری مدل‌ها را به حداکثر برساند.

چرا این موضوع مهم است؟

این موضوع اعتبار قانونی شرکت‌های AI را به چالش می‌کشد و می‌تواند منجر به وضع قوانین سخت‌گیرانه برای حسابرسی (Audit) داده‌های آموزشی شود. تایید این ادعاها، مدل کسب‌وکار آموزش مدل‌ها بر اساس داده‌های وب را به شدت متزلزل می‌کند.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران مدل‌های بنیادی اهمیت دارد تا بازار مصرف ایران، زیرا نتیجه آن تعیین‌کننده استانداردهای جهانی دسترسی به داده‌های آموزشی خواهد بود.

·نگاه ما
تحریریه دات‌هوش

این پرونده بحث را از «استفاده منصفانه» به «شفافیت شرکتی» تغییر می‌دهد. اگر ثابت شود OpenAI عمداً شواهد را حذف کرده است، احتمالاً شاهد فشار قانونی برای انتشار کامل «لیست داده‌های آموزشی» (Training Set) خواهیم بود؛ اتفاقی که تا امروز به دلیل اسرار تجاری، تابویی مطلق در صنعت AI بوده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.