پرش به محتوای اصلی
پرش به محتوای مقاله

«جایگزینی روزنامه‌نگاری اصیل»؛ محور شکایت حقوقی USA TODAY از OpenAI

·۱۶ مهر ۱۴۰۵۵ دقیقه مطالعه
عکس: نماد USA TODAY در کنار لوگوی OpenAI، نماد دعوای حق نشر مطبوعات با هوش مصنوعی
عکس: نماد USA TODAY در کنار لوگوی OpenAI، نماد دعوای حق نشر مطبوعات با هوش مصنوعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از پیام‌های داخلی OpenAI و مایکروسافت (مانند Project Taxi) برای اثبات قصد عمدی در «حفظ کردن» داده‌ها به جای «یادگیری» از آن‌ها، که یک تغییر استراتژیک در نحوه شکایت از مدل‌های زبانی است.

تصور کنید سال‌ها هزینه کنید تا تیمی از خبرنگاران برنده جایزه پولیتزر را برای افشای حقیقت به میدان بفرستید، اما در نهایت یک چت‌بات تمام دستاوردهای شما را در چند ثانیه خلاصه کند و کاربر را از بازدید از سایت شما منصرف سازد. این کابوس اکنون به یک نبرد حقوقی ۲۵۰ میلیون دلاری در دادگاه فدرال نیویورک تبدیل شده است.

طبق اعلام رسمی، شرکت USA TODAY Co., Inc. در ۸ اکتبر ۲۰۲۶ شکایتی را علیه OpenAI ثبت کرد. این شرکت مدعی است که مدل‌های GPT با استخراج غیرقانونی صدها هزار مقاله از آرشیوهای خبری آن‌ها آموزش دیده‌اند تا خروجی‌هایی تولید کنند که عملاً جایگزین منابع اصلی خبر می‌شوند.

این تقابل حقوقی در حالی رخ می‌دهد که آزمایشگاه‌های هوش مصنوعی با موجی از شکایت‌های مربوط به حق چاپ (Copyright) از سوی صنعت رسانه روبرو هستند. همان‌طور که در تحلیل قبلی ما درباره‌ی نحوه ارجاع‌دهی پلتفرم‌هایی مثل Perplexity و Gemini اشاره کردیم، این پرونده حالا از بحث ساده‌ی «ارجاع» فراتر رفته و به هسته‌ی اصلی نحوه ساخت مدل‌ها می‌پردازد. برای یک رسانه، این موضوع یک مسئله‌ی حیاتی است؛ اگر یک هوش مصنوعی بتواند یک گزارش تحقیقی پیچیده را به‌طور کامل بازتولید کند، انگیزه‌ی کاربر برای پرداخت هزینه اشتراک از بین می‌رود.

جزئیات پرونده و مستندات حقوقی

این پرونده با عنوان USA Today Co., Inc. v. OpenAI Foundation توسط استیون لیبرمن از مؤسسه حقوقی Rothwell, Figg, Ernst & Manbeck در دادگاه منطقه‌ی جنوبی نیویورک ثبت شده است. شاکی برای اثبات ادعای خود، فهرستی از ثبت‌های حق چاپ و نمونه‌هایی از خروجی‌های مدل GPT-5.6 را به دادگاه ارائه کرده است.

برای تسریع در روند رسیدگی، یک «بیانیه مرتبط بودن» (Statement of Relatedness) در همان روز ثبت شد. این درخواست به این معناست که این پرونده به عنوان بخشی از دعاوی تجمیع‌شده‌ی نقض حق چاپ OpenAI که پیش‌تر در همان دادگاه در جریان بوده، بررسی شود. با این اقدام، شاکیان به فهرست بلندی از مالکان حق چاپ می‌پیوندند که علیه OpenAI و سایر شرکت‌های هوش مصنوعی اقدام قانونی کرده‌اند. این فشارها در حالی شدت می‌یابد که برخی تحلیل‌ها هشدار می‌دهند سخت‌گیری بیش از حد در قوانین حق چاپ ممکن است امنیت ملی و رقابت تکنولوژیک آمریکا را به خطر اندازد.

ابعاد استخراج داده‌ها

بر اساس مستندات دادگاه، فرآیند آموزش OpenAI یک مشاهده‌ی غیرفعال از وب نبوده، بلکه یک استخراج هدفمند بوده است. در این شکایت ادعا شده که OpenAI از برنامه‌هایی استفاده کرده که به‌طور خاص برای حذف اطلاعات مدیریت حق چاپ طراحی شده‌اند تا ماهیت حفاظت‌شده‌ی آثار، فارغ از وجود دیوار پرداخت (Paywall) یا محدودیت‌های دسترسی، پنهان شود.

برای اثبات این ادعا، شاکی به شهادت OpenAI در برابر مجلس لردها در دسامبر ۲۰۲۳ استناد کرده است. در آن زمان، OpenAI پذیرفته بود که اگر داده‌های آموزشی را فقط به آثار در مالکیت عمومی محدود کند، نمی‌تواند سیستم‌هایی بسازد که نیازهای فعلی بازار را برآورند، زیرا تقریباً هر فرمی از بیان انسانی تحت پوشش حق چاپ است.

داده‌های عددی ذکر شده در پرونده عبارتند از:

  • WebText: مجموعه‌ی داخلی برای GPT-2 که گفته می‌شود بیش از ۱۶۰ هزار ورودی از شاکیان داشته است (۸۳,۲۶۶ مورد از usatoday.com و ۱۲,۹۹۴ مورد از freep.com).
  • مجموعه داده C4: دامنه‌های این انتشارات بیش از ۱۲۲ میلیون توکن (Token) — تکه‌های کوچکی از متن، شبیه برش‌های یک کیک طولانی که مدل تکه‌تکه می‌خورد — را در این زیرمجموعه اشغال کرده‌اند. این مجموعه در واقع یک زیرمجموعه فیلتر شده از زبان انگلیسی از یک snapshot سال ۲۰۱۹ از آرشیو وب Common Crawl است.
  • ترکیب آموزشی: در GPT-3، داده‌های Common Crawl ۶۰٪ و WebText2 (نسخه گسترش یافته WebText) حدود ۲۲٪ وزن داشتند که نشان‌دهنده اتکای شدید به داده‌های استخراج‌شده از وب است.

اعترافات داخلی و «پروژه تاکسی»

این شکایت تنها به خروجی‌ها تکیه نمی‌کند، بلکه پیام‌های داخلی OpenAI را برای اثبات قصد و نیت به کار گرفته است. به نقل از این مستندات، گرگ بروکمن، یکی از بنیان‌گذاران شرکت، اشاره کرده که مدل‌ها در پیش‌بینی متون خبری بسیار توانمند هستند. همچنین در ارائه‌ای از داریو آمودی در سال ۲۰۲۰، تولید خبر به عنوان یکی از مهارت‌های کلیدی GPT-3 لیست شده بود.

شواهد داخلی تکان‌دهنده‌تر است؛ معاون پژوهشی OpenAI صراحتاً گفته است: «ما شبکه‌های عصبی (Neural Network) — شبکه‌ای از سلول‌های کوچک، شبیه نقشهٔ مترو، که سیگنال را از ورودی به جواب می‌رساند — خود را برای حفظ کردن داده‌های آموزشی تربیت می‌کنیم؛ هدف ما همین است.»

علاوه بر این، پیام‌های داخلی ژوئن ۲۰۲۲ نشان می‌دهد که کارکنان شرکت پذیرفته‌اند GPT-4 حجم عظیمی از داده‌ها را حفظ کرده و در بازتولید (Regurgitating) آن‌ها بسیار مؤثر خواهد بود.

ادعاهای مربوط به نقش مایکروسافت حتی آسیب‌زننده‌تر است. طبق گزارش پرونده، مایکروسافت در یک بازه زمانی سه ساله و تحت طرحی به نام Project Taxi، دسترسی به Bing Index (مجموعه‌ای از میلیاردها صفحه وب استخراج‌شده) را در اختیار OpenAI قرار داده است. این افشاگری‌ها با اسناد داخلی مایکروسافت همسو است که در برخی موارد، فرآیند استخراج داده‌های هوش مصنوعی را به عنوان یک «سرقت گسترده» توصیف کرده‌اند. همچنین گفته می‌شود OpenAI برای اجرای یک خازند (Crawler) مجزا به نام Project Mango به مایکروسافت پول پرداخت کرده است. در این پرونده ادعا شده که فیلترهای خروجی OpenAI نتوانستند محتوای مربوط به نهادهایی که هنوز از شرکت شکایت نکرده بودند را حذف کنند؛ موضوعی که یکی از مدیران مایکروسافت در پیام‌های داخلی آن را یک «پوشش تصادفی» (Accidental cover-up) توصیف کرده است.

مشکل «جایگزینی»

USA TODAY استدلال می‌کند که OpenAI فقط از داده‌ها «یاد نگرفته»، بلکه محصولی ساخته تا جایگزین منبع شود. نمونه‌هایی از GPT-5.6 نشان می‌دهد که مدل خلاصه‌های مفصلی تولید کرده که ساختار سازمان‌یافته‌ی مقالات اصلی را دقیقاً کپی کرده‌اند. این موارد شامل انتشاراتی چون:

  • The Indianapolis Star، Detroit Free Press و The Knoxville News-Sentinel
  • The Palm Beach Post، The Tennessean و The Enquirer
  • The Des Moines Register، The Courier-Journal و Naples Daily News
  • Asbury Park Press، Milwaukee Journal Sentinel و The Columbus Dispatch
  • The Oklahoman و Star News

نقل‌قول‌های داخلی این ادعا را تقویت می‌کند. رئیس بخش ChatGPT در OpenAI پذیرفته است که وقتی کاربر پاسخی را از هوش مصنوعی می‌گیرد، «دلیل مناسبی برای کلیک روی لینک منبع وجود ندارد». همچنین گزارش شده است که یکی از مهندسان OpenAI بیان کرده که کاربران فارغ از اینکه لینک‌ها با چه برجستگی یا وضوحی نمایش داده شوند، روی آن‌ها کلیک نخواهند کرد.

ابعاد مالی و حقوقی

شاکیان بر اساس چارچوب‌های قانونی، مبالغ هنگفتی را طلب کرده‌اند. آن‌ها برای هر مورد نقض عمدی حق چاپ تا ۱۵۰ هزار دلار و برای حذف اطلاعات مدیریت حق چاپ، ۲۵ هزار دلار اضافی درخواست کرده‌اند. با توجه به صدها هزار مقاله، مجموع خسارات بالای ۲۵۰ میلیون دلار برآورد شده است.

این پرونده ۱۹ نشریه متعلق به USA TODAY Co. را نمایندگی می‌کند (که پیش‌تر با نام Gannett Co., Inc. شناخته می‌شد)، شرکت رسانه‌ای که پیشینه آن به سال ۱۹۰۶ بازمی‌گردد. این نشریات شامل USA TODAY، The Arizona Republic، The Bergen Record، The Democrat & Chronicle و The Detroit News هستند. این مجموعه صدها خبرنگار را در ۱۳ ایالت به خدمت گرفته و ده‌ها جایزه پولیتزر کسب کرده است.

متهمان شامل طیف گسترده‌ای از نهادهای OpenAI هستند: OpenAI Foundation، OpenAI GP, LLC، OAI International, Inc.، OpenAI OpCo, LLC، OpenAI Global, LLC، OAI Corporation و OpenAI Group PBC. در این شکایت به بازسازی سرمایه در ۲۸ اکتبر ۲۰۲۵ اشاره شده است، جایی که نهاد غیرانتفاعی به OpenAI Foundation و بخش انتفاعی به OpenAI Group PBC تبدیل شد که ارزش آن حدود ۱۳۰ میلیارد دلار تخمین زده شد. تا مارس ۲۰۲۶، ChatGPT به ۹۰۰ میلیون کاربر فعال هفتگی و ۵۰ میلیون مشترک پولی رسیده بود.

مدل‌های مورد بحث از GPT-1 تا GPT-6.1 و GPT-OSS، شامل تمام نسخه‌های Instant، Thinking، mini، nano و Pro هستند. شاکیان خواستار برگزاری دادگاه با حضور هیئت منصفه شده‌اند.

تحلیل: پایان سپر «استفاده منصفانه»

این پرونده نشان‌دهنده تغییری در استراتژی است؛ از بحث درباره اینکه هوش مصنوعی چگونه ارجاع می‌دهد، به این سؤال که آیا اصلاً مجاز به بلعیدن این داده‌ها هست یا خیر. USA TODAY با استناد به پیام‌های داخلی درباره «حفظ کردن» داده‌ها، تلاش می‌کند دفاعیه «استفاده تحول‌آفرین» (Transformative Use) را که OpenAI در پرونده‌های دیگر به آن تکیه کرده بود، تخریب کند.

برای صنعت خبرنگاری، این نبردی بر سر «ارزش کلیک» است. اگر دادگاه به این نتیجه برسد که خلاصه‌های هوش مصنوعی «جایگزین» (Substitute) هستند و نه «تحول» (Transformation)، آزمایشگاه‌های هوش مصنوعی مجبور خواهند شد به مدل «فقط لایسنس» روی بیاورند. این اتفاق عملاً داده‌های باز وب را به یک جاده عوارضی تبدیل می‌کند که تنها ثروتمندترین شرکت‌های هوش مصنوعی توان پرداخت هزینه مجموعه‌های آموزشی آن را دارند.

باید منتظر تصمیم دادگاه در مورد ادغام این پرونده با سایر دعاوی جاری بود، زیرا یک حکم مشترک می‌تواند یک پیشینه قانونی دائمی برای تمام داده‌های آموزشی مدل‌های زبانی بزرگ (LLM) ایجاد کند.

گام بعدی شما

  • اگر مدیر محتوا یا تولیدکننده داده هستید، بررسی کنید که آیا داده‌های شما در مجموعه‌های Common Crawl یا C4 حضور دارد یا خیر.
  • روی تحولات مدل‌های «استدلالی» نظارت کنید تا ببینید آیا برای کاهش ریسک حقوقی، از متدهای جدیدی برای ارجاع‌دهی استفاده می‌کنند یا خیر.
  • نتایج دادگاه‌های ادغام‌شده OpenAI را دنبال کنید، زیرا این احکام مسیر قانونی تمام مدل‌های زبانی بزرگ را تغییر می‌دهند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پرونده اعتبار مدل‌های بنیادی را در برابر قوانین مالکیت فکری به چالش می‌کشد و می‌تواند منجر به اجبار شرکت‌های AI به پرداخت میلیاردها دلار حق لایسنس شود. نتیجه‌ی این دادگاه تعیین می‌کند که آیا داده‌های وب همچنان رایگان هستند یا به دارایی‌های گران‌قیمت تبدیل می‌شوند.

تأثیر برای ایران

این خبر اثر مستقیمی بر کاربران ایرانی ندارد، اما برای توسعه‌دهندگان ایرانی که از مدل‌های بازمتن استفاده می‌کنند، هشدار است که در آینده دسترسی به داده‌های آموزشی باکیفیت به دلیل لایسنس‌های گران‌قیمت سخت‌تر خواهد شد.

·نگاه ما
تحریریه دات‌هوش

این پرونده تلاش می‌کند دفاعیه «استفاده تحول‌آفرین» (Transformative Use) را که سپر بلای OpenAI در پرونده‌های قبلی بود، با استفاده از اعترافات داخلی درباره «حفظ کردن» داده‌ها در هم بشکند. اگر دادگاه پذیرفت که مدل‌ها صرفاً داده‌ها را بازتولید می‌کنند و نه تحول می‌بخشند، مدل اقتصادی AI از «استخراج رایگان» به «اجاره‌بهای اجباری» تغییر می‌کند. این یعنی وبِ باز، به جاده‌ای تبدیل می‌شود که فقط غول‌های تکنولوژی توان پرداخت عوارض آن را دارند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.