پرش به محتوای اصلی
پرش به محتوای مقاله

آیا بازتولید ناچیز متون در Copilot تاییدکننده تحول‌آفرین بودن مدل‌هاست؟

·۱۳ شهریور ۱۴۰۵۵ دقیقه مطالعه
مایکروسافت به دادگاه: کپایلت به‌ندرت کتاب‌ها را در هوش مصنوعی کپی می‌کند
مایکروسافت به دادگاه: کپایلت به‌ندرت کتاب‌ها را در هوش مصنوعی کپی می‌کند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ارائه اولین داده‌های آماری دقیق از لاگ‌های واقعی کاربران (۸.۲ میلیون مورد) برای اثبات پایین بودن نرخ بازتولید متون کپی‌رایت‌شده در محیط عملیاتی.

تصور کنید یک نویسنده متوجه شود که هوش مصنوعی، تکه‌هایی از کتابش را دقیقاً و بدون تغییر برای کاربران بازگو می‌کند؛ این کابوس حقوقی اکنون به میدان دادگاه کشیده شده است. اما مایکروسافت با اعدادی تکان‌دهنده ادعا می‌کند که این اتفاق تقریباً هرگز رخ نمی‌دهد.

طبق یک سند دادگاهی مورخ ۴ سپتامبر ۲۰۲۶، از میان ۸.۲ میلیون مکالمه بررسی‌شده در Copilot، تنها ۲۴ مورد یافت شد که در آن‌ها ۳۰ کلمه یا بیشتر از کتاب‌های دارای کپی‌رایت به‌صورت دقیق بازتولید شده بود. این داده‌ها هسته اصلی دفاع مایکروسافت در برابر شکایت دسته‌جمعی نویسندگان و ناشران است و در گزارش‌های پیشین ما نیز به این ادعای مایکروسافت درباره ندرت تکرار متون کپی‌رایت اشاره شده بود.

این نبرد حقوقی در حالی رخ می‌دهد که صنعت در تلاش است مرز بین «یادگیری» و «کپی‌برداری» را تعریف کند. همان‌طور که در تحلیل‌های قبلی ما درباره امنیت مدل‌های زبانی اشاره کردیم، حفاظت از اکوسیستم تنها به مسائلی مثل جلوگیری از حملات تزریق پرامپت یا تکنیک‌هایی مانند ASCII smuggling برای محافظت از اکوسیستم نیست، بلکه به مالکیت معنوی داده‌هایی که این اکوسیستم را ساخته‌اند نیز بازمی‌گردد. برای یک کاربر عادی، سوال این است که آیا هوش مصنوعی یک کتابدار دیجیتال است یا یک سرقت ادبی پیشرفته.

زمینهٔ دعا و دعوا

این شکایت توسط «اتحادیه نویسندگان» (The Authors Guild) و تعدادی از نویسندگان آثار داستانی و غیرداستانی مطرح شده است. این روند تقریباً ۱۰ ماه پس از عرضه عمومی ChatGPT توسط OpenAI در نوامبر ۲۰۲۲ آغاز شد. مایکروسافت بعدها به‌عنوان یکی از خواندگان در این پرونده‌های ادغام‌شده اضافه شد.

این litigations بخشی از یک روند دادرسی چندمنطقه‌ای (multidistrict proceeding) با عنوان In re: OpenAI, Inc. Copyright Infringement Litigation است. این پرونده در حال حاضر در دادگاه منطقه جنوبی نیویورک و تحت نظارت قاضی سیدنی اچ. استین (Sidney H. Stein) در حال بررسی است.

داده‌های پشت پردهٔ دفاعیه

مایکروسافت در یادداشت حقوقی خود تضاد شدیدی میان «تست‌های آزمایشگاهی» و «استفاده واقعی» ترسیم می‌کند. به نقل از مستندات دادگاه، دکتر شاون شان، کارشناس شاکیان، از یک پروتکل استخراج خصمانه (adversarial extraction protocol) با ۵.۳ میلیون تلاش استفاده کرد تا مدل را مجبور کند متون کتاب‌ها را به‌صورت کلمه به کلمه بازتولید کند. در این تلاش‌ها، قطعاتی از کتاب‌ها با طول صدها کلمه به مدل‌های GPT داده شد تا واکنش آن‌ها سنجیده شود. حتی در این حملات هدفمند، کمتر از ۱٪ تلاش‌ها منجر به تطابق ۳۰ کلمه‌ای شد.

مایکروسافت این آزمایش را تمرینی توصیف می‌کند که در آن کارشناس به‌طور خاص یک قطعه هدف را انتخاب کرده و به‌طور مکرر به مدل دستور داده است تا زمانی که متن مورد نظر تولید شود. اما وقتی به لاگ‌های واقعی کاربران در خارج از محیط آزمایشگاهی نگاه می‌کنیم، اعداد به‌شدت سقوط می‌کنند:

  • کل مکالمات تحلیل‌شده: ۸.۲ میلیون
  • پاسخ‌های دارای تطابق: ۲۴ مورد
  • نرخ بازتولید (Regurgitation Rate): ۰.۰۰۰۲۹٪
  • پوشش کتاب‌ها: برای ۲۰۲ کتاب از ۲۱۲ کتاب مورد ادعا، هیچ مورد بازتولید در لاگ‌ها یافت نشد.

مایکروسافت نتیجه می‌گیرد که این ارقام به‌هیچ‌وجه هدف تحول‌آفرین آموزش مدل‌های زبانی بزرگ (LLM) را زیر سؤال نمی‌برد.

استدلال «استفاده منصفانه»

مایکروسافت استدلال می‌کند که آموزش یک مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — از نظر قانونی «به‌شدت تحول‌آفرین» (profoundly transformative) است. این شرکت به احکام قبلی در پرونده‌های آموزش AI علیه شرکت‌های متا (Meta) و آنتروپیک (Anthropic) استناد می‌کند که آموزش LLM را بسیار تحول‌آفرین توصیف کرده‌اند.

به باور مایکروسافت، کتاب‌ها برای خواندن انسان‌ها خلق شده‌اند، اما OpenAI از متونی مثل کتاب «وکیل خیابانی» (The Street Lawyer) اثر جان گریشام و کتاب «کلئوپاترا» (Cleopatra) اثر استیسی شیف برای هدفی تکنولوژیک استفاده کرده است: ساخت سیستمی که بتواند پاسخ‌های طبیعی به پرامپت‌ها بدهد.

در مورد منبع داده‌ها، مایکروسافت به تمرکز نویسندگان بر دانلود کتاب‌ها توسط OpenAI از Library Genesis (یک مخزن آنلاین معروف به انتشار نسخه‌های غیرقانونی) پاسخ داد. مایکروسافت اظهار داشت که سوابق غیرقابل انکار ثابت می‌کند این شرکت هیچ دانلود یا دخالتی در تهیه آن مجموعه‌داده‌ها نداشته است. این شرکت استدلال می‌کند که منشأ داده‌های آموزشی، تحلیل «استفاده منصفانه» را تغییر نمی‌دهد، زیرا هر مرحله از این فرآیند در خدمت همان هدف آموزشی بوده است.

شاخص جست‌وجوی بینگ و نقض غیرمستقیم

مایکروسافت همچنین درباره ارائه بخش‌هایی از شاخص جست‌وجوی Bing به OpenAI توضیح داد. در یادداشت حقوقی ذکر شده است که شواهد در مورد اینکه آیا آن بخش‌ها حاوی آثار شاکیان بوده است یا خیر، غیرقطعی است. کارشناس شاکیان بین ۸ تا ۲۴ اثر مورد ادعا را در بخش‌های منتقل‌شده از شاخص شناسایی کرد، اما مایکروسافت استدلال می‌کند که این انتقال نیز همچنان بخشی از فرآیند آموزش LLM بوده است.

به‌طور همزمان، مایکروسافت برای صدور حکم بر اساس لوایح (judgment on the pleadings) در مورد اتهام «نقض غیرمستقیم» (contributory infringement) درخواست داده است. این شرکت استدلال می‌کند که اگر دادگاه آموزش LLM را «استفاده منصفانه» تشخیص دهد، این امر به‌طور مستقل ادعای نقض غیرمستقیم را باطل می‌کند.

تأثیر بر بازار و لایسنس‌ها

مایکروسافت از دادگاه می‌خواهد دو نظریه خاص را رد کند: اول، ضرر ناشی از عدم پرداخت هزینه لایسنس برای داده‌های آموزشی و دوم، «رقیق شدن بازار» (market dilution) به دلیل رقابت کتاب‌های تولیدشده توسط هوش مصنوعی با نویسندگان انسانی. این شرکت ادعا می‌کند که الزام به دریافت لایسنس از میلیون‌ها نویسنده، مانعی عظیم در برابر نوآوری ایجاد می‌کند. در همین راستا، بنیاد EFF نیز استدلال کرده است که دادگاه‌ها نباید اجازه دهند مفاهیمی چون رقیق شدن بازار به ابزاری برای حذف رقابت در حوزه AI تبدیل شوند.

برای اثبات عدم آسیب به بازار، مایکروسافت به شواهدی از خود نویسندگان استناد کرد:

  • تحلیل‌های فروش نشان نمی‌دهد که عرضه ChatGPT یا Copilot باعث کاهش فروش کتاب‌ها شده باشد.
  • دیوید هنری هوانگ، نمایشنامه‌نویس، اعلام کرده که باور ندارد مدل‌های زبانی به بازار نمایشنامه‌های او آسیبی زده باشند.
  • اظهارات کارشناسان حاکی از آن است که اکثریت قاطع مصرف‌کنندگان، حتی با قیمت بسیار پایین‌تر، کتاب‌های تولیدشده توسط هوش مصنوعی را نمی‌خرند.

تضاد با ناشران خبری

در اقدامی موازی و در همان روز، مایکروسافت به ادعاهای ناشران خبری از جمله The New York Times پاسخ داد. به گزارش The Verge، مایکروسافت مدعی است Copilot به‌ندرت حتی یک جمله کامل از مقالات خبری را بازتولید می‌کند، چه رسد به بخش‌های بزرگی که بتواند جایگزین گزارش اصلی شود. در لایحه مربوط به کتاب‌ها، پرونده ناشران خبری به‌گونه‌ای توصیف شده است که توضیح می‌دهد چرا ابزار مبتنی بر LLM که ناشران به آن اعتراض دارند، قانونی است.

آنچه در پیش است

قاضی سیدنی اچ. استین نظارت بر این litigations چندمنطقه‌ای را در دادگاه منطقه جنوبی نیویورک بر عهده دارد. شرکت New York Times در ۴ سپتامبر ۲۰۲۶ درخواست‌های حکم خلاصه (summary judgment) خود را ثبت کرد که پاسخ به آن‌ها تا ۵ اکتبر ۲۰۲۶ زمان دارد. OpenAI نیز در همان روز درخواست حکم خلاصه را در مورد ادعاهای ناشران خبری ثبت کرد.

یک دستور مهروموم‌شده (sealing order) که در ۳ سپتامبر ۲۰۲۶ توسط قاضی استین امضا شد، تقویم انتشار عمومی اسناد را تعیین کرده است:

  • ۱۴ سپتامبر ۲۰۲۶: ضرب‌الاجل برای درخواست‌های حفظ سانسور (redactions) در لوایح حکم خلاصه.
  • ۱۷ سپتامبر ۲۰۲۶: ضرب‌الاجل برای ثبت مجدد لوایح و بیانیه‌های Rule 56.1 به‌صورت عمومی، به‌طوری که بخش‌های بدون اعتراض، بدون سانسور باشند.
  • ۱۵ اکتبر ۲۰۲۶: ضرب‌الاجل برای ثبت مجدد لوایح مخالف (opposition briefs) به‌صورت عمومی.

این پرونده احتمالاً پیش‌بینی‌کننده این خواهد بود که آیا شرکت‌های AI باید «مالیات آموزش» به سازندگان پرداخت کنند یا خیر. اگر دادگاه استدلال «استفاده تحول‌آفرین» را بپذیرد، راه برای آموزش بدون محدودیت روی داده‌های عمومی باز می‌شود. در غیر این صورت، مدل اقتصادی توسعه LLM ممکن است نیاز به بازنگری کلی داشته باشد.

منتظر لوایح مخالف ۱۵ اکتبر باشید تا ببینید نویسندگان چگونه تلاش می‌کنند آمار بازتولید ۰.۰۰۰۲۹٪ را رد کنند.

گام بعدی شما

  • اگر تولیدکننده محتوا هستید، ابزارهای تشخیص سرقت ادبی (Plagiarism Checkers) را برای بررسی خروجی‌های AI به کار بگیرید.
  • روند رسیدگی به پرونده‌های کپی‌رایت در اکتبر ۲۰۲۶ را دنبال کنید تا متوجه شوید آیا «مالیات آموزش» برای مدل‌ها اجباری می‌شود یا خیر.
  • استراتژی‌های تولید محتوای «تکمیل‌کننده AI» را جایگزین محتوای «جایگزین AI» کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پرونده بر اساس اعتبار دادگاه‌های آمریکا، پیش‌بینی می‌کند که آیا شرکت‌های AI باید برای داده‌های عمومی هزینه پرداخت کنند یا خیر. پذیرش استدلال «استفاده تحول‌آفرین» مسیر آموزش بدون محدودیت روی داده‌های وب را هموار می‌کند.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران مدل‌های بنیادی اهمیت دارد تا بازار مصرف ایران؛ زیرا نتیجه آن تعیین‌کننده استانداردهای جهانی لایسنس داده برای آموزش مدل‌های آینده است.

·نگاه ما
تحریریه دات‌هوش

تکیه مایکروسافت بر عدد ۰.۰۰۰۲۹٪ یک استراتژی هوشمندانه برای تغییر محور بحث از «حق مالکیت» به «احتمال وقوع» است. این رویکرد سعی دارد ثابت کند که حتی اگر کپی‌برداری در تئوری رخ دهد، در عمل به دلیل مقیاس عظیم داده‌ها، اثر آن ناچیز است. به نظر ما، این پرونده تعیین می‌کند که آیا مدل‌های زبانی به عنوان «ابزارهای پردازش» شناخته می‌شوند یا «تولیدکنندگان مشتق»، که دومی می‌تواند مدل اقتصادی تمام شرکت‌های AI را به هم بریزد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.