پرش به محتوای اصلی
پرش به محتوای مقاله

اسناد داخلی مایکروسافت: استخراج داده‌های هوش مصنوعی یک «سرقت گسترده» است

·۲۶ شهریور ۱۴۰۵۴ دقیقه مطالعه۱ بازدید
ساتیا نادلا هشدار شوکه‌کننده‌ای به شرکت‌های استفاده‌کننده از هوش مصنوعی داد | تک‌کرانچ
ساتیا نادلا هشدار شوکه‌کننده‌ای به شرکت‌های استفاده‌کننده از هوش مصنوعی داد | تک‌کرانچ
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تفاوت این خبر با بحث‌های قبلی، وجود اعترافات صریح داخلی است؛ مدیران مایکروسافت و OpenAI برخلاف بیانیه‌های عمومی، در خلوت خود این فرآیند را «سرقت» و «تهدید وجودی» نامیده‌اند.

تصور کنید تمام تلاش‌های شغلی شما در سال‌های گذشته، بدون اجازه و در سکوت، به سوختِ موتور ماشین‌افزاری تبدیل شود که حالا جای شما را می‌گیرد. این دقیقاً همان چیزی است که مدیران ارشد مایکروسافت در یادداشت‌های داخلی خود از آن به عنوان «بزرگ‌ترین سرقت نیروی کار در تاریخ بشر» یاد کرده‌اند. این توصیف تکان‌دهنده در یادداشتی داخلی در ژانویه ۲۰۲۳ توسط مدیر علوم کاربردی مایکروسافت نوشته شده بود.

به گزارش تک‌کرانچ (TechCrunch)، این اعترافات در اسناد بدون سانسور پرونده‌ای که روزنامه نیویورک تایمز (The New York Times) علیه OpenAI و مایکروسافت (Microsoft) به جریان انداخته، فاش شده است. این نبرد حقوقی در حالی رخ می‌دهد که شرکت‌های هوش مصنوعی برای حفظ حمایت‌های قانون «استفاده منصفانه» (Fair Use) در آموزش مدل‌های زبانی بزرگ (LLM) می‌جنگند. این قاعده حقوقی اجازه می‌دهد آثار دارای کپی‌رایت بدون اجازه در موارد خاصی مانند گزارش‌های خبری، نقد یا پارودی استفاده شوند. در همین راسته، در اوایل ماه جاری، دولت ترامپ در دفاع از استفاده بدون مجوز OpenAI از مطالب دارای کپی‌رایت برای آموزش مدل‌هایش، یک لایحه دفاعی ارائه کرد که جزئیات این رویکرد حمایتی دولت در تحلیل پیشین ما بررسی شده است.

همان‌طور که در تحلیل قبلی ما درباره‌ی اخلاقیات مدل‌های بنیادی و دیدگاه رهبران مایکروسافت نسبت به رفاه و ایمنی مدل‌ها اشاره کردیم، تضاد میان منافع تجاری و حقوق مالکیت فکری اکنون به نقطه انفجار رسیده است. این اسناد جدید، تمرکز را به بقای اقتصادی زنجیره تأمین محتوا تغییر می‌دهد. برای یک روزنامه‌نگار یا نویسنده، این نبرد تقابل میان ابزاری است که وب را خلاصه می‌کند و انسانی که واقعاً آن محتوا را خلق کرده است. این تنش‌ها در حالی شدت می‌یابد که بحث‌های جدیدی پیرامون تضاد میان حقوق مالکیت و امنیت ملی در آموزش مدل‌ها شکل گرفته است.

مکانیسم‌های استخراج داده

بر اساس مستندات دادگاه، این شرکت‌ها برای شناسایی نشدن، عمداً سیستم‌های پرداخت اشتراکی (Paywalls) را دور زده و اعلان‌های کپی‌رایت را حذف کرده‌اند. آن‌ها مجموعه‌داده‌های آموزشی خود را از طریق استخراج انبوه (Mass Scraping) جمع‌آوری کرده و میلیون‌ها مقاله را از کامان کراول (Common Crawl) — یک مخزن رایگان و باز از داده‌های خزش وب — استخراج کرده‌اند.

برخی از افشاگری‌های کلیدی این اسناد عبارتند از:

  • نیک رایدر، پژوهشگر OpenAI، یک «هک» برای دور زدن دیوار پرداخت نیویورک تایمز را به اشتراک گذاشت و گرگ بروکمن، رئیس این شرکت، در پاسخ تنها نوشت: «آه، چه عالی».
  • استفاده از طرح‌هایی به نام پروژه تاکسی (Project Taxi) و پروژه مانگو (Project Mango) برای تبادل داده‌های آموزشی؛ به‌طوری که OpenAI کل مجموعه داده‌های آموزشی GPT-3 را برای ارزیابی پیاده‌سازی تجاری در اختیار مایکروسافت قرار داد.
  • پروژه مانگو به تنهایی شامل نسخه‌هایی از حداقل ۱۶۰,۹۰۳ اثر منحصر‌به‌فرد از ناشران خبری بود.
  • مجموعه‌داده‌های میان‌آموزشی شامل بیش از ۹۱,۶۹۲ نسخه از آثار نیویورک تایمز، دیلی نیوز (Daily News) و مرکز گزارشگری تحقیقی (Center for Investigative Reporting) بود.
  • کارمندان OpenAI ظاهراً مجموعه‌داده‌هایی مانند WebText و WebText2 را ساخته‌اند که به طور نامتناسبی بر محتوای خبری استخراج‌شده متکی بود.

یکی از مجموعه‌داده‌های مشتق شده از کامان کراول، حاوی بیش از ۲ میلیون سند تنها از سایت nytimes.com بود. اسناد نشان می‌دهند که پژوهشگران عمداً اعلان‌های کپی‌رایت را حذف کردند تا مدل‌ها این اعلان‌ها را در خروجی به کاربران نمایش ندهند و ردپای سرقت محتوا پاک شود.

اثر «حلقه مرگ»

داده‌های داخلی مایکروسافت نشان می‌دهد که کوپایلت (Copilot) در نقش یک «موتور پاسخ‌گو»، نرخ کلیک به سایت نیویورک تایمز را در مقایسه با جست‌وجوی سنتی بینگ تا ۹۳٪ کاهش داده است. برنت هکت، مدیر علوم کاربردی مایکروسافت، در ارائه‌ای در ژانویه ۲۰۲۴ این وضعیت را «حلقه مرگ» (Doom Loop) نامید.

او هشدار داد که محصول نهایی، زیربنای اقتصادی تامین‌کنندگان اصلی داده‌هایش را تهدید می‌کند و این امر می‌تواند به طور همزمان هم به مدل‌ها و هم به وب آسیب بزند. او اشاره کرد که «بسیار غیرمعمول» است که یک محصول، زنجیره تأمین محتوای خود را تهدید کند.

ساتیا نادلا، مدیرعامل مایکروسافت، تحت سوگند شهادت داد که محتوای پشت دیوار پرداخت باید توسط هر کسی که می‌خواهد از آن برای آموزش یا زمینه‌سازی (Grounding) استفاده کند، لایسنس شود. او تصریح کرد که اگر می‌دانست OpenAI داده‌های پولی را استخراج کرده است، از حق مایکروسافت برای الزام آن‌ها به بازآموزی (Retrain) مدل‌هایشان استفاده می‌کرد.

تهدید وجودی برای ناشران

نیک تورلی، مدیر ChatGPT در OpenAI، صراحتاً نوشت که ناشران با یک «تهدید وجودی» روبرو هستند زیرا محصولات هوش مصنوعی «عمدتاً جایگزین» (Substitutive) هستند. او خاطرنشان کرد که با بهبود این ابزارها، خاصیت جایگزینی آن‌ها حتی بیشتر خواهد شد. این اعتراف ضربه‌ای سخت به دفاعیه «استفاده منصفانه» است؛ زیرا طبق این قانون، اثر جدید نباید جایگزین اثر اصلی در بازار شود یا به بازار آن آسیب بزند.

گرگ بروکمن مدل‌ها را در زمینه اخبار «عالی» توصیف کرد و نادلا نیز موافقت کرد که گفتگو با چت‌بات‌ها، نیاز کاربران به مراجعه به وب‌سایت منبع را جایگزین کرده است. یک سند مایکروسافت همچنین به «ریسک واقعی» اشاره کرد که هوش مصنوعی زاینده می‌تواند اشتغال افرادی را که داده‌های آموزشی را تولید کرده‌اند، به شدت مختل کند.

این تغییر نشان می‌دهد که هوش مصنوعی تنها مصرف خبر را تغییر نداده، بلکه در حال بلعیدن صنعتی است که از آن تغذیه می‌کند. اگر دادگاه‌ها بپذیرند که این یک «جایگزینی» است و نه یک «تحول»، زیربنای قانونی آموزش‌های بدون مجوز ممکن است فرو بپاشد.

منتظر مجموعه بعدی مدارک فاش شده در پرونده نیویورک تایمز باشید، زیرا ممکن است روش‌های فنی خاص مورد استفاده برای حذف متادیتای کپی‌رایت از خط لوله آموزشی را آشکار کنند.

گام بعدی شما

  • اگر تولیدکننده محتوا هستید، ابزارهای نظارت بر استفاده از داده‌ها (Data Provenance) را بررسی کنید.
  • دنبال کنید که آیا دادگاه حکم به «بازآموزی» (Retraining) مدل‌ها با حذف داده‌های سرقتی می‌دهد یا خیر.
  • استراتژی‌های توزیع محتوا را به گونه‌ای تغییر دهید که مدل‌های AI نتوانند به راحتی محتوای شما را بدون ترافیک ورودی جایگزین کنند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پرونده اعتبار ادعاهای «استفاده منصفانه» را به شدت تخریب می‌کند و می‌تواند منجر به جریمه‌های میلیاردی و الزام به حذف مدل‌های آموزش‌دیده شود. تخصص حقوقی در این پرونده تعیین می‌کند که آیا داده‌های وب همچنان «مشاع» هستند یا دارایی‌های خصوصی.

تأثیر برای ایران

این نبرد حقوقی در نهایت هزینه APIهای مدل‌های پیشرفته را افزایش می‌دهد، زیرا شرکت‌ها مجبور به پرداخت هزینه لایسنس داده‌ها می‌شوند و این هزینه به کاربر نهایی در ایران منتقل خواهد شد.

·نگاه ما
تحریریه دات‌هوش

این افشاگری‌ها نشان می‌دهد که مدل‌های استدلالی پیشرفته، نه بر پایه خلاقیت، بلکه بر پایه یک «آربیترایژ» (Arbitrage) عظیم از حقوق مالکیت فکری بنا شده‌اند. اگر دادگاه‌ها پذیرفتند که این مدل‌ها «جایگزین» هستند و نه «تحول‌آفرین»، کل مدل اقتصادی شرکت‌های AI که بر پایه داده‌های رایگان بنا شده، فرو می‌پاشد و عصر لایسنس‌های اجباری آغاز می‌شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.