پرش به محتوای اصلی
پرش به محتوای مقاله

«پاکسازی منابع فیزیکی»؛ استراتژی محرمانه Anthropic برای پیشی گرفتن از رقبا

·۳۰ مرداد ۱۴۰۵۳ دقیقه مطالعه۳ بازدید
گزارش تأییدنشده
شرکت‌های هوش مصنوعی کتاب‌های فیزیکی را نابود می‌کنند — بیایید پیش از دیر شدن، کتاب‌های نایاب را اسکن کنیم
شرکت‌های هوش مصنوعی کتاب‌های فیزیکی را نابود می‌کنند — بیایید پیش از دیر شدن، کتاب‌های نایاب را اسکن کنیم
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

افشای یک عملیات سیستماتیک برای نابودی فیزیکی منابع دانش جهت ایجاد انحصار داده‌ای؛ این اولین بار است که استراتژی «اسکن و تخریب» برای جلوگیری از دسترسی رقبا به داده‌های پیش از سال ۲۰۲۲ به طور علنی فاش می‌شود.

تصور کنید برای اینکه هیچ‌کس نتواند از یک منبع دانش استفاده کند، ابتدا آن را بخوانید و سپس نسخهٔ فیزیکی‌اش را بسوزانید. این دقیقاً همان کاری است که در پشت درهای بستهٔ یکی از قدرتمندترین آزمایشگاه‌های هوش مصنوعی جهان در جریان است.

یک توافق ۱.۵ میلیارد دلاری بر سر کپی‌رایت، پرده از «پروژه پاناما» (Project Panama) برداشت؛ عملیاتی محرمانه توسط شرکت آنتروپیک (Anthropic) برای خرید، اسکن و سپس نابودی میلیون‌ها کتاب فیزیکی. هدف این استراتژی، تصاحب داده‌های آموزشی باکیفیت از سال ۲۰۲۲ به قبل است؛ یعنی زمانی که محتوای وب هنوز توسط متون تولیدشده توسط ماشین آلوده نشده بود. این رویکرد تهاجمی در واقع بخشی از یک الگوی گسترده‌تر است که در آن غول‌های فناوری برای دستیابی به داده‌های خالص، آثار فیزیکی را نابود می‌کنند تا برتری رقابتی خود را تضمین کنند.

این نبرد برای دسترسی به آرشیوهای فیزیکی در حالی رخ می‌دهد که اینترنت به نقطهٔ بحرانی رسیده است. طبق گزارش‌ها، از ابتدای سال ۲۰۲۵، بیش از نیمی از محتوای جدید منتشرشده در وب، توسط هوش مصنوعی تولید شده است. برای آزمایشگاه‌های AI، تنها دانش «خالص» انسانی اکنون در قالب کاغذها باقی مانده و کتابخانه‌های فیزیکی را به خط مقدم جدید رقابت تبدیل کرده است.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی امنیت داده‌های آموزشی اشاره کردیم، کیفیت ورودی‌ها تعیین‌کنندهٔ خروجی مدل است. اگر هوش مصنوعی آخرین جملات نوشته‌شده توسط انسان روی کاغذ را ببلعد و سپس نسخه‌های اصلی را نابود کند، اینترنت تنها شامل کلمات خودِ هوش مصنوعی خواهد بود. این وضعیت ریسکی جدی ایجاد می‌کند: نسل‌های آینده شاید هرگز نتوانند تفاوتی میان تفکر انسانی و ماشین تشخیص دهند.

به گزارش آرشیو آنا (Anna's Archive) که در ۵ اوت ۲۰۲۶ منتشر شد، این فرآیند بر اساس یک منطق شرکتی سرد پیش می‌رود:

  • انحصارطلبی: نابودی کتاب‌ها مانع می‌شود رقیبان همان منابع را برای مدل‌های خود اسکن کنند. بدین ترتیب، دانش به‌طور دائمی در سرورهای خصوصی حبس می‌شود.
  • کاهش ریسک: نابودی فیزیکی برای دور زدن برخی ریسک‌های قانونی مربوط به انباشت دیجیتال به کار می‌رود.
  • بهینه‌سازی هزینه: این گزارش ادعا می‌کند نابودی کتاب‌ها ارزان‌تر از اسکن‌های بسیار دقیق و بدون افت کیفیت (Lossless) است.
  • تأمین داده: شرکت‌ها از واسطه‌ها برای خرید انبوه کتاب‌های دست‌دوم استفاده می‌کنند تا خط لولهٔ آموزشی خود را تغذیه کنند.

بر اساس مستندات، آنتروپیک ده‌ها میلیون دلار برای این خریدها هزینه کرده تا مدل زبانی بزرگ (LLM) — شبیه کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — خود یعنی کلود (Claude) را آموزش دهد. پروژه پاناما که در اوایل ۲۰۲۴ آغاز شد، از سوی منتقدان یک «جنایت جدی علیه بشریت» توصیف شده است، حتی اگر از نظر قانونی فعلاً مجاز باشد.

با تبدیل شدن به تنها مالک نسخه‌های دیجیتال، این شرکت‌ها میراث فرهنگی بشر را در سرورهای شرکتی زندانی می‌کنند. این یک پارادوکس خطرناک است: شرکت‌هایی که وعدهٔ دسترس‌پذیرتر کردن دانش را می‌دهند، مقاوم‌ترین حامل‌های آن دانش را تخریب می‌کنند. اگر نسخه‌های فیزیکی از بین بروند، عموم مردم توانایی تأیید خروجی‌های AI را با منابع اصلی انسانی از دست می‌دهند.

در واکنش به این وضعیت، آرشیو آنا در تلاش است تا یک «کتابخانه دیجیتال اسکندریه» بسازد. آن‌ها کتابخانه‌های سایه را بزرگ‌ترین معجزه اشتراک دانش در قرن ۲۱ می‌دانند و در حال جذب ۱۰ میلیون داوطلب برای اسکن و آپلود منابع از سراسر جهان هستند، از جمله:

  • کتاب‌ها و مقالات ژورنالی
  • روزنامه‌ها و مجلات
  • کتاب‌های باستانی و کمیاب
  • سایر متونی که در معرض نابودی هستند

این سازمان برای پروژه‌های بزرگ، کمک‌های مالی جهت پرداخت هزینه‌های اسکن ارائه می‌دهد. هدف آن‌ها این است که تمام انتشارات جهان را پیش از آنکه ناشران دسترسی را ببندند یا شرکت‌های AI نسخه‌های کاغذی را نابود کنند، دیجیتالی کنند.

برای یک خواننده عادی، این یعنی پنجرهٔ دسترسی به تفکرات انسانیِ غیردیجیتال در حال بسته شدن است. ما به سمتی می‌رویم که تنها راه دسترسی به برخی متون تاریخی، پرداخت هزینه به رابط کاربری یک AI باشد؛ همان شرکتی که نسخهٔ اصلی کتاب را نابود کرده است.

گام بعدی شما

  • اگر به متون کمیاب یا آرشیوهای محلی دسترسی دارید، با پروژه‌های دیجیتال‌سازی متن‌باز همکاری کنید.
  • در مورد قوانین کپی‌رایت مربوط به «تبدیل فیزیکی به دیجیتال» و حقوق مالکیت اشیاء فیزیکی مطالعه کنید.
  • برای تأیید اطلاعات حساس، به جای تکیه بر AI، به دنبال منابع فیزیکی یا آرشیوهای تأییدشده بروید.

اما داستان سخت‌افزاری این تحول و نحوهٔ پردازش این حجم از داده‌های اسکن‌شده حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این اقدام اعتبار منابع تاریخی را به شدت تهدید می‌کند زیرا امکان راستی‌آزمایی خروجی‌های AI با نسخه‌های اصلی از بین می‌رود. تخصص در مدیریت آرشیوها اکنون به یک ابزار استراتژیک در رقابت تسلیحاتی AI تبدیل شده است.

تأثیر برای ایران

این موضوع برای پژوهشگران ایرانی که بر روی مدل‌های زبانی فارسی کار می‌کنند هشداردهنده است؛ چرا که انحصار داده‌های باکیفیت توسط شرکت‌های غربی، فاصلهٔ تکنولوژیک را بیشتر می‌کند.

·نگاه ما
تحریریه دات‌هوش

این استراتژی نشان می‌دهد که مدل‌های هوش مصنوعی به «سقف داده» رسیده‌اند و حالا برای رشد، به جای تولید داده‌های مصنوعی، به دنبال شکار آخرین بقایای دانش انسانی هستند. نابودی فیزیکی منابع برای ایجاد انحصار، مدل کسب‌وکار AI را از یک ابزار دموکراتیزه کننده به یک ساختار استعماری تبدیل می‌کند که در آن دانش بشر به دارایی خصوصی تبدیل می‌شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.