پرش به محتوای اصلی
پرش به محتوای مقاله

عملیات مخفی آمازون برای تخریب کتاب‌های کمیاب جهت آموزش هوش مصنوعی

·۲۶ مرداد ۱۴۰۵۷ دقیقه مطالعه
ردیابی محموله کتاب‌های نادر تا رسیدن به مرکز آموزش هوش مصنوعی آمازون
ردیابی محموله کتاب‌های نادر تا رسیدن به مرکز آموزش هوش مصنوعی آمازون
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

افشای یک عملیات صنعتی در مقیاس وسیع برای تبدیل کتاب‌های فیزیکی به داده‌های دیجیتال و تخریب هم‌زمان آن‌ها جهت دور زدن قوانین کپی‌رایت و جلوگیری از فروپاشی مدل.

تصور کنید کتابخانه‌ای دیجیتال، تمام نسخه‌های خطی و دست‌نویس یک اثر تاریخی را پس از عکاسی، به آتش بکشد تا هیچ نسخه‌ی فیزیکی باقی نماند. این دقیقاً همان اتفاقی است که اکنون در پشت درهای بسته یکی از بزرگ‌ترین خرده‌فروشان جهان برای تغذیه مدل‌های هوش مصنوعی رخ می‌دهد.

آمازون در حالی خود را پیشرو در نوآوری معرفی می‌کند که یک ردیاب مخفی در محموله‌ای از کتاب‌های کمیاب، وجود تأسیساتی را فاش کرده که در آن دانش چاپی به‌طور سیستماتیک نابود می‌شود. در این عملیات، شرکت مقادیر انبوهی از کتاب‌ها را می‌خرد و جلد آن‌ها را جدا می‌کند تا صفحات را برای تغذیه مدل‌های پیشرو هوش مصنوعی خود اسکن کند.

این کشف بر اساس پوشش‌های پیشین ما درباره خط لوله‌های مخفی هوش مصنوعی برای خرد کردن کتاب‌های کمیاب جهت به‌دست آوردن داده‌های آموزشی است. این موضوع تأیید می‌کند که چنین رویه‌ای تنها به آزمایشگاه‌های کوچک محدود نمی‌شود، بلکه توسط بزرگ‌ترین خرده‌فروش جهان در مقیاس صنعتی اجرا می‌شود. برای یک خواننده عادی، این وضعیت معادل آن است که یک کتابخانه دیجیتال، نسخه‌های اصلی دست‌نویس را پس از گرفتن عکس از آن‌ها بسوزاند.

ردپای کاغذها تا لاس‌وگاس

در ماه ژوئیه، گزارش‌هایی از سوی کتاب‌فروشان منتشر شد که به جهشی تاریخی در فروش کتاب‌ها طی سال گذشته اشاره داشت. این فروشندگان مشکوک بودند که شرکت‌های هوش مصنوعی در حال تصاحب هر کتابی هستند که می‌توانند پیدا کنند تا داده‌های آموزشی جدیدی را تضمین کنند. از آنجا که بازارهای آنلاین هویت خریداران را ناشناس نگه می‌دارند، هویت این خریداران انبوه پنهان مانده بود. در روند معمول، وقتی سفارشی ثبت می‌شود، کتاب‌فروشان اقلام را به انبار بازار ارسال می‌کنند تا پیش از ارسال به خریدار نهایی، دسته‌بندی شوند.

برای کشف حقیقت، یک تحقیق توسط 404 Media محموله‌ای از کتاب‌های کمیاب را با استفاده از یک Apple AirTag ردیابی کرد. یک کتاب‌فروش موافقت کرد که این دستگاه را در یک سفارش بزرگ شامل تقریباً ۱۰۰۰ کتاب که از طریق بازار تجاری Biblio فروخته شده بود، قرار دهد. این کتاب‌فروش برای جلوگیری از آسیب به کسب‌وکار خود خواست نامش فاش نشود. شرکت Biblio به درخواست‌ها برای اظهارنظر در این باره پاسخ نداد.

سفر این محموله بسیار گسترده بود. ابتدا به فرودگاهی در کالیفرنیا رسید، سپس به فرودگاه بین‌المللی میلواکی در ویسکانسین پرواز کرد. از آنجا به انباری منتقل شد که توسط Trifinity اداره می‌شد؛ یک شرکت تخصصی حمل‌ونقل و توزیع واقع در نزدیکی فرودگاه منطقه‌ای کنوشا، در حدود ۳۰ مایلی جنوب میلواکی. پس از دو هفته توقف در آنجا، محموله با کامیون از طریق بزرگراه حرکت کرد و شبی را در یک مرکز استراحت کامیون‌ها در نزدیکی گرند جانکشن کلرادو گذراند.

در نهایت، محموله به مقصد نهایی خود رسید: انبار آمازون در لاس‌وگاس، نوادا، که با کد LAS8 شناخته می‌شود. در حالی که LAS8 عمدتاً خدمات «چاپ بر اساس تقاضا» (Print-on-Demand) را مدیریت می‌کند — یعنی چاپ و ارسال کتاب‌ها برای خریداران در لحظه — تحقیقات نشان داد که عملیات جداگانه‌ای در داخل این سایت با کد VGT3 فعال است.

درون تأسیسات VGT3

کارکنان VGT3 فرآیندی تکراری و صنعتی را توصیف می‌کنند که کاملاً بر دیجیتالی‌سازی متمرکز است. این تأسیسات در انتهای شمالی انبار LAS8 واقع شده است. گردش کار در این مرکز شامل دو نقش اصلی است:

  • دریافت (Receiving): کارکنان محموله‌های عظیم کتاب‌های چاپی را دریافت کرده و بارکدها یا ISBNها (شماره سریال منحصر‌به‌فرد هر کتاب منتشر شده) را برای ردیابی موجودی اسکن می‌کنند.
  • برش (Cutting): کارکنان جلد و عطف کتاب‌ها را می‌برند. این مکانیسم به این دلیل استفاده می‌شود که حذف عطف کتاب، فرآیند اسکن را به‌طور قابل‌توجهی ارزان‌تر و سریع‌تر می‌کند.

پس از آنکه جلدها جدا شده و صفحات اسکن شدند، کتاب‌های فیزیکی در این فرآیند نابود می‌شوند. لوگوی داخلی این مرکز — یک تی‌رکس با دهان باز که دندان‌هایش را نشان می‌دهد و کتابی باز در دست دارد — به عنوان نمادی تکان‌دهنده از این مصرف‌گرایی و بلعیدن دانش عمل می‌کند. ردیابی محموله کتاب‌های نایاب تا مرکز آموزش هوش مصنوعی آمازون

کارکنان در تالارهای گفتگوی آنلاین، این شغل را «خوب» و «جالب» توصیف می‌کنند، هرچند خسته‌کننده است، زیرا وظایف آسان و تکراری هستند. برخی کارکنان اشاره کردند که انبار شیفت‌های شب جذابی را ارائه می‌دهد. با این حال، در اوایل سال جاری، برخی کارکنان ابراز نگرانی کردند که آمازون ممکن است سایت را ببندد، زیرا موجودی فعلی خود را تمام کرده بودند و محموله‌های جدید کافی دریافت نمی‌کردند. با این حال، این سایت امروز همچنان فعال است.

جنگ برای داده‌های «پاک»

آمازون در حال حاضر در حال توسعه خانواده مدل‌های پیشرو Nova است تا با Google، OpenAI و Anthropic رقابت کند. این مدل‌ها برای حفظ کیفیت به مقادیر عظیمی از متون نوشته‌شده توسط انسان نیاز دارند. آمازون در داخل سازمان خود همچنین از یک عامل کدنویسی AI به نام Kiro برای توسعه نرم‌افزارهای خود استفاده کرده است.

کتاب‌های چاپی به سه دلیل استراتژیک ارزش منحصر‌به‌فردی دارند:

۱. شکاف اینترنتی: بخش زیادی از متون موجود در کتاب‌های کمیاب یا قدیمی هرگز در وب آپلود نشده‌اند و برای خزنده‌های وب (Web Scrapers) استاندارد که شرکت‌های AI پیش از این آن‌ها را تخلیه کرده‌اند، نامرئی هستند.
۲. سازماندهی داده‌ها: کتاب‌ها روایت‌های ساختاریافته و بلندمدتی را ارائه می‌دهند که برای آموزش استدلال‌های پیچیده (Complex Reasoning) برتر هستند.
۳. جلوگیری از فروپاشی مدل: کتاب‌های چاپ‌شده پیش از سال ۲۰۲۲ تضمین می‌کنند که فاقد متون تولیدشده توسط هوش مصنوعی هستند. آموزش روی محتوای تولیدشده توسط AI می‌تواند منجر به یک تخریب بازگشتی شود که به آن «فروپاشی مدل» (Model Collapse) می‌گویند و باعث می‌شود مدل هوش مصنوعی نهایی ضعیف‌تر شود.

تصاحب سیستماتیک

کتاب‌فروشان گزارش داده‌اند که طی سال گذشته جهشی عظیم در سفارش‌های انبوه رخ داده است. این خریداران نسبت به قیمت حساس نیستند و برخلاف دانشگاه‌ها یا کتابخانه‌ها، اغلب مجموعه‌هایی تصادفی از عناوین مختلف را خریداری می‌کنند.

شواهد نشان می‌دهد که آمازون ممکن است در تلاش باشد تا هر کتاب چاپی موجود در جهان را با بررسی متدیک لیست ISBNها اسکن کند. این تئوری توسط دو مشاهده کلیدی پشتیبانی می‌شود:

  • کارکنان VGT3 پیش از اسکن محتوای کتاب‌ها، ابتدا ISBNها را اسکن می‌کنند.
  • کتاب‌فروشان اشاره می‌کنند که این سفارش‌های عظیم تقریباً هرگز شامل کتاب‌های بسیار کمیابی که فاقد ISBN هستند، نمی‌شود.

علاوه بر این، سایر کتاب‌فروشان که در سال ۲۰۲۴ در آمازون فعالیت می‌کردند، گزارش دادند که سفارش‌هایی به طور مستقیم برای مشتری‌ای به نام «Amazon FC» به مکان VGT3 ارسال شده است. حجم این سفارش‌ها چنان غیرعادی بود که برخی فروشندگان به کلاهبرداری مشکوک شدند، اما نماینده‌ای از آمازون تأیید کرد که این سفارش‌ها قانونی هستند.

حفره قانونی

این رویه مشابه «پروژه پاناما» است؛ عملیات مشابهی توسط شرکت Anthropic که در جریان یک شکایت از سوی نویسندگان کتاب‌ها فاش شد. هدف پروژه پاناما تصاحب کتاب‌ها از بازارهای تجاری، بریدن عطف آن‌ها و اسکن کردنشان بود.

یک حکم دادگاه اخیر پیشنهاد کرد که اسکن یک کتاب برای داده‌های آموزشی ممکن است «استفاده منصفانه» (Fair Use) تلقی شود و نقض کپی‌رایت نباشد، به شرطی که نسخه فیزیکی اصلی نابود شود. با نابود کردن کتاب، شرکت AI تضمین می‌کند که رسانه فیزیکی تکثیر یا بازفروش نمی‌شود، که از نظر تئوری مانع از این می‌شود که این عملیات به مدل کسب‌وکار اصلی ناشر آسیب بزند. در واقع، دادگاه این عمل را به عنوان حق مشتری برای برداشتن یک رسانه فیزیکی و ذخیره دیجیتالی آن مشاهده کرد.

هزینه پیشرفت

سخنگوی آمازون اظهار داشت که شرکت «کتاب‌ها را از طریق کانال‌های تجاری خریداری می‌کند تا به توسعه و بهبود محصولات و خدماتی که مشتریان ما از آن‌ها استفاده می‌کنند کمک کند». با این حال، شرکت از پاسخ به این سؤال که چرا کتاب‌ها بریده می‌شوند، چه تعداد از این تأسیسات در سطح جهان وجود دارد یا چگونه به واکنش‌های منفی عمومی در مورد تخریب کتاب‌ها پاسخ می‌دهند، خودداری کرد.

برای مورخان و مجموعه‌داران، این فقدان جبران‌ناپذیر است. محموله ردیابی‌شده توسط 404 Media شامل کتاب‌های کمیابی بود — برخی به دلیل تعداد نسخه‌های چاپ‌شده بسیار کم و برخی دیگر به دلیل اینکه به زبان‌های خارجی کمیاب نوشته شده بودند. همان‌طور که یکی از کتاب‌فروشان توضیح داد، اگرچه این آثار ممکن است ارزش پولی یک چاپ اول از کتاب «الیور توئیست» را نداشته باشند، اما دارای ارزش تاریخی، فکری و عاطفی عظیمی هستند.

این کتاب‌فروش گفت: «همه چیزهای مختلفی وجود دارد که شرکت‌های AI به آن‌ها اهمیت نمی‌دهند. آن‌ها فقط محتوا را به عنوان مجموعه‌ای از کلمات پشت سر هم می‌خواهند.»

این تغییر نشان‌دهنده عصر جدیدی از تصاحب داده‌ها است که در آن دنیای فیزیکی برای تغذیه هوش دیجیتال استخراج و دور ریخته می‌شود. رقابت برای دستیابی به عملکرد در سطح مدل‌های پیشرو، از اینترنت فراتر رفته و به آرشیوهای تاریخ بشر رسیده است. این رویکرد استخراجی آمازون در حالی رخ می‌دهد که مطالعات پیشین نشان داده‌اند تولید کتاب‌های مبتنی بر هوش مصنوعی تأثیرات مخربی بر درآمد نویسندگان انسانی داشته و بازار نشر را اشباع کرده است.

منتظر دعاوی حقوقی کپی‌رایت در آینده باشید، زیرا نویسندگان و ناشران به تخریب فیزیکی مالکیت معنوی خود به بهای آموزش مدل‌های زبانی بزرگ (LLM) واکنش نشان خواهند داد.

چرا این موضوع مهم است؟

این اقدام نشان‌دهنده عبور از عصر داده‌های رایگان وب به عصر «استخراج تهاجمی» است. اعتبار مدل‌های آینده به جای حجم داده، به «خلوص انسانی» آن‌ها وابسته است و آمازون با نابودی نسخه‌های فیزیکی، رقبای خود را از دسترسی به این منابع محروم می‌کند.

تأثیر برای ایران

این خبر اثر مستقیمی بر کاربران ایرانی ندارد، اما برای پژوهشگران مدل‌های زبانی در ایران هشدار است که وابستگی به داده‌های وب (Web-scraped) به‌دلیل رشد محتوای مصنوعی، به‌زودی منجر به کاهش کیفیت مدل‌ها خواهد شد.

·نگاه ما
تحریریه دات‌هوش

تغییر استراتژی از «خزش وب» به «استخراج فیزیکی»، نشان می‌دهد که داده‌های باکیفیت انسانی به کالایی کمیاب تبدیل شده‌اند. آمازون با استفاده از یک حفره قانونی (تخریب برای اثبات عدم رقابت تجاری)، در واقع در حال خصوصی‌سازی دانش بشری است تا برتری فنی مدل‌های Nova را تضمین کند. این یعنی در آینده، تنها کسانی به متون اصلی دسترسی خواهند داشت که یا مالک فیزیکی آن‌ها باشند یا به دیتابیس‌های بسته غول‌های تک را دسترسی داشته باشند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.