پرش به محتوای اصلی
پرش به محتوای مقاله

جست‌وجوی هوش مصنوعی حافظه جمعی اینترنت را پاک می‌کند

·۲۰ مرداد ۱۴۰۵۸ دقیقه مطالعه۲ بازدید
تحلیل
جستجوی گوگل در حال مرگ است. آنچه بعد می‌آید، بدتر است.
جستجوی گوگل در حال مرگ است. آنچه بعد می‌آید، بدتر است.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

این گزارش فراتر از بحث توهمات هوش مصنوعی، به «پاک‌شدگی سیستماتیک» وب اشاره می‌کند و نشان می‌دهد چگونه مدل‌های زبانی با حذف ترافیک منابع اصلی، در واقع در حال نابود کردن غذای خود (داده‌های آموزشی) هستند.

تصور کنید برای برنامه‌ریزی یک جشن یا سفر، به هوش مصنوعی اعتماد کنید و متوجه شوید تمام اطلاعات شما درباره زمان غروب خورشید اشتباه بوده است. این اتفاق برای کاربری در کلرادو اسپرینگز رخ داد؛ او در فیس‌بوک نوشت: «من پروژکتور را بیرون نصب کرده بودم و منتظر غروب خورشید بودم، اما در کمال تعجب متوجه شدم که صرفاً در گذشته زندگی می‌کردم. هوش مصنوعی به من اطلاع داد که غروب خورشید قبلاً اتفاق افتاده است.»

طبق گزارشی که ۱۰ اوت ۲۰۲۶ در وب‌سایت thewalrus.ca منتشر شد، گوگل با اولویت دادن به خلاصه‌های مصنوعی بر منابع اصلی، در ارائه واقعیت‌های ساده شکست خورده است. این موضوع تنها یک خطای فنی نیست، بلکه نشانه‌ای از فروپاشی زیرساخت‌های اطلاعاتی ماست. دانستن زمان دقیق غروب خورشید برای کارهای ساده‌ای مثل دوچرخه‌سواری، برگزاری باربیکیو یا یک قرار عاشقانه (Promposal) که زمان‌بندی دقیقی می‌طلبد، یک ضرورت کاربردی است. با این حال، این پدیده پویا است و بسته به نزدیکی فرد به خط استوا، تنها بین دو و نیم تا چهار دقیقه طول می‌کشد. وقتی هوش مصنوعی شروع به اختراع این زمان‌ها می‌کند، به گفته یکی از متخصصان فناوری، یعنی شرکتی که اعتبارش را بر «پاسخ درست» بنا کرده بود، «برتری خود را از دست داده است».

این زوال در حالی رخ می‌دهد که وب با بحران سیستماتیک «پوسیدگی لینک» (Link Rot) و پاک‌شدگی دیجیتال روبروست. همان‌طور که در تحلیل قبلی ما درباره‌ی فشار کاربران برای بازگشت برخی قابلیت‌های قدیمی گوگل و متا اشاره کردیم، مشکل فعلی عمیق‌تر از مدل‌های بی‌دقت است؛ بحث بر سر فروپاشی کل پیکره دیجیتال است. اینترنت را نه به شکل یک کتابخانه، بلکه شبیه مجموعه‌ای از آینه‌های شکننده تصور کنید؛ وقتی شیء اصلی (منبع) ناپدید شود، تنها چیزی که باقی می‌ماند خلاصه هوش مصنوعی است، حتی اگر آن خلاصه یک توهم (Hallucination) — شبیه دوستی که خاطره‌ای را با اطمینان اما کاملاً اشتباه تعریف می‌کند — باشد.

زمینه‌ی زوال دیجیتال

ما معمولاً شکست‌های جست‌وجو را به کمبود مهارت کاربر یا «کثیف شدن» (Enshittification) نتایج نسبت می‌دهیم و با به اشتراک گذاشتن نکاتی برای دوری از «زباله‌های هوش مصنوعی» (AI slop)، خود را آرام می‌کنیم. ما به خودمان اطمینان می‌دهیم که حقیقت هنوز «جایی آنجاست» و فقط باید پرامپت بهتری بنویسیم تا آن را بیابیم. اما زیرساختی که حقیقت را ذخیره می‌کند، در حال تخریب فیزیکی است.

پوسیدگی لینک‌ها هر روز صفحات زیادی را می‌بلعد. برای مثال، در یک مورد، بخش‌های کلیدی قانون اساسی ایالات متحده به دلیل یک خطای کدنویسی برای مدتی از سایت کتابخانه کنگره ناپدید شدند. این نشان می‌دهد حتی حیاتی‌ترین سوابق تاریخی هم در برابر شکنندگی فنی آسیب‌پذیرند.

این وضعیت با گسترش فرمت‌های زودگذر بدتر شده است. ارتباطات از طریق استوری‌های اینستاگرام یا وضعیت‌های واتس‌اپ باعث می‌شود بخش بزرگی از تاریخ اجتماعی، فرهنگی و سیاسی هرگز در وهله اول ذخیره و حفظ نشود.

حالا وقتی یک هوش مصنوعی خطا‌پذیر را بین کاربر و منبع اصلی قرار می‌دهیم، تضمین می‌کنیم که حتی اگر صفحه‌ای در لایه‌های زیرین وجود داشته باشد، عملاً غیرقابل دسترس شود. جست‌وجو دیگر نمی‌تواند ادعا کند که دروازه‌ای خنثی به سوی بدنه پایداری از دانش است.

مکانیسم‌های پاک‌شدگی دیجیتال

جست‌وجوی هوش مصنوعی اساساً روش دسترسی ما به حقیقت را تغییر داده است. گوگل با قرار دادن لایه‌ای از هوش مصنوعی بین کاربر و منبع، باعث می‌شود صفحات موجود عملاً گم شوند. به گزارش 404 Media، این وضعیت با «آلودگی بالادستی» تشدید شده است؛ شرکت‌هایی محتوا را در ردیت (Reddit) می‌کارند تا پاسخ‌های هوش مصنوعی را دستکاری کرده و سوابق عمومی را که این سیستم‌ها خلاصه‌های خود را از آن می‌گیرند، مسموم کنند.

علاوه بر جست‌وجو، حافظه آرشیوی وب تحت فشار اولویت‌های متضاد ذینفعان است:

  • ویکی‌پدیا (Wikipedia) شاهد کاهش ترافیک است؛ چون مدل‌های هوش مصنوعی زاینده (Generative AI) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — محتوا را مستقیماً می‌بلعند و در نتایج ارائه می‌دهند، بنابراین کاربر دیگر نیازی به کلیک روی لینک ندارد. این یعنی ویکی‌پدیا در حال تبدیل شدن به زیرساخت نابودی خودش است، زیرا توجه کاربران و کمک‌های مالی دیگر به‌طور قابل‌اطمینانی به این منبع داوطلبانه بازنمی‌گردد تا زنده بماند.
  • اینترنت آرکایو (Internet Archive) و ابزار Wayback Machine — نزدیک‌ترین حافظه پشتیبان وب که صدها میلیارد عکس (Snapshot) را ثبت کرده است — با حملات سایبری و دعاوی حقوقی گران‌قیمت دست‌وپنجه نرم می‌کنند. پس از پیروزی ناشران در دادگاه‌ها بر سر برنامه وام‌دهی دیجیتال (که آن را کپی غیرمجاز خواندند)، سازمان‌های خبری شروع به مسدود کردن خزنده‌ها کردند تا شرکت‌های هوش مصنوعی نتوانند از صفحات آرشیو شده به عنوان منابع غیرمستقیم برای محتواهای دارای کپی‌رایت استفاده کنند.
  • حذف‌های شرکتی مطلق شده‌اند. در مارس ۲۰۲۵، کمپانی والت دیزنی تقریباً تمام آرشیو FiveThirtyEight را پس از اخراج کارکنانش پاک کرد. این سایت بیش از یک دهه در مالکیت شرکت‌های تابعه دیزنی بود، اما وقتی دیزنی نتیجه گرفت که دیگر یک دارایی فعال نیست — یعنی نه روزنامه‌نگاری جدیدی دارد و نه درآمد تبلیغاتی معناداری — سوابق آن را به‌طور کامل زدود.

این پاک‌شدگی دیجیتال از سانسور کتاب‌ها خطرناک‌تر است. کتاب ممنوعه شروری دارد و جلسات شورای مدرسه برگزار می‌کند، اما یک صفحه وب پاک‌شده چنان بی‌صدا می‌رود که شاید هیچ‌کس متوجه نبود اصلاً وجود داشته است.

پاسخ‌های حاکمیتی

برخی دولت‌ها این موضوع را یک تهدید برای امنیت ملی و مسئله حاکمیت فرهنگی می‌بینند. فرانسه برای محافظت از حاکمیت تکنولوژیک و امنیت سایبری ملی خود از پلتفرم‌های سیلیکون‌ولی فاصله گرفته است. در اقدامی پیش‌دستانه در اواخر ۲۰۱۸، مجلس ملی و وزارت دفاع فرانسه از Qwant استفاده کردند؛ سرویسی که در اروپا میزبانی می‌شود.

سرویس Qwant بر اساس مدلی عمل می‌کند که داده‌های جست‌وجو را ذخیره نمی‌کند، اطلاعات شخصی را نمی‌فروشد و از تبلیغات هدفمند بر اساس تاریخچه مرورگر استفاده نمی‌کند. سایر تغییرات اروپایی عبارتند از:

  • جایگزینی واتس‌اپ و سیگنال با اپلیکیشن داخلی Tchap برای ارتباطات دولتی.
  • انتقال ۷۲۰ عضو پارلمان اروپا و هزاران کارکنان اداری به Qwant برای تبدیل بازیابی اطلاعات به یک دارایی استراتژیک.
  • مهاجرت کمیسیون اروپا به W Social، یک شبکه اجتماعی مستقل که توسط یک استارت‌آپ سوئدی ساخته شده است.
  • جایگزینی گسترده محصولات مایکروسافت با جایگزین‌های متن‌باز در صدها هزار ایستگاه کاری.

پیش‌روهای قانونی هم در حال تغییرند. دادگاهی در آلمان اخیراً گوگل را مسئول اظهارات نادرست در بخش AI Overview دانست؛ جایی که هوش مصنوعی به اشتباه دو شرکت انتشاراتی را به شیوه‌های تجاری کلاهبردارانه متصل کرده بود. دادگاه استدلال کرد چون هوش مصنوعی اطلاعات را استخراج و با کلمات خود بازنویسی می‌کند، در واقع در حال خلق محتوای جدید است و باید مسئولیت تحریریه را بپذیرد، نه اینکه ادعا کند فقط یک واسطه غیرفعال است. گوگل در حال اعتراض به این تصمیم است، اما این رویه نشان می‌دهد دولت‌ها آزادی عمل بیشتری در تنظیم مقررات شرکت‌هایی که محتوا تولید می‌کنند، دارند.

شکاف زیرساختی

کانادا سابقه‌ای در ساخت معماری‌های دیجیتال با منافع عمومی دارد. پروژه‌هایی مثل CANARIE (شبکه کانادایی برای پیشبرد پژوهش، صنعت و آموزش) در دهه ۹۰ و Public Knowledge Project در دانشگاه سایمون فریزر (که سیستم Open Journal Systems را در سال ۲۰۰۲ برای کمک به هزاران مجله علمی جهت انتشار خارج از چنگ شرکت‌های تجاری راه انداخت) ثابت کردند که شبکه‌های پژوهشی ملی می‌توانند مستقل از شرکت‌های بزرگ باشند.

سایر نمونه‌های تاریخی ابتکارات دیجیتال کانادایی عبارتند از:

  • SchoolNet و برنامه دسترسی جامعه (Community Access Program) که مدارس و کتابخانه‌ها را سال‌ها پیش از آنکه اتصال به اینترنت بدیهی شود، آنلاین کرد.
  • MapleMusic که بازاری آنلاین برای موسیقی کانادایی ساخت، پیش از آنکه عصر سلطه استریمینگ، کشف فرهنگی را ببلعد.
  • کتابخانه و آرشیو کانادا که سوابق وب فدرال را حفظ می‌کند و با Internet Archive Canada که در tandem با سازمان اصلی کار می‌کند و نسخه‌های پشتیبان داده‌ها را در دانشگاه‌های کانادایی میزبانی می‌کند، همکاری می‌کند.

با این حال، تکیه فعلی دولت‌ها به شرکت‌های تبلیغاتی برای هدایت کارهای سیاست‌گذاری، وابستگی خطرناکی ایجاد کرده است. سخت است تصور کنیم کشوری که استراتژی هوش مصنوعی‌اش توسط اقتصاددان ارشد گوگل تأیید شده، تصمیم بگیرد هدایت کارهای روزمره سیاست‌گذاری دولت را از یک شرکت تبلیغاتی خارج کند. همان‌طور که کارولین استیج اولسن، وزیر دیجیتال‌سازی دانمارک اشاره کرد، وقتی زیرساخت دیجیتال عمومی به چند تأمین‌کننده خارجی گره بخورد، دولت آسیب‌پذیر می‌شود.

گام بعدی شما

  • برای کاهش نشت داده‌ها و حمایت از حاکمیت اطلاعاتی، از موتورهای جست‌وجوی متمرکز بر حریم خصوصی مثل DuckDuckGo یا Qwant استفاده کنید. اطلاعات ارزش اقتصادی دارند؛ الگوهای تجمیعی جست‌وجو می‌توانند بینش‌های حساسی را درباره یک جامعه و شهروندانش آشکار کنند. اگر دولت‌ها می‌خواهند اقتصاد نامشهود را مدیریت کنند، ابتدا باید شرایطی را فراهم کنند که اطلاعات بادوام و قابل‌یافت باشند.
  • برای حفظ سوابق مهم کاری یا پژوهشی خود، به جای تکیه بر لینک‌ها، نسخه‌های PDF یا آرشیوهای آفلاین تهیه کنید. ما به سمت یک اینترنت مصنوعی حرکت می‌کنیم که در آن ماشین‌ها چیزها را به‌طور تصادفی به یاد می‌آورند و واسطه‌ها از تکه‌های باقی‌مانده پول در می‌آورند.
  • در هنگام استفاده از خلاصه‌های هوش مصنوعی، همواره روی لینک منبع کلیک کنید تا مطمئن شوید مدل دچار توهم نشده است. اگر با جست‌وجو به عنوان یک سرویس مصرف‌کننده برخورد کنیم و نه به عنوان یک زیرساخت حیاتی، ریسک از دست دادن توانایی بازیابی حافظه جمعی خود را می‌پذیریم.

این تغییر به نفع پلتفرم‌هایی است که LLMها را کنترل می‌کنند، زیرا آن‌ها به تنها داوران اینکه چه چیزی «حقیقت» یا «موجود» است تبدیل می‌شوند. اثر مرتبه دوم آن، از دست دادن حاکمیت فرهنگی است؛ اگر ملتی نتواند سوابق دیجیتال خود را حفظ کند، نمی‌تواند تاریخ خود را اداره کند. ما می‌پذیریم که جاده‌ها توسط شرکت‌های تاکسی اینترنتی اداره نمی‌شوند، اپلیکیشن‌های پرداخت سیاست‌های پولی را تعیین نمی‌کنند و ارائه‌دهندگان ابری چارچوب‌های امنیت ملی را دیکته نمی‌کنند، اما در مورد وابستگی‌های دیجیتال خود به‌طور تکان‌دهنده‌ای سهل‌انگار بوده‌ایم.

منتظر احکام بعدی دادگاه‌های اروپایی درباره مسئولیت تحریریه هوش مصنوعی باشید، زیرا این احکام تعیین می‌کنند که آیا Big Tech می‌تواند همچنان ادعا کند که تنها واسطه‌ای غیرفعال برای اطلاعات است یا خیر. خورشید در حال غروب است برای آن قرارداد قدیمی با گوگل: «کنجکاوی‌ات را به ما بده و ما دنیا را به تو می‌دهیم». آنچه بعد از آن طلوع می‌کند، بستگی به این دارد که آیا با اینترنت عمومی به عنوان یک محصول سودآور برخورد کنیم یا به عنوان یک حافظه تاریخی حفظ‌شده که متعلق به ماست.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این روند باعث تخریب اعتبار منابع مستقل وب می‌شود و در بلندمدت، دانش بشری را به داده‌های بازیافتی و احتمالا غلط تبدیل می‌کند. تکیه بر اعتبار مؤسسات آرشیوی برای جلوگیری از فراموشی جمعی دیجیتال اکنون حیاتی‌تر از هر زمان دیگری است.

تأثیر برای ایران

به‌دلیل تحریم‌ها و محدودیت‌های API، دسترسی کاربران ایرانی به ابزارهای جایگزین حاکمیتی محدود است و وابستگی به مدل‌های آمریکایی برای بازیابی اطلاعات در ایران شدیدتر است.

·نگاه ما
تحریریه دات‌هوش

بزرگ‌ترین ریسک فعلی، تبدیل شدن مدل‌های زبانی به «تنها منبع حقیقت» است. وقتی لایه استنتاج جایگزین لایه بازیابی شود، ما از عصر «جست‌وجوی منبع» به عصر «پذیرش پاسخ» می‌رویم و در این مسیر، توانایی اعتبارسنجی اطلاعات را از دست می‌دهیم. این تغییر، قدرت تعریف تاریخ را از دست نویسندگان و آرشیویست‌ها می‌گیرد و به دست مهندسان مدل‌های بسته می‌سپارد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.