پرش به محتوای اصلی
پرش به محتوای مقاله

۷۶٪ از ۵۰ خبرگزاری برتر جهان برای موتورهای جست‌وجوی AI نامرئی هستند

·۱۲ مرداد ۱۴۰۵۵ دقیقه مطالعه۲ بازدید
بررسی کردم آیا ChatGPT می‌تواند ۵۰ سایت خبری برتر را ارجاع دهد: ۳۸ سایت نامرئی‌اند — اکثراً تصادفی.
بررسی کردم آیا ChatGPT می‌تواند ۵۰ سایت خبری برتر را ارجاع دهد: ۳۸ سایت نامرئی‌اند — اکثراً تصادفی.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کشف یک «اشتباه سیستمی» در سطح جهانی: ناشران به‌جای مسدودسازی استراتژیک، دچار خطای فنی شده‌اند و تفاوت عامل‌های آموزش و بازیابی را در تنظیمات دسترسی نادیده گرفته‌اند.

تصور کنید محتوای شما توسط پیشرفته‌ترین مدل‌های جهان خوانده شده و یاد گرفته می‌شود، اما وقتی کاربران از این مدل‌ها برای یافتن منبع می‌خواهند، نام شما هرگز نمی‌آید. این دقیقاً وضعیتی است که در حال حاضر برای اکثریت ناشران انگلیسی‌زبان رخ داده است. طبق گزارشی که در ۱ اوت ۲۰۲۶ منتشر شد، ۳۸ سایت از ۵۰ ناشر برتر حوزه خبر و فناوری، برای سیستم‌های استناددهی هوش مصنوعی نامرئی هستند. نکته تکان‌دهنده این است که این اتفاق نه یک استراتژی آگاهانه، بلکه نتیجه‌ی یک «تصادف فنی» در مدیریت دسترسی‌هاست.

در ادامه تحلیل‌های قبلی ما درباره‌ی اینکه چگونه هوش مصنوعی می‌تواند مهارت‌های حیاتی را در کلاس‌های درس تخریب کند، اکنون شاهد یک نقطه کور مشابه در نحوه مدیریت حضور دیجیتال توسط ناشران هستیم. بسیاری از تحریریه‌ها با تمام بات‌های AI به عنوان یک گروه واحد برخورد می‌کنند و نمی‌توانند بین بات‌هایی که داده‌ها را برای آموزش می‌دزدند و بات‌هایی که از طریق استناد (Citation) ترافیک ایجاد می‌کنند، تفکیک قائل شوند. این سوءتفاهم به این معناست که حتی اگر سایتی در گوگل رتبه بالایی داشته باشد، ممکن است در پاسخ‌های تولیدشده توسط هوش مصنوعی اصلاً وجود نداشته باشد. این چالش دقیقاً همان نقطه‌ای است که در آن تفکیک دسترسی ربات‌ها به شرطی حیاتی برای دیده شدن در موتورهای پاسخگو تبدیل می‌شود.

تفکیک بازیابی از آموزش

برای درک این شکست فنی، باید بین دو نوع عامل هوش مصنوعی تمایز قائل شوید. اول، خزنده‌های آموزشی (Training Crawlers) مانند GPTBot، ClaudeBot، CCBot، Google-Extended، Applebot-Extended، Bytespider، meta-externalagent و anthropic-ai هستند. این بات‌ها داده‌ها را جمع‌آوری می‌کنند تا مدل‌ها را بسازند و اصلاح کنند. این بات‌ها اطلاعات را برای ذخیره‌سازی بلندمدت در قالب «وزن‌های» (Weights) مدل پردازش می‌کنند.

در مقابل، عامل‌های بازیابی (Retrieval Agents) برای واکشی زنده طراحی شده‌اند. این گروه شامل OAI-SearchBot، ChatGPT-User، Claude-SearchBot، Claude-User، PerplexityBot، Perplexity-User و Amazonbot است. این عامل‌ها صفحات را در لحظه فراخوانی می‌کنند تا استنادات و لینک‌های بازگشتی به ناشر را فراهم کنند.

اگر ناشری عامل‌های بازیابی را مسدود کند، کاملاً از پاسخ‌های جست‌وجوی AI حذف می‌شود. طبق این گزارش، سناریویی ایجاد شده است که در آن محتوای یک سایت ممکن است مدل را آموزش دهد، اما تنها چیزی که خوانندگان را به سایت بازمی‌گرداند — یعنی استناد همراه با لینک — خاموش شده است. برای بسیاری از ناشران، مدل از تخصص آن‌ها یاد می‌گیرد، اما ناشر در مقابل هیچ ترافیکی دریافت نمی‌کند. این فقدان ترافیک ارجاعی در حالی رخ می‌دهد که با وجود رشد قابل توجه ترافیک جست‌وجوی AI در سال ۲۰۲۵، سهم این بازدیدها همچنان بسیار اندک است.

متدولوژی حسابرسی

این مطالعه با استفاده از یک ابزار حسابرسی باز به نام Actor، وضعیت ۵۰ ناشر برتر انگلیسی‌زبان حوزه خبر و فناوری را ارزیابی کرد. این فرآیند از یک تأییدیه دو مرحله‌ای برای مسیر اصلی سایت (/) پیروی می‌کرد:

۱. ارزیابی robots.txt: ابزار مذکور فایل‌ها را برای ۱۵ خازنده (Crawler) خاصی که پیش‌تر ذکر شد تحلیل کرد. این بررسی از معناشناسی مستند گوگل برای robots پیروی می‌کرد: گروه خاص‌تر برنده است، طولانی‌ترین قانون اولویت دارد و در صورت تساوی، دستور «Allow» پیروز می‌شود.

۲. بررسی محتوای HTML: ابزار صفحه اصلی را بدون اجرای جاوااسکریپت (JavaScript) فراخوانی کرد. این اقدام دقیقاً شبیه‌سازی رفتار عامل‌های بازیابی است. یک سایت تنها زمانی «قابل استناد» (Citable) علامت می‌خورد که هم عامل‌های بازیابی را مسدود نکرده باشد و هم HTML حاوی متن خواندنی ارائه دهد.

چهار سایت شامل NYT، Guardian، FT و Daily Mail صفحات اصلی خود را با «دیوارهای بات» (Bot-wall) بسته‌اند. برای این موارد، تنها تحلیل robots.txt امکان‌پذیر بود که برای تعیین وضعیت «غیرقابل استناد» آن‌ها کافی بود.

الگوهای شکست فنی

حسابرسی مذکور، ۵۰ سایت را در چهار حالت متمایز از شکست طبقه‌بندی کرد:

  • مسدودسازی کامل (Total Blockade): ۹ سایت تمام ۷ عامل بازیابی اصلی را بلاک کرده‌اند. این گروه شامل CNN، NBC News، USA Today، HuffPost، The Telegraph، Daily Mail، CNET، ZDNet و Mashable است. هر آنچه این تحریریه‌ها منتشر کنند، هیچ پاسخی در AI نمی‌تواند از آن نقل‌قول کند یا به آن لینک بدهد.

  • جهت اشتباه (The Wrong Direction): ۲۵ سایت اجازه دسترسی به حداقل یک خازنده آموزشی را داده‌اند اما عامل‌های بازیابی را مسدود کرده‌اند. این گروه شامل The Verge، Wired، Ars Technica، The Atlantic، Vox، The Guardian، The Washington Post و WSJ است. این رایج‌ترین خطا است و بعید است که این ناشران این مبادله را به‌طور عمدی انتخاب کرده باشند.

  • لغزش تک-بات (The Single-Bot Slip): ۵ سایت تنها یک خط کد با قابل استناد شدن فاصله دارند. ABC News و TechCrunch تنها ChatGPT-User را مسدود کرده‌اند، در حالی که Axios، Tom's Hardware و VentureBeat فقط Amazonbot را بلاک کرده‌اند.

  • پوسته جاوااسکریپتی (The JavaScript Shell): ۳ سایت از جمله NPR، Politico و The Information اجازه دسترسی به هر ۷ عامل بازیابی را داده‌اند، اما صفحاتی را ارائه می‌دهند که HTML آن‌ها بدون جاوااسکریپت اساساً هیچ متن خواندنی ندارد. چون عامل‌های بازیابی کد جاوااسکریپت را اجرا نمی‌کنند، آن‌ها با یک «اتاق خالی» مواجه می‌شوند.

اثر قراردادهای لایسنس

داده‌ها همبستگی واضحی بین قراردادهای لایسنس و دسترسی بات‌ها نشان می‌دهند. این همان «عصر قراردادهای لایسنس» است که در قالب اعداد بیان شده است. OAI-SearchBot تنها توسط ۱۴ سایت مسدود شده است، در حالی که PerplexityBot توسط ۳۰ سایت و Amazonbot توسط ۲۸ سایت بلاک شده‌اند. دو عامل بازیابی شرکت Anthropic نیز توسط ۲۴ تا ۲۵ سایت مسدود شده‌اند.

ناشرانی که قراردادهای مالی با OpenAI دارند، معمولاً بات‌های استنادی OpenAI را باز می‌گذارند در حالی که سایرین را مسدود می‌کنند. در نهایت تنها ۱۲ سایت به‌طور کامل «قابل استناد» بودند: Fox News، CBS News، Business Insider، LA Times، Time، Slate، The Independent، The Daily Beast، Semafor، Engadget، Gizmodo و PCMag.

تحلیل برای ناشران

برای یک تحریریه مدرن، این وضعیت یک شکست بحرانی در SEO فنی است. بخشی از این اتفاقات عمدی است؛ برای مثال، NYT در حال شکایت از OpenAI است و سایر ناشران از مسدودسازی به عنوان اهرمی در مذاکرات لایسنس استفاده می‌کنند. با این حال، مسدودسازی در «جهت اشتباه» (اجازه دادن به آموزش اما ممنوعیت استناد) موقعیتی است که دفاع از آن به عنوان یک استراتژی بسیار دشوار است. بسیاری از سایت‌ها صرفاً این قوانین را از لیست‌های قدیمی «بلاک کردن بات‌های AI» مربوط به سال ۲۰۲۳ به ارث برده‌اند.

علاوه بر این، مشکل «پوسته جاوااسکریپتی» شکافی را در ابزارهای سنتی SEO برجسته می‌کند. یک صفحه ممکن است در مرورگر عالی به نظر برسد، اما یک عامل AI هیچ چیزی برای نقل‌قول پیدا نمی‌کند. این نامرئی بودن، یک تهدید وجودی برای ترافیک ارجاعی در اکوسیستم جست‌وجوی «ابتدا هوش مصنوعی» (AI-first) است. این تهدید در واقع بخشی از چالش گسترده‌تر بقای وب‌سایت‌ها در برابر AI است که در آن سهم بازدیدها به شدت کاهش یافته است.

اگر شما مجموعه‌ای از سایت‌ها را مدیریت می‌کنید، بررسی‌های دستی دیگر کافی نیستند. فایل‌های robots.txt در طول زمان به دلیل به‌روزرسانی‌های CMS، تغییر پلتفرم یا سوئیچ‌های تک‌کلیکی «بلاک کردن بات‌های AI» در CDN دچار «لغزش» (Drift) می‌شوند. برای مثال، robots.txt مدیریت‌شده توسط Cloudflare می‌تواند قوانینی را بدون اطلاع مالک به سایت اضافه کند. بررسی‌ای که در مارس «سبز» (سالم) بوده، می‌تواند در ژوئن بدون اینکه کسی به آن دست زده باشد، «قرمز» شود.

گام بعدی شما برای تایید سایت

برای جلوگیری از این شکست‌ها، دو بررسی را انجام دهید:

۱. بررسی robots.txt: مطمئن شوید عامل‌های استنادی مانند OAI-SearchBot، ChatGPT-User، Claude-SearchBot، Claude-User، PerplexityBot، Perplexity-User و Amazonbot مسدود نیستند.

۲. تایید متن رندر شده در سرور: از ابزاری مانند curl برای فراخوانی صفحه خود استفاده کنید. به دنبال محتوای واقعی خود در HTML خام بگردید. اگر متن تنها پس از اجرای جاوااسکریپت ظاهر می‌شود، عامل‌های بازیابی یک پوسته خالی را می‌بینند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است؛ برای درک اینکه چگونه مراکز داده برای این حجم از بازیابی‌ها بهینه می‌شوند، به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این یافته‌ها اعتبار مدل‌های بازیابی را به چالش می‌کشد و نشان می‌دهد ترافیک وب در عصر AI بیش از آنکه به کیفیت محتوا وابسته باشد، به تنظیمات فنی دسترسی بستگی دارد. عدم تفکیک عامل‌ها منجر به مرگ تدریجی ترافیک ارجاعی برای رسانه‌های معتبر می‌شود.

تأثیر برای ایران

برای رسانه‌های فارسی‌زبان که در حال گذار به استانداردهای SEO مدرن هستند، این یک هشدار است: تکیه بر ابزارهای خودکار بلاک‌کننده AI در CDNها می‌تواند دسترسی سایت‌ها را برای موتورهای جست‌وجوی نسل جدید به‌طور کامل قطع کند.

·نگاه ما
تحریریه دات‌هوش

این گزارش نشان می‌دهد که جنگ میان ناشران و AI از مرحله «بستن درها» به مرحله «مدیریت جریان» رسیده است. خطای رایج در تفکیک بات‌های آموزشی از بازیابی، نشان‌دهنده یک شکاف عمیق میان تیم‌های حقوقی (که می‌خواهند داده‌ها دزدیده نشوند) و تیم‌های مارکتینگ (که ترافیک می‌خواهند) است. در واقع، ناشران در حال حاضر بدون اینکه متوجه شوند، در حال پرداخت هزینه‌ی آموزش رایگان مدل‌ها هستند بدون اینکه در مقابل، سهمی از ترافیک بازگشتی بگیرند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.