تصور کنید یک عامل (Agent) هوش مصنوعی را که هیچ قابلیت حل چالش یا ورود به حساب کاربری ندارد؛ این ابزار در حال حاضر تنها به ۸۲.۵٪ از وب واقعی دسترسی دارد. طبق تحلیل فنی منتشر شده در ۸ اکتبر ۲۰۲۶، شکافی عمیق در حال شکلگیری است: «کتابخانه عمومی» وب یعنی مستندات فنی باز ماندهاند، اما مناطقی که بیشترین ارزش اقتصادی را برای عاملها دارند، در حال بستن درها هستند.
بسیاری از محکهای فعلی بر صفحات ایستا یا مجموعهدادههای محلی تکیه میکنند، زیرا وب زنده محیطی خصمانه است. عواملی مانند اعتبار IP، چالشهای متغیر و دیوارهای متحرک، اندازهگیری دقیق را دشوار میکنند. برای حل این مشکل، پژوهشگر از navette استفاده کرد؛ یک مرورگر مخصوص عاملها با حجم ۶۵۹ کیلوبایت و نوشته شده با زبان Rust که ۲۰۰ آدرس URL واقعی را در پنج دسته بررسی کرد: مستندات، اخبار، تجارت الکترونیک، ابزارهای توسعه و شبکههای اجتماعی. این ابزار در واقع پاسخی به این پرسش است که آیا وبسایتها برای تعامل با عاملهای هوش مصنوعی بهینه شدهاند یا خیر.
چارچوب اندازهگیری
این بررسی به عنوان یک عامل «ساده» طراحی شده بود: بدون تلاش مجدد، بدون ورود به حساب و بدون قابلیت حل چالشهای امنیتی. در این آزمایش از یک IP مسکونی واحد در طول یک روز استفاده شد. هدف این نبود که درباره هر سایت حکم قطعی صادر شود، بلکه هدف اندازهگیری تجربهای بود که یک عامل پایه از یک نقطه دید مشخص با آن مواجه میشود.
شکاف خوانایی
نتایج نشان میدهد که دسترسی به محتوا بهصورت تصادفی توزیع نشده است. مستندات تقریباً بهطور کامل باز هستند و ۳۹ صفحه از ۴۰ صفحه قابل خواندن بودند. تنها مورد استثنا go.dev/tour بود که بهجای یک صفحه مستندات استاندارد، یک محیط تعاملی JS است. سایتهای بزرگی مانند MDN، python.org، React، Rust، Kubernetes و AWS دقیقاً همان محتوایی را به عامل ارائه دادند که به انسانها میدهند.
در مقابل، شبکههای اجتماعی محدودکنندهترین دسته بودند و تنها ۶۵٪ خوانایی داشتند. سایتهای خبری در سطح ۸۵٪ قرار دارند، اما این عدد فریبنده است؛ زیرا در حالی که درب ورودی باز است، «قرارداد اجتماعی» در لایههای پشتی (Backend) پیش از این شکسته شده است.
جزئیات دستهبندیها
- مستندات: ۹۷٪ خوانایی (۳۹/۴۰). صفر چالش، ۱ گیت JS، صفر مسدودسازی در robots.txt و وجود ۱ فایل llms.txt.
- اخبار: ۸۵٪ خوانایی (۳۴/۴۰). ۳ چالش، ۳ گیت JS، ۳۵ مورد مسدودسازی در robots.txt و وجود ۵ فایل llms.txt.
- تجارت الکترونیک: ۸۲٪ خوانایی (۳۳/۴۰). ۲ چالش، ۵ گیت JS، ۸ مورد مسدودسازی در robots.txt و وجود ۹ فایل llms.txt.
- ابزارهای توسعه: ۸۲٪ خوانایی (۳۳/۴۰). ۵ چالش، ۲ گیت JS، ۴ مورد مسدودسازی در robots.txt و وجود ۱۴ فایل llms.txt.
- اجتماعی: ۶۵٪ خوانایی (۲۶/۴۰). ۲ چالش، ۱۲ گیت JS، ۲۵ مورد مسدودسازی در robots.txt و وجود ۱۴ فایل llms.txt.
همانطور که در تحلیلهای قبلی ما درباره امنیت مدلهای بازمتن اشاره کردیم، دسترسی به دادههای باکیفیت همواره نقطه حساس رقابت است. به گزارش dev.to، موانع فعلی در سه لایه متمایز قرار دارند:
۱. دیوار اعلامشده: ۷۲ میزبان از ۲۰۰ مورد، تمام خزندههای هوش مصنوعی را از طریق robots.txt مسدود کردهاند. هدفهای اصلی شامل GPTBot (۶۹ میزبان)، Google-Extended (۶۷)، Bytespider (۶۷)، ClaudeBot (۶۶) و anthropic-ai (۶۶) هستند. این یک قرارداد اجتماعی است، نه یک حصار فیزیکی.
۲. دیوار اجباری: این حصار واقعی است و شامل ۱۲ چالش فعال (مانند Turnstile، پیامهای «Just a moment»، DataDome و PerimeterX) و ۲۳ گیت JS است که بدون اجرای کد، هیچ محتوایی رندر نمیکنند.
۳. بهای عبور (Tollbooth): ظهور خانواده پروتکل x402 که دسترسی پرداختمحور بهازای هر درخواست را از طریق وضعیت HTTP 402 و هدرهای X-Payment ممکن میکند.

زیرساختهای پرداختمحور
اگرچه «بهای عبور» (x402) هنوز بهطور گسترده مستقر نشده، اما زیرساختهای آن در حال آمادهسازی است. پژوهشگر وضعیت HTTP 402، هدرهای پرداخت و نشانهگذاری schema.org (isAccessibleForFree:false) را رصد کرد که در واقع نشانهگذاری Paywall گوگل است و توسط هر عاملی قابل خواندن است.
در میان ۱۶۴ بررسی که پاسخ دادند (۳۶ مورد توسط خطای 403 لبه مسدود شده بودند)، هیچ مورد 402 یا هدر X-Payment مشاهده نشد. با این حال، طبق مستندات، سایت The Intercept در حال حاضر هر سه لایه را به کار میگیرد: در نشانهگذاری خود Paywall را اعلام کرده، تمام خزندههای اصلی AI را در robots.txt مسدود کرده (شامل GPTBot، ClaudeBot، CCBot، Google-Extended، PerplexityBot و Amazonbot)، اما فعلاً صفحه اصلیاش را برای عاملهای ساده باز گذاشته است. این وضعیت به «پارکینگ متری با دروازه باز» تشبیه شده است.
این موضوع نشان میدهد که دیوارهای اجباری برای محافظت از گذار به مدل دسترسی پولی استفاده میشوند. دادهها ثابت میکنند که قرارداد اجتماعی robots.txt در هر جایی که تولید محتوا گران است، امضا شده است، حتی اگر درب ورودی فعلاً باز باشد. این تقابل میان دسترسی آزاد و محدود، ما را به بحث قراردادهای ماشینخوان در برابر توصیفات انسانی در بازارهای عاملهای هوش مصنوعی بازمیگرداند.
فرسایش در لحظه
برای جامعه فنی، این موضوع معیار قابلیت اطمینان عاملها را تغییر میدهد. دیگر کافی نیست که یک عامل بتواند از طریق یک پرامپت استدلال کند؛ بلکه باید بتواند در چشماندازی از اعتبارهای متغیر IP و گیتهای فنی پیمایش کند.
جالب است که وب در لحظه در حال بسته شدن است. بین ۶ و ۸ اکتبر، خوانایی کلی مجموعه از ۸۴.۵٪ به ۸۲.۵٪ کاهش یافت. این افت به دلیل تغییر تنظیمات robots.txt یک ناشر خبری بود که دسترسی را برای همه بست (تغییر از ۳۴ به ۳۵ مورد مسدودسازی). اگرچه یک ناشر ناچیز به نظر میرسد، اما این مجموعه داده دقیقاً همین چرخش را ثبت کرده است.
مذاکره ماشینی و ابزارها
پذیرش llms.txt — که یک مسیر courtesy برای مذاکره ماشینی است — در حال حاضر متمرکز بر بخش مستندات و ابزارهای توسعه است، جایی که دیوارهای فنی وجود ندارند. تنها ۵۵ سایت از ۲۰۰ مورد، فایل llms.txt دارند. سایتهایی که بیشترین نیاز به کانال مذاکره ماشینی دارند (اخبار و اجتماعی)، کمترین علاقه را نشان دادهاند و تنها ۵ سایت خبری چنین فایلی دارند.
توسعهدهندگانی که خزندهها یا ابزارهای استخراج داده میسازند، باید این شکستهای «ساکت» را در نظر بگیرند. گذار از یک وب رایگان و باز به محیطی متری و پرداختمحور برای ماشینها، همین حالا در نشانهگذاریهای بزرگترین ناشران جهان قابل مشاهده است. برای مدیریت این پیچیدگیها، استفاده از رویکردهای SRE برای شناسایی خطاهای کوئری میتواند به بهبود مشاهدهپذیری عاملها کمک کند. پژوهشگر این مجموعه داده (۲۰۰ ردیف در ۵ دسته) را تحت مجوز CC BY 4.0 منتشر کرده است که شامل طبقهبندی نتایج، انواع دیوارها و سیگنالهای x402 است و از طریق یک دیمون navette قابل بازتولید است.
گام بعدی شما
- اگر در حال توسعه عاملهای وبگردان هستید، بررسی کنید که آیا مدل شما با خطاهای 403 و گیتهای JS بهصورت ساکت مواجه میشود یا خیر.
- برای دسترسی به دادههای باکیفیت، بهجای تکیه بر خزش ساده، به دنبال APIهای رسمی یا پروتکلهای مذاکره ماشینی مانند llms.txt باشید.
- وضعیت اعتبار IPهای خروجی خود را رصد کنید تا از مسدود شدن توسط سیستمهای DataDome یا PerimeterX جلوگیری کنید.
اما داستان سختافزاری این تحول و نحوه پردازش این حجم از دادهها حتی شگفتانگیزتر است — به تحلیل ما درباره تراشههای Blackwell مراجعه کنید.




گفتگو