پرش به محتوای اصلی
پرش به محتوای مقاله

مستندات فنی در برابر سایت‌های خبری؛ شکاف دسترسی هوش مصنوعی

·۱۶ مهر ۱۴۰۵۵ دقیقه مطالعه
تحلیل
عامل من با وب واقعی روبرو شد: خطاهای ۴۰۳، چالش‌ها و ایستگاه عوارضی در راه.
عامل من با وب واقعی روبرو شد: خطاهای ۴۰۳، چالش‌ها و ایستگاه عوارضی در راه.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نخستین اندازه‌گیری کمی از نرخ مسدودسازی عامل‌های ساده در وب واقعی که نشان می‌دهد دسترسی به وب در بازه زمانی تنها ۴۸ ساعت، ۲٪ کاهش یافته است.

تصور کنید یک عامل (Agent) هوش مصنوعی را که هیچ قابلیت حل چالش یا ورود به حساب کاربری ندارد؛ این ابزار در حال حاضر تنها به ۸۲.۵٪ از وب واقعی دسترسی دارد. طبق تحلیل فنی منتشر شده در ۸ اکتبر ۲۰۲۶، شکافی عمیق در حال شکل‌گیری است: «کتابخانه عمومی» وب یعنی مستندات فنی باز مانده‌اند، اما مناطقی که بیشترین ارزش اقتصادی را برای عامل‌ها دارند، در حال بستن درها هستند.

بسیاری از محک‌های فعلی بر صفحات ایستا یا مجموعه‌داده‌های محلی تکیه می‌کنند، زیرا وب زنده محیطی خصمانه است. عواملی مانند اعتبار IP، چالش‌های متغیر و دیوارهای متحرک، اندازه‌گیری دقیق را دشوار می‌کنند. برای حل این مشکل، پژوهشگر از navette استفاده کرد؛ یک مرورگر مخصوص عامل‌ها با حجم ۶۵۹ کیلوبایت و نوشته شده با زبان Rust که ۲۰۰ آدرس URL واقعی را در پنج دسته بررسی کرد: مستندات، اخبار، تجارت الکترونیک، ابزارهای توسعه و شبکه‌های اجتماعی. این ابزار در واقع پاسخی به این پرسش است که آیا وب‌سایت‌ها برای تعامل با عامل‌های هوش مصنوعی بهینه شده‌اند یا خیر.

چارچوب اندازه‌گیری

این بررسی به عنوان یک عامل «ساده» طراحی شده بود: بدون تلاش مجدد، بدون ورود به حساب و بدون قابلیت حل چالش‌های امنیتی. در این آزمایش از یک IP مسکونی واحد در طول یک روز استفاده شد. هدف این نبود که درباره هر سایت حکم قطعی صادر شود، بلکه هدف اندازه‌گیری تجربه‌ای بود که یک عامل پایه از یک نقطه دید مشخص با آن مواجه می‌شود.

شکاف خوانایی

نتایج نشان می‌دهد که دسترسی به محتوا به‌صورت تصادفی توزیع نشده است. مستندات تقریباً به‌طور کامل باز هستند و ۳۹ صفحه از ۴۰ صفحه قابل خواندن بودند. تنها مورد استثنا go.dev/tour بود که به‌جای یک صفحه مستندات استاندارد، یک محیط تعاملی JS است. سایت‌های بزرگی مانند MDN، python.org، React، Rust، Kubernetes و AWS دقیقاً همان محتوایی را به عامل ارائه دادند که به انسان‌ها می‌دهند.

در مقابل، شبکه‌های اجتماعی محدودکننده‌ترین دسته بودند و تنها ۶۵٪ خوانایی داشتند. سایت‌های خبری در سطح ۸۵٪ قرار دارند، اما این عدد فریبنده است؛ زیرا در حالی که درب ورودی باز است، «قرارداد اجتماعی» در لایه‌های پشتی (Backend) پیش از این شکسته شده است.

جزئیات دسته‌بندی‌ها

  • مستندات: ۹۷٪ خوانایی (۳۹/۴۰). صفر چالش، ۱ گیت JS، صفر مسدودسازی در robots.txt و وجود ۱ فایل llms.txt.
  • اخبار: ۸۵٪ خوانایی (۳۴/۴۰). ۳ چالش، ۳ گیت JS، ۳۵ مورد مسدودسازی در robots.txt و وجود ۵ فایل llms.txt.
  • تجارت الکترونیک: ۸۲٪ خوانایی (۳۳/۴۰). ۲ چالش، ۵ گیت JS، ۸ مورد مسدودسازی در robots.txt و وجود ۹ فایل llms.txt.
  • ابزارهای توسعه: ۸۲٪ خوانایی (۳۳/۴۰). ۵ چالش، ۲ گیت JS، ۴ مورد مسدودسازی در robots.txt و وجود ۱۴ فایل llms.txt.
  • اجتماعی: ۶۵٪ خوانایی (۲۶/۴۰). ۲ چالش، ۱۲ گیت JS، ۲۵ مورد مسدودسازی در robots.txt و وجود ۱۴ فایل llms.txt.

همان‌طور که در تحلیل‌های قبلی ما درباره امنیت مدل‌های بازمتن اشاره کردیم، دسترسی به داده‌های باکیفیت همواره نقطه حساس رقابت است. به گزارش dev.to، موانع فعلی در سه لایه متمایز قرار دارند:

۱. دیوار اعلام‌شده: ۷۲ میزبان از ۲۰۰ مورد، تمام خزنده‌های هوش مصنوعی را از طریق robots.txt مسدود کرده‌اند. هدف‌های اصلی شامل GPTBot (۶۹ میزبان)، Google-Extended (۶۷)، Bytespider (۶۷)، ClaudeBot (۶۶) و anthropic-ai (۶۶) هستند. این یک قرارداد اجتماعی است، نه یک حصار فیزیکی.

۲. دیوار اجباری: این حصار واقعی است و شامل ۱۲ چالش فعال (مانند Turnstile، پیام‌های «Just a moment»، DataDome و PerimeterX) و ۲۳ گیت JS است که بدون اجرای کد، هیچ محتوایی رندر نمی‌کنند.

۳. بهای عبور (Tollbooth): ظهور خانواده پروتکل x402 که دسترسی پرداخت‌محور به‌ازای هر درخواست را از طریق وضعیت HTTP 402 و هدرهای X-Payment ممکن می‌کند.

عامل من با وب واقعی روبرو شد: خطاهای ۴۰۳، چالش‌ها و ایستگاه عوارضی در راه.

زیرساخت‌های پرداخت‌محور

اگرچه «بهای عبور» (x402) هنوز به‌طور گسترده مستقر نشده، اما زیرساخت‌های آن در حال آماده‌سازی است. پژوهشگر وضعیت HTTP 402، هدرهای پرداخت و نشانه‌گذاری schema.org (isAccessibleForFree:false) را رصد کرد که در واقع نشانه‌گذاری Paywall گوگل است و توسط هر عاملی قابل خواندن است.

در میان ۱۶۴ بررسی که پاسخ دادند (۳۶ مورد توسط خطای 403 لبه مسدود شده بودند)، هیچ مورد 402 یا هدر X-Payment مشاهده نشد. با این حال، طبق مستندات، سایت The Intercept در حال حاضر هر سه لایه را به کار می‌گیرد: در نشانه‌گذاری خود Paywall را اعلام کرده، تمام خزنده‌های اصلی AI را در robots.txt مسدود کرده (شامل GPTBot، ClaudeBot، CCBot، Google-Extended، PerplexityBot و Amazonbot)، اما فعلاً صفحه اصلی‌اش را برای عامل‌های ساده باز گذاشته است. این وضعیت به «پارکینگ متری با دروازه باز» تشبیه شده است.

این موضوع نشان می‌دهد که دیوارهای اجباری برای محافظت از گذار به مدل دسترسی پولی استفاده می‌شوند. داده‌ها ثابت می‌کنند که قرارداد اجتماعی robots.txt در هر جایی که تولید محتوا گران است، امضا شده است، حتی اگر درب ورودی فعلاً باز باشد. این تقابل میان دسترسی آزاد و محدود، ما را به بحث قراردادهای ماشین‌خوان در برابر توصیفات انسانی در بازارهای عامل‌های هوش مصنوعی بازمی‌گرداند.

فرسایش در لحظه

برای جامعه فنی، این موضوع معیار قابلیت اطمینان عامل‌ها را تغییر می‌دهد. دیگر کافی نیست که یک عامل بتواند از طریق یک پرامپت استدلال کند؛ بلکه باید بتواند در چشم‌اندازی از اعتبار‌های متغیر IP و گیت‌های فنی پیمایش کند.

جالب است که وب در لحظه در حال بسته شدن است. بین ۶ و ۸ اکتبر، خوانایی کلی مجموعه از ۸۴.۵٪ به ۸۲.۵٪ کاهش یافت. این افت به دلیل تغییر تنظیمات robots.txt یک ناشر خبری بود که دسترسی را برای همه بست (تغییر از ۳۴ به ۳۵ مورد مسدودسازی). اگرچه یک ناشر ناچیز به نظر می‌رسد، اما این مجموعه داده دقیقاً همین چرخش را ثبت کرده است.

مذاکره ماشینی و ابزارها

پذیرش llms.txt — که یک مسیر courtesy برای مذاکره ماشینی است — در حال حاضر متمرکز بر بخش مستندات و ابزارهای توسعه است، جایی که دیوارهای فنی وجود ندارند. تنها ۵۵ سایت از ۲۰۰ مورد، فایل llms.txt دارند. سایت‌هایی که بیشترین نیاز به کانال مذاکره ماشینی دارند (اخبار و اجتماعی)، کمترین علاقه را نشان داده‌اند و تنها ۵ سایت خبری چنین فایلی دارند.

توسعه‌دهندگانی که خزنده‌ها یا ابزارهای استخراج داده می‌سازند، باید این شکست‌های «ساکت» را در نظر بگیرند. گذار از یک وب رایگان و باز به محیطی متری و پرداخت‌محور برای ماشین‌ها، همین حالا در نشانه‌گذاری‌های بزرگ‌ترین ناشران جهان قابل مشاهده است. برای مدیریت این پیچیدگی‌ها، استفاده از رویکردهای SRE برای شناسایی خطاهای کوئری می‌تواند به بهبود مشاهده‌پذیری عامل‌ها کمک کند. پژوهشگر این مجموعه داده (۲۰۰ ردیف در ۵ دسته) را تحت مجوز CC BY 4.0 منتشر کرده است که شامل طبقه‌بندی نتایج، انواع دیوارها و سیگنال‌های x402 است و از طریق یک دیمون navette قابل بازتولید است.

گام بعدی شما

  • اگر در حال توسعه عامل‌های وب‌گردان هستید، بررسی کنید که آیا مدل شما با خطاهای 403 و گیت‌های JS به‌صورت ساکت مواجه می‌شود یا خیر.
  • برای دسترسی به داده‌های باکیفیت، به‌جای تکیه بر خزش ساده، به دنبال APIهای رسمی یا پروتکل‌های مذاکره ماشینی مانند llms.txt باشید.
  • وضعیت اعتبار IPهای خروجی خود را رصد کنید تا از مسدود شدن توسط سیستم‌های DataDome یا PerimeterX جلوگیری کنید.

اما داستان سخت‌افزاری این تحول و نحوه پردازش این حجم از داده‌ها حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این یافته‌ها بر اساس اعتبار داده‌های تجربی نشان می‌دهد که اتکای عامل‌های AI به وب باز، یک ریسک استراتژیک است. شرکت‌هایی که مدل‌های خود را بر پایه خزش رایگان بنا کرده‌اند، به‌زودی با دیوارهای پرداخت و مسدودسازی‌های فنی مواجه خواهند شد.

تأثیر برای ایران

به‌دلیل تحریم‌ها و مسدود بودن بسیاری از IPهای ایرانی، توسعه‌دهندگان داخلی پیش از این با دیوارهای فنی مواجه بوده‌اند؛ اما این روند جهانی، دسترسی حتی از طریق پروکسی‌ها را به دلیل سخت‌گیرانه‌تر شدن سیستم‌های تشخیص Bot دشوارتر می‌کند.

·نگاه ما
تحریریه دات‌هوش

بسته‌شدن وب برای عامل‌ها نشان‌دهنده پایان عصر «داده‌های رایگان» است. ما با گذاری از وبِ انسان‌محور به وبِ ماشین‌محور مواجهیم که در آن دسترسی به اطلاعات دیگر یک حق عمومی نیست، بلکه یک کالا (Commodity) است. این وضعیت باعث می‌شود عامل‌های هوش مصنوعی از حالت ابزارهای عمومی به ابزارهای «دارای امتیاز» تبدیل شوند که تنها کسانی که هزینه زیرساخت‌های دور زدن یا پرداخت به ناشران را می‌دهند، به داده‌های واقعی دسترسی خواهند داشت.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.