تصور کنید بتوانید تنها با یک اجرا، ۱۰۰ وبسایت را ممیزی کنید تا دقیقاً بفهمید کدام عاملهای هوش مصنوعی مسدود شدهاند و کدامها اجازه ورود دارند. طبق گزارشی که در ۲۶ سپتامبر ۲۰۲۶ در dev.to منتشر شد، ابزار AI Crawler Access Checker مدیریت دسترسی رباتها به دادههای شما را از یک بازی حدسی به یک فرآیند دقیق تبدیل میکند.
پیچیدگی دسترسیهای هوش مصنوعی
بسیاری از مالکان سایت با پیچیدگیهای دستورات robots.txt دستوپنجه نرم میکنند؛ جایی که گروههای خاص از عامل (Agent) — شبیه به نگهبانهایی که دستورات متفاوتی برای ورود به بخشهای مختلف ساختمان دارند — اغلب قوانین کلی (Wildcard) را لغو میکنند و در موارد تساوی در سطح جزئیات، قوانین «اجازه» (Allow) برنده میشوند. این سردرگمی زمانی بیشتر میشود که بخواهید مدیریت مجموعهای بزرگ از سایتها را بر عهده داشته باشید یا بررسی کنید آیا یک استقرار (Deployment) جدید، بهطور اتفاقی درهای سایت شما را به روی رباتهای آموزشی باز کرده است یا خیر.
علاوه بر این، یک قانون در WAF (دیوار آتش وب) یا CDN میتواند آنچه را که یک فایل ارائه میدهد تغییر دهد، بدون اینکه کسی به کد صفحه دست زده باشد. این موضوع یادآور چالشاتی است که شبکههای توزیع محتوا گاهی بهطور پیشفرض دسترسی عاملهای هوش مصنوعی را مسدود میکنند و باعث تداخل با تنظیمات robots.txt میشوند. خواندن این فایلها بهصورت دستی کند است و احتمال اشتباه در تفسیر دستورات بسیار زیاد است. همانطور که در تحلیل قبلی ما دربارهی AIMarket Hub و نحوه فعالسازی کشف API برای عاملها اشاره کردیم، این ابزار روی نقطه مقابل تمرکز دارد: کنترل دقیق اینکه چه کسی اجازه ورود دارد.

مکانیسم فنی
بر اساس مستندات فنی، این ممیز با درخواست سه مسیر سیاستگذاری خاص یعنی robots.txt، llms.txt و llms-full.txt عمل میکند. این ابزار قوانین را بر اساس فهرستی از ۱۶ خزنده هوش مصنوعی بررسی میکند که بر اساس هدف آنها به سه دسته آموزش، جستوجو و واکشی کاربر (User-fetch) تقسیم شدهاند. این لیست شامل موارد زیر است:
- OpenAI: شامل GPTBot، OAI-SearchBot و ChatGPT-User
- Anthropic: شامل ClaudeBot، Claude-SearchBot و Claude-User
- Perplexity: شامل PerplexityBot و Perplexity-User
- سایرین: Google-Extended، Applebot-Extended، Amazonbot، CCBot، Bytespider، meta-externalagent، DuckAssistBot و MistralAI-User
جزئیات ویژگیهای ممیزی
به نقل از توسعهدهندگان، ویژگیهای کلیدی و فنی این ابزار عبارتند از:
- امتیازدهی دوگانه: تولید «امتیاز دسترسی AI» برای تمام ۱۶ ربات و یک «امتیاز جستوجوی AI» مجزا برای زیرمجموعه جستوجو/واکشی کاربر، که اجازه میدهد سیاستهای آموزش و کشف محتوا بهطور مستقل بررسی شوند.
- دقت در حکم: هر ربات به یکی از چهار حالت «مجاز»، «جزئی»، «مسدود» یا «نامشخص» برچسب میخورد. ابزار همچنین الگوهای مسیرهای محدود شده را شناسایی کرده و مشخص میکند که آیا یک گروه نامگذاری شده خاص یا گروه کلی (Wildcard) با قانون مطابقت داشته است.
- شفافیت در خطاها (Honest Unknowns): اگر یک نقطه انتهایی (Endpoint) دچار Timeout شود یا خطاهای ۴۰۳، ۴۲۹ یا ۵xx برگرداند، حکم «نامشخص» صادر شده و امتیازها تهی (Null) میمانند. قطعیهای موقت هرگز بهعنوان اجازه دسترسی امتیازدهی نمیشوند.
- حفاظها (Safety Guardrails): سیستم آدرسهای خصوصی را رد میکند، DNS را پین میکند، از تغییر مسیرهای (Redirects) محدود و بازبینیشده استفاده میکند و حجم انتقال بایتها را محدود میکند. این ابزار هرگز کدهای جاوااسکریپت را اجرا نمیکند و محتوای صفحات را نمیخزد. در همین راستا، تلاشهایی مانند پروتکل AIFeed برای رمزنگاری دسترسیها و استفاده از DNS Anchoring صورت گرفته تا امنیت مجوزهای خزنده افزایش یابد.
- منطق مقایسهای: کاربران میتوانند مجموعه دادههای صادر شده از یک اجرای قبلی را در ورودی
previousResultsقرار دهند تا یک بلوک مقایسهای شامل فیلدهای تغییر یافته و مقادیر قبل و بعد را مشاهده کنند.
این ابزار روی پلتفرم Apify میزبانی میشود و از مدل پرداخت به ازای هر رویداد استفاده میکند. ممیزی موفقیتآمیز هر وبسایت منحصربهفرد ۰.۰۲ دلار هزینه دارد و شروع هر اجرا ۰.۰۰۵ دلار است. موارد تکراری نرمالسازی شده و دوبار محاسبه نمیشوند و شکستهای مربوط به منبع اصلی رایگان هستند. برای کاربران طرح رایگان Apify، اعتبار ۵ دلاری ماهانه برای ممیزی حدود ۲۴۹ سایت کافی است (۰.۰۰۵ + ۰.۰۲ × ۲۴۹ = ۴.۹۸۵ دلار).
زمینه و تحلیل
این حرکت به سمت فایلهای ساختاریافته llms.txt، نشاندهنده گذار از دوران «غرب وحشی» در استخراج دادههای وب است. با جداسازی سیاست آموزش از سیاست کشف، توسعهدهندگان میتوانند اجازه دهند موتورهای جستوجوی هوش مصنوعی ترافیک را به سایت آنها بکشانند، اما همزمان جلوی شرکتهای مدل زبانی بزرگ (LLM) را برای استفاده از محتوا جهت آموزش مدلها بگیرند.
برای یک مالک سایت معمولی، این یعنی دیگر نیازی به خرید اشتراکهای گرانقیمت SaaS برای حفاظت از مالکیت معنوی نیست. شما میتوانید در چند ثانیه بفهمید آیا تنظیمات CDN یا WAF شما، مجوزهای تعریفشده را لغو کرده است یا خیر.
اگر در حال ساخت عاملهای هوش مصنوعی هستید، خروجی JSON و پشتیبانی از پروتکل زمینه مدل (MCP) به عاملها اجازه میدهد سیاستهای سایت را بهطور خودکار تحلیل و اولویتبندی کنند. با این حال، باید مراقب بود که دسترسیهای بیش از حد API در عاملها به حفرههای امنیتی تبدیل نشود و اصل حداقل دسترسی رعایت گردد. طبق README ابزار، حفاظهای صریحی برای عاملها تعریف شده است: آنها باید حتماً به evidence[].sourceUrl استناد کنند، هرگز درباره مقادیر تهی یا نامشخص حدس نزنند، dataGaps را حفظ کنند و پیش از تغییر هر سیاست زنده، تأیید انسانی بگیرند.
گام بعدی شما
- لیست دامنههای خود را در ممیز وارد کنید و مجموعه دادههای حاصل را بهعنوان یک صف اولویت برای اصلاحات سایت بررسی کنید.
- فایل llms.txt را به وبسایت خود اضافه کنید تا تفکیک بین «جستوجو» و «آموزش» را فعال کنید.
- خروجی JSON را برای اتوماسیون نظارت بر دسترسی رباتها در زیرساخت خود به کار بگیرید.
اما مدیریت دسترسی تنها بخشی از نبرد دادههاست؛ برای درک اینکه مدلها چگونه بدون دسترسی مستقیم به دادههای شما یاد میگیرند، تحلیل ما دربارهی یادگیری مصنوعی (Synthetic Data) را بخوانید.




گفتگو