پرش به محتوای اصلی
پرش به محتوای مقاله

۵ گام برای احراز دسترسی خزنده‌های هوش مصنوعی به وب‌سایت‌ها

·۱۱ مهر ۱۴۰۵۸ دقیقه مطالعه
راهنما
بررسی من: آیا خزنده‌های هوش مصنوعی می‌توانند سایت شما را بخوانند؟
بررسی من: آیا خزنده‌های هوش مصنوعی می‌توانند سایت شما را بخوانند؟
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی متدولوژی ۵ مرحله‌ای برای احراز دسترسی خزنده‌ها و افشای تفاوت عملیاتی بین خزنده‌های فعال و توکن‌های پیکربندی (مانند Google-Extended) که اغلب توسط توسعه‌دهندگان اشتباه گرفته می‌شوند.

یک خط کد اشتباه در فایل robots.txt می‌تواند کل وب‌سایت شما را برای ربات‌های ChatGPT، Claude و Perplexity نامرئی کند. اگر یک موتور پاسخ‌دهنده نتواند صفحه شما را بخواند، هرگز از شما نقل‌قول نمی‌کند و عملاً حضور شما را از وبِ مبتنی بر هوش مصنوعی پاک می‌کند.

این ریسک پس از ژوئیه ۲۰۲۵ شدت گرفت؛ زمانی که Cloudflare مسدود کردن خزنده‌های هوش مصنوعی را برای تمام دامنه‌های جدید به‌صورت پیش‌فرض فعال کرد. برای مالکان سایت، چالش دیگر فقط سئو (SEO) برای موتورهای جست‌وجوی سنتی نیست، بلکه «آمادگی برای AI» است؛ یعنی اطمینان از اینکه عامل‌های (Agents) ارائه‌دهندگان مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — توسط دیواره‌های آتش یا دستورات اشتباه پس زده نمی‌شوند. این موضوع یادآور تجربه تلخ برخی کسب‌وکارهاست که به دلیل خطاهای کوچک در ساختار کد به‌طور کامل از دید مدل‌های هوش مصنوعی خارج شدند.

بررسی من: آیا خزنده‌های هوش مصنوعی سایت من را می‌خوانند؟

فرآیند بازرسی فنی

برای پاسخ به این سؤال حیاتی که آیا ربات‌های AI اصلاً اجازه ورود دارند یا خیر، بازرسی دقیقی روی دامنه yappatyih.com انجام شد. این فرآیند با کمک دو نشست Claude مدیریت شد: یک «مغز» برای برنامه‌ریزی بازرسی و یک «دست» برای اجرای اصلاحات. نقش مغز صرفاً خواندن بود: مشاهده سایت از بیرون، بدون تغییر در هر چیزی و ثبت واقعیت‌ها.

طبق گزارش‌های این پروژه، نخستین تست‌ها در ۳۰ سپتامبر ۲۰۲۶ اجرا شدند. در بررسی اول، هشت نام خزنده تست شدند و همگی کد وضعیت ۲۰۰ (موفقیت‌آمیز) را برگرداندند. با این حال، این مرحله چندین خطای پیکربندی در robots.txt و داده‌های ساختاریافته را افشا کرد که نیاز به اصلاح فوری داشت. «دست» این موارد را در همان روز رفع کرد و در نهایت ۱۰۲ تست موفقیت‌آمیز ثبت شد، که شامل پین‌های خاص برای شناسه‌ها (IDs) و تاریخ‌های نقشه سایت بود.

همان‌طور که در بحث‌های گذشته ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، دسترسی به داده‌ها همواره با لایه‌های امنیتی در تضاد است. در اینجا، هدف ایجاد تعادل بین امنیت و قابلیت کشف توسط AI است.

سازوکار بررسی دسترسی

برای تأیید دسترسی، می‌توانید با ارسال درخواستی با یک رشته «User-Agent» خاص، خودتان را جای یک خزنده جا بزنید. هر خزنده هنگام ورود، نام خود را اعلام می‌کند. با ابزاری مثل curl، می‌توانید صفحه‌ای را درخواست کنید و کد وضعیت HTTP و حجم دانلود را بخوانید.

دستور دقیق برای این بررسی چنین است:
curl -s -o /dev/null -w "%{http_code} %{size_download}\n" \ -A "Mozilla/5.0 (compatible; GPTBot/1.1)" \ https://yappatyih.com/writing/the-mamak-table-question/

پاسخ '200 OK' همراه با حجم کامل صفحه یعنی ربات اجازه ورود دارد. اما پاسخ '403 Forbidden' یا دریافت یک صفحه چالش (Challenge Page)، یا حتی دریافت حجمی به‌مراتب کمتر از اندازه واقعی صفحه، نشان می‌دهد چیزی در مسیر سایت شما، ربات را دفع می‌کند.

در ۲ اکتبر ۲۰۲۶، تست تکمیلی روی yappatyih.com با ۱۰ نام مختلف انجام شد. تمام آن‌ها کد ۲۰۰ و دقیقاً ۵۴,۵۷۰ بایت را برگرداندند؛ یعنی همان حجمی که یک مرورگر استاندارد دریافت می‌کند. ربات‌های تست‌شده شامل موارد زیر بودند:

  • GPTBot: توسط OpenAI برای جمع‌آوری صفحات جهت آموزش مدل‌ها استفاده می‌شود.
  • OAI-SearchBot: توسط OpenAI برای ساخت ایندکس جست‌وجوی ChatGPT استفاده می‌شود.
  • ChatGPT-User: توسط OpenAI برای فراخوانی یک صفحه در لحظه‌ای که کاربر درخواستی می‌دهد استفاده می‌شود.
  • ClaudeBot: توسط Anthropic برای جمع‌آوری صفحات جهت آموزش استفاده می‌شود.
  • Claude-User: توسط Anthropic برای فراخوانی صفحه در لحظه درخواست کاربر استفاده می‌شود.
  • PerplexityBot: توسط Perplexity برای ساخت ایندکس خود استفاده می‌شود.
  • CCBot: مربوط به Common Crawl برای آرشیو باز وب، که بسیاری از مدل‌ها از آن استفاده می‌کنند.
  • Bytespider: توسط ByteDance برای جمع‌آوری صفحات برای مدل‌هایش استفاده می‌شود.
  • Google-Extended و Applebot-Extended (در ادامه بررسی شد).

تفاوت خزنده‌ها و توکن‌های پیکربندی

یک یافته کلیدی، تفاوت بین خزنده‌های فعال و توکن‌های پیکربندی است. بسیاری از توسعه‌دهندگان به‌اشتباه سعی می‌کنند توکن‌هایی مثل Google-Extended و Applebot-Extended را «پینگ» کنند.

این‌ها خزنده‌ای نیستند که از سایت بازدید کنند؛ بلکه کلماتی هستند که شما در robots.txt می‌نویسید تا به گوگل و اپل بگویید آیا صفحاتی که قبلاً توسط خزنده‌های عادی‌شان خوانده شده، می‌تواند برای آموزش AI استفاده شود یا خیر. هیچ رباتی با نام 'Google-Extended' به سایت شما نمی‌آید. بنابراین، تست این نام با curl بی‌معنی است. در بازرسی ۳۰ سپتامبر، این‌ها به عنوان خزنده‌هایی که «۲۰۰ می‌گیرند» ثبت شدند، اما این نتیجه صادق اما بی‌ارزش بود. برای این دو مورد، تنها راه بررسی معتبر، خواندن مستقیم فایل robots.txt است.

نقش لاگ‌های سرور

تست‌های curl نشان می‌دهند که یک «نام» مسدود نیست، اما ثابت نمی‌کند که یک ربات واقعی می‌تواند وارد شود. اولاً، درخواست curl یک تظاهر است؛ از آدرس کاربر ارسال می‌شود اما نام ربات را قرض می‌گیرد. این فقط ثابت می‌کند که مسدودسازی بر اساس نام وجود ندارد، اما نشان نمی‌دهد اگر دیواره آتش (Firewall) بر اساس آدرس IP یا رفتار تصمیم بگیرد، چه اتفاقی می‌افتد.

بر اساس مستندات سرور، تنها دلیل قطعی، لاگ‌های سرور است. Cloudflare لاگ ویژه‌ای برای خزنده‌های AI دارد. از ۲۸ سپتامبر تا صبح ۲ اکتبر ۲۰۲۶، لاگ‌های yappatyih.com نشان‌دهنده ۹۵۹ درخواست از ۱۷ خزنده بود. توزیع فعال‌ترین ربات‌ها چنین بود:

  • GPTBot (OpenAI): ۲۱۷ درخواست
  • ClaudeBot (Anthropic): ۱۵۸ درخواست
  • OAI-SearchBot (OpenAI): ۳۱ درخواست
  • ChatGPT-User (OpenAI): ۲۷ درخواست
  • CCBot (Common Crawl): ۲۴ درخواست
  • PerplexityBot (Perplexity): ۱۴ درخواست
  • Bytespider (ByteDance): ۴ درخواست
  • Claude-User (Anthropic): ۳ درخواست

این داده‌ها تأیید کرد که خزنده‌های واقعی همان کد ۲۰۰ را دریافت کردند. نکته جالب اینکه Google-Extended و Applebot-Extended طبق انتظار در لاگ‌ها نبودند. همچنین یک تلاش امنیتی شناسایی شد: چیزی با نام خزنده AI سعی کرد فایل‌های .env.production و credentials.json را بخواند که هر دو خطای ۴۰۴ دادند؛ این ثابت می‌کند نام خزنده فقط یک برچسب است و لزوماً به معنای مشروعیت نیست.

شکست‌های رایج در پیکربندی

علاوه بر مسدودسازی‌ها، بازرسی چندین «دروغ کوچک» را پیدا کرد که ماشین‌ها را گیج می‌کند:

  • مسدودسازی تصاویر: در robots.txt خط User-agent: * Allow: / Disallow: /og/ وجود داشت. هدف پنهان کردن تصاویر سیستمی بود، اما پوشه /og/ شامل تصاویر en.png و zh.png بود که تصاویر پیش‌نمایش برای صفحاتی بودند که کاور نداشتند. ربات‌های فراخوان پیش‌نمایش که از قوانین robots.txt پیروی می‌کردند، دستور می‌گرفتند که این تصاویر را بر ندارند. حذف این یک خط مشکل را حل کرد و اکنون /og/en.png با کد ۲۰۰ و نوع image/png پاسخ می‌دهد.
  • نقشه‌های سایت (Sitemaps) مرده: آدرس /sitemap.xml خطای ۴۰۴ می‌داد، در حالی که Bing هنوز آن را در پرونده‌هایش داشت. این آدرس اکنون به ایندکس واقعی تغییر مسیر داده است.
  • تضاد در هویت: در داده‌های ساختاریافته، پروفایل "BlackRevo" با یک ID شناسایی شده بود، اما صفحه شخصی او ID دیگری داشت. برای یک ماشین، این یعنی دو شرکت متفاوت. این مورد به یک ID واحد که در همه جا استفاده شود اصلاح شد.
  • پارادوکس‌های زمانی: تاریخ lastmod در نقشه سایت بر اساس UTC بود. اگر پستی قبل از زمان انتشار رسمی ذخیره می‌شد، ادعا می‌کرد قبل از اینکه وجود داشته باشد، ویرایش شده است. اکنون سیستم تا زمان اولین ویرایش واقعی، تاریخ انتشار را می‌خواند.

تغییر استراتژی در FAQها

یک چرخش راهبردی در ساختار محتوا برای AI رخ داده است. هر پست در سایت با یک FAQ که با داده‌های FAQPage علامت‌گذاری شده به پایان می‌رسد. قبلاً این کار برای به‌دست آوردن نتایج بازشونده در گوگل بود. اما گوگل در اوت ۲۰۲۳ نتایج غنی FAQ را محدود کرد و طبق مستندات، از ۷ مه ۲۰۲۶ دیگر اصلاً نمایش داده نمی‌شوند.

به جای تعقیب «نتایج غنی»، بهترین روش فعلی این است که FAQها را به صورت تیترهای واقعی با پاسخ‌های مستقل و لینک‌های اختصاصی بنویسید. این کار دو هدف دارد: کمک به کاربرانی که متن را سریع مرور می‌کنند و ارائه داده‌های «تکه‌تکه شده» (Chunked) برای موتورهای پاسخ‌دهنده که صفحات را در قطعات کوچک می‌خوانند و نیاز دارند هر قطعه به تنهایی معنا داشته باشد.

روش تأیید ۵ مرحله‌ای

برای اطمینان از اینکه یک سایت آماده‌ی AI است، روش زیر توصیه می‌شود. این کار ۱۰ دقیقه زمان می‌برد و به هیچ ابزار پولی نیاز ندارد:

۱. بازرسی robots.txt: آن را در مرورگر باز کنید و مثل یک غریبه بخوانید. برای هر خط Disallow بررسی کنید دقیقاً چه چیزی آنجا قرار دارد. اگر نمی‌دانید، قبل از اینکه یک خزنده بفهمد، شما متوجه شوید.
۲. تست با نام‌ها: دستور curl را برای هر خزنده واقعی که می‌خواهید اجازه ورود داشته باشد، روی حداقل یک صفحه اجرا کنید. مطمئن شوید کد وضعیت و حجم فایل با آنچه مرورگر دریافت می‌کند مطابقت دارد.
۳. تأیید اشاره‌گرها: هر چیزی که صفحات شما به آن اشاره می‌کنند، از جمله og:image، نقشه سایت، آدرس کانونی (Canonical) و فید را فراخوانی کنید. کد وضعیت و نوع محتوا (Content Type) را چک کنید.
۴. یکپارچه‌سازی IDها: در داده‌های ساختاریافته، مطمئن شوید هر شخص یا شرکت دقیقاً یک ID ثابت دارد که در تمام صفحات و تمام سایت‌هایی که کنترل می‌کنید یکسان باشد.
۵. همگام‌سازی تاریخ‌ها: مطمئن شوید تاریخ‌های انتشار، ویرایش و نقشه سایت با یکدیگر و با خط زمانی واقعی اتفاقات همخوانی دارند.

این فرآیند تضمین نمی‌کند که AI از شما نقل‌قول کند، اما موانع فنی را حذف می‌کند. تعیین‌کننده نهایی، کیفیت محتواست: صفحه‌ای که یک چیز درست و مشخص را با صراحت بیان کند.

برای کسانی که از Cloudflare استفاده می‌کنند، بخش 'AI Crawl Control' در داشبورد، مکان اصلی برای مدیریت این مجوزها و تأیید فعال بودن یا نبودن مسدودسازی‌های پیش‌فرض است. همین امروز لاگ‌های سرور خود را چک کنید تا ببینید کدام ربات‌های AI واقعاً در حال ضربه زدن به در خانه شما هستند و آیا به‌طور تصادفی به آن‌ها می‌گویید که بروند یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این بازرسی بر اساس تجربه عملی نشان می‌دهد که دسترسی فنی، پیش‌شرط دیده شدن در عصر موتورهای پاسخ‌دهنده است. اعتبار یک وب‌سایت در سال ۲۰۲۶ با توانایی‌اش در ارائه داده‌های ساختاریافته و بدون تضاد به خزنده‌های AI سنجیده می‌شود.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که از Cloudflare استفاده می‌کنند، بررسی بخش 'AI Crawl Control' حیاتی است تا مسدودسازی‌های پیش‌فرض مانع از ایندکس شدن محتوای فارسی در مدل‌های جهانی نشود.

·نگاه ما
تحریریه دات‌هوش

تمرکز بر «آمادگی برای AI» نشان می‌دهد که سئو در حال تبدیل شدن به یک پروتکل ارتباطی بین ماشین‌هاست، نه فقط جذب ترافیک انسانی. حذف تضادهای کوچک در داده‌های ساختاریافته (مانند IDهای متناقض) اکنون اهمیت بیشتری نسبت به کلمات کلیدی دارد، زیرا مدل‌های استدلالی بر اساس انسجام داده‌ای تصمیم می‌گیرند، نه تکرار واژگان.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.