یک خط کد اشتباه در فایل robots.txt میتواند کل وبسایت شما را برای رباتهای ChatGPT، Claude و Perplexity نامرئی کند. اگر یک موتور پاسخدهنده نتواند صفحه شما را بخواند، هرگز از شما نقلقول نمیکند و عملاً حضور شما را از وبِ مبتنی بر هوش مصنوعی پاک میکند.
این ریسک پس از ژوئیه ۲۰۲۵ شدت گرفت؛ زمانی که Cloudflare مسدود کردن خزندههای هوش مصنوعی را برای تمام دامنههای جدید بهصورت پیشفرض فعال کرد. برای مالکان سایت، چالش دیگر فقط سئو (SEO) برای موتورهای جستوجوی سنتی نیست، بلکه «آمادگی برای AI» است؛ یعنی اطمینان از اینکه عاملهای (Agents) ارائهدهندگان مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن کتابها جواب میدهد — توسط دیوارههای آتش یا دستورات اشتباه پس زده نمیشوند. این موضوع یادآور تجربه تلخ برخی کسبوکارهاست که به دلیل خطاهای کوچک در ساختار کد بهطور کامل از دید مدلهای هوش مصنوعی خارج شدند.

فرآیند بازرسی فنی
برای پاسخ به این سؤال حیاتی که آیا رباتهای AI اصلاً اجازه ورود دارند یا خیر، بازرسی دقیقی روی دامنه yappatyih.com انجام شد. این فرآیند با کمک دو نشست Claude مدیریت شد: یک «مغز» برای برنامهریزی بازرسی و یک «دست» برای اجرای اصلاحات. نقش مغز صرفاً خواندن بود: مشاهده سایت از بیرون، بدون تغییر در هر چیزی و ثبت واقعیتها.
طبق گزارشهای این پروژه، نخستین تستها در ۳۰ سپتامبر ۲۰۲۶ اجرا شدند. در بررسی اول، هشت نام خزنده تست شدند و همگی کد وضعیت ۲۰۰ (موفقیتآمیز) را برگرداندند. با این حال، این مرحله چندین خطای پیکربندی در robots.txt و دادههای ساختاریافته را افشا کرد که نیاز به اصلاح فوری داشت. «دست» این موارد را در همان روز رفع کرد و در نهایت ۱۰۲ تست موفقیتآمیز ثبت شد، که شامل پینهای خاص برای شناسهها (IDs) و تاریخهای نقشه سایت بود.
همانطور که در بحثهای گذشته ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، دسترسی به دادهها همواره با لایههای امنیتی در تضاد است. در اینجا، هدف ایجاد تعادل بین امنیت و قابلیت کشف توسط AI است.
سازوکار بررسی دسترسی
برای تأیید دسترسی، میتوانید با ارسال درخواستی با یک رشته «User-Agent» خاص، خودتان را جای یک خزنده جا بزنید. هر خزنده هنگام ورود، نام خود را اعلام میکند. با ابزاری مثل curl، میتوانید صفحهای را درخواست کنید و کد وضعیت HTTP و حجم دانلود را بخوانید.
دستور دقیق برای این بررسی چنین است:curl -s -o /dev/null -w "%{http_code} %{size_download}\n" \ -A "Mozilla/5.0 (compatible; GPTBot/1.1)" \ https://yappatyih.com/writing/the-mamak-table-question/
پاسخ '200 OK' همراه با حجم کامل صفحه یعنی ربات اجازه ورود دارد. اما پاسخ '403 Forbidden' یا دریافت یک صفحه چالش (Challenge Page)، یا حتی دریافت حجمی بهمراتب کمتر از اندازه واقعی صفحه، نشان میدهد چیزی در مسیر سایت شما، ربات را دفع میکند.
در ۲ اکتبر ۲۰۲۶، تست تکمیلی روی yappatyih.com با ۱۰ نام مختلف انجام شد. تمام آنها کد ۲۰۰ و دقیقاً ۵۴,۵۷۰ بایت را برگرداندند؛ یعنی همان حجمی که یک مرورگر استاندارد دریافت میکند. رباتهای تستشده شامل موارد زیر بودند:
- GPTBot: توسط OpenAI برای جمعآوری صفحات جهت آموزش مدلها استفاده میشود.
- OAI-SearchBot: توسط OpenAI برای ساخت ایندکس جستوجوی ChatGPT استفاده میشود.
- ChatGPT-User: توسط OpenAI برای فراخوانی یک صفحه در لحظهای که کاربر درخواستی میدهد استفاده میشود.
- ClaudeBot: توسط Anthropic برای جمعآوری صفحات جهت آموزش استفاده میشود.
- Claude-User: توسط Anthropic برای فراخوانی صفحه در لحظه درخواست کاربر استفاده میشود.
- PerplexityBot: توسط Perplexity برای ساخت ایندکس خود استفاده میشود.
- CCBot: مربوط به Common Crawl برای آرشیو باز وب، که بسیاری از مدلها از آن استفاده میکنند.
- Bytespider: توسط ByteDance برای جمعآوری صفحات برای مدلهایش استفاده میشود.
- Google-Extended و Applebot-Extended (در ادامه بررسی شد).
تفاوت خزندهها و توکنهای پیکربندی
یک یافته کلیدی، تفاوت بین خزندههای فعال و توکنهای پیکربندی است. بسیاری از توسعهدهندگان بهاشتباه سعی میکنند توکنهایی مثل Google-Extended و Applebot-Extended را «پینگ» کنند.
اینها خزندهای نیستند که از سایت بازدید کنند؛ بلکه کلماتی هستند که شما در robots.txt مینویسید تا به گوگل و اپل بگویید آیا صفحاتی که قبلاً توسط خزندههای عادیشان خوانده شده، میتواند برای آموزش AI استفاده شود یا خیر. هیچ رباتی با نام 'Google-Extended' به سایت شما نمیآید. بنابراین، تست این نام با curl بیمعنی است. در بازرسی ۳۰ سپتامبر، اینها به عنوان خزندههایی که «۲۰۰ میگیرند» ثبت شدند، اما این نتیجه صادق اما بیارزش بود. برای این دو مورد، تنها راه بررسی معتبر، خواندن مستقیم فایل robots.txt است.
نقش لاگهای سرور
تستهای curl نشان میدهند که یک «نام» مسدود نیست، اما ثابت نمیکند که یک ربات واقعی میتواند وارد شود. اولاً، درخواست curl یک تظاهر است؛ از آدرس کاربر ارسال میشود اما نام ربات را قرض میگیرد. این فقط ثابت میکند که مسدودسازی بر اساس نام وجود ندارد، اما نشان نمیدهد اگر دیواره آتش (Firewall) بر اساس آدرس IP یا رفتار تصمیم بگیرد، چه اتفاقی میافتد.
بر اساس مستندات سرور، تنها دلیل قطعی، لاگهای سرور است. Cloudflare لاگ ویژهای برای خزندههای AI دارد. از ۲۸ سپتامبر تا صبح ۲ اکتبر ۲۰۲۶، لاگهای yappatyih.com نشاندهنده ۹۵۹ درخواست از ۱۷ خزنده بود. توزیع فعالترین رباتها چنین بود:
- GPTBot (OpenAI): ۲۱۷ درخواست
- ClaudeBot (Anthropic): ۱۵۸ درخواست
- OAI-SearchBot (OpenAI): ۳۱ درخواست
- ChatGPT-User (OpenAI): ۲۷ درخواست
- CCBot (Common Crawl): ۲۴ درخواست
- PerplexityBot (Perplexity): ۱۴ درخواست
- Bytespider (ByteDance): ۴ درخواست
- Claude-User (Anthropic): ۳ درخواست
این دادهها تأیید کرد که خزندههای واقعی همان کد ۲۰۰ را دریافت کردند. نکته جالب اینکه Google-Extended و Applebot-Extended طبق انتظار در لاگها نبودند. همچنین یک تلاش امنیتی شناسایی شد: چیزی با نام خزنده AI سعی کرد فایلهای .env.production و credentials.json را بخواند که هر دو خطای ۴۰۴ دادند؛ این ثابت میکند نام خزنده فقط یک برچسب است و لزوماً به معنای مشروعیت نیست.
شکستهای رایج در پیکربندی
علاوه بر مسدودسازیها، بازرسی چندین «دروغ کوچک» را پیدا کرد که ماشینها را گیج میکند:
- مسدودسازی تصاویر: در robots.txt خط
User-agent: * Allow: / Disallow: /og/وجود داشت. هدف پنهان کردن تصاویر سیستمی بود، اما پوشه/og/شامل تصاویرen.pngوzh.pngبود که تصاویر پیشنمایش برای صفحاتی بودند که کاور نداشتند. رباتهای فراخوان پیشنمایش که از قوانین robots.txt پیروی میکردند، دستور میگرفتند که این تصاویر را بر ندارند. حذف این یک خط مشکل را حل کرد و اکنون/og/en.pngبا کد ۲۰۰ و نوعimage/pngپاسخ میدهد. - نقشههای سایت (Sitemaps) مرده: آدرس
/sitemap.xmlخطای ۴۰۴ میداد، در حالی که Bing هنوز آن را در پروندههایش داشت. این آدرس اکنون به ایندکس واقعی تغییر مسیر داده است. - تضاد در هویت: در دادههای ساختاریافته، پروفایل "BlackRevo" با یک ID شناسایی شده بود، اما صفحه شخصی او ID دیگری داشت. برای یک ماشین، این یعنی دو شرکت متفاوت. این مورد به یک ID واحد که در همه جا استفاده شود اصلاح شد.
- پارادوکسهای زمانی: تاریخ
lastmodدر نقشه سایت بر اساس UTC بود. اگر پستی قبل از زمان انتشار رسمی ذخیره میشد، ادعا میکرد قبل از اینکه وجود داشته باشد، ویرایش شده است. اکنون سیستم تا زمان اولین ویرایش واقعی، تاریخ انتشار را میخواند.
تغییر استراتژی در FAQها
یک چرخش راهبردی در ساختار محتوا برای AI رخ داده است. هر پست در سایت با یک FAQ که با دادههای FAQPage علامتگذاری شده به پایان میرسد. قبلاً این کار برای بهدست آوردن نتایج بازشونده در گوگل بود. اما گوگل در اوت ۲۰۲۳ نتایج غنی FAQ را محدود کرد و طبق مستندات، از ۷ مه ۲۰۲۶ دیگر اصلاً نمایش داده نمیشوند.
به جای تعقیب «نتایج غنی»، بهترین روش فعلی این است که FAQها را به صورت تیترهای واقعی با پاسخهای مستقل و لینکهای اختصاصی بنویسید. این کار دو هدف دارد: کمک به کاربرانی که متن را سریع مرور میکنند و ارائه دادههای «تکهتکه شده» (Chunked) برای موتورهای پاسخدهنده که صفحات را در قطعات کوچک میخوانند و نیاز دارند هر قطعه به تنهایی معنا داشته باشد.
روش تأیید ۵ مرحلهای
برای اطمینان از اینکه یک سایت آمادهی AI است، روش زیر توصیه میشود. این کار ۱۰ دقیقه زمان میبرد و به هیچ ابزار پولی نیاز ندارد:
۱. بازرسی robots.txt: آن را در مرورگر باز کنید و مثل یک غریبه بخوانید. برای هر خط Disallow بررسی کنید دقیقاً چه چیزی آنجا قرار دارد. اگر نمیدانید، قبل از اینکه یک خزنده بفهمد، شما متوجه شوید.
۲. تست با نامها: دستور curl را برای هر خزنده واقعی که میخواهید اجازه ورود داشته باشد، روی حداقل یک صفحه اجرا کنید. مطمئن شوید کد وضعیت و حجم فایل با آنچه مرورگر دریافت میکند مطابقت دارد.
۳. تأیید اشارهگرها: هر چیزی که صفحات شما به آن اشاره میکنند، از جمله og:image، نقشه سایت، آدرس کانونی (Canonical) و فید را فراخوانی کنید. کد وضعیت و نوع محتوا (Content Type) را چک کنید.
۴. یکپارچهسازی IDها: در دادههای ساختاریافته، مطمئن شوید هر شخص یا شرکت دقیقاً یک ID ثابت دارد که در تمام صفحات و تمام سایتهایی که کنترل میکنید یکسان باشد.
۵. همگامسازی تاریخها: مطمئن شوید تاریخهای انتشار، ویرایش و نقشه سایت با یکدیگر و با خط زمانی واقعی اتفاقات همخوانی دارند.
این فرآیند تضمین نمیکند که AI از شما نقلقول کند، اما موانع فنی را حذف میکند. تعیینکننده نهایی، کیفیت محتواست: صفحهای که یک چیز درست و مشخص را با صراحت بیان کند.
برای کسانی که از Cloudflare استفاده میکنند، بخش 'AI Crawl Control' در داشبورد، مکان اصلی برای مدیریت این مجوزها و تأیید فعال بودن یا نبودن مسدودسازیهای پیشفرض است. همین امروز لاگهای سرور خود را چک کنید تا ببینید کدام رباتهای AI واقعاً در حال ضربه زدن به در خانه شما هستند و آیا بهطور تصادفی به آنها میگویید که بروند یا خیر.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو