اگر فکر میکنید برای دیده شدن در عصر هوش مصنوعی باید لایههای پیچیده و جدیدی به سایت خود اضافه کنید، احتمالاً در حال هدر دادن منابع مهندسی هستید. دادهها نشان میدهند که سادهترین فایلهای متنی وب، هنوز هم کلید ورود رباتهای پیشرفته به دنیای شما هستند. یک فایل robots.txt صحیح و یک sitemap.xml معتبر، تنها نقاط ورودی هستند که هر خزنده بزرگ هوش مصنوعی برای کشف محتوای جدید از آنها استفاده میکند.
بر اساس بررسیهای انجامشده روی دامنه geo010.com در یک مطالعه ۱۵ روزه، فایلهای «کسلکننده» زیرساختی مانند robots.txt و sitemap.xml ترافیک واقعی بیشتری از خزندههای هوش مصنوعی جذب کردهاند تا تمام قابلیتهای تخصصی AI در مجموع. این یافتهها نشان میدهد که زیرساختهای پایه، بسیار مؤثرتر از ابزارهای مدرن و پیچیده هستند.
بسیاری از مدیران سایتها اکنون در تلاشاند تا لایههای کشف اختصاصی مانند llms.txt یا /ai/summary.json را پیادهسازی کنند. اما این اقدامات بیشتر شبیه به بهینهسازی برای «ارجاع» (Citation-layer) هستند تا «کشف» (Discovery driver). در دنیایی که عاملهای هوش مصنوعی (AI Agents) — شبیه به دستیاران دیجیتالی که میتوانند بهجای شما در وب بچرخند و کار انجام دهند — مصرفکنندگان اصلی دادههای وب هستند، زیربنای دیده شدن همچنان همان لولهکشیهای سنتی سئو است. این موضوع در حالی است که بسیاری از وبسایتها هنوز بهدلیل فقدان استانداردهای متنی ساده برای AI در معرض خطر نامرئی شدن قرار دارند.
همانطور که در تحلیلهای قبلی ما دربارهی بهینهسازی موتورهای جستوجوی زاینده اشاره کردیم، سادگی در ساختار دادهها اغلب بر پیچیدگی غلبه میکند. برای ردیابی این رفتار، تیم تحقیق یک Cloudflare Worker مستقر کرد که تمام درخواستها به دامنه را در یک پایگاهداده D1 ثبت میکرد. آنها درخواستها را بر اساس نوع خزنده برچسبگذاری کردند و مسیرها را با هم تطبیق دادند تا User Agentهای جعلی و بررسیهای داخلی curl را فیلتر کنند. بازه زمانی این دادهها از ۴ اوت تا ۱۹ اوت ۲۰۲۴ بود.
متدولوژی تخصیص ترافیک
طبق گزارش این تیم، هر درخواست که از طریق Worker عبور میکرد، شامل تاریخ، مسیر، وضعیت (Status Code)، نوع صفحه و نام نرمالشدهی خزنده بود. برای تحلیل اثر ۹ معیار مختلف بهینهسازی موتورهای زاینده (GEO)، تیم سه پرسش کلیدی مطرح کرد: کدام خزندهها به مسیرهای مربوطه رسیدند، هر چند وقت یکبار این اتفاق افتاد و آیا پس از پیادهسازی هر معیار، تعداد بازدیدها تغییر کرد؟
برای حفظ دقت دادهها و اطمینان از یکپارچگی آنها، دو فیلتر سختگیرانه اعمال شد. اول، چون نام خزندهها (User Agents) توسط مهاجمان قابل جعل است، تیم پیش از شمارش بازدیدها، مسیرها و کدهای وضعیت را با هم تطبیق داد. دوم، استقرارهای تأیید داخلی که از طریق دستور curl انجام شده بود، فیلتر شدند تا اعداد بهصورت کاذب بالا نروند و ترافیک واقعی از ترافیک تست تفکیک شود.
سلسلهمراتب اثرگذاری بر خزندهها
بر اساس مستندات این مطالعه، اثرگذاری اقدامات مختلف GEO بهشدت متفاوت است. رتبهبندی زیر بر اساس ترافیک واقعی خزندهها بین ۴ تا ۱۹ اوت است:
- بیشترین اثر: robots.txt و sitemap.xml. اینها تنها مسیرهایی بودند که تمام رباتهای اصلی آنها را بازدید کردند. ClaudeBot هر دو فایل را ۱۰۴ بار خواند. Googlebot ۳۲ بار، OAI-SearchBot ۲۶ بار و Bingbot ۱۷ بار از robots.txt بهعنوان نقطه ورود تقریباً روزانه استفاده کردند. همچنین GPTBot (۹ بار) و Bingbot (۱۱ بار) از sitemap استفاده کردند.
- اثر زیاد: صفحه اصلی. تمام خزندههای اصلی هر روز صفحه اصلی را بازدید کردند؛ از جمله GPTBot (۲۱ بار)، PerplexityBot (۱۲ بار)، OAI-SearchBot (۱۰ بار)، ClaudeBot (۸ بار)، Claude-SearchBot و Applebot.
- اثر زیاد: صفحات محتوای جدید. در اینجا GPTBot پیشتاز بود و ۱۲۱ صفحه محتوا را لمس کرد، در حالی که ClaudeBot تنها ۲ مقاله جامعه (Community articles) را بازدید کرد.
- اثر متوسط: همراستاسازی تازگی (Freshness Alignment). این مورد باعث تکرار بازدیدها میشود. در ۸، ۱۲ و ۱۷ اوت، پس از دورههای بررسی تازگی محتوا، جهشهایی در بازدید خزندهها مشاهده شد.
- اثر کم-متوسط: چیدمان تعریفمحور (Definition-first Layout). این رویکرد که بر تراکم موجودیتها تمرکز دارد، توسط بیش از ۷ خزنده شناسایی شد، اما بیشتر بر کیفیت پاسخ اثر داشت تا تعداد بازدید.
- اثر کم: llms.txt. این فایل تنها ۴ درخواست در مجموع دریافت کرد که ۲ مورد آن مربوط به GPTBot بود. تنها GPTBot، Amazonbot و Googlebot با آن تعامل داشتند.
- اثر صفر: نقاط دسترسی AI و نشانهگذاری FAQPage. مسیرهایی مثل
/ai/،ai.txtو پلاگینها در ۱۵ روز هیچ درخواستی دریافت نکردند. همچنین نشانهگذاریهای FAQPage پس از پیادهسازی، هیچ بازدیدی از خزندههای اصلی AI جذب نکرد.
تفاوت فلسفی GPTBot و ClaudeBot
دادهها تضاد شدیدی را در نحوه عملکرد دو خزنده اثرگذار نشان میدهند. GPTBot مانند یک اسکنر عمیق عمل میکند. این ربات بهندرت robots.txt را میخواند (تنها ۱ درخواست) و llms.txt را گهگاه بررسی میکند، اما هدف اصلیاش پیمایش کامل سایت است. برای مثال در ۱۷ اوت، GPTBot در یک دور بازدید، ۶۰ صفحه مختلف را لمس کرد و هر صفحه را تنها یکبار بازدید نمود.
در مقابل، ClaudeBot یک دنبالکننده منضبط است. این ربات با دقت زیاد و بهصورت مذهبی robots.txt و sitemap.xml را میخواند (۱۰۴ درخواست برای هر کدام). اما بهندرت به محتوای عمیق میرود، مگر اینکه sitemap یا صفحه اصلی صراحتاً او را به آن مسیر هدایت کنند.
نتیجه عملی این است: اگر sitemap یا robots.txt شما خراب باشد، رباتی مثل ClaudeBot را که هر روز آن را میخواند، از دست میدهید. اما اگر محتوای شما سطحی باشد، رباتی مثل GPTBot را که همه چیز را میخواند، هدر دادهاید.
تخریب افسانه «قابلیتهای AI»
این مطالعه یک بررسی صادقانه روی پیشفرضهای قبلی بهینهسازی AI است. تحلیلهای پیشین ادعا میکردند که انتشار مقاله جدید یا افزودن FAQPage باعث جهش فوری خزندهها میشود. اما لاگهای هر درخواست ثابت کرد که این یک برداشت اشتباه و تخصیص نادرست (Misattribution) بوده است.
بسیاری از «جهشهای» روز اول، در واقع بازدیدکنندگان انسانی یا تستهای داخلی بودند. هر خزنده AI معمولاً در هر دور پیمایش، یک صفحه جدید را تنها یکبار بازدید میکند. برای مثال، این ادعا که یک مقاله جدید در روز اول ۶ تا ۱۰ بار خزیده شده، رد شد؛ لاگها نشان دادند هر خزنده AI تنها یکبار بازدید کرده است.
علاوه بر این، جهش ترافیک ۱۱ اوت در واقع یک حمله اسکنر از سوی ChatGPT-User و Amazonbot برای یافتن فایلهای حساس محیطی (.env.production) و مسیر /telescope/requests بود. جهش مشابهی در ۱۳ اوت نیز شناسایی شد که یک حمله با User Agent جعلی GPTBot بود. همچنین لاگها نشان دادند که نشانهگذاری FAQPage باعث افزایش خزش نشد؛ ۶ صفحهای که از آن استفاده میکردند توسط مرورگرها و Bingbot بازدید شدند، اما خزندههای اصلی AI به سراغ آنها نرفتند.
تأیید نهایی در سه روز آخر
دادههای ۱۷ تا ۱۹ اوت این الگوها را تأیید کرد. در ۱۷ اوت، GPTBot ۶۰ صفحه را در یک دور پیمایش دید که ثابت کرد محتوا از طریق sitemap کشف میشود، نه نقاط دسترسی AI؛ چرا که حتی یکبار هم به /ai/summary.json سر نزد.
در همان روز، ClaudeBot ۲۳ درخواست داشت که همگی محدود به robots.txt، sitemap.xml و صفحه اصلی بود. البته نویزهای شبکه همچنان وجود دارد؛ از ۱۰۶۶ درخواست در ۱۷ اوت، تنها ۳۷۱ مورد وضعیت ۲۰۰ (موفق) داشتند و بقیه تلاشهای اسکنر برای یافتن مسیرهای قدیمی PHP و /api/v1/validate/code بودند. در ۱۸ اوت، Bingbot ۵۱ درخواست داشت (بیشترین مقدار در یک روز) و Meta-ExternalAgent برای اولین بار با ۸ درخواست ظاهر شد.
گام بعدی شما (چکلیست پیش از لانچ)
برای هر کسی که امروز یک سایت جدید را راهاندازی میکند، دادهها یک لیست اولویت سختگیرانه را پیشنهاد میدهند. پیش از دست زدن به هرگونه پلاگین تخصصی AI، این سه زیربنا را بسازید:
- بازبینی robots.txt: خزندههای AI مورد نظرتان را مجاز کنید و فقط صفحات خصوصی، محیطهای Staging یا صفحات تحلیل را ببندید. یک قانون اشتباه که همه چیز را مسدود کند، یک «صفر خاموش» ایجاد میکند.
- اعتبارسنجی sitemap.xml: مطمئن شوید تمام URLها کد ۲۰۰ برمیگردانند. sitemap پر از خطای ۴۰۴ به بازدیدکننده روزانه (ClaudeBot) میگوید سایت شما خراب است.
- بهینهسازی صفحه اصلی با HTML ساده (Server-Rendered): خزندههای AI جاوااسکریپت را اجرا نمیکنند. صفحه اصلی باید با متن ساده HTML توضیح دهد سایت چیست و لینکهای مستقیم به بهترین صفحات داشته باشد.
علاوه بر این، پیش از روز لانچ، ۳ تا ۵ مقاله واقعی منتشر کنید. از آنجایی که GPTBot همه چیز را پیمایش میکند، پنج صفحه محکم و باکیفیت بسیار ارزشمندتر از پنجاه صفحه توخالی است.
مواردی که باید نادیده بگیرید
این گزارش توصیه میکند اولویت را روی نقاط دسترسی کشف AI مانند /ai/summary.json، /.well-known/ai.txt، ai-plugin.json یا openapi.json نگذارید. این موارد در ۱۵ روز هیچ درخواستی جذب نکردند. به همین ترتیب، نشانهگذاری FAQPage را تنها پس از آن اضافه کنید که صفحه در حال حاضر ایندکس شده باشد، زیرا این ابزار بیشتر برای «ارجاع» است تا «کشف» و زمانی کمک میکند که AI از قبل صفحه شما را در نظر داشته باشد.
سایر موارد کماولویت شامل ساخت داشبوردهای نظارتی پیچیده (به جای آن با لاگهای سرور شروع کنید) و زیرساختهای تازگی محتوا است که تنها پس از تثبیت محتوا و تاریخها مفید هستند.
این تغییر در درک ما به این معناست که برای اکثر توسعهدهندگان، هدف ساخت یک «پل» برای AI نیست، بلکه اطمینان از این است که جادههای موجود آسفالت شدهاند و تابلوها واضح هستند. بهینهسازی لولهکشی کشفی در حالی که هنوز جریانی وجود ندارد، اتلاف منابع مهندسی است. این چالش در شرایطی رخ میدهد که سهم ترافیک ارجاعی AI به وبسایتها همچنان بسیار ناچیز است و بقای سایتها به جذب بهینه این ترافیک وابسته است.
اگر یک سایت عملیاتی را مدیریت میکنید، گام بعدی این است که لاگهای سرور خود را برای الگوهای خاص GPTBot و ClaudeBot بررسی کنید تا ببینید آیا sitemap شما واقعاً بهصورت روزانه خوانده میشود یا خیر.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید. با این حال، نکته امیدوارکننده این است که نرخ تبدیل کاربرانی که از طریق جستوجوی AI وارد سایت میشوند بهطور قابلتوجهی از ترافیک ارگانیک سنتی پیشی گرفته است.




گفتگو