پرش به محتوای اصلی
پرش به محتوای مقاله

GPTBot در برابر ClaudeBot؛ تفاوت در استراتژی اسکن وب

·۲۸ مرداد ۱۴۰۵۷ دقیقه مطالعه
راهنما
چه فعالیت‌های GEO واقعاً خزنده‌های AI را جابه‌جا می‌کنند؟ داده‌های ما و چک‌لیست راه‌اندازی سایت جدید
چه فعالیت‌های GEO واقعاً خزنده‌های AI را جابه‌جا می‌کنند؟ داده‌های ما و چک‌لیست راه‌اندازی سایت جدید
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اثبات تجربی اینکه نقاط دسترسی اختصاصی AI (مانند /ai/ یا llms.txt) در مقایسه با sitemap و robots.txt اثر تقریباً صفر دارند و جهش‌های ترافیکی ادعایی، اغلب ناشی از حملات اسکنر یا بازدید انسانی بوده‌اند.

اگر فکر می‌کنید برای دیده شدن در عصر هوش مصنوعی باید لایه‌های پیچیده و جدیدی به سایت خود اضافه کنید، احتمالاً در حال هدر دادن منابع مهندسی هستید. داده‌ها نشان می‌دهند که ساده‌ترین فایل‌های متنی وب، هنوز هم کلید ورود ربات‌های پیشرفته به دنیای شما هستند. یک فایل robots.txt صحیح و یک sitemap.xml معتبر، تنها نقاط ورودی هستند که هر خزنده بزرگ هوش مصنوعی برای کشف محتوای جدید از آن‌ها استفاده می‌کند.

بر اساس بررسی‌های انجام‌شده روی دامنه geo010.com در یک مطالعه ۱۵ روزه، فایل‌های «کسل‌کننده» زیرساختی مانند robots.txt و sitemap.xml ترافیک واقعی بیشتری از خزنده‌های هوش مصنوعی جذب کرده‌اند تا تمام قابلیت‌های تخصصی AI در مجموع. این یافته‌ها نشان می‌دهد که زیرساخت‌های پایه، بسیار مؤثرتر از ابزارهای مدرن و پیچیده هستند.

بسیاری از مدیران سایت‌ها اکنون در تلاش‌اند تا لایه‌های کشف اختصاصی مانند llms.txt یا /ai/summary.json را پیاده‌سازی کنند. اما این اقدامات بیشتر شبیه به بهینه‌سازی برای «ارجاع» (Citation-layer) هستند تا «کشف» (Discovery driver). در دنیایی که عامل‌های هوش مصنوعی (AI Agents) — شبیه به دستیاران دیجیتالی که می‌توانند به‌جای شما در وب بچرخند و کار انجام دهند — مصرف‌کنندگان اصلی داده‌های وب هستند، زیربنای دیده شدن همچنان همان لوله‌کشی‌های سنتی سئو است. این موضوع در حالی است که بسیاری از وب‌سایت‌ها هنوز به‌دلیل فقدان استانداردهای متنی ساده برای AI در معرض خطر نامرئی شدن قرار دارند.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی بهینه‌سازی موتورهای جست‌وجوی زاینده اشاره کردیم، سادگی در ساختار داده‌ها اغلب بر پیچیدگی غلبه می‌کند. برای ردیابی این رفتار، تیم تحقیق یک Cloudflare Worker مستقر کرد که تمام درخواست‌ها به دامنه را در یک پایگاه‌داده D1 ثبت می‌کرد. آن‌ها درخواست‌ها را بر اساس نوع خزنده برچسب‌گذاری کردند و مسیرها را با هم تطبیق دادند تا User Agentهای جعلی و بررسی‌های داخلی curl را فیلتر کنند. بازه زمانی این داده‌ها از ۴ اوت تا ۱۹ اوت ۲۰۲۴ بود.

متدولوژی تخصیص ترافیک

طبق گزارش این تیم، هر درخواست که از طریق Worker عبور می‌کرد، شامل تاریخ، مسیر، وضعیت (Status Code)، نوع صفحه و نام نرمال‌شده‌ی خزنده بود. برای تحلیل اثر ۹ معیار مختلف بهینه‌سازی موتورهای زاینده (GEO)، تیم سه پرسش کلیدی مطرح کرد: کدام خزنده‌ها به مسیرهای مربوطه رسیدند، هر چند وقت یک‌بار این اتفاق افتاد و آیا پس از پیاده‌سازی هر معیار، تعداد بازدیدها تغییر کرد؟

برای حفظ دقت داده‌ها و اطمینان از یکپارچگی آن‌ها، دو فیلتر سخت‌گیرانه اعمال شد. اول، چون نام خزنده‌ها (User Agents) توسط مهاجمان قابل جعل است، تیم پیش از شمارش بازدیدها، مسیرها و کدهای وضعیت را با هم تطبیق داد. دوم، استقرار‌های تأیید داخلی که از طریق دستور curl انجام شده بود، فیلتر شدند تا اعداد به‌صورت کاذب بالا نروند و ترافیک واقعی از ترافیک تست تفکیک شود.

سلسله‌مراتب اثرگذاری بر خزنده‌ها

بر اساس مستندات این مطالعه، اثرگذاری اقدامات مختلف GEO به‌شدت متفاوت است. رتبه‌بندی زیر بر اساس ترافیک واقعی خزنده‌ها بین ۴ تا ۱۹ اوت است:

  • بیشترین اثر: robots.txt و sitemap.xml. این‌ها تنها مسیرهایی بودند که تمام ربات‌های اصلی آن‌ها را بازدید کردند. ClaudeBot هر دو فایل را ۱۰۴ بار خواند. Googlebot ۳۲ بار، OAI-SearchBot ۲۶ بار و Bingbot ۱۷ بار از robots.txt به‌عنوان نقطه ورود تقریباً روزانه استفاده کردند. همچنین GPTBot (۹ بار) و Bingbot (۱۱ بار) از sitemap استفاده کردند.
  • اثر زیاد: صفحه اصلی. تمام خزنده‌های اصلی هر روز صفحه اصلی را بازدید کردند؛ از جمله GPTBot (۲۱ بار)، PerplexityBot (۱۲ بار)، OAI-SearchBot (۱۰ بار)، ClaudeBot (۸ بار)، Claude-SearchBot و Applebot.
  • اثر زیاد: صفحات محتوای جدید. در اینجا GPTBot پیشتاز بود و ۱۲۱ صفحه محتوا را لمس کرد، در حالی که ClaudeBot تنها ۲ مقاله جامعه (Community articles) را بازدید کرد.
  • اثر متوسط: هم‌راستاسازی تازگی (Freshness Alignment). این مورد باعث تکرار بازدیدها می‌شود. در ۸، ۱۲ و ۱۷ اوت، پس از دوره‌های بررسی تازگی محتوا، جهش‌هایی در بازدید خزنده‌ها مشاهده شد.
  • اثر کم-متوسط: چیدمان تعریف‌محور (Definition-first Layout). این رویکرد که بر تراکم موجودیت‌ها تمرکز دارد، توسط بیش از ۷ خزنده شناسایی شد، اما بیشتر بر کیفیت پاسخ اثر داشت تا تعداد بازدید.
  • اثر کم: llms.txt. این فایل تنها ۴ درخواست در مجموع دریافت کرد که ۲ مورد آن مربوط به GPTBot بود. تنها GPTBot، Amazonbot و Googlebot با آن تعامل داشتند.
  • اثر صفر: نقاط دسترسی AI و نشانه‌گذاری FAQPage. مسیرهایی مثل /ai/، ai.txt و پلاگین‌ها در ۱۵ روز هیچ درخواستی دریافت نکردند. همچنین نشانه‌گذاری‌های FAQPage پس از پیاده‌سازی، هیچ بازدیدی از خزنده‌های اصلی AI جذب نکرد.

تفاوت فلسفی GPTBot و ClaudeBot

داده‌ها تضاد شدیدی را در نحوه عملکرد دو خزنده اثرگذار نشان می‌دهند. GPTBot مانند یک اسکنر عمیق عمل می‌کند. این ربات به‌ندرت robots.txt را می‌خواند (تنها ۱ درخواست) و llms.txt را گهگاه بررسی می‌کند، اما هدف اصلی‌اش پیمایش کامل سایت است. برای مثال در ۱۷ اوت، GPTBot در یک دور بازدید، ۶۰ صفحه مختلف را لمس کرد و هر صفحه را تنها یک‌بار بازدید نمود.

در مقابل، ClaudeBot یک دنبال‌کننده منضبط است. این ربات با دقت زیاد و به‌صورت مذهبی robots.txt و sitemap.xml را می‌خواند (۱۰۴ درخواست برای هر کدام). اما به‌ندرت به محتوای عمیق می‌رود، مگر اینکه sitemap یا صفحه اصلی صراحتاً او را به آن مسیر هدایت کنند.

نتیجه عملی این است: اگر sitemap یا robots.txt شما خراب باشد، رباتی مثل ClaudeBot را که هر روز آن را می‌خواند، از دست می‌دهید. اما اگر محتوای شما سطحی باشد، رباتی مثل GPTBot را که همه چیز را می‌خواند، هدر داده‌اید.

تخریب افسانه «قابلیت‌های AI»

این مطالعه یک بررسی صادقانه روی پیش‌فرض‌های قبلی بهینه‌سازی AI است. تحلیل‌های پیشین ادعا می‌کردند که انتشار مقاله جدید یا افزودن FAQPage باعث جهش فوری خزنده‌ها می‌شود. اما لاگ‌های هر درخواست ثابت کرد که این یک برداشت اشتباه و تخصیص نادرست (Misattribution) بوده است.

بسیاری از «جهش‌های» روز اول، در واقع بازدیدکنندگان انسانی یا تست‌های داخلی بودند. هر خزنده AI معمولاً در هر دور پیمایش، یک صفحه جدید را تنها یک‌بار بازدید می‌کند. برای مثال، این ادعا که یک مقاله جدید در روز اول ۶ تا ۱۰ بار خزیده شده، رد شد؛ لاگ‌ها نشان دادند هر خزنده AI تنها یک‌بار بازدید کرده است.

علاوه بر این، جهش ترافیک ۱۱ اوت در واقع یک حمله اسکنر از سوی ChatGPT-User و Amazonbot برای یافتن فایل‌های حساس محیطی (.env.production) و مسیر /telescope/requests بود. جهش مشابهی در ۱۳ اوت نیز شناسایی شد که یک حمله با User Agent جعلی GPTBot بود. همچنین لاگ‌ها نشان دادند که نشانه‌گذاری FAQPage باعث افزایش خزش نشد؛ ۶ صفحه‌ای که از آن استفاده می‌کردند توسط مرورگرها و Bingbot بازدید شدند، اما خزنده‌های اصلی AI به سراغ آن‌ها نرفتند.

تأیید نهایی در سه روز آخر

داده‌های ۱۷ تا ۱۹ اوت این الگوها را تأیید کرد. در ۱۷ اوت، GPTBot ۶۰ صفحه را در یک دور پیمایش دید که ثابت کرد محتوا از طریق sitemap کشف می‌شود، نه نقاط دسترسی AI؛ چرا که حتی یک‌بار هم به /ai/summary.json سر نزد.

در همان روز، ClaudeBot ۲۳ درخواست داشت که همگی محدود به robots.txt، sitemap.xml و صفحه اصلی بود. البته نویزهای شبکه همچنان وجود دارد؛ از ۱۰۶۶ درخواست در ۱۷ اوت، تنها ۳۷۱ مورد وضعیت ۲۰۰ (موفق) داشتند و بقیه تلاش‌های اسکنر برای یافتن مسیرهای قدیمی PHP و /api/v1/validate/code بودند. در ۱۸ اوت، Bingbot ۵۱ درخواست داشت (بیشترین مقدار در یک روز) و Meta-ExternalAgent برای اولین بار با ۸ درخواست ظاهر شد.

گام بعدی شما (چک‌لیست پیش از لانچ)

برای هر کسی که امروز یک سایت جدید را راه‌اندازی می‌کند، داده‌ها یک لیست اولویت سخت‌گیرانه را پیشنهاد می‌دهند. پیش از دست زدن به هرگونه پلاگین تخصصی AI، این سه زیربنا را بسازید:

  1. بازبینی robots.txt: خزنده‌های AI مورد نظرتان را مجاز کنید و فقط صفحات خصوصی، محیط‌های Staging یا صفحات تحلیل را ببندید. یک قانون اشتباه که همه چیز را مسدود کند، یک «صفر خاموش» ایجاد می‌کند.
  2. اعتبارسنجی sitemap.xml: مطمئن شوید تمام URLها کد ۲۰۰ برمی‌گردانند. sitemap پر از خطای ۴۰۴ به بازدیدکننده روزانه (ClaudeBot) می‌گوید سایت شما خراب است.
  3. بهینه‌سازی صفحه اصلی با HTML ساده (Server-Rendered): خزنده‌های AI جاوااسکریپت را اجرا نمی‌کنند. صفحه اصلی باید با متن ساده HTML توضیح دهد سایت چیست و لینک‌های مستقیم به بهترین صفحات داشته باشد.

علاوه بر این، پیش از روز لانچ، ۳ تا ۵ مقاله واقعی منتشر کنید. از آنجایی که GPTBot همه چیز را پیمایش می‌کند، پنج صفحه محکم و باکیفیت بسیار ارزشمندتر از پنجاه صفحه توخالی است.

مواردی که باید نادیده بگیرید

این گزارش توصیه می‌کند اولویت را روی نقاط دسترسی کشف AI مانند /ai/summary.json، /.well-known/ai.txt، ai-plugin.json یا openapi.json نگذارید. این موارد در ۱۵ روز هیچ درخواستی جذب نکردند. به همین ترتیب، نشانه‌گذاری FAQPage را تنها پس از آن اضافه کنید که صفحه در حال حاضر ایندکس شده باشد، زیرا این ابزار بیشتر برای «ارجاع» است تا «کشف» و زمانی کمک می‌کند که AI از قبل صفحه شما را در نظر داشته باشد.

سایر موارد کم‌اولویت شامل ساخت داشبوردهای نظارتی پیچیده (به جای آن با لاگ‌های سرور شروع کنید) و زیرساخت‌های تازگی محتوا است که تنها پس از تثبیت محتوا و تاریخ‌ها مفید هستند.

این تغییر در درک ما به این معناست که برای اکثر توسعه‌دهندگان، هدف ساخت یک «پل» برای AI نیست، بلکه اطمینان از این است که جاده‌های موجود آسفالت شده‌اند و تابلوها واضح هستند. بهینه‌سازی لوله‌کشی کشفی در حالی که هنوز جریانی وجود ندارد، اتلاف منابع مهندسی است. این چالش در شرایطی رخ می‌دهد که سهم ترافیک ارجاعی AI به وب‌سایت‌ها همچنان بسیار ناچیز است و بقای سایت‌ها به جذب بهینه این ترافیک وابسته است.

اگر یک سایت عملیاتی را مدیریت می‌کنید، گام بعدی این است که لاگ‌های سرور خود را برای الگوهای خاص GPTBot و ClaudeBot بررسی کنید تا ببینید آیا sitemap شما واقعاً به‌صورت روزانه خوانده می‌شود یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید. با این حال، نکته امیدوارکننده این است که نرخ تبدیل کاربرانی که از طریق جست‌وجوی AI وارد سایت می‌شوند به‌طور قابل‌توجهی از ترافیک ارگانیک سنتی پیشی گرفته است.

چرا این موضوع مهم است؟

این یافته‌ها بر اساس تحلیل تجربی لاگ‌های سرور است و نشان می‌دهد که اعتبار سئو سنتی در عصر AI همچنان پابرجاست. مدیران وب باید اولویت خود را از پیاده‌سازی پلاگین‌های AI به اصلاح فایل‌های پایه تغییر دهند تا از دست دادن ترافیک ربات‌های Claude و GPT جلوگیری کنند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که محتوای انگلیسی تولید می‌کنند، اصلاح sitemap و robots.txt ارزان‌ترین و سریع‌ترین راه برای افزایش شانس دیده شدن در پاسخ‌های Perplexity و ChatGPT است.

·نگاه ما
تحریریه دات‌هوش

تمرکز بیش از حد توسعه‌دهندگان بر استانداردهای نوظهور مانند llms.txt نشان‌دهنده یک سوءتفاهم استراتژیک است. در حالی که صنعت به سمت عامل‌های هوش مصنوعی حرکت می‌کند، این داده‌ها ثابت می‌کنند که این عامل‌ها هنوز بر روی پروتکل‌های پایه وب متکی هستند. در واقع، «سادگی زیرساختی» بر «پیچیدگی بهینه‌سازی» پیروز شده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.