پرش به محتوای اصلی
پرش به محتوای مقاله

OAI-SearchBot در برابر GPTBot؛ تفکیک ترافیک جست‌وجو از داده‌های آموزشی

·۱۴ مهر ۱۴۰۵۳ دقیقه مطالعه
راهنما
ربات جستجوی OAI در برابر GPTBot: تفکیک دسترسی جستجو از آموزش مدل
ربات جستجوی OAI در برابر GPTBot: تفکیک دسترسی جستجو از آموزش مدل
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جدا کردن دسترسی برای «جست‌وجوی بلادرنگ» از «آموزش مدل»؛ این یعنی برای نخستین بار می‌توان بدون اهدای داده برای آموزش، در نتایج پاسخ‌های هوش مصنوعی حضور داشت.

اگر صاحب وب‌سایت هستید، اکنون می‌توانید تصمیم بگیرید که آیا محتوای شما صرفاً برای پاسخ به کاربران استفاده شود یا به عنوان سوخت برای آموزش مدل‌های آینده تبدیل گردد. این تفکیک فنی به این معناست که دیگر مجبور نیستید برای دیده شدن در نتایج جست‌وجوی هوش مصنوعی، مالکیت داده‌های خود را واگذار کنید. رؤیت‌پذیری وب‌سایت شما در پاسخ‌های هوش مصنوعی به یک تمایز فنی بین دو خزنده متفاوت بستگی دارد. اوپن‌ای‌آی (OpenAI) از OAI-SearchBot برای جست‌وجوی بلادرنگ ChatGPT و از GPTBot برای جمع‌آوری داده‌های آموزشی استفاده می‌کند و اجازه دادن به یکی، لزوماً به معنای اجازه دادن به دیگری نیست.

این تغییر در حالی رخ می‌دهد که برندها برای حفظ مالکیت معنوی خود با چالش‌های جدی روبرو هستند و تلاش می‌کنند تعادلی میان جذب ترافیک مبتنی بر هوش مصنوعی و حفاظت از دارایی‌های فکری ایجاد کنند. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی سوءاستفاده از سبک‌های هنری توسط مدل‌های زاینده اشاره کردیم — مانند موردی که ChatGPT امضاهای ۱۵ کارتونیست مجله نیویورکر را جعل کرد — کنترل دسترسی خزنده‌ها نخستین خط دفاعی برای تولیدکنندگان محتواست.

بر اساس مستندات منتشر شده تا ۶ اکتبر ۲۰۲۶، سه نقش متفاوت برای خزنده‌های این شرکت تعریف شده است:

  • OAI-SearchBot: مخصوص جست‌وجوی ChatGPT برای ارائه ارجاعات (Citations) و اطلاعات به‌روز.
  • GPTBot: خزنده‌ای که وب را برای اهداف کلی آموزش مدل‌ها می‌پیماید.
  • ChatGPT-User: نقش مجزایی برای درخواست‌هایی که مستقیماً توسط کاربر در طول یک جلسه چت ارسال می‌شود.

ربات جستجوی OAI در مقابل ربات GPT: تفکیک دسترسی جستجو از آموزش

برای اجرای این تفکیک، توسعه‌دهندگان باید گروه‌های کاربر (User-agent) خاصی را در فایل robots.txt تعریف کنند. برای مثال، یک سایت می‌تواند برای User-agent: OAI-SearchBot مقدار Allow: / را تنظیم کند، در حالی که برای User-agent: GPTBot مقدار Disallow: / را قرار دهد. با این روش، سایت شما در نتایج جست‌وجوی هوش مصنوعی — که شبیه به یک ویترین دیجیتال برای جذب مشتری است — باقی می‌ماند، اما از استخر داده‌های آموزشی خارج می‌شود. این موضوع در حالی اهمیت می‌یابد که تفاوت‌های بنیادین میان دیده‌شدن در موتورهای جست‌وجوی سنتی و هوش مصنوعی می‌تواند سرنوشت ترافیک ورودی وب‌سایت‌ها را تغییر دهد.

به گزارش منابع فنی، صرفِ تنظیم این فایل و موفقیت‌آمیز بودن یک درخواست، تضمین‌کننده ارجاع (Citation) نیست. مالکان سایت باید بررسی کنند که قوانین فایروال، چالش‌های لبه (Edge Challenges) یا تغییر مسیرها، محدوده‌های IP منتشر شده توسط OAI-SearchBot را مسدود نکرده باشند؛ زیرا رشته‌های User-agent به‌تنهایی می‌توانند توسط اشخاص ثالث جعل شوند. در واقع، برخی موانع فنی پیچیده‌تر نیز وجود دارند که حتی با وجود تنظیمات صحیح robots.txt، وب‌سایت شما را برای مدل‌هایی مانند ChatGPT و Perplexity نامرئی می‌کنند.

این رویکرد، فرض قدیمی مبنی بر اینکه دسترسی هوش مصنوعی «یا صفر است یا یک» (All-or-nothing)، را تغییر می‌دهد. برای صاحبان کسب‌وکار، این بدان معناست که اکنون می‌توانید با جست‌وجوی هوش مصنوعی به عنوان یک کانال بازاریابی (AEO/GEO) برخورد کنید و هم‌زمان، آموزش مدل را یک مسئله حریم خصوصی داده‌ها بدانید. این موضوع گفتگو را از یک موضع مبهم «مسدود کردن هوش مصنوعی» به یک سیاست دسترسی دقیق و جزئی منتقل می‌کند.

این استاندارد تنها مختص اوپن‌ای‌آی نیست و کنترل‌های مشابهی برای سایر ارائه‌دهندگان نیز وجود دارد. برای نمونه، شرکت آنتروپیک (Anthropic) نیز نقش‌های مجزایی برای ClaudeBot، Claude-User و Claude-SearchBot در نظر گرفته است. ترکیب یا اشتباه در نام‌گذاری این‌ها در سیاست‌های دسترسی، منجر به مسدودسازی‌های اشتباه یا دسترسی‌های ناخواسته می‌شود.

گام بعدی شما

برای تأیید تنظیمات خود، فایل robots.txt ارائه شده در هاست خود را بازرسی کرده و یک صفحه عمومی نمونه را تست کنید. سپس این موارد را اجرا کنید:

  • دسترسی GPTBot را در صورت عدم تمایل به آموزش مدل، مسدود کنید.
  • رنج‌های IP رسمی OAI-SearchBot را در فایروال خود سفید کنید تا ترافیک ارجاعی قطع نشود.
  • صفحات حاوی داده‌های حساس مشتریان و حساب‌های خصوصی را حتماً پشت لایه‌های احراز هویت قرار دهید، زیرا robots.txt یک سیستم امنیتی نیست.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تفکیک بر اساس استانداردهای جدید مدیریت داده، توازن میان دیده شدن در عصر هوش مصنوعی و حفاظت از مالکیت معنوی را برقرار می‌کند. اعتبار این سیستم به شفافیت در تفکیک خزنده‌ها بازمی‌گردد تا مالکان وب‌سایت‌ها کنترل دقیق‌تری بر دارایی‌های دیجیتال خود داشته باشند.

تأثیر برای ایران

برای توسعه‌دهندگان و تولیدکنندگان محتوای ایرانی که از APIهای جهانی استفاده می‌کنند، این تنظیمات برای جلوگیری از تحلیل رایگان محتوای فارسی توسط مدل‌های آمریکایی ضروری است.

·نگاه ما
تحریریه دات‌هوش

این حرکت اوپن‌ای‌آی در واقع پذیرشی از فشار قانونی مالکان محتواست تا از بن‌بست «مسدودسازی کامل» خارج شوند. با تبدیل شدن AI Search به یک کانال توزیع ترافیک، مدل‌های زبانی از حالت «جایگزین وب‌سایت‌ها» به «درگاه ورودی وب‌سایت‌ها» تغییر نقش می‌دهند، مشروط بر اینکه ارجاعات به درستی کار کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.