پرش به محتوای اصلی
پرش به محتوای مقاله

«سئو برای ماشین‌ها»؛ روش جدید فریب موتورهای جست‌وجوی زاینده

·۱۱ شهریور ۱۴۰۵۸ دقیقه مطالعه۲ بازدید
گزارش تحقیقی
سه سایت ۲۱۵ هزار صفحه «بهترین نرم‌افزار» برای هوش مصنوعی ساختند؛ Perplexity به آنها استناد می‌کند
سه سایت ۲۱۵ هزار صفحه «بهترین نرم‌افزار» برای هوش مصنوعی ساختند؛ Perplexity به آنها استناد می‌کند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کشف استراتژی «مزارع مبنی‌سازی» که با استفاده از اصطلاحات فنی (مانند Grounding Page) و ساختارهای JSON-LD، به‌طور هدفمند لایه‌ی بازیابی مدل‌های زبانی را برای جذب ترافیک تجاری فریب می‌دهند.

تصور کنید ابزاری که برای حذف توهمات هوش مصنوعی طراحی شده، حالا توسط هزاران صفحهٔ جعلی که دقیقاً برای فریب دادن آن ساخته شده‌اند، هدایت می‌شود. این همان وضعیتی است که اکنون در لایه‌ی بازیابی Perplexity رخ می‌دهد.

طبق تحلیل فنی منتشرشده در ۲ سپتامبر ۲۰۲۶ توسط trellner.com، حدود ۲۱۵,۱۲۸ صفحهٔ «بهترین نرم‌افزار» که توسط هوش مصنوعی تولید شده‌اند، در حال تغذیه کردن فرآیند مبنی‌سازی (Grounding) این موتور جست‌وجو هستند. این صفحات بخشی از یک شبکه گسترده از محتوای مصنوعی هستند که نه برای خواندن انسان، بلکه برای مصرف ماشین‌ها بهینه شده‌اند. این رویکرد تولید انبوه محتوا یادآور استراتژی‌هایی است که در ساخت سایت‌های عظیم بدون نیاز به توسعه‌دهنده دیده شده و مرز میان مهارت کدنویسی و سلیقه کاربر را جابه‌جا کرده است. طبق این گزارش، Perplexity به‌طور مکرر داده‌های مبنی‌سازی را از این دامنه‌های کم‌اعتبار بازیابی می‌کند؛ دامنه‌هایی که صرفاً برای دست‌کاری لایه‌های بازیابی هوش مصنوعی ایجاد شده‌اند و این امر می‌تواند ماهیت «تأییدشده» توصیه‌های نرم‌افزاری این ابزار را به مخاطره بیندازد.

این اتفاق در حالی رخ می‌دهد که صنعت به سمت تولید بازیابی‌افزا (RAG) حرکت می‌کند؛ سیستمی که در آن مدل‌ها برای کاهش توهم (Hallucination)، پاسخ‌های خود را بر اساس داده‌های وب در لحظه مستند می‌کنند. در حالی که هدف RAG افزایش دقت واقع‌گرایانه است، این گزارش نشان می‌دهد که لایه‌ی بازیابی می‌تواند توسط بازیگرانی که می‌دانند موتورهای جست‌وجوی هوش مصنوعی چگونه اطلاعات را اولویت‌بندی می‌کنند، «بازی» شود. این یک مسابقه‌ی تسلیحاتی دیجیتال است که در آن هدف دیگر الگوریتم گوگل نیست، بلکه گام مبنی‌سازی مدل‌های زبانی بزرگ (LLM) است.

مقیاس مبنی‌سازی مصنوعی

پژوهشگران مدل‌های perplexity/sonar و perplexity/sonar-pro را در ۳۸۰ دسته‌بندی نرم‌افزاری، از «نرم‌افزارهای CRM» تا «نرم‌افزارهای مدیریت مجموعه‌های موزه‌ای» آزمایش کردند. این مطالعه شامل ۷۶۰ فراخوانی در مجموع از طریق OpenRouter بود؛ به این صورت که برای هر مدل در هر دسته‌بندی، یک پرامپت ارسال شد. در هر فراخوانی، درخواست شد که ۵ محصول برتر به صورت یک لیست رتبه‌بندی شده در قالب JSON، شامل دامنه صفحه اصلی رسمی هر محصول، ارائه شود. تمام ۷۶۰ فراخوانی پاسخی قابل تجزیه (Parseable) بازگرداندند.

این فرآیند منجر به ایجاد ۳,۸۰۰ جایگاه توصیه شد که ۱,۸۰۷ محصول متمایز را نام می‌بردند. در مجموع ۷,۵۳۴ ارجاع به ۲۰۵۵ دامنه مختلف ثبت شد. نتایج این بررسی تکان‌دهنده است: ۵۹.۸٪ از این ارجاعات به دامنه‌هایی اشاره داشتند که رتبه‌ای پایین‌تر از ۱۰۰,۰۰۰ در لیست یک میلیون دامنه برتر Tranco داشتند و ۲۳.۴٪ اصلاً در لیست یک میلیون دامنه برتر نبودند.

مکانیسم مزارع مبنی‌سازی

بر اساس این گزارش، پدیده‌ای به نام «مزارع مبنی‌سازی» (Grounding Farms) ظهور کرده است. سه سایت wifitalents.com، worldmetrics.org و gitnux.org که احتمالاً تحت کنترل یک مالک مشترک هستند، در ۴۱ دسته‌بندی از ۳۸۰ مورد ظاهر شده‌اند و در مجموع ۱۸۱ ارجاع (۲.۴٪ از کل) را به خود اختصاص داده‌اند. نکته کلیدی این است که هیچ‌کدام از این دامنه‌ها پیش از دسامبر ۲۰۲۳ وجود نداشتند.

این سایت‌ها از استراتژی‌های بسیار دقیقی برای جذب مدل‌های هوش مصنوعی استفاده می‌کنند:

  • عناوین ماشین‌خوان: دو سایت به‌طور صریح از عنوان HTML «Facts & Grounding Page» استفاده می‌کنند. «مبنی‌سازی» (Grounding) یک اصطلاح فنی برای گام بازیابی است که مدل‌ها انجام می‌دهند و اصلاً واژه‌ای نیست که خریداران انسانی از آن استفاده کنند.
  • توضیحات متای هدفمند: آن‌ها از متادیسکریپشن‌های یکسانی استفاده می‌کنند (که فقط نام برند در آن‌ها متفاوت است) و خود را به عنوان «یک شرکت تحقیقات بازار مستقل که آمار صنعت را منتشر می‌کند... جزئیات شرکتی، قانونی، متدولوژی و انطباق در یک رکورد ماشین‌خوان» معرفی می‌کنند.
  • زیرساخت مشترک: هر سه دامنه بین دسامبر ۲۰۲۳ و می ۲۰۲۴ از طریق NameCheap ثبت شده‌اند. آن‌ها DNS خود را به یک جفت نام‌سرور مشترک در Cloudflare واگذار کرده‌اند: pam.ns.cloudflare.com و sean.ns.cloudflare.com.
  • اعتبار مصنوعی: هر سایت دارای وبلاگی است که دقیقاً ۶ پست دارد. تمام ۱۸ پست در این سه سایت درباره برندهای دیگر در همین مجموعه است، از جمله برند چهارمی به نام zipdo.co که همان نام‌سرورها و عنوان «Facts & Grounding Page» را دارد.
  • مقیاس انبوه: سایت‌مپ‌های این دامنه‌ها شامل تعداد خیره‌کننده‌ای URL است. Worldmetrics دارای ۱۰۷,۰۸۳، Gitnux دارای ۱۰۳,۵۷۸ و WifiTalents دارای ۱۰۵,۵۴۱ لینک است. از این میان، ۲۱۵,۱۲۸ صفحه به‌طور خاص با ساختار /best/<something>-software/ ساخته شده‌اند.

تجاری‌سازی ماشین‌ها

این صفحات صرفاً برای سئو نیستند، بلکه ورودی یک قیف فروش تجاری‌اند. در حالی که لیست‌های «بهترین‌ها» برای بازیابی توسط هوش مصنوعی تولید می‌شوند، این سایت‌ها خدمات انسانی گران‌قیمتی را تبلیغ می‌کنند. برای مثال، Worldmetrics.org خدمات تحقیقات بازار سفارشی را با قیمت‌های شروع از ۵,۰۰۰ یورو، گزارش‌های آماده از ۴۹۹ یورو و خدمات انتخاب تامین‌کننده از ۲,۵۰۰ یورو ارائه می‌دهد.

این یک رابطه انگلی است: هوش مصنوعی با ارجاع به صفحه «حقایق تأییدشده»، ترافیک را تامین می‌کند و اپراتور سایت تلاش می‌کند این دیده‌شدنِ ماشین‌محور را به لیدهای (Leads) مشاوره با ارزش بالا تبدیل کند.

ناهنجاری Guideflow

گزارش همچنین برجسته می‌کند که چگونه محتوای غیرتخصصی در رتبه‌های بالا قرار می‌گیرد. سایت guideflow.com که فروشنده دموهای تعاملی محصول است، به سومین منبع بزرگ ارجاعات در ۳۸۰ دسته‌بندی تبدیل شده و حتی از Gartner پیشی گرفته است.

با وجود اینکه این سایت یک سایت بررسی یا دایرکتوری نیست، guideflow.com در ۹۶ دسته‌بندی مختلف (یک چهارم کل دسته‌های آزمایش شده) ۱۹۴ بار ارجاع داده شده است. وبلاگ این سایت مبنای (Grounding) دسته‌هایی شده است که حتی در حوزه فعالیت آن‌ها نیست، مانند «نرم‌افزارهای رندرینگ سه‌بعدی»، «نرم‌افزارهای IVR»، «نرم‌افزارهای RFID» و «نرم‌افزارهای مدیریت دفاتر معماری».

هر ارجاع به یک URL متفاوت بود؛ سایت‌مپ این وب‌سایت ۳,۳۵۱ لینک وبلاگی دارد که ۲,۱۷۶ مورد از آن‌ها پست‌های متمایز هستند. این نشان می‌دهد که لایه‌ی بازیابی، لیست‌های بازاریابی محتوایی (Listicles) را بر تحلیلگران شناخته‌شده صنعت ترجیح می‌دهد. جالب است که برخی از این ارجاعات مربوط به نسخه‌های استونیایی (Estonian-locale) پست‌ها بود.

یک قالب، سه حکم متناقض

برای تست سازگاری این مزارع، پژوهشگران صفحه «نرم‌افزار تخمین پروژه» را در هر سه برند بررسی کردند. هر سه صفحه رتبه‌بندی خود را در قالب JSON-LD برای خوانش آسان ماشین ذکر کرده بودند. با این حال، نتایج متناقض بود: برند برنده در Gitnux اصلاً در لیست ۵تای اول Worldmetrics ظاهر نشد.

علاوه بر این، انتساب «کارشناس» مصنوعی به نظر می‌رسید:

  • Worldmetrics اعتبار را به Kathryn Blake, Alexander Schmidt و Victoria Marsh نسبت داد.
  • Gitnux اعتبار را به Diana Reeves, Helena Kowalczyk و Olivia Thornton نسبت داد.
  • WifiTalents اعتبار را به Ryan Gallagher, Isabella Rossi و Natasha Ivanova نسبت داد.

این منجر به معرفی ۹ «کارشناس» مختلف برای یک دسته‌بندی واحد نرم‌افزاری شد. علاوه بر این، هر سه صفحه حاوی یک متغیر قالب (Template variable) رندرنشده در بخش نویسنده بودند که در دو صفحه عبارت «Within the next 26 days» و در صفحه سوم «Within the next 40 days» دیده می‌شد.

توهم در لایه‌ی منبع

اتکا به این منابع بی‌کیفیت منجر به شکست‌های مستقیم در پاسخ نهایی می‌شود. پژوهشگران ۱۵۰۲ صفحه خانه فروشندگان را دو بار بررسی کردند (یک بار مستقیم و یک بار از طریق پروکسی چرخان). آن‌ها دریافتند ۱.۱٪ (۱۷ دامنه) حذف شده یا غیرقابل دسترس بودند. این شامل سایت‌های بزرگی مانند nasdaq.com و solidworks.com می‌شد که صرفاً به درخواست خودکار پاسخ ندادند.

ده دامنه اصلاً به آدرسی ختم نشدند، از جمله:

  • graphiql.com (به عنوان خانه GraphiQL معرفی شده بود)
  • todo.com (برای Microsoft To Do معرفی شده بود)
  • aquasecurity.io (برای Trivy معرفی شده بود)

نگران‌کننده‌تر از این، «توهمات تغییر مسیر» (Redirect Hallucinations) است. در یک مورد، هنگام درخواست پلتفرم‌های مدیریت داده‌های پژوهشی، مدل sonar به دامنه dryad.co ارجاع داد که در واقع به یک پورتال قمار آنلاین اندونزیایی با عنوان «BIGSLOT288 | Portal Game Online» تغییر مسیر می‌داد. در موردی دیگر، درخواست ابزارهای کیفیت داده، مدل sonar-pro را به montecarlo.com هدایت کرد که به Monte-Carlo Société des Bains de Mer، یک گروه هتل و کازینوی لوکس در موناکو، تغییر مسیر می‌داد.

متدولوژی فنی

این مطالعه با ۷۶۰ فراخوانی از طریق OpenRouter برای اطمینان از محیطی یکسان انجام شد. پژوهشگران از لیست روزانه Tranco برای تاریخ ۱ سپتامبر ۲۰۲۶ و از Wayback Machine برای تأیید سن دامنه‌ها استفاده کردند. آن‌ها دریافتند که میانگین اولین ثبت دامنه‌های بدون رتبه در Wayback Machine سال ۲۰۲۰ است، در حالی که برای دامنه‌های رتبه‌دار این تاریخ به ۲۰۱۱ بازمی‌گردد. نکته قابل توجه این است که ۱۶.۶٪ از دامنه‌های آرشیو شده بدون رتبه، اولین بار در سال ۲۰۲۵ یا بعد از آن ثبت شده‌اند، در حالی که این رقم برای دامنه‌های رتبه‌دار تنها ۱.۶٪ است.

برای دامنه‌های رتبه‌دار، میانگین رتبه Tranco برابر با ۷۱,۶۱۱ بود. ۱۰ دامنه برتر از نظر تعداد ارجاع، ۱۷.۳٪ از کل ارجاعات را تشکیل می‌دادند که نشان می‌دهد نتایج توسط یک کارتل کوچک از سایت‌های مشهور تسلط نشده است. در مقابل، ویکی‌پدیا در کل ۷,۵۳۴ ارجاع، تنها ۳ بار ذکر شده بود.

باید اشاره کرد که perplexity/sonar و perplexity/sonar-pro لایه‌ی بازیابی مشترکی داشتند و در ۲۸۹ مورد از ۳۸۰ دسته، لیست‌های ارجاع کاملاً یکسانی (Byte-identical) بازگرداندند. مجموعه‌ی URLهای آن‌ها دارای ضریب جاکارد (Jaccard) ۰.۸۹۸ است. این نشان می‌دهد که مشکل در پشته‌ی (Stack) جست‌وجوی مشترک است، نه در سطح خاص مدل.

تحلیل: ظهور سئوی عامل‌محور (Agentic SEO)

این وضعیت نشان‌دهنده یک تغییر بنیادین در مفروضات مربوط به مبنی‌سازی وب است. برای سال‌ها تصور می‌شد که سایت‌های پربازدید و با اعتبار بالا (مانند ویکی‌پدیا) بر RAG مسلط خواهند بود. در عوض، ما شاهد تولد «سئوی عامل‌محور» (Agentic SEO) هستیم؛ محتوایی که نه برای خواندن انسان، بلکه برای بازیابی توسط عامل‌های هوش مصنوعی ایجاد شده است.

این سایت‌های مصنوعی با استفاده از عباراتی مانند «Grounding Page» و ارائه داده‌های ساختاریافته JSON-LD، در واقع در حال نوشتن یک دفترچه راهنما برای هوش مصنوعی هستند تا آن را دنبال کند. این امر یک حلقه بازخورد خطرناک ایجاد می‌کند: مدل‌های هوش مصنوعی به صفحات مصنوعی ارجاع می‌دهند، که این کار اعتبار ادراک‌شده‌ی آن صفحات را افزایش می‌دهد و در نهایت منجر به ارجاعات بیشتر می‌شود.

برای متخصصان فنی، این بدان معناست که RAG یک راهکار قطعی (Silver Bullet) برای حقیقت نیست. اگر لایه‌ی بازیابی مستعد این نوع دست‌کاری برنامه‌ریزی شده باشد، «مبنی‌سازی» صرفاً تغییری از توهم مدل به توهم منبع است. این چالش در دقت داده‌ها مشابه مشکلاتی است که در تخریب آمارهای رشد مقالات هوش مصنوعی مشاهده شده و نیاز به متدولوژی‌های دقیق‌تر برای شمارش و تأیید منابع را برجسته می‌کند.

برای مقابله با این وضعیت، سیستم‌های بازیابی احتمالاً باید از تطبیق ساده رتبه یا کلمات کلیدی فراتر رفته و بررسی‌های پیشرفته‌تری روی منشأ داده‌ها یا «گراف‌های اعتماد» (Trust Graphs) پیاده کنند تا شبکه‌های مصنوعی را شناسایی کنند. باید منتظر ظهور پروتکل‌های تأیید مخصوص هوش مصنوعی یا ادغام اثبات منشأ محتوا مبتنی بر بلاک‌چین (C2PA) در لایه‌ی بازیابی باشیم تا تخصص انسانی از مزارع مبنی‌سازی متمایز شود.

گام بعدی شما

  • اگر از Perplexity برای انتخاب ابزارهای نرم‌افزاری استفاده می‌کنید، حتماً دامنه ارجاع داده شده را بررسی کنید تا مطمئن شوید یک «مزرعه مبنی‌سازی» نیست.
  • برای توسعه‌دهندگان RAG: پیاده‌سازی «گراف‌های اعتماد» (Trust Graphs) را جایگزین تکیه بر رتبه‌های ساده وب کنید.
  • بررسی کنید آیا محتوای وب‌سایت شما برای عامل‌های هوش مصنوعی بهینه شده یا صرفاً برای انسان‌ها؛ عصر Agentic SEO آغاز شده است.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این یافته اعتبار «مستند بودن» پاسخ‌های هوش مصنوعی را زیر سؤال می‌برد و نشان می‌دهد که لایه‌های بازیابی در برابر دست‌کاری برنامه‌ریزی‌شده آسیب‌پذیرند. اعتماد به خروجی‌های RAG اکنون نیازمند پروتکل‌های تأیید منبع (Provenance) است تا تخصص انسانی از مزارع داده تفکیک شود.

تأثیر برای ایران

برای تولیدکنندگان محتوای فارسی، این یک هشدار است که استراتژی‌های سئو باید از تمرکز بر گوگل به سمت بهینه‌سازی برای عامل‌های هوش مصنوعی تغییر کند تا در پاسخ‌های مدل‌های چندزبانه جایگاه یابند.

·نگاه ما
تحریریه دات‌هوش

این پدیده نشان می‌دهد که RAG به جای حل مشکل توهم، آن را از لایه‌ی مدل به لایه‌ی منبع منتقل کرده است. ما با ظهور «سئوی عامل‌محور» (Agentic SEO) روبرو هستیم که در آن محتوا برای متقاعد کردن ماشین‌ها نوشته می‌شود، نه انسان‌ها. این یک حلقه بازخورد خطرناک است: مدل‌ها صفحات مصنوعی را می‌شناسند، اعتبار آن‌ها را بالا می‌برند و در نتیجه بیشتر به آن‌ها ارجاع می‌دهند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.