تصور کنید ابزاری که برای حذف توهمات هوش مصنوعی طراحی شده، حالا توسط هزاران صفحهٔ جعلی که دقیقاً برای فریب دادن آن ساخته شدهاند، هدایت میشود. این همان وضعیتی است که اکنون در لایهی بازیابی Perplexity رخ میدهد.
طبق تحلیل فنی منتشرشده در ۲ سپتامبر ۲۰۲۶ توسط trellner.com، حدود ۲۱۵,۱۲۸ صفحهٔ «بهترین نرمافزار» که توسط هوش مصنوعی تولید شدهاند، در حال تغذیه کردن فرآیند مبنیسازی (Grounding) این موتور جستوجو هستند. این صفحات بخشی از یک شبکه گسترده از محتوای مصنوعی هستند که نه برای خواندن انسان، بلکه برای مصرف ماشینها بهینه شدهاند. این رویکرد تولید انبوه محتوا یادآور استراتژیهایی است که در ساخت سایتهای عظیم بدون نیاز به توسعهدهنده دیده شده و مرز میان مهارت کدنویسی و سلیقه کاربر را جابهجا کرده است. طبق این گزارش، Perplexity بهطور مکرر دادههای مبنیسازی را از این دامنههای کماعتبار بازیابی میکند؛ دامنههایی که صرفاً برای دستکاری لایههای بازیابی هوش مصنوعی ایجاد شدهاند و این امر میتواند ماهیت «تأییدشده» توصیههای نرمافزاری این ابزار را به مخاطره بیندازد.
این اتفاق در حالی رخ میدهد که صنعت به سمت تولید بازیابیافزا (RAG) حرکت میکند؛ سیستمی که در آن مدلها برای کاهش توهم (Hallucination)، پاسخهای خود را بر اساس دادههای وب در لحظه مستند میکنند. در حالی که هدف RAG افزایش دقت واقعگرایانه است، این گزارش نشان میدهد که لایهی بازیابی میتواند توسط بازیگرانی که میدانند موتورهای جستوجوی هوش مصنوعی چگونه اطلاعات را اولویتبندی میکنند، «بازی» شود. این یک مسابقهی تسلیحاتی دیجیتال است که در آن هدف دیگر الگوریتم گوگل نیست، بلکه گام مبنیسازی مدلهای زبانی بزرگ (LLM) است.
مقیاس مبنیسازی مصنوعی
پژوهشگران مدلهای perplexity/sonar و perplexity/sonar-pro را در ۳۸۰ دستهبندی نرمافزاری، از «نرمافزارهای CRM» تا «نرمافزارهای مدیریت مجموعههای موزهای» آزمایش کردند. این مطالعه شامل ۷۶۰ فراخوانی در مجموع از طریق OpenRouter بود؛ به این صورت که برای هر مدل در هر دستهبندی، یک پرامپت ارسال شد. در هر فراخوانی، درخواست شد که ۵ محصول برتر به صورت یک لیست رتبهبندی شده در قالب JSON، شامل دامنه صفحه اصلی رسمی هر محصول، ارائه شود. تمام ۷۶۰ فراخوانی پاسخی قابل تجزیه (Parseable) بازگرداندند.
این فرآیند منجر به ایجاد ۳,۸۰۰ جایگاه توصیه شد که ۱,۸۰۷ محصول متمایز را نام میبردند. در مجموع ۷,۵۳۴ ارجاع به ۲۰۵۵ دامنه مختلف ثبت شد. نتایج این بررسی تکاندهنده است: ۵۹.۸٪ از این ارجاعات به دامنههایی اشاره داشتند که رتبهای پایینتر از ۱۰۰,۰۰۰ در لیست یک میلیون دامنه برتر Tranco داشتند و ۲۳.۴٪ اصلاً در لیست یک میلیون دامنه برتر نبودند.
مکانیسم مزارع مبنیسازی
بر اساس این گزارش، پدیدهای به نام «مزارع مبنیسازی» (Grounding Farms) ظهور کرده است. سه سایت wifitalents.com، worldmetrics.org و gitnux.org که احتمالاً تحت کنترل یک مالک مشترک هستند، در ۴۱ دستهبندی از ۳۸۰ مورد ظاهر شدهاند و در مجموع ۱۸۱ ارجاع (۲.۴٪ از کل) را به خود اختصاص دادهاند. نکته کلیدی این است که هیچکدام از این دامنهها پیش از دسامبر ۲۰۲۳ وجود نداشتند.
این سایتها از استراتژیهای بسیار دقیقی برای جذب مدلهای هوش مصنوعی استفاده میکنند:
- عناوین ماشینخوان: دو سایت بهطور صریح از عنوان HTML «Facts & Grounding Page» استفاده میکنند. «مبنیسازی» (Grounding) یک اصطلاح فنی برای گام بازیابی است که مدلها انجام میدهند و اصلاً واژهای نیست که خریداران انسانی از آن استفاده کنند.
- توضیحات متای هدفمند: آنها از متادیسکریپشنهای یکسانی استفاده میکنند (که فقط نام برند در آنها متفاوت است) و خود را به عنوان «یک شرکت تحقیقات بازار مستقل که آمار صنعت را منتشر میکند... جزئیات شرکتی، قانونی، متدولوژی و انطباق در یک رکورد ماشینخوان» معرفی میکنند.
- زیرساخت مشترک: هر سه دامنه بین دسامبر ۲۰۲۳ و می ۲۰۲۴ از طریق NameCheap ثبت شدهاند. آنها DNS خود را به یک جفت نامسرور مشترک در Cloudflare واگذار کردهاند:
pam.ns.cloudflare.comوsean.ns.cloudflare.com. - اعتبار مصنوعی: هر سایت دارای وبلاگی است که دقیقاً ۶ پست دارد. تمام ۱۸ پست در این سه سایت درباره برندهای دیگر در همین مجموعه است، از جمله برند چهارمی به نام zipdo.co که همان نامسرورها و عنوان «Facts & Grounding Page» را دارد.
- مقیاس انبوه: سایتمپهای این دامنهها شامل تعداد خیرهکنندهای URL است. Worldmetrics دارای ۱۰۷,۰۸۳، Gitnux دارای ۱۰۳,۵۷۸ و WifiTalents دارای ۱۰۵,۵۴۱ لینک است. از این میان، ۲۱۵,۱۲۸ صفحه بهطور خاص با ساختار
/best/<something>-software/ساخته شدهاند.
تجاریسازی ماشینها
این صفحات صرفاً برای سئو نیستند، بلکه ورودی یک قیف فروش تجاریاند. در حالی که لیستهای «بهترینها» برای بازیابی توسط هوش مصنوعی تولید میشوند، این سایتها خدمات انسانی گرانقیمتی را تبلیغ میکنند. برای مثال، Worldmetrics.org خدمات تحقیقات بازار سفارشی را با قیمتهای شروع از ۵,۰۰۰ یورو، گزارشهای آماده از ۴۹۹ یورو و خدمات انتخاب تامینکننده از ۲,۵۰۰ یورو ارائه میدهد.
این یک رابطه انگلی است: هوش مصنوعی با ارجاع به صفحه «حقایق تأییدشده»، ترافیک را تامین میکند و اپراتور سایت تلاش میکند این دیدهشدنِ ماشینمحور را به لیدهای (Leads) مشاوره با ارزش بالا تبدیل کند.
ناهنجاری Guideflow
گزارش همچنین برجسته میکند که چگونه محتوای غیرتخصصی در رتبههای بالا قرار میگیرد. سایت guideflow.com که فروشنده دموهای تعاملی محصول است، به سومین منبع بزرگ ارجاعات در ۳۸۰ دستهبندی تبدیل شده و حتی از Gartner پیشی گرفته است.
با وجود اینکه این سایت یک سایت بررسی یا دایرکتوری نیست، guideflow.com در ۹۶ دستهبندی مختلف (یک چهارم کل دستههای آزمایش شده) ۱۹۴ بار ارجاع داده شده است. وبلاگ این سایت مبنای (Grounding) دستههایی شده است که حتی در حوزه فعالیت آنها نیست، مانند «نرمافزارهای رندرینگ سهبعدی»، «نرمافزارهای IVR»، «نرمافزارهای RFID» و «نرمافزارهای مدیریت دفاتر معماری».
هر ارجاع به یک URL متفاوت بود؛ سایتمپ این وبسایت ۳,۳۵۱ لینک وبلاگی دارد که ۲,۱۷۶ مورد از آنها پستهای متمایز هستند. این نشان میدهد که لایهی بازیابی، لیستهای بازاریابی محتوایی (Listicles) را بر تحلیلگران شناختهشده صنعت ترجیح میدهد. جالب است که برخی از این ارجاعات مربوط به نسخههای استونیایی (Estonian-locale) پستها بود.
یک قالب، سه حکم متناقض
برای تست سازگاری این مزارع، پژوهشگران صفحه «نرمافزار تخمین پروژه» را در هر سه برند بررسی کردند. هر سه صفحه رتبهبندی خود را در قالب JSON-LD برای خوانش آسان ماشین ذکر کرده بودند. با این حال، نتایج متناقض بود: برند برنده در Gitnux اصلاً در لیست ۵تای اول Worldmetrics ظاهر نشد.
علاوه بر این، انتساب «کارشناس» مصنوعی به نظر میرسید:
- Worldmetrics اعتبار را به Kathryn Blake, Alexander Schmidt و Victoria Marsh نسبت داد.
- Gitnux اعتبار را به Diana Reeves, Helena Kowalczyk و Olivia Thornton نسبت داد.
- WifiTalents اعتبار را به Ryan Gallagher, Isabella Rossi و Natasha Ivanova نسبت داد.
این منجر به معرفی ۹ «کارشناس» مختلف برای یک دستهبندی واحد نرمافزاری شد. علاوه بر این، هر سه صفحه حاوی یک متغیر قالب (Template variable) رندرنشده در بخش نویسنده بودند که در دو صفحه عبارت «Within the next 26 days» و در صفحه سوم «Within the next 40 days» دیده میشد.
توهم در لایهی منبع
اتکا به این منابع بیکیفیت منجر به شکستهای مستقیم در پاسخ نهایی میشود. پژوهشگران ۱۵۰۲ صفحه خانه فروشندگان را دو بار بررسی کردند (یک بار مستقیم و یک بار از طریق پروکسی چرخان). آنها دریافتند ۱.۱٪ (۱۷ دامنه) حذف شده یا غیرقابل دسترس بودند. این شامل سایتهای بزرگی مانند nasdaq.com و solidworks.com میشد که صرفاً به درخواست خودکار پاسخ ندادند.
ده دامنه اصلاً به آدرسی ختم نشدند، از جمله:
- graphiql.com (به عنوان خانه GraphiQL معرفی شده بود)
- todo.com (برای Microsoft To Do معرفی شده بود)
- aquasecurity.io (برای Trivy معرفی شده بود)
نگرانکنندهتر از این، «توهمات تغییر مسیر» (Redirect Hallucinations) است. در یک مورد، هنگام درخواست پلتفرمهای مدیریت دادههای پژوهشی، مدل sonar به دامنه dryad.co ارجاع داد که در واقع به یک پورتال قمار آنلاین اندونزیایی با عنوان «BIGSLOT288 | Portal Game Online» تغییر مسیر میداد. در موردی دیگر، درخواست ابزارهای کیفیت داده، مدل sonar-pro را به montecarlo.com هدایت کرد که به Monte-Carlo Société des Bains de Mer، یک گروه هتل و کازینوی لوکس در موناکو، تغییر مسیر میداد.
متدولوژی فنی
این مطالعه با ۷۶۰ فراخوانی از طریق OpenRouter برای اطمینان از محیطی یکسان انجام شد. پژوهشگران از لیست روزانه Tranco برای تاریخ ۱ سپتامبر ۲۰۲۶ و از Wayback Machine برای تأیید سن دامنهها استفاده کردند. آنها دریافتند که میانگین اولین ثبت دامنههای بدون رتبه در Wayback Machine سال ۲۰۲۰ است، در حالی که برای دامنههای رتبهدار این تاریخ به ۲۰۱۱ بازمیگردد. نکته قابل توجه این است که ۱۶.۶٪ از دامنههای آرشیو شده بدون رتبه، اولین بار در سال ۲۰۲۵ یا بعد از آن ثبت شدهاند، در حالی که این رقم برای دامنههای رتبهدار تنها ۱.۶٪ است.
برای دامنههای رتبهدار، میانگین رتبه Tranco برابر با ۷۱,۶۱۱ بود. ۱۰ دامنه برتر از نظر تعداد ارجاع، ۱۷.۳٪ از کل ارجاعات را تشکیل میدادند که نشان میدهد نتایج توسط یک کارتل کوچک از سایتهای مشهور تسلط نشده است. در مقابل، ویکیپدیا در کل ۷,۵۳۴ ارجاع، تنها ۳ بار ذکر شده بود.
باید اشاره کرد که perplexity/sonar و perplexity/sonar-pro لایهی بازیابی مشترکی داشتند و در ۲۸۹ مورد از ۳۸۰ دسته، لیستهای ارجاع کاملاً یکسانی (Byte-identical) بازگرداندند. مجموعهی URLهای آنها دارای ضریب جاکارد (Jaccard) ۰.۸۹۸ است. این نشان میدهد که مشکل در پشتهی (Stack) جستوجوی مشترک است، نه در سطح خاص مدل.
تحلیل: ظهور سئوی عاملمحور (Agentic SEO)
این وضعیت نشاندهنده یک تغییر بنیادین در مفروضات مربوط به مبنیسازی وب است. برای سالها تصور میشد که سایتهای پربازدید و با اعتبار بالا (مانند ویکیپدیا) بر RAG مسلط خواهند بود. در عوض، ما شاهد تولد «سئوی عاملمحور» (Agentic SEO) هستیم؛ محتوایی که نه برای خواندن انسان، بلکه برای بازیابی توسط عاملهای هوش مصنوعی ایجاد شده است.
این سایتهای مصنوعی با استفاده از عباراتی مانند «Grounding Page» و ارائه دادههای ساختاریافته JSON-LD، در واقع در حال نوشتن یک دفترچه راهنما برای هوش مصنوعی هستند تا آن را دنبال کند. این امر یک حلقه بازخورد خطرناک ایجاد میکند: مدلهای هوش مصنوعی به صفحات مصنوعی ارجاع میدهند، که این کار اعتبار ادراکشدهی آن صفحات را افزایش میدهد و در نهایت منجر به ارجاعات بیشتر میشود.
برای متخصصان فنی، این بدان معناست که RAG یک راهکار قطعی (Silver Bullet) برای حقیقت نیست. اگر لایهی بازیابی مستعد این نوع دستکاری برنامهریزی شده باشد، «مبنیسازی» صرفاً تغییری از توهم مدل به توهم منبع است. این چالش در دقت دادهها مشابه مشکلاتی است که در تخریب آمارهای رشد مقالات هوش مصنوعی مشاهده شده و نیاز به متدولوژیهای دقیقتر برای شمارش و تأیید منابع را برجسته میکند.
برای مقابله با این وضعیت، سیستمهای بازیابی احتمالاً باید از تطبیق ساده رتبه یا کلمات کلیدی فراتر رفته و بررسیهای پیشرفتهتری روی منشأ دادهها یا «گرافهای اعتماد» (Trust Graphs) پیاده کنند تا شبکههای مصنوعی را شناسایی کنند. باید منتظر ظهور پروتکلهای تأیید مخصوص هوش مصنوعی یا ادغام اثبات منشأ محتوا مبتنی بر بلاکچین (C2PA) در لایهی بازیابی باشیم تا تخصص انسانی از مزارع مبنیسازی متمایز شود.
گام بعدی شما
- اگر از Perplexity برای انتخاب ابزارهای نرمافزاری استفاده میکنید، حتماً دامنه ارجاع داده شده را بررسی کنید تا مطمئن شوید یک «مزرعه مبنیسازی» نیست.
- برای توسعهدهندگان RAG: پیادهسازی «گرافهای اعتماد» (Trust Graphs) را جایگزین تکیه بر رتبههای ساده وب کنید.
- بررسی کنید آیا محتوای وبسایت شما برای عاملهای هوش مصنوعی بهینه شده یا صرفاً برای انسانها؛ عصر Agentic SEO آغاز شده است.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو