پرش به محتوای اصلی
پرش به محتوای مقاله

۳۴.۷٪ از ارجاعات عددی Perplexity فاقد سندیت واقعی هستند

·۱۱ شهریور ۱۴۰۵۹ دقیقه مطالعه
یک‌سوم استنادهای Perplexity شامل عدد مورد استناد نیستند
یک‌سوم استنادهای Perplexity شامل عدد مورد استناد نیستند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کشف مکانیزم «نوشتن سپس ارجاع دادن» (Write-then-attribute) در Perplexity؛ برخلاف تصور رایج، مدل ابتدا پاسخ را بر اساس احتمالات تولید می‌کند و سپس لینک‌هایی را می‌جوید که احتمالاً مرتبط هستند، نه اینکه پاسخ را از دل لینک‌ها استخراج کند.

تصور کنید برای یک گزارش مالی حساس به اعداد تکیه کنید و بعد بفهمید یک‌سوم مدارک شما جعلی یا غیرقابل دسترس هستند. این دقیقاً وضعیتی است که کاربران Perplexity با آن مواجه‌اند؛ جایی که «اثبات» ارائه شده توسط موتور جست‌وجوی هوش مصنوعی، بیشتر یک ویترین است تا یک مسیر قابل پیگیری از شواهد.

طبق گزارش Haus Research که در ۲ سپتامبر ۲۰۲۶ منتشر شد، ۳۴.۷٪ از ارجاعات متصل به ادعاهای عددی در مدل‌های جست‌وجوی Perplexity عملاً بی‌فایده هستند. یافته‌ها نشان‌دهنده یک شکست سیستماتیک در «مبنی‌سازی» (Grounding) است. از میان ۱۸۲۶ ارجاعی که مدل‌های جست‌وجوی Perplexity به جملاتی حاوی یک عدد اختصاص داده بودند، بیش از یک‌سوم به صفحاتی اشاره می‌کردند که یا باز نمی‌شدند و یا حتی یک عدد از آن جمله را در خود نداشتند. اگر معیار سنجش را از «هر ارجاع» به «هر ادعا» تغییر دهیم، ۱۴.۴٪ از ۸۷۲ ادعا شکست می‌خورند.

این بحران اعتبار در حالی رخ می‌دهد که تولید بازیابی‌افزا (RAG) — سیستمی که مدل را مجبور می‌کند قبل از پاسخ، اطلاعات را از منابع خارجی بازیابی کند — به استاندارد صنعت برای کاهش توهم (Hallucination) تبدیل شده است. در حالی که صنعت تصور می‌کند افزودن یک URL به یک جمله، آن را به یک «فکت» تبدیل می‌کند، این مطالعه ثابت می‌کند که لینک اغلب از ادعا گسسته است. همان‌طور که در تحلیل قبلی ما درباره‌ی تأثیر صفحات «بهترین نرم‌افزارها» بر مبنی‌سازی مدل‌ها اشاره کردیم، این حسابرسی نشان می‌دهد که فرآیند بازیابی به‌طور مکرر به نفع حدس‌های احتمالی نادیده گرفته شده است. این پدیده در واقع بخشی از یک روند گسترده‌تر است که در آن تولید محتوای بهینه‌شده برای ماشین‌ها باعث فریب موتورهای جست‌وجوی زاینده می‌شود.

متدولوژی حسابرسی

پژوهشگران مدل‌های perplexity/sonar و perplexity/sonar-pro را با ۳۱۰ پرسش واقع‌گرایانه درباره ۲۱۰ شرکت فناوری مورد آزمایش قرار دادند. تیم بر ۱۰ قالب خاص تمرکز کرد که هر کدام نماینده حقیقتی بود که یک کاربر در دنیای واقعی جست‌وجو می‌کند:

  • تاریخ تأسیس
  • آخرین دور سرمایه‌گذاری
  • تعداد کارکنان
  • قیمت ورود
  • دفتر مرکزی
  • درآمد
  • نقض‌های امنیتی افشا شده
  • مدیرعامل فعلی
  • خرید شرکت‌های دیگر
  • توافق‌نامه سطح خدمات (SLA) نسخه‌های پولی

هر شرکت یک پرسش دریافت کرد و ۱۰۰ شرکت دومین پرسش را بر اساس قالبی متفاوت دریافت کردند. برای اطمینان از دقت، Temperature روی ۰ تنظیم شد و نتایج با GPT-4.1 (همراه با پلاگین وب) مقایسه شدند.

اجرای فنی و اعتبارسنجی

این حسابرسی بر ادعاهای «قابل بررسی» تمرکز داشت؛ یعنی جملاتی که حاوی یک عدد بودند (مبالغ پولی، درصدها، بزرگی‌ها، سال‌ها یا هر رشته‌ای از سه رقم یا بیشتر). پژوهشگران تمام URLهای منحصر‌به‌فرد ارجاع شده را استخراج کردند که برای مدل sonar به تنهایی ۲۹۱۵ مورد بود.

برای جلوگیری از خطاهای منفی (False Negatives)، یک سیستم بازیابی سه مرحله‌ای پیاده شد. اگر صفحه‌ای باز نمی‌شد، زمان انتظار (timeout) افزایش می‌یافت و سپس از طریق پروکسی‌های چرخان مجدداً تلاش می‌شد تا مطمئن شوند صفحه‌ای صرفاً به دلیل مسدود بودن آی‌پی یک مرکز داده، «مرده» ثبت نشود. این فرآیند ۱۹۲ URL را نجات داد.

مدل‌های Perplexity ادعاها را به‌صورت درون‌متنی با علامت [n] مشخص می‌کنند، که در آن n شاخص آرایه ارجاعات است. این ساختار اجازه می‌دهد ادعا شود که یک جمله دقیقاً از یک URL خاص آمده است، نه اینکه صرفاً یک کتاب‌شناسی کلی در انتهای متن باشد. پژوهشگران هر پاسخ را به جملات تقسیم کردند و برای هر نشانگر، یک جفت «ادعا-ارجاع» تولید کردند.

نقاط شکست ارجاعات

نرخ شکست به دو دسته اصلی تقسیم می‌شود: دسترسی و محتوا.

لینک‌های بسته و مرده
یک‌ششم ارجاعات به محتوای «گیت‌شده» یا پولی اشاره داشتند. در حالی که سایت‌هایی مثل PitchBook، ZoomInfo، Crunchbase و Reuters حق دریافت هزینه برای دسترسی دارند، اما پاورفوت‌نویسی که خواننده نمی‌تواند باز کند، ادعایی از منبع است که هیچ راهی برای تست آن وجود ندارد. در مجموع، ۸۴.۲٪ از پاسخ‌های مدل sonar حداقل یک URL داشتند که کاربر عادی قادر به باز کردن آن نبود.

علاوه بر این، ۱۰.۶٪ از پاسخ‌ها حاوی حداقل یک لینک کاملاً مرده بودند. اگرچه تنها ۱.۳٪ از کل URLهای ارجاع شده مرده بودند، اما این‌ها اغلب الگوی صفحات «یک‌بار مصرفی» را داشتند که در مقیاس بالا برای جذب کوئری‌های خاص ساخته شده‌اند. نمونه‌هایی از این لینک‌های مرده عبارت بودند از:

  • komo.ai/directory/<company>-offices (مثلاً sonar برای دفتر مرکزی Elastic به این لینک ارجاع داد که خطای 404 داد).
  • apollo.io/where-is/<company> (هر دو مدل برای دفتر مرکزی Reddit به این لینک ارجاع دادند که خطای 410 Gone داد).
  • temperstack.com/plans/<company> (مدل sonar-pro برای ارزان‌ترین پلن Discord به این لینک ارجاع داد که خطای 404 داد).
  • devhelm.io/sla/<company>
  • portersfiveforce.com/blogs/brief-history/<company>

صفحات شبح‌وار
در مورد جفت‌هایی که صفحه آن‌ها باز شد و خواندنی بود، ۱۶.۱٪ هیچ‌یک از اعداد ادعاشده در متن را نداشتند. پژوهشگران داده‌ها را نرمال کردند تا مثلاً ۱۸۵ میلیون دلار، 185M و 185000000 همگی یکسان شناخته شوند. حتی با این تساهل، بسیاری از ارجاعات شکست خوردند.

به عنوان مثال، وقتی درباره ارزان‌ترین پلن پولی Vercel سؤال شد، sonar پاسخ داد که «پلن رایگان Hobby صفر دلار است، بنابراین اولین سطح پولی از ۲۰ دلار در ماه شروع می‌شود» و به vercel.com/docs/plans ارجاع داد. صفحه با کد HTTP 200 باز می‌شد و نام پلن‌ها را داشت، اما رشته‌های «$20» یا «20/month» در هیچ کجای متن نبود. احتمالاً عدد درست بود، اما ارجاع، دلیلی برای آن نبود.

توهمات اجماعی و منابع کم‌دوام

مدل‌ها به‌طور مکرر برای آدرس‌های پستی و کدهای پستی به Wikipedia ارجاع می‌دادند. در موارد متعددی، مقالات ویکی‌پدیا فاقد این داده‌های آدرس دقیق بودند. برخی پاسخ‌ها حتی از عباراتی مثل «منابع متعدد ذکر می‌کنند» یا «چندین دایرکتوری تجاری لیست کرده‌اند» استفاده کردند، اما در نهایت نشانگر ارجاع را به ویکی‌پدیا متصل کردند.

مثال دیگر مربوط به مدیرعامل GitLab، بیل استیپلز (Bill Staples) بود. Sonar ادعا کرد او در ۵ دسامبر ۲۰۲۴ این سمت را پذیرفته و به صفحه تیم اجرایی خود GitLab ارجاع داد. در حالی که صفحه نام بیل استیپلز را داشت، اما تاریخ را ذکر نکرده بود. یعنی تنها نیمی از جمله واقعاً منبع داشت.

بر اساس گزارش Haus Research، بخش بزرگی از منابع مدل‌ها بر محتوای وب «یک‌بار مصرف» متکی است. در میان ۳۰۳۱ ارجاع مدل sonar که در ۹۸۹ میزبان مختلف پخش شده بودند، ۲۳.۴٪ به دامنه خود شرکت‌ها و ۲۳.۱٪ به دایرکتوری‌های B2B، تخمین‌زننده‌های درآمد یا لیست‌های لید مانند Tracxn، Clay، GetLatka، Growjo و CB Insights اشاره داشتند.

توزیع منابع
بزرگ‌ترین میزبان‌های مورد ارجاع عبارت بودند از:

  • linkedin.com: ۵.۶٪
  • en.wikipedia.org: ۴.۳٪
  • tracxn.com: ۳.۰٪

این صفحات دایرکتوری کم‌دوام‌ترین مواد در این مجموعه هستند. تنها ۶۶.۰٪ از آن‌ها باز شدند، در حالی که نرخ کلی باز شدن ارجاعات ۷۸.۷٪ بود. این صفحات از دیتابیس‌ها برای رتبه گرفتن در نتایج جست‌وجو تولید می‌شوند و اغلب بدون اطلاع قبلی، بسته یا حذف می‌شوند.

شکاف پایداری

پژوهشگران ۱۵۰۰ لینک ارجاع شده توسط sonar را در ایندکس CDX ماشین زمان (Wayback Machine) جست‌وجو کردند. از ۱۴۳۲ موردی که شناسایی شدند، ۲۵.۱٪ هرگز توسط این آرشیو ثبت نشده بودند. برای صفحات دایرکتوری و لیست لید، این عدد به ۳۹.۳٪ می‌رسد. یعنی دو مورد از هر پنج منبع، تنها تا زمانی وجود دارند که میزبان آن‌ها را فعال نگه دارد. وقتی این URLها ناپدید می‌شوند، جمله و نشانگر ارجاع در متن باقی می‌مانند، اما قابلیت بررسی ادعا از بین می‌رود.

مقایسه مدل‌ها: Sonar در برابر Sonar-Pro

برخلاف انتظار، مدل پولی (Pro) هیچ بهبودی در مبنی‌سازی (Grounding) نشان نداد. یک مطالعه آزمایشی اولیه پیشنهاد می‌کرد sonar-pro بدتر است، اما در مقیاس کامل، این شکاف از بین رفت. مدل perplexity/sonar در ۶۵.۹٪ جفت‌های عددی موفق بود (بازه اطمینان ۹۵٪ بین ۶۲.۸ تا ۶۸.۹)، در حالی که perplexity/sonar-pro در ۶۴.۷٪ موارد موفق بود (۶۱.۵ تا ۶۷.۷). هر دو مدل با نرخ‌های تقریباً یکسان ارجاع دادند و به‌طور متوسط ۹.۸ و ۹.۷ منبع برای هر پاسخ ذکر کردند.

در مقابل، GPT-4.1 با پلاگین وب رفتار متفاوتی داشت. این مدل منابع بسیار کمتری (۲ مورد در هر پاسخ) ذکر کرد و بیشتر به دامنه خود شرکت‌ها (۳۶.۴٪) تکیه داشت، در حالی که این عدد برای Perplexity ۲۳.۴٪ بود. با این حال، چون GPT-4.1 از ارجاعات درون‌متنی استفاده نمی‌کند، حسابرسی جمله-به-جمله روی آن غیرممکن است.

شکاف داوری

برای سنجش عمق شکست، از یک مدل هوش مصنوعی مجزا به‌عنوان داور استفاده شد تا بررسی کند آیا صفحات ارجاع شده واقعاً ادعاها را پشتیبانی می‌کنند یا خیر. به این مدل، ۴۰۰ جفت تصادفی از صفحات خواندنی برای هر مدل نشان داده شد.

  • بررسی قطعی (Grep): ۸۴.۶٪ از جفت‌های خواندنی sonar را تأیید کرد (صرفاً وجود یک عدد منطبق برای قبولی کافی بود).
  • داور AI: تنها ۵۰.۸٪ از ادعاهای sonar را به‌عنوان «پشتیبانی شده» تأیید کرد، ۲۴.۵٪ را «جزئی» و ۲۴.۸٪ را «بدون پشتیبانی» دانست.

وقتی این عدد با نرخ باز شدن صفحات ترکیب شود، نرخ پشتیبانی نهایی (End-to-End) به ۴۰.۰٪ می‌رسد. این اختلاف ۲۶ واحدی نشان می‌دهد که یک صفحه ممکن است حاوی یک عدد باشد، اما لزوماً از ادعای واقعی مدل پشتیبانی نکند. عدد قطعی (Grep) در واقع عدد «سخاوتمندانه» است و حتی همین عدد هم برای یک یافته پژوهشی، به اندازه کافی بد است.

پیامدهای فنی

این داده‌ها نشان می‌دهد لایه ارجاعات در جست‌وجوی AI فعلی اغلب یک «افزونه ثانویه» است. مدل لزوماً «اول بازیابی می‌کند و بعد می‌نویسد»، بلکه اغلب «اول می‌نویسد و بعد ارجاع می‌دهد».

شکست‌ها با این موضوع مرتبط است که یک حقیقت چقدر در یک جای کانونی (Canonical) نوشته شده است. تعداد کارکنان و سال‌های تأسیس در فیلدهای ساختاریافته قرار دارند و بیشتر دفعات تأیید می‌شوند. اما تاریخ شروع به کار یک مدیرعامل یا شماره پستی یک دفتر، جزئیاتی هستند که به‌طور گسترده تکرار می‌شوند اما به‌ندرت در یک نقطه معتبر واحد منتشر شده‌اند. مدل «اجماع» موجود در وب را بازتولید می‌کند و سپس به صفحه‌ای ارجاع می‌دهد که احتمالاً نام آن موجودیت را دارد، حتی اگر جزئیات دقیق را نداشته باشد.

برای متخصصان فنی، این موضوع قابلیت اعتماد به پژوهش‌های AI-driven برای داده‌های با دقت بالا را زیر سؤال می‌برد. اگر یک‌سوم شواهد وجود ندارند یا غیرقابل دسترس‌اند، «مبنی بودن» خروجی تنها یک توهم است. این مطالعه نتیجه می‌گیرد که در یک‌سوم ارجاعات بررسی شده، چیزی که به‌عنوان دلیل ارائه شده، در عمل به‌عنوان دلیل عمل نمی‌کند. برای مقابله با این چالش، برخی پیشنهاد می‌کنند که استفاده از دفاتر شواهد (Evidence Ledgers) می‌تواند راهکاری برای صادقانه کردن تحلیل‌های AI و توقف توهمات باشد.

محدوده و محدودیت‌ها

این snapshot در ۲ سپتامبر ۲۰۲۶ گرفته شده و مربوط به پرسش‌های انگلیسی درباره شرکت‌های فناوری است. پژوهشگران اشاره کردند که صفحه گیت‌شده لزوماً «اشتباه» نیست؛ مثلاً یک مشترک PitchBook ممکن است ادعا را تأیید کند. اما این حسابرسی بر اساس آنچه یک کاربر بدون حساب کاربری می‌تواند تأیید کند، اندازه‌گیری شده است.

علاوه بر این، پژوهشگران HTMLها را بدون اجرای JavaScript دریافت کردند و پاسخ‌ها از طریق OpenRouter گرفته شدند، نه محصول مصرف‌کننده Perplexity. همچنین ۲۱۰ شرکت به‌عنوان شرکت‌های شناخته‌شده انتخاب شدند، نه از یک جامعه آماری تعریف شده. در نهایت، تأکید شد که یک ادعا می‌تواند درست باشد حتی اگر ارجاع آن غلط باشد؛ آن‌ها «کارکرد اثبات» را می‌سنجند، نه «صحت گزاره» را.

منتظر باشید تا ببینید آزمایشگاه‌های AI متمرکز بر جست‌وجو چگونه به این «شکاف‌های منشأ» پاسخ می‌دهند، به‌ویژه اینکه آیا به سمت حلقه‌های تأیید سخت‌گیرانه‌تری می‌روند که از انتشار ارجاع جلوگیری کند مگر اینکه عدد دقیق در تکه متن بازیابی شده شناسایی شود.

گام بعدی شما

  • در هر پاسخ Perplexity، ارجاعات عددی را به‌صورت دستی باز کنید و تطابق دقیق عدد را با متن منبع چک کنید.
  • برای داده‌های حساس مالی یا فنی، به‌جای تکیه بر موتورهای جست‌وجوی AI، مستقیماً از دامنه‌های رسمی شرکت‌ها یا پایگاه‌های داده معتبر استفاده کنید.
  • در صورت استفاده از RAG در پروژه‌های خود، لایه‌ای برای اعتبارسنجی متقاطع (Cross-verification) بین تکه متن بازیابی شده و پاسخ نهایی اضافه کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این گزارش اعتبار بنیادین سیستم‌های RAG را به چالش می‌کشد و ثابت می‌کند که وجود لینک لزوماً به معنای مبنی‌سازی (Grounding) نیست. تکیه بر این ابزارها برای داده‌های با دقت بالا (High-precision) بدون بازبینی انسانی، ریسک خطای سیستماتیک را افزایش می‌دهد.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که از APIهای Perplexity برای ساخت ابزارهای تحلیل داده استفاده می‌کنند، این خبر یک هشدار جدی است: هرگز ارجاعات عددی این مدل را بدون لایه اعتبارسنجی مستقل به کاربر نهایی ارائه ندهید.

·نگاه ما
تحریریه دات‌هوش

این یافته‌ها نشان می‌دهد که لایه ارجاعات در مدل‌های جست‌وجوگر، بیشتر نقش یک «تزئین روان‌شناختی» برای جلب اعتماد کاربر را دارد تا یک ابزار فنی برای شفافیت. مدل‌ها در واقع از استراتژی «تولید بر اساس اجماع» استفاده می‌کنند و ارجاعات را صرفاً برای توجیه خروجی اضافه می‌کنند، نه برای استخراج آن. این موضوع ضرورت توسعه سیستم‌های Verification-first را بیش از پیش نمایان می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.