پرش به محتوای اصلی
پرش به محتوای مقاله

Perplexity در ثباتِ ارجاعات، دو برابرِ ChatGPT عمل می‌کند

·۷ مرداد ۱۴۰۵۶ دقیقه مطالعه۱ بازدید
راهنما
سنجش چیزی که هر بار پاسخ متفاوتی می‌دهد، چگونه ممکن است؟
سنجش چیزی که هر بار پاسخ متفاوتی می‌دهد، چگونه ممکن است؟
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کشف مفهومی به نام «کف نویز» در ثبات ارجاعات؛ اثبات اینکه Perplexity در بازتولید منابع ارجاعی، پایداری دو برابری نسبت به ChatGPT دارد.

اگر برای استخراج منابع معتبر از هوش مصنوعی استفاده می‌کنید، احتمالاً متوجه شده‌اید که مدل‌ها در پاسخ به یک سؤال تکراری، لزوماً یک جواب ثابت نمی‌دهند. این نوسان در واقع یک «کف نویز» (Noise Floor) سیستمی است که می‌تواند تمام نتایج تست‌های ساده‌ی «درست/غلط» شما را باطل کند. اندازه‌گیری میزان دیده‌شدن (Visibility) در AI به‌شدت دشوار است زیرا مدل‌های زبانی بزرگ (LLM) به ندرت دو بار پاسخ یکسانی می‌دهند.

طبق گزارشی که در ۲۹ جولای ۲۰۲۶ توسط Greater Than Services منتشر شد، دو‌سوم از منابع ذکر‌شده توسط ChatGPT حتی زمانی که دقیقاً همان سؤال دوباره پرسیده می‌شود، تغییر می‌کنند. این یافته نشان می‌دهد که عدم قطعیت (Non-determinism) در جست‌وجوی AI تنها یک نقص جزئی نیست، بلکه یک نویز سیستمی است که اعتبار تست‌های ساده را از بین می‌برد. برای مثال، اگر از یک مدل بپرسید «بهترین شرکت حقوقی در نیویورک کجاست»، ممکن است اکنون یک سری کسب‌وکار را نام ببرد و یک ساعت بعد، مجموعه‌ای کاملاً متفاوت را پیشنهاد دهد. این بدان معناست که روش ساده‌ی نمونه‌برداری یک‌باره از یک توزیع و تبدیل آن به یک «فکت»، عملاً بی‌ارزش است. در واقع شما در حال اندازه‌گیری دیده‌شدن نیستید، بلکه صرفاً دارید یک نمونه از یک توزیع احتمالی را برمی‌دارید و به‌اشتباه آن را «واقعیت» می‌نامید. این چالش در نمایش منابع، با شکاف گسترده‌ای که بین نتایج گوگل و موتورهای پاسخ‌دهنده AI مشاهده می‌شود هم‌سو است و نشان می‌دهد که معیارهای سنتی دیده‌شدن دیگر کاربرد ندارند.

برای درک بهتر این موضوع، تصور کنید مدل زبانی بزرگ (LLM) — شبیه کتابخانه‌داری است که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — اما هر بار که از او می‌پرسید «بهترین کتاب حقوق چیست»، یک لیست متفاوت می‌دهد، هرچند کتابخانه همان است.

طراحی آزمایش و کنترل

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، پیش‌بینی‌پذیری در خروجی مدل‌ها همواره یکی از چالش‌های اصلی است. در این مطالعه، پژوهشگران برای حل این مشکل و جداسازی تفاوت‌های واقعی مدل‌ها از نویزهای تصادفی، یک مکانیسم «گروه کنترل» ایجاد کردند. پژوهشگر چهار دستیار هوشمند با قابلیت فعال‌شده‌ی جست‌وجوی وب را با یکدیگر مقایسه کرد: GPT-4o، Claude Haiku 4.5، Gemini 2.5 Flash و Perplexity Sonar.

تمرکز این تست بر یک حوزه خاص (Vertical) با استفاده از ۱۰ سؤال با «قصد خرید» (Buyer-intent) بود. نمونه‌هایی از این پرس‌وجوها شامل «بهترین شرکت حقوقی آسیب‌های شخصی در شهر نیویورک؟» و «برترین وکلای مهاجرت در بمبئی؟» بود.

برای هر پاسخ، دو نقطه داده‌ی مشخص ثبت شد: کدام کسب‌وکارها نام برده شده‌اند و کدام URLها مورد استناد قرار گرفته‌اند. برای تضمین دقت، منابع ذکر‌شده به‌جای استخراج از متن پاسخ (Scraping)، مستقیماً از متادیتای ساختاریافته‌ی استنادی هر API دریافت شدند. این ساختار به پژوهشگر اجازه داد تشخیص دهد که آیا مدل‌ها با یکدیگر اختلاف نظر دارند یا صرفاً با خودشان در تضاد هستند.

متدولوژی ثبات

پژوهشگران برای اندازه‌گیری میزان اشتراک دامنه‌ها از معیار «شباهت جاکارد» (Jaccard Similarity) استفاده کردند که در واقع اندازه‌گیری «اشتراک بر union» است. آن‌ها هر سؤال با قصد خرید را ۳ بار (n=3) برای هر دستیار اجرا کردند تا دو شاخص متمایز را محاسبه کنند:

  • ثبات متقاطع (Cross-consistency): میزان هم‌پوشانی دو دستیار مختلف در پاسخ به یک سؤال یکسان. این مقدار به عنوان میانگین جاکارد زوجی بین ۶ جفت دستیار ممکن محاسبه شد.
  • ثبات داخلی (Self-consistency): میزان هم‌پوشانی یک دستیار با خودش در هنگام تکرار پرسش. این مقدار به صورت میانگین جاکارد زوجی در سه اجرای یک دستیار واحد محاسبه گردید.

برای اجرای این فرآیند، مطالعه از یک تابع خاص برای محاسبه شاخص جاکارد استفاده کرد:
function jaccard(setA, setB) { const a = new Set(setA); const b = new Set(setB); if (a.size === 0 && b.size === 0) return 1; let intersection = 0; for (const x of a) if (b.has(x)) intersection++; const union = a.size + b.size - intersection; return intersection / union; }.

برای اطمینان از پاکیزگی داده‌ها، دو جزئیات نرمال‌سازی حیاتی اعمال شد:

۱. نرمال‌سازی دامنه‌ی ثبت‌شدنی (Registrable Domain Normalization): تمام URLها به دامنه اصلی ثبت‌شده تبدیل شدند. این کار باعث شد تا مثلاً www.example.com/page-a و example.com/page-b به عنوان منابع متفاوت شمرده نشوند، زیرا در غیر این صورت، پژوهش به جای اندازه‌گیری هم‌پوشانی منابع، در حال اندازه‌گیری فرمت URLها بود.
۲. فیلترینگ متادیتای استنادی: تنها دامنه‌هایی که در متادیتای رسمی استنادِ API ظاهر می‌شدند، شمارش شدند. دامنه‌هایی که به‌طور گذرا در متن تولیدشده ذکر شده بودند، برای حفظ یک متدولوژی قابل دفاع، نادیده گرفته شدند.

اندازه‌گیری چیزی که هر بار پاسخ متفاوتی می‌دهد

شکاف پایداری

نتایج یک شکاف عمیق در قابلیت اطمینان مدل‌ها را نشان داد. هم‌پوشانی بین دستیارهای مختلف (Cross-assistant overlap) تنها حدود ۷٪ بود؛ این یعنی مدل‌های مختلف تقریباً هرگز منابع یکسانی را ذکر نمی‌کنند. با این حال، ثبات داخلی به‌طور متوسط ۵۱٪ تخمین زده شد؛ این موضوع ثابت می‌کند که یک مدل تقریباً ۷.۵ برابر بیشتر از رقبایش با خودش سازگار است و تفاوت بین مدل‌ها یک سیگنال واقعی است، نه صرفاً نویز تصادفی.

اما امتیازات پایداری فردی، شکاف عملکردی عظیمی را آشکار کرد. طبق گزارش Greater Than Services، میزان پایداری منابع ذکر‌شده در دو پرسش یکسان به شرح زیر بود:

  • Perplexity: حدود ۷۲٪ تکرار منابع
  • Claude: حدود ۵۴٪ تکرار منابع
  • Gemini: حدود ۴۲٪ تکرار منابع
  • ChatGPT: حدود ۳۲٪ تکرار منابع

این اعداد ثابت می‌کند که Perplexity بیش از دو برابر باثبات‌تر از ChatGPT است. برای توسعه‌دهنده‌ای که یک سیستم مبتنی بر بازیابی (Retrieval-dependent) می‌سازد، این بدان معناست که انتخاب ارائه‌دهنده (Provider) می‌تواند پیش از نوشتن حتی یک خط کد سفارشی، بازتولیدپذیری سیستم را تا دو برابر تغییر دهد.

مهندسی در مواجهه با عدم قطعیت

این مطالعه پیشنهاد می‌کند که هر کسی که در حال تست ویژگی‌های مبتنی بر LLM است، باید از «تأییدات تک‌گام» (Single-run assertions) دست بردارد. غریزه متداول تست در برنامه‌نویسی — یعنی ورودی یکسان و تأیید خروجی — در دنیای مدل‌های زبانی کاربردی ندارد.

در عوض، توسعه‌دهندگان باید این چهار اصل را به کار گیرند:

  • گزارش توزیع‌ها (Report Distributions): تست‌ها را $n$ بار اجرا کنید. در این مطالعه، $n=3$ برای جداسازی سیگنال از نویز کافی بود، هرچند برای اثرات کوچک‌تر به دفعات اجرای بیشتری نیاز است. نتایج را با افزایش $n$ بررسی کنید تا ببینید آیا عدد نهایی تغییر می‌کند یا خیر.
  • اندازه‌گیری کف نویز (Measure the Noise Floor): ثبات داخلی را صریحاً محاسبه کنید. هر تفاوت ادعاشده بین مدل A و مدل B برای اینکه معنادار باشد، باید از این کف نویز عبور کند. اگر ثبات داخلی یک مدل ۳۲٪ است، تفاوت ۱۰ درصدی بین دو مدل صرفاً نویز محسوب می‌شود.
  • تأیید بر اساس ویژگی‌ها (Assert on Properties): از تطبیق دقیق رشته‌های متنی (Exact string matches) فاصله بگیرید. تستی که بررسی می‌کند آیا پاسخ «حداقل یک منبع از لیست مجاز را ذکر کرده است یا خیر»، در برابر عدم قطعیت مقاوم است، در حالی که تستی با عنوان «پاسخ برابر با این رشته باشد»، شکست می‌خورد.
  • تثبیت متغیرها (Pin Variables): نسخه مدل، Temperature (دما)، منطقه جغرافیایی و وضعیت جست‌وجوی وب را قفل کنید. پژوهشگر اشاره کرد که به‌روزرسانی مدل توسط ارائه‌دهنده در میانه مطالعه می‌تواند بدون شناسایی، تمام داده‌ها را باطل کند.

محدوده و محدودیت‌ها

باید توجه داشت که این یافته‌ها تصویری لحظه‌ای از جولای ۲۰۲۶ در یک حوزه خاص هستند. رفتار بازیابی با به‌روزرسانی‌های مکرر مدل تغییر می‌کند. رقم ۳۲٪ برای ChatGPT اندازه‌گیری یک بازه زمانی خاص است، نه یک قانون ثابت طبیعت.

علاوه بر این، در حالی که $n=3$ برای اثبات اینکه ثبات داخلی بیشتر از ثبات متقاطع است کافی بود، اما برای رتبه‌بندی قطعی مدل‌ها کفایت نمی‌کرد. تفاوت بین ۵۴٪ کلود و ۴۲٪ جمینای ممکن است با نمونه‌برداری بیشتر جابه‌جا شود؛ پژوهشگر رتبه‌بندی دقیق این دو را بدون مجموعه‌ای بزرگتر از داده‌ها (مانند $n=20$) تضمین نمی‌کند.

این کشف، معیار سنجش قابلیت اطمینان در جست‌وجوی AI را تغییر می‌دهد. توسعه‌دهندگان باید از «مجموعه‌های طلایی» (Golden Sets) از پاسخ‌های ایستا فاصله بگیرند و به سمت اعتبارسنجی احتمالی (Probabilistic Validation) حرکت کنند. واریانس در اینجا یک باگ برای رفع نیست، بلکه خاصیتی از معماری است که باید مدیریت شود.

اگر در حال ساخت یک اپلیکیشن مبتنی بر RAG هستید، اکنون باید ثبات داخلی ارائه‌دهنده منتخب خود را به عنوان خط پایه (Baseline) اندازه بگیرید تا متوجه شوید آیا واریانس خروجی شما ناشی از پرامپت‌های شماست یا مدل زیرساختی.

گام بعدی شما

  • اگر از RAG استفاده می‌کنید، ثبات داخلی (Self-consistency) ارائه‌دهنده‌ی فعلی خود را با اجرای تکراری ۱۰ پرسش کلیدی اندازه بگیرید.
  • استراتژی تست خود را از تطبیق دقیق متنی به تأیید ویژگی‌های پاسخ (Property-based assertion) تغییر دهید.
  • در تنظیمات API، مقدار Temperature را برای کاهش نوسانات خروجی در پایین‌ترین سطح ممکن قرار دهید.

اما اثر این نوسانات بر هزینه‌های استنتاج در مقیاس بالا حتی پیچیده‌تر است — به تحلیل ما درباره‌ی بهینه‌سازی هزینه‌های GPU مراجعه کنید.

چرا این موضوع مهم است؟

این مطالعه با تکیه بر متدولوژی Jaccard Similarity، استاندارد جدیدی برای سنجش اعتبار مدل‌های جست‌وجو ارائه می‌دهد. توسعه‌دهندگان اکنون می‌دانند که تفاوت عملکرد بین دو مدل ممکن است صرفاً نویز آماری باشد، نه یک برتری فنی واقعی.

تأثیر برای ایران

برای توسعه‌دهندگانی که با APIهای خارجی سیستم‌های RAG می‌سازند، این داده‌ها معیار انتخاب مدل را بر اساس «پایداری» تغییر می‌دهد تا از نوسانات غیرقابل پیش‌بینی در محیط‌های عملیاتی ایرانی جلوگیری شود.

·نگاه ما
تحریریه دات‌هوش

تکیه بر پاسخ‌های ایستا در ارزیابی LLMها یک خطای متدولوژیک است. این نتایج نشان می‌دهد که «قابلیت اطمینان» در جست‌وجوی AI نه یک ویژگی باینری، بلکه یک طیف آماری است؛ بنابراین معیار موفقیت یک سیستم RAG دیگر «صحیح بودن پاسخ» نیست، بلکه «پایداری توزیع پاسخ‌ها» است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.