پرش به محتوای اصلی
پرش به محتوای مقاله

دقت ۹۵ درصدی You.com در بازیابی حقایق؛ ضربه به ابزارهای جست‌وجوی بسته

·۱۱ شهریور ۱۴۰۵۴ دقیقه مطالعه۱ بازدید
You.com به ۹۵.۱۷٪ دقت در پاسخ‌دهی به پرسش‌های ساده رسید
You.com به ۹۵.۱۷٪ دقت در پاسخ‌دهی به پرسش‌های ساده رسید
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی متد استخراج Verbatim (عین عبارت) که به‌جای خلاصه کردن، دقیقاً قطعات متنی پاسخ را جدا می‌کند و نرخ صحت را در SimpleQA به بالای ۹۵٪ می‌رساند.

اگر برای برنامه‌های خود از ابزارهای جست‌وجوی داخلی مدل‌های زبانی استفاده می‌کنید، احتمالاً با توهمات عددی و هزینه‌های پیش‌بینی‌ناپذیر دست‌وپنجه نرم کرده‌اید. حالا You.com با معرفی حالت Highlights، سقف جدیدی برای دقت بازیابی اطلاعات در دنیای واقعی تعریف کرده است. در حالی که هوش مصنوعی متکی به وب مدت‌هاست با مسئله دقت دست‌وپنجه نرم می‌کند، دستیابی به امتیاز دقت ۹۵.۱۷٪ در بنچ‌مارک SimpleQA، اکنون یک استاندارد جدید برای کارایی در این حوزه ایجاد کرده است.

طبق اعلام این شرکت، در ۱ سپتامبر ۲۰۲۶ حالت Highlights (برجسته‌سازی) معرفی شد؛ یک متد استخراج تخصصی برای API جست‌وجوی وب که به‌جای دریافت کل صفحه یا تکه‌های پراکنده، دقیقاً عبارات حاوی حقیقت را از دل وب‌سایت‌ها بیرون می‌کشد تا مدل زبانی بتواند پاسخ‌های دقیق‌تری ارائه دهد.

زمینه و پیاده‌سازی

این قابلیت اکنون از طریق پارامتر extraction_mode در API فعال است و با همان قیمت ۵ دلار به ازای هر هزار درخواست (CPM) که برای سرویس‌های موجود پرداخت می‌شد، ارائه می‌گردد.

بسیاری از ابزارهای جست‌وجوی AI در حال حاضر به تکه‌های متنی کوتاه و متمرکز بر کلمات کلیدی (Snippets) یا تخلیه کامل محتوای صفحه (Full-page dumps) متکی هستند. این رویکرد اغلب مدل پاسخ‌دهنده را مجبور می‌کند تا در میان حجم زیادی از نویزها جست‌وجو کند یا ممکن است باعث شود اعداد و ارقام حیاتی نادیده گرفته شوند. به‌طور پیش‌فرض، API جست‌وجوی وب یک آرایه از snippets شامل قطعات متنی کوتاه و کلمه-محور را برمی‌گرداند. اما با تنظیم حالت روی highlights، این موارد با یک آرایه به نام contents.highlights جایگزین می‌شوند که حاوی عبارات دقیقی است که مستقیماً به پرسش کاربر پاسخ می‌دهند. این رویکرد در کنار ابزارهای مدیریت دانش، مانند پلتفرم Glasp که امکان اتصال حافظه شخصی به مدل‌هایی چون Claude را فراهم می‌کند، می‌تواند اکوسیستم جامع‌تری از بازیابی اطلاعات دقیق را برای کاربران ایجاد کند.

جزئیات فنی

به گفته این شرکت، فرآیند استخراج برای هر درخواست به‌صورت مجزا اجرا می‌شود و برای هر پرسش، یک بررسی تازه روی صفحه وب صورت می‌گیرد. سازوکار این سیستم بر چهار محور استوار است:

  • استخراج عین عبارت (Verbatim Extraction): یک مدل تخصصی، بازه‌های متنی را که پاسخ پرسش هستند شناسایی کرده و آن‌ها را دقیقاً همان‌طور که در وب‌سایت ظاهر شده‌اند — با حفظ دقیق اعداد، تاریخ‌ها و ارقام — بازمی‌گرداند.
  • حفظ ساختار: جداول با سرتیترهای کامل و دست‌نخورده بازگردانده می‌شوند و بلوک‌های کد فرمت اصلی خود را حفظ می‌کنند.
  • ادغام هوشمند: اگر چندین جمله از یک بخش یکسان هر دو برای پاسخ ضروری باشند، این جملات در یک قطعه واحد ادغام می‌شوند تا پیوستگی متن حفظ شود.
  • رتبه‌بندی: قطعات متنی کاندید رتبه‌بندی شده و نتایجی که بالاترین رتبه را دارند، در اولویت اول بازگردانده می‌شوند.

عملکرد و بنچ‌مارک‌ها

در تست‌های داخلی، حالت Highlights در جست‌وجوی تک-فکت (Single-fact lookups) از سایر حالت‌ها پیشی گرفت:

  • SimpleQA: دقت ۹۵.۱۷٪ (با تأخیر p50 معادل ۶۹۵ میلی‌ثانیه).
  • RetrievalQA: دقت ۶۶.۹۳٪.
  • FRAMES: دقت ۸۲.۰۴٪ (که اندکی کمتر از استخراج کامل صفحه با دقت ۸۲.۷۷٪ بود).

شرکت You.com توضیح داد که شکاف ۰.۷۳ واحدی در بنچ‌مارک استدلال چندمرحله‌ای (Multi-hop reasoning) FRAMES، در محدوده نوسانات عادی اجرای این تست قرار دارد و قابل چشم‌پوشی است.

در مقایسه با رقبا در آزمون SimpleQA، You.com گزارش داد که اگرچه Exa (در حالت صفحه کامل) با ۹۵.۴۷٪ و Parallel (در حالت پیشرفته) با ۹۵.۳۳٪ امتیازات اندکی بالاتر کسب کردند، اما از تأخیر (Latency) بسیار بیشتری رنج می‌بردند و ترتیباً به ۱۳۳۷ و ۲۰۹۸ میلی‌ثانیه رسیدند. این شرکت تأکید کرد که برای این مقایسه، از بهینه‌ترین پیکربندی هر یک از رقبا استفاده کرده است.

مزیت هزینه‌ای

یک ارزیابی مستقل توسط Braintrust، ابزار You.com را در مقابل ابزارهای جست‌وجوی یکپارچه در APIهای OpenAI و Anthropic در قالب ۱,۳۲۹ سؤال مورد آزمایش قرار داد. نتایج نشان‌دهنده یک برتری مالی واضح برای رویکرد «جداسازی» (Unbundled) بود.

با استفاده از مدل Claude Sonnet 5، هزینه هر سؤال از ۰.۱۱۴۸ دلار (در جست‌وجوی داخلی) به ۰.۰۷۴۷ دلار با استفاده از Highlights کاهش یافت که به معنای کاهش ۳۵ درصدی هزینه‌هاست. همچنین دقت از ۷۸.۷۸٪ به ۷۹.۲۳٪ افزایش یافت و فرآیند ۱.۲۶ ثانیه سریع‌تر شد. برای مدل GPT-5.6 Terra، هزینه‌ها ۱۱٪ کاهش یافت (از ۰.۰۴۶۷ به ۰.۰۴۱۷ دلار) در حالی که دقت ۳.۶۶ واحد افزایش یافت.

You.com اشاره کرد که اگرچه هزینه هر سؤال در مقایسه با Snippets حدود ۱۱٪ افزایش می‌یابد (زیرا متن بیشتری به مدل ارسال می‌شود)، اما هزینه به‌ازای هر «پاسخ صحیح» حدود ۵٪ کمتر است. برای مدل‌های Claude و GPT، هزینه به‌ازای هر پاسخ صحیح به ترتیب ۳۵٪ و ۱۵٪ کاهش یافت.

شکاف مشاهده‌پذیری (Observability)

شرکت You.com استدلال می‌کند که ابزارهای جست‌وجوی داخلی OpenAI و Anthropic مانند «جعبه‌های سیاه» هستند. این ابزارها صفحاتی را که به آن‌ها استناد شده نشان می‌دهند، اما عبارات دقیقی را که مدل واقعاً خوانده است پنهان می‌کنند. این موضوع دیباگ کردن علت توهمات عددی مدل را غیرممکن می‌کند.

در یکی از تست‌های Braintrust درباره بازیکن تنیس، کارلوس آلکاراز، پرسیده شد که او در مجموع دو تورنمنت، چند گیم سرویس را واگذار کرده است. ردپای (Trace) You.com دقیقاً نشان داد که مدل اعداد ۲۴ و ۲۲ را از کجا پیدا کرده تا به مجموع درست ۴۶ برسد. در مقابل، اجراهای شکست‌خورده در سیستم‌های دیگر هرگز عبارت پشتیبان عدد ۲۴ را نمایش ندادند، برای هر دو مقدار از عدد ۲۲ استفاده کردند و پاسخ را ۴۴ دادند. این موضوع ثابت کرد که خطا در مرحله بازیابی (Retrieval) رخ داده است، نه در محاسبات ریاضی.

توازن در استفاده (Trade-offs)

برای توسعه‌دهندگان، بهای این دقت، تأخیر است. Highlights حدود ۱۶۰ میلی‌ثانیه به زمان پاسخ نسبت به Snippets استاندارد اضافه می‌کند. اگر بودجه زمانی سخت‌گیرانه‌ای برای پرسش و پاسخ‌های ساده دارید، Snippets همچنان گزینه بهتری هستند.

برای صفحاتی که سریع‌تر از به‌روزرسانی ایندکس تغییر می‌کنند، حالت extraction_mode: "full_page" توصیه می‌شود، زیرا داده‌ها را به‌صورت زنده دریافت می‌کند و به جای حافظه پنهان (Cache) از وب استفاده می‌کند. این حالت به‌ویژه برای سؤالات چندمرحله‌ای سبک FRAMES که به بافت (Context) گسترده‌تری نسبت به عبارات محدود نیاز دارند، مفید است.

حساب‌های جدید ۱۰۰ دلار اعتبار دریافت می‌کنند و ابزارهای مورد استفاده در این بنچ‌مارک‌ها به‌صورت عمومی در دسترس است. این تغییر به سمت جست‌وجوی جداسازی‌شده و مشاهده‌پذیر، به توسعه‌دهندگان اجازه می‌دهد مدل‌های خود را تعویض کنند در حالی که یک خط لوله داده‌ای با دقت بالا و ثابت را حفظ نمایند.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، از اعتبار ۱۰۰ دلاری حساب‌های جدید You.com برای تست جایگزینی جست‌وجوی داخلی با API Highlights استفاده کنید.
  • در پروژه‌هایی که دقت عددی حیاتی است، خروجی‌های contents.highlights را برای دیباگ کردن توهمات مدل بررسی کنید.
  • برای کاهش هزینه‌های استنتاج در مقیاس بالا، مدل‌های ارزان‌تر را با یک لایه بازیابی دقیق‌تر (مانند این ابزار) ترکیب کنید.

اما تأثیر این رویکرد بر آینده مدل‌های استدلالی حتی عمیق‌تر است — به بررسی ما درباره‌ی مدل‌های Reasoning مراجعه کنید.

چرا این موضوع مهم است؟

این پیشرفت با تکیه بر اعتبار بنچمارک SimpleQA نشان می‌دهد که دقت در هوش مصنوعی زاینده بیش از آنکه به اندازه مدل وابسته باشد، به کیفیت داده‌های ورودی بستگی دارد. کاهش ۳۵ درصدی هزینه‌ها برای شرکت‌های مقیاس‌پذیر، مدل اقتصادی استفاده از AI را تغییر می‌دهد.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم توسعه‌دهندگان ایرانی به این سرویس دشوار است، اما استفاده از مدل‌های واسط برای پیاده‌سازی لایه استخراج مشابه، می‌تواند هزینه‌های استنتاج را برای استارتاپ‌های داخلی کاهش دهد.

·نگاه ما
تحریریه دات‌هوش

جدا کردن لایه بازیابی داده از لایه استنتاج مدل، پایان عصر اعتماد کورکورانه به ابزارهای All-in-one است. این رویکرد به توسعه‌دهندگان اجازه می‌دهد بدون تغییر مدل، لوله انتقال داده‌های خود را بهینه کنند و مهم‌تر از آن، مسیر رسیدن مدل به پاسخ را قابل ردیابی کنند. در واقع شفافیت در بازیابی، تنها راه درمان قطعی توهمات در کاربردهای تجاری است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.