اگر برای برنامههای خود از ابزارهای جستوجوی داخلی مدلهای زبانی استفاده میکنید، احتمالاً با توهمات عددی و هزینههای پیشبینیناپذیر دستوپنجه نرم کردهاید. حالا You.com با معرفی حالت Highlights، سقف جدیدی برای دقت بازیابی اطلاعات در دنیای واقعی تعریف کرده است. در حالی که هوش مصنوعی متکی به وب مدتهاست با مسئله دقت دستوپنجه نرم میکند، دستیابی به امتیاز دقت ۹۵.۱۷٪ در بنچمارک SimpleQA، اکنون یک استاندارد جدید برای کارایی در این حوزه ایجاد کرده است.
طبق اعلام این شرکت، در ۱ سپتامبر ۲۰۲۶ حالت Highlights (برجستهسازی) معرفی شد؛ یک متد استخراج تخصصی برای API جستوجوی وب که بهجای دریافت کل صفحه یا تکههای پراکنده، دقیقاً عبارات حاوی حقیقت را از دل وبسایتها بیرون میکشد تا مدل زبانی بتواند پاسخهای دقیقتری ارائه دهد.
زمینه و پیادهسازی
این قابلیت اکنون از طریق پارامتر extraction_mode در API فعال است و با همان قیمت ۵ دلار به ازای هر هزار درخواست (CPM) که برای سرویسهای موجود پرداخت میشد، ارائه میگردد.
بسیاری از ابزارهای جستوجوی AI در حال حاضر به تکههای متنی کوتاه و متمرکز بر کلمات کلیدی (Snippets) یا تخلیه کامل محتوای صفحه (Full-page dumps) متکی هستند. این رویکرد اغلب مدل پاسخدهنده را مجبور میکند تا در میان حجم زیادی از نویزها جستوجو کند یا ممکن است باعث شود اعداد و ارقام حیاتی نادیده گرفته شوند. بهطور پیشفرض، API جستوجوی وب یک آرایه از snippets شامل قطعات متنی کوتاه و کلمه-محور را برمیگرداند. اما با تنظیم حالت روی highlights، این موارد با یک آرایه به نام contents.highlights جایگزین میشوند که حاوی عبارات دقیقی است که مستقیماً به پرسش کاربر پاسخ میدهند. این رویکرد در کنار ابزارهای مدیریت دانش، مانند پلتفرم Glasp که امکان اتصال حافظه شخصی به مدلهایی چون Claude را فراهم میکند، میتواند اکوسیستم جامعتری از بازیابی اطلاعات دقیق را برای کاربران ایجاد کند.
جزئیات فنی
به گفته این شرکت، فرآیند استخراج برای هر درخواست بهصورت مجزا اجرا میشود و برای هر پرسش، یک بررسی تازه روی صفحه وب صورت میگیرد. سازوکار این سیستم بر چهار محور استوار است:
- استخراج عین عبارت (Verbatim Extraction): یک مدل تخصصی، بازههای متنی را که پاسخ پرسش هستند شناسایی کرده و آنها را دقیقاً همانطور که در وبسایت ظاهر شدهاند — با حفظ دقیق اعداد، تاریخها و ارقام — بازمیگرداند.
- حفظ ساختار: جداول با سرتیترهای کامل و دستنخورده بازگردانده میشوند و بلوکهای کد فرمت اصلی خود را حفظ میکنند.
- ادغام هوشمند: اگر چندین جمله از یک بخش یکسان هر دو برای پاسخ ضروری باشند، این جملات در یک قطعه واحد ادغام میشوند تا پیوستگی متن حفظ شود.
- رتبهبندی: قطعات متنی کاندید رتبهبندی شده و نتایجی که بالاترین رتبه را دارند، در اولویت اول بازگردانده میشوند.
عملکرد و بنچمارکها
در تستهای داخلی، حالت Highlights در جستوجوی تک-فکت (Single-fact lookups) از سایر حالتها پیشی گرفت:
- SimpleQA: دقت ۹۵.۱۷٪ (با تأخیر p50 معادل ۶۹۵ میلیثانیه).
- RetrievalQA: دقت ۶۶.۹۳٪.
- FRAMES: دقت ۸۲.۰۴٪ (که اندکی کمتر از استخراج کامل صفحه با دقت ۸۲.۷۷٪ بود).
شرکت You.com توضیح داد که شکاف ۰.۷۳ واحدی در بنچمارک استدلال چندمرحلهای (Multi-hop reasoning) FRAMES، در محدوده نوسانات عادی اجرای این تست قرار دارد و قابل چشمپوشی است.
در مقایسه با رقبا در آزمون SimpleQA، You.com گزارش داد که اگرچه Exa (در حالت صفحه کامل) با ۹۵.۴۷٪ و Parallel (در حالت پیشرفته) با ۹۵.۳۳٪ امتیازات اندکی بالاتر کسب کردند، اما از تأخیر (Latency) بسیار بیشتری رنج میبردند و ترتیباً به ۱۳۳۷ و ۲۰۹۸ میلیثانیه رسیدند. این شرکت تأکید کرد که برای این مقایسه، از بهینهترین پیکربندی هر یک از رقبا استفاده کرده است.
مزیت هزینهای
یک ارزیابی مستقل توسط Braintrust، ابزار You.com را در مقابل ابزارهای جستوجوی یکپارچه در APIهای OpenAI و Anthropic در قالب ۱,۳۲۹ سؤال مورد آزمایش قرار داد. نتایج نشاندهنده یک برتری مالی واضح برای رویکرد «جداسازی» (Unbundled) بود.
با استفاده از مدل Claude Sonnet 5، هزینه هر سؤال از ۰.۱۱۴۸ دلار (در جستوجوی داخلی) به ۰.۰۷۴۷ دلار با استفاده از Highlights کاهش یافت که به معنای کاهش ۳۵ درصدی هزینههاست. همچنین دقت از ۷۸.۷۸٪ به ۷۹.۲۳٪ افزایش یافت و فرآیند ۱.۲۶ ثانیه سریعتر شد. برای مدل GPT-5.6 Terra، هزینهها ۱۱٪ کاهش یافت (از ۰.۰۴۶۷ به ۰.۰۴۱۷ دلار) در حالی که دقت ۳.۶۶ واحد افزایش یافت.
You.com اشاره کرد که اگرچه هزینه هر سؤال در مقایسه با Snippets حدود ۱۱٪ افزایش مییابد (زیرا متن بیشتری به مدل ارسال میشود)، اما هزینه بهازای هر «پاسخ صحیح» حدود ۵٪ کمتر است. برای مدلهای Claude و GPT، هزینه بهازای هر پاسخ صحیح به ترتیب ۳۵٪ و ۱۵٪ کاهش یافت.
شکاف مشاهدهپذیری (Observability)
شرکت You.com استدلال میکند که ابزارهای جستوجوی داخلی OpenAI و Anthropic مانند «جعبههای سیاه» هستند. این ابزارها صفحاتی را که به آنها استناد شده نشان میدهند، اما عبارات دقیقی را که مدل واقعاً خوانده است پنهان میکنند. این موضوع دیباگ کردن علت توهمات عددی مدل را غیرممکن میکند.
در یکی از تستهای Braintrust درباره بازیکن تنیس، کارلوس آلکاراز، پرسیده شد که او در مجموع دو تورنمنت، چند گیم سرویس را واگذار کرده است. ردپای (Trace) You.com دقیقاً نشان داد که مدل اعداد ۲۴ و ۲۲ را از کجا پیدا کرده تا به مجموع درست ۴۶ برسد. در مقابل، اجراهای شکستخورده در سیستمهای دیگر هرگز عبارت پشتیبان عدد ۲۴ را نمایش ندادند، برای هر دو مقدار از عدد ۲۲ استفاده کردند و پاسخ را ۴۴ دادند. این موضوع ثابت کرد که خطا در مرحله بازیابی (Retrieval) رخ داده است، نه در محاسبات ریاضی.
توازن در استفاده (Trade-offs)
برای توسعهدهندگان، بهای این دقت، تأخیر است. Highlights حدود ۱۶۰ میلیثانیه به زمان پاسخ نسبت به Snippets استاندارد اضافه میکند. اگر بودجه زمانی سختگیرانهای برای پرسش و پاسخهای ساده دارید، Snippets همچنان گزینه بهتری هستند.
برای صفحاتی که سریعتر از بهروزرسانی ایندکس تغییر میکنند، حالت extraction_mode: "full_page" توصیه میشود، زیرا دادهها را بهصورت زنده دریافت میکند و به جای حافظه پنهان (Cache) از وب استفاده میکند. این حالت بهویژه برای سؤالات چندمرحلهای سبک FRAMES که به بافت (Context) گستردهتری نسبت به عبارات محدود نیاز دارند، مفید است.
حسابهای جدید ۱۰۰ دلار اعتبار دریافت میکنند و ابزارهای مورد استفاده در این بنچمارکها بهصورت عمومی در دسترس است. این تغییر به سمت جستوجوی جداسازیشده و مشاهدهپذیر، به توسعهدهندگان اجازه میدهد مدلهای خود را تعویض کنند در حالی که یک خط لوله دادهای با دقت بالا و ثابت را حفظ نمایند.
گام بعدی شما
- اگر توسعهدهنده هستید، از اعتبار ۱۰۰ دلاری حسابهای جدید You.com برای تست جایگزینی جستوجوی داخلی با API Highlights استفاده کنید.
- در پروژههایی که دقت عددی حیاتی است، خروجیهای
contents.highlightsرا برای دیباگ کردن توهمات مدل بررسی کنید. - برای کاهش هزینههای استنتاج در مقیاس بالا، مدلهای ارزانتر را با یک لایه بازیابی دقیقتر (مانند این ابزار) ترکیب کنید.
اما تأثیر این رویکرد بر آینده مدلهای استدلالی حتی عمیقتر است — به بررسی ما دربارهی مدلهای Reasoning مراجعه کنید.




گفتگو