انتخاب اشتباه یک API جستوجو میتواند صورتحساب توکنهای عامل شما را ۴۰٪ افزایش دهد و در عین حال دقت نتایج را پایین بیاورد. در ۱۸ اوت ۲۰۲۶، مؤسسه Artificial Analysis محک «Search Index» را منتشر کرد؛ استانداردی برای اندازهگیری کیفیت، هزینه و سرعت ارائهدهندگان جستوجو هنگام ادغام در عاملهای خودمختار.
بسیاری از چارچوبهای فعلی عاملها هنگام مواجهه با نتایج جستوجوی نویزی، دچار توهم (Hallucination) یا حلقههای پیمایش ناکارآمد میشوند. برای حل این مشکل، این محک از چارچوب متنباز Stirrup و مدل GPT-5.6 Luna بهعنوان موتور استدلال ثابت استفاده کرده است تا اطمینان حاصل شود که تنها عملکرد ارائهدهنده جستوجو مورد سنجش قرار میگیرد.
همانطور که در تحلیلهای قبلی ما دربارهی بهینهسازی استنتاج در مدلهای زبانی اشاره کردیم، کاهش تعداد دفعات فراخوانی مدل، کلید کاهش هزینههاست. این موضوع با چالشهای مشابهی در شناسایی ابزارها توسط ماشینها مرتبط است که راهکارهای جدیدی برای جایگزینی README جهت بهبود دیدپذیری APIها ارائه دادهاند. این محک ارائهدهندگان را در سه حوزه ارزیابی میکند: DeepSearchQA (۹۰۰ پرسش پژوهشی)، BrowseComp (۲۰۰ حقیقت سختیافت) و AA-Omniscience (۶۰۰ پرسش تخصصی).
طبق گزارش Artificial Analysis، شکاف عملکردی میان ابزارها بسیار عمیق است:
- خط پایه: مدل بدون دسترسی به جستوجو تنها ۳۳ امتیاز کسب میکند.
- سطح برتر: سرویسهای Parallel، Exa و Firecrawl با امتیازات ۷۵، ۷۴ و ۷۳ پیشتاز هستند.
- کارایی: استفاده از نسخه پیشرفته Parallel Search مصرف کل توکنها را در مقایسه با نسخه پایه بیش از ۴۰٪ کاهش داد.

این دادهها این فرض رایج در صنعت را که «سرعت خام پرسوجو» معیار اصلی عملکرد عامل است، به چالش میکشد. به نقل از این گزارش، اگرچه Parallel Search (turbo) سریعترین پاسخ را دارد (۰.۵۱ ثانیه)، اما امتیاز کیفیت پایینتر آن (۶۷) باعث میشود عامل مجبور شود دفعات بیشتری جستوجو را تکرار کند. در نهایت، زمان کل انجام تسک با ارائهدهندگان کندتر اما باکیفیتتر، تقریباً یکسان میشود.
برای توسعهدهندگان، این به معنای اولویت دادن به «دقت در اولین تلاش» بهجای «تأخیر در هر پرسوجو» است تا هزینههای عملیاتی به حداقل برسد. موازنه روشن است: پرداخت هزینه بیشتر برای هر پرسوجوی جستوجو، اغلب با کاهش تعداد توکنهای مصرفی توسط مدل زبانی بزرگ (LLM) در طول استدلالهای تکرار شونده، صورتحساب نهایی را کاهش میدهد. در همین راستا، برخی ابزارها مانند Mixedbread توانستهاند هزینههای عاملهای جستجو را تا ۱۰ برابر کمتر از مدلهای پیشرفتهای چون GPT-5.6 Sol کنند.
گام بعدی شما
- متدولوژی کامل این محک را در پلتفرم Artificial Analysis بررسی کنید تا ارائهدهنده متناسب با گردشکار عامل خود را بیابید.
- در سیستمهای خود، نرخ «تکرار جستوجو برای یک تسک» را اندازهگیری کنید تا متوجه شوید آیا سرعت پایین API باعث افزایش هزینه توکنها شده است یا خیر.
- اگر از نسخههای Basic APIها استفاده میکنید، هزینه انتقال به نسخههای Advanced را با کاهش احتمالی ۴۰ درصدی توکنها مقایسه کنید.
اما تأثیر این بهینهسازیها بر معماری حافظه بلندمدت عاملها حتی پیچیدهتر است — به تحلیل ما دربارهی پروتکل MCP مراجعه کنید.




گفتگو