اگر برای جمعآوری لیستهای جامع بازار یا شناسایی تمام شرکتهای یک حوزه خاص ساعتها وقت صرف استخراج دستی دادهها میکنید، بازی تغییر کرده است. Exa با معرفی Agent Ultra، نرخ یافتن موجودیتها را در مقایسه با مدل Opus 5.5 تا ۱۵۷۹٪ افزایش داد. این بالاترین سطح تلاش در API عامل (Agent API) است که بهطور خاص برای پژوهشهایی طراحی شده که باید «تا حد اشباع» اجرا شوند. به این معنا که جستوجو برای یافتن تمام شرکتهای فعال در حوزه اتوماسیون مرورگر در آمریکا، بهجای ساعتها کار دستی و استخراج داده (Scraping)، اکنون در ۳۰ دقیقه انجام میشود.
اکثر ابزارهای جستوجوی هوش مصنوعی روی سرعت اولویت میگذارند و اغلب تنها تعداد محدودی از لینکهای مرتبط را برمیگردانند. اما Agent Ultra این اولویت را تغییر داده و بر ساخت لیستهای جامع و غنیسازی موجودیتها تمرکز میکند؛ جایی که نیاز به بررسی هزاران منبع است. این تحول در زمانی رخ میدهد که سازمانها از پرسوجوهای سادهی سؤال و جواب (Q&A) به سمت نقشهبرداریهای پیچیده بازار و پژوهشهای شناسایی مشتری (KYC) حرکت میکنند.
عامل (Agent) — شبیه به کارمندی است که نه تنها سؤال شما را میفهمد، بلکه میتواند برای رسیدن به جواب، ابزارهای مختلف را به کار بگیرد و مراحل مختلفی را طی کند — در حالت Ultra به جای یک پاسخ سریع، روی غنیسازی لیستها و یافتن هزاران منبع تمرکز میکند. همانطور که در تحلیلهای پیشین ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، انتقال از پرسوجوهای ساده به نقشهبرداریهای پیچیده بازار، نیاز به لایههای جدیدی از استدلال دارد. این گسترش قابلیتهای عاملها در حالی صورت میگیرد که بسیاری از سازمانها همچنان با چالش مدیریت و نظارت بر عاملهای هوش مصنوعی در محیطهای سازمانی دستوپنجه نرم میکنند.
زمینه و سازوکار
طبق گزارش marktechpost.com، سازوکار Agent Ultra بر پایه تقسیم یک وظیفه اصلی به چندین زیر-وظیفه است. سپس تیمی از زیر-عاملها (Swarm of subagents) بهطور همزمان روی دامنههای مختلف پژوهش میکنند.
این سامانه بهطور پویا مدلهای پیشرو (Frontier Models) را برای مراحل پیچیده و مدلهای سریعتر و ارزانتر را برای کارهای سادهتر مسیریابی میکند تا مصرف محاسباتی بهینه شود. حالت Ultra مدلی است که بیشترین مقدار محاسبات (Compute) را مصرف میکند و نسبت به هر سطح تلاش دیگری، زمان بیشتری برای اجرا صرف میکند تا کاملترین نتایج ممکن را بازگرداند.
بنچمارکهای عملکرد
بر اساس مستندات منتشر شده توسط Exa، این حالت در چهار محک کلیدی، مدلهای Opus 5.5، GPT-6 Astra و Perplexity Agent را در حالی که همگی در حداکثر توان (Maximum effort settings) خود بودند، شکست داد:
- Company Find-All: بهطور میانگین ۲۴۵۱ موجودیت در هر وظیفه یافت شد که ۱۵۷۹٪ بیشتر از Opus 5.5 است. همچنین این مدل کمترین هزینه بهازای هر موجودیت یافتشده را ثبت کرد.
- WANDR (soft recall): با کسب امتیاز ۸۱.۴٪، مدل Opus 5.5 (۷۲.۳٪) را با اختلاف ۹.۱ امتیاز مطلق شکست داد، در حالی که هزینه هر وظیفه را به نصف رساند.
- DeepSearchQA (F1): به امتیاز ۹۳.۹٪ رسید و از Perplexity Agent (۸۹.۷٪) پیشی گرفت و ۴۶٪ ارزانتر از GPT-6 Astra بود.
- WideSearch (row-level F1): با امتیاز ۵۸.۹٪، بالاترین رتبه را در میان چهار سیستم تستشده کسب کرد و کمترین هزینه را بهازای هر وظیفه در این گروه داشت.
جزئیات بنچمارکها
Exa برای این ارزیابیها از مجموعهدادههای خاصی استفاده کرد. WANDR محک شرکت Perplexity برای ۵۰۰ وظیفه جمعآوری دادهی «پهن و عمیق» است که در اینجا Exa از مدل gpt-6-luna بهعنوان داور استفاده کرد. DeepSearchQA نیز محک گوگل دیپمایند است که شامل ۹۰۰ پرامپت برای جستوجوهای چندمرحلهای است.
شرکت Exa برای WANDR و DeepSearchQA هر کدام تا ۲۰۰ وظیفه، و برای WideSearch و Company Find-All هر کدام ۱۰۰ وظیفه را ارزیابی کرد. لازم است ذکر شود که تمام این نتایج در حال حاضر توسط فروشنده گزارش شده و هنوز بهطور مستقل بازتولید (Reproduce) نشدهاند.
استقرار و هزینهها
دسترسی به Agent Ultra از امروز از طریق API میزبانیشده و با تنظیم پارامتر effort روی "ultra" امکانپذیر است. این مدل وزنهای باز (Open Weights) — یعنی دستور پخت مدل علناً منتشر نشده و فقط غذای آماده در دسترس است — ندارد و نمیتوان آن را بهصورت شخصی میزبانی (Self-host) کرد. زمان اجرای وظایف پیچیده معمولاً ۳۰ دقیقه است، اما در موارد بسیار سخت ممکن است تا ۳ ساعت طول بکشد.
هزینهها بر اساس نرخهای استاندارد عامل محاسبه میشود و سقف پیشفرض هر اجرا ۲۰ دلار است. کاربران میتوانند بودجه را از ۱ تا ۱۰۰ دلار از طریق پارامتر maxCostDollars و مدت زمان را بین ۳۰۰ تا ۱۰۸۰۰ ثانیه از طریق maxDurationSeconds تنظیم کنند.
این API از قابلیتهای Streaming، outputSchema و input.data پشتیبانی میکند. همچنین با تنظیم reasoning.effort: "ultra" با نقطه انتهایی /responses شرکت OpenAI سازگار است. کاربران همچنین میتوانند سیستم را در Exa API Playground تست کنند.
این چرخش به سمت محاسبات «جامع»، ظهور «پژوهشگر خودگردان» را نوید میدهد. در حالی که برخی از توسعهدهندگان بر روی بهینهسازی زیرساختی برای مدیریت تعداد زیادی از عاملهای صوتی با تأخیر کم تمرکز کردهاند، Exa سه گروه هدف اصلی را برای پژوهشهای متنی شناسایی کرده است:
- تأمینکنندگان مدل: برای جمعآوری دادههای آموزشی، مانند یافتن تمام مخازنی (Repo) که یک تکنیک خاص را پیاده کردهاند، در حالی که معیارهایی مثل انتشار وزنها تأیید شود.
- خدمات مالی: برای ساخت نقشههای بازار جهت بررسی دقیق (Diligence)، نظارت بر سیگنالهای پرتفولیو و پژوهشهای KYC در سوابق دادگاهها و پروندههای رسمی.
- تیمهای بازاریابی (GTM): برای ساخت لیستهای حسابهای مشتری و غنیسازی ردیفها با فیلدهای قضاوتی که توسط URLهای مستند پشتیبانی میشوند.
اگر در حال ساخت مجموعهدادههای آموزشی یا نقشههای بازار هستید، قابلیت حذف ردیفهای موجود از نتایج جدید به شما اجازه میدهد تا لیستها را بهصورت تکرارناپذیر و مرحلهبهمرحله گسترش دهید. این ویژگی، API را از یک ابزار جستوجو به یک موتور غنیسازی پایگاهداده تبدیل میکند.
منتظر بازتولید مستقل این بنچمارکهای گزارششده توسط فروشنده باشید تا مشخص شود آیا رشد ۱۵۰۰ درصدی در کشف موجودیتها در صنایع مختلف نیز صادق است یا خیر.
گام بعدی شما
- اگر در حال ساخت مجموعهدادههای آموزشی هستید، پارامتر
maxCostDollarsرا برای کنترل هزینههای استخراج انبوه تنظیم کنید. - برای تست رایگان، از Exa API Playground استفاده کنید تا تفاوت نتایج حالت Ultra با حالتهای سریعتر را ببینید.
- منتظر گزارشهای مستقل از بنچمارکهای WANDR باشید تا صحت ادعای رشد ۱۵۰۰ درصدی تأیید شود.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو