پرش به محتوای اصلی
پرش به محتوای مقاله

Exa: افزایش ۱۵۷۹ درصدی شناسایی موجودیت‌ها در حالت Agent Ultra

·۴ مهر ۱۴۰۵۴ دقیقه مطالعه۱ بازدید
Exa Agent Ultra را معرفی می‌کند: API پژوهش عمیق با زیرعامل‌های هوشمند برای ساخت لیست‌های جامع
Exa Agent Ultra را معرفی می‌کند: API پژوهش عمیق با زیرعامل‌های هوشمند برای ساخت لیست‌های جامع
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی مفهومی به نام «پژوهش تا حد اشباع»؛ جایی که مدل به‌جای ارائه سریع‌ترین پاسخ، تمام منابع ممکن را برای ساخت یک لیست کامل می‌کاود و نرخ یافتن موجودیت‌ها را بیش از ۱۵ برابر می‌کند.

اگر برای جمع‌آوری لیست‌های جامع بازار یا شناسایی تمام شرکت‌های یک حوزه خاص ساعت‌ها وقت صرف استخراج دستی داده‌ها می‌کنید، بازی تغییر کرده است. Exa با معرفی Agent Ultra، نرخ یافتن موجودیت‌ها را در مقایسه با مدل Opus 5.5 تا ۱۵۷۹٪ افزایش داد. این بالاترین سطح تلاش در API عامل (Agent API) است که به‌طور خاص برای پژوهش‌هایی طراحی شده که باید «تا حد اشباع» اجرا شوند. به این معنا که جست‌وجو برای یافتن تمام شرکت‌های فعال در حوزه اتوماسیون مرورگر در آمریکا، به‌جای ساعت‌ها کار دستی و استخراج داده (Scraping)، اکنون در ۳۰ دقیقه انجام می‌شود.

اکثر ابزارهای جست‌وجوی هوش مصنوعی روی سرعت اولویت می‌گذارند و اغلب تنها تعداد محدودی از لینک‌های مرتبط را برمی‌گردانند. اما Agent Ultra این اولویت را تغییر داده و بر ساخت لیست‌های جامع و غنی‌سازی موجودیت‌ها تمرکز می‌کند؛ جایی که نیاز به بررسی هزاران منبع است. این تحول در زمانی رخ می‌دهد که سازمان‌ها از پرس‌وجوهای ساده‌ی سؤال و جواب (Q&A) به سمت نقشه‌برداری‌های پیچیده بازار و پژوهش‌های شناسایی مشتری (KYC) حرکت می‌کنند.

عامل (Agent) — شبیه به کارمندی است که نه تنها سؤال شما را می‌فهمد، بلکه می‌تواند برای رسیدن به جواب، ابزارهای مختلف را به کار بگیرد و مراحل مختلفی را طی کند — در حالت Ultra به جای یک پاسخ سریع، روی غنی‌سازی لیست‌ها و یافتن هزاران منبع تمرکز می‌کند. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، انتقال از پرس‌وجوهای ساده به نقشه‌برداری‌های پیچیده بازار، نیاز به لایه‌های جدیدی از استدلال دارد. این گسترش قابلیت‌های عامل‌ها در حالی صورت می‌گیرد که بسیاری از سازمان‌ها همچنان با چالش مدیریت و نظارت بر عامل‌های هوش مصنوعی در محیط‌های سازمانی دست‌وپنجه نرم می‌کنند.

زمینه و سازوکار

طبق گزارش marktechpost.com، سازوکار Agent Ultra بر پایه تقسیم یک وظیفه اصلی به چندین زیر-وظیفه است. سپس تیمی از زیر-عامل‌ها (Swarm of subagents) به‌طور هم‌زمان روی دامنه‌های مختلف پژوهش می‌کنند.

این سامانه به‌طور پویا مدل‌های پیشرو (Frontier Models) را برای مراحل پیچیده و مدل‌های سریع‌تر و ارزان‌تر را برای کارهای ساده‌تر مسیریابی می‌کند تا مصرف محاسباتی بهینه شود. حالت Ultra مدلی است که بیشترین مقدار محاسبات (Compute) را مصرف می‌کند و نسبت به هر سطح تلاش دیگری، زمان بیشتری برای اجرا صرف می‌کند تا کامل‌ترین نتایج ممکن را بازگرداند.

بنچمارک‌های عملکرد

بر اساس مستندات منتشر شده توسط Exa، این حالت در چهار محک کلیدی، مدل‌های Opus 5.5، GPT-6 Astra و Perplexity Agent را در حالی که همگی در حداکثر توان (Maximum effort settings) خود بودند، شکست داد:

  • Company Find-All: به‌طور میانگین ۲۴۵۱ موجودیت در هر وظیفه یافت شد که ۱۵۷۹٪ بیشتر از Opus 5.5 است. همچنین این مدل کمترین هزینه به‌ازای هر موجودیت یافت‌شده را ثبت کرد.
  • WANDR (soft recall): با کسب امتیاز ۸۱.۴٪، مدل Opus 5.5 (۷۲.۳٪) را با اختلاف ۹.۱ امتیاز مطلق شکست داد، در حالی که هزینه هر وظیفه را به نصف رساند.
  • DeepSearchQA (F1): به امتیاز ۹۳.۹٪ رسید و از Perplexity Agent (۸۹.۷٪) پیشی گرفت و ۴۶٪ ارزان‌تر از GPT-6 Astra بود.
  • WideSearch (row-level F1): با امتیاز ۵۸.۹٪، بالاترین رتبه را در میان چهار سیستم تست‌شده کسب کرد و کمترین هزینه را به‌ازای هر وظیفه در این گروه داشت.

جزئیات بنچمارک‌ها

Exa برای این ارزیابی‌ها از مجموعه‌داده‌های خاصی استفاده کرد. WANDR محک شرکت Perplexity برای ۵۰۰ وظیفه جمع‌آوری داده‌ی «پهن و عمیق» است که در اینجا Exa از مدل gpt-6-luna به‌عنوان داور استفاده کرد. DeepSearchQA نیز محک گوگل دیپ‌مایند است که شامل ۹۰۰ پرامپت برای جست‌وجوهای چندمرحله‌ای است.

شرکت Exa برای WANDR و DeepSearchQA هر کدام تا ۲۰۰ وظیفه، و برای WideSearch و Company Find-All هر کدام ۱۰۰ وظیفه را ارزیابی کرد. لازم است ذکر شود که تمام این نتایج در حال حاضر توسط فروشنده گزارش شده و هنوز به‌طور مستقل بازتولید (Reproduce) نشده‌اند.

استقرار و هزینه‌ها

دسترسی به Agent Ultra از امروز از طریق API میزبانی‌شده و با تنظیم پارامتر effort روی "ultra" امکان‌پذیر است. این مدل وزن‌های باز (Open Weights) — یعنی دستور پخت مدل علناً منتشر نشده و فقط غذای آماده در دسترس است — ندارد و نمی‌توان آن را به‌صورت شخصی میزبانی (Self-host) کرد. زمان اجرای وظایف پیچیده معمولاً ۳۰ دقیقه است، اما در موارد بسیار سخت ممکن است تا ۳ ساعت طول بکشد.

هزینه‌ها بر اساس نرخ‌های استاندارد عامل محاسبه می‌شود و سقف پیش‌فرض هر اجرا ۲۰ دلار است. کاربران می‌توانند بودجه را از ۱ تا ۱۰۰ دلار از طریق پارامتر maxCostDollars و مدت زمان را بین ۳۰۰ تا ۱۰۸۰۰ ثانیه از طریق maxDurationSeconds تنظیم کنند.

این API از قابلیت‌های Streaming، outputSchema و input.data پشتیبانی می‌کند. همچنین با تنظیم reasoning.effort: "ultra" با نقطه انتهایی /responses شرکت OpenAI سازگار است. کاربران همچنین می‌توانند سیستم را در Exa API Playground تست کنند.

این چرخش به سمت محاسبات «جامع»، ظهور «پژوهشگر خودگردان» را نوید می‌دهد. در حالی که برخی از توسعه‌دهندگان بر روی بهینه‌سازی زیرساختی برای مدیریت تعداد زیادی از عامل‌های صوتی با تأخیر کم تمرکز کرده‌اند، Exa سه گروه هدف اصلی را برای پژوهش‌های متنی شناسایی کرده است:

  • تأمین‌کنندگان مدل: برای جمع‌آوری داده‌های آموزشی، مانند یافتن تمام مخازنی (Repo) که یک تکنیک خاص را پیاده کرده‌اند، در حالی که معیارهایی مثل انتشار وزن‌ها تأیید شود.
  • خدمات مالی: برای ساخت نقشه‌های بازار جهت بررسی دقیق (Diligence)، نظارت بر سیگنال‌های پرتفولیو و پژوهش‌های KYC در سوابق دادگاه‌ها و پرونده‌های رسمی.
  • تیم‌های بازاریابی (GTM): برای ساخت لیست‌های حساب‌های مشتری و غنی‌سازی ردیف‌ها با فیلدهای قضاوتی که توسط URLهای مستند پشتیبانی می‌شوند.

اگر در حال ساخت مجموعه‌داده‌های آموزشی یا نقشه‌های بازار هستید، قابلیت حذف ردیف‌های موجود از نتایج جدید به شما اجازه می‌دهد تا لیست‌ها را به‌صورت تکرارناپذیر و مرحله‌به‌مرحله گسترش دهید. این ویژگی، API را از یک ابزار جست‌وجو به یک موتور غنی‌سازی پایگاه‌داده تبدیل می‌کند.

منتظر بازتولید مستقل این بنچمارک‌های گزارش‌شده توسط فروشنده باشید تا مشخص شود آیا رشد ۱۵۰۰ درصدی در کشف موجودیت‌ها در صنایع مختلف نیز صادق است یا خیر.

گام بعدی شما

  • اگر در حال ساخت مجموعه‌داده‌های آموزشی هستید، پارامتر maxCostDollars را برای کنترل هزینه‌های استخراج انبوه تنظیم کنید.
  • برای تست رایگان، از Exa API Playground استفاده کنید تا تفاوت نتایج حالت Ultra با حالت‌های سریع‌تر را ببینید.
  • منتظر گزارش‌های مستقل از بنچمارک‌های WANDR باشید تا صحت ادعای رشد ۱۵۰۰ درصدی تأیید شود.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با تکیه بر اعتبار بنچمارک‌های گوگل و Perplexity، هزینه استخراج داده‌های صنعتی را به‌شدت کاهش می‌دهد. در نتیجه، نقشه‌برداری از بازارهای پیچیده که پیش‌تر نیاز به تیم‌های انسانی داشت، اکنون به یک فرایند خودکار تبدیل می‌شود.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم به این سرویس برای توسعه‌دهندگان ایرانی دشوار است، اما مدل‌های مشابه می‌توانند برای غنی‌سازی داده‌های بازار داخلی ایران به‌کار روند.

·نگاه ما
تحریریه دات‌هوش

تمرکز Exa بر «پژوهش تا حد اشباع» نشان می‌دهد که عصر مدل‌های سریع برای پاسخ‌های کوتاه در حال پایان است و جای خود را به مدل‌های «کند اما جامع» می‌دهد. این رویکرد، مفهوم استنتاج را از یک پاسخ لحظه‌ای به یک فرآیند پس‌زمینه (Background Process) تبدیل می‌کند که در آن کیفیت و جامعیت داده، بر سرعت پاسخ اولویت دارد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.