پرش به محتوای اصلی
پرش به محتوای مقاله

عامل Browser Use زمان جست‌وجوی پرواز را به ۷ ثانیه رساند

·۱۰ مهر ۱۴۰۵۴ دقیقه مطالعه۱ بازدید
نمودار معماری Agent Harness: تبدیل کلیک مرورگر به چندگزینه‌ای با jev-ultrafast v0.1.0
نمودار معماری Agent Harness: تبدیل کلیک مرورگر به چندگزینه‌ای با jev-ultrafast v0.1.0
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر پارادایم از «درک بصری» (Visual-based) به «فضای عملیاتی نمایه شده» (Indexed Action Space) در عامل‌های مرورگر که منجر به کاهش ۲۵ درصدی زمان اجرا و حذف نویزهای بصری شد.

۷.۰۷۳ ثانیه؛ این تمام زمانی است که اکنون برای یک جست‌وجوی کامل پرواز از زوریخ به لندن در گوگل‌فلایتس لازم است. این رکورد خیره‌کننده نتیجه‌ی عرضه jev-ultrafast v0.1.0 است؛ پروژه‌ای متن‌باز که در سپتامبر ۲۰۲۶ توسط تیم Browser Use برای حل ناکارآمدی عامل‌های هوش مصنوعی مبتنی بر بینایی منتشر شد.

بیشتر عامل‌های مرورگر از یک چرخه کند استفاده می‌کنند: گرفتن اسکرین‌شات، خواندن تصویر و حدس زدن مختصات دکمه‌ها. در این روش، یک اشتباه کوچک در تشخیص دکمه معمولاً به معنای شروع دوباره کل فرآیند است. این رویکرد مستعد توهم (Hallucination) — شبیه دوستی که خاطره‌ای را اشتباه تعریف می‌کند — و خطاهای هزینه‌بر است. در واقع تا زمانی که یک عامل سنتی کارش را تمام کند، یک انسان به‌راحتی می‌توانست خودش پرواز را پیدا کند.

زمینه و بستر (Context)

این پروژه بر مفهوم «هارنس عامل» (Agent Harness) استوار است؛ لایه‌ای نرم‌افزاری که چرخه عامل و وضعیت نشست را مدیریت می‌کند. همان‌طور که در تحلیل قبلی ما درباره‌ی رویکرد مینیمالیستی Earendil: Pi 1.0 اشاره کردیم، این لایه نقش هماهنگ‌کننده را دارد. این طراحی با مفاهیم معرفی‌شده در SDK عامل‌های OpenAI در آوریل ۲۰۲۶ در مورد هارنس‌ها، چرخه‌های عامل و سندباکس‌ها (Sandboxes) همسو است. البته باید توجه داشت که مفهوم کلی هارنس را با ابزار اتصال اختصاصی این پروژه که یک اسم خاص و Browser Harness نام دارد، اشتباه نگیریم.

نمودار مقایسه سرعت پاسخ‌دهی مدل jev-ultrafast نسبت به سایر مدل‌های عامل مرورگر در معیار WebVoyager

به نقل از مستندات پروژه، jev-ultrafast به‌جای تصاویر، کنترل‌های صفحه را به یک جدول شماره‌دار تبدیل می‌کند. این سیستم را یک «عامل مرورگر با فضای عملیاتی پویا و نمایه شده» می‌نامند که از یک فرآیند چهارمرحله‌ای سخت‌گیرانه پیروی می‌کند. این معماری در واقع تکامل یافته‌ی رویکردهایی است که پیش‌تر منجر به کاهش ۲۵ درصدی تأخیر در عامل‌های مرورگر شد و اکنون به رکورد ۷ ثانیه‌ای رسیده است.

جزئیات فنی

  • خواندن صفحه: عامل صفحه را به صورت جدول می‌خواند. با هر تغییر صفحه، کنترل‌های رایج و قابل مشاهده به عناصر شماره‌دار تبدیل می‌شوند. برای کاهش حجم داده‌ها، بدنه مقالات و فوترهای خارج از صفحه از پنجره متنی (Context Window) — مثل میز کاری که فقط جای چند ورق دارد — حذف می‌شوند تا مدل با اطلاعات غیرضروری اشباع نشود.
  • انتخاب عملیات: یک مدل قضاوت، عملیات و عنصر هدف را در یک مرحله (One-shot) انتخاب می‌کند. هشت عملیات سازگار برای این سیستم تعریف شده است: کلیک (CLICK)، تایپ متن (TYPE_TEXT)، انتخاب (SELECT)، اسکرول به بالا (SCROLL_UP)، اسکرول به پایین (SCROLL_DOWN)، انتظار (WAIT)، اتمام (DONE) و مسدود شدن (BLOCKED).
  • تولید متن: یک مدل زبانی کوچک (SLM) مانند inception/mercury-2.5 از طریق OpenRouter (در حالی که قابلیت استدلال یا Reasoning آن غیرفعال شده است)، تنها در صورت نیاز متن تولید می‌کند. طبق گزارش‌ها، تولید کلمه «زوریخ» در دمو تنها ۵۸۱ میلی‌ثانیه زمان برده است.
  • تأییدیه: مجری پیش از هر اقدام، وضعیت صفحه، عنصر هدف و احتمال پوشانده شدن عنصر (Occlusion) را بازبینی می‌کند. خروجی مدل هرگز مستقیماً به سلکتورها، مختصات، دستورات شل یا کدهای جاوااسکریپت قابل اجرا تبدیل نمی‌شود.

این معماری از Jev متعلق به شرکت TypeSafe استفاده می‌کند؛ یک مدل قضاوت «سیستم یک» (System One) که به‌جای نوشتن متن، تصمیم می‌گیرد. این مدل به دلیل بهینگی بالا، توانسته است هزینه‌های عملیاتی عامل‌های AI را تا ۲۲ برابر کاهش دهد و بهره‌وری را به شدت افزایش دهد. در ضبط رسمی این پروژه، Jev توانست ۱۷ درخواست را با میانگین تأخیر ۱۷۸ میلی‌ثانیه مدیریت کند.

عملکرد و هزینه

رکورد ۷.۰۷۳ ثانیه‌ای شامل فراخوانی‌های مدل، تولید متن و زمان بارگذاری صفحه است، هرچند زمان اولیه برای راه‌اندازی مرورگر و ناوبری اولیه در این عدد لحاظ نشده است. بر اساس بررسی داده‌ها در ۲ اکتبر ۲۰۲۶، در ۶ اجرای متناوب روی یک تسک مشابه، میانگین زمان از ۹.۴۵۰ ثانیه به ۷.۰۹۲ ثانیه رسید که کاهش ۲۵ درصدی را نشان می‌دهد. در این بازه بهبود، میانگین درخواست‌های ارسالی به TypeSafe از ۲۲ به ۱۷ مورد و فراخوانی‌های پروتکل مرورگر به شدت کاهش یافته و از ۱۰۹۲ به ۱۰۱ مورد رسید.

سایر تست‌های سریع و مستقل (Smoke Checks) شامل موارد زیر است:

  • باز کردن مقاله ویکی‌پدیا: ۲.۷۹۸ ثانیه
  • جست‌وجوی هتل محلی: ۱.۸۹۶ ثانیه

کل هزینه این جست‌وجوی پرواز حدود ۰.۰۰۳۹ دلار تخمین زده شده است. این مبلغ بر اساس قیمت‌گذاری TypeSafe برای مدل Jev 1.13 (۰.۰۴۲ دلار به‌ازای هر میلیون توکن ورودی و خروجی رایگان) محاسبه شده است. در این اجرا، ۹۰,۵۵۸ توکن ورودی مصرف شد (حدود ۰.۰۰۳۸ دلار) به علاوه مبلغ ۰.۰۰۰۰۶۲۷۲ دلار برای دو فراخوانی متنی.

برای کاربر عملی، این یعنی هوش مصنوعی کمتر احتمال دارد دکمه‌های خیالی بسازد. با تبدیل مرورگر به یک منوی چندگزینه‌ای به‌جای یک تصویر، مدل از «نویز بصری» فوترها و مقالات خارج از صفحه رها می‌شود. نتیجه، تعاملی سریع‌تر و بهینه‌تر است که بیشتر به یک API برنامه‌نویسی شبیه است تا انسانی که حرکات موس را تقلید می‌کند.

با این حال، باید هشدار داد که رکورد ۷ ثانیه‌ای یک مورد ضبط شده خاص است و نه یک بنچمارک کلی. توسعه‌دهندگان تأکید کرده‌اند که سه جفت اجرا برای یک ادعای آماری قوی کافی نیست. همچنین نسخه فعلی از فریم‌ها (Frames)، المان‌های Canvas، آپلود فایل، تب‌های جدید یا ویجت‌های کیبورد دلخواه پشتیبانی نمی‌کند. کاربران همچنین هشدار یافته‌اند که پرداخت‌ها و ورود به حساب‌ها را به‌صورت دستی مدیریت کنند، زیرا عامل از پروفایل کروم و وضعیت لاگین کاربر استفاده می‌کند.

این چرخش نشان می‌دهد آینده عامل‌های وب در بینایی بهتر نیست، بلکه در نمایه‌سازی (Indexing) بهتر است. Browser Use با تبدیل مرورگر به لیستی از گزینه‌های قابل بررسی، گلوگاه را از «چشم» مدل به «سرعت تصمیم‌گیری» منتقل کرده است.

گام بعدی شما

  • برای درک این سازوکار بدون نصب، یک لیست شماره‌دار از المان‌های یک صفحه (مثلاً [۱] دکمه نوع سفر، [۲] کادرباکس مبدأ) را به یک LLM بدهید و دقت آن را با ارسال اسکرین‌شات مقایسه کنید.
  • اگر توسعه‌دهنده هستید، مستندات Browser Use را برای جایگزینی متدهای VQA با متدهای نمایه شده بررسی کنید.
  • وضعیت دسترسی مدل‌های Jev در OpenRouter را برای کاهش هزینه استنتاج در پروژه‌های خود چک کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد با کاهش شدید تأخیر و نرخ توهم، استفاده از عامل‌های وب را از حالت آزمایشی به ابزارهای کاربردی نزدیک می‌کند. اعتبار این یافته‌ها بر اساس داده‌های واقعی اجرای عملیات در محیط مرورگر است که هزینه‌های استنتاج را به شدت کاهش می‌دهد.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و نیاز به پروفایل کروم، دسترسی مستقیم به این ابزار برای کاربران ایرانی دشوار است، اما توسعه‌دهندگان داخلی می‌توانند از متد نمایه‌سازی متنی برای ساخت عامل‌های وب بهینه استفاده کنند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی بینایی با نمایه‌سازی متنی، پذیرش این واقعیت است که مدل‌های فعلی در درک مختصات بصری ضعیف‌تر از استدلال روی ساختار داده هستند. این رویکرد عملاً «بینایی» را به یک لایه پیش‌پردازش تبدیل می‌کند تا مدل اصلی فقط روی منطق تصمیم‌گیری تمرکز کند. به نظر ما، این مسیر به جای تلاش برای ساخت مدل‌های بینایی بی‌نقص، به سمت بهینه‌سازی رابط بین مدل و محیط (Interface) حرکت می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.