۷.۰۷۳ ثانیه؛ این تمام زمانی است که اکنون برای یک جستوجوی کامل پرواز از زوریخ به لندن در گوگلفلایتس لازم است. این رکورد خیرهکننده نتیجهی عرضه jev-ultrafast v0.1.0 است؛ پروژهای متنباز که در سپتامبر ۲۰۲۶ توسط تیم Browser Use برای حل ناکارآمدی عاملهای هوش مصنوعی مبتنی بر بینایی منتشر شد.
بیشتر عاملهای مرورگر از یک چرخه کند استفاده میکنند: گرفتن اسکرینشات، خواندن تصویر و حدس زدن مختصات دکمهها. در این روش، یک اشتباه کوچک در تشخیص دکمه معمولاً به معنای شروع دوباره کل فرآیند است. این رویکرد مستعد توهم (Hallucination) — شبیه دوستی که خاطرهای را اشتباه تعریف میکند — و خطاهای هزینهبر است. در واقع تا زمانی که یک عامل سنتی کارش را تمام کند، یک انسان بهراحتی میتوانست خودش پرواز را پیدا کند.
زمینه و بستر (Context)
این پروژه بر مفهوم «هارنس عامل» (Agent Harness) استوار است؛ لایهای نرمافزاری که چرخه عامل و وضعیت نشست را مدیریت میکند. همانطور که در تحلیل قبلی ما دربارهی رویکرد مینیمالیستی Earendil: Pi 1.0 اشاره کردیم، این لایه نقش هماهنگکننده را دارد. این طراحی با مفاهیم معرفیشده در SDK عاملهای OpenAI در آوریل ۲۰۲۶ در مورد هارنسها، چرخههای عامل و سندباکسها (Sandboxes) همسو است. البته باید توجه داشت که مفهوم کلی هارنس را با ابزار اتصال اختصاصی این پروژه که یک اسم خاص و Browser Harness نام دارد، اشتباه نگیریم.

به نقل از مستندات پروژه، jev-ultrafast بهجای تصاویر، کنترلهای صفحه را به یک جدول شمارهدار تبدیل میکند. این سیستم را یک «عامل مرورگر با فضای عملیاتی پویا و نمایه شده» مینامند که از یک فرآیند چهارمرحلهای سختگیرانه پیروی میکند. این معماری در واقع تکامل یافتهی رویکردهایی است که پیشتر منجر به کاهش ۲۵ درصدی تأخیر در عاملهای مرورگر شد و اکنون به رکورد ۷ ثانیهای رسیده است.
جزئیات فنی
- خواندن صفحه: عامل صفحه را به صورت جدول میخواند. با هر تغییر صفحه، کنترلهای رایج و قابل مشاهده به عناصر شمارهدار تبدیل میشوند. برای کاهش حجم دادهها، بدنه مقالات و فوترهای خارج از صفحه از پنجره متنی (Context Window) — مثل میز کاری که فقط جای چند ورق دارد — حذف میشوند تا مدل با اطلاعات غیرضروری اشباع نشود.
- انتخاب عملیات: یک مدل قضاوت، عملیات و عنصر هدف را در یک مرحله (One-shot) انتخاب میکند. هشت عملیات سازگار برای این سیستم تعریف شده است: کلیک (CLICK)، تایپ متن (TYPE_TEXT)، انتخاب (SELECT)، اسکرول به بالا (SCROLL_UP)، اسکرول به پایین (SCROLL_DOWN)، انتظار (WAIT)، اتمام (DONE) و مسدود شدن (BLOCKED).
- تولید متن: یک مدل زبانی کوچک (SLM) مانند inception/mercury-2.5 از طریق OpenRouter (در حالی که قابلیت استدلال یا Reasoning آن غیرفعال شده است)، تنها در صورت نیاز متن تولید میکند. طبق گزارشها، تولید کلمه «زوریخ» در دمو تنها ۵۸۱ میلیثانیه زمان برده است.
- تأییدیه: مجری پیش از هر اقدام، وضعیت صفحه، عنصر هدف و احتمال پوشانده شدن عنصر (Occlusion) را بازبینی میکند. خروجی مدل هرگز مستقیماً به سلکتورها، مختصات، دستورات شل یا کدهای جاوااسکریپت قابل اجرا تبدیل نمیشود.
این معماری از Jev متعلق به شرکت TypeSafe استفاده میکند؛ یک مدل قضاوت «سیستم یک» (System One) که بهجای نوشتن متن، تصمیم میگیرد. این مدل به دلیل بهینگی بالا، توانسته است هزینههای عملیاتی عاملهای AI را تا ۲۲ برابر کاهش دهد و بهرهوری را به شدت افزایش دهد. در ضبط رسمی این پروژه، Jev توانست ۱۷ درخواست را با میانگین تأخیر ۱۷۸ میلیثانیه مدیریت کند.
عملکرد و هزینه
رکورد ۷.۰۷۳ ثانیهای شامل فراخوانیهای مدل، تولید متن و زمان بارگذاری صفحه است، هرچند زمان اولیه برای راهاندازی مرورگر و ناوبری اولیه در این عدد لحاظ نشده است. بر اساس بررسی دادهها در ۲ اکتبر ۲۰۲۶، در ۶ اجرای متناوب روی یک تسک مشابه، میانگین زمان از ۹.۴۵۰ ثانیه به ۷.۰۹۲ ثانیه رسید که کاهش ۲۵ درصدی را نشان میدهد. در این بازه بهبود، میانگین درخواستهای ارسالی به TypeSafe از ۲۲ به ۱۷ مورد و فراخوانیهای پروتکل مرورگر به شدت کاهش یافته و از ۱۰۹۲ به ۱۰۱ مورد رسید.
سایر تستهای سریع و مستقل (Smoke Checks) شامل موارد زیر است:
- باز کردن مقاله ویکیپدیا: ۲.۷۹۸ ثانیه
- جستوجوی هتل محلی: ۱.۸۹۶ ثانیه
کل هزینه این جستوجوی پرواز حدود ۰.۰۰۳۹ دلار تخمین زده شده است. این مبلغ بر اساس قیمتگذاری TypeSafe برای مدل Jev 1.13 (۰.۰۴۲ دلار بهازای هر میلیون توکن ورودی و خروجی رایگان) محاسبه شده است. در این اجرا، ۹۰,۵۵۸ توکن ورودی مصرف شد (حدود ۰.۰۰۳۸ دلار) به علاوه مبلغ ۰.۰۰۰۰۶۲۷۲ دلار برای دو فراخوانی متنی.
برای کاربر عملی، این یعنی هوش مصنوعی کمتر احتمال دارد دکمههای خیالی بسازد. با تبدیل مرورگر به یک منوی چندگزینهای بهجای یک تصویر، مدل از «نویز بصری» فوترها و مقالات خارج از صفحه رها میشود. نتیجه، تعاملی سریعتر و بهینهتر است که بیشتر به یک API برنامهنویسی شبیه است تا انسانی که حرکات موس را تقلید میکند.
با این حال، باید هشدار داد که رکورد ۷ ثانیهای یک مورد ضبط شده خاص است و نه یک بنچمارک کلی. توسعهدهندگان تأکید کردهاند که سه جفت اجرا برای یک ادعای آماری قوی کافی نیست. همچنین نسخه فعلی از فریمها (Frames)، المانهای Canvas، آپلود فایل، تبهای جدید یا ویجتهای کیبورد دلخواه پشتیبانی نمیکند. کاربران همچنین هشدار یافتهاند که پرداختها و ورود به حسابها را بهصورت دستی مدیریت کنند، زیرا عامل از پروفایل کروم و وضعیت لاگین کاربر استفاده میکند.
این چرخش نشان میدهد آینده عاملهای وب در بینایی بهتر نیست، بلکه در نمایهسازی (Indexing) بهتر است. Browser Use با تبدیل مرورگر به لیستی از گزینههای قابل بررسی، گلوگاه را از «چشم» مدل به «سرعت تصمیمگیری» منتقل کرده است.
گام بعدی شما
- برای درک این سازوکار بدون نصب، یک لیست شمارهدار از المانهای یک صفحه (مثلاً [۱] دکمه نوع سفر، [۲] کادرباکس مبدأ) را به یک LLM بدهید و دقت آن را با ارسال اسکرینشات مقایسه کنید.
- اگر توسعهدهنده هستید، مستندات Browser Use را برای جایگزینی متدهای VQA با متدهای نمایه شده بررسی کنید.
- وضعیت دسترسی مدلهای Jev در OpenRouter را برای کاهش هزینه استنتاج در پروژههای خود چک کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو