تصور کنید یک دستیار دیجیتال را برای رزرو بلیط یا خرید محصول به وب بفرستید، اما او در میانه راه، به دلیل یک تغییر کوچک در چیدمان صفحه، کاملاً گیج شود. این دقیقاً همان نقطهای است که اکثر عاملهای فعلی متوقف میشوند.
طبق اعلام شرکت Mininglamp Technology در ۲۸ جولای ۲۰۲۶، اکثر عاملهای هوش مصنوعی (AI Agents) — که شبیه کارمندانی هستند که دستور میگیرند کاری را در دنیای بیرون انجام دهند و سپس گزارش دهند — در ۸۰٪ وظایف پایانبهپایان (End-to-End) در محیط وب زنده شکست میخورند. همانطور که در تحلیل قبلی ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، فاصله میان محیطهای شبیهسازیشده و دنیای واقعی، همواره بزرگترین نقطه ضعف مدلها بوده است. این چالش با نتایج مشابهی در سایر حوزههای عملیاتی روبروست؛ برای نمونه، دستاورد مدل Fable 5 در بنچمارک RLI نشان داد که حتی در وظایف تخصصی فریلنسری نیز نرخ تکمیل عملیات همچنان پایین است.
بسیاری از محکهای فعلی بر پایه سایتهای ایستا و کنترلشده هستند که اصلاً ماهیت «آشفته» وب واقعی را ندارند. به همین دلیل، توسعهدهندگان دچار تصور غلطی از توانایی مدلها میشوند. برای حل این مشکل، Mininglamp با همکاری دانشگاه پکن و آکادمی علوم چین، ابزاری برای اندازهگیری صادقانهتر ساخته است.

بر اساس گزارش dev.to، بنچمارک WebRetriever در مقیاسی گسترده عمل میکند:
- دامنه: ۸۰۰ وبسایت زنده و ۱,۵۵۰ وظیفه بینحوزهای.
- پوشش: ۸ حوزه مختلف از جمله سلامت، امور مالی و خدمات دولتی.
- ارزیابی: چارچوب NavEval به دقت ۹۱.۲٪ با نظرات متخصصان انسانی همسو است (در حالی که متدهای قبلی حدود ۸۱٪ بودند).


دادهها شکاف عمیقی را میان «ناوبری» و «تکمیل» نشان میدهند. بسیاری از مدلها میتوانند صفحات ساده را پیدا کنند، اما نرخ موفقیت در اتمام واقعی کار نزدیک ۲۰٪ است. این یعنی رسیدن به مقصد، با تمام کردن شغل یکی نیست. برای برنامهنویسان، این «آخرین کیلومتر» از قابلیت اطمینان، سختترین بخش معماری است.


علاقمندان میتوانند از طریق پلتفرم Octo و با کد دعوت 0f351ca01bb4c4dd ثبتنام کنند. همچنین امکان پیوستن از طریق ابزارهای کدنویسی AI مانند Cursor یا Claude Code از طریق لینک گیتهاب فراهم شده است.


گام بعدی شما
- اگر از Agentهای وب استفاده میکنید، نرخ خطای آنها را در محیطهای پویا (Dynamic) بسنجید، نه در محیطهای ایستا.
- برای توسعهدهندگان: متمرکز شوید بر بهبود «اتمام عملیات» به جای «پیدا کردن لینک».
- روند تغییرات جدول ردهبندی WebRetriever را دنبال کنید تا بفهمید کدام معماریها سد ۲۰ درصدی را میشکنند.
این نتایج احتمالاً تعیین میکند که آیا عاملهای خودکار وب تا سال ۲۰۲۷ واقعاً قابل استفاده خواهند بود یا خیر؛ اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو