پرش به محتوای اصلی
پرش به محتوای مقاله

عامل‌های هوش مصنوعی در ۸۰٪ وظایف واقعی وب شکست می‌خورند

·۶ مرداد ۱۴۰۵۲ دقیقه مطالعه۱ بازدید
ثبت‌نام چالش جهانی WebRetriever شرکت Mininglamp آغاز شد — جایزه ۱۵ هزار دلاری
ثبت‌نام چالش جهانی WebRetriever شرکت Mininglamp آغاز شد — جایزه ۱۵ هزار دلاری
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی محیط‌های شبیه‌سازی‌شده با ۸۰۰ وب‌سایت زنده و پویا؛ این اولین بار است که شکاف میان «ناوبری» و «تکمیل واقعی وظیفه» با این دقت عددی افشا می‌شود.

تصور کنید یک دستیار دیجیتال را برای رزرو بلیط یا خرید محصول به وب بفرستید، اما او در میانه راه، به دلیل یک تغییر کوچک در چیدمان صفحه، کاملاً گیج شود. این دقیقاً همان نقطه‌ای است که اکثر عامل‌های فعلی متوقف می‌شوند.

طبق اعلام شرکت Mininglamp Technology در ۲۸ جولای ۲۰۲۶، اکثر عامل‌های هوش مصنوعی (AI Agents) — که شبیه کارمندانی هستند که دستور می‌گیرند کاری را در دنیای بیرون انجام دهند و سپس گزارش دهند — در ۸۰٪ وظایف پایان‌به‌پایان (End-to-End) در محیط وب زنده شکست می‌خورند. همان‌طور که در تحلیل قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، فاصله میان محیط‌های شبیه‌سازی‌شده و دنیای واقعی، همواره بزرگ‌ترین نقطه ضعف مدل‌ها بوده است. این چالش با نتایج مشابهی در سایر حوزه‌های عملیاتی روبروست؛ برای نمونه، دستاورد مدل Fable 5 در بنچمارک RLI نشان داد که حتی در وظایف تخصصی فریلنسری نیز نرخ تکمیل عملیات همچنان پایین است.

بسیاری از محک‌های فعلی بر پایه سایت‌های ایستا و کنترل‌شده هستند که اصلاً ماهیت «آشفته» وب واقعی را ندارند. به همین دلیل، توسعه‌دهندگان دچار تصور غلطی از توانایی مدل‌ها می‌شوند. برای حل این مشکل، Mininglamp با همکاری دانشگاه پکن و آکادمی علوم چین، ابزاری برای اندازه‌گیری صادقانه‌تر ساخته است.

ثبت‌نام چالش جهانی WebRetriever ماینینگ‌لَمپ با جایزه ۱۵ هزار دلاری آغاز شد

بر اساس گزارش dev.to، بنچمارک WebRetriever در مقیاسی گسترده عمل می‌کند:

  • دامنه: ۸۰۰ وب‌سایت زنده و ۱,۵۵۰ وظیفه بین‌حوزه‌ای.
  • پوشش: ۸ حوزه مختلف از جمله سلامت، امور مالی و خدمات دولتی.
  • ارزیابی: چارچوب NavEval به دقت ۹۱.۲٪ با نظرات متخصصان انسانی هم‌سو است (در حالی که متدهای قبلی حدود ۸۱٪ بودند).

ثبت‌نام چالش جهانی WebRetriever با جایزه ۱۵ هزار دلاری آغاز شد

ثبت‌نام چالش جهانی WebRetriever با جایزه ۱۵ هزار دلاری آغاز شد

داده‌ها شکاف عمیقی را میان «ناوبری» و «تکمیل» نشان می‌دهند. بسیاری از مدل‌ها می‌توانند صفحات ساده را پیدا کنند، اما نرخ موفقیت در اتمام واقعی کار نزدیک ۲۰٪ است. این یعنی رسیدن به مقصد، با تمام کردن شغل یکی نیست. برای برنامه‌نویسان، این «آخرین کیلومتر» از قابلیت اطمینان، سخت‌ترین بخش معماری است.

ثبت‌نام چالش جهانی WebRetriever با جایزه ۱۵ هزار دلاری آغاز شد

ثبت‌نام چالش جهانی WebRetriever با جایزه ۱۵ هزار دلاری آغاز شد

علاقمندان می‌توانند از طریق پلتفرم Octo و با کد دعوت 0f351ca01bb4c4dd ثبت‌نام کنند. همچنین امکان پیوستن از طریق ابزارهای کدنویسی AI مانند Cursor یا Claude Code از طریق لینک گیت‌هاب فراهم شده است.

ثبت‌نام چالش جهانی WebRetriever مینینگ‌لَمپ آغاز شد — جایزه ۱۵ هزار دلاری

ثبت‌نام چالش جهانی WebRetriever شرکت Mininglamp آغاز شد — جایزه ۱۵ هزار دلاری

گام بعدی شما

  • اگر از Agentهای وب استفاده می‌کنید، نرخ خطای آن‌ها را در محیط‌های پویا (Dynamic) بسنجید، نه در محیط‌های ایستا.
  • برای توسعه‌دهندگان: متمرکز شوید بر بهبود «اتمام عملیات» به جای «پیدا کردن لینک».
  • روند تغییرات جدول رده‌بندی WebRetriever را دنبال کنید تا بفهمید کدام معماری‌ها سد ۲۰ درصدی را می‌شکنند.

این نتایج احتمالاً تعیین می‌کند که آیا عامل‌های خودکار وب تا سال ۲۰۲۷ واقعاً قابل استفاده خواهند بود یا خیر؛ اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این داده‌ها با تکیه بر اعتبار دانشگاه پکن و آکادمی علوم چین، توهم پیشرفت سریع در Agentic AI را می‌شکند. شکست ۸۰ درصدی یعنی اکثر استارتاپ‌های عامل‌محور هنوز محصولی ندارند که در مقیاس واقعی قابل اتکا باشد.

تأثیر برای ایران

برنامه‌نویسان ایرانی که روی اتوماسیون وب کار می‌کنند، می‌توانند از بنچمارک WebRetriever برای سنجش واقعی مدل‌های خود استفاده کنند تا از شکست‌های احتمالی در محیط عملیاتی جلوگیری نمایند.

·نگاه ما
تحریریه دات‌هوش

تمرکز صنعت از «مدل‌های چت‌باتی» به سمت «عامل‌های عملیاتی» است، اما این بنچمارک ثابت می‌کند که ما هنوز در مرحله «تشخیص مسیر» هستیم، نه «انجام کار». مشکل اصلی نبودِ مدل‌های استدلالی است که بتوانند تغییرات لحظه‌ای UI وب را مدیریت کنند، نه کمبود داده‌های آموزشی.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.