اگر امروز در حال ساخت عاملی هستید که باید در وب بچرخد و فرمها را پر کند، ابزاری که مدل شما را هدایت میکند مهمتر از خودِ مدل است. طبق دادههای منتشر شده در ۲۳ اوت ۲۰۲۶، فریمورک eve متعلق به ورسل (Vercel)، در تکمیل تسکهای وب زنده، بهطور میانگین ۷٪ گامهای کمتری نسبت به Claude Code برمیدارد. این نتایج نشان میدهد که برای عاملهایی که با وب باز تعامل دارند، «هارنس» یا همان چارچوب نرمافزاری، حیاتیتر از مدل زیربنایی است.
این یافته در حالی منتشر میشود که توسعهدهندگان از تولید سادهی کد به سمت استقرار عاملهای هوش مصنوعی (AI Agents) — شبیه به دستیارهای دیجیتالی که میتوانند بهجای شما دکمهها را بزنند و خرید کنند — حرکت میکنند. این روند تکاملی با تغییر وضعیت Claude Code به حالت اجرای خودکار شتاب گرفته است تا استقلال عاملها در محیطهای توسعه افزایش یابد. همانطور که در تحلیل قبلی ما دربارهی ادغام طراحی رابط کاربری در Claude Code اشاره کردیم، این دادههای جدید مشخص میکند که آن ابزار در کجا به سقف عملکرد خود میرسد. در حالی که یک عامل کدنویسی میتواند یک مخزن (Repo) را بازنویسی کند، یک عامل وب باید در برابر هرجومرج HTML زنده و نقاط انتهایی (Endpoints) غیرقابلپیشبینی API دوام بیاورد.
به گزارش پلتفرم Ora که در زمینه محکزنی عاملهای وب تخصص دارد، هر دو ابزار در صدها مسیر واقعی کاربر آزمایش شدند. این مسیرها شامل عملیات پیچیدهای بود که عاملها را ملزم به انجام اقدامات سخت میکرد؛ اقداماتی نظیر ثبتنام در محصولات، یکپارچهسازی سرویسها با یکدیگر و پردازش پرداختهای مالی.
Ora تخمین میزند که ۹۹٪ وب فعلی «عامل-پذیر» (Agent-ready) نیست؛ یعنی اکثر سایتها برای تعامل با هوش مصنوعی طراحی نشدهاند. همین موضوع باعث میشود توانایی هارنس در مدیریت شکستها و هرجومرج وب، عاملی حیاتی برای موفقیت باشد.
بر اساس مستندات منتشر شده در وبلاگ ورسل، هر دو ابزار از مدلهای یکسانی یعنی Claude Fable 5 و Haiku 4.5 استفاده کردند. چون مدلها کاملاً یکسان بودند، تنها متغیر موجود، «هارنس» بود؛ یعنی همان لایهی نرمافزاری که ابزارها را در اختیار مدل قرار میدهد و آن را گامبهگام هدایت میکند. نتایج این آزمایش سه شکاف کلیدی در عملکرد را برجسته کرد:
- موفقیت بومی: eve نرخ موفقیت بومی را ۲ برابر کرد؛ یعنی تسکهای بسیار بیشتری را مستقیماً در سایت مشتری به پایان رساند، بهجای آنکه به جستوجوی کلی وب متکی شود.
- بهرهوری: eve در صدها مسیر کاربر، بهطور میانگین ۷٪ گامهای کمتری برای رسیدن به هدف برداشت.
- دقت: eve توانست ۹٪ نقاط انتهایی معتبر و قابلفراخوانی بیشتری را نسبت به Claude Code شناسایی کند.
برای یک توسعهدهنده در دنیای واقعی، این یعنی انتخاب ابزار کاملاً به محیط بستگی دارد. اگر در حال ویرایش فایلها، اجرای تستها یا ثبت تغییرات (Commit) در یک مخزن کد هستید، Claude Code همچنان اسب کاری برتر برای تسکهای سطح مخزن است. در این راستا، مدلهای متنباز دیگری نیز مانند GLM-5.2 با قابلیتهای پیشرفته کدنویسی سعی دارند جایگزینهایی عملی برای توسعهدهندگان در محیطهای محلی باشند. اما اگر در حال ساخت عاملی هستید که باید در داشبورد یک سرویس شخص ثالث بچرخد یا یک جریان ثبتنام را خودکار کند، معماری eve که بر پایه Next.js ساخته شده است، موثرتر است.
این تغییر ثابت میکند که «هوش» مدلهایی مثل Fable 5 توسط ابزارهایی که در اختیار دارند محدود میشود. یک هارنس بهتر، شناسایی دقیقتر نقاط انتهایی و تعامل مطمئنتری با رابط کاربری (UI) را فراهم میکند که مستقیماً به کاهش تأخیر (Latency) و افزایش نرخ موفقیت منجر میشود.
توسعهدهندگان اکنون میتوانند با استفاده از ابزار journey.ora.ai، هزینه، تأخیر و تعداد گامها را در سایتهای خود اندازه بگیرند. برای بهینهسازی «موفقیت بومی»، توسعهدهندگان باید روی سه محور تمرکز کنند:
- شناسایی نقاط انتهایی: اطمینان از اینکه هارنس مستقیماً نقاط انتهایی معتبر را مییابد و فراخوانی میکند.
- تعامل با UI: توانمند کردن عامل برای پر کردن فرمها و کلیک بر روی دکمهها بدون اتکا به جستوجو.
- کشینگ پرامپت: Ora متوجه مشکلی در کشینگ پرامپت (Prompt Caching) در eve شد که پس از رفع آن، هزینهها ۱۵٪ کاهش یافت.
باید منتظر ماند و دید ارائهدهندگان دیگر فریمورکها چگونه به این معیارهای موفقیت بومی پاسخ میدهند، زیرا صنعت به سمت هارنسهای تخصصی برای شخصیتهای (Personas) مختلف عاملها حرکت میکند.
گام بعدی شما
- اگر از Claude Code برای تسکهای وب استفاده میکنید، خروجیهای آن را با ابزار journey.ora.ai مقایسه کنید تا نقاط شکست را بیابید.
- در طراحی سایتهای خود، ساختارهای سادهتری برای شناسایی APIها توسط عاملها در نظر بگیرید.
- برای کاهش هزینههای استنتاج، تنظیمات کشینگ پرامپت را در فریمورک خود بازبینی کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو