پرش به محتوای اصلی
پرش به محتوای مقاله

عامل بینایی Mano-CUA در اتوماسیون وب از Claude 4.5 پیشی گرفت

·۲۶ شهریور ۱۴۰۵۵ دقیقه مطالعه۱ بازدید
عامل وب تخصصی ۴۱.۷ امتیاز گرفت، اما GPT و Claude در پر کردن فرم ناموفق بودند.
عامل وب تخصصی ۴۱.۷ امتیاز گرفت، اما GPT و Claude در پر کردن فرم ناموفق بودند.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی کامل تحلیل DOM با بینایی خالص در یک عامل وب؛ این مدل برخلاف رقبای خود، ساختار کد صفحه را نمی‌خواند و صرفاً با تحلیل بصری پیکسل‌ها عمل می‌کند.

شکاف ۱۰ امتیازی بین Mano-CUA 1.1 و Claude 4.5 در محک WebRetriever Protocol I را جدی بگیرید. این عامل بینایی تخصصی با کسب امتیاز ۴۱.۷، ثابت کرد که در اتوماسیون واقعی مرورگر، مدل‌های هدفمند را بر غول‌های عمومی ترجیح باید داد. این نتیجه نشان می‌دهد که تفاوت عملکرد صرفاً یک نویز آماری نیست، بلکه یک روند ثابت در انجام وظایف پیچیده است. این امر نشان‌دهندهٔ فاصلهٔ رو به رشد میان مدل‌های زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — و مدل‌هایی است که صرفاً برای تعامل با رابط‌های گرافیکی (GUI) آموزش دیده‌اند.

همان‌طور که در تحلیل قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، تخصص در یک حوزه خاص، همواره ریسک خطا را کاهش می‌دهد. در حالی که مدل‌های حجیم مثل GPT-6 Astra در حل پازل‌های تاریخی موفق‌اند، اتوماسیون مرورگر چالشی متفاوت است. طبق گزارش‌های فنی، اکثر مدل‌های عمومی در درک چیدمان فضایی صفحات وب و عناصر پویا که بعد از هر کلیک تغییر می‌کنند، شکست می‌خورند. این مدل‌ها معمولاً به تحلیل مدل شیء سند (DOM) یا APIهای دسترسی متکی هستند؛ ساختارهایی که هنگام مواجهه با جاوااسکریپت‌های پیچیده، رندرینگ پویا یا کامپوننت‌های سفارشی وب، اغلب از کار می‌افتند.

پروژه Mano-P که میزبان Mano-CUA است، کد DOM را کاملاً نادیده می‌گیرد. این سامانه یک سیستم مبتنی بر بینایی خالص است که عناصر قابل کلیک را مستقیماً از روی پیکسل‌ها شناسایی کرده و بر اساس بستر بصری برنامه‌ریزی می‌کند. به این ترتیب، عامل به جای جست‌وجوی یک کد فنی یا یک div عمومی با هندلر onclick، «دکمه آبی رنگی که روی آن Submit نوشته شده» را می‌بیند و در برابر تغییرات ساختاری کد وب‌سایت مقاوم می‌شود.

زمینه: چالش پر کردن فرم‌ها

پر کردن فرم‌ها نقطه‌ای است که مدل‌های عمومی معمولاً در آن سقوط می‌کنند. فرم‌های واقعی شامل ورودی‌های متنی، دکمه‌های رادیویی، انتخاب‌گرهای تاریخ (Date Pickers)، منوهای کشویی و بخش‌های تودرتوی شرطی هستند. هر تعامل در این فرم‌ها، وضعیت صفحه را تغییر می‌دهد و مدل‌های عمومی اغلب بعد از ۴ یا ۵ گام، موقعیت خود را گم می‌کنند. این موضوع منجر به نادیده گرفتن ورودی‌های اجباری، کلیک روی فیلدهای اشتباه یا افتادن در حلقه‌های تکراری از اقدامات شکست‌خورده می‌شود.

محک WebRetriever Protocol I این قابلیت‌ها را با استفاده از فرم‌های وب واقعی از وب‌سایت‌های موجود آزمایش می‌کند، نه صفحات تست ساده‌شده. این سایت‌ها شامل جریان‌های چندصفحه‌ای، کپچاها و خطاهای اعتبارسنجی هستند که کاربر را برای اصلاح اشتباهات به صفحات دیگر هدایت می‌کنند. این رویکرد در واقع تکامل یافته‌ی همان چالش‌هایی است که عامل‌های جست‌وجوی Iris در محک‌های استدلال وب با موفقیت از رقبای خود پیشی گرفتند.

جزئیات: تحلیل عملکرد و بنچمارک‌ها

بر اساس بررسی داده‌های منتشر شده، شکاف عملکرد در تعاملات چندمرحله‌ای، انتخاب از منوهای کشویی و پیمایش در نتایج صفحه‌بندی شده (Paginated Results) بیشترین مقدار است:

  • Mano-CUA 1.1: امتیاز ۴۱.۷ در NavEval
  • Gemini 2.5 Pro Computer Use: امتیاز ۴۰.۹ در NavEval
  • Claude 4.5 Computer Use: امتیاز ۳۱.۳ در NavEval

علاوه بر وب، نسخه ۷۲ میلیارد پارامتری این مدل در محک OSWorld که وظایف سطح دسکتاپ را در سیستم‌عامل‌های مختلف می‌سنجد، به نرخ موفقیت ۵۸.۲٪ رسید؛ عددی که ۱۳.۲ امتیاز بالاتر از مدل رتبه دوم است. حتی مدل کوچک ۴ میلیارد پارامتری (4B) با قابلیت تفکر محلی، در یک تست GUI شامل ۱۰۰ وظیفه در سیستم‌عامل macOS امتیاز ۵۶٪ را کسب کرد، در حالی که Qwen3-VL-Plus در همان مجموعه تست تنها ۳۹٪ موفق بود. با این حال، WebRetriever Protocol I متمرکزتر باقی مانده و به‌طور خاص وظایف ناوبری و بازیابی وب را می‌سنجد. این تمرکز بر بازیابی دقیق، یادآور تفاوت‌های بنیادین عامل‌های هوش مصنوعی در برابر موتورهای جست‌وجوی سنتی در پردازش الگوهای پیچیده است.

جزئیات: سازوکار آموزش

برتری Mano-CUA حاصل یک خط لوله آموزشی سه مرحله‌ای است که به جای پیش‌بینی توکن بعدی، بر تکمیل وظیفه تمرکز دارد:

۱. تنظیم نظارت‌شده (SFT): آموزش اولیه روی داده‌های تعامل با GUI؛ مثل وقتی به یک پزشک عمومی، تخصص پوست می‌دهیم تا روی داده‌های بصری دقیق شود.
۲. یادگیری تقویتی آفلاین (Offline RL): آموزش با استفاده از مسیرهای ثبت‌شده (Logged Trajectories).
۳. یادگیری تقویتی آنلاین (Online RL): تعامل مستقیم مدل با رابط‌های زنده برای یادگیری از موفقیت‌ها و شکست‌ها.

این مرحله نهایی، تفاوت اصلی است. مدل یاد می‌گیرد که نه تنها یک کلیک درست چگونه است، بلکه اگر روی عنصر اشتباهی کلیک کرد، چگونه وضعیت را بازیابی کند. این فرآیند توسط یک حلقه «تفکر-اقدام-تأیید» پشتیبانی می‌شود. اگر منویی باز نشود یا فیلدی ورودی را رد کند، مدل پیام خطا را از روی اسکرین‌شات می‌خواند و استراتژی خود را در لحظه تغییر می‌دهد.

استقرار محلی و حریم خصوصی

برای توسعه‌دهندگانی که حریم خصوصی را اولویت می‌دانند، مدل کوانتیده (Quantized) ۴ میلیارد پارامتری روی سخت‌افزار Apple M5 Pro به صورت محلی اجرا می‌شود. این مدل با ۳۲ گیگابایت رم، سرعت رمزگشایی (Decoding) حدود ۸۰ توکن در ثانیه را ثبت می‌کند.

نصب این ابزار از طریق Homebrew امکان‌پذیر است:
brew tap Mininglamp-AI/tap && brew install mano-cua
mano-cua check
mano-cua install-sdk
mano-cua install-model
mano-cua run "fill out the application form on example.com" --local

استفاده از پرچم --local تضمین می‌کند که هیچ اسکرین‌شاتی به سرورهای خارجی ارسال نشود. در غیر این صورت، استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند، شبیه خودِ آشپزی و نه دوره آموزش آشپز — از طریق نقاط انتهایی ابری انجام می‌شود که سریع‌تر است اما نیازمند ارسال داده‌ها به سرور است.

این چرخش نشان می‌دهد عصر «یک مدل برای همه کارها» در حوزه‌های تخصصی به بن‌بست رسیده است. در حالی که مدل‌های عمومی انعطاف‌پذیرند، عامل‌های تخصصی در اتوماسیون مرورگر، تصویربرداری پزشکی و تولید کد به دلیل ترکیب داده‌های آموزشی هدفمند، پیشی می‌گیرند. یک مدل عمومی تنها از بخش کوچکی از داده‌هایش درباره GUI می‌آموزد، اما مدل تخصصی مثل Mano-CUA به‌طور خاص برای تکمیل وظیفه بهینه شده است.

توسعه‌دهندگان اکنون می‌توانند از این پروژه تحت لایسنس Apache 2.0 استفاده کنند. کدها، ابزارهای CLI و وزن‌های باز (Open Weights) — یعنی دستور پخت مدل علناً منتشر شده و نه فقط غذای آماده — در مخزن گیت‌هاب Mininglamp-AI در آدرس github.com/Mininglamp-AI/Mano-P در دسترس است که گزارش فنی کامل و تنظیمات بنچمارک را نیز میزبانی می‌کند.

گام بعدی شما

  • اگر از ابزارهای اتوماسیون مبتنی بر DOM خسته شده‌اید، مدل 4B را روی سخت‌افزار مک خود تست کنید.
  • مستندات GitHub پروژه Mano-P را برای درک حلقه «تفکر-اقدام-تأیید» مطالعه کنید.
  • بررسی کنید که آیا گردش‌های کاری شما در وب، قابلیت جایگزینی با عامل‌های بینایی خالص را دارند یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد اعتبار رویکرد مدل‌های تخصصی را در برابر مدل‌های عمومی تثبیت می‌کند. تخصص در تعامل با GUI می‌تواند هزینه و نرخ خطای اتوماسیون‌های سازمانی را به شدت کاهش دهد.

تأثیر برای ایران

به‌دلیل وزن‌های باز (Open Weights) و امکان اجرای محلی مدل 4B، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به APIهای تحریم‌شده و با حفظ حریم خصوصی، اتوماسیون‌های پیشرفته وب را پیاده‌سازی کنند.

·نگاه ما
تحریریه دات‌هوش

تکیه بر بینایی خالص به جای تحلیل کد DOM، یک چرخش بنیادین در معماری عامل‌هاست. این رویکرد نشان می‌دهد که برای رسیدن به استقلال واقعی در وب، مدل‌ها باید دنیا را همان‌طور که ما می‌بینیم (پیکسل‌ها) درک کنند، نه همان‌طور که برنامه‌نویسان آن را تعریف کرده‌اند (تگ‌ها). احتمالاً در آینده نزدیک، شاهد ظهور مدل‌های «بینایی-اول» خواهیم بود که لایه‌ی کد را کاملاً دور می‌زنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.