پرش به محتوای اصلی
پرش به محتوای مقاله

تفکیک برنامه‌ریزی از اجرا؛ راهکار ANCHOR برای حذف توهمات در اتوماسیون وب

·۱۸ مهر ۱۴۰۵۵ دقیقه مطالعه
عامل خودکار هوش مصنوعی در حال تحلیل رابط کاربری و تصمیم‌گیری برای کلیک کردن
عامل خودکار هوش مصنوعی در حال تحلیل رابط کاربری و تصمیم‌گیری برای کلیک کردن
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی معماری تفکیک‌شده در ANCHOR که با استفاده از مدل‌های بسیار کوچک (4B) و یک مجری غیر-AI، نرخ موفقیت اتوماسیون وب را به ۸۴٪ رسانده و توهمات اجرایی را تقریباً حذف کرده است.

تصور کنید یک مدل زبانی کوچک را برای مدیریت کارهای وب استخدام کرده‌اید، اما او در ۲۵٪ مواقع با اطمینان کامل ادعا می‌کند کاری را تمام کرده، در حالی که در واقع شکست خورده است. این «موفقیت کاذب» (False Success) زمانی رخ می‌دهد که مدل‌های زبانی بزرگ (LLM) در کنترل مستقیم مرورگرهای وب، درباره پیشرفت خود دروغ می‌گویند. این موضوع شکافی خطرناک در قابلیت اطمینان ایجاد می‌کند که هر کسب‌وکاری را در مواجهه با جریان‌های کاری حساس و حیاتی، دچار ریسک می‌کند.

همان‌طور که در تحلیل قبلی ما درباره‌ی ابزارهای رصد صدای برندها اشاره کردیم، صنعت اکنون از تحلیل داده‌ها به سمت لایه‌ی «عامل‌محور» (Agentic) حرکت می‌کند؛ جایی که اجرای واقعی دستورات رخ می‌دهد. اکثر ابزارهای فعلی اتوماسیون رباتیک یا RPA، بر اساس شناسه‌های سخت‌گیرانه‌ای (Rigid Selectors) کار می‌کنند که با کوچک‌ترین تغییر در کد سایت، از کار می‌افتند. برای مثال، اسکریپتی که از دستور page.locator('[data-test="add-to-cart"]').click() استفاده می‌کند، اگر سایت تنها یک ویژگی (Attribute) خاص را تغییر دهد، بلافاصله شکست می‌خورد. راهکار رایج و ترند فعلی این است که اجازه دهیم یک مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — صفحه را «ببیند» و کلیک کند، اما طبق تجربه یک دانشجوی مهندسی کامپیوتر در مانائوس برزیل، این روش اساساً ناپایدار است.

زمینه و بستر ANCHOR

برای حل این مشکل، توسعه‌دهنده این پروژه ANCHOR را ساخت؛ یک عامل اتوماسیون وب محلی. این سیستم به‌گونه‌ای طراحی شده است که روی سخت‌افزارهای معمولی و متواضعانه اجرا شود؛ به‌طور مشخص از یک کارت گرافیک GTX 1050 Ti با ۴ گیگابایت حافظه ویدیویی (VRAM) استفاده می‌کند. این سیستم از مدل‌های کوچک، به‌ویژه Qwen 3.5 در نسخه‌های ۴ و ۹ میلیارد پارامتری استفاده می‌کند که از طریق Ollama اجرا می‌شوند.

به نقل از مستندات پروژه، ANCHOR به‌جای دادن کنترل مستقیم به هوش مصنوعی برای کلیک کردن، از یک معماری تفکیک‌شده (Split Architecture) استفاده می‌کند:

  • برنامه‌ریز (Planner): مدل زبانی درخواست کاربر را به زبان ساده دریافت می‌کند (مثلاً: «ماریا سیلوا، بخش IT، پیمانکار را ثبت‌نام کن، شرایط را بپذیر و ذخیره کن») و یک خلاصه شماره‌گذاری شده از عناصر صفحه را می‌گیرد. سپس یک نقشه شامل اهداف و گام‌ها با استفاده از نام عناصر برمی‌گرداند، مانند «پر کردن نام کامل» یا «تیک زدن پیمانکار».
  • مجری (Executor): یک موتور غیر-هوش مصنوعی و قطعی (Deterministic) است که نقشه را اجرا می‌کند. این موتور از یک روش اکتشافی (Heuristic) برای یافتن عناصر استفاده می‌کند که متن، برچسب‌ها، نقش‌ها و زمینه (شامل مترادفات و متن‌های مجاور) را با هم ترکیب می‌کند.

اگر مجری در مورد یک عنصر شک کند، از اقدام خودداری می‌کند. در این حالت، کاربر تصمیم می‌گیرد و گزینه شماره‌گذاری شده درست را روی صفحه انتخاب می‌کند. این انتخاب توسط سیستم به خاطر سپرده می‌شود تا در دفعات بعدی، عامل دوباره همان سوال را نپرسد.

عامل خودکار با مدل زبانی بزرگ روی دکمه‌ای کلیک نمی‌کند.

جزئیات اجرا

بر اساس بررسی‌های فنی، اثر هر اقدام به‌طور سخت‌گیرانه بررسی می‌شود تا مشخص شود آیا صفحه تغییر کرده است، آیا یک فیلد مقدار خود را حفظ کرده یا اینکه خطایی ظاهر شده است. در نهایت، نتیجه نهایی در برابر درخواست اصلی کاربر تأیید می‌شود. این سازوکار مانع از ایجاد حلقه‌ی «موفقیت کاذب» می‌شود که در عامل‌های تحت کنترل مستقیم LLM بسیار رایج است.

این طراحی اجازه می‌دهد تا گردش کار «یک‌بار یادگیری، دفعات زیاد اجرا» شکل بگیرد:

  • اجرای اول: مدل وظیفه را برنامه‌ریزی می‌کند که در سخت‌افزار مذکور (GTX 1050 Ti) حدود ۷۰ ثانیه زمان می‌برد.
  • تکرار (Replay): اجراهای بعدی از نقشه تأیید شده استفاده می‌کنند بدون اینکه نیازی به فراخوانی مجدد مدل باشد. این فرآیند تنها در حدود ۳ ثانیه انجام می‌شود که به عامل اجازه می‌دهد ردیف‌های یک جدول اکسل را با سرعت بسیار بالا پردازش کند.
  • بازیابی (Recovery): اگر سایت تغییر کند و یکی از گام‌های ذخیره شده از کار بیفتد، ANCHOR تغییر را شناسایی و ثبت می‌کند و به کاربر اجازه می‌دهد تغییرات را بازبینی یا لغو کند.

دلیل عدم کلیک مدل زبانی بزرگ در عامل خودکارسازی

بنچمارک‌های استواری

توسعه‌دهنده یک بنچمارک استواری ساخت که شامل ۳۰ وظیفه در ۵ سطح تغییرات صفحه بود: تغییر نام شناسه‌ها (IDs)، استفاده از مترادفات، تغییر ساختار چیدمان (Layout)، بنرهای کوکی یا بخش‌های پنهان، و ایجاد عناصر فریبنده (Decoys) که حاوی دستورات تزریق شده بودند. در مجموع ۱۵۰ اجرا برای هر مدل، نتایج بسیار واضح بود:

  • اسکریپت‌های سنتی RPA (شناسه ثابت): ۵۳٪ وظایف انجام شد؛ صفر مورد موفقیت کاذب.
  • کنترل مستقیم LLM (مدل‌های 4B / 9B): ۶۸٪ و ۷۲٪ موفقیت؛ اما به ترتیب ۳۳ و ۴۱ مورد موفقیت کاذب.
  • سیستم ANCHOR (مدل‌های 4B / 9B): ۸۲٪ و ۸۴٪ موفقیت؛ تنها ۲ و ۱ مورد موفقیت کاذب.

یک نقطه ضعف قابل توجه برای ANCHOR، صفحاتی است که محتوا در آن‌ها پشت دکمه‌های «نمایش بیشتر» (Show more) پنهان شده است؛ جایی که نرخ موفقیت آن به ۴۷٪ کاهش یافت، در حالی که عامل‌های کنترل‌کننده مستقیم بین ۵۷ تا ۶۰٪ موفق بودند.

درس‌های حاصل از توسعه

توسعه این پروژه سه بینش حیاتی را درباره اتوماسیون هوش مصنوعی آشکار کرد:

۱. اندازه‌گیری مستمر: بنچمارک‌های جامع باگ‌هایی را شکار کردند که تست‌های تک‌موردی نادیده می‌گرفتند. برای مثال، یک سد امنیتی برای جلوگیری از اقدامات مخرب، به‌طور تصادفی اجازه می‌داد دستور «حذف همه» اجرا شود، در حالی که درخواست کاربر فقط «حذف برونو لیما» بود.
۲. حساسیت به پرامپت: اضافه کردن تنها دو خط به پرامپت برای استخراج جدول باعث شد مدل ۴ میلیاردی جست‌وجوها را زودتر از موعد متوقف کند و مدل ۹ میلیاردی انواع قراردادها را نادیده بگیرد. راهکار این بود که آن خطوط فقط در زمان درخواست‌های خواندن داده ارائه شوند.
۳. مرزهای امنیتی: نسخه ۰.۳.۱ پس از آن ساخته شد که توسعه‌دهنده متوجه شد مدل در حین تست‌های لینکدین، رمزهای عبور را پردازش می‌کند. اکنون ANCHOR هر درخواستی که شامل رمز عبور باشد را رد می‌کند و کاربر باید به‌صورت دستی وارد حساب شود.

برای کاربر عملی، این یعنی آینده اتوماسیون نه در «خودمختاری کامل»، بلکه در «برنامه‌ریزی به کمک هوش مصنوعی با اجرای قطعی» است. در حال حاضر کد این پروژه تحت لایسنس PolyForm Strict در گیت‌هاب در دسترس است. انتظار می‌رود در نسخه بعدی (۰.۴)، پشتیبانی از iframeها، تب‌های جدید و آپلود/دانلود فایل‌ها اضافه شود.

گام بعدی شما

  • اگر از ابزارهای RPA سنتی خسته شده‌اید، کد ANCHOR را در گیت‌هاب بررسی کنید تا با مفهوم تفکیک Planner و Executor آشنا شوید.
  • در طراحی عامل‌های خود، به‌جای اعتماد به ادعای مدل در مورد اتمام کار، یک لایه تأییدیه (Verification) مستقل برای تغییرات DOM صفحه اضافه کنید.
  • برای کاهش هزینه و افزایش سرعت، از مدل‌های کوچک (SLM) برای برنامه‌ریزی و موتورهای کدنویسی شده برای اجرا استفاده کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد با کاهش نرخ موفقیت‌های کاذب، اعتماد به عامل‌های هوش مصنوعی را در محیط‌های عملیاتی افزایش می‌دهد. تخصص در تفکیک لایه‌ی برنامه‌ریزی از اجرا، کلید عبور از دموهای جذاب به ابزارهای صنعتی قابل اتکا است.

تأثیر برای ایران

به‌دلیل متن‌باز بودن کد در گیت‌هاب و قابلیت اجرا روی سخت‌افزارهای معمولی (مثل GTX 1050 Ti)، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به APIهای گران‌قیمت و تحریم‌شده، عامل‌های اتوماسیون محلی بسازند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی کنترل مستقیم مدل با یک موتور قطعی، پذیرش این واقعیت است که LLMها برای «تصمیم‌گیری» عالی اما برای «تکمیل دقیق عملیات» غیرقابل اعتماد هستند. این رویکرد، پارادایم اتوماسیون را از تلاش برای ساخت یک مدل همه‌فن‌حریف به سمت معماری‌های ترکیبی (Hybrid) می‌برد که در آن هوش مصنوعی فقط نقش معمار را دارد، نه کارگر اجرایی.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.