پرش به محتوای اصلی
پرش به محتوای مقاله

BrowserSkill اتصال عامل‌های هوش مصنوعی به جلسات فعال مرورگر را ممکن کرد

·۲۵ شهریور ۱۴۰۵۳ دقیقه مطالعه۱ بازدید
عامل هوش مصنوعی BrowserSkill در حال تعامل با مرورگر زنده برای انجام وظایف وب‌محور
عامل هوش مصنوعی BrowserSkill در حال تعامل با مرورگر زنده برای انجام وظایف وب‌محور
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر رویکرد از ایجاد نمونه‌های جدید مرورگر (Instantiation) به اتصال به جلسات موجود (Attachment)؛ این یعنی مدل دیگر نیازی به لاگین مجدد ندارد و اثر انگشت دیجیتالی کاربر را به ارث می‌برد.

تصور کنید یک عامل هوش مصنوعی بتواند دقیقاً همان‌طور که شما با مرورگرتان کار می‌کنید، در کنار شما باشد و بدون اینکه هر بار از شما رمز عبور بخواهد، کارهای پیچیده را انجام دهد. این یعنی پایان دوران «راه‌اندازی سرد» (Cold Start) که در آن مدل‌ها باید هر بار از صفر وارد حساب‌های کاربری می‌شدند.

بیشتر عامل‌های فعلی در محیط‌های استریل و ایزوله‌ای به نام سندباکس (Sandbox) محبوس شده‌اند. اما طبق اعلام تنسنت (Tencent)، ابزار جدید آن‌ها یعنی BrowserSkill به مدل‌هایی مثل OpenAI Codex، Claude یا مدل‌های محلی اجازه می‌دهد مستقیماً به بستر فعال مرورگر کاربر متصل شوند. این ابزار در واقع یک لایه زیرساختی است که فاصله بین مدل و دنیای واقعی وب را از بین می‌برد.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، جداسازی محیط اجرا یک استاندارد بود، اما در عمل تبدیل به یک گلوگاه شد. ابزارهای رایج اتوماسیون مثل Playwright یا Puppeteer هر بار یک نمونه‌ی خام از کرومیوم می‌سازند. این محیط‌ها چون کوکی‌های فعال و جلسات احراز هویت‌شده شما را ندارند، مدل را مجبور می‌کنند هر بار با چالش‌های تایید دو مرحله‌ای (MFA) یا کلیدهای امنیتی سخت‌افزاری دست‌وپنجه نرم کند.

به گزارش مستندات این پروژه، مشکل فقط ورود به حساب‌ها نیست؛ بلکه سیستم‌های ضدتقلب (Anti-fraud) مانند Cloudflare و Akamai به‌سرعت متوجه می‌شوند که یک ربات در حال رندر کردن صفحه است. BrowserSkill با تغییر استراتژی از «ساخت مرورگر» به «اتصال به جلسه»، این مشکل را حل می‌کند.

گلوگاه سندباکس

بر اساس بررسی‌های فنی، درایورهای برنامه‌نویسی سنتی در محیط‌های سازمانی و وب۳ به سه دلیل شکست می‌خورند:

  • اصطکاک احراز هویت: نیاز به تکرار مراحل پیچیده ورود در هر بار اجرا.
  • شناسایی توسط سیستم‌های ضدتقلب: لو رفتن امضاهای اتوماسیون که باعث مسدود شدن دسترسی می‌شود.
  • ایزولاسیون زمینه: عدم دسترسی به داده‌های محلی مانند کیف پول‌های MetaMask یا Phantom.

معماری فنی

این سیستم عامل را از طریق رابط‌های دیباگ سطح پایین به پردازش در حال اجرای مرورگر متصل می‌کند. مکانیزم‌های کلیدی آن عبارت‌اند از:

  • تک‌گانه سازی CDP: اتصال به پروتکل ابزارهای توسعه کروم (CDP) از طریق پورت دیباگ (مثلاً ۹۲۲۲) که باعث حفظ وضعیت DOM و افزونه‌های فعال می‌شود.
  • تطبیق اثر انگشت: چون عملیات در پروفایل اصلی کاربر رخ می‌دهد، عامل هوش مصنوعی از امضاهای TLS واقعی و مسیرهای حرکت طبیعی موس بهره می‌برد.
  • حفظ زمینه: دسترسی فوری به حافظه محلی (Local Storage) و کوکی‌ها که صفحات ورود را کاملاً دور می‌زند. این رویکرد برای بهبود دقت مدل‌ها حیاتی است، مشابه آنچه در تلاش‌های موزیلا برای ادغام جست‌وجوی معنایی در تاریخچه مرورگر فایرفاکس برای دسترسی بهتر به داده‌های کاربر مشاهده کردیم.

برای ادغام این ابزار در پایتون، توسعه‌دهنده کافی است یک BrowserSkillDriver را با نقطه اتصال CDP مقداردهی کند. سپس با استفاده از تابع get_active_session_context() وضعیت احراز هویت را تایید کرده و با افزودن human_delay (تاخیر انسانی) برای دور زدن دقیق‌تر سیستم‌های شناسایی، دستورات را اجرا کند. این سطح از تعامل عمیق با محیط اجرا، یادآور معماری ReclaimLLM در ثبت تغییرات فایل‌ها در لایه‌ی بومی است که سعی دارد تعاملات هوش مصنوعی را در پایین‌ترین سطح ممکن رصد کند.

کاربردهای استراتژیک

این قابلیت برای چند گردش‌کار خاص بسیار قدرتمند است:

  • اتوماسیون وب۳: عامل می‌تواند در رابط یک dApp حرکت کند، در حالی که کاربر تراکنش‌ها را از طریق افزونه کیف پول تایید می‌کند؛ بدون اینکه کلیدهای خصوصی هرگز در معرض مدل زبانی قرار گیرند.
  • خط لوله‌های SaaS: اتوماسیون به‌روزرسانی‌های CRM داخلی یا پنل‌های مدیریتی که پشت لایه‌های پیچیده SSO قرار دارند.
  • دور زدن سیستم‌های ضدتقلب: استخراج داده از پلتفرم‌های با امنیت بالا بدون نیاز به سرویس‌های گران‌قیمت حل کپچا.

با این حال، این دسترسی خطرات امنیتی جدی دارد. یک حمله تزریق پرامپت (Prompt Injection) می‌تواند عامل را فریب دهد تا تراکنش‌های غیرمجاز در یک جلسه بانکی یا ایمیلی فعال انجام دهد. برای کاهش این ریسک، تنسنت پیشنهاد می‌کند از مرزهای اجرای سخت‌گیرانه و تایید دستی برای رویدادهای حساس DOM استفاده شود.

این چرخش به سمت زیرساخت‌های عامل‌محور محلی، مرورگر را از یک مانع به یک فضای کاری مشترک بین انسان و هوش مصنوعی تبدیل می‌کند.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، مخزن گیت‌هاب BrowserSkill را بررسی کنید تا نحوه اتصال به پورت ۹۲۲۲ کروم را یاد بگیرید.
  • برای پروژه‌های حساس، حتماً یک لایه تایید دستی (Manual Approval) برای هر کلیک روی دکمه‌های «ارسال» یا «پرداخت» تعریف کنید.
  • بررسی کنید که آیا گردش‌کارهای فعلی شما به دلیل MFA متوقف شده‌اند و آیا این ابزار می‌تواند جایگزین Playwright شود یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با حذف اصطکاک ورود به حساب‌ها، امکان استقرار عامل‌های کاربردی در مقیاس سازمانی را فراهم می‌کند. اعتبار این رویکرد در توانایی آن در تقلید کامل از رفتار انسانی برای دور زدن سیستم‌های امنیتی پیشرفته است.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت‌های شدید IP و سیستم‌های ضدتقلب در سرویس‌های خارجی روبرو هستند، این ابزار راهکاری برای کاهش نرخ مسدود شدن (Ban) عامل‌های استخراج داده فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی سندباکس با جلسات زنده، پارادایم عامل‌های هوش مصنوعی را از «شبیه‌ساز وب» به «همکار دیجیتال» تغییر می‌دهد. این رویکرد ریسک امنیتی را به شدت بالا می‌برد چون مدل اکنون به کلیدهای دسترسی فعال کاربر دسترسی دارد، اما در مقابل، نرخ موفقیت عملیات در وب واقعی را به دلیل حذف موانع احراز هویت، چندین برابر می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.