پرش به محتوای اصلی
پرش به محتوای مقاله

به‌روزرسانی Ankita: افزودن قابلیت کلیک و تایپ در محیط وب

·۵ مهر ۱۴۰۵۳ دقیقه مطالعه۱ بازدید
مرورگر زنده در کنار چت شما
مرورگر زنده در کنار چت شما
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

انتقال از دسترسی صرفاً خواندنی به کنترل فعال مرورگر در یک ابزار متن‌باز دسکتاپ، همراه با پیاده‌سازی سخت‌گیرانه تأیید انسانی برای هر تغییر در صفحه (Mutation).

تصور کنید دستیاری دارید که به‌جای دادن لینک‌های پیشنهادی، خودش وارد سایت شود، فرم‌های طولانی را پر کند و عملیات را به پایان برساند. این دیگر یک رویای آینده نیست، بلکه قابلیت جدیدی است که اکنون در دسترس کاربران پیشرفته قرار گرفته است.

طبق اعلام توسعه‌دهندگان، نسخه ۲.۴.۳ ابزار متن‌باز Ankita در ۲۷ سپتامبر ۲۰۲۶ منتشر شد و حالا می‌تواند یک مرورگر زنده را به‌طور فعال هدایت کند. در حالی که اکثر دستیارهای دسکتاپ تنها دسترسی خواندنی به وب دارند، Ankita اکنون می‌تواند کلیک کند، تایپ کند، اسکرول نماید و فرم‌ها را تکمیل کند. این نسخه یک «مرحله مرورگر» (Browser Stage) را مستقیماً در اپلیکیشن دسکتاپ ادغام کرده است. این رویکرد یادآور قابلیت‌های BrowserSkill است که پیش‌تر امکان اتصال عامل‌های هوش مصنوعی به جلسات فعال مرورگر را فراهم کرده بود.

بسیاری از دستیارهای هوش مصنوعی با وب مانند یک منبع اطلاعاتی ایستا برخورد می‌کنند. اما با ادغام یک مرورگر زنده، Ankita از یک چت‌بات ساده که لینک‌ها را خلاصه می‌کند، به یک عامل (Agent) تبدیل شده است که می‌تواند جریان‌های کاری (Workflows) را در سراسر وب اجرا کند. این تغییر، بازتاب‌دهنده حرکت گسترده‌تر صنعت به سمت قابلیت‌های «استفاده از کامپیوتر» (Computer Use) است؛ جایی که هوش مصنوعی با رابط‌های گرافیکی (GUI) دقیقاً مانند یک انسان تعامل می‌کند.

زمینه و قابلیت‌ها

مرحله مرورگر به‌طور مستقیم در اپلیکیشن دسکتاپ تعبیه شده است. کاربران می‌توانند تب‌های فعال، آدرس URL، وضعیت صفحه و محتوای فعلی صفحه را مشاهده کنند. رابط کاربری شامل دکمه‌های اختصاصی «توقف» (Stop) و «به دست گرفتن کنترل» (Take control) است تا کاربر بتواند در هر لحظه در روند کار دخالت کند.

Ankita پیش از این قادر به انجام کارهای محلی مانند اجرای دستورات، ویرایش فایل‌ها و مدیریت سرورهای MCP بود. ابزارهای جدید مرورگر اکنون از طریق یک سیستم «کشف ابزار» (Tool-discovery) به‌صورت On-demand بارگذاری می‌شوند. این مکانیزم تضمین می‌کند که پرامپت سیستمی (System Prompt) تا زمانی که واقعاً به مرورگر نیاز نباشد، بیش از حد حجیم نشود و سرعت پاسخ‌دهی مدل حفظ گردد. این تمرکز بر پردازش محلی، در راستای تقابل حریم خصوصی و نیاز به سخت‌افزار در مدل‌های زبانی محلی است که به کاهش وابستگی به ابر کمک می‌کند.

جزئیات فنی

به گزارش وب‌سایت dev.to، این سیستم از مکانیزم کشف ابزار برای بارگذاری قابلیت‌های مرورگر در زمان نیاز استفاده می‌کند. کاربران می‌توانند بین دو موتور پشتیبان (Backend) انتخاب کنند که هر دو به‌صورت پیش‌فرض غیرفعال هستند و باید توسط کاربر فعال شوند:

  • Playwright Browser: از یک پروفایل مجزای Chromium استفاده می‌کند تا دستیار هرگز با نشست‌های (Sessions) شخصی کاربر در مرورگر اصلی تماس نداشته باشد.
  • Chrome Local: از طریق یک سرور MCP متصل به Chrome DevTools عمل می‌کند. این گزینه امکاناتی برای استفاده از نشست‌های خصوصی (Private Session)، پورت دیباگ (Debug Port) یا حتی نشست شخصی خود کاربر را فراهم می‌کند.

سایر مشخصات فنی این به‌روزرسانی عبارتند از:

  • مدیریت فرم‌ها: ابزار fill_form می‌تواند تا ۱۰ فیلد مختلف را تنها با یک بار اسکن (Snapshot) از صفحه پر کند. این قابلیت از فیلدهای متنی، لیست‌های انتخابی (Selects) و چک‌باکس‌ها پشتیبانی می‌کند. این سطح از خودکارسازی در محیط وب، مشابه آنچه در ابزار aiFetchly برای حذف نیاز به ابزارهای ابری در پژوهش‌های تجاری مشاهده شد، است.
  • اتصالات: ناوبری فقط به پروتکل‌های HTTP و HTTPS محدود شده است و دسترسی به میزبان‌های خصوصی (Private Hosts) به‌طور پیش‌فرض مسدود است.
  • راه‌اندازی: فرآیند نصب دسکتاپ شامل نمایش پیشرفت دانلود Chromium، حالت پس‌زمینه (Background Mode) و تست اتصال پورت دیباگ است.
  • کنترل دامنه: هر پلاگین از لیست‌های دامنه‌های مجاز (Allowed) و مسدود (Blocked) پشتیبانی می‌کند.

امنیت در این سیستم بر اساس یک «ناهمسانی سخت‌گیرانه در دسترسی‌ها» طراحی شده است. در حالی که مدل می‌تواند صفحات را آزادانه بخواند، هر اقدامی که منجر به تغییر در صفحه شود (Mutate) — مانند کلیک بر روی یک دکمه یا ارسال یک فرم — نیازمند تأیید صریح انسان است. برای جلوگیری از نشت اطلاعات حساس، سیستم مقادیر رمز عبور را از اسنپ‌شات‌ها حذف (Redact) کرده و متن‌های وارد شده را در پیش‌نمایش‌های تأییدیه مخفی می‌کند. علاوه بر این، کلیک‌ها و ارسال فرم‌ها هرگز پس از یک اختلال در اتصال به‌طور خودکار تکرار نمی‌شوند؛ اگر مسیر بازیابی نتواند ثابت کند چه اتفاقی افتاده است، سیستم به‌جای تلاش کورکورانه، از کاربر سؤال می‌کند.

فراتر از مرورگر، به‌روزرسانی نسخه ۲.۴.۳ بر روی عملکرد عمیق سیستم متمرکز شده است. در ویندوز، توسعه‌دهنده عملیات ایجاد دستورات، کشف شل (Shell Discovery) و کارهای مربوط به درخت فرآیندها (Process-tree) را به یک Worker منتقل کرده است تا از مسدود شدن Event Loop اصلی برنامه جلوگیری شود. بررسی فایل‌ها اکنون از یک Worker مقیم استفاده می‌کند که در یک نمونه ۳۰ تایی از فایل‌های README، به میانگین زمان پاسخ‌دهی ۳.۳۷ میلی‌ثانیه (Warm Median) دست یافته است. بازترسیم‌های Markdown در ترمینال اکنون روی یک ضرب‌الاجل ثابت ۲۰ میلی‌ثانیه‌ای ادغام می‌شوند و trimming تاریخچه، هزینه‌ها را به‌صورت افزایشی اندازه‌گیری می‌کند تا نیازی به اسکن مجدد کل گفتگو نباشد.

سخت‌سازی امنیتی به سیستم فایل نیز گسترش یافته است. ابزار جدید اکنون مرزهای فضای کاری (Workspace Boundaries) را برای مسیرهای مطلق و نسبی، از جمله موجودی‌های Git، اجرا می‌کند. این اقدام باعث مسدود شدن خروج‌های غیرمجاز (Traversal Escapes)، لینک‌های نمادین داخلی (Interior Symlinks/Junctions)، نام‌های مستعار دستگاه‌های ویندوزی و جریان‌های داده جایگزین (Alternate Data Streams) می‌شود. نوشتن‌های اتمیک (Atomic Writes) از طریق فایل‌های استیجینگ (Staging) انحصاری و غیرقابل پیش‌بینی مدیریت می‌شوند. علاوه بر این، تشخیص‌های MCP و سیستم‌های جایگزین تأییدیه، اسرار و اعتبارنامه‌ها را از هدرها، فایل‌های پیکربندی، تنظیمات سرور و متغیرهای محیطی (Env Vars) حذف می‌کنند.

این نسخه در واقع شرط‌بندی بزرگی روی مدل «انسان در حلقه» (Human-in-the-loop) برای هوش مصنوعی عامل‌محور است. توسعه‌دهنده با اجباری کردن تأیید برای تغییرات اما آزاد گذاشتن خواندن، در حال تست این است که مرز بین خودمختاری و ایمنی در یک محیط محلی باید کجا باشد.

برای کاربر نهایی، این یعنی هوش مصنوعی می‌تواند کارهای خسته‌کننده وب — مانند پر کردن یک فرم ۱۰ فیلدی از روی یک اسنپ‌شات واحد — را بدون نیاز به کپی-پیست دستی انجام دهد. در واقع نقش مدل از یک «پژوهشگر» به یک «اپراتور دیجیتال» تغییر کرده است.

اعتبارسنجی این نسخه بسیار گسترده بوده است؛ در محیط GitHub Windows، این ابزار ۷۱۳ تست را با صفر خطا پشت سر گذاشته است. فایل اجرایی دسکتاپ در مقابل یک مدل محلی HTTP/SSE تست شد تا مواردی چون تغییر ظاهر، ارسال مرورگر، پیکسل‌های اسکرین‌شات، به دست گرفتن کنترل، دکمه Stop و ورودی‌های stdin/EOF ترمینال تأیید شوند. همچنین، هر چهار دارایی (Asset) منتشر شده از طریق هضم‌های SHA-256 تأیید شدند تا یکپارچگی بسته‌ها تضمین شود.

کاربران اکنون می‌توانند نسخه Portable را از صفحه Releases دانلود کرده و این پلاگین‌های مرورگر را در جریان‌های کاری خود تست کنند.

گام بعدی شما

  • اگر از ابزارهای متن‌باز برای خودکارسازی استفاده می‌کنید، نسخه Portable را از صفحه Releases دانلود کرده و پلاگین‌های مرورگر را تست کنید.
  • برای افزایش امنیت، حتماً لیست دامنه‌های مسدود (Blocked Domains) را بر اساس نیازهای خود تنظیم کنید.
  • عملکرد ابزار fill_form را روی فرم‌های پیچیده داخلی سازمان خود امتحان کنید تا میزان دقت استخراج داده‌ها را بسنجید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این به‌روزرسانی با تکیه بر اعتبار جامعه متن‌باز، استانداردی برای پیاده‌سازی ایمنِ کنترل مرورگر توسط AI ارائه می‌دهد. انتقال از مدل Read-only به Read-Write، مرز بین چت‌بات‌ها و عامل‌های عملیاتی را به‌طور جدی جابه‌جا می‌کند.

تأثیر برای ایران

به‌دلیل متن‌باز بودن Ankita، توسعه‌دهندگان ایرانی می‌توانند بدون وابستگی به APIهای گران‌قیمت و تحریم‌شده، عامل‌های عملیاتی خود را به‌صورت محلی (Self-hosted) پیاده‌سازی کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز Ankita بر مدل «تأیید برای تغییر» نشان می‌دهد که حتی در ابزارهای متن‌باز، اعتماد کامل به خودمختاری عامل‌ها (Agents) هنوز یک ریسک امنیتی غیرقابل قبول است. این رویکرد، مدلِ «ناظر انسانی» را به جای «جایگزینی انسان» تثبیت می‌کند. در واقع، ارزش واقعی این ابزار نه در حذف کاربر، بلکه در کاهش بار شناختی او از طریق تبدیل کارهای تکراری به یک دکمه تأیید است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.