پرش به محتوای اصلی
پرش به محتوای مقاله

Ankita v2.5.1: کاهش مصرف توکن با راهنمای خودکار مرورگر

·۱۷ مهر ۱۴۰۵۴ دقیقه مطالعه
نسخه ۲.۵.۱ Ankita: مرورگر خود را توضیح می‌دهد — راهنمای خودکار، شواهد خواندنی صفحه و زمان اجرای محافظت‌شده
نسخه ۲.۵.۱ Ankita: مرورگر خود را توضیح می‌دهد — راهنمای خودکار، شواهد خواندنی صفحه و زمان اجرای محافظت‌شده
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی سیستم بارگذاری خودکار راهنمای مرورگر و تبدیل خروجی‌های وب به مارک‌داون ساختاریافته برای حذف تکرار در شناسایی صفحات؛ این یعنی توقف اتلاف توکن برای هر تب جدید.

اگر برای اجرای تسک‌های خودکار در وب هزینه می‌کنید، احتمالاً با مشکل «سوزاندن توکن» (Token Burn) آشنا هستید؛ وضعیتی که در آن عامل‌های هوش مصنوعی هزاران توکن را صرف حدس زدن ساختار یک صفحه می‌کنند و با هر بار بازنشانی، همه چیز را فراموش می‌کنند. Ankita در نسخه ۲.۵.۱ که در ۹ اکتبر ۲۰۲۶ منتشر شد، با تغییر رویکرد به مدیریت ساختاریافته، یکی از گران‌ترین مشکلات دنیای عامل‌های مرورگر را حل کرد. این به‌روزرسانی تضمین می‌کند که مرورگر داخلی زمانی که کاربر تسکی را به آن می‌سپارد و از سیستم فاصله می‌گیرد، به‌صورت پیش‌بینی‌پذیر رفتار کند.

بسیاری از عامل‌های هوش مصنوعی (AI Agents) — شبیه دستیاری که هر بار با باز کردن یک پنجره جدید، یادش می‌رود وب‌سایت را چطور کار کند — هر تب مرورگر را به عنوان یک صفحه سفید می‌بینند. آن‌ها هزاران توکن را صرف حدس زدن نحوه تعامل با یک صفحه می‌کنند، اما به محض اینکه زمینه (Context) بازنشانی شود، تمام آن درس‌ها را فراموش می‌کنند. این ناکارآمدی باعث می‌شود هزینه‌های API به‌سرعت بالا برود. این چالش‌ها در واقع ریشه در همان موانعی دارد که پیش‌تر در تحلیل ما درباره دلایل شکست مرورگرهای بومی هوش مصنوعی به دلیل هزینه‌های بالا بررسی کردیم. همان‌طور که در بحث‌های گذشته ما درباره‌ی بهینه‌سازی حافظه مدل‌ها اشاره کردیم، کلید کاهش هزینه در حذف تکرار است و Ankita اکنون در حال حذف همین ناکارآمدی است.

به نقل از یادداشت‌های انتشار در dev.to، هسته اصلی این به‌روزرسانی، بارگذاری خودکار راهنمای استفاده از مرورگر (browser-use guides) است. وقتی همراه هوشمند تشخیص دهد که ابزارهای مرورگر در یک جلسه فعال هستند، بلافاصله مجموعه دستورالعمل‌های کامل را بارگذاری می‌کند. این یعنی دیگر نیازی به فراخوانی‌های اضافی روتر یا انتقال‌های حافظه نیست و عامل از همان گام اول، صفحه را درست هدایت می‌کند. اکنون در هدر دسکتاپ، عبارت «Instructions loaded: browser-use» به‌طور صریح نشان می‌دهد که این راهنما بخشی از درخواست آماده‌شده است.

شواهد خوانا و ردیابی وضعیت

علاوه بر دستورالعمل‌ها، نحوه «دیدن» وب توسط عامل تغییر کرده است. به جای تخلیه متون خام (raw text dumps)، خوانش‌های مرورگر اکنون خروجی‌های ساختاریافته مارک‌داون (Markdown) برمی‌گردانند که شامل موارد زیر است:

  • عناوین، پاراگراف‌ها، لینک‌ها، لیست‌ها و جداول برای خوانایی بهتر.
  • جداسازی شواهد DOM پنهان برای تفکیک کنترل‌های اجرایی (actionable controls) از داده‌های پس‌زمینه.
  • فیلتر کردن اسکریپت‌ها، استایل‌ها و مقادیر فیلدهای خصوصی برای خلوت نگه داشتن پنجره زمینه (Context Window) — شبیه میز کاری که فقط کاغذهای ضروری روی آن است، نه کل کتابخانه.

این تغییر اجازه می‌دهد کاربر بدون نیاز به دریافت مجدد کل سورس صفحه، سوالات تکمیلی بپرسد. اکنون یک جستجوی تحت‌اللفظی (literal find) می‌تواند متونی را فراتر از اولین تکه (chunk) پیدا کند و خوانش‌های محدود (bounded reads) هویت منبع را حفظ می‌کنند.

برای حل مشکل «چرخنده تک» (Single Spinner) — وضعیتی که کاربر نمی‌توانست تشخیص دهد عامل گیر کرده است یا در حال کار می‌باشد — این به‌روزرسانی وضعیت‌های زنده مرورگر را به دسته‌های مجزایی تقسیم کرده است: «تفکر» (thinking)، «خواندن» (reading)، «اجرا» (acting)، «بررسی» (checking)، «بازیابی» (recovery)، «کمک دستی» (manual help) و «توقف» (Stop). هر یک از این وضعیت‌ها اکنون شمارنده عملیات تکمیل‌شده‌ی مخصوص به خود را دارند. علاوه بر این، دیالوگ‌های بومی (native dialogs) را می‌توان در حین تصاحب (takeover) پذیرفت یا رد کرد، و متن دیالوگ‌های گذرا از پخش پیشرفت (progress broadcasts) و تامنیل‌های مشترک حذف شده است.

حفاظ‌های فنی و اصلاحات

بر اساس مستندات فنی، این نسخه یک خطای بحرانی را برطرف کرده است؛ جایی که دسته‌های ترکیبی از اقدامات مرورگر، ارجاعات خود را باطل می‌کردند. سیستم اکنون هر هدف زنده را قبل از اولین ویرایش و دوباره قبل از هر گام بعدی بررسی می‌کند. این یعنی اگر یک گره (Node) جایگزین یا غیرفعال شود، عامل به‌جای تکرار کورکورانه یک اقدام شکست‌خورده، به‌صورت ایمن متوقف می‌شود. پیوندهای اصلی گره/UID در مراحل میانی معتبر می‌مانند و اسنپ‌شات نهایی ارجاعات جدیدی را ارائه می‌دهد.

سایر اصلاحات کلیدی عبارتند از:

  • جلوگیری از ارث‌بری شناسه‌های قدیمی Playwright در کنترل‌های هم‌نام و ویژگی‌های کپی‌شده DOM ref.
  • عدم پذیرش منوهای سفارشی در Selectهای بومی و ارائه راهنمایی به عامل برای کلیک روی گزینه‌های مشاهده‌شده.
  • جلوگیری از اجرای مجدد خودکار اقداماتی که باعث باز شدن دیالوگ‌های بومی می‌شوند.

برای کاربران حرفه‌ای، یک محیط اجرای محافظت‌شده (با فعال‌سازی BROWSER_RUNTIME_V2=on) معرفی شده که رسیدهای ساختاریافته برای توالی‌های اجرا شده، ناقص، شکست‌خورده یا نامطمئن ارائه می‌دهد. این حالت آزمایشی از نمونه‌های ایزوله Chromium با دانلودهای محدود فضای کاری و انتخاب‌های صریح برای آپلود پشتیبانی می‌کند. همچنین، انتقال‌های غیرپشتیبانی شده در connected-Chrome اکنون به‌جای حدس زدن، رد می‌شوند.

در سمت ارائه‌دهنده، شفافیت خطاها بهبود یافته است. سیستم اکنون تفاوت بین محدودیت نرخ (Rate Limit)، مشکلات سهمیه (quota issues)، خطاهای احراز هویت، دسترسی به مدل‌های پولی، مسیرهای مخصوص کلاینت و عدم در دسترس بودن آپ‌استریم‌ها را تشخیص می‌دهد. همچنین مدل Keyless Kilo اکنون مسیرهایی که نیاز به دسترسی پولی دارند را فیلتر می‌کند و به‌جای حدس زدن، بر اساس متادیتای اعلام‌شده برای تعیین قابلیت‌های بینایی عمل می‌کند. این رویکرد بهینه‌سازی دسترسی، مشابه راهکاری است که CogniRunner برای ادغام مدل‌های بدون کلید در جریان‌های کاری Jira به کار گرفت تا وابستگی به زیرساخت‌های گران‌قیمت را کاهش دهد.

کنترل توکن و زمینه

این به‌روزرسانی نشان‌دهنده چرخش به سمت طراحی «توکن-آگاه» است. با تبدیل تعامل با مرورگر به یک مهارت ساختاریافته به‌جای بازی حدس‌زدنی، Ankita هزینه عملیاتی تسک‌های خودمختار طولانی را کاهش می‌دهد. برای کاربر نهایی، این یعنی تکمیل سریع‌تر تسک‌ها و صورت‌حساب‌های کمتر API.

برای مدیریت بیشتر هزینه‌ها، چندین سوئیچ اختیاری و مستقل اضافه شده است:

  • تمرکز بر ابزار مرورگر (Browser tool focus): حفظ عامل و حافظه در حالی که شناسایی‌های نامرتبط رد می‌شوند.
  • فشرده‌سازی تاریخچه فقط برای درخواست‌ها (Request-only history compaction) و حفظ شواهد مبنی‌سازی شده (grounded evidence retention).
  • تشخیص‌های صفحه تغییرنیافته (Unchanged-page diagnostics) و متریک‌های بایت برای درخواست/طرح‌واره/تاریخچه جهت مقایسه‌های آزمایشگاهی.

توسعه‌دهنده اشاره کرده که در اجرای CI ویندوز، ۳ مورد از ۱۱۱۹ تست شکست خورده است. دو مورد از فیکسچرهای connected-Chrome اولین ناوبری خود را متوقف کردند و یک فیکسچر سبد خرید (cart fixture) هیچ ویرایشی را ثبت نکرد. با این حال، مجموعه‌های بومی محلی به‌طور کامل پاس شدند و نسخه به‌صورت دستی منتشر شد تا چرخه تکرار تست‌ها متوقف شود.

کاربران اکنون می‌توانند سقف دورهای ابزار را از طریق MAX_TOOL_STEPS (که پیش‌فرض آن ۱۰۰ است) تنظیم کنند. این یک شیر اطمینان ضروری برای عامل‌هایی است که ممکن است در حین ناوبری‌های پیچیده وب وارد حلقه‌های بی‌نهایت شوند.

برای بررسی این ویژگی‌ها، می‌توانید کد منبع را در گیت‌هاب به آدرس https://github.com/akyourowngames/A.N.K.I.T.A بیابید. فوری‌ترین بهبوداتی که می‌توانید تست کنید، دستورالعمل‌های خودکار و شواهد خوانا هستند که هر دو به‌صورت پیش‌فرض فعال شده‌اند. کاربران CLI همچنین از یک برگه تقلب (cheatsheet) جدید برای دستورات /commands بهره‌مند می‌شوند که شامل تکمیل زیردستورها و پیشنهاداتی برای غلط‌های تایپی است.

گام بعدی شما

  • اگر از عامل‌های مرورگر استفاده می‌کنید، متغیر BROWSER_RUNTIME_V2 را برای دریافت رسیدهای دقیق از اجرای تسک‌ها فعال کنید.
  • سقف MAX_TOOL_STEPS را بر اساس پیچیدگی تسک‌های خود تنظیم کنید تا از اتلاف توکن در حلقه‌های تکراری جلوگیری شود.
  • خروجی‌های مارک‌داون جدید را برای بررسی دقت استخراج داده‌ها از صفحات وب تست کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این به‌روزرسانی با کاهش چشمگیر اتلاف توکن، هزینه عملیاتی عامل‌های خودمختار را پایین می‌آورد و پایداری آن‌ها را در تسک‌های طولانی افزایش می‌دهد. تکیه بر شواهد ساختاریافته به‌جای متن خام، دقت استنتاج را بالا برده و احتمال توهم در ناوبری وب را کم می‌کند.

تأثیر برای ایران

به‌دلیل متن‌باز بودن Ankita، توسعه‌دهندگان ایرانی می‌توانند بدون وابستگی به اشتراک‌های گران‌قیمت، از این ساختار برای کاهش هزینه API مدل‌های زبانی در پروژه‌های خود استفاده کنند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی حدس‌زدن با دستورالعمل‌های پیش‌بارگذاری شده، پارادایم تعامل عامل‌ها با وب را از «اکتشاف لحظه‌ای» به «اجرای مهارت» تغییر می‌دهد. این رویکرد نشان می‌دهد که برای رسیدن به مقیاس واقعی، عامل‌ها نباید هر بار چرخ را اختراع کنند، بلکه باید از لایه‌های انتزاعی برای توصیف رابط‌های کاربری استفاده کنند. در واقع، Ankita در حال تبدیل مرورگر از یک محیط ناشناخته به یک API ساختاریافته است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.