پرش به محتوای اصلی
پرش به محتوای مقاله

AutoBot در برابر Sol Max؛ برتری حافظه سلسله‌مراتبی در مدیریت سیستم‌عامل

·۲۶ شهریور ۱۴۰۵۸ دقیقه مطالعه
ربات خودکار: ابزار داخلی تیم تولید خودکار با قابلیت‌های صوتی ChatGPT و رابط کاربری OpenAI
ربات خودکار: ابزار داخلی تیم تولید خودکار با قابلیت‌های صوتی ChatGPT و رابط کاربری OpenAI
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی یک لایه مدیریت وضعیت محلی که اجازه می‌دهد عامل‌ها بدون تغییر مدل، از طریق اصلاح خودکار چارچوب و حافظه سلسله‌مراتبی روی دیسک، نرخ موفقیت خود را در محیط سیستم‌عامل افزایش دهند.

تصور کنید یک لایه مدیریتی هوشمند و پیچیده داشته باشید که به عامل‌های هوش مصنوعی اجازه می‌دهد خطاهای گردش‌کار خود را شناسایی کرده، آن‌ها را تعمیر کنند و حافظه سازمانی‌شان را روی دیسک محلی ذخیره نمایند. AutoBot دقیقاً همین کار را می‌کند؛ یک چارچوب (Harness) متن‌باز که بدون نیاز به آموزش یا تغییر مدل، نرخ تکمیل وظایف ChatGPT را ۱۸.۵٪ نسبت به خط‌مای منتشر شده‌ی OpenAI Sol Max افزایش داده است.

بسیاری از عامل‌های امروزی با مشکلی به نام «انحراف زمینه» (Context Drift) دست‌وپنجه نرم می‌کنند؛ وضعیتی که در آن مدل با طولانی شدن گفتگو، هدف اصلی را فراموش می‌کند. همان‌طور که در تحلیل قبلی ما درباره‌ی تلاش‌های OpenAI برای گزارش عدم همراستایی مدل‌ها اشاره کردیم، صنعت اکنون به سمت ایجاد حفاظ‌های ساختاری حرکت می‌کند تا از توهم (Hallucination) — وضعیتی که در آن عامل‌ها موفقیت کاذب را گزارش می‌کنند — جلوگیری شود. AutoBot با تبدیل محیط عامل به یک ماشین وضعیت پایدار (Persistent State Machine)، به‌جای یک جلسه چت گذرا، این مشکل را حل می‌کند.

بنچمارک‌ها و عملکرد

طبق مستندات این پروژه که در ۱۷ سپتامبر ۲۰۲۶ منتشر شد، AutoBot در گردش‌کارهای طولانی و چندبرنامه‌ای پیروزی‌های چشمگیری به دست آورده است. در محک OSWorld 2.0، این ابزار در ۱۰۸ وظیفه مختلف به صحت باینری ۳۲.۴۱٪ و صحت جزئی ۶۴.۲۸٪ رسید و توانست از مدل Claude Opus 5 Max شرکت Anthropic پیشی بگیرد. این نتایج در مقایسه با وضعیت لیدربورد در تاریخ ۱۰ سپتامبر ۲۰۲۶ به دست آمده است.

اتوبات: سامانه کنترل حریم‌خصوصی با قابلیت‌های صوتی و رابط کاربری ChatGPT برای تیم تولید خودکار

علاوه بر این، AutoBot در حال حاضر رتبه اول لیدربورد تست‌های پنهان (Hidden-test) در AssistantBench را در اختیار دارد. این سیستم با ثبت صحت ۵۰.۷۰٪ در ۱۸۱ وظیفه، رویکرد خود را در کارهای پیچیده دانشی به اثبات رساند. جالب است بدانید این چارچوب پیش از تغییر نام به AutoBot در دو هفته گذشته، با نام «AutoAssist» شناخته می‌شد و اسکرین‌شات‌های بنچمارک پیش از این تغییر نام ثبت شده‌اند.

ربات خودکار: ابزار داخلی تیم تولید خودکار با قابلیت‌های صوتی ChatGPT و رابط کاربری OpenAI، با تمرکز بر حریم خصوصی.

مکانیزم خودبهبودی

AutoBot به عنوان یک «چارچوب عامل‌محور خودبهبودبخش» عمل می‌کند. وقتی یک گردش‌کار شکست می‌خورد یا نیاز به بهینه‌سازی دارد، عامل به‌طور مستقل چارچوب (Harness) خود را تعمیر کرده و سپس این تغییرات را اعتبارسنجی می‌کند. این بهبودها به وظایف بعدی منتقل می‌شوند و باعث می‌شوند سیستم بدون نیاز به آموزش مجدد مدل زیربنایی، توانمندی‌هایش را به‌صورت ترکیبی افزایش دهد. در واقع، مواجهه با گردش‌کارهای دشوار، اساساً به ارتقای خودِ عامل تبدیل می‌شود.

مدیریت حافظه و وضعیت

برای حل محدودیت پنجره متنی (Context Window) — که مثل میز کاری است که فقط جای چند ورق دارد و نه کل کتابخانه — AutoBot حافظه‌ای سلسله‌مراتبی را مستقیراً روی دیسک کاربر پیاده می‌کند. این سیستم از بازیابی‌های متمرکز بر وظیفه (Task-specific retrieval) برای ساخت زمینه فعال استفاده کرده و هر شب عملیات «تثبیت شبانه» (Nightly Consolidation) را برای ادغام دانش جدید و اصلاحات انجام می‌دهد. این سازوکار اجازه می‌دهد عامل، حافظه سازمانی خود را در پروژه‌های مختلف و گفتگوهای گوناگون انباشته کند.

این معماری تضمین می‌کند که پروژه‌ها با پایان یافتن یک جلسه چت خاص، از بین نروند. با استفاده از گراف‌های وظیفه پایدار و نقاط بازرسی اتمی (Atomic Checkpoints)، یک عامل جایگزین می‌تواند دقیقاً از همان جایی که عامل قبلی متوقف شده بود، کار را از سر بگیرد. در این سیستم، اتمام کار تنها زمانی پذیرفته می‌شود که با الزامات فعلی مطابقت داشته باشد و شواهد مقصد (Destination Evidence) تأیید شوند.

مناطق حریم خصوصی و امنیت

AutoBot مدل سخت‌گیرانه‌ای از «حریم خصوصی بر اساس رابطه» را معرفی کرده است. داده‌ها به چهار منطقه مجزا تقسیم می‌شوند تا هیچ اطلاعاتی به‌طور خودکار وارد زمینه مشترک نشود:

  • PRIVATE: حقایق حساس شخصی، ترجیحات، داده‌های سلامت، امور مالی و برنامه‌های خصوصی؛ این اطلاعات هرگز به‌طور خودکار به اشتراک گذاشته نمی‌شوند.
  • FAMILY_FRIENDS: روابط، رویدادها، تدارکات و الگوهای ارتباطی شخصی مجاز؛ این داده‌ها هرگز برای کارهای اداری استفاده نمی‌شوند مگر اینکه نیاز صریح و فعلی وجود داشته باشد.
  • WORK: سازمان‌ها، پروژه‌ها، هم‌تیمی‌ها، مشتریان، تأمین‌کنندگان و الگوهای ارتباط حرفه‌ای؛ این‌ها هرگز برای ارتباطات شخصی استفاده نمی‌شوند مگر اینکه صراحتاً مرتبط باشند.
  • SHARED: حداقل حقایقی که کاربر آگاهانه اجازه می‌دهد بین مناطق جابه‌جا شوند؛ این بخش فقط با انتخاب کاربر (Opt-in) و با ذکر منبع فعال می‌شود.

این مناطق در واقع پوشه‌ها و قوانین عملیاتی درون یک حساب macOS هستند و گاوصندوق‌های رمزگذاری‌شده مجزا یا مرزهای سخت‌افزاری امنیتی نیستند. توسعه‌دهندگان برای دستیابی به جداسازی قوی‌تر، استفاده از حساب‌های کاربری مجزا در مک یا ماشین‌های متفاوت را توصیه می‌کنند.

قرارداد تکمیل پنج‌مرحله‌ای

برای جلوگیری از عادت رایج مدل‌های هوش مصنوعی به ادعای «اتمام کار» در حالی که هنوز ناتمام است، AutoBot یک فرآیند اعتبارسنجی پنج‌مرحله‌ای را اجباری می‌کند:
۱. تکمیل تحقیق (research_complete)
۲. تکمیل پیش‌نویس (draft_complete)
۳. به‌روزرسانی مقصد (destination_updated)
۴. تأیید ذخیره‌سازی (save_confirmed)
۵. تأیید بازخوانی رندر شده (rendered_readback_verified)

سیستم محلی ترتیب این مراحل را اجرا کرده و هش‌های شواهد (Evidence Hashes) را ردیابی می‌کند. نکته کلیدی این است که برچسب اعتبارسنج (Validator) باید با برچسب تولیدکننده (Producer) متفاوت باشد. این یعنی یک اعتبارسنج واقعاً مجزا باید از شواهد تازه استفاده کند و مقصد معتبر را برای کارهای خارجی بازرسی نماید. این استقلال رویه‌ای تضمین می‌کند که یک گزارش ساده «انجام شد» تحت قرارداد عملیاتی کافی نباشد.

سیاست نوشتار پاک (Clean Write)

AutoBot اکثر APIها، رابط‌ها، ابزارهای MCP، ادغام‌های مرورگر و اپلیکیشن‌های شخص ثالث را به‌صورت پیش‌فرض «فقط خواندنی» در نظر می‌گیرد، مگر اینکه یک آداپتور مخصوص مقصد، ویژگی‌های «نوشتار پاک» را اثبات کند. برای نوشتن در مقاصدی که برای گیرنده قابل مشاهده است، سیستم از اپلیکیشن رسمی (First-party) که کاربر در آن وارد شده، از طریق قابلیت Computer Use در ChatGPT استفاده می‌کند.

سیستم پیش از هر اقدام، حساب، مقصد، محدوده (Scope) و محتوای نهایی قابل مشاهده را تأیید می‌کند. پس از آن، گردش‌کار باید نتیجه رندر شده را بازبینی کند تا از تغییر مورد نظر مطمئن شود، نبود تکرار را بررسی کند، از عدم شکست عملیات اطمینان یابد و چک کند که هیچ عبارت یا برچسبی مبنی بر «تولید شده توسط AI» یا «ChatGPT» اضافه نشده باشد. اگر پلتفرمی برچسب غیرقابل حذف را تحمیل کند یا نتیجه مبهم باشد، گردش‌کار باید فوراً متوقف شود و نباید ادعای موفقیت کند.

ادغام با ChatGPT بومی

AutoBot یک چت‌بات مستقل، مدل جدید یا درگاه (Gateway) برای عامل‌ها نیست، بلکه ترکیبی از دو لایه است: اپلیکیشن دسکتاپ ChatGPT (شامل قابلیت‌های Voice، Goals، مهارت‌ها، پلاگین‌ها و Computer Use) و فضای کاری AutoBot (شامل قرارداد عملیاتی AGENTS.md، مناطق حریم خصوصی و یک ناظر زنده یک‌دقیقه‌ای).

این سیستم از CPU محلی برای مدیریت ارکستراسیون، وضعیت و بررسی‌های یکپارچگی استفاده می‌کند. با کامپایل کردن زمینه و شواهد قابل استفاده مجدد به‌صورت محلی، هزینه استنتاج (Inference) کاهش یافته و بودجه مدل صرف تصمیمات دشواری می‌شود که کار را به جلو می‌برد. این ابزار کاملاً به قابلیت‌های فعلی ChatGPT، از جمله پلن کاربر، منطقه جغرافیایی و محدودیت‌های دسترسی وابسته است.

مقایسه با OpenClaw و Hermes

در مقایسه با جایگزین‌هایی مثل OpenClaw و Hermes، تمرکز AutoBot بر مرزهای صریح و اعتبارسنجی رویه‌ای است.

در برابر OpenClaw:
این رقابت در واقع تکامل رویکردهای میزبانی شخصی است؛ جایی که پروژه OpenClaw 2.0 با تمرکز بر سرعت میزبانی استانداردهای جدیدی را تعریف کرده بود و اکنون AutoBot لایه‌های امنیتی را به آن می‌افزاید.

  • حافظه: در حالی که OpenClaw حافظه را ذخیره و جستجو می‌کند، AutoBot مناطق حریم خصوصی مبتنی بر رابطه را اضافه کرده تا قوانین استفاده از زمینه خصوصی در کارهای اداری صریح‌تر باشد.
  • وظایف: OpenClaw وظایف پس‌زمینه را ثبت می‌کند؛ اما AutoBot برای هر خروجی یک مالک، یک مقصد و یک دروازه تکمیل تعیین می‌کند تا سوابق دقیق‌تری از موارد باقی‌مانده داشته باشد.
  • حسابرسی: OpenClaw از تاریخچه حسابرسی خروجی پشتیبانی می‌کند، اما AutoBot بازبینی رندر شده مقصد را برای اطمینان از عدم اشتباه در مقصد یا شکست در ذخیره‌سازی اجباری می‌کند.
  • قابلیت‌های منحصر‌به‌فرد: AutoBot به یک اعتبارسنج تکمیل مجزا نیاز دارد، نوشتن را در صورت عدم تأیید تحویل پاک مسدود می‌کند و لحن یادگرفته شده را بر اساس کانال ارتباطی مجزا نگه می‌دارد.

در برابر Hermes:

  • حافظه: Hermes از حافظه منتخب و جستجوی جلسه استفاده می‌کند؛ اما AutoBot رابطه و هدف را بخشی از قوانین پیش‌فرض بازیابی قرار می‌دهد تا کنترل حرفه‌ای/شخصی بهتری فراهم شود.
  • زمان‌بندی: Hermes شغل‌ها را زمان‌بندی می‌کند؛ اما AutoBot مراحل شواهد مرتب شده و خروجی‌های ناتمام را حفظ می‌کند تا تفاوت بین «اجرای یک شغل» و «ذخیره یک اثر» مشخص باشد.
  • امنیت: Hermes تأییدیه‌های ابزار را فراهم می‌کند؛ اما AutoBot بازرسی استاندارد قبل و بعد از نوشتن در مقصد را اضافه کرده است.
  • قابلیت‌های منحصر‌به‌فرد: AutoBot پذیرش مستقل هر مرحله از تکمیل، یک مسیر نوشتار پاک از طریق اپلیکیشن رسمی و مرزهای یادگیری لحن مخصوص به هر مخاطب را الزامی می‌کند.

به‌روزرسانی‌های نسخه ۰.۳.۰

آخرین نسخه یک مهارت محلی برای راه‌اندازی اولیه (First-time skill) معرفی کرده است که به عنوان اپراتور نصب عمل می‌کند. این ابزار وضعیت فعلی را بررسی، پیش‌فرض‌های امن محلی را اعمال و اولین دروازه کاربر یا قابلیت حل‌نشده را حفظ می‌کند. پوشه پایه اکنون بدون نیاز به Node یا ورود به حساب نصب می‌شود، هرچند اجرای پیشرفته (Advanced Runtime) همچنان به Node 22 یا بالاتر نیاز دارد.

جزئیات فنی تکمیلی

  • صدا و کارهای طولانی: قابلیت Voice در ChatGPT می‌تواند رشته‌های مجزایی برای کارهای طولانی باز کند و موانع را به گفتگو بازگرداند. حالت Goal، نتیجه و معیارهای تکمیل را به کار متصل نگه می‌دارد. توجه داشته باشید که در هر لحظه تنها یک چت صوتی در دسکتاپ فعال است و این وظایف از بودجه استفاده Codex استفاده می‌کنند.
  • اجرای محلی: برای کارهای طولانی، مک و فضای کاری باید در دسترس بمانند؛ کاربران باید گزینه «Prevent sleep while running» را فعال کنند.
  • کنترل لحن: سیستم به‌جای آرشیو پیام‌های خام، الگوهای فشرده و تأیید شده توسط کاربر را ذخیره می‌کند. این امر تضمین می‌کند که پروفایل پیام‌های خانوادگی روی لحن ایمیل‌های مشتری تأثیر نگذارد.
  • دستورات: مدیریت سیستم از طریق دستورات محلی امکان‌پذیر است؛ مانند ./runtime/bin/autoassist doctor برای بررسی سلامت، version برای اطلاعات بیلد و core status برای وضعیت سیستم.

این چرخش به سمت مدیریت محلی باعث می‌شود هوش عامل اقتصادی‌تر شود. با کامپایل کردن زمینه و شواهد قابل استفاده مجدد به‌صورت محلی، سیستم از هدر دادن توکن‌ها برای دستورات تکراری جلوگیری می‌کند.

این رویکرد این فرض را که عامل‌ها باید در یک پنجره واحد «همه‌چیزدان» باشند، تغییر می‌دهد. در عوض، ثابت می‌کند که یک قرارداد عملیاتی سخت‌گیرانه و مدیریت وضعیت محلی می‌تواند یک مدل همه‌منظوره را به یک کارمند سازمانی متخصص تبدیل کند.

اگر از مک برای مدیریت گردش‌کارهای پیچیده در چندین اپلیکیشن استفاده می‌کنید، باید مخزن گیت‌هاب AutoBot را برای دریافت آخرین به‌روزرسانی‌های Runtime و قرارداد عملیاتی AGENTS.md دنبال کنید.

گام بعدی شما

  • اگر از مک برای مدیریت گردش‌کارهای پیچیده استفاده می‌کنید، مخزن گیت‌هاب AutoBot را برای دریافت آخرین نسخه Runtime دنبال کنید.
  • قرارداد عملیاتی AGENTS.md را مطالعه کنید تا متوجه شوید چگونه می‌توان برای عامل‌ها «قوانین بازی» تعریف کرد.
  • تنظیمات حریم خصوصی را در چهار منطقه مجزا پیاده کنید تا از نشت داده‌های شخصی در خروجی‌های کاری جلوگیری شود.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با تکیه بر اعتبار بنچمارک‌های OSWorld و AssistantBench، نشان می‌دهد که لایه‌های ارکستراسیون محلی می‌توانند محدودیت‌های مدل‌های بنیادی را دور بزنند. این یک تغییر استراتژیک از تمرکز بر «هوش مدل» به «دقت فرآیند» در اکوسیستم عامل‌های هوش مصنوعی است.

تأثیر برای ایران

به‌دلیل نیاز به اپلیکیشن دسکتاپ ChatGPT و دسترسی به APIهای خاص، استفاده از این ابزار برای کاربران ایرانی نیازمند ابزارهای تغییر آی‌پی و حساب‌های فعال است.

·نگاه ما
تحریریه دات‌هوش

AutoBot ثابت می‌کند که برای رسیدن به سطح «عامل متخصص»، لزوماً به مدل‌های بزرگ‌تر یا آموزش مجدد نیاز نیست، بلکه ساختار مدیریت وضعیت (State Management) محلی کلید ماجراست. این رویکرد، فرض رایج مبنی بر اینکه عامل باید تمام دانش را در یک پنجره متنی نگه دارد را به چالش می‌کشد و مدل را از یک «هم‌صحبت» به یک «مجری رویه‌ای» تبدیل می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.