پرش به محتوای اصلی
پرش به محتوای مقاله

OpenAmer با دفتر کل نتایج، توهمات عامل‌های دسکتاپ را حذف کرد

·۱۹ مهر ۱۴۰۵۵ دقیقه مطالعه
راهنما
اجرای عامل هوش مصنوعی دسکتاپ خودتأییدشونده روی دستگاه شخصی: راهنمای سریع ۱۰ دقیقه‌ای
اجرای عامل هوش مصنوعی دسکتاپ خودتأییدشونده روی دستگاه شخصی: راهنمای سریع ۱۰ دقیقه‌ای
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی «دفتر کل نتایج» برای جایگزینی حافظه مدل در تایید اقدامات؛ این یعنی عامل دیگر ادعا نمی‌کند کاری را انجام داده، بلکه مدرک اجرای آن را در سطح سیستم‌عامل ثبت می‌کند.

تصور کنید یک عامل هوش مصنوعی به جای اینکه فقط درباره‌ی مدیریت ایمیل‌هایتان حرف بزند، واقعاً پنجره‌ی مرورگر را باز کند، ایمیل‌ها را دسته‌بندی کند و در نهایت یک سند رسمی ارائه دهد که ثابت می‌کند هر مرحله با موفقیت انجام شده است. این دیگر یک رویای آینده نیست، بلکه قابلیت اصلی OpenAmer است؛ عاملی که مستقیماً روی ویندوز، مک و لینوکس اجرا می‌شود.

بسیاری از آموزش‌های مربوط به عامل (Agent) — شبیه به دستیاری که فقط دستور می‌گیرد اما لزوماً کاری انجام نمی‌دهد — در نهایت به یک چت‌بات ختم می‌شوند که فقط حرف می‌زند. اما OpenAmer یک پروژه متن‌باز با مجوز Apache-2.0 است که از رابط‌های ساده‌ی چت فراتر رفته و اقدامات واقعی را روی ماشین کاربر اجرا می‌کند. به این ترتیب، یک عامل محلی اکنون می‌تواند پنجره‌های دسکتاپ شما را مدیریت کند و از طریق یک رکورد دائمی از موفقیت یا شکست، دقیقاً ثابت کند چه کاری انجام داده است. این رویکرد یادآور تلاش‌های مشابه برای استقلال از محیط‌های ابری در توسعه‌ی عامل‌های محلی است که هدفشان افزایش کنترل کاربر بر محیط‌های کاری است.

طبق گزارش توسعه‌دهندگان این پروژه، اکثر عامل‌های فعلی با مشکل «توهمات عملیاتی» دست‌وپنجه نرم می‌کنند؛ وضعیتی که در آن مدل ادعا می‌کند کاری را تمام کرده، در حالی که اصلاً آن را شروع نکرده است. این شکاف، سدی از بی‌اعتمادی برای هر کسی ایجاد می‌کند که می‌خواهد به هوش مصنوعی اجازه دهد به نرم‌افزارهای مالی یا ایمیل‌های خصوصی‌اش دسترسی داشته باشد. OpenAmer با اجرای محلی در نشست (Session) کاربر و روی سخت‌افزار شخصی، این مشکل را حل می‌کند. این عامل به جای تکیه بر مرورگرهای بدون رابط کاربری (Headless) که نیاز به احراز هویت مجدد دارند، از همان دسترسی‌ها و لاگین‌های فعال کاربر استفاده می‌کند.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، اجرای محلی لایه‌ای از حریم خصوصی را اضافه می‌کند که در مدل‌های ابری وجود ندارد.

الزامات سیستمی و نصب

بر اساس مستندات راهنمای سریع، این سیستم برای استقرار با کمترین فشار روی منابع طراحی شده است. پیش‌نیازهای آن عبارتند از:

  • ویندوز ۱۰ یا ۱۱ (به‌صورت بومی، بدون نیاز به WSL یا دسترسی ادمین)، لینوکس، مک یا Termux
  • پایتون ۳.۱۰ به بالا (که توسط نصب‌کننده‌ی تک‌خطی مدیریت می‌شود)
  • حدود ۲ گیگابایت رم آزاد

کاربران می‌توانند آن را از طریق یک دستور تک‌خطی در PowerShell برای ویندوز یا اسکریپت curl برای لینوکس و مک نصب کنند. اگرچه این سیستم از کلیدهای API مدل‌های پیشرو پشتیبانی می‌کند، اما به‌گونه‌ای ساخته شده که با یک «مغز» محلی کوچک و زنجیره‌های استدلالی رایگان ابری کار کند؛ بنابراین خرید کلیدهای گران‌قیمت کاملاً اختیاری است.

برای کسانی که نمی‌خواهند برای جست‌وجوی وب، تولید تصویر، تبدیل متن به گفتار و مدل اصلی، پنج کلید مختلف پیدا کنند، دستور openamer setup --portal امکان ورود از طریق OAuth را فراهم می‌کند تا همه چیز یکپارچه شود. همچنین هر نقطه انتهایی (Endpoint) سازگار با OpenAI همچنان قابل استفاده است.

سازوکار هسته ASI

قلب تپنده این سیستم، هسته ASI است. این بخش از نظر معماری غیرمعمول است، زیرا حلقه‌های سنتی دور یک مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — و فرآیندهای مجزا برای هر ابزار را با پنج ابزار بومی که در داخل خودِ فرآیند اجرا می‌شوند، جایگزین کرده است. این معماری باعث می‌شود فراخوانی ابزار به جای بوت کردن یک فرآیند جدید، صرفاً یک فراخوانی تابع باشد که ریسک‌های امنیتی نشت شل (Shell-escaping) را حذف و تأخیر را کاهش می‌دهد.

این هسته از طریق یک حلقه مرکزی «ضربان قلب» (openamer asi heartbeat --tick) عمل می‌کند. این تک‌حلقه، جایگزین حدود ۸۴ شغل زمان‌بندی‌شده‌ی مجزا شده است و ۱۰ زیرسیستم مختلف را مدیریت می‌کند:

  • Darwin, Swarm, A2A, Learning, Senses, System, Security, Outreach, Infra, and Meta.

هر زیرسیستم دارای ریتم، زمان آخرین اجرا، تعداد خطاها و نرخ عقب‌نشینی (Back-off) مخصوص به خود است. این طراحی تضمین می‌کند که اگر یک زیرسیستم دچار اختلال شود، کل برنامه را مسموم نکند و کاربر بتواند در یک نقطه واحد ببیند چه چیزی در حال اجراست، به جای اینکه ده‌ها فایل لاگ را جست‌وجو کند.

کاربران می‌توانند مستقیماً از طریق دستورات CLI با شناخت مدل تعامل کنند:

  • asi think: فعال‌سازی استدلال بازگشتی عمیق.
  • asi learn: شروع چرخه یادگیری اینترنتی روی یک موضوع خاص.
  • asi remember: بازیابی حافظه اپیزودیک.
  • asi trigger: فعال کردن قابلیت‌هایی مثل خودبهبودی یا اعتبارسنجی.
  • asi status: بررسی وضعیت هویت، اپیزودها و ۱۰ زیرسیستم.

کنترل دسکتاپ و اعتبارسنجی

OpenAmer کارهای وب را با کنترل یک نمونه واقعی از کروم از طریق پروتکل DevTools و روی یک پروفایل دائمی مدیریت می‌کند. این کار به عامل اجازه می‌دهد از نشست‌های فعال کاربر استفاده کند و با دیوارهای لاگین مواجه نشود.

برای برنامه‌های بومی، سیستم وضعیت پنجره هدف را ثبت کرده و ورودی‌های مصنوعی را بدون درگیر کردن نشانگر فیزیکی موس ارسال می‌کند. در واقع، موس شما در جای خود می‌ماند در حالی که عامل روی دیدگاه خودش از واقعیت عمل می‌کند. در ویدیوهای منتشر شده، در حالی که عامل در حال مدیریت یک پنجره است، خروجی زنده GetCursorPos نشان می‌دهد که نشانگر انسانی ۰ پیکسل جابه‌جا شده است.

برای حل مشکل اعتماد، OpenAmer یک «دفتر کل نتایج» (Outcome Ledger) پیاده کرده است. هر اقدام پیش از وقوع، با وضعیت «موفق/ناموفق» در یک رکورد دائمی ثبت می‌شود. اگر سیستم کرش کند یا کنترل آن تغییر کند، عامل به جای تکیه بر حافظه مدل، بر اساس این رکورد دوباره اجرا می‌شود. این یعنی اقدامی که قبلاً انجام شده، تکرار نمی‌شود و از عملیات خطرناک دوبار (Double-actions) جلوگیری می‌شود.

شبکه جهانی A2A

این پروژه همچنین یک شبکه «عامل به عامل» (A2A) را معرفی می‌کند. نمونه‌های مختلف با یکدیگر ثبت شده و پیام‌ها را بدون نیاز به یک مرکز واحد رد و بدل می‌کنند. این معماری مزایای متعددی دارد:

  • حذف نقطه شکست واحد: هر گره می‌تواند به عنوان نقطه ورود عمل کند.
  • اشتراک دانش: مهارت‌های یادگرفته شده در یک گره، برای بقیه هم در دسترس می‌شود.
  • بهینه‌سازی منابع: یک تسک استدلالی سنگین می‌تواند به گره‌ای با واحد پردازش گرافیکی (GPU) — که مثل یک موتور جت برای محاسبات هوش مصنوعی است — ارجاع داده شود، در حالی که لپ‌تاپ کاربر فقط ریتم خود را حفظ می‌کند.

این تغییر به سمت عامل‌های محلی و خود-تأییدکننده، معیار اتوماسیون دسکتاپ را تغییر می‌دهد. ما از «اعتماد به خلاصه مدل» به سمت «خواندن دفتر کل» حرکت می‌کنیم. برای کاربر نهایی، این یعنی هوش مصنوعی دیگر یک جعبه سیاه نیست، بلکه یک اپراتور پاسخگو با یک ردپای مستند است.

گام بعدی شما

  • اگر به دنبال اتوماسیون واقعی هستید، مخزن گیت‌هاب OpenAmer را بررسی کرده و آن را روی یک ماشین مجازی (VM) برای تست اولیه نصب کنید.
  • دستور asi think را برای تحلیل سناریوهای شکست در سیستم‌های عامل‌محور امتحان کنید.
  • بررسی کنید که آیا مدل‌های محلی کوچک شما می‌توانند با دقت کافی دستورات دفتر کل را اجرا کنند یا نیاز به APIهای ابری دارید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد با ایجاد ردپای مستند (Audit Trail)، اعتماد به عامل‌های هوش مصنوعی را از سطح چت‌بات‌ها به سطح اپراتورهای سیستمی می‌برد. این تغییر برای سازمان‌هایی که امنیت و دقت در اجرای دستورات دسکتاپ برایشان حیاتی است، یک پیش‌نیاز فنی محسوب می‌شود.

تأثیر برای ایران

به‌دلیل متن‌باز بودن و پشتیبانی از مدل‌های محلی، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به APIهای تحریمی، عامل‌های اتوماسیون دسکتاپ را روی سخت‌افزارهای داخلی پیاده‌سازی کنند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی حافظه مدل با یک دفتر کل (Ledger) خارجی، نقطه عطفی در حل مشکل توهمات عملیاتی است. این رویکرد نشان می‌دهد که برای رسیدن به عامل‌های قابل اعتماد، نباید روی بهبود استدلال مدل متکی بود، بلکه باید لایه‌ای از «حقیقت سخت» (Hard Truth) را در سطح سیستم‌عامل پیاده کرد. در واقع، OpenAmer مدل را از جایگاه «مدیر عملیات» به «برنامه‌ریز» تنزل داده و اجرای عملیات را به یک سیستم ثبت‌شده و قابل بازگشت سپرده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.