پرش به محتوای اصلی
پرش به محتوای مقاله

فریم‌ورک Cua کنترل دسکتاپ‌های چندسیستمی را به عامل‌های هوش مصنوعی سپرد

·۲۸ شهریور ۱۴۰۵۴ دقیقه مطالعه
گیت‌هاب - trycua/cua: مقیاس‌دهی استفاده از کامپیوتر ۲.۰ با درایورهای متن‌باز، ناوگان چندسیستم‌عاملی و معیارهای آموزش، ارزیابی
گیت‌هاب - trycua/cua: مقیاس‌دهی استفاده از کامپیوتر ۲.۰ با درایورهای متن‌باز، ناوگان چندسیستم‌عاملی و معیارهای آموزش، ارزیابی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی مدل‌های تخصصی System 1 برای تعامل با UI؛ به جای استفاده از LLMهای سنگین برای هر کلیک، مدل‌های کوچک و سریع تصمیمات سطح پایین رابط کاربری را مدیریت می‌کنند.

تصور کنید یک دستیار دیجیتال نه فقط کد بنویسد، بلکه بتواند مانند یک انسان، محیط دسکتاپ شما را ببیند، روی دکمه‌ها کلیک کند و بین نرم‌افزارهای مختلف جابه‌جا شود. این رویایی که تا پیش از این در حد دموهای محدود بود، با انتشار فریم‌ورک Cua در ۱۹ سپتامبر ۲۰۲۵ به یک ابزار در دسترس تبدیل شد. این ابزار یک چارچوب متن‌باز است که به عامل‌های هوش مصنوعی اجازه می‌دهد برنامه‌های بومی دسکتاپ را در سیستم‌عامل‌های macOS، ویندوز و لینوکس به طور مستقیم اجرا کنند. این ابزار فراتر از فراخوانی‌های ساده API عمل می‌کند و به عامل‌ها اجازه می‌دهد در یک وظیفه واحد، رابط‌های گرافیکی و محیط‌های کدنویسی را پیمایش کنند.

بسیاری از عامل‌های هوش مصنوعی (AI Agents) — شبیه به کارمندانی که دستورات را می‌فهمند اما دسترسی به ابزار ندارند — در مرحلهٔ نهایی اجرا شکست می‌خورند؛ یعنی جایی که باید واقعاً در یک سیستم‌عامل کلیک کنند یا متنی تایپ کنند. Cua با معرفی مفهوم «استفاده از کامپیوتر ۲.۰»، این شکاف را پر می‌کند تا عامل‌ها بتوانند به‌طور یکپارچه بین ترمینال، مرورگر و برنامه‌های بومی مثل LibreOffice Calc جابه‌جا شوند.

زمینه و قابلیت‌ها

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های عامل‌محور اشاره کردیم، دسترسی مستقیم به سیستم‌عامل همواره با ریسک‌های امنیتی همراه است. به همین دلیل Cua یک پشتهٔ کامل شامل دسکتاپ‌های ابری ایزوله، ماشین‌های مجازی (VM) برای مک، مدل‌های تصمیم‌گیر تخصصی و مجموعه‌ای از بنچ‌مارک‌ها ارائه می‌دهد. این رویکرد یادآور پروژه Proliferate است که با استفاده از محیط‌های ایزوله، تداخل میان عامل‌های مختلف را حذف کرد. این ساختار به توسعه‌دهندگان اجازه می‌دهد تا عامل و مدل مورد نظر خود را وارد کنند یا از ابزارهای تخصصی Cua برای تصمیم‌گیری استفاده نمایند.

برای نمایش این قابلیت، یک دموی ۵۰ ثانیه‌ای وجود دارد که دو نشست Cua Driver را در حال فعالیت روی یک دسکتاپ Omarchy نشان می‌دهد. در این نمایش، عامل‌ها سلول‌هایی را در LibreOffice Calc انتخاب کرده و اشیائی را در Inkscape جابه‌جا می‌کنند، در حالی که یک ترمینال در پیش‌زمینه فعال باقی مانده است.

طبق مستندات مخزن گیت‌هاب Cua AI, Inc.، این اکوسیستم از چهار رکن اصلی تشکیل شده است که هدف آن‌ها حذف اصطکاک در اتوماسیون دسکتاپ است:

زیرساخت و اجرا

  • Cua Fleets: سیستمی برای ایجاد دسکتاپ‌های ابری لینوکس ایزوله در محیط run.cua.ai. یک Fleet ظرفیت سندباکس را مدیریت می‌کند؛ کدها یک دسکتاپ را از استخر منابع درخواست می‌کنند و از Sandbox SDK برای اجرای دستورات، ثبت اسکرین‌شات و تعامل با برنامه‌ها استفاده می‌کنند. یک نمونه ساده از نتایج اولیه شامل ایجاد یک دسکتاپ لینوکس، اجرای دستور uname -a برای شناسایی سیستم، ذخیره اسکرین‌شات و در نهایت حذف منابع است. این مدل از زیرساخت‌های متن‌باز، راهکاری موثر برای مدیریت هزینه‌های عملیاتی و جلوگیری از وابستگی به تامین‌کنندگان ابری است.
  • Cua Driver: رابط اصلی برای کنترل برنامه‌ها و مرورگرها. این ابزار از «ارسال پس‌زمینه» پشتیبانی می‌کند؛ یعنی عامل می‌تواند بدون اشغال کردن نشانگر موس یا تمرکز پنجرهٔ کاربر در پلتفرم‌های پشتیبانی‌شده، در پس‌زمینه فعالیت کند. این درایور از طریق CLI، پروتکل MCP یا SDKهای تایپ‌شده متصل می‌شود.
  • Lume: ابزاری برای ساخت ماشین‌های مجازی macOS و لینوکس روی تراشه‌های اپل سیلیکون با استفاده از Virtualization.Framework اپل. کاربران می‌توانند یک VM از نسخه macOS Tahoe را از طریق یک تصویر بازیابی (restore image) اپل ایجاد کرده، آن را استارت بزنند و از طریق SSH به آن متصل شوند.

هوشمندی و ارزیابی

  • CUA-S1: خانواده‌ای از مدل‌های کوچک و تخصصی «سیستم ۱». این مدل‌ها برخلاف مدل‌های زبانی بزرگ (LLM) — که مثل کتابخانه‌داری هستند که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — برای تصمیمات سریع و محدود بهینه شده‌اند. آن‌ها برنامه‌ریزهای عمومی نیستند، بلکه برای کارهایی مثل تشخیص اینکه کدام مقدار باید در کدام فیلد فرم قرار بگیرد یا تصمیم‌گیری درباره اینکه آیا یک المان را رها کنند یا خیر، بهینه شده‌اند. این استراتژی با رویکرد ترکیب مدل‌های متنوع برای بهینه‌سازی استنتاج همسو است، جایی که هر مدل وظیفه‌ای تخصصی را بر عهده می‌گیرد. اولین پروفایل تحقیقاتی این مدل بر امتیازدهی به تصمیمات از المان‌های ساختاریافته رابط کاربری تمرکز دارد، نه تولید توکن به توکن.
  • Cua Bench: مجموعه‌ای از محک‌ها (Benchmarks) برای ساخت وظایف استفاده از کامپیوتر و استخراج مسیرهای اجرا (trajectories) جهت آموزش مدل‌ها. این ابزار از پایتون ۳.۱۲ یا ۳.۱۳ و مدیریت بسته uv پشتیبانی می‌کند. کاربران می‌توانند با وظایفی شبیه‌سازی شده شروع کنند که نیازی به VM، داکر یا کلید API مدل ندارد و موفقیت زمانی تأیید می‌شود که ارزیاب پاداشی معادل ۱.۰ گزارش کند.

به نقل از گزارش‌های فنی این پروژه، برای نمایش توانایی این سیستم، سناریویی طراحی شده که در آن عامل، عملیات «۶ ضربدر ۷» را در برنامهٔ ماشین‌حساب بومی اجرا کرده و نتیجهٔ ۴۲ را تأیید می‌کند. این فریم‌ورک با ابزارهای فعلی مثل Claude Code، Codex، Cursor و OpenClaw نیز سازگار است.

چرخش به سمت مدل‌های تخصصی مثل CUA-S1 نشان می‌دهد که دیگر برای هر کلیک ساده، نیازی به فراخوانی مدل‌های غول‌پیکر نیست. با سپردن تصمیمات سطح پایین رابط کاربری به مدل‌های کوچک‌تری مانند CUA-S1، توسعه‌دهندگان می‌توانند تأخیر (Latency) و هزینه توکن‌ها را کاهش داده و در عین حال قابلیت اطمینان اقدامات عامل را افزایش دهند. کد منبع CUA-S1 تحت لایسنس MIT است و وزن‌های مدل به‌طور جداگانه در Hugging Face میزبانی می‌شوند.

برای کاربر نهایی، این به معنای آن است که عامل‌های هوش مصنوعی از «چت‌بات‌هایی که کد می‌نویسند» به «اپراتورهایی که از نرم‌افزار استفاده می‌کنند» تبدیل می‌شوند. توانایی اجرای این ابزارها در سندباکس‌های ابری ایزوله، ریسک امنیتی دادن دسترسی کامل به یک عامل خودمختار در ایستگاه کاری اصلی کاربر را کاهش می‌دهد.

توسعه‌دهندگان می‌توانند با اجرای یک اسکریپت ساده در ترمینال برای مک و لینوکس (curl -fsSL https://cua.ai/driver/install.sh) یا یک اسکریپت پاورشل برای ویندوز (irm https://cua.ai/driver/install.ps1 | iex)، Cua Driver را نصب کنند. این پروژه تحت لایسنس MIT منتشر شده است، هرچند از اجزای شخص ثالثی مثل Kasm (MIT)، OmniParser (CC-BY-4.0) و ultralytics (AGPL-3.0) استفاده می‌کند.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، با نصب Cua Driver روی یک ماشین مجازی لینوکس، اولین گردش‌کار خودکارسازی دسکتاپ را تست کنید.
  • مدل‌های CUA-S1 را از Hugging Face دریافت کرده و دقت آن‌ها را در تشخیص المان‌های UI با مدل‌های عمومی مقایسه کنید.
  • مستندات MCP را برای اتصال عامل‌های خود به زیرساخت Cua مطالعه کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell و بهینه‌سازی استنتاج مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با حذف نیاز به APIهای اختصاصی هر نرم‌افزار، هر برنامه‌ای را به یک ابزار قابل فراخوانی برای AI تبدیل می‌کند. اعتبار این رویکرد در استفاده از محیط‌های ایزوله است که مانع از تبدیل شدن عامل‌های خودمختار به یک تهدید امنیتی برای سیستم‌عامل می‌شود.

تأثیر برای ایران

به‌دلیل متن‌باز بودن و لایسنس MIT، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به اشتراک‌های گران‌قیمت، زیرساخت‌های عامل‌محور خود را روی سرورهای داخلی پیاده‌سازی کنند.

·نگاه ما
تحریریه دات‌هوش

جدا کردن لایهٔ «تصمیم‌گیری رابط کاربری» از «برنامه‌ریزی کلی» با معرفی مدل‌های CUA-S1، یک چرخش هوشمندانه است. این یعنی صنعت از مدل‌های همه‌کاره (General-purpose) به سمت معماری‌های ترکیبی حرکت می‌کند که در آن مدل‌های کوچک و سریع، نقش «رفلکس‌های عصبی» را برای تعامل با محیط ایفا می‌کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.