پرش به محتوای اصلی
پرش به محتوای مقاله

Coasty با API جدید، کنترل ماشین‌های مجازی را به دست عامل‌های هوش مصنوعی داد

·۲۴ تیر ۱۴۰۵۱۷ دقیقه مطالعه
مرجع API — رابط برنامه‌نویسی استفاده از رایانه Coasty
مرجع API — رابط برنامه‌نویسی استفاده از رایانه Coasty
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی یک لایه واسط (DSL) مبتنی بر JSON برای کنترل ماشین‌های مجازی که اجازه می‌دهد استدلال مدل زبانی مستقیماً به مختصات پیکسلی و دستورات OS تبدیل شود، بدون اینکه توسعه‌دهنده نیاز به مدیریت VM داشته باشد.

تصور کنید یک برنامه‌نویس تنها یک هدف کلی و یک ماشین مجازی را به یک عامل هوشمند می‌سپارد و سپس تماشا می‌کند تا پروژه بدون نوشتن حتی یک خط کد کنترل، به پایان برسد. این واقعیت جدید با انتشار API کنترل کامپیوتر توسط Coasty در ۱۵ جولای ۲۰۲۶ محقق شده است؛ ابزاری که پلی ساختاریافته میان استدلال مدل‌های زبانی و اجرای عملیاتی در سطح سیستم‌عامل ایجاد می‌کند.

بسیاری از عامل‌های هوشمند فعلی در مواجهه با «آخرین کیلومتر» اتوماسیون شکست می‌خورند؛ یعنی جایی که باید واقعاً روی دکمه‌ها کلیک کنند یا در یک سیستم‌عامل واقعی تایپ کنند. این مدل‌ها اغلب به اسکریپت‌های شکننده یا افزونه‌های محدود مرورگر تکیه می‌کنند که در محیط‌های واقعی به راحتی از کار می‌افتند. Coasty این مشکل را با ارائه ماشین‌های مجازی (VM) ابری مدیریت‌شده حل کرده است که عامل‌ها می‌توانند آن‌ها را مستقیماً از طریق یک API استاندارد ببینند و کنترل کنند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی معماری عامل‌های هوشمند اشاره کردیم، جداسازی لایه‌ی تفکر از لایه‌ی اجرا، کلید پایداری این سیستم‌هاست. برای مدیریت این پیچیدگی و ایجاد تعادل میان سهولت استفاده و دقت عملیاتی، Coasty قابلیت‌های خود را در سه سطح سازمان‌دهی کرده است:

  • اجرای وظایف (Task Runs): این بالاترین سطح اتوماسیون است. در این حالت، شما صرفاً یک هدف و یک ماشین را تعریف می‌کنید و Coasty تمام چرخهٔ عامل — شامل عکس‌برداری از صفحه (screenshot)، تفکر، پیش‌بینی اقدام، اجرا و در نهایت تایید نتیجه — را تا زمانی که وظیفه به طور کامل انجام شود، مدیریت می‌کند.
  • گردش‌های کاری (Workflows): یک زبان تخصصی (DSL) مبتنی بر JSON است که برای زنجیره‌سازی چندین اجرای وظیفه به کار می‌رود. این سطح از ساختار، قابلیت‌هایی نظیر شاخه‌بندی (branching)، حلقه‌های تکرار و تاییدهای انسانی در حلقه (human-in-the-loop) را پشتیبانی می‌کند.
  • پایه پیش‌بینی‌ها (Prediction Primitives): این‌ها نقاط انتهایی (Endpoints) سطح پایین برای تیم‌های متخصص است که می‌خواهند حلقه کنترل (control loop) را کاملاً در اختیار داشته باشند. این بخش شامل پیش‌بینی‌های بدون وضعیت (stateless)، جلسات با وضعیت (stateful sessions) و مکان‌یابی دقیق در سطح پیکسل است.

طبق مستندات Coasty، این پلتفرم برای اجرای وظایف، ماشین‌های مجازی مدیریت‌شده لینوکس یا ویندوز را فراهم می‌کند. کاربران می‌توانند این ماشین‌ها را از طریق درخواست POST /v1/machines تخصیص دهند. نکته فنی این است که این ماشین‌ها به‌صورت نامتقارن (asynchronous) عمل می‌کنند؛ بنابراین توسعه‌دهندگان باید وضعیت ماشین را از طریق Polling بررسی کنند تا زمان «در حال اجرا» (running) بودن آن فرا برسد و سپس اقدامات خود را ارسال نمایند.

سیستم پرداخت برای این ماشین‌ها به‌صورت دقیقه‌ای و بر اساس مصرف (metered) محاسبه می‌شود. بر اساس داده‌های منتشرشده در مستندات، هزینه اجرای ماشین‌های لینوکس ۰.۰۵ دلار و ماشین‌های ویندوز ۰.۰۹ دلار در هر ساعت است. ماشین‌هایی که متوقف یا به حالت تعلیق (suspended) درآمده‌اند، مشمول نرخ «نگهداری فعال» (keep-alive) به مبلغ ۰.۰۱ دلار در ساعت می‌شوند. برای جلوگیری از هزینه‌های پیش‌بینی‌نشده یا اجرای بی‌نهایت، API این سرویس دارای قابلیت TTL (زمان بقا) است که ماشین‌های مجازی را پس از گذشت یک دوره زمانی مشخص به‌طور خودکار نابود می‌کند.

در هسته این سیستم، یک حلقه بازخورد بصری فعال است. فرآیند به این صورت است که عامل ابتدا یک اسکرین‌شات از وضعیت فعلی می‌گیرد، مدل بینایی (vision model) اقدام بعدی را پیش‌بینی می‌کند و در نهایت واحد مجری (executor) آن حرکت را روی ماشین مجازی پیاده می‌کند.

برای نیازهایی که دقت بسیار بالایی می‌طلبند، Coasty ابزار مبنی‌سازی (Grounding) را ارائه می‌دهد. این ابزار خاص با پاسخ به پرسش که «این المان دقیقاً کجاست؟»، مختصات دقیق x و y را بازمی‌گرداند. این روش بسیار سریع‌تر و ارزان‌تر از یک پیش‌بینی کامل است؛ به‌طوری که هزینه هر فراخوانی آن ۰.۰۳ دلار است (در حالی که پیش‌بینی‌های کامل ۰.۰۵ دلار هزینه دارند).

زبان DSL گردش‌های کار (در نسخه ۲۰۲۶-۰۶-۰۱) امکان طراحی منطق‌های برنامه‌نویسی پیچیده را می‌دهد. این زبان از یک شیء JSON با یک آرایه از گام‌ها (steps) استفاده می‌کند که در آن هر گام از وظایف، نتیجه خود را برای استفاده در مراحل بعدی ذخیره و پیوند (bind) می‌کند. برای تضمین امنیت و کنترل دقیق بودجه، سه حفاظ سخت‌گیرانه (hard guards) در این گردش‌ها تعبیه شده است:

۱. budget_cents: تعیین سقف هزینه کل به سنت‌های دلار.
۲. max_iterations: تعیین محدودیت برای تعداد دفعات تکرار حلقه‌ها.
۳. deadline_seconds: تعیین یک زمان پایان قطعی (wall-clock timeout) برای اجرای عملیات.

به نقل از تیم توسعه، در حالی که Coasty مدل‌های مدیریت‌شده ارائه می‌دهد، امکان استفاده از مدل‌های شخصی یا Bring Your Own Model (BYOK) را نیز فراهم کرده است. با فعال کردن این گزینه، کل ساختار اجرایی — شامل worker، ابزار Grounding و عامل کدنویسی — تغییر جهت داده و روی حساب شخصی کاربر در Anthropic یا OpenAI اجرا می‌شود. این رویکرد یادآور استانداردسازی اتصال مدل‌های زبانی به ابزارهای خارجی از طریق پروتکل MCP است که توسط انتروپیک برای ایجاد یکپارچگی بیشتر در اکوسیستم ابزارهای AI معرفی شد.

Coasty تضمین می‌کند که هیچ «جایگزینی خاموش» (silent fallback) وجود ندارد؛ یعنی اگر حالت BYOK فعال باشد، پلتفرم هرگز از کلیدهای API خودش استفاده نمی‌کند. این قابلیت به سازمان‌های بزرگ اجازه می‌دهد کنترل بهتری بر داده‌ها و نسخه‌های مدل‌های خود داشته باشند. با این حال، Coasty همچنان هزینه پلتفرم خود را به‌ازای هر گام (۰.۰۵ دلار یا ۰.۰۸ دلار برای موتورهای قدیمی یا legacy) دریافت می‌کند.

با پذیرش این واقعیت که هوش مصنوعی نمی‌تواند همه مشکلات را به‌تنهایی حل کند، مکانیزم «به‌دست‌گیری توسط انسان» (Human Takeover) تعریف شده است. وقتی عامل با مانعی غیرقابل عبور — مانند کپچا (CAPTCHA) یا نیاز به یک تصمیم‌گیری قضاوتی انسانی — مواجه می‌شود، وضعیت اجرا به‌طور خودکار به awaiting_human تغییر می‌کند. در این لحظه سیستم یک رویداد (event) ارسال می‌کند که به شخص اجازه می‌دهد وارد جلسه ماشین مجازی شده، مشکل را حل کند و سپس از طریق نقطه انتهایی /resume کنترل را دوباره به هوش مصنوعی بازگرداند.

برای جلوگیری از پرداخت‌های تکراری و اجرای ناخواسته‌ی دوبارۀ دستورات (به‌ویژه در صورت قطع شبکه)، Coasty هدرهای Idempotency-Key را در ۱۸ عملیات حیاتی، از جمله تخصیص ماشین‌ها و تهیه اسنپ‌شات‌ها، پیاده کرده است. اگر درخواستی با همان کلید قبلاً ارسال شده باشد و دوباره تکرار شود، سیستم نتیجه ذخیره‌شده را بازمی‌گرداند و هزینه جدیدی از کاربر کسر نمی‌کند.

این معماری بار سنگین مدیریت زیرساخت را از دوش توسعه‌دهنده برداشته و سیستم‌عامل را به یک رابط برنامه‌نویسی تبدیل می‌کند. در واقع، Coasty هوش مصنوعی عامل‌محور را از حالت «صرفاً فراخوانی API» به «استفاده واقعی از کامپیوتر» می‌برد. برای کسانی که می‌خواهند چنین قابلیت‌هایی را در محیط‌های توسعه‌ای خاص پیاده کنند، روش‌های ساخت سرورهای MCP در .NET می‌تواند دیدگاهی جامع درباره اتصال زنده مدل‌ها به APIهای تجاری ارائه دهد.

توسعه‌دهندگانی که قصد شروع کار را دارند، می‌توانند از کلیدهای آزمایشی sk-coasty-test- استفاده کنند. این کلیدها روی ماشین‌های مجازی شبیه‌ساز (mock VMs) اجرا می‌شوند و هیچ هزینه‌ای برای کاربر ندارند؛ این امر اجازه می‌دهد تا تست‌های CI/CD پیش از تغییر به کلیدهای تولیدی (production) و پرداخت واقعی انجام شود.

گام بعدی شما

  • بررسی مستندات DSL برای طراحی اولین گردش کار خودکار در محیط ویندوز.
  • تست قابلیت Grounding برای کاهش هزینه‌های استنتاج در وظایفی که نیاز به کلیک‌های دقیق دارند.
  • پیاده‌سازی سیستم awaiting_human برای مدیریت استثنائات در مسیرهای حساس اداری.

اما رقابت برای تسلط بر رابط سیستم‌عامل تازه شروع شده است؛ برای مقایسه این رویکرد مبتنی بر JSON با الگوهای نوظهور 'Operator' در آزمایشگاه‌های بزرگتر، تحلیل ما درباره استراتژی‌های کنترل OS را دنبال کنید.

چرا این موضوع مهم است؟

این ابزار با حذف نیاز به مدیریت زیرساخت برای عامل‌های AI، سرعت استقرار اتوماسیون‌های پیچیده را به‌شدت افزایش می‌دهد. اعتبار این رویکرد در استفاده از لایه‌های حفاظتی بودجه و زمان است که مانع از خسارات مالی ناشی از حلقه‌های بی‌نهایت مدل‌ها می‌شود.

تأثیر برای ایران

به‌دلیل تحریم‌ها و نیاز به پرداخت ارزی برای APIها، دسترسی توسعه‌دهندگان ایرانی به این زیرساخت دشوار است؛ اما معماری آن الگوی مناسبی برای ساخت ابزارهای بومی کنترل ماشین مجازی فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

انتقال کنترل سیستم‌عامل از اسکریپت‌های ایستا به یک DSL منعطف، نشان می‌دهد که عصر «برنامه‌نویسی برای عامل‌ها» جایگزین «پرامپت‌نویسی برای عامل‌ها» می‌شود.Coastey با استانداردسازی لایه اجرا، ریسک توهم مدل‌ها در تعامل با OS را به شدت کاهش داده است. به نظر ما، نقطه قوت واقعی این پلتفرم نه در مدل‌ها، بلکه در لایه Idempotency و مدیریت بودجه است که اتوماسیون AI را از یک دموی جذاب به یک ابزار صنعتی قابل اعتماد تبدیل می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.