پرش به محتوای اصلی
پرش به محتوای مقاله

قابلیت کنترل کامپیوتر به‌صورت بومی در Gemini 3.5 Flash ادغام شد

·۳ تیر ۱۴۰۵۲ دقیقه مطالعه۱ بازدید
نمایی از رابط کاربری Gemini 3.5 Flash در حال کنترل مرورگر و انجام وظایف کامپیوتری
نمایی از رابط کاربری Gemini 3.5 Flash در حال کنترل مرورگر و انجام وظایف کامپیوتری
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی مدل‌های مستقل و تخصصی برای کنترل کامپیوتر با یک مدل واحد و بومی (Native) در Gemini 3.5 Flash که باعث افزایش سرعت و دقت در اجرای دستورات رابط کاربری شده است.

اگر امروز یک توسعه‌دهنده هستید که برای اتوماسیونِ کارهای تکراری از چندین ابزار مجزا استفاده می‌کنید، باید بدانید که مرز بین «چت‌بات» و «اپراتور» در حال محو شدن است. گوگل حالا اجازه می‌دهد هوش مصنوعی به‌جای پیشنهاد دادنِ یک برنامه، مستقیماً آن را در سیستم‌عامل شما اجرا کند. این تحول در اتوماسیون، یادآور رقابت‌های جاری میان ابزارهای بصری و کدنویسی است؛ جایی که مقایسه‌ی اتوماسیون بصری n8n با اسکریپت‌های پایتون نشان داد که سرعت پیاده‌سازی در محیط‌های گرافیکی تا چه حد با کدنویسی دستی متفاوت است.

طبق اعلام گوگل در پست وبلاگی به تاریخ ۲۴ ژوئن ۲۰۲۶، قابلیت استفاده از کامپیوتر (Computer Use) اکنون به‌طور بومی در هستهٔ Gemini 3.5 Flash ادغام شده است. این یعنی مدل زبانی بزرگ (LLM) — شبیه کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — دیگر برای مدیریت دسکتاپ به یک مدلِ کمکی یا خارجی نیاز ندارد. همان‌طور که در تحلیل قبلی ما درباره‌ی چالش‌های سخت‌افزاری Google Home Speaker اشاره کردیم، گوگل پیش‌تر در پیوند دادن مدل‌هایش به سخت‌افزار با دشواری‌هایی روبرو بود؛ اما این به‌روزرسانی دقیقاً روی لایه نرم‌افزاری تمرکز دارد تا کارهای پیچیدهٔ اداری و تست‌های نرم‌افزاری را خودکار کند. این پیشرفت در مدل‌های خانواده Flash، در ادامه‌ی بهبودهای متوالی است؛ برای مثال قابلیت کنترل احساسات صدا در Gemini 3.1 Flash گام مهمی در جهت طبیعی‌تر کردن تعاملات صوتی بود.

به نقل از مستندات گوگل، جایگزینی مدل مستقل ۲.۵ Computer Use با ادغام بومی در نسخه ۳.۵ Flash، باعث رسیدن به بالاترین سطح عملکرد در کارهای عامل‌محور (Agentic) شده است. این سیستم از نقاط قوت فعلی در فراخوانی تابع (Function Calling) و مبنی‌سازی (Grounding) از طریق Maps و Search بهره می‌برد. در همین راستا، رقبا نیز تلاش می‌کنند تا فرآیندهای چندمرحله‌ای را ساده کنند، مشابه آنچه در حالت goal مدل Grok Build برای خودکارسازی کدنویسی مشاهده کردیم.

Gemini 3.5 benchmarks

برای مدیریت امنیت در محیط‌های عملیاتی، گوگل سه لایه حفاظتی تعریف کرده است:

  • آموزش خصمانه (Adversarial Training) هدفمند برای کاهش ریسک تزریق پرامپت (Prompt Injection).
  • سامانه تأییدیه که برای اقدامات حساس یا غیرقابل بازگشت، تأیید صریح کاربر را می‌خواهد.
  • توقف خودکار تسک زمانی که تزریق‌های غیرمستقیم پرامپت شناسایی شوند.

این تغییر برای کسب‌وکارها به این معناست که هوش مصنوعی از یک مشاور ساده به یک اپراتور تبدیل می‌شود. شرکت‌ها با ترکیب محیط‌های ایزوله (Sandboxing) و تأیید انسانی، می‌توانند زنجیره‌ای از کارهای طولانی را که پیش‌تر نیاز به نظارت دستی در چندین اپلیکیشن داشت، کاملاً خودکار کنند.

توسعه‌دهندگان اکنون می‌توانند از این قابلیت‌ها از طریق Gemini API و پلتفرم Gemini Enterprise Agent Platform استفاده کنند. همچنین محیط دموی Browserbase برای تست فوری این ابزارها در دسترس است.

گام بعدی شما

  • اگر از Gemini API استفاده می‌کنید، قابلیت‌های جدید را در محیط Sandbox تست کنید تا ریسک اجرای دستورات اشتباه کاهش یابد.
  • گردش‌های کاری (Workflows) تکراری خود را شناسایی کنید و ببینید کدام بخش‌ها را می‌توان به عامل‌های بومی 3.5 Flash سپرد.
  • مستندات امنیتی گوگل درباره «تأییدیه کاربر» را بخوانید تا بدانید کجا باید کنترل انسانی را حفظ کنید.

اما تأثیر این ادغام بر رقابت با عامل‌های OpenAI در لبهٔ سیستم‌عامل، ابعادی پیچیده‌تر دارد — به تحلیل ما درباره‌ی استراتژی‌های اکوسیستم عامل‌های AI مراجعه کنید.

چرا این موضوع مهم است؟

این به‌روزرسانی با تکیه بر اعتبار زیرساختی گوگل، هزینه و پیچیدگی توسعه عامل‌های خودکار را به‌شدت کاهش می‌دهد. در نتیجه، اتوماسیونِ کارهای اداری از حالت اسکریپت‌های ساده به عامل‌های استدلالی با دسترسی کامل به سیستم تغییر وضعیت می‌دهد.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌های گوگل، دسترسی توسعه‌دهندگان ایرانی به Gemini Enterprise Agent Platform دشوار است و عمدتاً از طریق واسطه‌ها یا VPNهای سازمانی صورت می‌گیرد.

·نگاه ما
تحریریه دات‌هوش

تمرکز گوگل بر ادغام «بومی» به‌جای استفاده از مدل‌های واسط، نشان می‌دهد که سرعت استنتاج (Inference) اکنون اولویت اصلی برای پذیرش تجاری است. این حرکت احتمالاً پاسخ به فشارهای بازار برای کاهش تأخیر (Latency) در عامل‌هایی است که باید به‌صورت زنده با رابط کاربری (UI) تعامل کنند. به نظر ما، این استراتژی گوگل را از یک «پایگاه دانش» به یک «لایه عملیاتی» در دسکتاپ تبدیل می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.