پرش به محتوای اصلی
پرش به محتوای مقاله

گوگل در برابر OpenAI و Anthropic؛ شکاف ایمنی در عامل‌های هوشمند

·۱۴ مهر ۱۴۰۵۳ دقیقه مطالعه
خروجی هم‌زمان ابزارها در شرایط خطر حالت مشترک
خروجی هم‌زمان ابزارها در شرایط خطر حالت مشترک
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر معیار ارزیابی از «صحت انتخاب ابزار» به «ایمنی در اجرای هم‌زمان». این نخستین بار است که تداخلات زمانی در فراخوانی‌های متعدد ابزارها به‌صورت سیستماتیک و بدون داور LLM سنجیده شده است.

تصور کنید یک عامل هوشمند برای انجام یک وظیفه، چندین دستور را هم‌زمان صادر کند اما به‌دلیل نبود ترتیب درست، داده‌ها را روی هم بنویسد یا سیستم را قفل کند. این نقص امنیتی بحرانی در مدیریت هم‌زمانی، محوریت محک Fan-Out است که در ۶ اکتبر ۲۰۲۶ منتشر شد.

طبق گزارش dev.to، در حالی که اکثر مدل‌ها می‌توانند ابزار درست را شناسایی کنند، مدل google/gemini-3.8-flash در حال حاضر در اجتناب از مخاطرات حالت مشترک (Shared-state hazards) پیشتاز است. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی امنیت مدل‌های عامل‌محور اشاره کردیم، توانایی مدل در درک ترتیب زمانی عملیات، به اندازه دقت در انتخاب ابزار اهمیت دارد. این چالش‌ها به‌ویژه زمانی تشدید می‌شوند که ابزارهای سفارشی در محیط‌های مختلف اجرا شوند؛ موضوعی که پروتکل MCP با یکپارچه‌سازی ابزارهای AI در محیط‌های توسعه سعی در تسهیل آن دارد.

بیشتر محک‌های موجود بر صحت تک‌فراخوانی تمرکز دارند و خطرات «فن-اوت» (Fan-out) — یعنی زمانی که یک عامل در یک نوبت، چندین ابزار را فعال می‌کند — را نادیده می‌گیرند. در محیط‌های عملیاتی، این موضوع منجر به تداخل در فایل‌ها، قفل شدن حساب‌ها و اختلال در چرخه حیات برنامه‌ها می‌شود. اگر عاملی سعی کند هم‌زمان در یک فایل بنویسد و از آن بخواند، بدون توالی درست، کل سیستم شکست می‌خورد.

بر اساس مستندات این محک، سه معیار اصلی اندازه‌گیری می‌شوند: ایمنی (عدم نقض قوانین تداخل)، زمان‌بندی ایمن و بهینه (SAO) و سرعت نسبت به یک زمان‌بندی ایده‌آل. برای تضمین عینیت امتیازات، به‌جای استفاده از یک مدل زبانی به‌مثابه داور، از گراف جهت‌دار بدون دور (Conflict DAG) و بررسی‌های جامع درهم‌تنیدگی استفاده شده است.

تحلیل عملکرد

در سطح دشوار این آزمون (N=8)، شکاف عملکردی عمیقی مشاهده شد:

  • google/gemini-3.8-flash: در هر دو معیار ایمنی و SAO به دقت ۸۵.۷۱٪ رسید.
  • anthropic/claude-sonnet-5: ایمنی ۸۵.۷۱٪ را حفظ کرد اما در زمان‌بندی بهینه (SAO) به ۵۷.۱۴٪ سقوط کرد.
  • openai/gpt-5.4-mini-2026-03-17: با نمره ۲۸.۵۷٪ در هر دو بخش، عملکرد بسیار ضعیفی داشت.

در تسک «سرمایه-جمع» (Fan-out-swarm) که تداخلات بین-عاملی را می‌سنجد، مدل‌های google/gemini-3.7-flash و 3.8-flash به ایمنی ۱۰۰٪ رسیدند، هرچند در یافتن بهینه‌ترین زمان‌بندی برای چندین عامل ناتوان بودند (۰٪ SAO). این نوع تعاملات پیچیده یادآور برتری سوارم‌های هماهنگ در برابر Copilot‌های انفرادی است که بهره‌وری تیم‌های توسعه را به‌شدت افزایش داده است.

این تغییر در رویکرد ارزیابی، فرضیات این حوزه را از «انتخاب ابزار» به «هماهنگ‌سازی هم‌زمانی» (Concurrency Orchestration) تغییر می‌دهد. این یافته ثابت می‌کند ایمنی در گردش‌کارهای عامل‌محور (Agentic) تنها به خروجی یک ابزار وابسته نیست، بلکه به ترتیب زمانی اجرا بستگی دارد. ابزارهای حفاظتی مانند AsyncFC یا EffectFence می‌توانند از اجرا محافظت کنند، اما استدلال ذاتی مدل درباره وضعیت سیستم را بهبود نمی‌بخشند.

برای توسعه‌دهندگان، این بدان معناست که تکیه بر «هوش» مدل برای مدیریت دسته‌های پیچیده از عامل‌ها کافی نیست. تا زمانی که مدل‌ها بتوانند از سد ۹۰٪ در معیار SAO عبور کنند، پیاده‌سازی لایه‌های هماهنگ‌ساز خارجی برای جلوگیری از تراکنش‌های تکراری یا رقابت در چرخه حیات ضروری است. در کنار این بهینه‌سازی‌های نرم‌افزاری، کاهش هزینه‌های عملیاتی عامل‌ها توسط NVIDIA و KAIST مسیر را برای استقرار گسترده‌تر این سیستم‌های پیچیده هموارتر می‌کند.

پژوهشگران اکنون در حال گسترش این محک به ۱۲ آیتم و معرفی تست‌های «اصلاح تک‌خطی» هستند تا ببینند آیا مدل‌ها می‌توانند با محدودیت‌های جدید تداخل سازگار شوند.

گام بعدی شما

  • اگر از سیستم‌های چندعاملی استفاده می‌کنید، توالی فراخوانی ابزارها را به‌صورت سخت‌افزاری یا لایه‌ای محدود کنید و به استدلال مدل اعتماد نکنید.
  • در پیاده‌سازی‌های حساس، از لایه‌های Orchestration برای مدیریت قفل‌های داده‌ای (Locks) استفاده کنید.
  • عملکرد مدل‌های Flash را در سناریوهای هم‌زمانی آزمایش کنید تا گلوگاه‌های ایمنی را شناسایی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این یافته بر اعتبار مدل‌های گوگل در محیط‌های تولیدی (Production) می‌افزاید و نشان می‌دهد که ایمنی عامل‌ها باید از سطح خروجی به سطح زمان‌بندی اجرا منتقل شود. تکیه بر این معیارها، ریسک توقف سیستم‌ها در مقیاس واقعی را کاهش می‌دهد.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که از مدل‌های Gemini از طریق APIهای واسط استفاده می‌کنند، این نتایج Gemini Flash را به گزینه‌ای مطمئن‌تر برای ساخت عامل‌های خودکار با ابزارهای متعدد تبدیل می‌کند.

·نگاه ما
تحریریه دات‌هوش

تمرکز بر Concurrency Orchestration نشان می‌دهد که مدل‌های زبانی در حال عبور از مرحله «دانستن» به مرحله «مدیریت» هستند. شکست مدل‌های OpenAI در این محک ثابت می‌کند که افزایش پارامترها لزوماً به معنای درک بهتر از مفاهیم زمانی و ترتیب عملیات نیست. در واقع، مدل‌های کوچک‌تر و بهینه‌شده مانند Gemini Flash ممکن است در مدیریت وضعیت‌های پویا، ساختار استدلالی کارآمدتری داشته باشند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.