پرش به محتوای اصلی
پرش به محتوای مقاله

چگونه لایه‌ی امنیتی گوگل هزینه‌های پیش‌بینی‌نشده توکن‌ها را مهار می‌کند؟

·۷ مرداد ۱۴۰۵۵ دقیقه مطالعه۲ بازدید
گوگل به توسعه‌دهندگان اجازه می‌دهد فراخوانی ابزار عامل‌های جمینی را مسدود کنند
گوگل به توسعه‌دهندگان اجازه می‌دهد فراخوانی ابزار عامل‌های جمینی را مسدود کنند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی مدل پیش‌فرض با Gemini 3.6 Flash و معرفی «قلاب‌های محیطی» برای بازرسی و مسدودسازی فراخوانی ابزارها در لحظه اجرا؛ تغییری از اعتماد به مدل به سمت نظارت سخت‌افزاری/نرم‌افزاری بر خروجی‌ها.

تصور کنید یک دروازه‌ی برنامه‌ریزی‌شده دارید که هر فراخوانی ابزاری را پیش از اجرا متوقف می‌کند و محیط ایزوله‌ی عامل را از یک جعبه سیاه به یک لایه‌ی کنترلی شفاف تبدیل می‌کند. این قابلیت جدید به توسعه‌دهندگان اجازه می‌دهد منطق داخلی عامل‌های مدیریت‌شده‌ی گوگل را پلیس‌کشی کنند و قوانینی تعریف کنند که در لحظه، تصمیمات مدل را نادیده بگیرد. گوگل همچنین این قابلیت را برای پروژه‌هایی که هیچ حساب پرداخت (Billing) متصل به آن‌ها نیست نیز باز کرده است.

عامل‌ها (Agents) در واقع پیاده‌سازی گوگل از حلقه‌ی عامل‌محور هستند که در آن یک فراخوانی API، یک محیط ایزوله‌ی لینوکس (Linux Sandbox) برای برنامه‌ریزی و اجرای کد ایجاد می‌کند. مدل سپس بسته‌ها را نصب کرده، فایل‌ها را می‌خواند و می‌نویسد و صفحات وب را تا رسیدن به هدف نهایی دریافت می‌کند. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی مدل‌های با عملکرد بالا مانند MAI-Cyber-1-Flash شرکت Microsoft اشاره کردیم، صنعت در حال گذار از رابط‌های چت ساده به سمت سامانه‌های خودمختاری است که به‌جای پاسخ دادن، اقدام می‌کنند؛ روندی که هدف آن تبدیل گفتگو به عمل است. این تغییر رویکرد در زیرساخت‌های اجرایی گوگل نیز مشهود است، به‌طوری‌که برخی تحلیل‌ها نشان می‌دهند حذف محیط‌های ابری در اپلیکیشن‌های دسکتاپ توانسته است تأخیر اجرای عامل‌ها را به‌شدت کاهش دهد.

سازوکار قلاب‌ها

به نقل از مستندات گوگل، این کنترل از طریق یک فایل hooks.json که در محیط ایزوله قرار می‌گیرد، اجرا می‌شود. از آنجا که محیط‌های ایزوله پیش‌تر نقاطی بودند که توسعه‌دهنده فقط می‌توانست داده ارسال کند و نظارتی بر درون آن‌ها نداشت، قلاب‌های محیطی (Environment Hooks) برای بازگرداندن دید پذیری و نظارت ضروری بودند.

این قلاب‌های محیطی، هندلرهایی را برای دو لحظه‌ی بسیار خاص در حلقه‌ی عملیاتی ثبت می‌کنند: دقیقاً پیش از اجرای یک ابزار و دقیقاً پس از پایان اجرای آن.

  • مدیریت پیش از اجرا (Pre-execution): این هندلرها با استفاده از عبارت‌های منظم (Regular Expressions)، نام ابزارها را شناسایی می‌کنند. این اجازه می‌دهد تا یک ورودی واحد بتواند همزمان اجرای کد و نوشتن فایل را پوشش دهد یا حتی تک‌تک فراخوانی‌ها را متوقف کند. اگر یک قلاب درخواست را رد کند (Denial)، سیستم فراخوانی ابزار را نادیده گرفته و دلیل مسدودسازی را به بافتار (Context) مدل بازمی‌گرداند. از آنجا، عامل می‌تواند مسیر دیگری را انتخاب کند یا دلیل خطا را در همان نوبت تعامل به کاربر توضیح دهد.
  • مدیریت پس از اجرا (Post-execution): این هندلرها داده‌های رویداد را مستقیماً از طریق پروکسی خروجی گوگل (Egress Proxy) به یک نقطه اتصال خارجی برای ثبت گزارش‌های بازرسی (Audit Logging) می‌فرستند. چون این درخواست‌ها از طریق پروکسی عبور می‌کنند، مقصد حتماً باید در لیست سفید (Allowlist) محیط قرار داشته باشد. توکن‌های احراز هویت به‌جای فایل قلاب، در پیکربندی شبکه ذخیره می‌شوند و پروکسی، هدرهای واقعی را هنگام ارسال روی شبکه تزریق می‌کند.

این قلاب‌ها به‌طور خاص ابزارهای داخلی کانتینر شامل اجرای کد و عملیات سیستم فایل (خواندن، نوشتن، لیست کردن و حذف فایل‌ها) را هدف قرار می‌دهند. نکته‌ی حائز اهمیت این است که توابع سفارشی که در سمت کلاینت اجرا می‌شوند یا سرورهای راه دور پروتکل زمینهٔ مدل (MCP)، خارج از کانتینر اجرا می‌شوند و بنابراین توسط این قلاب‌ها متوقف یا رهگیری نمی‌شوند.

ایمنی و سازوکارهای جایگزین

برای جلوگیری از بن‌بست‌های عملیاتی (Production Deadlocks)، گوگل طوری طراحی کرده است که در صورت بروز شکست، دسترسی‌ها به سمت «مجاز» حل شوند. اگر یک اسکریپت قلاب با خطا مواجه شود، زمانش تمام شود (Timeout)، خطای سرور برگرداند یا JSONی تولید کند که سیستم شناسایی نکند، فراخوانی ابزار بدون توجه به این خطا ادامه می‌یابد. گوگل خاطرنشان می‌کند که یک ابزار بررسی کد (Linter) خراب یا یک سرور تله‌متری که از دسترس خارج شده، هرگز نباید بتواند باعث توقف کامل یک اپلیکیشن عملیاتی شود.

با این حال، خطرات امنیتی در مورد فایل پیکربندی وجود دارد. گوگل هشدار می‌دهد که اگر عاملی دسترسی به شل (Shell) یا دسترسی نوشتن در فضای کاری داشته باشد، می‌تواند فایل hooks.json را ویرایش کند. برای تضمین مقاومت در برابر دستکاری، توصیه می‌شود توسعه‌دهندگان پیکربندی را از یک مخزن «فقط خواندنی» (Read-only) بارگذاری کنند.

اعتبارسنجی در دنیای واقعی

پلیس‌کشی رفتار عامل‌ها اکنون به حوزه‌ای سودآور تبدیل شده و سرمایه‌گذاران خطرپذیر مبالغ هنگفتی را به این حوزه تزریق کرده‌اند. گوگل با قرار دادن این بررسی مستقیماً در زمان اجرای خود (Runtime)، به این نیاز پاسخ می‌دهد. شرکت OffDeal، یک بانک سرمایه‌گذاری AI-native، هم‌اکنون از این قابلیت برای خط لوله‌های اعتبارسنجی استفاده می‌کند.

آلستون لین، مدیر فناوری (CTO) این شرکت، بیان کرد که آن‌ها از قلاب‌های پس از اجرا برای اجرای خط لوله‌های بررسی تصویر استفاده می‌کنند؛ به محض اینکه یک عامل تحلیلگر فهرستی از شرکت‌ها را می‌نویسد، سیستم قوانین کیفی در سطح پیکسل را برای ده‌ها لوگوی مورد نیاز در یک ارائه‌ی بانکی (Deck) اعمال می‌کند. لین می‌گوید: «پیش از قلاب‌های عامل، ما نمی‌توانستیم این کار را روی عامل‌های مدیریت‌شده‌ی Gemini انجام دهیم؛ چون محیط ایزوله دور بود و کد اعتبارسنجی ما جایی برای اجرا نداشت.»

به‌روزرسانی مدل و هزینه‌ها

بر اساس گزارش‌های رسمی، از ۲۱ ژوئیه ۲۰۲۶، مدل Gemini 3.6 Flash به‌عنوان مدل پیش‌فرض عامل‌های مدیریت‌شده فعال شده است. توسعه‌دهندگان بدون نیاز به تغییر کد، در تعامل بعدی این مدل را دریافت می‌کنند. هرچند توسعه‌دهندگان می‌توانند نسخه‌های دیگر را از طریق پیکربندی عامل تثبیت (Pin) کنند — مانند Gemini 3.5 Flash برای تداوم یا 3.5 Flash-Lite برای هزینه کمتر — اما مدل پیش‌فرض جدید برای حلقه‌ی عامل بهینه‌سازی شده است. این تغییرات در کنار تغییر متدهای کنترل Gemini و جایگزینی دستورات سیستمی در برابر Temperature، نشان‌دهنده‌ی تلاش گوگل برای افزایش دقت و پیش‌بینی‌پذیری پاسخ‌هاست.

برای عامل‌هایی که به‌عنوان منابع ماندگار (Persistent Resources) ذخیره شده‌اند، مدل در لحظه ایجاد تثبیت می‌شود و نمی‌توان آن را در هر فراخوانی تغییر داد. هدف از این کار، پیش‌بینی‌پذیر نگه داشتن رفتار فراخوانی ابزار، عیب‌یابی و مرزهای امنیتی است.

مدل Gemini 3.6 Flash در کنار نسخه‌های 3.5 Flash-Lite و نسخه امنیتی 3.5 Flash Cyber عرضه شد (اگرچه عرضه نسخه پرچمدار 3.5 Pro به تأخیر افتاد). بهبودهای عملکردی ثبت شده عبارتند از:

  • کارایی: ۱۷٪ توکن خروجی کمتری در شاخص Artificial Analysis مصرف می‌کند.
  • برنامه‌نویسی: در محک DeepSWE امتیاز ۴۹٪ را کسب کرد (در مقابل ۳۷٪ در نسل قبل).
  • قیمت‌گذاری: ۱.۵۰ دلار برای هر میلیون توکن ورودی و ۷.۵۰ دلار برای هر میلیون توکن خروجی (در مقایسه با ۹.۰۰ دلار برای خروجی در 3.5 Flash).

نرده‌های مالی و عملیاتی

برای جلوگیری از هزینه‌های خارج از کنترل در حلقه‌هایی که صدها گام اجرا می‌شوند، گوگل سقف توکن (Token Ceiling) را اضافه کرد. این سقف تمام توکن‌های ورودی، خروجی و توکن‌های زنجیره تفکر (Thinking Tokens) را در کل تعامل محدود می‌کند، اما توکن‌های کش‌شده (Cached) را شامل نمی‌شود. این محدودیت بیشتر یک «تلاش حداکثری» است تا یک سقف دقیق و سخت.

وقتی عاملی به این سقف می‌رسد، اجرا به صورت «ناقص» بازمی‌گردد اما وضعیت محیط ایزوله حفظ می‌شود تا با یک فراخوانی جدید و بودجه‌ی توکنی تازه، کار را ادامه دهد. گوگل تخمین می‌زند یک پردازش سنگین داده بین ۰.۷۰ تا ۳.۲۵ دلار هزینه داشته باشد و گردش‌های کاری پیچیده که سه تا پنج میلیون توکن مصرف می‌کنند، تقریباً ۵ دلار در هر تعامل هزینه داشته باشند. محاسبات مربوط به محیط ایزوله در حال حاضر در دوره پیش‌نمایش رایگان است.

دو قابلیت زیرساختی دیگر برای خودکارسازی بلندمدت اضافه شده‌اند:

۱. محرک‌های زمان‌بندی شده (Scheduled Triggers): این قابلیت یک عامل، یک پرامپت، یک محیط و یک عبارت Cron را در قالب یک منبع ماندگار پیوند می‌دهد. این سیستم به‌طور خودکار اجرا شده و به‌صورت پیش‌فرض پس از ۵ شکست متوالی، خودش را متوقف می‌کند. هر اجرا از همان محیط ایزوله قبلی استفاده می‌کند تا فایل‌های اجرای قبلی برای اجرای بعدی در دسترس باشند.
۲. رابط محیط‌ها (Environments Interface): این رابط به توسعه‌دهندگان اجازه می‌دهد جلسات محیط ایزوله را از طریق کد لیست کرده، بازرسی کنند و حذف نمایند. این قابلیت برای بازیابی IDهای محیط پس از قطع اتصال یا پاک‌سازی فوری محیط‌ها به‌جای انتظار برای انقضای هفت‌روزه استفاده می‌شود.

این به‌روزرسانی‌ها که پس از عرضه ۷ ژوئیه ۲۰۲۶ (شامل اجرای در پس‌زمینه، اتصالات MCP، فراخوانی توابع سفارشی و نوسازی اعتبارنامه‌ها در میان جلسه) می‌آیند، یک لایه سیاستی کامل برای توسعه‌کنندگانی که از کلیدهای API رایگان استفاده می‌کنند فراهم می‌کند.

برای متخصصان فنی، این تغییر فرض «اعتماد به مدل» را با معماری «اعتماد به قلاب» جایگزین می‌کند. گوگل با جابجایی مرز امنیتی از پرامپت به زمان اجرا (Runtime)، پذیرفته است که برنامه‌ریزی مبتنی بر LLM برای سیستم‌های فایل سازمانی با ریسک بالا، بیش از حد غیرقابل‌پیش‌بینی است.

گام بعدی شما

  • گردش‌های کاری عامل‌های خود را بررسی کنید تا بفهمید کدام فراخوانی ابزارها نیاز به اعتبارسنجی سخت‌گیرانه دارد و کدام‌ها می‌توانند خودمختار باقی بمانند.
  • برای جلوگیری از دسترسی‌های غیرمجاز و دستکاری توسط مدل، پیکربندی hooks.json را از یک مخزن Read-only بارگذاری کنید.
  • سقف توکن‌ها را بر اساس متوسط هزینه تعاملات خود تنظیم کنید تا از وقفه‌های ناگهانی در عملیات‌های پیچیده جلوگیری شود.

اما اثر این لایه‌ی کنترلی بر استانداردهای نوظهور MCP برای استفاده از ابزارهای بین‌پلتفرمی، مسیر بعدی این تحول است که در گزارش‌های آتی بررسی خواهیم کرد.

چرا این موضوع مهم است؟

این به‌روزرسانی با ایجاد قابلیت نظارت لحظه‌ای، اعتماد سازمان‌های بزرگ را برای سپردن دسترسی‌های سیستمی به عامل‌های AI جلب می‌کند. تخصص گوگل در مدیریت زیرساخت لینوکس اکنون به ابزاری برای کاهش ریسک‌های عملیاتی در استقرارهای تجاری تبدیل شده است.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی توسعه‌دهندگان ایرانی به این قابلیت‌ها نیازمند زیرساخت‌های میانجی است، اما پیاده‌سازی این معماری «اعتماد به قلاب» برای تیم‌های داخلی که عامل‌های محلی می‌سازند، الگوی امنیتی ارزشمندی است.

·نگاه ما
تحریریه دات‌هوش

گوگل با انتقال مرز امنیتی از لایه پرامپت به لایه runtime، راستی‌ آزمایی (Validation) را از یک توصیه به یک الزامی فنی تبدیل کرد. این حرکت نشان می‌دهد که حتی غول‌های AI نیز به پیش‌بینی‌پذیری کامل مدل‌های زبانی در مدیریت فایل‌های حساس اعتماد ندارند و ترجیح می‌دهند یک لایه کد سنتی و قطعی را بر تصمیمات احتمالی مدل اولویت دهند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.