تصور کنید دانشآموزی شب امتحان به پاسخنامه دسترسی پیدا کند؛ نمره ۲۰ او دیگر نشانه هوش نیست، بلکه فقط قدرت حافظه است. این دقیقاً همان بحرانی است که اکنون مدلهای هوش مصنوعی با آن دستوپنجه نرم میکنند.
نشت دادههای محک (Benchmark Contamination) زمانی رخ میدهد که سوالات آزمون بهطور اتفاقی وارد دادههای آموزشی مدل شوند و مدل بهجای استدلال، صرفاً پاسخها را بازخوانی کند. این چالش تنها محدود به دادههای آموزشی نیست، بلکه در محیطهای عملیاتی نیز دیده میشود؛ برای مثال، ناکارآمدی تستهای داخلی مخزن کد در اعتبارسنجی وصلههای AI نشان میدهد که چگونه معیارهای ارزیابی میتوانند فریبنده باشند. طبق اعلام گوگل دیپمایند (Google DeepMind) در ۲۸ اوت ۲۰۲۶، این شرکت پروژهای آزمایشی را با همکاری مؤسسه ایمنی هوش مصنوعی سنگاپور آغاز کرده تا مطمئن شود مدلها واقعاً در حال حل مسائل هستند، نه تکرار آنها.
همانطور که در پوشش پیشین ما دربارهی دسترسی به ابزارهای پریمیوم گوگل اشاره کردیم، اکنون تمرکز توسعهدهندگان از «دسترسی» به «اعتبار» ارزیابیها تغییر کرده است.
برای حل این مشکل، گوگل از سرویس Confidential Space در مجموعه گوگل کلاود (Google Cloud) استفاده میکند تا آزمونهای دوبلبلایند را روی مدل Gemini Flash Lite اجرا کند. بر اساس مستندات این پروژه، ساختار فنی این سامانه سه تضمین کلیدی ارائه میدهد:
- حریم خصوصی دادهها: پرامپتهای آزمون خارجی رمزنگاری شدهاند و برای گوگل نامرئی هستند. این رویکرد در تضاد با برخی سیاستهای پیشین است، جایی که دسترسی پیشفرض Gemini به دادههای Workspace نگرانیهای جدی دربارهی حریم خصوصی و امنیت دادههای داخلی ایجاد کرده بود.
- حفاظت از مالکیت معنوی: وزنهای مدل (Weights) — که در واقع دستور پخت و ساختار داخلی مدل هستند — از دید ارزیابان خارجی پنهان میمانند.
- تأییدیه ریاضی: اثباتهای رمزنگاریشده تضمین میکنند که هیچیک از طرفین به دادههای خصوصی طرف مقابل دسترسی نداشتهاند.
این رویکرد، بنبست قدیمی میان شرکتهای سازنده و ارزیابان را میشکند. پیش از این، ارزیابان یا باید به وزنهای محرمانه مدل دسترسی مییافتند یا به وعدههای شفاهی شرکتها اعتماد میکردند. به گزارش منابع صنعتی، همین اصطکاک باعث شد ارزیابی مدل Fable 5 شرکت Anthropic در محک ARC-AGI بهدلیل سیاستهای سختگیرانه حفظ دادهها به تأخیر بیفتد.
برای دنیای کسبوکار، این تغییر به معنای گذار از قراردادهای «مبتنی بر اعتماد» به تضمینهای «مبتنی بر ریاضیات» است. این موضوع بهویژه برای بخشهای حساس مانند امنیت سایبری یا اطلاعات دولتی که حاکمیت دادهها در آنها غیرقابل مذاکره است، حیاتی است.
گام بعدی شما
- گزارش فنی کامل دیپمایند را دنبال کنید تا ببینید آیا نتایج Gemini Flash Lite در این شرایط سختگیرانه تغییر میکند یا خیر.
- اگر از مدلهای بازمتن استفاده میکنید، از ابزارهای تشخیص نشت داده برای اعتبارسنجی نتایج خود استفاده کنید.
- بررسی کنید که آیا ارزیابیهای مدلهای رقیب در سال ۲۰۲۶ از متدهای رمزنگاریشده استفاده کردهاند یا خیر.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو