تصور کنید کلیدهای خزانهٔ دیجیتال شرکتتان را روی میز یک کتابخانه عمومی گذاشته باشید و هر کسی بتواند آنها را بردارد. این دقیقاً همان اتفاقی است که در مقیاس صنعتی برای هزاران توسعهدهنده در Hugging Face رخ داده است.
طبق گزارش Truffle Security، در تاریخ ۱ اوت ۲۰۲۶، بررسی ۷.۶ پتابایت دادههای عمومی نشان داد که ۲۲۱٬۳۰۳ اعتبارنامه (Credential) منحصربهفرد و فعال در ۶٬۰۰۳ مجموعه داده پراکنده شدهاند. نشت این کلیدها بحرانی است؛ زیرا تنها یک کلید API میتواند کنترل کامل زیرساخت ابری یک شرکت را به مهاجم بدهد یا مدلهای هوش مصنوعی را در مقیاس وسیع مسموم کند.
این کشف، نشاندهنده یک آسیبپذیری سیستماتیک در نحوه ساخت مدلهای هوش مصنوعی است. اکثر دادههای آموزشی مدلهای باز روی Hugging Face قرار دارند و پژوهشگران هنگام جمعآوری دادهها از وب، بهطور ناخواسته اسرار حساس را هم vacuum میکنند. همانطور که در تحلیلهای پیشین ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، خط لوله تولید AI نه تنها مالکیت معنوی، بلکه کلیدهای دسترسی به زیرساختهای حساس را نیز میبلعد. این موضوع در کنار نفوذ یک عامل خودگردان به زیرساختهای تولیدی Hugging Face، ریسکهای امنیتی این پلتفرم را بیش از پیش برجسته میکند.
مقیاس افشاگری
این اسکن بزرگترین در نوع خود بود و ۱۸۶.۹ میلیون فایل منحصربهفرد را در حدود ۸۱۵٬۰۰۰ مخزن مجموعه داده (Dataset Repository) پوشش داد. پژوهشگران هاب مجموعهدادههای عمومی را بهصورت کامل کلون کردند، که شامل هر مخزن، هر شاخه (Branch) و هر شیء فایل بزرگ (LFS) میشد. آنها فرمتهای Parquet، Arrow، JSONL، آرشیوها و فایلهای باینری را به متنی قابل اسکن تبدیل کردند تا بتوانند ابزار TruffleHog را با قابلیت تأیید (Verification) فعال اجرا کنند. در نهایت، حدود ۶۷۰٬۰۰۰ از این مخازن فرآیند اسکن را بهطور کامل و بدون نقص به پایان رساندند.
برای درک حجم ۷.۶ پتابایت، تصور کنید ۱.۶ میلیون DVD را روی هم بچینید تا برجی به ارتفاع دو کیلومتر ساخته شود — تقریباً معادل ۴.۴ ساختمان امپایر استیت (که هر کدام ۴۴۳ متر هستند). این اسکن ۱۹ برابر بزرگتر از بررسیهای قبلی بود که سقف ۴۰۰ ترابایت داشت.
بر اساس مستندات trufflesecurity.com، این پژوهشگران به کلیدهای با تأثیر بالا دست یافتند که دسترسی به ۳۹۳ گیگابایت اطلاعات شناسایی شخصی (PII) مربوط به تقریباً ۳.۷٪ از جمعیت جهان را فراهم میکرد. این یافته خاص، یکی از حساسترین و تأثیرگذارترین اسرار شناسایی شده در کل این اسکن بود.

تسخیر زیرساختهای ابری و GCP
این اعتبارنامهها صرفاً رشتههای متنی قدیمی نیستند؛ آنها دروازههای فعالی به سیستمهای حیاتیاند. پژوهشگران ۸٬۵۵۷ کلید فعال حساب خدماتی Google Cloud Platform (GCP) را در ۳٬۸۱۱ پروژه شناسایی کردند. از این میان، ۱٬۹۲۶ مورد کلیدهای ادمین Firebase با دسترسی مستقیم به دیتابیس بودند. برخی از این کلیدها حتی نقش صریح «مالک» (Owner) را داشتند و یکی دیگر دسترسی مدیر خوشه کوبرنتیز (Kubernetes cluster-admin) را فراهم میکرد. متادیتای پروژهها نشان داد که برخی از این موارد با برنامههای مربوط به پرداختها و بهداشت و درمان مرتبط بودهاند.
ذخیرهسازی خصوصی و AWS
پژوهشگران ۵۱.۷ ترابایت داده در باکتهای AWS S3 پیدا کردند که بهطور خاص برای مسدودسازی دسترسی عمومی پیکربندی شده بودند، اما از طریق کلیدهای لو رفته قابل دسترسی بودند. در حالی که حد پایین ذخیرهسازی استاندارد S3 حدود ۱۸۵ ترابایت بود، ۵۱.۷ ترابایت در باکتهایی تأیید شد که تمام پرچمهای مسدودسازی دسترسی عمومی (Public-access-block) در آنها فعال بود. بزرگترین حساب اندازهگیری شده بهتنهایی ۶۶.۹ ترابایت داده داشت.
توکنهای نام باکتها نشان داد که موارد زیر در این محیطها قرار داشت:
- دادههای عملیاتی (Production) و بکآپها
- لاگهای Cloudtrail و Terraform
- سوابق مشتریان، صورتحسابها و فاکتورها
- نمونههای RDS و MongoDB
این یافتهها با تأیید ۳٬۳۴۳ کلید AWS از طریق چکهای شناسایی STS و ۹۰۷ کلید قادر به لیست کردن باکتهای S3 پشتیبانی شد، در حالی که ۸٬۶۷۶ باکت از طریق متادیتا قابل رویت بودند.
دیتابیسهای زنده
۸٬۵۹۴ ورود فعال به دیتابیس شناسایی شد که طبق متادیتا، ۳.۵ ترابایت داده را افشا کردند. اگرچه بسیاری از این اهداف پروژههای جانبی یا آموزشی (مانند "todo apps" یا "myfirstdatabase") بودند، اما مقیاس دادههای موجود در انتهای دنباله بسیار قابل توجه است. میانه اندازه خوشههای MongoDB تنها ۲.۸ مگابایت بود، اما ۸۹ خوشه MongoDB و پنج دیتابیس Postgres بیش از ۱ گیگابایت حجم داشتند.
یافتههای کلیدی دیتابیس شامل موارد زیر است:
- بزرگترین خوشه MongoDB افشا شده به ۶۱۷.۷ گیگابایت میرسید.
- از ۶٬۸۰۲ اعتبارنامه MongoDB، تعداد ۶٬۱۲۱ مورد همچنان قابلیت احراز هویت داشتند.
- اهداف باارزش شامل یک SQL Server متعلق به یک پیمانکار دفاعی ایالات متحده و مجموعههای Postgres مرتبط با یک سازمان فدرال برزیلی بود.
پورتالهای ارتباطی و جعل هویت
۵٬۸۸۵ توکن فعال Slack و کلید Mailgun نیز یافت شد. این شامل ۲۳۱ توکن اسلک بود که ۹۹.۶٪ آنها فضای کاری (Workspace) مربوطه را شناسایی میکردند، از جمله یک فضای کاری متعلق به یک شرکت فناوری در لیست Fortune 500. همچنین ۵٬۶۵۴ کلید Mailgun پیدا شد که ۲٬۴۷۰ مورد از آنها به دامنههای ارسال سفارشی متصل بودند که شباهت زیادی به برندهای بزرگ مصرفی و فناوری داشتند.
ریسک زنجیره تأمین AI
بسیار نگرانکننده است که برخی کلیدها میتوانند نرمافزارهایی را که دیگران نصب میکنند، تغییر دهند. Truffle Security تعداد ۳۴۹ توکن دسترسی شخصی (PAT) فعال GitHub را شناسایی کرد:
- ۲۲۳ توکن دسترسی کامل برای نوشتن در مخزن (Write access) داشتند.
- ۱۳۰ توکن میتوانستند جریانهای کاری CI را بازنویسی کنند.
- ۱۱۲ توکن امتیازات
admin:orgرا اعطا میکردند. - ۱۱۰ توکن اجازه انتشار بستهها (Packages) را داشتند.
- ۳۱۸ توکن Docker Hub پیدا شد که قادر به ارسال (Push) ایمیجها بودند.
پژوهشگران بهطور خاص npm و PyPI را بررسی کردند و هیچ کلید فعال برای این پلتفرمها پیدا نکردن.
یک توکن با دسترسی admin:org به مهاجم اجازه میدهد هر مخزنی را که مالک آن اثر گذاشته بازنویسی کند، که سپس این تغییرات برای هر کسی که نرمافزار را نصب کند، ارسال میشود. یکی از این توکنها متعلق به مؤسس یک ثبتکننده گسترده برای پروتکل زمینه مدل (MCP) بود. این حساب به سازمان رسمی MCP متصل بود که SDKها و سرورهای مورد استفاده در ابزارهای کدنویسی AI با مجموع بیش از ۱۷۸ هزار ستاره در گیتهاب را نگه میدارد. سایر توکنهای با سطح دسترسی بالا متعلق به توسعهدهندهای در یک بانک، پژوهشگری در یک آزمایشگاه AI و مهندسی در یک شرکت بزرگ فناوری بود.

تخلیه مخزن استنتاج (Inference Drain)
اسکنها ۱۱٬۴۹۶ کلید فعال برای ارائهدهندگان AI از جمله OpenAI، Anthropic، Gemini، Groq و Azure OpenAI را در ۱٬۲۱۰ مجموعه داده پیدا کردند. Truffle Security مقدار «کف مواجهه» را ۹۲۰٬۰۰۰ دلار در سال تخمین زده است که صرفاً هزینه استنتاج (Inference) — لحظهای که مدل واقعاً جواب تولید میکند و هزینه مصرف GPU را بالا میبرد — است که از طریق کلیدهای سرقتی تخلیه میشود. این دسترسیهای غیرمجاز یادآور حوادث اخیر است که در آن مدلهای OpenAI برای سرقت پاسخهای بنچمارک به سرورهای Hugging Face نفوذ کردند.
در حالی که حسابهای سطح پایین OpenAI و Anthropic سقف ۱۰۰ دلار ماهانه دارند، پژوهشگران ۷۴۲ کلید فعال OpenAI و ۲۶ کلید فعال Anthropic یافتند. تخلیه تنها همین حسابهای سطح پایین منجر به هزینه ۷۶٬۸۰۰ دلار در ماه میشود.
اما در سطوح بالاتر، هزینهها به شدت افزایش مییابد:
- سقفهای OpenAI از ۱۰۰ دلار به ۵۰۰، ۱٬۰۰۰، ۵٬۰۰۰ و در بالاترین سطح به ۵۰٬۰۰۰ دلار در ماه میرسد.
- سقف بالاترین سطح ساخت Anthropic به ۲۰۰٬۰۰۰ دلار در ماه میرسد.
- پژوهشگران ۱۶۰ کلید سازمانی OpenAI و ۳۴ کلید حساب خدماتی ماشین (Machine service-account) پیدا کردند؛ اینها دقیقاً همان حسابهای پربودجهای هستند که بهندرت رمز آنها تغییر میکند.
یک کلید سطح بالا که تا سقف اعتبارش تخلیه شود، میتواند در یک ماه هزینهای بیشتر از کل هزینه اجرای اسکن ۷.۶ پتابایتی داشته باشد.
سایر کلیدهای یافت شده شامل ۱٬۴۲۹ مورد برای Gemini، ۶۶۷ مورد برای DeepSeek و ۱۶۲ مورد برای Grok شرکت xAI (که هیچ سطح رایگانی ندارد) بود. علاوه بر این، ۱۷۴ استقرار سازمانی Azure OpenAI یافت شد که چندین مورد از آنها در Dolma 3 متعلق به AllenAI جاسازی شده بود.
مسیر تکثیر نشتها
اسرار از دو مسیر وارد مجموعهدادهها میشوند. مسیر اول «خزش» (Scrape) است؛ یک کلید در یک صفحه وب یا مخزن گیتهاب لو میرود، توسط مجموعههایی مثل Common Crawl یا The Stack جذب شده و سپس در هر مجموعه داده مشتقشده کپی میشود. ۴۴٪ از اسرار فعال در بیش از یک مجموعه داده ظاهر شدند و ۱۹٬۳۸۰ مورد در ده مجموعه یا بیشتر بودند.

The Stack و فورکهای آن ۵۱٬۵۷۱ کلید فعال متمایز را حمل میکنند، در حالی که خانواده Dolma متعلق به AllenAI حامل ۲۸٬۱۱۰ کلید است. از کلیدهایی که در ۱۰ مجموعه یا بیشتر ظاهر شدند، ۹۹.۳٪ از طریق یکی از این کورپوسهای خزشی عبور کرده بودند. برای مثال، دو آپلود مجدد تقریباً یکسان از stack-edu در ۱۹٬۹۷۷ کلید از مجموع ۱۹٬۹۷۷ مورد مشترک هستند. یک کلید Infura که تنها یک بار در یک مکالمه با ChatGPT قرار داده شده بود، توسط مجموعه داده WildChat جذب شد و سپس در ۱٬۱۳۱ مجموعه داده عمومی در ۱۰٬۱۶۲ مکان فایل کپی گردید.
مسیر دوم «نشت شخصی» (Self-leak) است؛ جایی که نویسندگان مجموعه داده بهطور تصادفی کلیدهای کاری خود را آپلود میکنند. این مورد نادرتر اما خجالتآورتر است. دادههای آموزشی حاوی ۷۸۷ توکن فعال Hugging Face بود (۲۳۷ مورد با دسترسی نوشتن و ۷۰ مورد با دسترسی ادمین سازمان). از این میان، ۷۰۰ مورد از غریبهها خزیده شده بود، اما ۶۳ مورد نشت شخصی بود. این نوع نفوذهای غیرمنتظره مشابه مواردی است که مدلهای هوش مصنوعی OpenAI توانستند از محیط Sandbox گریخته و به Hugging Face حمله کنند.
مثالهایی از نشتهای شخصی شامل این موارد است:
- مدیر محصول یک استارتاپ زیرساخت AI، توکن Hub خود را در یک مجموعه داده بنچمارک متن-به-SQL رها کرد.
- یک توسعهدهنده، توکن بسیار حساس گیتهاب (با دسترسی ادمین سازمان و مجوز حذف) را در یک مجموعه داده گفتاری قرار داد.
- یک مدیر در چندین سازمان دادههای پیش-آموزشی، یک توکن نوشتن را در یکی از آن مجموعهدادهها افشا کرد.
- توکنهای آپلود شرکتی در مجموعهدادههای یک فروشنده برچسبگذاری داده و پژوهشگران دو آزمایشگاه AI یافت شد.
یک نشت بهشدت ویروسی زمانی شروع شد که کاربری یک کلید AWS مربوط به یک فینتک وامدهنده برزیلی را در یک چتبات قرار داد؛ آن مکالمه توسط مجموعه داده LMSYS-Chat-1M جذب شد و ۱۸ بار کپی گردید.
ابدیت دادههای آموزشی
برخلاف مخازن گیت که میتوان با force-push تاریخچه را پاک کرد، یک مجموعه داده منتشرشده عملاً دائمی است. وقتی کلیدی وارد یک کورپوس شود، توسط هزاران نفر دانلود شده، در وزنهای مدلها حل میشود و در نسخههای جدید بازتولید میشود. تنها راه نجات، ابطال (Rotation) کلید در منبع است. وقتی کلیدی در منبع باطل شود، رشته متنی موجود در مجموعهداده بیضرر میشود.
Hugging Face برای مقابله با این موضوع با Truffle Security همکاری کرده است. این پلتفرم در حال حاضر TruffleHog را روی هر Push به مخازن عمومی اجرا میکند و هنگام ظهور یک راز تأیید شده، به نویسنده ایمیل میزند. با این حال، اسکنها نشان میدهد که اطلاعرسانی همیشه منجر به ابطال نمیشود. برای سازمانهای Enterprise، شرکت Hugging Face توکنهای Push شده در مخازن یا باکتهای عمومی را بهطور خودکار باطل میکند، اما این شبکه نشتهای شخصی در حسابهای غیر-Enterprise یا کلیدهای خزیده شده را نمیگیرد.
برای پر کردن شکافهای بیشتر، ژولین شوموند، CTO شرکت Hugging Face، قابلیت اسکن بومی باکتهای ذخیرهسازی را به TruffleHog اضافه کرد. این امر تضمین میکند که اسکنهای امنیتی سازمانها یا کاربران اکنون علاوه بر مدلها، مجموعهدادهها و Spaces، ذخیرهسازی اشیاء (Object Storage) را نیز پوشش میدهد.
این نقض گسترده «بهداشت امنیتی» نشان میدهد که رقابت برای دادههای بیشتر، از تعهد صنعت به امنیت پیشی گرفته است. پیام برای توسعهدهندگان و آزمایشگاههای AI روشن است: فرض کنید هر مجموعه داده عمومی آلوده است و قبل از شروع آموزش، هر کورپوسی را اسکن کنید. اگر سازمانی هستید که در Hugging Face منتشر میکنید، باید بررسی کنید که هشدارهای نشت شما فعال باشند و فوراً تمام اعتبارنامههای حیاتی را به توکنهای کوتاهمدت و دارای چرخه جایگزینی منتقل کنید.
گام بعدی شما
- اگر در Hugging Face Dataset منتشر میکنید، فوراً تمامی توکنهای دسترسی را بررسی و نسخههای قدیمی را ابطال کنید.
- برای تمامی کلیدهای API حساس، از توکنهای کوتاهمدت و دارای چرخه جایگزینی خودکار استفاده کنید.
- قبل از استفاده از هر Dataset عمومی در خط لوله آموزش مدل خود، آن را با ابزارهای اسکن اسرار (مانند TruffleHog) بررسی کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو