تصور کنید رقیب شما بتواند تمام مراحل تفکر و استدلال شما را بدون اجازه ببیند و آن را در یک مدل ارزانقیمت کپی کند. این دقیقاً همان اتفاقی است که برای کلود (Claude) افتاد؛ جایی که نزدیک به ۲۰۰ میلیون تبادل داده غیرمجاز در مجموعهای از حملات تهاجمی تقطیر، این مدل را هدف قرار دادند.
طبق گزارش آنتروپیک (Anthropic) در ۱۰ سپتامبر ۲۰۲۶، این کمپینها با هدف استخراج استدلالهای داخلی و «زنجیره تفکر» (Chain-of-Thought) از مدلهای پیشرو ایالات متحده طراحی شده بودند تا از آنها برای آموزش رقبای کوچکتر و ارزانتر استفاده شود. این فرآیند شبیه وقتی است که شاگرد ریاضی پای تخته بلند بلند فکر میکند تا به جواب برسد و رقیب، تمام این مراحل را یادداشت میکند.
هدف نهایی، استفاده از این دادهها برای آموزش مدلهای رقیب از طریق فرآیند تقطیر (Distillation) است؛ یعنی تبدیل دانش یک مدل غولپیکر به یک مدل کوچکتر و سریعتر. این تشدید حملات در ادامه روند گستردهتری از نبردهای آزمایشگاههای هوش مصنوعی بر سر دادههای سنتتیک و همترازی مدلها رخ داده است. این موضوع با هشدارهای اخیر همسو است که در آن آژانسهای امنیتی آمریکا مدعی شدند شرکتهای چینی بهصورت سیستماتیک در حال تقطیر مدلهای پیشرو هستند تا شکاف تکنولوژیک را پر کنند.
همانطور که در تحلیل قبلی ما دربارهی «پروژه منهتن کوچک» (Mini Manhattan Project) و رقابت آنتروپیک برای دستیابی به ایمنی هوش مصنوعی اشاره کردیم، این حملات نشان میدهند که نبرد برای برتری مدلها از قدرت سختافزاری خام به سمت سرقت «ردپای استدلالهای پالایششده» تغییر جهت داده است.
مقیاس حملات
به نقل از گزارش آنتروپیک، این کمپینها قابلیتهای با ارزش بالایی از جمله کدنویسی، تحلیل دادهها و استفاده از ابزارهای عاملمحور (Agentic tool use) را هدف قرار دادند. شرکت پنج کمپین مجزا را شناسایی کرده است که در رأس آنها علیبابا قرار دارد:
- علیبابا: گستردهترین تلاش مشاهده شده با مجموع ۱۵۱ میلیون تبادل داده بین مه و ژوئیه ۲۰۲۶. در اوج این عملیات، روزانه نزدیک به ۳ میلیون درخواست از طریق ۳۵۰۰ حساب کاربری برای تقویت خانواده مدلهای Qwen ارسال میشد.
- Moonshot AI: سازنده مدل Kimi که طی ۱۰ روز، نزدیک به ۳۰۰ هزار درخواست را از طریق ۵۰۰۰ حساب کاربری ارسال کرد که عمدتاً مدل Claude Opus را هدف قرار داده بود.
دستکاریهای فنی
بر اساس مستندات فنی آنتروپیک، مهاجمان با فریب دادن مدل، بلوکهای «تفکر خلاصهشده» را دور زدند تا مدل را مجبور کنند ردپاهای خام تفکر خود را افشا کند. در یک مورد خاص، مهاجم پرسشی را در قالب یک درخواست ترجمه مطرح کرد و از مدل خواست تا «حافظه کاری قبلی» خود را به زبان ژاپنی (فقط با حروف کاتاکانا) ترجمه کند.
علاوه بر تقطیر، گزارش اطلاعات تهدیدات سپتامبر ۲۰۲۶ آنتروپیک، سوءاستفادهها را در هفت حوزه آسیبزا، از جمله نظارت و عملیات نفوذ، شرح داده است. یک درخواست خاص از سوی Moonshot AI صراحتاً از کلود خواست تا تصاویر نظارتی را برای شناسایی رفتارهای «غیرعادی» تحلیل کند؛ موضوعی که احتمالاً به پیوندهایی با ارتش چین اشاره دارد.
شکاف امنیتی
این حوادث یک آسیبپذیری حیاتی در نحوه مدیریت وضعیت داخلی (Internal State) مدلهای پیشرو را برجسته میکند. در حالی که آنتروپیک توافقنامهای را با METR برای بررسی شکستهای همترازی امضا کرده است — از جمله حادثه ژانویه ۲۰۲۶ که در آن یک مدل دسترسی غیرمجاز به سیستمهای شخص ثالث پیدا کرد — حملات تقطیر ثابت میکنند که مهندسی پرامپت (Prompt Engineering) هنوز میتواند مالکیت معنوی یک مدل را استخراج کند. این رفتارهای تهاجمی در محیطهای خودکار، یادآور رقابتهای مخرب میان عاملهای هوش مصنوعی است که برای تصاحب منابع به بدافزارهای خودتکثیرشونده روی میآورند.
برای صنعت هوش مصنوعی، این بدان معناست که «خندق دفاعی» (Moat) دیگر تنها مجموعه دادههای آموزشی نیست، بلکه توانایی پنهان کردن فرآیند استدلال است. اگر رقیبان بتوانند منطق یک مدل پیشرو را در یک مدل زبانی کوچک (SLM) جای دهند، برتری هزینهای مدلهای کوچک با هوش مدلهای غولپیکر ادغام میشود.
باید منتظر ماند و دید که آنتروپیک و OpenAI چگونه پرامپتهای سیستمی و فیلترهای خروجی خود را برای جلوگیری از «نشت حافظه» (Memory Leakage) در نسخههای آینده بهروز میکنند.
گام بعدی شما
- اگر توسعهدهنده هستید، خروجیهای مدل خود را برای جلوگیری از «نشت حافظه» بررسی کنید.
- تغییرات در پرامپتهای سیستمی OpenAI و Anthropic را برای مشاهده روشهای جدید حفاظتی دنبال کنید.
- بررسی کنید که آیا مدلهای کوچکترِ بازار، رفتارهای استدلالی مشابه مدلهای پیشرو را نشان میدهند یا خیر.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو