تصور کنید مهاجمی بتواند «افکار پنهان» قدرتمندترین مدلهای هوش مصنوعی جهان را استخراج کند، آن هم تنها با هدایت ردپاهای رمزگذاریشده به سمت نسخههای کوچکتر و ضعیفتر از همان مدل. این کشف که توسط الکساندر پانفیلوف (Alexander Panfilov) از دانشگاه توبینگن (University of Tübingen) رهبری شده، نشان میدهد گامهای استدلالی محرمانهای که شرکتها برای محافظت از مالکیت معنوی خود پنهان میکنند، آنقدرها که تصور میشد امن نیستند.
این یافته در حالی منتشر میشود که رقابت ژئوپلیتیکی بر سر تقطیر (Distillation) شدت یافته است؛ فرآیندی که در آن از خروجیهای یک مدل قدرتمند برای آموزش مدلی کوچکتر و ارزانتر استفاده میشود. در حالی که تقطیر یک رویه استاندارد در صنعت است، سیاستگذاران آمریکایی نگراناند که آزمایشگاههای چینی از این روش برای کپیبرداری سیستماتیک از فناوریهای ایالات متحده استفاده کنند. توانایی افشای ردپاهای واقعی استدلال، بهجای دریافت صرفاً پاسخ نهایی، سد ورود برای این نوع سرقتهای صنعتی و مالکیت معنوی را بهشدت پایین میآورد.
بحث بر سر تقطیر مدلها
تقطیر یک تکنیک شناختهشده و تثبیتشده برای انتقال کارآمد قابلیتها از مدلهای موجود به مدلهای جدید است. این روش بهویژه زمانی که توسعهدهندگان قصد ساخت مدلهای وزنهای باز (Open Weights) یا مدلهایی که بهطور کامل قابل دانلود باشند را دارند، بسیار رایج است. با این حال، این موضوع اکنون به یک نقطه تنش و جرقهای برای اختلافات بینالمللی تبدیل شده است.
به نقل از گزارشهای رسمی، OpenAI در ماه فوریه به قانونگذاران آمریکایی اطلاع داد که به نظر میرسد مدل R1 شرکت DeepSeek از یکی از مدلهای این شرکت برای کپیبرداری جهت ساخت یک مدل استدلالی استفاده کرده است. در ماه ژوئن نیز Anthropic به قانونگذاران گفت که شرکت Alibaba بهطور سیستماتیک از مدلهای آنتروپیک تقطیر کرده است تا مدلهای خود را که با نام Qwen شناخته میشوند، بسازد.
در مقابل، برخی معتقدند تقطیر برای پیشرفت ضروری است. مارک زاکربرگ (Mark Zuckerberg)، مدیرعامل Meta، در یادداشتی تأکید کرد که تقطیر «یکی از اصول مهم در نحوه عملکرد اکوسیستم متنباز است» و هشدار داد که اعمال محدودیتها بر این روند میتواند ایالات متحده را در موضع ضعف قرار دهد. یارین گال (Yarin Gal) از دانشگاه آکسفورد نیز میافزاید که اگر همه شرکتها دسترسی به تقطیر را مسدود کنند، نرخ کلی پیشرفت در حوزه هوش مصنوعی آسیب خواهد دید.
همانطور که در بحثهای گذشته ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، تعادل بین دسترسی آزاد و محافظت از IP همواره یک چالش است.
سازوکار حمله
این حمله از یک ویژگی معماری خاص در نحوه مدیریت محاسبات توسط شرکتهایی مثل OpenAI، Anthropic و Google بهره میبرد. مدلهای پیشرفته برای حل مسائل دشوار از زنجیره تفکر (Chain-of-Thought) استفاده میکنند و وظایف را به بخشهای کوچکتر و سازنده تقسیم میکنند. برای محافظت از این فرآیند اختصاصی، شرکتها استدلال را مخفی نگه میدارند اما نسخهای رمزگذاریشده از آن استدلال را به کامپیوتر کاربر میفرستند تا بخشی از محاسبات را برونسپاری کرده و بار پردازشی را کاهش دهند.
پانفیلوف و تیمش — که شامل پژوهشگران مؤسسه مکس پلانک، مؤسسه ایمنی AI (MATS Research) و شرکت امنیتی Snyk بود — دریافتند که میتوان این ردپاهای رمزگذاریشده را رهگیری کرد و آنها را به نسخهای کوچکتر از همان خانواده مدل ارسال کرد.
از آنجا که مدلهای کوچکتر از نظر محاسباتی بهینهتر و ارزانتر هستند، اغلب برای کارهای سادهتر به کار میروند. نکته کلیدی این است که این مدلها همراستاسازی (Alignment) کمتری دریافت کردهاند. برخلاف برادران بزرگترشان، مدلهای کوچک احتمال کمتری دارد که درخواستهای رمزگشایی محتوای ردپا را رد کنند. فلوریان ترامر (Florian Tramer) از ETH زوریخ، ایده جایگزینی پیامها با یک مدل ضعیفتر که کلید رمزگشایی یکسانی دارد را «بسیار هوشمندانه» خواند و تأکید کرد که این موضوع «قطعاً در حال تبدیل شدن به یک مسئله جدی است».
یافتههای کلیدی و نقاط ضعف
- پراکندگی آسیبپذیری: پانفیلوف اعلام کرد: «تمام ارائهدهندگان مدلهای پیشرو که آزمایش کردیم، دارای این آسیبپذیری هستند.» این مورد شامل تمام مدلهایی است که از طریق API در گوگل، آنتروپیک و OpenAI در دسترس هستند.
- نشت دادهها: این روش موفق شد اطلاعات حساس شخصی، از جمله رمزهای عبور و کلیدهای API را که در ردپاهای استدلالی ضبطشده از دستگاه کاربر بودند، بازیابی کند.
- شواهد تقطیر: پژوهشگران برای آزمایش تقطیر، ۹۰ پرسش را به مدلهای مختلف دادند. وقتی چند کلمه اول از ردپاهای استدلالی مدلهای تجاری به مدل چینی Kimi K3 (محصول Moonshot AI) داده شد، خروجیهای آن بهطور عجیبی شبیه به استدلالهای پنهان Claude Opus 4.8 و GPT 5.6 Sol بود.
- تفاوت مدلها: پژوهشگران اشاره کردند که مدلهای وزنباز دیگر، بهویژه DeepSeek چین و Inkling (محصول شرکت آمریکایی Thinking Machines)، این شباهت استدلالی با کلود اپوس را نشان ندادند.
- رابطه علی و معلولی: پژوهشگران تصریح کردند که با وجود این شباهتها، کار آنها «نمیتواند بهطور علی و معلولی تقطیر را ثابت کند»، بلکه تنها نشاندهنده شباهتهای ساختاری است.
واکنش صنعت
به دنبال اطلاعیهای که ماه گذشته ارسال شد، OpenAI، Anthropic و Google اقدامات کوتاهمدتی را برای مسدود کردن رفتارهای تکرار (replay) مورد استفاده در این حمله اجرا کردند. مایکل آکیمان (Michael Aciman)، سخنگوی آنتروپیک، اظهار داشت که این پژوهش شامل دسترسی به زیرساختهای داخلی آنتروپیک، بازیابی کلیدهای رمزنگاری یا بازیابی دادههای شخصی از سیستمهای این شرکت نبوده است.
با این حال، پانفیلوف هشدار میدهد که اگرچه نشت دادههای خصوصی تا حد زیادی مهار شده، اما برخی ردپاهای استدلالی همچنان قابل کشف هستند. او استدلال میکند که یک راهکار کامل و قطعی نیازمند بازنگری بنیادین در نحوه عملکرد APIهای این شرکتها است.
مخاطرات ژئوپلیتیک
این نقص فنی به بحثهای گستردهتر درباره برتری در هوش مصنوعی دامن میزند. تندروهای آمریکایی معتقدند تقطیر به چین مزیت استراتژیک میدهد تا مدلهای وزنباز با عملکرد بالا را با کسری از هزینههای معمول بسازد.
اما کایل میلر (Kyle Miller) از مرکز امنیت و فناوریهای نوظهور (CSET) میگوید مشخص نیست تقطیر واقعاً چقدر به چین کمک میکند. او اشاره میکند که تقطیر تنها مدلهای موجود را تا حد محدودی بهبود میبخشد و شرکتهای چینی احتمالاً تخصص لازم برای ساخت مدلهای پیشرو از صفر را دارند. میلر میگوید: «به باور من، اگر توانایی تقطیر برای آزمایشگاههای چینی حذف شود، چشمانداز رقابتی بهطور چشمگیری تغییر نخواهد کرد.»
از منظر فنی، این یافته این فرض را که استدلال «پنهان» میتواند یک خندق دفاعی (Moat) برای مدلهای تجاری باشد، تغییر میدهد. اگر فرآیند تفکر قابل استخراج باشد، مزیت اصلی مدلهای بسته از «روش تفکر» به «مقیاس دادهها و توان محاسباتی» زیربنایی منتقل میشود.
در آینده باید منتظر بحثهای رگولاتوری در ایالات متحده در مورد صادرات وزنهای مدل و قانونی بودن آموزشهای مبتنی بر تقطیر باشیم، زیرا این آسیبپذیری ابزار جدیدی برای تحلیلهای جنایی (Forensic) در حوزه هوش مصنوعی فراهم میکند.
گام بعدی شما
- اگر از APIهای مدلهای پیشرو برای پردازش دادههای حساس استفاده میکنید، بررسی کنید که آیا ردپاهای استدلالی در سمت کلاینت ذخیره میشوند یا خیر.
- توسعهدهندگان مدلهای کوچک را دنبال کنید تا ببینید آیا قابلیتهای استدلالی آنها بهطور ناگهانی و بدون آموزش گسترده، مشابه مدلهای بسته میشود یا خیر.
- در مورد قوانین جدید صادرات وزنهای مدل و قانونی بودن آموزش مبتنی بر تقطیر در ایالات متحده هوشیار باشید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو