پرش به محتوای اصلی
پرش به محتوای مقاله

مدل‌های کوچک راه نفوذ به زنجیره تفکر مدل‌های پیشرو را باز کردند

·۲۰ مرداد ۱۴۰۵۵ دقیقه مطالعه
تصویری از یک مغز دیجیتالی که لایه‌های درونی شبکه عصبی را نشان می‌دهد.
تصویری از یک مغز دیجیتالی که لایه‌های درونی شبکه عصبی را نشان می‌دهد.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کشف مکانیزمی که از طریق مدل‌های کوچک‌تر (SLM) برای رمزگشایی زنجیره تفکر مدل‌های بزرگ استفاده می‌کند؛ این اولین بار است که ثابت می‌شود نسخه‌های ضعیف‌تر یک خانواده مدل می‌توانند به‌عنوان کلید باز کردن افکار مدل‌های پیشرو عمل کنند.

تصور کنید مهاجمی بتواند «افکار پنهان» قدرتمندترین مدل‌های هوش مصنوعی جهان را استخراج کند، آن هم تنها با هدایت ردپاهای رمزگذاری‌شده به سمت نسخه‌های کوچک‌تر و ضعیف‌تر از همان مدل. این کشف که توسط الکساندر پانفیلوف (Alexander Panfilov) از دانشگاه توبینگن (University of Tübingen) رهبری شده، نشان می‌دهد گام‌های استدلالی محرمانه‌ای که شرکت‌ها برای محافظت از مالکیت معنوی خود پنهان می‌کنند، آن‌قدرها که تصور می‌شد امن نیستند.

این یافته در حالی منتشر می‌شود که رقابت ژئوپلیتیکی بر سر تقطیر (Distillation) شدت یافته است؛ فرآیندی که در آن از خروجی‌های یک مدل قدرتمند برای آموزش مدلی کوچک‌تر و ارزان‌تر استفاده می‌شود. در حالی که تقطیر یک رویه استاندارد در صنعت است، سیاست‌گذاران آمریکایی نگران‌اند که آزمایشگاه‌های چینی از این روش برای کپی‌برداری سیستماتیک از فناوری‌های ایالات متحده استفاده کنند. توانایی افشای ردپاهای واقعی استدلال، به‌جای دریافت صرفاً پاسخ نهایی، سد ورود برای این نوع سرقت‌های صنعتی و مالکیت معنوی را به‌شدت پایین می‌آورد.

بحث بر سر تقطیر مدل‌ها

تقطیر یک تکنیک شناخته‌شده و تثبیت‌شده برای انتقال کارآمد قابلیت‌ها از مدل‌های موجود به مدل‌های جدید است. این روش به‌ویژه زمانی که توسعه‌دهندگان قصد ساخت مدل‌های وزن‌های باز (Open Weights) یا مدل‌هایی که به‌طور کامل قابل دانلود باشند را دارند، بسیار رایج است. با این حال، این موضوع اکنون به یک نقطه تنش و جرقه‌ای برای اختلافات بین‌المللی تبدیل شده است.

به نقل از گزارش‌های رسمی، OpenAI در ماه فوریه به قانون‌گذاران آمریکایی اطلاع داد که به نظر می‌رسد مدل R1 شرکت DeepSeek از یکی از مدل‌های این شرکت برای کپی‌برداری جهت ساخت یک مدل استدلالی استفاده کرده است. در ماه ژوئن نیز Anthropic به قانون‌گذاران گفت که شرکت Alibaba به‌طور سیستماتیک از مدل‌های آنتروپیک تقطیر کرده است تا مدل‌های خود را که با نام Qwen شناخته می‌شوند، بسازد.

در مقابل، برخی معتقدند تقطیر برای پیشرفت ضروری است. مارک زاکربرگ (Mark Zuckerberg)، مدیرعامل Meta، در یادداشتی تأکید کرد که تقطیر «یکی از اصول مهم در نحوه عملکرد اکوسیستم متن‌باز است» و هشدار داد که اعمال محدودیت‌ها بر این روند می‌تواند ایالات متحده را در موضع ضعف قرار دهد. یارین گال (Yarin Gal) از دانشگاه آکسفورد نیز می‌افزاید که اگر همه شرکت‌ها دسترسی به تقطیر را مسدود کنند، نرخ کلی پیشرفت در حوزه هوش مصنوعی آسیب خواهد دید.

همان‌طور که در بحث‌های گذشته ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، تعادل بین دسترسی آزاد و محافظت از IP همواره یک چالش است.

سازوکار حمله

این حمله از یک ویژگی معماری خاص در نحوه مدیریت محاسبات توسط شرکت‌هایی مثل OpenAI، Anthropic و Google بهره می‌برد. مدل‌های پیشرفته برای حل مسائل دشوار از زنجیره تفکر (Chain-of-Thought) استفاده می‌کنند و وظایف را به بخش‌های کوچک‌تر و سازنده تقسیم می‌کنند. برای محافظت از این فرآیند اختصاصی، شرکت‌ها استدلال را مخفی نگه می‌دارند اما نسخه‌ای رمزگذاری‌شده از آن استدلال را به کامپیوتر کاربر می‌فرستند تا بخشی از محاسبات را برون‌سپاری کرده و بار پردازشی را کاهش دهند.

پانفیلوف و تیمش — که شامل پژوهشگران مؤسسه مکس پلانک، مؤسسه ایمنی AI (MATS Research) و شرکت امنیتی Snyk بود — دریافتند که می‌توان این ردپاهای رمزگذاری‌شده را رهگیری کرد و آن‌ها را به نسخه‌ای کوچک‌تر از همان خانواده مدل ارسال کرد.

از آنجا که مدل‌های کوچک‌تر از نظر محاسباتی بهینه‌تر و ارزان‌تر هستند، اغلب برای کارهای ساده‌تر به کار می‌روند. نکته کلیدی این است که این مدل‌ها همراستاسازی (Alignment) کمتری دریافت کرده‌اند. برخلاف برادران بزرگ‌ترشان، مدل‌های کوچک احتمال کمتری دارد که درخواست‌های رمزگشایی محتوای ردپا را رد کنند. فلوریان ترامر (Florian Tramer) از ETH زوریخ، ایده جایگزینی پیام‌ها با یک مدل ضعیف‌تر که کلید رمزگشایی یکسانی دارد را «بسیار هوشمندانه» خواند و تأکید کرد که این موضوع «قطعاً در حال تبدیل شدن به یک مسئله جدی است».

یافته‌های کلیدی و نقاط ضعف

  • پراکندگی آسیب‌پذیری: پانفیلوف اعلام کرد: «تمام ارائه‌دهندگان مدل‌های پیشرو که آزمایش کردیم، دارای این آسیب‌پذیری هستند.» این مورد شامل تمام مدل‌هایی است که از طریق API در گوگل، آنتروپیک و OpenAI در دسترس هستند.
  • نشت داده‌ها: این روش موفق شد اطلاعات حساس شخصی، از جمله رمزهای عبور و کلیدهای API را که در ردپاهای استدلالی ضبط‌شده از دستگاه کاربر بودند، بازیابی کند.
  • شواهد تقطیر: پژوهشگران برای آزمایش تقطیر، ۹۰ پرسش را به مدل‌های مختلف دادند. وقتی چند کلمه اول از ردپاهای استدلالی مدل‌های تجاری به مدل چینی Kimi K3 (محصول Moonshot AI) داده شد، خروجی‌های آن به‌طور عجیبی شبیه به استدلال‌های پنهان Claude Opus 4.8 و GPT 5.6 Sol بود.
  • تفاوت مدل‌ها: پژوهشگران اشاره کردند که مدل‌های وزن‌باز دیگر، به‌ویژه DeepSeek چین و Inkling (محصول شرکت آمریکایی Thinking Machines)، این شباهت استدلالی با کلود اپوس را نشان ندادند.
  • رابطه علی و معلولی: پژوهشگران تصریح کردند که با وجود این شباهت‌ها، کار آن‌ها «نمی‌تواند به‌طور علی و معلولی تقطیر را ثابت کند»، بلکه تنها نشان‌دهنده شباهت‌های ساختاری است.

واکنش صنعت

به دنبال اطلاعیه‌ای که ماه گذشته ارسال شد، OpenAI، Anthropic و Google اقدامات کوتاه‌مدتی را برای مسدود کردن رفتارهای تکرار (replay) مورد استفاده در این حمله اجرا کردند. مایکل آکیمان (Michael Aciman)، سخنگوی آنتروپیک، اظهار داشت که این پژوهش شامل دسترسی به زیرساخت‌های داخلی آنتروپیک، بازیابی کلیدهای رمزنگاری یا بازیابی داده‌های شخصی از سیستم‌های این شرکت نبوده است.

با این حال، پانفیلوف هشدار می‌دهد که اگرچه نشت داده‌های خصوصی تا حد زیادی مهار شده، اما برخی ردپاهای استدلالی همچنان قابل کشف هستند. او استدلال می‌کند که یک راهکار کامل و قطعی نیازمند بازنگری بنیادین در نحوه عملکرد APIهای این شرکت‌ها است.

مخاطرات ژئوپلیتیک

این نقص فنی به بحث‌های گسترده‌تر درباره برتری در هوش مصنوعی دامن می‌زند. تندروهای آمریکایی معتقدند تقطیر به چین مزیت استراتژیک می‌دهد تا مدل‌های وزن‌باز با عملکرد بالا را با کسری از هزینه‌های معمول بسازد.

اما کایل میلر (Kyle Miller) از مرکز امنیت و فناوری‌های نوظهور (CSET) می‌گوید مشخص نیست تقطیر واقعاً چقدر به چین کمک می‌کند. او اشاره می‌کند که تقطیر تنها مدل‌های موجود را تا حد محدودی بهبود می‌بخشد و شرکت‌های چینی احتمالاً تخصص لازم برای ساخت مدل‌های پیشرو از صفر را دارند. میلر می‌گوید: «به باور من، اگر توانایی تقطیر برای آزمایشگاه‌های چینی حذف شود، چشم‌انداز رقابتی به‌طور چشم‌گیری تغییر نخواهد کرد.»

از منظر فنی، این یافته این فرض را که استدلال «پنهان» می‌تواند یک خندق دفاعی (Moat) برای مدل‌های تجاری باشد، تغییر می‌دهد. اگر فرآیند تفکر قابل استخراج باشد، مزیت اصلی مدل‌های بسته از «روش تفکر» به «مقیاس داده‌ها و توان محاسباتی» زیربنایی منتقل می‌شود.

در آینده باید منتظر بحث‌های رگولاتوری در ایالات متحده در مورد صادرات وزن‌های مدل و قانونی بودن آموزش‌های مبتنی بر تقطیر باشیم، زیرا این آسیب‌پذیری ابزار جدیدی برای تحلیل‌های جنایی (Forensic) در حوزه هوش مصنوعی فراهم می‌کند.

گام بعدی شما

  • اگر از APIهای مدل‌های پیشرو برای پردازش داده‌های حساس استفاده می‌کنید، بررسی کنید که آیا ردپاهای استدلالی در سمت کلاینت ذخیره می‌شوند یا خیر.
  • توسعه‌دهندگان مدل‌های کوچک را دنبال کنید تا ببینید آیا قابلیت‌های استدلالی آن‌ها به‌طور ناگهانی و بدون آموزش گسترده، مشابه مدل‌های بسته می‌شود یا خیر.
  • در مورد قوانین جدید صادرات وزن‌های مدل و قانونی بودن آموزش مبتنی بر تقطیر در ایالات متحده هوشیار باشید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این موضوع اعتبار ادعاهای شرکت‌های بزرگ درباره امنیت مالکیت معنوی مدل‌هایشان را زیر سؤال می‌برد. بر اساس تخصص پژوهشگران امنیت AI، این نقص مسیر استخراج دانش از مدل‌های بسته را برای رقبای بین‌المللی هموارتر می‌کند.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران مدل‌های بنیادی اهمیت دارد تا بازار مصرف ایران. با این حال، توسعه‌دهندگان ایرانی که روی مدل‌های کوچک و بهینه کار می‌کنند، می‌توانند از این متد برای تحلیل رفتار مدل‌های بسته استفاده کنند.

·نگاه ما
تحریریه دات‌هوش

این کشف نشان می‌دهد که «پنهان‌سازی» استدلال در مدل‌های بسته، یک لایه امنیتی واقعی نیست بلکه تنها یک مانع عملی است. با این آسیب‌پذیری، مزیت رقابتی شرکت‌های بزرگ از «الگوریتم تفکر» به «حجم داده و سخت‌افزار» تغییر می‌کند؛ یعنی هر کسی که بتواند استدلال را استخراج کند، تنها با داشتن سخت‌افزار کافی می‌تواند مدل‌های پیشرو را شبیه‌سازی کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.