پرش به محتوای اصلی
پرش به محتوای مقاله

Kimi K3 در برابر مدل‌های پیشرو آمریکا؛ شکاف عمیق در قابلیت‌های تهاجمی

·۲ مرداد ۱۴۰۵۴ دقیقه مطالعه
مدل‌های متن‌باز اکنون با عملکرد مدل‌های پیشروی چهار ماه پیش برابری می‌کنند، با هزینه‌ای بسیار کمتر
مدل‌های متن‌باز اکنون با عملکرد مدل‌های پیشروی چهار ماه پیش برابری می‌کنند، با هزینه‌ای بسیار کمتر
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اثبات عملی این نکته که مدل‌های چینی با استفاده از تقطیر (Distillation) از مدل‌های آمریکایی، فقط در سطح عمومی پیشرفت کرده‌اند و در وظایف پیچیده سایبری به‌طور سیستماتیک شکست می‌خورند.

اگر امروز مدیر امنیت شبکه هستید، باید بدانید که مدل‌های چینی هنوز نمی‌توانند در سطح مدل‌های آمریکایی سیستم‌های پیچیده را به زانو درآورند. طبق اعلام مؤسسه امنیت هوش مصنوعی بریتانیا (UK AISI) و مرکز استانداردها و نوآوری هوش مصنوعی آمریکا (CAISI)، مدل Kimi K3 در تست‌های تهاجمی سایبری شکست خورد و نتوانست به سطوح پیشرفته‌ی کنترل سیستم دست یابد.

این نتایج در ۲۴ جولای ۲۰۲۶ منتشر شد و نشان داد که Kimi K3 هرچند در مقایسه با مدل‌های داخلی چین مانند GLM-5.2 عملکرد بهتری دارد، اما همچنان در برابر غول‌های پیشرو آمریکایی رنگ می‌بازد. این وضعیت برای بسیاری از فعالان دنیای کسب‌وکار، درست مثل دانش‌آموزی است که تمام کتاب درسی را حفظ کرده اما وقتی پای یک مسئله‌ی مهندسی واقعی و کاربردی می‌رسد، نمی‌داند چه کند و نمی‌تواند آن را حل نماید.

زمینه و روندهای جاری

این شکاف در حالی رخ می‌دهد که تنش‌های جهانی بر سر ایمنی هوش مصنوعی و کنترل‌های صادراتی در حال شدیدتر شدن است. در حالی که مدل‌های وزن‌باز (Open-weight) چینی در حال تکامل هستند، آن‌ها به‌طور مستمر در مواجهه با نیازمندی‌های استدلالی بالا برای بهره‌برداری از نرم‌افزارها (Software Exploitation) دچار مشکل می‌شوند.

مرکز CAISI از اوایل سال ۲۰۲۵ قابلیت‌های سایبری مدل‌ها را با استفاده از یک مقیاس مبتنی بر Elo ردیابی کرده است. در حالی که خطوط روند هر دو طیف ایالات متحده و چین در حال صعود است، مدل‌های چینی به‌طور مداوم عقب‌تر باقی مانده‌اند. در این مقیاس، هر ۴۰۰ امتیاز افزایش در رتبه Elo، نشان‌دهنده یک جهش ده برابری در احتمال حل موفقیت‌آمیز یک تکلیف یا مسئله است.

مؤسسه بریتانیا پیش‌تر تخمین زده بود که شکاف عملکرد برای مدل‌های بازمتن، در مقایسه با بازه‌ی ۶ تا ۱۰ ماهه در ابتدای سال ۲۰۲۵، اکنون به ۴ تا ۷ ماه کاهش یافته است. این روند سریع تکامل، با گزارش‌های اخیر مبنی بر رسیدن مدل‌های وزن‌باز به سطح توانمندی‌های سایبری مدل‌های پیشرو در بازه زمانی کوتاهی همسو است. نتایج جدید با این الگوی کاهش فاصله همسو است. با این حال، UK AISI هشدار می‌دهد که این صعود مستمر، «یک ریسک دائمی و بازگشت‌ناپذیر از سوءاستفاده» را ایجاد می‌کند، چرا که دسترسی به ابزارهای خطرناک ساده‌تر می‌شود.

جزئیات تست‌های بنچمارک

برای سنجش دقیق، محققان از ExploitBench استفاده کردند؛ بنچمارکی از دانشگاه کارنگی ملون که بر روی ۴۱ آسیب‌پذیری موتور V8 کروم که بعد از سال ۲۰۲۳ کشف شده‌اند، تمرکز دارد. این ابزار به‌طور دقیق ردیابی می‌کند که یک مدل تا کجای مسیر واقعی نفوذ به نرم‌افزار پیش می‌رود. نتایج یک شکاف عمیق را نشان داد:

  • مدل‌های پیشرو آمریکایی: میانگین امتیاز ۷۶.۲٪
  • Kimi K3: میانگین امتیاز ۳۲.۲٪
  • GLM-5.2: میانگین امتیاز ۲۴.۴٪

کیمی K3 در بهره‌برداری سایبری فاصله زیادی با مدل‌های آمریکایی دارد؛ تقطیر احتمالاً دلیل آن است.

نکته کلیدی و حیاتی این است که Kimi K3 در هیچ‌یک از ۴۱ تکلیف مورد بررسی، نتوانست به اجرای کد دلخواه (Arbitrary Code Execution) یا ACE برسد. ACE بالاترین و خطرناک‌ترین سطح بهره‌برداری است، زیرا به مهاجم اجازه می‌دهد کنترل کامل و مطلق بر سیستم هدف به دست آورد. در مقابل، مدل‌های آمریکایی در ۲۰ مورد از این ۴۱ تکلیف توانستند به سطح ACE دست یابند. لازم به ذکر است که محققان برای سنجش حداکثر پتانسیل مطلق، حفاظ‌ها (Guardrails) یا همان نرده‌های ایمنی سیستم را در مدل‌های آمریکایی غیرفعال کردند، زیرا این حفاظ‌ها در نسخه‌های عمومی فعال هستند و مانع از نمایش توان واقعی مدل در حملات می‌شوند.

«کیمی K3» در بهره‌برداری سایبری فاصله زیادی با مدل‌های آمریکایی دارد؛ تقطیر احتمالاً دلیل آن است.

در شبیه‌سازی دوم به نام «The Last Ones» (TLO)، یک مسیر حمله ۳۲ مرحله‌ای به شبکه یک شرکت (Corporate Network Attack Path) مورد آزمایش قرار گرفت که شامل چهار زیرشبکه (Subnet) و تقریباً ۲۰ میزبان (Host) بود. انجام این عملیات توسط یک متخصص انسانی به‌طور معمول ۲۰ ساعت زمان می‌برد. تنها گروه کوچکی از مدل‌ها اصلاً قادر به حل TLO هستند؛ در واقع تنها چهار مدل Closed-weight موجود در بازار توانسته‌اند از این تست عبور کنند و قوی‌ترین آن‌ها نیز تنها ۶ یا ۷ بار از ۱۰ بار تلاش، موفق به تکمیل مسیر شده‌اند.

نتایج برای مدل‌های مورد بررسی به شرح زیر بود:

  • مدل‌های آمریکایی: به‌طور میانگین تا مرحله ۲۸.۵ پیش رفتند
  • Kimi K3: به‌طور میانگین تا مرحله ۱۷ پیش رفت
  • GLM-5.2: به‌طور میانگین تا مرحله ۱۱ پیش رفت

اگرچه Kimi K3 در یک مورد از ۱۰ تلاش توانست کل مسیر را طی کند- در حالی که در محدوده ۱۰۰ میلیون توکن (تکه‌های کوچک متن که مدل پردازش می‌کند) باقی بماند- اما فاقد قابلیت «قابلیت اطمینان» (Reliability) لازم برای عملیات‌های پیشرفته و پیچیده بود. مؤسسه اشاره کرد که Kimi K3 در صورتی که دسترسی اولیه به شبکه داشته باشد، قادر است به‌طور خودکار به «سیستم‌های سازمانی کوچک، ضعیف و آسیب‌پذیر» حمله کند. اگرچه TLO دفاع فعال (Active Defense) را در نظر نمی‌گیرد، اما این نتایج در دنیای واقعی زنگ خطر را به صدا در می‌آورد؛ مشابه حادثه‌ای که اخیراً مدل‌های OpenAI سعی کردند به‌طور خودکار به Hugging Face نفوذ کنند.

کیمی K3 در بهره‌برداری سایبری فاصله زیادی با مدل‌های آمریکایی دارد؛ تقطیر احتمالاً دلیل آن است.

تقطیر و ادعاهای سخت‌افزاری

این یافته‌ها به ادعاهای مایکل کراتسیوس، مشاور علمی ایالات متحده، وزن بیشتری می‌دهد. او اخیراً شرکت Moonshot AI را متهم کرده است که مدل Fable متعلق به شرکت Anthropic را «تقطیر» (Distillation) کرده است. تقطیر به این معناست که Moonshot AI از بهترین خروجی‌های مدل Fable به عنوان داده‌های آموزشی استفاده کرده تا عملکرد Kimi K3 را ارتقا دهد. همچنین کراتسیوس ادعا کرد که Moonshot AI به تراشه‌های GB300 انویدیا دسترسی داشته است، در حالی که این سخت‌افزارها مشمول کنترل‌های صادراتی سخت‌گیرانه ایالات متحده هستند.

فرآیند تقطیر به یک مدل کوچک‌تر اجازه می‌دهد تا دانش عمومی یک مدل بزرگ‌تر را تقلید کند، بدون اینکه قابلیت‌های تخصصی و عمیق‌تر آن مدل بزرگ را به ارث ببرد. از آنجا که طبقه‌بندی‌های ایمنی Anthropic به‌طور خاص پرس‌وجوهای تهاجمی سایبری پیشرفته را مسدود می‌کنند، این قابلیت‌های خطرناک احتمالاً در هیچ‌یک از مجموعه‌داده‌های تقطیر شده وجود نداشتند.

این موضوع توضیح می‌دهد چرا Kimi K3 در بنچمارک‌های عمومی نمرات بالایی می‌گیرد (چون احتمالاً بر اساس خروجی‌های Claude برای برنامه‌نویسی و وظایف Agentic آموزش دیده است)، اما در بهره‌برداری‌های سایبری با ریسک بالا شکست می‌خورد. با این حال، برخی تحلیلگران معتقدند بازه زمانی انتشار مدل‌ها احتمال تقطیر داده‌ها را رد می‌کند و دلایلی متفاوت برای پیشرفت سریع این مدل‌ها می‌بینند. در واقع، این مدل نسخه «مؤدبانه» هوش مصنوعی را آموخته است، بدون اینکه مهارت‌های «منطقه خطر» را کسب کند. نتایج AISI این نظریه را تأیید می‌کند، زیرا غیرفعال کردن حفاظ‌ها در مدل‌های آمریکایی، قابلیت‌هایی را آشکار کرد که دسترسی به آن‌ها از طریق رابط‌های عمومی تقریباً غیرممکن است و بنابراین برای تقطیر در دسترس نبوده‌اند.

برای مدیران ارشد سازمان‌ها، نتیجه این است که اگرچه مدل‌های وزن‌باز چینی در حال کاهش فاصله هستند، اما «سقف هوش» (Intelligence Ceiling) برای وظایف حیاتی امنیتی همچنان به‌طور قطعی در دست سیستم‌های بسته‌سورس آمریکایی است. با این حال، UK AISI هشدار می‌دهد که صعود مستمر در قابلیت‌های مدل‌های باز، با کاهش موانع ورود، ریسک دائمی سوءاستفاده را ایجاد می‌کند.

در آینده باید منتظر گزارش‌های مربوط به تخلفات صادراتی GPUهای GB300 باشید، زیرا دسترسی به سخت‌افزار تعیین خواهد کرد که آیا این شکاف عملکردی در سال ۲۰۲۷ بسته می‌شود یا بیشتر باز خواهد شد.

گام بعدی شما

  • اگر از مدل‌های بازمتن برای تحلیل کد استفاده می‌کنید، خروجی‌های مربوط به امنیت را با یک مدل بسته مثل GPT-4o یا Claude 3.5 Sonnet تطبیق دهید.
  • روی ابزارهایی نظارت کنید که از عامل‌های هوش مصنوعی (AI Agents) — سیستم‌هایی که می‌توانند به‌طور مستقل ابزارها را اجرا کنند — برای اتوماسیون شبکه استفاده می‌کنند.
  • گزارش‌های آتی درباره تخلفات صادراتی GPUهای GB300 را دنبال کنید، زیرا دسترسی به سخت‌افزار تعیین می‌کند که این شکاف در سال ۲۰۲۷ بسته شود یا بازتر شود.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این گزارش با تکیه بر اعتبار مؤسسات AISI و CAISI ثابت می‌کند که برتری استراتژیک آمریکا در AI همچنان در لایه‌ی استدلالی عمیق حفظ شده است. این موضوع باعث می‌شود شرکت‌های امنیتی همچنان بر مدل‌های بسته متکی بمانند و اعتماد به مدل‌های متن‌باز برای کارهای حساس کاهش یابد.

تأثیر برای ایران

این گزارش برای پژوهشگران مدل‌های بنیادی در ایران اهمیت دارد تا بدانند تکیه بر داده‌های تقطیری برای بهبود مدل‌های بومی، منجر به ایجاد «توهمِ توانمندی» می‌شود و سقف استدلالی مدل را بالا نمی‌برد.

·نگاه ما
تحریریه دات‌هوش

شکاف عملکردی Kimi K3 نشان می‌دهد که تکیه بر داده‌های سنتتیک یا تقطیر شده، سقف یادگیری مدل را محدود می‌کند. این مدل در واقع «ظاهرِ هوش» را از مدل‌های غربی قرض گرفته اما «منطقِ عملیاتی» را تولید نکرده است. این موضوع ثابت می‌کند که برای رسیدن به سطح استدلالی پیشرفته در حوزه‌های حساس، دسترسی به سخت‌افزار و داده‌های خام، بسیار حیاتی‌تر از کپی‌برداری از خروجی‌های مدل‌های دیگر است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.