پرش به محتوای اصلی
پرش به محتوای مقاله

مقیاس‌پذیری پس‌آموزش در GLM-5.3 توانایی زنجیره‌سازی اکسپلویت‌های سایبری را

·۲۳ مرداد ۱۴۰۵۵ دقیقه مطالعه۲ بازدید
پرچم‌دار جدید Z.ai: GLM-5.3 با کدنویسی پیشرفته و قابلیت سایبری فراتر از آموزش‌ها
پرچم‌دار جدید Z.ai: GLM-5.3 با کدنویسی پیشرفته و قابلیت سایبری فراتر از آموزش‌ها
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ظهور توانایی زنجیره‌سازی اکسپلویت‌های سایبری به‌عنوان یک اثر جانبی غیرمنتظره از مقیاس‌دهی محیط‌های پس‌آموزش، نه تغییر در معماری مدل.

اگر امروز در حال مدیریت زیرساخت‌های حساس هستید، باید بدانید که مرز بین «یافتن یک باگ» و «طراحی یک حمله کامل» توسط هوش مصنوعی در حال محو شدن است. مدل جدید GLM-5.3 نشان داد که مقیاس‌دهی محیط‌های آموزشی می‌تواند قابلیت‌هایی را فعال کند که حتی برای توسعه‌دهندگان مدل هم پیش‌بینی نشده بود.

این مدل که در ۱۴ اوت ۲۰۲۶ منتشر شد، معماری نسل قبلی خود را حفظ کرده اما در یک نقطه عطف قرار گرفته است: توانایی زنجیره‌سازی اکسپلویت‌های پیچیده سایبری به‌عنوان یک محصول جانبی و برنامه‌ریزی‌نشده از مقیاس‌دهی پس‌آموزش ظاهر شده است. طبق اعلام Z.ai، این شرکت با بهره‌گیری از گسترش گسترده در محیط‌های متنوع وظایف، مرزهای کدنویسی عامل‌محور (Agentic) و امنیت تهاجمی را جابه‌جا کرده است.

این عرضه در حالی رخ می‌دهد که رقابت میان آزمایشگاه‌های پیشرو به اوج رسیده است. تنها چند روز پیش از این، DeepSeek مدل پرچم‌دار V4 Pro خود را از حالت پیش‌نمایش خارج کرد. در جداول مقایسه‌ای Z.ai، مدل GLM-5.3 مستقیماً در برابر DeepSeek-V4 Pro، مدل Kimi K3 از شرکت Moonshot و GPT-5.6 Sol شرکت OpenAI در حوزه‌های کدنویسی، امنیت سایبری و مجموعه‌های عامل‌محور قرار گرفته است.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، صنعت در حال گذار از رابط‌های ساده‌ی چت به مدل‌های عامل‌محوری است که می‌توانند با زیرساخت‌های دنیای واقعی تعامل کنند؛ روندی که در تمرینات اخیر تیم قرمز OpenAI برای نفوذ به Hugging Face نیز برجسته شد. این رویکرد با استراتژی‌های جدیدی مانند اتوماسیون Red-Teaming برای شناسایی خودکار حفره‌های امنیتی همسو است که توسط OpenAI توسعه یافته است. در حال حاضر GLM-5.3 از طریق API و طرح کدنویسی Z.ai در دسترس است و برای تمام مشترکین فعلی طرح کدنویسی فعال شده است.

سازوکار: مقیاس‌دهی محیطی

به نقل از مستندات Z.ai، پیشرفت‌های GLM-5.3 نه از تغییرات معماری، بلکه از «مقیاس‌دهی محیطی» (Environment Scaling) حاصل شده است. این مدل از یک پشته آموزشی خاص شامل موارد زیر استفاده می‌کند:

  • IndexShare: تکنیکی برای مدیریت زمینه‌های متنی طولانی (Long-context).
  • SAO: روشی برای یادگیری تقویتی (RL) در وظایفی با افق زمانی بلند.
  • Slime: چارچوبی متن‌باز برای یادگیری تقویتی ناهمگام در مقیاس بزرگ.

Z.ai تمرکز آموزش را از تمرینات کدنویسی ایزوله به محیط‌های کاری حرفه‌ای تغییر داد. برای مثال، مدل در محیط شبیه‌سازی‌شده‌ی یک مهندس زیرساخت ML قرار گرفت که به خوشه‌های محاسباتی، مستندات داخلی، پایگاه‌های کد (Codebases) و نتایج آزمایش‌ها دسترسی داشت. وظیفه‌ی مدل تشخیص گلوگاه‌ها و ارائه افزایش سرعت‌های قابل اندازه‌گیری بود؛ کارهایی که برای یک مهندس انسان معمولاً چندین روز زمان می‌برد.

برای مقیاس‌دهی این محیط‌ها، Z.ai از عامل‌های پژوهشی برای تبدیل الگوهای کاری واقعی به وظایف قابل اجرا استفاده کرد، در حالی که عامل‌های داور، قابلیت حل این وظایف را تأیید می‌کردند و بدون دسترسی به راهکارهای مرجع، تأییدکننده‌ها (Verifiers) را سنتز می‌کردند. سیگنال پاداش برای زیرمجموعه‌ای از وظایف به‌صورت ماشینی تولید می‌شود و از مسیرهای حل (Solver Trajectories) برای بستن میان‌برهای پاداش استفاده می‌کند. Z.ai تأکید می‌کند که این خط‌لوله‌ها همچنان به نظارت انسانی قابل‌توجهی در چرخه (Human-in-the-loop) نیاز دارند.

بنچمارک‌های کدنویسی و عملکرد

بر اساس گزارش‌های منتشر شده، بیشترین رشد در ارزیابی‌های بلندمدت رخ داده است. در محک Terminal-Bench 3.0، امتیاز GLM-5.3 از ۴.۶ در نسخه قبلی به ۲۸.۳ جهش کرد. همچنین در DeepSWE v1.1 از ۴۶.۲ به ۶۶.۹ و در نسخه CLI آزمون Agents’ Last Exam از ۲۳.۸ به ۲۸.۵ رسید. تمام این ارقام توسط فروشنده گزارش شده و دارای یادداشت‌های متدولوژیک خاصی درباره ابزار ارزیابی، طول زمینه و تنظیمات نمونه‌برداری هستند.

در مقایسه‌های رودررو در Z.ai Code Bench (بنچمارک داخلی)، این شرکت گزارش داده است که مدل ۵۰٪ بهبود نسبت به GLM-5.2 داشته است. گزارش‌ها حاکی از آن است که این مدل از Claude Opus 4.8 پیشی گرفته، در حالی که توکن‌های خروجی به‌مراتب کمتری مصرف می‌کند (۳۱.۴٪ با حدود ۵۰,۰۰۰ توکن در هر وظیفه در مقابل ۲۹.۵٪ با ۱۲۰,۰۰۰ توکن). با این حال، هنوز از Claude Fable 5 آنتروپیک که در حداکثر تلاش به ۳۹.۵٪ می‌رسد و همچنین GPT-5.6 Sol در چندین ارزیابی سخت‌تر کدنویسی عمومی عقب‌تر است.

Z.ai استدلال می‌کند که استفاده از Code Bench خصوصی، ریسک آلودگی (Contamination) از مجموعه‌داده‌های تست عمومی را کاهش می‌دهد؛ موضوعی که می‌تواند نتایج مدل‌های بازمتن را به‌طور کاذب تغییر دهد.

قابلیت‌های سایبری «برنامه‌ریزی‌نشده»

شگفت‌انگیزترین یافته، رشد مدل در حوزه امنیت سایبری است. هدف Z.ai بهبود توانایی مدل در یافتن تک‌باگ‌ها و نقص‌های مجزا بود، اما این قابلیت به‌طور ترکیبی به استدلال برای زنجیره‌سازی کامل اکسپلویت‌ها تبدیل شد و مدل توانست برنامه‌های منسجمی برای زنجیره‌های کامل نفوذ طراحی کند. این جهش در توانمندی‌ها تأییدی بر این روند است که مدل‌های وزن‌باز در بازه‌های زمانی کوتاهی به سطح توانمندی‌های سایبری مدل‌های پیشرو رسیده‌اند.

  • CyberGym: امتیاز ۸۴.۵٪ (بالاتر از ۷۷.۲٪ در GLM-5.2) که از تمام مدل‌های مورد مقایسه پیشی گرفت.
  • ExploitBench: امتیاز مدل بیش از دو برابر نسخه قبلی شد و از ۲۴.۴٪ به ۵۴.۴٪ رسید.
  • ExploitGym: مدل GLM-5.3 توانست ۱۰۵ وظیفه را در دو ساعت و ۱۳۰ وظیفه را در شش ساعت تکمیل کند، در حالی که GLM-5.2 تنها ۲۹ و ۳۹ مورد را حل کرده بود.

Z.ai به یک الگوی مستقیم اشاره می‌کند: هرچه یک بنچمارک در سطح بالاتری از زنجیره اکسپلویت قرار داشته باشد، میزان بهبود GLM-5.3 نسبت به نسخه قبلی بیشتر است. با این حال، همچنان شکافی با مدل‌های پیشرو بسته وجود دارد؛ برای مثال، مدل Mythos 5 در همان بازه‌های زمانی، به ترتیب ۱۸۱ و ۲۴۷ وظیفه ExploitGym را تکمیل کرد.

Z.ai این نتایج را در دنیای واقعی با همکاری تیم‌های امنیتی در چین اعتبارسنجی کرد. مدل‌ها ۲۴۳۶ آسیب‌پذیری را در ۲۶۹ پروژه متن‌باز شناسایی کردند که ۱۰۹۷ مورد از آن‌ها در سطح «بحرانی» یا «بالا» رتبه‌بندی شدند. این یافته‌ها حوزه‌های گسترده‌ای از جمله هسته‌های سیستم (Kernels)، سیستم‌عامل‌ها، موتورهای مرورگر و پروتکل‌های شبکه را در بر می‌گیرد. برخی از این باگ‌ها از سال ۱۹۸۱ شناسایی نشده بودند.

این یافته‌ها در «دفتر ثبت افشای امنیتی Z.ai» منتشر می‌شود. موارد اخیر شامل یک باگ use-after-free در هسته لینوکس، یک نقص مدیریت حافظه در WebKit که Safari اپل را تحت تأثیر قرار می‌دهد و یک باگ اعتبارسنجی پارامتر در FreeBSD است. در حال حاضر ۵۳ مورد با کد CVE افشا شده و ۲۳۸۳ مورد دیگر تحت embargo (محرمانه) هستند.

تغییرات API و سخت‌سازی ایمنی

برای توسعه‌دهندگان، API مدل اکنون سه سطح تلاش برای تفکر (Thinking Effort) شامل low، high و max را پشتیبانی می‌کند. در یک تغییر ساختاری (Breaking Change)، شرکت دیگر اجازه نمی‌دهد فرآیند «تفکر» به‌طور کامل غیرفعال شود، حتی برای برنامه‌هایی که پیش از این با حالت خاموش اجرا می‌شدند.

با وجود در دسترس بودن API، وزن‌های مدل هنوز عمومی نشده‌اند. Z.ai یک تأخیر دو هفته‌ای برای ارزیابی ایمنی و سخت‌سازی اعمال کرده است. این توقف به‌طور صریح به قابلیت‌های تهاجمی غیرمنتظره مدل مربوط می‌شود، زیرا شرکت به دنبال کاهش ریسک انتشار مدلی است که می‌تواند به‌طور خودکار زنجیره‌های اکسپلویت را بسازد.

این تحول در قابلیت‌ها، معیار مدل‌های بازمتن را تغییر می‌دهد. این موضوع نشان می‌دهد که سقف «استدلال» تنها به تعداد پارامترها وابسته نیست، بلکه به تنوع و پیچیدگی محیط‌های یادگیری تقویتی (RL) در مرحله پس‌آموزش بستگی دارد. اگر ارزیابان مستقل بتوانند این امتیازات را بازتولید کنند، ثابت می‌شود محیط‌های سنتتیک تولیدشده توسط عامل‌ها می‌توانند جایگزین مجموعه‌داده‌های دست‌چین‌شده انسانی در مهارت‌های فنی سطح بالا شوند.

تست‌های مستقل پس از انتشار وزن‌ها آغاز خواهد شد که انتظار می‌رود در اواخر اوت ۲۰۲۶ رخ دهد. کاربران باید دفتر ثبت افشای امنیتی Z.ai را دنبال کنند تا ببینند چه تعداد از ۲۳۸۳ آسیب‌پذیری محرمانه پیش از انتشار عمومی وصله می‌شوند.

گام بعدی شما

  • اگر از APIهای کدنویسی استفاده می‌کنید، سطوح جدید Thinking Effort را برای وظایف پیچیده تست کنید.
  • دفتر ثبت افشای امنیتی Z.ai را دنبال کنید تا ببینید کدام‌یک از ۲۳۸۳ آسیب‌پذیری محرمانه پیش از انتشار عمومی وصله می‌شوند.
  • استراتژی‌های دفاعی خود را برای مقابله با حملات زنجیره‌ای (Chained Exploits) بازبینی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پیشرفت بر اساس تجربه عملی در شناسایی هزاران باگ قدیمی، نشان می‌دهد که مدل‌های استدلالی اکنون قادر به اجرای حملات سایبری چندمرحله‌ای هستند. این موضوع اعتبار ارزیابی‌های امنیتی سنتی را زیر سؤال برده و نیاز به ابزارهای دفاعی خودکار را فوری می‌کند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم توسعه‌دهندگان ایرانی به GLM-5.3 دشوار است؛ اما انتشار احتمالی وزن‌های باز مدل در اواخر اوت، فرصتی برای پژوهشگران امنیت سایبری ایران فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

این مدل ثابت می‌کند که «هوش» در مدل‌های زبانی لزوماً با افزایش اندازه مدل (Scaling Laws کلاسیک) رشد نمی‌کند، بلکه کیفیت و پیچیدگی محیط‌های تعاملی در مرحله پس‌آموزش است که قابلیت‌های استدلالی نوظهور را فعال می‌کند. جابه‌جایی از داده‌های استاتیک به محیط‌های شبیه‌سازی‌شده‌ی مهندسی، مدل را از یک «تولیدکننده متن» به یک «حل‌کننده مسئله» تبدیل کرده است. این موضوع فرضیه برتری مطلق مدل‌های بسته را به چالش می‌کشد، زیرا نشان می‌دهد با دسترسی به محیط‌های آموزشی درست، مدل‌های با وزن‌های باز نیز می‌توانند در مهارت‌های تخصصی به سطح پیشرو برسند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.