اگر امروز در حال مدیریت زیرساختهای حساس هستید، باید بدانید که مرز بین «یافتن یک باگ» و «طراحی یک حمله کامل» توسط هوش مصنوعی در حال محو شدن است. مدل جدید GLM-5.3 نشان داد که مقیاسدهی محیطهای آموزشی میتواند قابلیتهایی را فعال کند که حتی برای توسعهدهندگان مدل هم پیشبینی نشده بود.
این مدل که در ۱۴ اوت ۲۰۲۶ منتشر شد، معماری نسل قبلی خود را حفظ کرده اما در یک نقطه عطف قرار گرفته است: توانایی زنجیرهسازی اکسپلویتهای پیچیده سایبری بهعنوان یک محصول جانبی و برنامهریزینشده از مقیاسدهی پسآموزش ظاهر شده است. طبق اعلام Z.ai، این شرکت با بهرهگیری از گسترش گسترده در محیطهای متنوع وظایف، مرزهای کدنویسی عاملمحور (Agentic) و امنیت تهاجمی را جابهجا کرده است.
این عرضه در حالی رخ میدهد که رقابت میان آزمایشگاههای پیشرو به اوج رسیده است. تنها چند روز پیش از این، DeepSeek مدل پرچمدار V4 Pro خود را از حالت پیشنمایش خارج کرد. در جداول مقایسهای Z.ai، مدل GLM-5.3 مستقیماً در برابر DeepSeek-V4 Pro، مدل Kimi K3 از شرکت Moonshot و GPT-5.6 Sol شرکت OpenAI در حوزههای کدنویسی، امنیت سایبری و مجموعههای عاملمحور قرار گرفته است.
همانطور که در تحلیلهای قبلی ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، صنعت در حال گذار از رابطهای سادهی چت به مدلهای عاملمحوری است که میتوانند با زیرساختهای دنیای واقعی تعامل کنند؛ روندی که در تمرینات اخیر تیم قرمز OpenAI برای نفوذ به Hugging Face نیز برجسته شد. این رویکرد با استراتژیهای جدیدی مانند اتوماسیون Red-Teaming برای شناسایی خودکار حفرههای امنیتی همسو است که توسط OpenAI توسعه یافته است. در حال حاضر GLM-5.3 از طریق API و طرح کدنویسی Z.ai در دسترس است و برای تمام مشترکین فعلی طرح کدنویسی فعال شده است.
سازوکار: مقیاسدهی محیطی
به نقل از مستندات Z.ai، پیشرفتهای GLM-5.3 نه از تغییرات معماری، بلکه از «مقیاسدهی محیطی» (Environment Scaling) حاصل شده است. این مدل از یک پشته آموزشی خاص شامل موارد زیر استفاده میکند:
- IndexShare: تکنیکی برای مدیریت زمینههای متنی طولانی (Long-context).
- SAO: روشی برای یادگیری تقویتی (RL) در وظایفی با افق زمانی بلند.
- Slime: چارچوبی متنباز برای یادگیری تقویتی ناهمگام در مقیاس بزرگ.
Z.ai تمرکز آموزش را از تمرینات کدنویسی ایزوله به محیطهای کاری حرفهای تغییر داد. برای مثال، مدل در محیط شبیهسازیشدهی یک مهندس زیرساخت ML قرار گرفت که به خوشههای محاسباتی، مستندات داخلی، پایگاههای کد (Codebases) و نتایج آزمایشها دسترسی داشت. وظیفهی مدل تشخیص گلوگاهها و ارائه افزایش سرعتهای قابل اندازهگیری بود؛ کارهایی که برای یک مهندس انسان معمولاً چندین روز زمان میبرد.
برای مقیاسدهی این محیطها، Z.ai از عاملهای پژوهشی برای تبدیل الگوهای کاری واقعی به وظایف قابل اجرا استفاده کرد، در حالی که عاملهای داور، قابلیت حل این وظایف را تأیید میکردند و بدون دسترسی به راهکارهای مرجع، تأییدکنندهها (Verifiers) را سنتز میکردند. سیگنال پاداش برای زیرمجموعهای از وظایف بهصورت ماشینی تولید میشود و از مسیرهای حل (Solver Trajectories) برای بستن میانبرهای پاداش استفاده میکند. Z.ai تأکید میکند که این خطلولهها همچنان به نظارت انسانی قابلتوجهی در چرخه (Human-in-the-loop) نیاز دارند.
بنچمارکهای کدنویسی و عملکرد
بر اساس گزارشهای منتشر شده، بیشترین رشد در ارزیابیهای بلندمدت رخ داده است. در محک Terminal-Bench 3.0، امتیاز GLM-5.3 از ۴.۶ در نسخه قبلی به ۲۸.۳ جهش کرد. همچنین در DeepSWE v1.1 از ۴۶.۲ به ۶۶.۹ و در نسخه CLI آزمون Agents’ Last Exam از ۲۳.۸ به ۲۸.۵ رسید. تمام این ارقام توسط فروشنده گزارش شده و دارای یادداشتهای متدولوژیک خاصی درباره ابزار ارزیابی، طول زمینه و تنظیمات نمونهبرداری هستند.
در مقایسههای رودررو در Z.ai Code Bench (بنچمارک داخلی)، این شرکت گزارش داده است که مدل ۵۰٪ بهبود نسبت به GLM-5.2 داشته است. گزارشها حاکی از آن است که این مدل از Claude Opus 4.8 پیشی گرفته، در حالی که توکنهای خروجی بهمراتب کمتری مصرف میکند (۳۱.۴٪ با حدود ۵۰,۰۰۰ توکن در هر وظیفه در مقابل ۲۹.۵٪ با ۱۲۰,۰۰۰ توکن). با این حال، هنوز از Claude Fable 5 آنتروپیک که در حداکثر تلاش به ۳۹.۵٪ میرسد و همچنین GPT-5.6 Sol در چندین ارزیابی سختتر کدنویسی عمومی عقبتر است.
Z.ai استدلال میکند که استفاده از Code Bench خصوصی، ریسک آلودگی (Contamination) از مجموعهدادههای تست عمومی را کاهش میدهد؛ موضوعی که میتواند نتایج مدلهای بازمتن را بهطور کاذب تغییر دهد.
قابلیتهای سایبری «برنامهریزینشده»
شگفتانگیزترین یافته، رشد مدل در حوزه امنیت سایبری است. هدف Z.ai بهبود توانایی مدل در یافتن تکباگها و نقصهای مجزا بود، اما این قابلیت بهطور ترکیبی به استدلال برای زنجیرهسازی کامل اکسپلویتها تبدیل شد و مدل توانست برنامههای منسجمی برای زنجیرههای کامل نفوذ طراحی کند. این جهش در توانمندیها تأییدی بر این روند است که مدلهای وزنباز در بازههای زمانی کوتاهی به سطح توانمندیهای سایبری مدلهای پیشرو رسیدهاند.
- CyberGym: امتیاز ۸۴.۵٪ (بالاتر از ۷۷.۲٪ در GLM-5.2) که از تمام مدلهای مورد مقایسه پیشی گرفت.
- ExploitBench: امتیاز مدل بیش از دو برابر نسخه قبلی شد و از ۲۴.۴٪ به ۵۴.۴٪ رسید.
- ExploitGym: مدل GLM-5.3 توانست ۱۰۵ وظیفه را در دو ساعت و ۱۳۰ وظیفه را در شش ساعت تکمیل کند، در حالی که GLM-5.2 تنها ۲۹ و ۳۹ مورد را حل کرده بود.
Z.ai به یک الگوی مستقیم اشاره میکند: هرچه یک بنچمارک در سطح بالاتری از زنجیره اکسپلویت قرار داشته باشد، میزان بهبود GLM-5.3 نسبت به نسخه قبلی بیشتر است. با این حال، همچنان شکافی با مدلهای پیشرو بسته وجود دارد؛ برای مثال، مدل Mythos 5 در همان بازههای زمانی، به ترتیب ۱۸۱ و ۲۴۷ وظیفه ExploitGym را تکمیل کرد.
Z.ai این نتایج را در دنیای واقعی با همکاری تیمهای امنیتی در چین اعتبارسنجی کرد. مدلها ۲۴۳۶ آسیبپذیری را در ۲۶۹ پروژه متنباز شناسایی کردند که ۱۰۹۷ مورد از آنها در سطح «بحرانی» یا «بالا» رتبهبندی شدند. این یافتهها حوزههای گستردهای از جمله هستههای سیستم (Kernels)، سیستمعاملها، موتورهای مرورگر و پروتکلهای شبکه را در بر میگیرد. برخی از این باگها از سال ۱۹۸۱ شناسایی نشده بودند.
این یافتهها در «دفتر ثبت افشای امنیتی Z.ai» منتشر میشود. موارد اخیر شامل یک باگ use-after-free در هسته لینوکس، یک نقص مدیریت حافظه در WebKit که Safari اپل را تحت تأثیر قرار میدهد و یک باگ اعتبارسنجی پارامتر در FreeBSD است. در حال حاضر ۵۳ مورد با کد CVE افشا شده و ۲۳۸۳ مورد دیگر تحت embargo (محرمانه) هستند.
تغییرات API و سختسازی ایمنی
برای توسعهدهندگان، API مدل اکنون سه سطح تلاش برای تفکر (Thinking Effort) شامل low، high و max را پشتیبانی میکند. در یک تغییر ساختاری (Breaking Change)، شرکت دیگر اجازه نمیدهد فرآیند «تفکر» بهطور کامل غیرفعال شود، حتی برای برنامههایی که پیش از این با حالت خاموش اجرا میشدند.
با وجود در دسترس بودن API، وزنهای مدل هنوز عمومی نشدهاند. Z.ai یک تأخیر دو هفتهای برای ارزیابی ایمنی و سختسازی اعمال کرده است. این توقف بهطور صریح به قابلیتهای تهاجمی غیرمنتظره مدل مربوط میشود، زیرا شرکت به دنبال کاهش ریسک انتشار مدلی است که میتواند بهطور خودکار زنجیرههای اکسپلویت را بسازد.
این تحول در قابلیتها، معیار مدلهای بازمتن را تغییر میدهد. این موضوع نشان میدهد که سقف «استدلال» تنها به تعداد پارامترها وابسته نیست، بلکه به تنوع و پیچیدگی محیطهای یادگیری تقویتی (RL) در مرحله پسآموزش بستگی دارد. اگر ارزیابان مستقل بتوانند این امتیازات را بازتولید کنند، ثابت میشود محیطهای سنتتیک تولیدشده توسط عاملها میتوانند جایگزین مجموعهدادههای دستچینشده انسانی در مهارتهای فنی سطح بالا شوند.
تستهای مستقل پس از انتشار وزنها آغاز خواهد شد که انتظار میرود در اواخر اوت ۲۰۲۶ رخ دهد. کاربران باید دفتر ثبت افشای امنیتی Z.ai را دنبال کنند تا ببینند چه تعداد از ۲۳۸۳ آسیبپذیری محرمانه پیش از انتشار عمومی وصله میشوند.
گام بعدی شما
- اگر از APIهای کدنویسی استفاده میکنید، سطوح جدید Thinking Effort را برای وظایف پیچیده تست کنید.
- دفتر ثبت افشای امنیتی Z.ai را دنبال کنید تا ببینید کدامیک از ۲۳۸۳ آسیبپذیری محرمانه پیش از انتشار عمومی وصله میشوند.
- استراتژیهای دفاعی خود را برای مقابله با حملات زنجیرهای (Chained Exploits) بازبینی کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو