پرش به محتوای اصلی
پرش به محتوای مقاله

«بدون تغییر در مدل بنیادی»؛ راز پیشرفت GLM-5.3 در امنیت سایبری

·۶ شهریور ۱۴۰۵۸ دقیقه مطالعه۱ بازدید
لوگوی Hugging Face برای مدل GLM-5.3 سازمان zai-org
لوگوی Hugging Face برای مدل GLM-5.3 سازمان zai-org
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

دستیابی به عملکرد SOTA در کدنویسی و امنیت سایبری صرفاً از طریق مقیاس‌بندی پس‌آموزش، بدون تغییر در مدل بنیادی. این اولین بار است که چنین جهشی در قابلیت‌های استدلالی بدون آموزش مجدد (Pre-training) مشاهده می‌شود.

۵۰ درصد؛ این رقم، جهش خیره‌کننده در قابلیت‌های کدنویسی مدل GLM-5.3 است که سقف توانمندی‌های مهندسی عامل‌محور در مدل‌های وزن‌باز را جابه‌جا کرد. طبق اعلام تیم توسعه در ۲۸ اوت ۲۰۲۶، این به‌روزرسانی ثابت می‌کند که پس‌آموزش (Post-training) تهاجمی می‌تواند دستاوردهای عظیمی در استدلال‌های پیچیده از دل یک مدل بنیادی استخراج کند.

این تحول در حالی رخ می‌دهد که صنعت از رابط‌های ساده‌ی چت به سمت عامل‌های (Agents) خودمختار حرکت می‌کند. همان‌طور که در تحلیل قبلی ما درباره‌ی خطرات گذار به سیستم‌های عامل‌محور اشاره کردیم — مانند حادثه‌ی نفوذ ۱۲۰۰ عامل سرکش به Hugging Face — اکنون تمرکز بر این است که این عامل‌ها برای مهندسی نرم‌افزار در مقیاس تولید، قابل‌اعتماد شوند.

برای اکثر توسعه‌دهندگان، این تغییر شبیه به ارتقای یک برنامه‌نویس تازه‌کار به یک معمار ارشد است، بدون آنکه تحصیلات پایه او تغییر کرده باشد. مدل لزوماً در دانش خام «باهوش‌تر» نشده است، بلکه در نحوه به‌کارگیری این دانش برای وظایفی با افق زمانی بلند، بسیار منضبط‌تر شده است.

پیشرفت در پس‌آموزش

بر اساس مستندات zai-org در Hugging Face، مدل GLM-5.3 از همان مدل بنیادی نسل قبلی خود یعنی GLM-5.2 استفاده می‌کند. تمام بهبودهای قابل‌اندازه‌گیری در عملکرد، نتیجه‌ی تکنیک‌های مقیاس‌بندی در مرحله‌ی پس‌آموزش است.

این رویکرد به‌طور خاص وظایف پیچیده کدنویسی و برنامه‌ریزی‌های طولانی‌مدت را هدف قرار داده است. نتایج در محک داخلی Z.ai Code Bench بیشترین وضوح را دارد، جایی که مدل جهشی ۵۰ درصدی نسبت به نسخه ۵.۲ ثبت کرده است.

بنچمارک‌های کدنویسی و عامل‌محور

مدل GLM-5.3 اکنون در چندین محک عمومی، جایگاه برترین مدل وزن‌باز (SOTA) را در اختیار دارد. عملکرد این مدل در وظایف متنوع مهندسی نرم‌افزار، جهشی معنادار در قابلیت اطمینان را نشان می‌دهد:

  • Terminal Bench 3.0: امتیاز ۲۸.۳ را کسب کرد که در مقایسه با ۴.۶ در GLM-5.2 یک جهش عظیم است. برای مقایسه، این مدل از Kimi K3 (۱۷.۴) و Qwen3.8-Max (۲۱.۱) پیشی گرفته، هرچند کمی عقب‌تر از GPT-5.6 (۳۴.۶) و Fable 5 (۳۳.۷) است.
  • Agents' Last Exam (ALE-CLI): با امتیاز ۲۸.۵، مدل‌هایی مثل Kimi K3 (۲۷.۶)، Qwen3.8-Max (۲۵.۷) و Fable 5 (۲۳.۸) را پشت سر گذاشت و تنها با فاصله اندکی از GPT-5.6 (۲۸.۶) قرار گرفت.
  • FrontierSWE: به امتیاز ۷۸.۱ رسید که به‌طور قابل‌توجهی بالاتر از ۶۷.۵ در GLM-5.2 و ۶۶.۵ در Qwen3.8-Max است، هرچند Fable 5 با ۸۸.۲ پیشتاز است.
  • DeepSWE (v1.1): امتیاز ۶۶.۹ را به دست آورد و در رقابتی تنگاتنگ با Kimi K3 (۶۷.۵) قرار گرفت و بسیار بالاتر از GLM-5.2 (۴۶.۲) بود. در اینجا GPT-5.6 با ۷۲.۷ پیشتاز است.
  • SWE-Marathon (v1.1): از ۱۹.۴ در نسخه قبلی به ۴۲.۵ رسید. این رقم با GPT-5.6 (۴۲.۵) برابری می‌کند اما از Kimi K3 (۴۸.۱) و Qwen3.8-Max (۴۸.۸) عقب‌تر است.
  • ProgramBench: امتیاز ۱۹.۰ را ثبت کرد که تقریباً دو برابر نسخه ۵.۲ (۹.۵) است. این بنچمارک اکنون «تقریباً حل شده» تلقی می‌شود و Fable 5 با ۳۳.۰ در صدر است.
  • NL2Repo: امتیاز ۵۸.۰ را کسب کرد که بهبود نسبت به ۴۸.۹ در نسخه قبلی است، هرچند همچنان پشت سر Qwen3.8-Max (۶۹.۷) قرار دارد.
  • Toolathlon Verified: امتیاز ۷۳.۰ را به دست آورد در حالی که GLM-5.2 امتیاز ۵۹.۹ داشت. این مدل با Kimi K3 (۷۶.۵) و GPT-5.6 (۷۴.۹) رقابت نزدیکی دارد.
  • AutomationBench (v1.0.6): به امتیاز ۴۸.۲ رسید که افزایش چشمگیری نسبت به ۲۶.۲ در GLM-5.2 است و حتی از Kimi K3 (۴۶.۷) و GPT-5.6 (۴۵.۸) پیشی گرفت.
  • HLE w/ Tools: امتیاز ۶۲.۵ را ثبت کرد که نسبت به ۵۴.۷ در GLM-5.2 بهبود یافته است. این مدل کمی عقب‌تر از Fable 5 (۶۳.۹) و GPT-5.6 (۶۴.۵) است.
  • GDPval-AA v2: با امتیاز ۱۷۶۹، از GLM-5.2 (۱۵۰۸)، Kimi K3 (۱۶۸۲) و GPT-5.6 (۱۷۳۰) جلو زد.
  • Terminal Bench 2.1: امتیاز ۸۸.۲ را کسب کرد و بسیار نزدیک به GPT-5.6 (۸۸.۸) قرار گرفت و از GLM-5.2 (۸۱.۰) و Kimi K3 (۸۸.۳) پیشی گرفت.
  • PostTrainBench: امتیاز ۳۹.۸ را به دست آورد و مدل‌های GLM-5.2 (۳۱.۷) و Kimi K3 (۳۲.۰) را شکست داد، هرچند Fable 5 با ۴۱.۸ پیشتاز است.

لوگوی Hugging Face برای مخزن GLM-5.3 سازمان zai-org

قابلیت‌های نوظهور در امنیت سایبری

یکی از تکان‌دهنده‌ترین یافته‌های این انتشار، ماهیت «نوظهور» مهارت‌های امنیت سایبری مدل است. تیم توسعه دریافت که با مقیاس‌بندی پس‌آموزش، توانایی مدل در کشف و بهره‌برداری از آسیب‌پذیری‌ها سریع‌تر از حد انتظار رشد کرده است. این روند در تحلیل‌های پیشین ما درباره مقیاس‌پذیری پس‌آموزش در GLM-5.3 که به توانایی زنجیره‌سازی اکسپلویت‌ها اشاره داشت، مورد بررسی قرار گرفته بود.

در محک CyberGym برای کشف آسیب‌پذیری، GLM-5.3 امتیاز ۸۴.۵ را کسب کرد و از GLM-5.2 (۷۷.۲)، Kimi K3 (۸۰.۰) و GPT-5.6 (۸۳.۶) پیشی گرفت. اما جهش واقعی در مراحل پیشرفته‌تر زنجیره بهره‌برداری رخ داده است. در محک ExploitBench، عملکرد مدل از ۲۴.۴ به ۵۴.۴ رسید، هرچند همچنان پشت سر Fable 5 (۷۸.۰) و GPT-5.6 (۷۶.۵) است. این توانمندی در استدلال، مدل را قادر ساخت تا آسیب‌پذیری‌های قدیمی و پیچیده نرم‌افزاری را شناسایی کند که پیش از این نادیده گرفته شده بودند.

در ExploitGym، شکاف عملکردی حتی عمیق‌تر است. در بازه زمانی ۲ ساعته، GLM-5.3 امتیاز ۱۰۵ را ثبت کرد در حالی که GLM-5.2 تنها ۲۹ امتیاز داشت. در بازه ۶ ساعته، این رقم به ۱۳۰ رسید، در حالی که GLM-5.2 فقط ۳۹ امتیاز کسب کرد. برای درک بهتر، GPT-5.6 در همین دسته‌ها ۲۱۶ از ۲۹۳ و Fable 5 امتیاز ۱۸۱ از ۲۴۷ را کسب کردند.

این داده‌ها نشان‌دهنده افزایش شدید توانایی مدل در اجرای وظایف پیچیده و چندمرحله‌ای است؛ یعنی گذار از «کشف ساده» به «بهره‌برداری فعال».

استقرار محلی و کنترل

این مدل برای میزبانی شخصی (Self-hosting) منعطف طراحی شده و از چارچوب‌های استنتاج (Inference) متعددی پشتیبانی می‌کند:

  • SGLang، vLLM و TokenSpeed برای سرویس‌دهی با توان عملیاتی بالا.
  • Transformers، KTransformers و Unsloth برای توسعه و تنظیم دقیق (Fine-tuning).
  • vLLM-Ascend، xLLM و SGLang برای استقرار روی پلتفرم‌های NPU Ascend.

کاربران اکنون می‌توانند «بودجه تفکر» مدل را از طریق پارامتر reasoning_effort در سه سطح low ،high و max کنترل کنند. به‌طور پیش‌فرض، مدل از حالت max استفاده می‌کند تا بالاترین دقت ممکن را در بنچمارک‌ها تضمین کند. برای استفاده از حالت‌های low یا high باید آن‌ها را به‌طور صریح تعریف کرد.

در سناریوهای چت، توصیه می‌شود پارامتر clear_thinking=true در قالب چت ارسال شود تا نحوه نمایش استدلال‌های داخلی مدل برای کاربر مدیریت شود، زیرا در صورت عدم تعیین، مقدار پیش‌فرض آن false است.

جزئیات ارزیابی فنی

برای اطمینان از اینکه این اعداد نتیجه‌ی «دور زدن» بنچمارک‌ها نیستند، کنترل‌های سخت‌گیرانه‌ای اعمال شده است:

محیط و محدودیت‌ها:

  • NL2Repo: با دمای (Temperature) ۱.۰، top_p=1.0 و حداکثر ۶۴ هزار توکن جدید در پنجره متنی ۱ میلیون توکن ارزیابی شد. از قضاوت‌های مبتنی بر قانون و LLM برای مسدود کردن عملیات غیرمجاز pip یا curl استفاده شد.
  • CyberGym: در محیط Claude Code 2.1.207 با حداکثر تلاش استدلالی و بدون ابزارهای وب اجرا شد. عامل‌ها در کانتینرهای ایزوله با لیست سفید دامنه‌ها (فقط pypi.org و deb.debian.org) قرار گرفتند تا از تقلب جلوگیری شود. نتایج بر اساس Pass@1 در ۱۵۰۷ وظیفه است.
  • ExploitBench: به ۳۰۰ دور تعامل بین عامل و محیط محدود شد. امتیاز پوشش متوسط بر اساس ۴۱ وظیفه در ۳ بازبینی محاسبه شد.
  • Terminal-Bench 3.0: با استفاده از Claude Code 2.1.207 با ۴۰۰ هزار توکن زمینه و ۱۲۸ هزار توکن خروجی اجرا شد. هر اجرا به ۶۰۰ نوبت تعامل عامل با مهلت زمانی ۱۰ ساعت محدود شد. نتایج به صورت avg@3 در سه اجرا برای هر وظیفه گزارش شده است.
  • Agents' Last Exam (CLI): با ۱ میلیون توکن زمینه و ۶۴ هزار توکن خروجی ارزیابی شد. هر یک از ۱۰۵ وظیفه در یک کانتینر داکر ایزوله با مهلت زمانی پیش‌فرض ۴ ساعت (تا ۸ ساعت برای وظایف خاص) اجرا شد.

نمونه‌برداری و داوری:

  • HLE w/ Tools: با دمای ۱.۰، top_p=0.95 و حداکثر طول تولید ۱۶۳,۸۴۰ توکن در زمینه ۳۰۰,۰۰۰ توکن ارزیابی شد. مدل GPT-5.6-luna (medium) به‌عنوان داور عمل کرد.
  • ExploitGym: نتایج با استفاده از زمان استنتاج API که بر اساس توکن در ثانیه (TPS) هر مدل بازتنظیم شده بود، محاسبه شد. GLM-5.3 با ۱۱۵ TPS، Kimi K3 با ۴۰ TPS و Qwen3.8 Max با ۴۷ TPS بازتنظیم شدند. این ارزیابی روی ۸۶۹ وظیفه انجام شد.
  • DeepSWE: با استفاده از mini-swe-agent با دمای ۰.۹۵، top_p=1.0، مهلت ۶ ساعت و ۴۰۰ هزار توکن زمینه اجرا شد.
  • Terminal-Bench 2.1: در Claude Code 2.1.207 با دمای ۱.۰، top_p=1 و حداکثر ۶۵,۵۳۶ توکن جدید با مهلت ۶ ساعت ارزیابی شد.

جلوگیری از تقلب و اصلاحات:

  • SWE-Marathon: از پنجره متنی ۱ میلیون توکن استفاده شد. تیم توسعه تشخیص‌های بیش از حد گسترده در «strip-clone» را برای جلوگیری از مثبت‌های کاذب حذف کرد و --extra-index-url https://pypi.org/simple را برای رفع خطاهای ساخت داکر در «parameter-golf» و «trimul-cuda» اضافه کرد.
  • PostTrainBench: با پنجره متنی ۱ میلیون توکن ارزیابی شد. برای جلوگیری از مثبت‌های کاذب هنگام دسترسی به نقاط انتهایی vLLM محلی از طریق OpenAI SDK، بررسی‌های مبتنی بر الگو با یک عامل LLM جایگزین شد تا استفاده از APIهای خارجی را بازرسی کند.

تحلیل: عصر پس‌آموزش

این انتشار نشان‌دهنده تغییری در نگاه صنعت به مقیاس‌بندی مدل‌ها است. برای سال‌ها، شعار این بود: «داده‌های بیشتر، مدل بنیادی بزرگ‌تر». اما GLM-5.3 نشان می‌دهد که ما به‌طور قابل‌توجهی از پتانسیل مرحله پس‌آموزش غافل بوده‌ایم.

توسعه‌دهندگان با تمرکز بر «زنجیره بهره‌برداری» و برنامه‌ریزی‌های طولانی‌مدت، ابزاری ساخته‌اند که کمتر شبیه به یک چت‌بات و بیشتر شبیه به یک مهندس نرم‌افزار کاربردی است. این امر اتکا به محاسبات عظیم برای آموزش بنیادی را کاهش داده و تأکید را بر ترازسازی (Alignment) با کیفیت و متمرکز بر وظایف خاص قرار می‌دهد. با این حال، همین قدرت تهاجمی باعث شد تا Z.ai پیش‌تر انتشار وزن‌های این مدل را به‌دلیل خطرات امنیتی متوقف کند تا پروتکل‌های ایمنی بازبینی شوند.

برای کاربر نهایی، این بدان معناست که مدل‌های وزن‌باز در نهایت در حال پر کردن شکاف با غول‌های تجاری مانند GPT-5.6 در حوزه‌های تخصصی هستند. توانایی اجرای یک عامل کدنویسی SOTA به‌صورت محلی روی NPU یا GPU، اقتصاد توسعه نرم‌افزار مبتنی بر هوش مصنوعی را تغییر می‌دهد.

برای مشاهده این قابلیت‌ها در عمل، می‌توانید وزن‌های مدل را در Hugging Face بررسی کنید یا پارامتر reasoning_effort را در یک نمونه vLLM محلی تست کنید تا موازنه بین سرعت و دقت را پیدا کنید.

گام بعدی شما

  • وزن‌های مدل را در Hugging Face بررسی کنید تا قابلیت‌های کدنویسی آن را در پروژه‌های خود بسنجید.
  • پارامتر reasoning_effort را در یک نمونه vLLM محلی تست کنید تا موازنه بین سرعت و دقت را پیدا کنید.
  • اگر در حوزه امنیت سایبری فعال هستید، عملکرد مدل در ExploitGym را با ابزارهای فعلی خود مقایسه کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پیشرفت نشان می‌دهد مدل‌های وزن‌باز در حال بستن شکاف با غول‌های تجاری در حوزه‌های تخصصی هستند. توانایی اجرای یک عامل کدنویسی سطح اول به‌صورت محلی، اقتصاد توسعه نرم‌افزار مبتنی بر هوش مصنوعی را به‌کلی تغییر می‌دهد.

تأثیر برای ایران

به‌دلیل وزن‌باز بودن مدل، توسعه‌دهندگان ایرانی می‌توانند آن را به‌صورت محلی روی GPUهای موجود استقرار دهند و از محدودیت‌های APIهای تجاری عبور کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز GLM-5.3 بر زنجیره بهره‌برداری و برنامه‌ریزی بلندمدت، پارادایم مقیاس‌بندی را تغییر می‌دهد. این مدل ثابت می‌کند که پتانسیل پس‌آموزش به‌شدت دست‌کم گرفته شده و می‌توان بدون صرف هزینه‌های نجومی برای آموزش مدل‌های بنیادی جدید، به نتایج SOTA رسید. در واقع، ما از دوران «مدل‌های همه‌فن‌حریف» به سمت «عامل‌های متخصص» حرکت می‌کنیم که انضباط در اجرا را جایگزین حجم دانش خام کرده‌اند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.