پرش به محتوای اصلی
پرش به محتوای مقاله

«تمرکز بر پس‌آموزش»؛ استراتژی جدید Z.ai در توسعه GLM-5.3

·۸ شهریور ۱۴۰۵۵ دقیقه مطالعه
GLM-5.3 با ۷۵۶ گیگابایت وزن باز شد: خودمیزبانی بهتر است یا API؟
GLM-5.3 با ۷۵۶ گیگابایت وزن باز شد: خودمیزبانی بهتر است یا API؟
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر استراتژی از مقیاس‌بندی پیش‌آموزش به بهینه‌سازی شدید پس‌آموزش برای رسیدن به نتایج برتر در بنچمارک‌های کدنویسی، بدون تغییر در معماری پایه مدل.

اگر قصد دارید یک عامل کدنویس بسازید که واقعاً بتواند باگ‌های پیچیده را شکار کند، باید برای مدیریت یک فایل ۷۵۶ گیگابایتی آماده شوید. در ۲۹ اوت ۲۰۲۶، شرکت Z.ai وزن‌های مدل GLM-5.3 را منتشر کرد تا مرزهای کدنویسی عامل‌محور (Agentic Coding) و تحلیل آسیب‌پذیری‌ها را جابه‌جا کند.

این عرضه در حالی رخ می‌دهد که کل صنعت در حال بحث بر سر این است که آیا افزایش صرفِ مقیاس هنوز منجر به افزایش هوش می‌شود یا خیر. برای اکثر توسعه‌دهندگان، حجم عظیم GLM-5.3 باعث می‌شود میزبانی شخصی (Self-hosting) — یعنی داشتن سرور شخصی برای اجرای مدل، شبیه داشتن یک نیروگاه برق کوچک در حیاط خانه است — تنها برای مراکز داده با چندین GPU ممکن باشد و بقیه را به سمت استفاده از APIها سوق دهد.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، دسترسی به وزن‌ها لزوماً به معنای دسترسی آسان به قابلیت‌ها نیست.

معماری عملکرد

به نقل از یادداشت‌های انتشار، جهش عملکرد در GLM-5.3 حاصل یک دوره‌ی پیش‌آموزش (Pretraining) — یعنی مرحله‌ای که مدل مثل یک کودک میلیاردها صفحه متن را برای یادگیری زبان می‌خواند — بزرگ‌تر نیست. Z.ai زیربنای GLM-5.2 را دست‌نخورده باقی گذاشت؛ یعنی نه خوشه‌ی محاسباتی بزرگ‌تری به کار گرفت و نه ساختار پارامترها را تغییر داد. تمام دستاوردها حاصل پس‌آموزش (Post-training) است.

این شرکت از یک محیط یادگیری تقویتی پیچیده، سیستم تأیید وظایف و داده‌های تخصصی مهندسی نرم‌افزار و شکار آسیب‌پذیری‌ها استفاده کرد. این رویکرد به‌جای پیش‌بینی صرفِ توکن بعدی از کد، بر نحوه‌ی مدیریت حلقه‌های اجرا و بازخوردهای محیط سندباکس تمرکز دارد. برای سازندگان عامل، این یعنی قدرت مدل از طریق ساختارهای نظارتی (Scaffolding) و حلقه‌های تأیید هدایت می‌شود، نه فقط مقیاس خام داده‌های پیش‌آموزش.

مشخصات فنی

برای درک نیازهای استقرار، توسعه‌دهندگان باید به معماری هسته نگاه کنند:

  • اندازه مدل: ۷۵۶ گیگابایت وزن توزیع شده در ۱۴۱ تکه (Shard) از نوع Safetensors.
  • پیکربندی خبره‌ها: ۲۵۶ خبره مسیریابی شده (Routed Experts) که برای هر توکن، ۸ خبره فعال می‌شوند.
  • پنجره زمینه (Context Window) — یعنی میزان متنی که مدل هم‌زمان در ذهن نگه می‌دارد، شبیه میز کاری که جا برای چند ورق دارد — یک میلیون توکن را پشتیبانی می‌کند.
  • پشتیبانی از سرویس‌دهی: پشتیبانی بومی از vLLM و SGLang از روز اول گنجانده شده تا نیاز به پورت کردن دستی استک سرویس‌دهی توسط جامعه نباشد.

دستاوردهای عددی

طبق اعلام Z.ai، مدل در محک‌های تخصصی جهش‌های قابل‌توجهی داشته است:

  • Terminal-Bench 3.0: افزایش از ۴.۶ به ۲۸.۳
  • DeepSWE: افزایش از ۴۶.۲ به ۶۶.۹
  • ExploitBench: جهش از ۲۴.۴ به ۵۴.۴

با این حال، یک تحلیل انتقادی در Dev.to هشدار می‌دهد که این اعداد توسط خود سازنده و با یک محیط خاص تولید شده‌اند. این تنظیمات شامل پنجره زمینه ۴۰۰ هزار توکنی و مهلت زمانی سخاوتمندانه‌ی ۱۰ ساعت برای هر اجرا (Rollout) بود. تا زمانی که آزمایش‌کنندگان مستقل این نتایج را در استک‌های مختلف سرویس‌دهی تکرار نکنند، این ارقام را باید سقف تئوریک دانست، نه انتظار واقعی در محیط تولید.

هزینه میزبانی در برابر API

میزبانی شخصی وزن‌های اصلی و بدون کوانتش (Quantization) — یعنی فشرده‌سازی مدل برای اشغال فضای کمتر، شبیه تبدیل یک کتابخانه عظیم به یک دفترچه راهنمای جیبی است — برای توسعه‌دهندگان مستقل عملاً غیرممکن است. حتی با کوانتش FP8، مدل از ظرفیت ورک‌استیشن‌های استاندارد یا آزمایشگاه‌های خانگی کوچک فراتر می‌رود. به زبان ساده، «وزن‌های باز» به این معنا نیست که شما می‌توانید مدل را دانلود کرده و روی یک لپ‌تاپ اجرا کنید.

برای کسانی که API را انتخاب می‌کنند، Cloudflare مدل GLM-5.3 را در Workers AI ادغام کرد. ساختار قیمت‌گذاری، انگیزه‌ای شدید برای مهندسی پرامپت (Prompt Engineering) — هنر سؤال درست پرسیدن برای گرفتن بهترین جواب — ایجاد می‌کند:

  • ورودی استاندارد: ۱.۴۰ دلار به ازای هر میلیون توکن
  • ورودی کش‌شده: ۰.۲۶ دلار به ازای هر میلیون توکن
  • خروجی: ۴.۴۰ دلار به ازای هر میلیون توکن

تفاوت قیمت ورودی استاندارد و کش‌شده بیش از ۵ برابر است. بنابراین، طراحی پرامپت‌هایی که از کش استفاده کنند — به‌ویژه هنگام تکرار پرامپت‌های سیستمی یا بلوک‌های بزرگ کد — بزرگ‌ترین اهرم کاهش هزینه است. همچنین، چون توکن‌های خروجی بیش از ۳ برابر گران‌تر از ورودی‌ها هستند، عامل‌هایی که کدهای طولانی و پرحرف (Verbose) تولید می‌کنند، سریع‌تر با صورت‌حساب‌های سنگین مواجه می‌شوند تا کسانی که پاسخ‌های موجز می‌دهند.

لایسنس و سقف ۱۰ میلیارد دلاری

Z.ai از یک لایسنس سفارشی برای وزن‌های باز استفاده می‌کند. این لایسنس اجازه تغییر، توزیع و استفاده تجاری گسترده را به اکثر کاربران می‌دهد. هر کسی که قابلیت‌های مدل را در یک محصول جای‌گذاری کند، می‌تواند این کار را به‌صورت رایگان انجام دهد. اما یک شرط تجاری خاص دارد: هر ارائه‌دهنده مدل‌به‌عنوان‌سرویس (MaaS) که درآمد گروهی یکپارچه آن از ۱۰ میلیارد دلار بیشتر باشد، باید پیش از ارائه استنتاج API یا تنظیم دقیق (Fine-tuning) کنترل‌شده، یک بررسی امنیتی توسط Z.ai را پشت سر بگذارد.

این سازوکار مستقیماً غول‌های ابری مثل AWS، گوگل کلاود یا مایکروسافت آزور را هدف قرار می‌دهد تا از تصاحب تمام سود مدل بدون مشارکت در اکوسیستم محاسباتی یا لایسنس جلوگیری کند. چون این لایسنس توسط OSI تأیید نشده، نامیدن آن به عنوان «بدون محدودیت» غلط است. البته برای استارتاپ‌های مراحل اولیه، توسعه‌دهندگان مستقل یا شرکت‌هایی که اتوماسیون داخلی اجرا می‌کنند، این سقف عملاً بی‌اثر است.

ریسک‌های عملیاتی

میزبانی داخلی این وزن‌ها، بار امنیتی را به کاربر منتقل می‌کند. از آنجا که GLM-5.3 در شناسایی آسیب‌پذیری‌ها بسیار توانمند است، اجرای آن روی زیرساخت شخصی نیازمند جداسازی شدید شبکه (Network Segmentation)، کنترل خروجی (Egress Control) و مدیریت دقیق دسترسی‌های ابزارها روی میزبان است. همان‌طور که تحلیل Dev.to اشاره می‌کند، سازنده وزن‌ها را فراهم می‌کند، اما «شعاع تخریب» (Blast Radius) یک شکست امنیتی بر عهده اپراتور است.

استراتژی‌های مسیریابی درخواست

برخی تیم‌ها برای مدیریت هزینه و امنیت، از یک درگاه (Gateway) محلی-اول استفاده می‌کنند. استراتژی پیشنهادی در Dev.to، مسیریابی را بر اساس سه معیار تعریف می‌کند: آستانه تأخیر (Latency)، حساسیت داده‌ها و سطوح هم‌زمانی (Concurrency).

  • مسیریابی محلی: پرامپت‌های حاوی کدهای اختصاصی داخلی یا داده‌های حساس مشتری باید برای مدل‌های محلی کوچک‌تر ارسال شوند.
  • مسیریابی به Endpoint: وظایف طولانی‌مدت عامل‌ها و رشته‌های موازی با ترافیک بالا باید به سرویس‌های ابری منتقل شوند.

این یک ضرورت عملی است؛ چون یک لپ‌تاپ استاندارد تنها می‌تواند حدود دو دستور هم‌زمان را مدیریت کند، در حالی که Workerهای ابری می‌توانند ده‌ها درخواست را هندل کنند.

گام بعدی شما

  • اگر برای عامل‌های کدنویسی از GLM-5.3 استفاده می‌کنید، بهترین مسیر این است که ابتدا با Endpointهای ابری شروع کنید و هزینه واقعی را بر اساس حجم کاری خاص خود بسنجید.
  • پرامپت‌های خود را برای بهره‌گیری از نرخ ۰.۲۶ دلاری ورودی‌های کش‌شده بهینه کنید.
  • تا زمان انتشار نتایج تکرارپذیر توسط منابع مستقل، بنچمارک‌های سازنده را به عنوان سقف مطلق عملکرد در نظر بگیرید، نه میانگین.

این مقاله ابتدا در NextFuture منتشر شده است. برای محتوای بیشتر در زمینه مهندسی Fullstack و AI ما را دنبال کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با تکیه بر تخصص در شکار آسیب‌پذیری‌ها، استانداردهای امنیتی کدنویسی را جابه‌جا می‌کند. اعتبار این ادعا در گرو تکرار نتایج توسط شخص ثالث است، اما رویکرد Z.ai در محدود کردن غول‌های ابری، الگوی جدیدی برای توزیع عادلانه سود در مدل‌های بازمتن است.

تأثیر برای ایران

به‌دلیل حجم ۷۵۶ گیگابایتی، میزبانی محلی این مدل برای اکثر تیم‌های ایرانی غیرممکن است و تنها مسیر دسترسی، استفاده از APIهای واسط یا Cloudflare است.

·نگاه ما
تحریریه دات‌هوش

تمرکز Z.ai بر پس‌آموزش به‌جای افزایش پارامترها، نشان می‌دهد که صنعت در حال رسیدن به نقطه اشباع در مقیاس خام داده‌ها است. این مدل ثابت می‌کند که «کیفیتِ بازخورد در حلقه اجرا» بسیار اثرگذارتر از «کمیتِ توکن‌های پیش‌آموزش» است. در واقع، ما از عصر مدل‌های همه‌فن‌حریف به سمت مدل‌هایی می‌رویم که در محیط‌های شبیه‌سازی‌شده (Sandbox) تخصص می‌یابند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.