پرش به محتوای اصلی
پرش به محتوای مقاله

درون استراتژی Z.ai؛ ارتقای هوش مدل با مقیاس‌بندی یادگیری تقویتی

·۲۸ مرداد ۱۴۰۵۴ دقیقه مطالعه۲ بازدید
نمودار مقایسه امتیاز هوش مصنوعی GLM-5.3 و Kimi K3 در شاخص Artificial Analysis
نمودار مقایسه امتیاز هوش مصنوعی GLM-5.3 و Kimi K3 در شاخص Artificial Analysis
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

دستیابی به سطح هوش مدل‌های پیشرو صرفاً از طریق مقیاس‌بندی یادگیری تقویتی (RL) در مرحله پس‌آموزش، بدون نیاز به اجرای مجدد چرخه پیش‌آموزش مدل بنیادی.

اگر امروز برای استنتاج مدل‌های استدلالی هزینه می‌پردازید، مدل GLM-5.3 می‌تواند هزینه هر تسک را به کمتر از یک دلار برساند. این مدل چینی حالا فاصله خود را با پیشروترین سیستم‌های جهان به تنها ۳ امتیاز رسانده است.

طبق گزارش منتشر شده در ۱۸ آگوست ۲۰۲۶، مدل جدید آزمایشگاه Z.ai موفق شد در شاخص هوش Artificial Analysis امتیاز ۶۰ را کسب کند و دقیقاً در جایگاهی برابر با Kimi K3 محصول شرکت Moonshot AI قرار بگیرد. در حالی که Claude Opus 5 همچنان با امتیاز ۶۳ در صدر این جدول است، GLM-5.3 نشان داد که برای رسیدن به سطح مدل‌های پیشرو، لزوماً نیاز به صرف بودجه‌های نجومی برای آموزش اولیه نیست. این جایگاه در حالی تثبیت شده که مدل Claude Opus 5 پیش‌تر با ثبت رکوردهای جدید در استدلال ماشینی، استانداردهای سخت‌گیرانه‌ای را برای مدل‌های رقیب تعریف کرده بود.

این تحول در حالی رخ می‌دهد که صنعت به‌سمت مدل‌های استدلالی (Reasoning Model) — مدل‌هایی که اولویت را به محاسبات در زمان استنتاج (Test-time compute) نسبت به افزایش خام تعداد پارامترها می‌دهند — حرکت می‌کند. در حالی که مدل‌های پیشرو اغلب برای جهش به سطوح بالاتر بنچمارک‌ها به چرخه‌های عظیم پیش‌آموزش نیاز دارند، Z.ai مسیر متفاوتی را در پیش گرفته است. این آزمایشگاه در تلاش است ثابت کند که پس‌آموزش‌های هدفمند می‌توانند شکاف عملکردی با توانمندترین سیستم‌های جهان را پر کنند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، تمرکز اکنون از افزایش تعداد پارامترها به سمت بهینه‌سازی محاسبات در زمان استنتاج تغییر کرده است.

بر اساس مستندات Artificial Analysis، مدل GLM-5.3 بر پایه همان مدل بنیادی نسل قبلی (GLM-5.2) ساخته شده است. تمام پیشرفت‌های این مدل حاصل یک ماه مقیاس‌بندی یادگیری تقویتی (RL) در محیط‌های عملیاتی با افق زمانی بلند است. Z.ai با استفاده از تسک‌های متنوع‌تر و افزایش توان محاسباتی روی زیرساخت‌های موجود، توانست این جهش را رقم بزند.

این رویکرد غیرمعمول به این معناست که جهش عملکردی مدل کاملاً مدیون مرحله پس‌آموزش است، نه یک چرخه جدید از پیش‌آموزش (Pretraining). این مدل رسماً در ۱۴ آگوست ۲۰۲۶ عرضه شد.

به نقل از گزارش‌های فنی، نتایج داخلی مدل خیره‌کننده است. رویکرد متمرکز بر RL باعث شد امتیاز Terminal-Bench 3.0 از ۴.۶ به ۲۸.۳ و امتیاز DeepSWE v1.1 از ۴۶.۲ به ۶۶.۹ برسد. مستندات Z.ai همچنین نتایجی را در حوزه‌های کدنویسی، امنیت سایبری و بنچمارک‌های عامل‌محور (Agentic) در برابر رقبایی چون Kimi K3، Claude Opus 4.8، Claude Fable 5 و GPT-5.6 Sol ارائه داده است.

امتیاز ۶۰ در نسخه ۴.۱.۱ شاخص هوش، ترکیبی از ۹ ارزیابی مجزا است که شامل موارد زیر می‌شود:

  • تسک‌های دنیای واقعی و استفاده از ابزار (Tool Use) در حالت عامل‌محور
  • کدنویسی در ترمینال و استدلال علمی
  • استدلال در سطح تحصیلات تکمیلی در علوم و فیزیک
  • قابلیت اطمینان دانش، نرخ توهم (Hallucination) و استدلال در بستر متنی طولانی

مدل GLM-5.3 با این امتیاز، بسیار بالاتر از میانگین ۳۵ امتیازیِ ۱۸۱ مدل هم‌رده قرار گرفته و رتبه هشتم کلی را به دست آورده است. این امتیاز در حالت «بیشترین تلاش برای استدلال» ثبت شده که Z.ai آن را برای کارهای کدنویسی توصیه می‌کند. هزینه کل این ارزیابی‌ها روی API این شرکت ۱۲۳۸.۵۰ دلار بوده است.

این مدل دارای ۷۵۳ میلیارد پارامتر است و در حال حاضر بسته (Proprietary) است. با این حال، Z.ai متعهد شده است که دو هفته پس از عرضه (یعنی تا اواخر آگوست ۲۰۲۶)، پس از تکمیل ارزیابی‌های ایمنی و سخت‌سازی (Hardening)، وزن‌های باز (Open Weights) مدل را منتشر کند.

این اقدام، GLM-5.3 را در کنار Kimi K3 قرار می‌دهد که در ۱۶ ژوئیه ۲۰۲۶ منتشر شد. Kimi K3 در حال حاضر برترین مدل وزن‌باز در این شاخص است که در ژوئیه ۲۰۲۶ تحت یک لایسنس مبتنی بر سطح درآمد (Revenue-tiered license) به صورت باز منتشر شد.

تفاوت اصلی GLM-5.3 با رقیبش در اقتصاد استنتاج است. هزینه هر میلیون توکن ورودی در API این مدل ۱.۴۰ دلار و برای خروجی ۴.۴۰ دلار است؛ در حالی که Kimi K3 برای همین مقادیر به ترتیب ۳.۰۰ و ۱۵.۰۰ دلار دریافت می‌کند.

این قیمت‌گذاری باعث می‌شود هزینه هر تسک در شاخص هوش برای GLM-5.3 حدود ۰.۶۸ دلار باشد، در حالی که این رقم برای Kimi K3 برابر با ۰.۸۴ دلار و برای Claude Opus 5 حدود ۲.۳۴ دلار است. البته این بهره‌وری با یک هزینه همراه است: مدل GLM-5.3 پرحرف‌ترین مدل در این گروه است و در طول ارزیابی‌ها ۱۷۰ میلیون توکن خروجی تولید کرد که بسیار بیشتر از میانگین ۷۲ میلیونی این کلاس است.

برای جامعه فنی، این تغییر سیگنالی است که «مرز فناوری» دیگر تنها با بودجه پیش‌آموزش تعریف نمی‌شود. اگر مدلی بتواند از طریق RL در پس‌آموزش به هوش رقیب برسد و هم‌زمان هزینه هر تسک را کاهش دهد، مزیت رقابتی از «داشتن داده‌های بیشتر» به «داشتن خط لوله یادگیری تقویتی کارآمدتر» منتقل می‌شود.

در حال حاضر GLM-5.3 از طریق API و برای مشترکین طرح کدنویسی (GLM Coding Plan) در دسترس است. کاربران باید قابلیت «تفکر» (Thinking) را — که در سه سطح تلاش در دسترس است — فعال کنند، زیرا فراخوانی مدل بدون فعال کردن این قابلیت منجر به شکست در اجرای تسک‌ها می‌شود.

منتظر انتشار رسمی وزن‌های GLM-5.3 در روزهای آینده باشید؛ اتفاقی که آن را به یکی از بالاترین مدل‌های استدلالی وزن‌باز تبدیل می‌کند که قیمتی تقریباً نصف نزدیک‌ترین رقیبش دارد.

گام بعدی شما

  • اگر از مدل‌های استدلالی برای کدنویسی استفاده می‌کنید، هزینه استنتاج GLM-5.3 را با مدل فعلی خود مقایسه کنید.
  • برای تسک‌های پیچیده، سطح «تلاش» (Effort Level) مدل را روی حداکثر قرار دهید تا از حداکثر توان استدلالی آن بهره ببرید.
  • منتظر انتشار وزن‌های باز مدل در روزهای آینده باشید تا امکان استقرار محلی آن فراهم شود.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با تکیه بر اعتبار شاخص Artificial Analysis، ثابت کرد که می‌توان با هزینه‌ای بسیار کمتر به سطح مدل‌های پیشرو رسید. این اتفاق باعث فشار بر قیمت‌گذاری API مدل‌های رقیب و تسریع در پذیرش مدل‌های استدلالی در صنعت می‌شود.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم توسعه‌دهندگان ایرانی به این مدل دشوار است؛ اما انتشار قریب‌الوقوع وزن‌های باز آن، فرصتی استثنایی برای استقرار محلی یک مدل استدلالی سطح بالا در ایران فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

برتری GLM-5.3 در هزینه استنتاج نشان می‌دهد که بهینه‌سازی‌های پس‌آموزش می‌توانند اثرات مالی ملموسی ایجاد کنند، حتی اگر مدل از نظر حجم پارامترها تغییر نکند. این موضوع فرضیه «بزرگ‌تر یعنی باهوش‌تر» را به چالش می‌کشد و ثابت می‌کند که کیفیت داده‌های RL می‌تواند جایگزین مقیاس‌های عظیم پیش‌آموزش شود. در واقع، رقابت اکنون به میدان «مهندسی پاداش» منتقل شده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.