اگر امروز برای استنتاج مدلهای استدلالی هزینه میپردازید، مدل GLM-5.3 میتواند هزینه هر تسک را به کمتر از یک دلار برساند. این مدل چینی حالا فاصله خود را با پیشروترین سیستمهای جهان به تنها ۳ امتیاز رسانده است.
طبق گزارش منتشر شده در ۱۸ آگوست ۲۰۲۶، مدل جدید آزمایشگاه Z.ai موفق شد در شاخص هوش Artificial Analysis امتیاز ۶۰ را کسب کند و دقیقاً در جایگاهی برابر با Kimi K3 محصول شرکت Moonshot AI قرار بگیرد. در حالی که Claude Opus 5 همچنان با امتیاز ۶۳ در صدر این جدول است، GLM-5.3 نشان داد که برای رسیدن به سطح مدلهای پیشرو، لزوماً نیاز به صرف بودجههای نجومی برای آموزش اولیه نیست. این جایگاه در حالی تثبیت شده که مدل Claude Opus 5 پیشتر با ثبت رکوردهای جدید در استدلال ماشینی، استانداردهای سختگیرانهای را برای مدلهای رقیب تعریف کرده بود.
این تحول در حالی رخ میدهد که صنعت بهسمت مدلهای استدلالی (Reasoning Model) — مدلهایی که اولویت را به محاسبات در زمان استنتاج (Test-time compute) نسبت به افزایش خام تعداد پارامترها میدهند — حرکت میکند. در حالی که مدلهای پیشرو اغلب برای جهش به سطوح بالاتر بنچمارکها به چرخههای عظیم پیشآموزش نیاز دارند، Z.ai مسیر متفاوتی را در پیش گرفته است. این آزمایشگاه در تلاش است ثابت کند که پسآموزشهای هدفمند میتوانند شکاف عملکردی با توانمندترین سیستمهای جهان را پر کنند.
همانطور که در تحلیلهای پیشین ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، تمرکز اکنون از افزایش تعداد پارامترها به سمت بهینهسازی محاسبات در زمان استنتاج تغییر کرده است.
بر اساس مستندات Artificial Analysis، مدل GLM-5.3 بر پایه همان مدل بنیادی نسل قبلی (GLM-5.2) ساخته شده است. تمام پیشرفتهای این مدل حاصل یک ماه مقیاسبندی یادگیری تقویتی (RL) در محیطهای عملیاتی با افق زمانی بلند است. Z.ai با استفاده از تسکهای متنوعتر و افزایش توان محاسباتی روی زیرساختهای موجود، توانست این جهش را رقم بزند.
این رویکرد غیرمعمول به این معناست که جهش عملکردی مدل کاملاً مدیون مرحله پسآموزش است، نه یک چرخه جدید از پیشآموزش (Pretraining). این مدل رسماً در ۱۴ آگوست ۲۰۲۶ عرضه شد.
به نقل از گزارشهای فنی، نتایج داخلی مدل خیرهکننده است. رویکرد متمرکز بر RL باعث شد امتیاز Terminal-Bench 3.0 از ۴.۶ به ۲۸.۳ و امتیاز DeepSWE v1.1 از ۴۶.۲ به ۶۶.۹ برسد. مستندات Z.ai همچنین نتایجی را در حوزههای کدنویسی، امنیت سایبری و بنچمارکهای عاملمحور (Agentic) در برابر رقبایی چون Kimi K3، Claude Opus 4.8، Claude Fable 5 و GPT-5.6 Sol ارائه داده است.
امتیاز ۶۰ در نسخه ۴.۱.۱ شاخص هوش، ترکیبی از ۹ ارزیابی مجزا است که شامل موارد زیر میشود:
- تسکهای دنیای واقعی و استفاده از ابزار (Tool Use) در حالت عاملمحور
- کدنویسی در ترمینال و استدلال علمی
- استدلال در سطح تحصیلات تکمیلی در علوم و فیزیک
- قابلیت اطمینان دانش، نرخ توهم (Hallucination) و استدلال در بستر متنی طولانی
مدل GLM-5.3 با این امتیاز، بسیار بالاتر از میانگین ۳۵ امتیازیِ ۱۸۱ مدل همرده قرار گرفته و رتبه هشتم کلی را به دست آورده است. این امتیاز در حالت «بیشترین تلاش برای استدلال» ثبت شده که Z.ai آن را برای کارهای کدنویسی توصیه میکند. هزینه کل این ارزیابیها روی API این شرکت ۱۲۳۸.۵۰ دلار بوده است.
این مدل دارای ۷۵۳ میلیارد پارامتر است و در حال حاضر بسته (Proprietary) است. با این حال، Z.ai متعهد شده است که دو هفته پس از عرضه (یعنی تا اواخر آگوست ۲۰۲۶)، پس از تکمیل ارزیابیهای ایمنی و سختسازی (Hardening)، وزنهای باز (Open Weights) مدل را منتشر کند.
این اقدام، GLM-5.3 را در کنار Kimi K3 قرار میدهد که در ۱۶ ژوئیه ۲۰۲۶ منتشر شد. Kimi K3 در حال حاضر برترین مدل وزنباز در این شاخص است که در ژوئیه ۲۰۲۶ تحت یک لایسنس مبتنی بر سطح درآمد (Revenue-tiered license) به صورت باز منتشر شد.
تفاوت اصلی GLM-5.3 با رقیبش در اقتصاد استنتاج است. هزینه هر میلیون توکن ورودی در API این مدل ۱.۴۰ دلار و برای خروجی ۴.۴۰ دلار است؛ در حالی که Kimi K3 برای همین مقادیر به ترتیب ۳.۰۰ و ۱۵.۰۰ دلار دریافت میکند.
این قیمتگذاری باعث میشود هزینه هر تسک در شاخص هوش برای GLM-5.3 حدود ۰.۶۸ دلار باشد، در حالی که این رقم برای Kimi K3 برابر با ۰.۸۴ دلار و برای Claude Opus 5 حدود ۲.۳۴ دلار است. البته این بهرهوری با یک هزینه همراه است: مدل GLM-5.3 پرحرفترین مدل در این گروه است و در طول ارزیابیها ۱۷۰ میلیون توکن خروجی تولید کرد که بسیار بیشتر از میانگین ۷۲ میلیونی این کلاس است.
برای جامعه فنی، این تغییر سیگنالی است که «مرز فناوری» دیگر تنها با بودجه پیشآموزش تعریف نمیشود. اگر مدلی بتواند از طریق RL در پسآموزش به هوش رقیب برسد و همزمان هزینه هر تسک را کاهش دهد، مزیت رقابتی از «داشتن دادههای بیشتر» به «داشتن خط لوله یادگیری تقویتی کارآمدتر» منتقل میشود.
در حال حاضر GLM-5.3 از طریق API و برای مشترکین طرح کدنویسی (GLM Coding Plan) در دسترس است. کاربران باید قابلیت «تفکر» (Thinking) را — که در سه سطح تلاش در دسترس است — فعال کنند، زیرا فراخوانی مدل بدون فعال کردن این قابلیت منجر به شکست در اجرای تسکها میشود.
منتظر انتشار رسمی وزنهای GLM-5.3 در روزهای آینده باشید؛ اتفاقی که آن را به یکی از بالاترین مدلهای استدلالی وزنباز تبدیل میکند که قیمتی تقریباً نصف نزدیکترین رقیبش دارد.
گام بعدی شما
- اگر از مدلهای استدلالی برای کدنویسی استفاده میکنید، هزینه استنتاج GLM-5.3 را با مدل فعلی خود مقایسه کنید.
- برای تسکهای پیچیده، سطح «تلاش» (Effort Level) مدل را روی حداکثر قرار دهید تا از حداکثر توان استدلالی آن بهره ببرید.
- منتظر انتشار وزنهای باز مدل در روزهای آینده باشید تا امکان استقرار محلی آن فراهم شود.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو