پرش به محتوای اصلی
پرش به محتوای مقاله

مدل ZGCM-1: برتری مدل ۷ میلیارد پارامتری بر غول‌های ۳۰ برابری

·۲۵ شهریور ۱۴۰۵۵ دقیقه مطالعه۱ بازدید
مدل ۷ میلیارد پارامتری ZGCM-1 که با یادگیری خودی از مدل‌های ۳۰ برابر بزرگ‌تر پیشی گرفت
مدل ۷ میلیارد پارامتری ZGCM-1 که با یادگیری خودی از مدل‌های ۳۰ برابر بزرگ‌تر پیشی گرفت
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از دسته‌ای از عامل‌های هوش مصنوعی برای مدیریت خودکار چرخه تحقیق و توسعه (R&D) و تولید داده‌های مصنوعی، در کنار بهینه‌ساز Muon برای افزایش ۴.۲ برابری سرعت آموزش.

تصور کنید مدلی با اندازهٔ یک خودروی کوچک، بتواند در مسابقه‌ای تخصصی از تانک‌های عظیم پیشی بگیرد. مدل ZGCM-1 دقیقاً همین کار را کرده است؛ یک مدل ۷ میلیارد پارامتری که اکنون در بنچمارک‌های استدلال پیچیده با سیستم‌های ۲۳۵ میلیارد پارامتری رقابت می‌کند. این یعنی شکافی ۳۰ برابری در اندازه که توسط ZGCM-1 پر شده است.

طبق تحلیل فنی منتشر شده در وب‌سایت dev.to، این مدل که در ۱۶ سپتامبر ۲۰۲۶ عرضه شد، در زمینه‌های استدلال ریاضی و جست‌وجوی عامل‌محور (Agentic Search) عملکردی بسیار فراتر از وزن خود نشان داده است.

بسیاری از مدل‌های کوچک سعی می‌کنند همه‌فن‌حریف باشند و تمام وب را در حافظهٔ محدود خود جای دهند. این رویکرد معمولاً به توهم (Hallucination) منجر می‌شود؛ وضعیتی که مدل با اطمینان کامل، اما اشتباه، پاسخ می‌دهد. برای مثال، مدل ممکن است در حالی که بسیار روان صحبت می‌کند، در حل یک مسئله جبر عمیق شکست بخورد. توسعه‌دهندگان آکادمی Zhongguancun و مؤسسه هوش مصنوعی Zhongguancun شرط متفاوتی بستند: اولویت با تمرکز معماری پاک بود، نه حجم خام داده‌ها.

همان‌طور که در بحث‌های گذشته‌ی ما درباره‌ی بهینه‌سازی مدل‌های زبانی کوچک اشاره کردیم، تخصص‌گرایی در لایه‌های پایین مدل می‌تواند جایگزین افزایش پارامترها شود. این رویکرد در راستای جریانی است که در آن مدل‌های کوچک و وزن‌باز توانسته‌اند هزینه‌ی استنتاج عامل‌های هوش مصنوعی را تا ۷۰٪ کاهش دهند و کارایی را در اولویت قرار دهند.

معماری ترکیبی

ZGCM-1 یک ترنسفورمر (Transformer) فقط-رمزگشا با ۷.۳۹ میلیارد پارامتر، ۳۲ لایه و بُعد پنهان ۴۰۹۶ است. نوآوری کلیدی آن، یک ستون فقرات «توجه ترکیبی» است که توجه پنجره‌ای لغزان (Sliding-Window Attention - SWA) را با نسبت ۵ به ۱ با توجه جهانی (Global Attention) ترکیب می‌کند. این ساختار پیچیده را می‌توان در بررسی دقیق‌تر معماری ترکیبی ZGCM-1 برای بهینه‌سازی موتور اجرای ۷ میلیاردی که پیش‌تر منتشر کردیم، مشاهده کرد.

به طور دقیق‌تر، ۲۷ لایه از ۳۲ لایه از SWA با پنجره ۱۲۸ توکنی استفاده می‌کنند و تنها ۵ لایه توجه جهانی دارند. این پیکربندی تهاجمی اجازه می‌دهد مدل یک پنجرهٔ زمینه (Context Window) عظیم ۲۵۶ هزار توکنی را پشتیبانی کند. بر اساس مستندات فنی، این تغییر منجر به کاهش ۶.۴ برابری ردپای KV Cache به ازای هر توکن و افزایش ۳.۹۴ برابری توان عملیاتی (Throughput) در حداکثر زمینه نسبت به توجه استاندارد شده است. برای مدلی که برای جست‌وجوی عامل‌محور در کدبیس‌ها و اسناد طولانی طراحی شده، این بهره‌وری یک مزیت عملیاتی مستقیم است.

برای پایداری در این حجم از زمینه، تیم از توجه پرس‌وجوی گروه‌بندی‌شده (GQA)، نرمال‌سازی RMSNorm، فعال‌سازهای SwiGLU و رمزگذاری موقعیت دورانی (RoPE) استفاده کرد. آن‌ها به طور خاص از نرمال‌سازی QK و یک RoPE جزئی با کسر دورانی ۰.۳۳ برای حفظ پایداری در حد ۲۵۶ هزار توکن بهره بردند.

بهینه‌سازی و سرعت آموزش

خط لوله آموزش این مدل به سرعت ۴.۲ برابری در رسیدن به تابع زیان (Time-to-loss) نسبت به خط پایه AdamW/BF16 دست یافت. این جهش مدیون سه انتخاب فنی بود:

  • بهینه‌ساز Muon: یک بهینه‌ساز الهام‌گرفته از مرتبه دوم که تکانه Nesterov را در فضای گرادیان اعمال کرده و سپس به‌روزرسانی را با تکرارهای Newton-Schulz متعامد می‌کند. ZGCM-1 یکی از بزرگ‌ترین اعتبارسنجی‌های مقیاس‌پذیر برای همگرایی سریع‌تر Muon نسبت به AdamW است.
  • دقت ترکیبی FP8: مدل برای بخش اعظم ضرب‌های ماتریسی از FP8 استفاده می‌کند. این کار فشار روی پهنای باند حافظه را کاهش داده و اجازه می‌دهد اندازهٔ دسته‌های (Batch size) مؤثر بزرگ‌تری انتخاب شوند. دقت بالاتر تنها برای عملیات‌های حساس مانند نرمال‌سازی لایه‌ها و Softmax توجه رزرو شده است.
  • منظم‌سازی TWEO: منظم‌سازی بر اساس وزن‌های پرت (Trainable Weight-based Outlier) باعث کاهش جهش‌های فعال‌سازی می‌شود؛ موضوعی که معمولاً توسعه‌دهندگان را مجبور می‌کند برخی لایه‌ها را حتی در اجرای FP8 در حالت BF16 نگه دارند.

برنامه آموزشی به صورت پیش‌رونده بود و زمینه را از ۱۶ هزار به ۶۴ هزار و در نهایت به ۲۵۶ هزار توکن رساند. در اواسط آموزش، تیم ردپای استفاده از ابزار و تعاملات جست‌وجو را به عنوان فرآیندهای تصمیم‌گیری مارکوف (MDPs) بازنویسی کرد. این تکنیک که از یادگیری تقویتی آفلاین وام گرفته شده، نظارت متراکم در سطح گام را فراهم کرد و سیگنالی غنی‌تر از پیش‌بینی توکن بعدی داد.

مرحله پس از آموزش، ترکیبی از تنظیم نظارت‌شده (SFT) و بهینه‌سازی سیاست نسبی گروهی (GRPO) بود. در مرحله SFT، فیلترینگ کیفی تهاجمی اعمال شد و حدود ۵۰٪ از داده‌های کاندید خام پیش از هرگونه به‌روزرسانی گرادیان، از طریق یک فرآیند امتیازدهی لایه‌ای حذف شدند.

تحقیق و توسعه هوش مصنوعی-بومی: ارتش عامل‌ها

شاید تکان‌دهنده‌ترین جنبه ZGCM-1 این باشد که بخشی از آن توسط هوش مصنوعی‌های دیگر ساخته شده است. تیم توسعه، دسته‌هایی از عامل‌ها (Agents) را برای مدیریت بخش‌های سخت R&D به کار گرفت و بخش زیادی از نیروی انسانی مهندسی در چرخه داده و زیرساخت را جایگزین کرد.

این عامل‌ها مسئول موارد زیر بودند:

  • فیلتر کردن و امتیازدهی به داده‌های آموزشی در مقیاس وسیع.
  • تولید نمونه‌های مصنوعی برای ریاضیات و جست‌وجوی عامل‌محور.
  • مانیتورینگ اجراهای آموزشی و شناسایی ناهنجاری‌ها.
  • اجرای تحلیل‌های حذف (Ablations) روی انتخاب‌های ابرپارامتر.

در حالی که انسان‌ها خط لوله و معماری ثابت را طراحی کردند، عامل‌ها اجرا را به صورت خودکار مدیریت کردند. جامعه HuggingFace اشاره کرده است که این موضوع ZGCM-1 را به مدلی تبدیل می‌کند که «تا حدی خودش را ساخته است» و گامی معنادار به سوی بهبود خودکار بازگشتی است. البته باید اشاره کرد که عامل‌ها هدف آموزش یا معماری را به صورت خودکار تغییر ندادند و در چارچوب طراحی شده توسط انسان عمل کردند.

عملکرد در محک‌ها

نتایج، ZGCM-1 را در صدر دسته مدل‌های ۷ تا ۸ میلیارد پارامتری در ۱۴ محک استدلال قرار می‌دهد. نمرات ریاضی به طور خاص خیره‌کننده هستند:

  • MATH-500: ۹۷.۱٪
  • AIME 2026: ۷۵.۰٪
  • HMMT 2025: ۷۰.۴٪

در جست‌وجوی عامل‌محور، مدل در وظیفه «جست‌وجوی تابع باینری» برتری عظیمی داشت و ۶۲.۰٪ امتیاز کسب کرد، در حالی که Qwen3-8B تنها ۱۲٪ بود. این شکاف ۵۰ درصدی نشان‌دهنده توانایی واقعی مدل در پیمایش کدهای واقعی برای یافتن پیاده‌سازی توابع است؛ نیازی حیاتی برای عامل‌های کدنویسی حرفه‌ای. سایر نتایج عامل‌محور شامل ۶۳.۱٪ در WebWalkerQA و ۱۹.۴٪ در BrowseComp است.

در وظایف زبانی عمومی، مدل با Qwen3-8B برابری می‌کند. تیم ZGCM ادعای برتری در کاربردهای عمومی ندارد؛ تمرکز آن‌ها صراحتاً روی ریاضیات و جست‌وجوی عامل‌محور بوده و پروفایل بنچمارک‌ها نیز همین تخصص را منعکس می‌کند.

استانداردی جدید برای باز بودن

برخلاف بسیاری از مدل‌های «وزن‌های باز» که فقط مدل نهایی را ارائه می‌دهند، ZGCM-1 کاملاً باز است. این انتشار شامل موارد زیر است:

  • دستورالعمل‌های داده‌ای (Recipes) برای هر مرحله.
  • کد کامل آموزش.
  • نقاط بازرسی (Checkpoints) میانی در مراحل مختلف برنامه آموزشی.
  • لاگ‌های کامل Weights & Biases (W&B) که کل مسیر آموزش را نشان می‌دهد.

این شفافیت، مدل را از یک ابزار به یک «دستور پخت» قابل بازتولید تبدیل می‌کند. تیم‌هایی که روی برنامه‌های ریاضی تخصصی یا جست‌وجوی عامل‌محور کار می‌کنند، می‌توانند از این دستورالعمل‌ها و نقاط بازرسی به عنوان نقطه شروع برای پیش‌آموزش یا تنظیم دقیق با دید کامل به تاریخچه مدل پایه استفاده کنند.

پیامدها برای متخصصان

این تحول، پیش‌فرض‌های توسعه مدل‌های کوچک را تغییر می‌دهد. ثابت شد که قابلیت‌های استدلال تخصصی را می‌توان از طریق نظارت مبتنی بر MDP و مدیریت داده توسط عامل‌ها در مدل‌های ۷ میلیارد پارامتری جای داد، بدون اینکه نیاز باشد تعداد پارامترها را افزایش داد.

برای متخصصان، این یعنی استدلال نمادین با سرعت بالا و تأخیر کم، اکنون برای خط لوله‌های عامل‌محور روی دستگاه (On-device) یا حساس به هزینه، عملی است. به طور خاص در موارد زیر کاربرد دارد:

  • خط لوله‌های ریاضی‌محور که نیاز به استدلال نمادین دارند اما نمی‌خواهند تأخیر سیستم‌های ۷۰ میلیارد پارامتری را تحمل کنند.
  • عامل‌های جست‌وجوی کد که به قابلیت پیمایش کدبیس نیاز دارند (مشابه نتایج جست‌وجوی تابع باینری).
  • پردازش زمینه‌های طولانی که در آن پنجره ۲۵۶ هزار توکنی و مزیت توان عملیاتی ۳.۹۴ برابری، هزینه‌های سرویس‌دهی را کاهش می‌دهد.

ترکیب Muon و آموزش FP8، نقشه‌ای برای کاهش هزینه محاسباتی مدل‌های بنیادی آینده ارائه می‌دهد. پژوهشگران اکنون باید لاگ‌های W&B در HuggingFace را بررسی کنند تا افزایش ۴.۲ برابری سرعت آموزش را تأیید کرده و قابلیت‌های پیمایش کد مدل را روی مخازن خصوصی خود آزمایش کنند. گزارش فنی کامل در arXiv در دسترس است و مخزن گیت‌هاب شامل تمام اسکریپت‌های لازم برای آموزش است.

گام بعدی شما

  • بررسی لاگ‌های W&B در HuggingFace برای تحلیل نحوه همگرایی سریع‌تر با بهینه‌ساز Muon.
  • تست مدل ZGCM-1 روی کدهای پیچیده داخلی برای ارزیابی دقت در جست‌وجوی توابع (Binary Function Search).
  • مطالعه گزارش فنی در arXiv برای درک جزئیات پیاده‌سازی Partial RoPE در زمینه‌های ۲۵۶ هزار توکنی.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با تکیه بر تخصص در معماری توجه ترکیبی و بهینه‌ساز Muon، ثابت کرد که مدل‌های کوچک می‌توانند در استدلال‌های نمادین با غول‌های صنعت رقابت کنند. این دستاورد اعتبار مدل‌های SLM را برای استقرار در لبه (Edge) و کاهش هزینه‌های استنتاج در مقیاس صنعتی افزایش می‌دهد.

تأثیر برای ایران

به دلیل وزن‌های باز (Open Weights) و نیاز محاسباتی کمتر نسبت به مدل‌های غول‌پیکر، توسعه‌دهندگان ایرانی می‌توانند این مدل را روی سخت‌افزارهای محدودتر استقرار داده و برای ساخت عامل‌های کدنویسی تخصصی استفاده کنند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی مهندسان داده با ارتش‌های عامل برای مدیریت چرخه R&D، مدل ZGCM-1 را از یک محصول به یک اثبات مفهوم (PoC) برای «خود-بهبودی بازگشتی» تبدیل می‌کند. این رویکرد نشان می‌دهد که گلوگاه مدل‌های کوچک دیگر تعداد پارامترها نیست، بلکه کیفیت و ساختار داده‌های آموزشی است که می‌تواند توسط خودِ هوش مصنوعی بهینه‌ شود. در واقع، ما شاهد گذار از «مهندسی مدل» به «مهندسی سیستم‌های تولید مدل» هستیم.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.