پرش به محتوای اصلی
پرش به محتوای مقاله

درون معماری ترکیبی ZGCM-1 برای بهینه‌سازی موتور اجرای ۷ میلیاردی

·۲۴ شهریور ۱۴۰۵۳ دقیقه مطالعه۲ بازدید
توقف فشرده‌سازی وب در مدل‌های ۷ میلیارد پارامتری
توقف فشرده‌سازی وب در مدل‌های ۷ میلیارد پارامتری
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از فرآیندهای تصمیم‌گیری مارکوف (MDP) برای تعامل با ابزارها به‌جای متون استاتیک؛ این تغییر باعث شد یک مدل ۷ میلیارد پارامتری در ریاضیات با مدل‌های ۷۰ میلیارد پارامتری برابری کند.

دقت ۹۷ درصدی در آزمون MATH-500 نتیجه‌ای است که به‌دست می‌آید وقتی ۷.۳۹ میلیارد پارامتر به‌جای تبدیل شدن به پایگاه داده‌ای برای اطلاعات عمومی، به عنوان یک موتور اجرا به کار گرفته شوند. طبق اعلام آکادمی Zhongguancun و مؤسسه هوش مصنوعی Zhongguancun در ۱۵ سپتامبر ۲۰۲۶، مدل ZGCM-1 ثابت کرد که اتلاف ظرفیت مدل‌های کوچک در حفظ کردن داده‌هاست و پارادایم طراحی باید به سمت موتورهای اجرای اختصاصی تغییر کند.

بسیاری از مدل‌های کوچک هنگام مواجهه با استدلال‌های عمیق، به دلیل محدودیت ظرفیت پارامتریک دچار توهم (Hallucination) می‌شوند. ZGCM-1 با تبدیل شدن به یک موتور اجرا که اطلاعات را به‌صورت لحظه‌ای بازیابی می‌کند، از این مشکل عبور کرده است. این مدل از یک پنجره زمینه (Context Window) عظیم ۲۵۶ هزار توکنی برای پردازش داده‌های خارجی استفاده می‌کند تا به‌جای تکیه بر وزن‌های داخلی، بر داده‌های جاری متمرکز شود.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی مدل‌های زبانی کوچک (SLM) اشاره کردیم، مدیریت حافظه در پنجره‌های متنی بزرگ همواره یک چالش سخت‌افزاری بوده است. برای جلوگیری از کرش کردن سخت‌افزار، تیم توسعه یک معماری ترکیبی را پیاده کرده است. بر اساس گزارش وب‌سایت dev.to، آن‌ها لایه‌های توجه (Attention) پنجره‌ای لغزنده را با لایه‌های توجه کامل ترکیب کردند که منجر به افزایش ۳.۹۴ برابری توان عملیاتی (Throughput) در مقیاس ۲۵۶ هزار توکن شد. این رویکرد در راستای کاهش چشمگیر هزینه‌های استنتاج در مدل‌های کوچک است که جایگاه عامل‌های هوشمند را در لبه‌ی شبکه تقویت می‌کند.

به‌نقل از مستندات فنی، بهره‌وری آموزش این مدل با استفاده از بهینه‌ساز FP8 Muon و یک برنامه آموزشی پیش‌رونده سه‌مرحله‌ای (از ۱۶ هزار تا ۲۵۶ هزار توکن) افزایش یافته است. این طراحی مشترک سیستم، زمان رسیدن به تابع زیان در پیش‌آموزش ۱۶ هزار توکنی را تقریباً ۴.۲ برابر کاهش داد و آموزش مدل‌های با کارایی بالا را بدون نیاز به خوشه‌های محاسباتی عظیم ممکن کرد. این بهینه‌سازی‌ها با روند سقوط شتابان هزینه‌های توسعه پروژه‌های هوش مصنوعی در ماه‌های اخیر هم‌سو است.

استدلال عامل‌محور و بنچمارک‌ها

بزرگ‌ترین تغییر این مدل، برخورد با تعاملات ابزاری به‌صورت فرآیندهای تصمیم‌گیری مارکوف (MDPs) است. ZGCM-1 به‌جای دنبال کردن نسخه‌های ایستا از متون ReAct، یاد می‌گیرد که انتقال بین وضعیت‌ها، بازگشت صریح (Backtracking) و بازنویسی پرس‌وجوها را به‌عنوان سیاست‌های اصلی خود اجرا کند.

این چرخش معماری منجر به ثبت نمرات در سطح مدل‌های پیشرو شد:

  • MATH-500: ۹۷.۱۳٪
  • AIME 2026: ۷۵.۰۰٪
  • WebWalkerQA: ۶۳.۰۹٪
  • BrowseComp: ۱۹.۴۳٪

این ارقام معمولاً تنها توسط مدل‌های ۷۰ میلیارد پارامتری یا معماری‌های عظیم ترکیب خبره‌ها (MoE) مانند Qwen3-235B به‌دست می‌آمدند. ZGCM-1 با جداسازی ذخیره‌سازی دانش از عمق استدلال، به دقتی سطح بالا با کسری از پارامترها دست یافته است. این دستاورد یادآور رویکرد اقتصادی علی‌بابا در مدل‌های میان‌رده است که هدفشان جایگزینی بهینه برای APIهای گران‌قیمت بود.

برای جامعه فنی، این یک سیگنال واضح است: هدف دیگر «جا دادن» کل وب در وزن‌های مدل نیست، بلکه ساخت کنترلرهای سبک با استدلال عمیق است که بتوانند ابزارهای جست‌وجو و محیط‌های ایزوله (Sandbox) را به‌طور مؤثر مدیریت کنند.

توسعه‌دهندگان اکنون می‌توانند به کل خط لوله، شامل وزن‌ها و دستورالعمل‌های داده، از طریق Hugging Face در مسیر zgcagi/ZGCM-1-7B و مخزن گیت‌هاب مربوطه دسترسی داشته باشند.

گام بعدی شما

  • بررسی مدل ZGCM-1 در Hugging Face برای تست قابلیت‌های استدلال ریاضی در مقیاس کوچک.
  • مطالعه مستندات بهینه‌ساز FP8 Muon برای کاهش زمان آموزش در پروژه‌های شخصی.
  • آزمایش مدل در محیط‌های Agentic برای ارزیابی توانایی بازگشت (Backtracking) در حل مسائل پیچیده.

اما تأثیر این رویکرد بر کاهش هزینه‌های استنتاج در لبه، ابعاد جدیدی به رقابت مدل‌های کوچک می‌دهد — به تحلیل ما درباره‌ی رایانش لبه مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص تیم Zhongguancun در طراحی سیستم، ثابت می‌کند که معماری درست می‌تواند جایگزین مقیاس سخت‌افزاری شود. این موضوع هزینه استنتاج را برای کاربردهای تخصصی ریاضی و مهندسی به‌شدت کاهش می‌دهد.

تأثیر برای ایران

به دلیل وزن‌های باز (Open Weights)، توسعه‌دهندگان ایرانی می‌توانند این مدل را بدون نیاز به APIهای گران‌قیمت و تحریم‌شده، به‌صورت محلی استقرار دهند و از آن در ابزارهای آموزشی ریاضی استفاده کنند.

·نگاه ما
تحریریه دات‌هوش

جداسازی صریح «موتور استدلال» از «مخزن دانش» در ZGCM-1، پایان عصر مدل‌های همه‌کاره‌ی کوچک را تسریع می‌کند. به نظر ما، آینده‌ی SLMها نه در رقابت با LLMهای غول‌پیکر برای دانستن همه چیز، بلکه در تبدیل شدن به سیستم‌عامل‌های هوشمند است که ابزارهای خارجی را با دقت ریاضی مدیریت می‌کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.