پرش به محتوای اصلی
پرش به محتوای مقاله

درون فرآیند تبدیل GLM-5.3 به یک مدل متراکم برای محیط‌های بدون ابر

·۳ مهر ۱۴۰۵۴ دقیقه مطالعه
آلتار-۱: مدل امنیتی متن‌باز با ۳۲۸ گیگابایت، حاصل هرس‌شدن از جی‌ال‌ام-۵.۳ توسط آیکیدو سکیوریتی
آلتار-۱: مدل امنیتی متن‌باز با ۳۲۸ گیگابایت، حاصل هرس‌شدن از جی‌ال‌ام-۵.۳ توسط آیکیدو سکیوریتی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اثبات این موضوع که ۳۵٪ از خبره‌های یک مدل MoE عظیم را می‌توان بدون آموزش مجدد و با افت ناچیز در بازخوانی (Recall) هرس کرد تا مدل روی سخت‌افزار تک‌گره جای بگیرد.

استقرار مدل‌های پیشرو در شبکه‌های ایزوله (Air-gapped) معمولاً به خوشه‌های سخت‌افزاری عظیم یا انتقال ریسک‌پذیر داده‌ها به ابر نیاز دارد. اما Aikido Security با معرفی مدل Altar-1، این شکاف زیرساختی را پر کرده است. این مدل با فشرده‌سازی مدل عظیم GLM-5.3 از ۱۵۰۶.۷ گیگابایت به ۳۲۸ گیگابایت، امکان میزبانی شخصی (Self-hosting) را فراهم می‌کند.

این انتشار، یک نقطه اصطکاک بحرانی را برای بانک‌ها و اپراتورهای فناوری عملیاتی (OT) برطرف می‌کند؛ سازمان‌هایی که نمی‌توانند کد منبع، مستندات معماری یا یافته‌های امنیتی اصلاح‌نشده را به خارج از شبکه خود ارسال کنند. در حالی که مدل‌های با وزن‌های باز (Open-weight) معمولاً مشکل اقامت داده‌ها (Data Residency) را حل می‌کنند، معماری‌های ترکیب خبره‌ها (Mixture of Experts یا MoE) اغلب یک شکاف استقرار ایجاد می‌کنند؛ زیرا این معماری‌ها کاربر را مجبور می‌کنند تمام خبره‌ها را ذخیره کند، صرف‌نظر از اینکه در لحظه چه حجم از بار کاری فعال است.

چالش اقامت داده‌ها

زمینه امنیتی بسیار حساس است. مدل‌های پیشرو بسته (Closed Models) روی زیرساخت‌های شخص ثالث اجرا می‌شوند و برای سازمان‌هایی که تحت دستورات سخت‌گیرانه اقامت داده‌ها هستند، ریسک ایجاد می‌کنند. این نگرانی‌ها در حالی شدت می‌یابد که حفره‌های امنیتی در زیرساخت‌های مدیریت داده سازمانی همچنان یکی از چالش‌های جدی در مسیر حفاظت از اطلاعات حساس است. علاوه بر این، عامل‌های امنیتی زمینه‌های (Context) طولانی‌مدتی می‌سازند؛ در نتیجه، حافظه پنهان KV (KV cache) حاصل از این فرآیند برای فضای حافظه GPU با وزن‌های مدل رقابت می‌کند. همین موضوع باعث می‌شود فشرده‌سازی کارآمد برای قابلیت اجرا در محیط‌های On-premise ضروری باشد.

با تکیه بر پوشش قبلی ما درباره دستورالعمل‌های پیش‌آموزش با بهره‌وری محاسباتی، مدل Altar-1 بر فشرده‌سازی پس از آموزش (Post-training compression) تمرکز دارد تا مدل‌های با پارامترهای بالا روی سخت‌افزارهای محدود قابل اجرا کند. این مدل، «ماشین ایکیدو» (Aikido Machine) را تغذیه می‌کند؛ یک دستگاه تست نفوذ خودکار که برای شبکه‌های On-prem و ایزوله طراحی شده است. همچنین این مدل در ابزارهای Aikido Attack، تحلیل کد AI و Deep Review به کار می‌رود.

به نقل از گزارش فنی Marktechpost، تیم توسعه این کاهش حجم را از طریق یک فرآیند دو مرحله‌ای به دست آورده است:

خط لوله فشرده‌سازی

  • کوانتش (Quantization): فرآیند با نقطه بازرسی GLM-5.3-AWQ-INT4 آغاز شد. در این روش از وزن‌های ۴ بیتی برای خبره‌های مسیریابی (W4A16) با فعال‌سازهای ۱۶ بیتی استفاده شده است، در حالی که لایه‌های توجه (Attention)، خبره مشترک، لایه‌های متراکم (Dense layers) و سر مدل (Head) در حالت BF16 حفظ شده‌اند.
  • هرس کردن خبره‌ها (Expert Pruning): تیم توسعه با استفاده از متد Cerebras REAP (هرس فعال‌سازی خبره با وزن مسیریاب)، خبره‌ها را بر اساس وزن مسیریاب و بزرگی خروجی امتیازدهی کردند، نه صرفاً بر اساس دفعات انتخاب.

مدل Altar-1 تنها ۱۶۸ خبره از ۲۵۶ خبره اصلی در هر لایه را حفظ کرده و ۸۸ خبره (۳۴.۴٪) را بدون نیاز به هیچ‌گونه آموزش مجدد حذف نموده است. برای محافظت از خبره‌های متخصص در زمینه‌های کدنویسی، زبان‌های نادر و خروجی‌های ساختاریافته، هر خبره بر اساس بیشترین سهمش در کار مسیریابی هر دامنه واحد امتیازدهی شد. برای کالیبراسیون، از ردپاهای (Traces) مربوط به ابزار تست نفوذ ایکیدو، فراخوانی ابزارها (Tool calling)، استدلال، کدنویسی و متون ویکی‌پدیا به زبان‌های مختلف استفاده شد. شرکت صراحتاً اعلام کرد که در این فرآیند از هیچ داده‌ای متعلق به مشتریان استفاده نشده است.

دقت مدل و ابعاد

مدل Altar-1 نسبت به نسخه BF16 حدود ۷۸.۲٪ و نسبت به نسخه AWQ (والد خود) حدود ۳۲.۸٪ کوچک‌تر است. در یک مطالعه دقت عمومی با استفاده از یک پانل بسته شامل ۲۵ پرامپت، مدل Altar-1 واگرایی KL معادل ۰.۵۰۶ نات را نسبت به مدل کامل BF16 نشان داد. برای مقایسه، یک ساختار EXL3 از همین برش، امتیاز ۰.۵۱۱ را کسب کرد.

عملکرد و سخت‌افزار

بر اساس بررسی‌های داخلی روی یک محک CVE که ۳۲ آسیب‌پذیری شناخته‌شده در ۳۰ مخزن کد را پوشش می‌داد (با ۳ بار اجرا برای هر مورد)، Altar-1 به میانگین Recall (بازخوانی) ۶۰.۴٪ رسید. این عدد در مقایسه با ۶۱.۵٪ برای نسخه AWQ INT4 و ۶۵.۶٪ برای مدل کامل BF16، افت بسیار اندکی را نشان می‌دهد. نکته کلیدی این است که مدل جدید، پوشش ۲۳ مورد از ۲۵ آسیب‌پذیری شناسایی‌شده توسط مدل مادر را حفظ کرد که نشان‌دهنده نرخ حفظ ۹۲٪ است.

اگرچه این محک محدود است و بیشتر بر بازشناسی هدفمند CVEها تمرکز دارد تا کشف کور یا اعتبارسنجی اکسپلویت، اما Aikido گزارش داده است که Altar-1 در یک تست نفوذ واقعی روی محیط عملیاتی یک مشتری، یک آسیب‌پذیری با شدت بحرانی (Critical) را شناسایی کرده است.

مشخصات استقرار

برای اجرای این مدل به GPUهای سری Hopper انویدیا نیاز است. یک گره شامل ۴ عدد H200 حافظه کافی برای ۳۲۸ گیگابایت وزن‌ها و یک KV Cache با پنجره زمینه ۱۲۸ هزار توکنی در اندازه‌های دسته‌ای (Batch sizes) تولیدی را فراهم می‌کند. در مقابل، یک گره ۴ عددی H100 با ۸۰ گیگابایت حافظه (۳۲۰ گیگابایت کل)، حتی برای بارگذاری وزن‌ها به تنهایی ناکافی است.

متخصصان می‌توانند این مدل را از طریق vLLM مستقر کنند که به‌طور خودکار کرنل Marlin MoE را انتخاب می‌کند:
vllm serve AikidoSec/altar-1 --tensor-parallel-size 4 --trust-remote-code --max-model-len 131072

این تغییر در استراتژی استقرار، این فرض را که عامل‌های امنیتی با دقت بالا حتماً به زیرساخت‌های در مقیاس ابری نیاز دارند، تغییر می‌دهد. Aikido با اثبات اینکه نزدیک به ۳۵٪ از خبره‌های MoE را می‌توان با حداقل افت بازخوانی هرس کرد، نشان داد که مدل‌های امنیتی تخصصی را می‌توان برای لبه (Edge) «اندازه مناسب» (Right-sized) کرد، بدون آنکه توان استدلالی مدل مادر ۷۵۳ میلیارد پارامتری (که در هر توکن از حدود ۴۰ میلیارد پارامتر فعال استفاده می‌کند) از دست برود.

برای متخصصان فنی، این یعنی دستگاه‌های تست نفوذ خودکار اکنون می‌توانند کاملاً درون‌سازمانی و بدون تأخیر یا ریسک‌های امنیتی API اجرا شوند. این مدل از مجوز GLM-5.3 پیروی می‌کند که اجازه استفاده تجاری و توزیع مجدد را می‌دهد، به شرطی که شرکت‌هایی با درآمد بیش از ۱۰ میلیارد دلار در ۱۲ ماه گذشته، بررسی امنیتی Z.AI را بگذرانند. لازم به ذکر است که Altar-1 یک مدل با وزن‌های باز است و نه لزوماً متن‌باز (Open Source) طبق استانداردهای OSI.

Aikido قصد دارد در آینده با استفاده از فرمت‌های کم‌بیت‌تر مانند EXL3، تعداد خبره‌های بیشتری را حفظ کرده و نسخه‌های بعدی را به‌طور اختصاصی برای گردش‌کارهای امنیتی تنظیم دقیق (Fine-tuning) کند.

گام بعدی شما

  • اگر در محیط‌های حساس امنیتی فعالیت می‌کنید، مدل Altar-1 را برای جایگزینی APIهای ابری در تحلیل کد بررسی کنید.
  • برای استقرار، حتماً از گره‌های H200 استفاده کنید تا فضای کافی برای KV Cache در پنجره‌های متنی بزرگ داشته باشید.
  • مستندات vLLM را برای بهینه‌سازی کرنل Marlin در مدل‌های MoE مطالعه کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص در فشرده‌سازی مدل، استقرار هوش مصنوعی در محیط‌های فوق‌حساس (مانند نظامی و بانکی) را ممکن می‌کند. در نتیجه، وابستگی سازمان‌های حساس به زیرساخت‌های ابری خارجی برای تحلیل‌های امنیتی به شدت کاهش می‌یابد.

تأثیر برای ایران

به‌دلیل نیاز به سخت‌افزار گران‌قیمت H200، استقرار این مدل برای اکثر شرکت‌های ایرانی دشوار است، اما برای پژوهشگران مدل‌های بنیادی، متد REAP راهکاری کاربردی برای بهینه‌سازی مدل‌های بزرگ روی منابع محدود است.

·نگاه ما
تحریریه دات‌هوش

هرس کردن خبره‌ها در معماری MoE بدون نیاز به آموزش مجدد، نشان می‌دهد که بخش بزرگی از پارامترهای مدل‌های غول‌پیکر در دامنه‌های تخصصی، عملاً زائد هستند. این رویکرد احتمالاً مسیر توسعه مدل‌های «به‌اندازه» (Right-sized) را باز می‌کند که در آن به جای کوچک کردن کل مدل، تنها بخش‌های غیرضروری از تخصص‌های مدل حذف می‌شوند تا استدلال سطح بالا حفظ شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.