پرش به محتوای اصلی
پرش به محتوای مقاله

مدل EMO و معماری MoE؛ حفظ عملکرد کامل با حذف ۸۷.۵٪ از متخصصان

·۲۶ اردیبهشت ۱۴۰۵۳ دقیقه مطالعه
مدل EMO و معماری MoE؛ حفظ عملکرد کامل با حذف ۸۷.۵٪ از متخصصان
اشتراک‌گذاری

تصور کنید ۸۷.۵٪ از تخصص‌های یک مدل زبانی را حذف کنید و باز هم کیفیت پاسخ‌ها تغییر نکند. این ادعای جسورانه، محور اصلی انتشار مدل EMO در ۱۶ مه ۲۰۲۶ توسط مؤسسه Allen برای هوش مصنوعی (Allen Institute for AI) و دانشگاه برکلی است.

معماری مجموعه‌ای از متخصصان (Mixture-of-Experts یا MoE) که در مدل‌هایی مانند DeepSeek-V4 به کار رفته، اجازه می‌دهد پارامترها بدون انفجار هزینه‌های محاسباتی مقیاس‌پذیر شوند. با این حال، این مدل‌ها معمولاً از «مسیریابی کم‌عمق» رنج می‌برند؛ به این معنا که متخصصان به‌جای موضوعات، به علائم نگارشی یا حروف اضافه واکنش نشان می‌دهند و همین امر باعث می‌شود برای هر تکلیف ساده، کل مدل باید در حافظه باقی بماند. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی مدل‌های MoE اشاره کردیم، این وابستگی به حافظه، گلوگاه اصلی استقرار مدل‌های بزرگ است.

طبق اعلام پژوهشگران، EMO این مشکل را با استفاده از «مرزهای سند» به عنوان سیگنال آموزشی حل کرده است تا توکن‌های درون یک سند مجبور شوند از یک استخر مشترک از متخصصان استفاده کنند. بر اساس گزارش the-decoder.com، این مدل با ۱ تریلیون توکن و ۱۴ میلیارد پارامتر کل (۱ میلیارد پارامتر فعال) در ۱۲۸ متخصص آموزش دیده است.

Bar chart comparing benchmark results for EMO and a standard MoE at full and reduced expert counts (base model).

Bar chart of GSM8K results for EMO and a standard MoE at different expert counts per layer.

داده‌های فنی این مدل نشان می‌دهد:

  • با استفاده از تنها ۱۲.۵٪ از متخصصان (۱۶ مورد از ۱۲۸ مورد)، افت عملکرد EMO تنها ۳ واحد است، در حالی که مدل‌های MoE استاندارد ۱۰ تا ۱۵ واحد سقوط می‌کنند.
  • در بنچمارک ریاضی GSM8K، زیرمجموعه ۱۲.۵ درصدی نمره ۱۲.۲ را کسب کرد که حتی از نمره ۱۲.۰ مدل کامل نیز بالاتر است.

Routing comparison: standard MoE with independently selected experts per token (left) vs. EMO with a document-wide restricted expert pool (right).

Visualization of token clusters from router activations: EMO with semantic domains like health and politics (left) vs. standard MoE with syntactic clusters like prepositions (right).

تحلیلگران دریافته‌اند که در حالی که MoEهای استاندارد بر اساس «نوع کلمه» خوشه‌بندی می‌شوند، EMO بر اساس دامنه‌های معنایی مانند سلامت، سیاست و موسیقی سازمان‌دهی شده است. این ماژولار بودن، نحوه استقرار مدل‌ها در محیط‌های با حافظه محدود را تغییر می‌دهد؛ توسعه‌دهندگان اکنون می‌توانند به‌جای بارگذاری یک مدل یکپارچه، تنها متخصصان «ریاضی» یا «کدنویسی» را فراخوانی کنند. علاوه بر این، این ساختار یک اهرم امنیتی جدید ایجاد می‌کند: امکان غیرفعال کردن خوشه‌های تخصصی مرتبط با محتوای مضر، بدون نیاز به بازآموزی کل سیستم.

Diagram showing how domain-specific subsets of experts (math, code, biomedical) can be selected from the full EMO model.

Line chart of average MMLU accuracy vs. memory budget for EMO, standard MoE, and fixed baselines.

گام بعدی شما

  • کد آموزش و وزن‌های مدل را در Hugging Face و GitHub بررسی کنید.
  • از دموی آنلاین تعاملی برای تحلیل الگوهای فعال‌سازی توکن‌ها استفاده کنید.
  • اگر در محیط‌های Edge فعالیت می‌کنید، استراتژی بارگذاری انتخابی متخصصان را در معماری خود تست کنید.

اما چالش بعدی، انتقال این مدل‌ها به سخت‌افزارهای لبه است — به بررسی ما درباره‌ی رایانش لبه (Edge Computing) مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با کاهش شدید نیاز به حافظه گرافیکی (VRAM)، استقرار مدل‌های بزرگ را در محیط‌های محدود ممکن می‌سازد. همچنین، امکان غیرفعال کردن خوشه‌های تخصصی مرتبط با محتوای مضر، لایه‌ی جدیدی از امنیت را بر اساس اعتبار ساختاری مدل فراهم می‌کند.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.