پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Instella-MoE شرکت AMD رکوردهای عملکردی وزن‌های باز را جابه‌جا کرد

·۱۱ مرداد ۱۴۰۵۴ دقیقه مطالعه۲ بازدید
AMD مدل Instella-MoE-16B-A3B را منتشر کرد: یک مدل متن‌باز ترکیبی متخصص با ۲.۸ میلیارد پارامتر فعال، آموزش‌دیده روی پردازنده‌ه
AMD مدل Instella-MoE-16B-A3B را منتشر کرد: یک مدل متن‌باز ترکیبی متخصص با ۲.۸ میلیارد پارامتر فعال، آموزش‌دیده روی پردازنده‌ه
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تأیید عملیاتی زنجیره کامل (End-to-End) آموزش یک مدل کلاس جهانی روی سخت‌افزار غیر-NVIDIA و معرفی مکانیزم FarSkip-Collective برای کاهش چشم‌گیر تأخیر در سرویس‌دهی.

اگر به دنبال جایگزینی برای اکوسیستم‌های بسته و سخت‌افزارهای انحصاری هستید، AMD همین حالا یک نقشه راه عملی ارائه داده است. مدل Instella-MoE-16B-A3B با کسب میانگین ۷۶.۷ در بنچمارک‌های پایه، یک معیار جدید برای مدل‌های کاملاً باز ترکیب خبره‌ها (MoE) تعیین کرد و رقبایی چون Moonlight-16B-A3B (با امتیاز ۷۶.۲)، SmolLM3-3B-Base (۷۰.۵) و OLMo-3-7B (۷۰.۱) را پشت سر گذاشت.

طبق اعلام ROCm، این مدل به‌طور کامل از صفر روی پردازنده‌های گرافیکی AMD Instinct MI300X و MI325X آموزش دیده است. این دستاورد ثابت می‌کند که یک زنجیره سخت‌افزاری پایان-به-پایان (End-to-End) غیر-انویدیا برای آموزش مدل‌های سطح پیشرو (Frontier) کاملاً کارآمد و قابل اتکا است. این رویکرد یادآور تلاش‌های گسترده‌تر برای کاهش وابستگی به سخت‌افزارهای خاص است، مشابه آنچه در توسعه ابزارهای رایگانی چون ZML برای تسریع استنتاج در تراشه‌های متنوع مشاهده می‌کنیم. در حالی که ما پیش‌تر بررسی کردیم که چگونه مکانیزم‌های ابزار پیشرفته (مانند سیستم چهار لایه‌ای در Claude Code) مشکل قابلیت اطمینان را حل می‌کنند، AMD در اینجا بر بهره‌وری ساختاری خود مدل تمرکز کرده تا سربار استقرار در مقیاس بزرگ را کاهش دهد. برای تیم‌های فنی، این نشان‌دهنده تغییری به سمت معماری‌های بهینه‌شده و «فعال‌ساز پراکنده» (Sparsely Activated) است که هوشمندی بالا را بدون نیاز به محاسبات فعال عظیم حفظ می‌کنند.

این مدل برای آزمایشگاه‌های پژوهشی، گروه‌های دانشگاهی و تیم‌های تحقیق و توسعه (R&D) سازمانی طراحی شده است که به ظرفیت‌های مرکز داده (Data Center) دسترسی دارند و برای استارتاپ‌های کوچک که به دنبال APIهای تجاری و میزبان هستند، مناسب نیست.

در مورد قابلیت استقرار، وزن‌های مدل تحت مجوز ResearchRAIL منتشر شده‌اند که یعنی کاربرد آن تنها محدود به اهداف آکادمیک و پژوهشی است و نمی‌توان آن را به عنوان یک مدل تجاری آماده استفاده (Drop-in) به‌کار برد. با این حال، کدهای آموزش آن تحت لایسنس MIT در دسترس است، که این موضوع آن را به یک دارایی بسیار قابل استفاده برای کسانی تبدیل می‌کند که می‌خواهند دستورالعمل‌های آموزشی (Recipes) خاص خود را بسازند.

از نظر سخت‌افزاری، ۱۶ میلیارد پارامتر در دقت BF16 به حدود ۳۲ گیگابایت حافظه وزن نیاز دارد. این یعنی تنها یک شتاب‌دهنده با حافظه بالا برای سرویس‌دهی به مدل کافی است. AMD برای تسهیل این فرآیند، کدهای استنتاج (Inference) SGLang را ارائه داده است.

معماری این مدل از ساختار فقط-رمزگشا (Decoder-only) با ۲۷ لایه، اندازه پنهان (Hidden Size) ۲۰۴۸، ۱۶ سر توجه (Attention Heads) و واژگانی با ۱۲۸,۸۹۶ توکن استفاده می‌کند. با وجود ۱۶ میلیارد پارامتر کلی، به دلیل استفاده از ترکیب خبره‌ها (Mixture of Experts - MoE)، در هر توکن تنها ۲.۸ میلیارد پارامتر فعال می‌شوند. این کار از طریق ۲ خبره مشترک و ۶ خبره مسیریابی شده (که از یک استخر ۶۴ تایی انتخاب می‌شوند) انجام می‌شود.

دو نوآوری فنی کلیدی در این مدل وجود دارد:

  • توجه نهان چندسر گیت‌دار (Gated MLA): این مکانیزم یک گیت خروجی یادگیرنده و سبک به MLA می‌افزاید. یک تصویر خطی اختصاصی، یک گیت شرطی‌شده با ورودی ایجاد می‌کند که پیش از تصویر خروجی، به‌صورت ضربی اعمال می‌شود.
  • FarSkip-Collective: این سیستم فعال‌سازی‌های قدیمی و ناقص را به لایه‌های MoE و توجه می‌فرستد. این کار باعث هم‌پوشانی ارتباطات موازی خبره‌ها با محاسبات می‌شود که منجر به افزایش ۱۲.۷ درصدی سرعت پیش‌آموزش و کاهش ۳۹.۲ درصدی زمان تا نخستین توکن (TTFT) در هنگام سرویس‌دهی شده است.

AMD مدل Instella-MoE-16B-A3B را منتشر کرد: یک مدل متن‌باز ترکیبی متخصص با ۲.۸ میلیارد پارامتر فعال روی پردازنده‌های Instinct

بر اساس مستندات فنی، مراحل آموزش این مدل به شرح زیر است:

  • پیش‌آموزش: خط لوله آموزشی ۷.۱ تریلیون توکن از مجموعه‌های باز شامل Nemotron-CC-v2، MegaMath، FineMath، RefineCode و TxT360 را پوشش داد. در طول پیش‌آموزش و آموزش میانی، از هدف «پیش‌بینی چند-توکنی» (Multi-Token Prediction) استفاده شد. این پایداری در آموزش، با مکانیزم‌های پیشرفته‌ای مانند سیستم همگام‌سازی گره‌های جایگزین در زیرساخت‌های PyTorch بر بستر ROCm که زمان توقف آموزش را کاهش می‌دهد، تکمیل می‌شود.
  • آموزش میانی: در این مرحله از داده‌های Dolma3 Dolmino 100B در سه مدل مختلف داده استفاده شد که سپس از طریق میانگین‌گیری وزن‌ها ادغام شدند.
  • بسترهای متنی بلند: پنجره زمینه (Context Window) از ۴ هزار به ۶۴ هزار توکن گسترش یافت. این کار با استفاده از YaRN، افزایش مقدار تتا در RoPE و ماسک‌گذاری مستندات حاصل شد. نتیجه این تغییر، میانگین امتیاز ۴۱.۵ در HELMET و ۷۹.۴ در RULER برای متون بلند بود.
  • پس‌آموزش: مرحله SFT روی ترکیبی از Dolci-Think-SFT-7B و Nemotron اجرا شد و با یک مجموعه ۵۱۲ هزار نمونه‌ای مبتنی بر بازخورد به پایان رسید. سپس DPO اجرا شد که در آن به‌روزرسانی‌های بایاس مسیریاب صورت گرفت و همزمان Loss توازن بار کمکی غیرفعال شد. یادگیری تقویتی (RL) در چارچوب Miles از طریق ۱۴۰۰ گام RLVR و روش Multi-Teacher On-Policy Distillation اجرا گردید.

در تست‌های رودررو، نسخه «Think» این مدل با امتیاز ۷۳.۲۲، مدل‌های Olmo3-7B-Think (۷۱.۹۷)، Gemma-4-E4B think (۷۰.۴۷) و Qwen3.5-4B (۶۹.۷۳) را شکست داد. همچنین پس از پس‌آموزش، در آزمون HumanEval+ به امتیاز ۶۵.۷ و در IFEval به ۸۳.۷۰ رسید. مدل پایه نیز در آزمون WinoGrande با ۸۶.۵ پیشتاز بود، هرچند که در مقایسه با Qwen3.5-4B-Base (۷۹.۵) عقب‌تر است.

از منظر مهندسی، این عرضه «دستورالعمل» ساخت یک MoE کارآمد را تایید می‌کند. AMD با انتشار وزن‌های مربوط به هر مرحله از آموزش، جزئیات ترکیب داده‌ها و کدهای آموزش تحت لایسنس MIT، الگویی جامع برای بازتولید مدل‌های با کارایی بالا روی پشته ROCm ارائه کرده است.

گام بعدی شما

  • تیم‌های مهندسی باید کدهای استنتاج SGLang را بررسی کنند تا تأثیر FarSkip-Collective بر تأخیر (Latency) در محیط‌های عملیاتی خاص خود را بسنجند.
  • پژوهشگران می‌توانند از ساختار لایسنس MIT کدهای آموزش برای بهینه‌سازی مدل‌های تخصصی‌تر استفاده کنند.
  • ارزیابی مدل در سناریوهای Context-heavy با توجه به پنجره ۶۴ هزار توکنی توصیه می‌شود.

اما اثر این استقلال سخت‌افزاری بر قیمت‌گذاری آینده تراشه‌های AI حتی تکان‌دهنده‌تر است — به تحلیل ما درباره‌ی رقابت AMD و انویدیا در بازار دیتاسنترها مراجعه کنید.

چرا این موضوع مهم است؟

این مدل اعتبار سخت‌افزارهای AMD را در آموزش مدل‌های MoE به رسمیت می‌شناساند و وابستگی صنعت به یک تامین‌کننده واحد را کاهش می‌دهد. دسترسی به کد آموزش MIT-licensed، سرعت نوآوری در معماری‌های Sparse را برای کل جامعه پژوهشی بالا می‌برد.

تأثیر برای ایران

این خبر برای پژوهشگران مدل‌های بنیادی در ایران که به دلیل تحریم‌ها یا هزینه‌ها با محدودیت دسترسی به GPUهای خاص روبرو هستند، یک مسیر جایگزین برای استفاده از سخت‌افزارهای AMD بر پایه ROCm فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

این اقدام AMD فراتر از معرفی یک مدل جدید است؛ در واقع این یک «نمایش قدرت» برای اثبات این است که اکوسیستم ROCm اکنون توانایی رقابت با CUDA را در سطح آموزش مدل‌های پیشرو دارد. با باز کردن تمام مراحل آموزش و داده‌ها، AMD قصد دارد توسعه‌دهندگانی را جذب کند که از انحصاری بودن سخت‌افزاری انویدیا خسته شده‌اند و به دنبال جایگزینی استاندارد و باز هستند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.