اگر به دنبال جایگزینی برای اکوسیستمهای بسته و سختافزارهای انحصاری هستید، AMD همین حالا یک نقشه راه عملی ارائه داده است. مدل Instella-MoE-16B-A3B با کسب میانگین ۷۶.۷ در بنچمارکهای پایه، یک معیار جدید برای مدلهای کاملاً باز ترکیب خبرهها (MoE) تعیین کرد و رقبایی چون Moonlight-16B-A3B (با امتیاز ۷۶.۲)، SmolLM3-3B-Base (۷۰.۵) و OLMo-3-7B (۷۰.۱) را پشت سر گذاشت.
طبق اعلام ROCm، این مدل بهطور کامل از صفر روی پردازندههای گرافیکی AMD Instinct MI300X و MI325X آموزش دیده است. این دستاورد ثابت میکند که یک زنجیره سختافزاری پایان-به-پایان (End-to-End) غیر-انویدیا برای آموزش مدلهای سطح پیشرو (Frontier) کاملاً کارآمد و قابل اتکا است. این رویکرد یادآور تلاشهای گستردهتر برای کاهش وابستگی به سختافزارهای خاص است، مشابه آنچه در توسعه ابزارهای رایگانی چون ZML برای تسریع استنتاج در تراشههای متنوع مشاهده میکنیم. در حالی که ما پیشتر بررسی کردیم که چگونه مکانیزمهای ابزار پیشرفته (مانند سیستم چهار لایهای در Claude Code) مشکل قابلیت اطمینان را حل میکنند، AMD در اینجا بر بهرهوری ساختاری خود مدل تمرکز کرده تا سربار استقرار در مقیاس بزرگ را کاهش دهد. برای تیمهای فنی، این نشاندهنده تغییری به سمت معماریهای بهینهشده و «فعالساز پراکنده» (Sparsely Activated) است که هوشمندی بالا را بدون نیاز به محاسبات فعال عظیم حفظ میکنند.
این مدل برای آزمایشگاههای پژوهشی، گروههای دانشگاهی و تیمهای تحقیق و توسعه (R&D) سازمانی طراحی شده است که به ظرفیتهای مرکز داده (Data Center) دسترسی دارند و برای استارتاپهای کوچک که به دنبال APIهای تجاری و میزبان هستند، مناسب نیست.
در مورد قابلیت استقرار، وزنهای مدل تحت مجوز ResearchRAIL منتشر شدهاند که یعنی کاربرد آن تنها محدود به اهداف آکادمیک و پژوهشی است و نمیتوان آن را به عنوان یک مدل تجاری آماده استفاده (Drop-in) بهکار برد. با این حال، کدهای آموزش آن تحت لایسنس MIT در دسترس است، که این موضوع آن را به یک دارایی بسیار قابل استفاده برای کسانی تبدیل میکند که میخواهند دستورالعملهای آموزشی (Recipes) خاص خود را بسازند.
از نظر سختافزاری، ۱۶ میلیارد پارامتر در دقت BF16 به حدود ۳۲ گیگابایت حافظه وزن نیاز دارد. این یعنی تنها یک شتابدهنده با حافظه بالا برای سرویسدهی به مدل کافی است. AMD برای تسهیل این فرآیند، کدهای استنتاج (Inference) SGLang را ارائه داده است.
معماری این مدل از ساختار فقط-رمزگشا (Decoder-only) با ۲۷ لایه، اندازه پنهان (Hidden Size) ۲۰۴۸، ۱۶ سر توجه (Attention Heads) و واژگانی با ۱۲۸,۸۹۶ توکن استفاده میکند. با وجود ۱۶ میلیارد پارامتر کلی، به دلیل استفاده از ترکیب خبرهها (Mixture of Experts - MoE)، در هر توکن تنها ۲.۸ میلیارد پارامتر فعال میشوند. این کار از طریق ۲ خبره مشترک و ۶ خبره مسیریابی شده (که از یک استخر ۶۴ تایی انتخاب میشوند) انجام میشود.
دو نوآوری فنی کلیدی در این مدل وجود دارد:
- توجه نهان چندسر گیتدار (Gated MLA): این مکانیزم یک گیت خروجی یادگیرنده و سبک به MLA میافزاید. یک تصویر خطی اختصاصی، یک گیت شرطیشده با ورودی ایجاد میکند که پیش از تصویر خروجی، بهصورت ضربی اعمال میشود.
- FarSkip-Collective: این سیستم فعالسازیهای قدیمی و ناقص را به لایههای MoE و توجه میفرستد. این کار باعث همپوشانی ارتباطات موازی خبرهها با محاسبات میشود که منجر به افزایش ۱۲.۷ درصدی سرعت پیشآموزش و کاهش ۳۹.۲ درصدی زمان تا نخستین توکن (TTFT) در هنگام سرویسدهی شده است.

بر اساس مستندات فنی، مراحل آموزش این مدل به شرح زیر است:
- پیشآموزش: خط لوله آموزشی ۷.۱ تریلیون توکن از مجموعههای باز شامل Nemotron-CC-v2، MegaMath، FineMath، RefineCode و TxT360 را پوشش داد. در طول پیشآموزش و آموزش میانی، از هدف «پیشبینی چند-توکنی» (Multi-Token Prediction) استفاده شد. این پایداری در آموزش، با مکانیزمهای پیشرفتهای مانند سیستم همگامسازی گرههای جایگزین در زیرساختهای PyTorch بر بستر ROCm که زمان توقف آموزش را کاهش میدهد، تکمیل میشود.
- آموزش میانی: در این مرحله از دادههای Dolma3 Dolmino 100B در سه مدل مختلف داده استفاده شد که سپس از طریق میانگینگیری وزنها ادغام شدند.
- بسترهای متنی بلند: پنجره زمینه (Context Window) از ۴ هزار به ۶۴ هزار توکن گسترش یافت. این کار با استفاده از YaRN، افزایش مقدار تتا در RoPE و ماسکگذاری مستندات حاصل شد. نتیجه این تغییر، میانگین امتیاز ۴۱.۵ در HELMET و ۷۹.۴ در RULER برای متون بلند بود.
- پسآموزش: مرحله SFT روی ترکیبی از Dolci-Think-SFT-7B و Nemotron اجرا شد و با یک مجموعه ۵۱۲ هزار نمونهای مبتنی بر بازخورد به پایان رسید. سپس DPO اجرا شد که در آن بهروزرسانیهای بایاس مسیریاب صورت گرفت و همزمان Loss توازن بار کمکی غیرفعال شد. یادگیری تقویتی (RL) در چارچوب Miles از طریق ۱۴۰۰ گام RLVR و روش Multi-Teacher On-Policy Distillation اجرا گردید.
در تستهای رودررو، نسخه «Think» این مدل با امتیاز ۷۳.۲۲، مدلهای Olmo3-7B-Think (۷۱.۹۷)، Gemma-4-E4B think (۷۰.۴۷) و Qwen3.5-4B (۶۹.۷۳) را شکست داد. همچنین پس از پسآموزش، در آزمون HumanEval+ به امتیاز ۶۵.۷ و در IFEval به ۸۳.۷۰ رسید. مدل پایه نیز در آزمون WinoGrande با ۸۶.۵ پیشتاز بود، هرچند که در مقایسه با Qwen3.5-4B-Base (۷۹.۵) عقبتر است.
از منظر مهندسی، این عرضه «دستورالعمل» ساخت یک MoE کارآمد را تایید میکند. AMD با انتشار وزنهای مربوط به هر مرحله از آموزش، جزئیات ترکیب دادهها و کدهای آموزش تحت لایسنس MIT، الگویی جامع برای بازتولید مدلهای با کارایی بالا روی پشته ROCm ارائه کرده است.
گام بعدی شما
- تیمهای مهندسی باید کدهای استنتاج SGLang را بررسی کنند تا تأثیر FarSkip-Collective بر تأخیر (Latency) در محیطهای عملیاتی خاص خود را بسنجند.
- پژوهشگران میتوانند از ساختار لایسنس MIT کدهای آموزش برای بهینهسازی مدلهای تخصصیتر استفاده کنند.
- ارزیابی مدل در سناریوهای Context-heavy با توجه به پنجره ۶۴ هزار توکنی توصیه میشود.
اما اثر این استقلال سختافزاری بر قیمتگذاری آینده تراشههای AI حتی تکاندهندهتر است — به تحلیل ما دربارهی رقابت AMD و انویدیا در بازار دیتاسنترها مراجعه کنید.




گفتگو