آموزش مدلهایی با تریلیونها پارامتر دیگر انحصاری آزمایشگاههایی با خوشههای ۱۰۰ هزار تراشهای نیست. شرکت Magic دستورالعملی برای پیشآموزش (Pretraining) ارائه کرده است که بیش از ۱۰ برابر بهینهتر از مدلهای پایه با وزنهای باز (Open Weights) است و عملاً قابلیتهای پیشرو را از بودجههای سختافزاری عظیم جدا میکند.
برای سالها، صنعت بر این فرض استوار بود که قوانین مقیاسپذیری (Scaling Laws) برای رسیدن به سطح بعدی هوش، نیازمند افزایش خطی یا نمایی در محاسبات (Compute) است. این دوران «زور بازو» تنها به نفع چند غول فناوری بود. رویکرد Magic تمرکز را از حجم سختافزار به بهرهوری الگوریتمی تغییر میدهد تا بتواند عاملهای کدنویسی فوقبشری و تحقیق و توسعه (R&D) خودکار در هوش مصنوعی خلق کند.
طبق بهروزرسانی فنی منتشر شده در ۸ سپتامبر ۲۰۲۶، این تیم توانسته است با استفاده از تقریباً ۵۰ برابر FLOPs (عملیات اعشاری در ثانیه) کمتر، به برابری با مدل DeepSeek V4 Pro Base برسد. این رقم به معنای بودجهای در حدود ۰.۵ میلیون دلار روی سختافزار GB200 است؛ یعنی تقریباً نیمی از کل محاسبات بهکاررفته برای آموزش GPT-3.

شکاف بهرهوری
به نقل از مستندات Magic، بهرهوری این مدلها با استفاده از معیار زیان bits-per-byte (bpb) روی دادههای خارج از مجموعه سنجیده شده است؛ معیاری که تفاوتهای میان توکنسازها (Tokenizers) را خنثی میکند. این روش از حساسیت به پرامپت و عدم قطعیت ارزیابیهای مبتنی بر نمونهبرداری که در مدلهای پایه رایج است، فاصله میگیرد.
نتایج در حوزههای مختلف، برتری مستمر Magic را نشان میدهد. در مورد مخازن کد خصوصی، مدل V5 e24 به عدد ۰.۱۹۴ bpb رسید. این نتیجه از DeepSeek V4 Pro (۰.۲۰۲ bpb)، Kimi K2 (۰.۲۰۵ bpb) و Nemotron 3 Ultra (۰.۲۰۳ bpb) پیشی گرفت.
در بررسی مقالات پژوهشی، مدل V5 e24 به عدد ۰.۳۸۳ bpb دست یافت. این رقم بهطور قابلتوجهی کمتر از DeepSeek V4 Pro (۰.۴۰۴ bpb)، Kimi K2 (۰.۴۲۱ bpb) و Nemotron 3 Ultra (۰.۴۰۶ bpb) است.
در شدیدترین شکاف، دستورالعمل Magic برای استدلال روی مسائل ریاضی، ۱۲۷ برابر بهینهتر از DeepSeek V4 Pro بود. مدل V5 e24 در این دسته به ۰.۵۸۷ bpb رسید، در حالی که این عدد برای DeepSeek V4 Pro برابر با ۰.۶۷۸ bpb و برای Nemotron 3 Ultra برابر با ۰.۶۱۹ bpb بود.
همانطور که در تحلیلهای پیشین ما دربارهی بهینهسازی مدلهای بازمتن اشاره کردیم، کاهش وابستگی به سختافزار، کلید دموکراتیزه کردن هوش مصنوعی است.
پیشبینیهای مقیاس و هزینه
وقتی Magic محاسبات خود را ۱۰ برابر دیگر افزایش داد (حدود ۴ میلیون دلار)، مدلهای آنها در ارزیابیهای perplexity (پراکندگی) بهطور معناداری از تمام مدلهای پایه بازِ موجود پیشی گرفتند. این شرکت اشاره میکند که برای رسیدن به همین سطح از قابلیتها با دستورالعمل DeepSeek V4 Pro، بیش از ۱۰۰ میلیون دلار هزینه میشد، بدون اینکه چالش دسترسی به دادهها را در نظر بگیریم.
برای تایید این خطوط پایه، Magic مقادیر logprobs مدلهای باز را با استفاده از vLLM و SGLang روی سختافزارهای GB200 و GB300 ارزیابی کرد. آنها همچنین با Fireworks برای تایید logprobs در یک موتور استنتاج (Inference) داخلی همکاری کردند.
نکته جالب این است که تیم Magic دریافت Nemotron 3 Ultra در تمامی زمینهها از DeepSeek V4 Pro بهتر عمل میکند. این موضوع نشان میدهد عملکرد ضعیفتر Nemotron در بنچمارکهای پس از RL (یادگیری تقویتی)، احتمالاً ناشی از پسآموزش (Post-training) نامناسب است، نه ضعف در بنیاد پیشآموزش. تیم همچنین اشاره کرد که مدلهای Kimi K3 و Muse Spark متعلق به Meta، به ترتیب پیشرفتهایی معادل ۲.۵ و ۳.۳ برابر نسبت به Kimi K2 نشان میدهند.
عملکرد در حوزههای تخصصی
برای شناسایی شکافهای مجموعهداده، Magic ارزیابیهای خود را به تفکیک موضوع تجزیه کرد. آنها برای جلوگیری از پاداش دادن به «حفظ کردن توالیها»، اسناد را با استفاده از یک مدل زبانی بزرگ پیشرو (Third-party frontier LLM) بازنویسی یا خلاصه کردند.
بهرهوری در حوزههای پژوهشی:
- علوم کامپیوتر: مدل V5 e24 به ۰.۴۰۰ bpb رسید که ۱۲۰ برابر بهینهتر از DeepSeek V4 Pro است. مدل V5 e21 از ۰.۵۴۸ bpb شروع کرد، V5 e22 به ۰.۴۸۱ bpb و V5 e23 به ۰.۴۲۵ bpb رسید.
- مهندسی: مدل V5 e24 با ۰.۳۸۳ bpb، ۴۸ برابر بهینهتر از رقیب خود بود. مدل V5 e21 از ۰.۵۱۷ bpb شروع کرد، V5 e22 به ۰.۴۵۶ bpb و V5 e23 به ۰.۴۰۵ bpb رسید.
- ریاضیات: مدل V5 e24 به ۰.۳۴۲ bpb رسید که ۲۱ برابر بهینهتر از DeepSeek V4 Pro است. مدل V5 e21 از ۰.۴۹۲ bpb شروع کرد، V5 e22 به ۰.۴۲۶ bpb و V5 e23 به ۰.۳۶۷ bpb رسید.
- فیزیک: مدل V5 e24 با ۰.۴۰۶ bpb، ۲۹ برابر بهینهتر عمل کرد. مدل V5 e21 از ۰.۵۵۲ bpb شروع کرد، V5 e22 به ۰.۴۸۷ bpb و V5 e23 به ۰.۴۳۱ bpb رسید.
تعمیمپذیری و دانش
ارزیابیهای کد Magic از کدبیس خودشان و کدهای خصوصی خریداریشده از استارتاپهای دیگر استفاده کرد. برای استدلال، آنها از Kimi K3 برای تولید walkthroughهای زنجیره تفکر (Chain-of-Thought) برای مسائل ریاضی خصوصی استفاده کردند.
برای تضمین تعمیمپذیری سختگیرانه، آنها کدهای متنباز (OSS) و هر سندی که دارای یک پنجره ۹۶ کاراکتری از متن نرمالشده یا شباهت Jaccard بالاتر از یک آستانه حساس در مقایسه با دادههای آموزش بود را حذف کردند.
Magic بهطور عمدی برخی حوزهها را برای اولویت دادن به کدنویسی و R&D کنار گذاشت تا تعادل در ترکیب دادهها برقرار شود. این حوزههای کماولویت عبارتند از:
- اخبار محلی
- دانش عمومی جهان
- حقوق
- حقایق درباره افراد مشهور
- ورزش و رویدادها
آنها برخی موارد استثنا در دانش جهانی مشاهده کردند، بهویژه در پزشکی و سلامت، جایی که Nemotron اعداد و عبارات خاصی را چنان مؤثر حفظ کرده بود که حتی پس از بازنویسی توسط LLM، آنها را بهخوبی پیشبینی میکرد.
مسیر رسیدن به پایداری
این پیشرفت آنی نبود. در اواخر ۲۰۲۴، تیم یک مدل متراکم کوچک با معماری مخصوص پنجرههای زمینه (Context Windows) بسیار بلند آموزش داد، اما مقیاسهای اولیه پیشآموزش بهکرات دچار فروپاشی (Blow up) میشدند.
آنها ماهها روی ساخت یک بنیاد پایدار متمرکز شدند که شامل موارد زیر بود:
- همگرایی نرم (Smooth convergence)
- کیفیت آموزش با دقت پایین معادل FP32
- زیرساخت سریع و پایدار
- قوانین درست مقیاسدهی ابرپارامترها (Hyperparameters)
- شکار تهاجمی باگها
موفقیت فعلی آنها نتیجه ضربدر شدن دهها تغییر کوچک در معماری مدل، بهینهسازها، اهداف آموزش و سازماندهی دادهها است. آنها از «NanoGPT speedruns» برای بازخورد سریع استفاده کردند، هرچند اشاره کردند که بهبودهای مدلهای بسیار کوچک همیشه به مدلهای مقیاسبزرگ منتقل نمیشود. همچنین دریافتند برخی ویژگیهای موجود در اکثر LLMها را میتوان بدون آسیب به عملکرد مقیاسبزرگ حذف کرد.
برای ارزیابی تغییرات، آنها سه مدل در دو مرتبه بزرگی محاسباتی آموزش میدهند. یک تغییر تنها زمانی پذیرفته میشود که برازش قانون توان (Power law fit) نشان دهد در مقیاس بزرگ کمککننده خواهد بود. آنها هر چند هفته یک بار تا ۱/۱۰ مقیاس نهایی (Hero scale) پیش میرفتند و اجراهای کامل (V3, V4, V5) هر چند ماه یک بار رخ میداد.
پیشرفت آنها خیرهکننده است: V2 خط پایه بود، V3 در اوایل ۲۰۲۶، V4 در جولای ۲۰۲۶ و V5 در سپتامبر ۲۰۲۶ رسید. در V5، آنها به بهرهوری ۵۰۵ برابری نسبت به V2 دست یافتند.
از پیشآموزش تا استدلال
برای تایید اینکه بهرهوری پیشآموزش به عملکرد واقعی تبدیل میشود، Magic یک اجرای کوتاه RL ریاضی با بودجه ۱۶ هزار توکنی زنجیره تفکر (CoT) انجام داد. تمام RLها مستقیماً از مدل پایه و بدون SFT یا distillation شروع شدند.
مدل V5 (e24) به نرخ پذیرش ۷۲٪ در مسائل ریاضی مسابقاتی دست یافت. این عملکرد تنها با استفاده از ۰.۲٪ از بودجه محاسباتی پیشآموزش مدل به دست آمد.
برای مقایسه، نرخ pass@1 مدل V5 (e24) در AIME26 از ۹۰٪ گذشت (و pass@16 به ۱۰۰٪ رسید). این نتیجه در فاز RL با مصرف کم محاسبات و بهطور متوسط ۶ هزار توکن CoT به دست آمد. این تست روی یک ارزیابی ریاضی مسابقاتی خصوصی با ۴۰۰ مسئله انجام شد که سختتر از AIME است تا از آلودگی دادهها (Contamination) که در مدلهای شخص ثالث دیده میشود، جلوگیری شود.
در چشمانداز کلی RL، مدل V5 با نرخ ۷۲٪ از Nemotron 3 (۲۷٪) پیشی گرفت، در حالی که پشت سر مدلهایی مثل Kimi K3 (۷۵٪) و DeepSeek V4 Pro (۶۵٪) در پیکربندیهای مختلف قرار داشت؛ هرچند محاسبات RL در Magic بهطور قابلتوجهی کمتر بود. سایر بنچمارکها شامل GPT-6 Astra (۱۰۰٪)، Claude 5.1 (۹۸٪)، Muse Spark 1.3 (۸۸٪)، Gemini 3.8 (۸۳٪)، Grok 4.6 (۷۱٪)، Inkling (۵۰٪)، Qwen 3.8 (۴۵٪) و GLM-5.3 (۴۵٪) بود.
تحلیل: بازتعریف خندق محاسباتی
این پیشرفت بهطور بنیادی نظریه «خندق محاسباتی» (Compute Moat) را به چالش میکشد. اگر یک تیم کوچک بتواند با ۵۰ برابر محاسبات کمتر به مدلهای پایه پیشرو برسد، مزیت رقابتی خوشههای عظیم GPU در برابر نبوغ الگوریتمی کاهش مییابد.
شرکت Magic محاسبات را با تقریب 6·N·D گزارش میکند (که در آن N تعداد پارامترهای فعال و D تعداد توکنهای پیشآموزش است) تا از حدس زدن هزینههای ابعاد توالی اجتناب کند. عدد «۶» از فرمول (add+mul) * (fwd+bwd*2) به دست آمده است.
برای درک بهتر، مقادیر 6·N·D FLOPs برای مدلهای کلیدی عبارتند از:
- DeepSeek V4 Pro: ۴۸.۸ میلیارد پارامتر، ۳۳ تریلیون توکن (9.67e24 FLOPs)
- DeepSeek V4 Flash: ۱۳.۲ میلیارد پارامتر، ۳۲ تریلیون توکن (2.55e24 FLOPs). این مدل در کنار بهینهسازیهای پیشآموزش، در کاهش چشمگیر اشغال حافظه KV Cache نیز پیشرو بوده است تا استنتاج را سریعتر کند.
- Kimi K2: ۳۱.۶ میلیارد پارامتر، ۱۵.۵ تریلیون توکن (2.95e24 FLOPs)
- Nemotron 3 Ultra: ۵۵ میلیارد پارامتر، ۲۰ تریلیون توکن (6.60e24 FLOPs)
- Magic V4: 1.91e24 FLOPs
- Magic V5 (e24): 1.63e24 FLOPs
- Magic V5 (e23): 1.58e23 FLOPs
- Magic V5 (e22): 1.12e22 FLOPs
- Magic V3: 3.85e24 FLOPs
- Magic V2: 7.20e23 FLOPs
برای جامعه فنی، این موضوع نشان میدهد که مدلهای وزنباز فعلی ممکن است بهطور قابلتوجهی بیش از حد آموزش دیده (Over-trained) یا دارای معماری ناکارآمد باشند. تغییر به سمت «محاسبات مؤثر» — جایی که کیفیت دستورالعمل بر کمیت FLOPs برتری دارد — میتواند آموزش مدلهای تریلیون پارامتری را دموکراتیزه کند.
گامهای بعدی
شرکت Magic اکنون تمرکز خود را به سمت مقیاسدهی RL با افق زمانی بلند (Long-horizon RL) و توسعه تکنیکهای آموزش ترازسازی (Alignment) با ویژگیهای نظری مستحکم تغییر داده است. آنها بهطور خاص روی موارد زیر کار میکنند:
- اکتشاف و تخصیص اعتبار (Credit assignment) در RL با افق بلند
- کارهای سیستمی برای مقیاسدهی RL با افق بلند
- آموزش ترازسازی در برابر دانش نهفتهای که بهطور محدود استخراج شده است
- بهبودهای بیشتر در پیشآموزش
آنها معتقدند که پیشآموزش، RL عاملمحور (Agentic RL) و زمینه بلند (Long-context)، ستونهای کافی برای ساخت عاملهای کدنویسی فوقبشری و خودکارسازی R&D در هوش مصنوعی هستند. منتظر انتشار مدل آنها و بهروزرسانی «سیاست آمادگی AGI» باشید که گیتهای استقرار و الزامات ایمنی در طول آموزش RL را پوشش میدهد.
گام بعدی شما
- بررسی متدولوژیهای کاهش FLOPs برای بهینهسازی هزینههای آموزش مدلهای تخصصی.
- دنبال کردن انتشار مدل V5 و سیاست آمادگی AGI شرکت Magic برای ارزیابی گیتهای استقرار.
- تحلیل اثر حذف دادههای «دانش عمومی» بر روی تخصص مدل در حوزههای STEM.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو