پرش به محتوای اصلی
پرش به محتوای مقاله

دست‌وردهٔ پیش‌آموزش Magic هزینهٔ محاسباتی مدل‌های باز را ۱۰ برابر کاهش داد

·۱۹ شهریور ۱۴۰۵۱۰ دقیقه مطالعه
پیش‌آموزی بیش از ۱۰ برابر کارآمدتر — جادو
پیش‌آموزی بیش از ۱۰ برابر کارآمدتر — جادو
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جداسازی قابلیت‌های مدل از حجم محاسبات؛ Magic ثابت کرد که می‌توان با ۵۰ برابر FLOPs کمتر، به عملکرد مدل‌های پایه پیشرو رسید، که این یک شکست در فرض رایج «رابطه خطی محاسبات و هوش» است.

آموزش مدل‌هایی با تریلیون‌ها پارامتر دیگر انحصاری آزمایشگاه‌هایی با خوشه‌های ۱۰۰ هزار تراشه‌ای نیست. شرکت Magic دستورالعملی برای پیش‌آموزش (Pretraining) ارائه کرده است که بیش از ۱۰ برابر بهینه‌تر از مدل‌های پایه با وزن‌های باز (Open Weights) است و عملاً قابلیت‌های پیشرو را از بودجه‌های سخت‌افزاری عظیم جدا می‌کند.

برای سال‌ها، صنعت بر این فرض استوار بود که قوانین مقیاس‌پذیری (Scaling Laws) برای رسیدن به سطح بعدی هوش، نیازمند افزایش خطی یا نمایی در محاسبات (Compute) است. این دوران «زور بازو» تنها به نفع چند غول فناوری بود. رویکرد Magic تمرکز را از حجم سخت‌افزار به بهره‌وری الگوریتمی تغییر می‌دهد تا بتواند عامل‌های کدنویسی فوق‌بشری و تحقیق و توسعه (R&D) خودکار در هوش مصنوعی خلق کند.

طبق به‌روزرسانی فنی منتشر شده در ۸ سپتامبر ۲۰۲۶، این تیم توانسته است با استفاده از تقریباً ۵۰ برابر FLOPs (عملیات اعشاری در ثانیه) کمتر، به برابری با مدل DeepSeek V4 Pro Base برسد. این رقم به معنای بودجه‌ای در حدود ۰.۵ میلیون دلار روی سخت‌افزار GB200 است؛ یعنی تقریباً نیمی از کل محاسبات به‌کاررفته برای آموزش GPT-3.

پیش‌آموزی بیش از ۱۰ برابر کارآمدتر — جادو

شکاف بهره‌وری

به نقل از مستندات Magic، بهره‌وری این مدل‌ها با استفاده از معیار زیان bits-per-byte (bpb) روی داده‌های خارج از مجموعه سنجیده شده است؛ معیاری که تفاوت‌های میان توکن‌سازها (Tokenizers) را خنثی می‌کند. این روش از حساسیت به پرامپت و عدم قطعیت ارزیابی‌های مبتنی بر نمونه‌برداری که در مدل‌های پایه رایج است، فاصله می‌گیرد.

نتایج در حوزه‌های مختلف، برتری مستمر Magic را نشان می‌دهد. در مورد مخازن کد خصوصی، مدل V5 e24 به عدد ۰.۱۹۴ bpb رسید. این نتیجه از DeepSeek V4 Pro (۰.۲۰۲ bpb)، Kimi K2 (۰.۲۰۵ bpb) و Nemotron 3 Ultra (۰.۲۰۳ bpb) پیشی گرفت.

در بررسی مقالات پژوهشی، مدل V5 e24 به عدد ۰.۳۸۳ bpb دست یافت. این رقم به‌طور قابل‌توجهی کمتر از DeepSeek V4 Pro (۰.۴۰۴ bpb)، Kimi K2 (۰.۴۲۱ bpb) و Nemotron 3 Ultra (۰.۴۰۶ bpb) است.

در شدیدترین شکاف، دستورالعمل Magic برای استدلال روی مسائل ریاضی، ۱۲۷ برابر بهینه‌تر از DeepSeek V4 Pro بود. مدل V5 e24 در این دسته به ۰.۵۸۷ bpb رسید، در حالی که این عدد برای DeepSeek V4 Pro برابر با ۰.۶۷۸ bpb و برای Nemotron 3 Ultra برابر با ۰.۶۱۹ bpb بود.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی مدل‌های بازمتن اشاره کردیم، کاهش وابستگی به سخت‌افزار، کلید دموکراتیزه کردن هوش مصنوعی است.

پیش‌بینی‌های مقیاس و هزینه

وقتی Magic محاسبات خود را ۱۰ برابر دیگر افزایش داد (حدود ۴ میلیون دلار)، مدل‌های آن‌ها در ارزیابی‌های perplexity (پراکندگی) به‌طور معناداری از تمام مدل‌های پایه بازِ موجود پیشی گرفتند. این شرکت اشاره می‌کند که برای رسیدن به همین سطح از قابلیت‌ها با دستورالعمل DeepSeek V4 Pro، بیش از ۱۰۰ میلیون دلار هزینه می‌شد، بدون اینکه چالش دسترسی به داده‌ها را در نظر بگیریم.

برای تایید این خطوط پایه، Magic مقادیر logprobs مدل‌های باز را با استفاده از vLLM و SGLang روی سخت‌افزارهای GB200 و GB300 ارزیابی کرد. آن‌ها همچنین با Fireworks برای تایید logprobs در یک موتور استنتاج (Inference) داخلی همکاری کردند.

نکته جالب این است که تیم Magic دریافت Nemotron 3 Ultra در تمامی زمینه‌ها از DeepSeek V4 Pro بهتر عمل می‌کند. این موضوع نشان می‌دهد عملکرد ضعیف‌تر Nemotron در بنچمارک‌های پس از RL (یادگیری تقویتی)، احتمالاً ناشی از پس‌آموزش (Post-training) نامناسب است، نه ضعف در بنیاد پیش‌آموزش. تیم همچنین اشاره کرد که مدل‌های Kimi K3 و Muse Spark متعلق به Meta، به ترتیب پیشرفت‌هایی معادل ۲.۵ و ۳.۳ برابر نسبت به Kimi K2 نشان می‌دهند.

عملکرد در حوزه‌های تخصصی

برای شناسایی شکاف‌های مجموعه‌داده، Magic ارزیابی‌های خود را به تفکیک موضوع تجزیه کرد. آن‌ها برای جلوگیری از پاداش دادن به «حفظ کردن توالی‌ها»، اسناد را با استفاده از یک مدل زبانی بزرگ پیشرو (Third-party frontier LLM) بازنویسی یا خلاصه کردند.

بهره‌وری در حوزه‌های پژوهشی:

  • علوم کامپیوتر: مدل V5 e24 به ۰.۴۰۰ bpb رسید که ۱۲۰ برابر بهینه‌تر از DeepSeek V4 Pro است. مدل V5 e21 از ۰.۵۴۸ bpb شروع کرد، V5 e22 به ۰.۴۸۱ bpb و V5 e23 به ۰.۴۲۵ bpb رسید.
  • مهندسی: مدل V5 e24 با ۰.۳۸۳ bpb، ۴۸ برابر بهینه‌تر از رقیب خود بود. مدل V5 e21 از ۰.۵۱۷ bpb شروع کرد، V5 e22 به ۰.۴۵۶ bpb و V5 e23 به ۰.۴۰۵ bpb رسید.
  • ریاضیات: مدل V5 e24 به ۰.۳۴۲ bpb رسید که ۲۱ برابر بهینه‌تر از DeepSeek V4 Pro است. مدل V5 e21 از ۰.۴۹۲ bpb شروع کرد، V5 e22 به ۰.۴۲۶ bpb و V5 e23 به ۰.۳۶۷ bpb رسید.
  • فیزیک: مدل V5 e24 با ۰.۴۰۶ bpb، ۲۹ برابر بهینه‌تر عمل کرد. مدل V5 e21 از ۰.۵۵۲ bpb شروع کرد، V5 e22 به ۰.۴۸۷ bpb و V5 e23 به ۰.۴۳۱ bpb رسید.

تعمیم‌پذیری و دانش

ارزیابی‌های کد Magic از کدبیس خودشان و کدهای خصوصی خریداری‌شده از استارتاپ‌های دیگر استفاده کرد. برای استدلال، آن‌ها از Kimi K3 برای تولید walkthroughهای زنجیره تفکر (Chain-of-Thought) برای مسائل ریاضی خصوصی استفاده کردند.

برای تضمین تعمیم‌پذیری سخت‌گیرانه، آن‌ها کدهای متن‌باز (OSS) و هر سندی که دارای یک پنجره ۹۶ کاراکتری از متن نرمال‌شده یا شباهت Jaccard بالاتر از یک آستانه حساس در مقایسه با داده‌های آموزش بود را حذف کردند.

Magic به‌طور عمدی برخی حوزه‌ها را برای اولویت دادن به کدنویسی و R&D کنار گذاشت تا تعادل در ترکیب داده‌ها برقرار شود. این حوزه‌های کم‌اولویت عبارتند از:

  • اخبار محلی
  • دانش عمومی جهان
  • حقوق
  • حقایق درباره افراد مشهور
  • ورزش و رویدادها

آن‌ها برخی موارد استثنا در دانش جهانی مشاهده کردند، به‌ویژه در پزشکی و سلامت، جایی که Nemotron اعداد و عبارات خاصی را چنان مؤثر حفظ کرده بود که حتی پس از بازنویسی توسط LLM، آن‌ها را به‌خوبی پیش‌بینی می‌کرد.

مسیر رسیدن به پایداری

این پیشرفت آنی نبود. در اواخر ۲۰۲۴، تیم یک مدل متراکم کوچک با معماری مخصوص پنجره‌های زمینه (Context Windows) بسیار بلند آموزش داد، اما مقیاس‌های اولیه پیش‌آموزش به‌کرات دچار فروپاشی (Blow up) می‌شدند.

آن‌ها ماه‌ها روی ساخت یک بنیاد پایدار متمرکز شدند که شامل موارد زیر بود:

  • همگرایی نرم (Smooth convergence)
  • کیفیت آموزش با دقت پایین معادل FP32
  • زیرساخت سریع و پایدار
  • قوانین درست مقیاس‌دهی ابرپارامترها (Hyperparameters)
  • شکار تهاجمی باگ‌ها

موفقیت فعلی آن‌ها نتیجه ضرب‌در شدن ده‌ها تغییر کوچک در معماری مدل، بهینه‌سازها، اهداف آموزش و سازمان‌دهی داده‌ها است. آن‌ها از «NanoGPT speedruns» برای بازخورد سریع استفاده کردند، هرچند اشاره کردند که بهبودهای مدل‌های بسیار کوچک همیشه به مدل‌های مقیاس‌بزرگ منتقل نمی‌شود. همچنین دریافتند برخی ویژگی‌های موجود در اکثر LLMها را می‌توان بدون آسیب به عملکرد مقیاس‌بزرگ حذف کرد.

برای ارزیابی تغییرات، آن‌ها سه مدل در دو مرتبه بزرگی محاسباتی آموزش می‌دهند. یک تغییر تنها زمانی پذیرفته می‌شود که برازش قانون توان (Power law fit) نشان دهد در مقیاس بزرگ کمک‌کننده خواهد بود. آن‌ها هر چند هفته یک بار تا ۱/۱۰ مقیاس نهایی (Hero scale) پیش می‌رفتند و اجراهای کامل (V3, V4, V5) هر چند ماه یک بار رخ می‌داد.

پیشرفت آن‌ها خیره‌کننده است: V2 خط پایه بود، V3 در اوایل ۲۰۲۶، V4 در جولای ۲۰۲۶ و V5 در سپتامبر ۲۰۲۶ رسید. در V5، آن‌ها به بهره‌وری ۵۰۵ برابری نسبت به V2 دست یافتند.

از پیش‌آموزش تا استدلال

برای تایید اینکه بهره‌وری پیش‌آموزش به عملکرد واقعی تبدیل می‌شود، Magic یک اجرای کوتاه RL ریاضی با بودجه ۱۶ هزار توکنی زنجیره تفکر (CoT) انجام داد. تمام RLها مستقیماً از مدل پایه و بدون SFT یا distillation شروع شدند.

مدل V5 (e24) به نرخ پذیرش ۷۲٪ در مسائل ریاضی مسابقاتی دست یافت. این عملکرد تنها با استفاده از ۰.۲٪ از بودجه محاسباتی پیش‌آموزش مدل به دست آمد.

برای مقایسه، نرخ pass@1 مدل V5 (e24) در AIME26 از ۹۰٪ گذشت (و pass@16 به ۱۰۰٪ رسید). این نتیجه در فاز RL با مصرف کم محاسبات و به‌طور متوسط ۶ هزار توکن CoT به دست آمد. این تست روی یک ارزیابی ریاضی مسابقاتی خصوصی با ۴۰۰ مسئله انجام شد که سخت‌تر از AIME است تا از آلودگی داده‌ها (Contamination) که در مدل‌های شخص ثالث دیده می‌شود، جلوگیری شود.

در چشم‌انداز کلی RL، مدل V5 با نرخ ۷۲٪ از Nemotron 3 (۲۷٪) پیشی گرفت، در حالی که پشت سر مدل‌هایی مثل Kimi K3 (۷۵٪) و DeepSeek V4 Pro (۶۵٪) در پیکربندی‌های مختلف قرار داشت؛ هرچند محاسبات RL در Magic به‌طور قابل‌توجهی کمتر بود. سایر بنچمارک‌ها شامل GPT-6 Astra (۱۰۰٪)، Claude 5.1 (۹۸٪)، Muse Spark 1.3 (۸۸٪)، Gemini 3.8 (۸۳٪)، Grok 4.6 (۷۱٪)، Inkling (۵۰٪)، Qwen 3.8 (۴۵٪) و GLM-5.3 (۴۵٪) بود.

تحلیل: بازتعریف خندق محاسباتی

این پیشرفت به‌طور بنیادی نظریه «خندق محاسباتی» (Compute Moat) را به چالش می‌کشد. اگر یک تیم کوچک بتواند با ۵۰ برابر محاسبات کمتر به مدل‌های پایه پیشرو برسد، مزیت رقابتی خوشه‌های عظیم GPU در برابر نبوغ الگوریتمی کاهش می‌یابد.

شرکت Magic محاسبات را با تقریب 6·N·D گزارش می‌کند (که در آن N تعداد پارامترهای فعال و D تعداد توکن‌های پیش‌آموزش است) تا از حدس زدن هزینه‌های ابعاد توالی اجتناب کند. عدد «۶» از فرمول (add+mul) * (fwd+bwd*2) به دست آمده است.

برای درک بهتر، مقادیر 6·N·D FLOPs برای مدل‌های کلیدی عبارتند از:

  • DeepSeek V4 Pro: ۴۸.۸ میلیارد پارامتر، ۳۳ تریلیون توکن (9.67e24 FLOPs)
  • DeepSeek V4 Flash: ۱۳.۲ میلیارد پارامتر، ۳۲ تریلیون توکن (2.55e24 FLOPs). این مدل در کنار بهینه‌سازی‌های پیش‌آموزش، در کاهش چشمگیر اشغال حافظه KV Cache نیز پیشرو بوده است تا استنتاج را سریع‌تر کند.
  • Kimi K2: ۳۱.۶ میلیارد پارامتر، ۱۵.۵ تریلیون توکن (2.95e24 FLOPs)
  • Nemotron 3 Ultra: ۵۵ میلیارد پارامتر، ۲۰ تریلیون توکن (6.60e24 FLOPs)
  • Magic V4: 1.91e24 FLOPs
  • Magic V5 (e24): 1.63e24 FLOPs
  • Magic V5 (e23): 1.58e23 FLOPs
  • Magic V5 (e22): 1.12e22 FLOPs
  • Magic V3: 3.85e24 FLOPs
  • Magic V2: 7.20e23 FLOPs

برای جامعه فنی، این موضوع نشان می‌دهد که مدل‌های وزن‌باز فعلی ممکن است به‌طور قابل‌توجهی بیش از حد آموزش دیده (Over-trained) یا دارای معماری ناکارآمد باشند. تغییر به سمت «محاسبات مؤثر» — جایی که کیفیت دستورالعمل بر کمیت FLOPs برتری دارد — می‌تواند آموزش مدل‌های تریلیون پارامتری را دموکراتیزه کند.

گام‌های بعدی

شرکت Magic اکنون تمرکز خود را به سمت مقیاس‌دهی RL با افق زمانی بلند (Long-horizon RL) و توسعه تکنیک‌های آموزش ترازسازی (Alignment) با ویژگی‌های نظری مستحکم تغییر داده است. آن‌ها به‌طور خاص روی موارد زیر کار می‌کنند:

  • اکتشاف و تخصیص اعتبار (Credit assignment) در RL با افق بلند
  • کارهای سیستمی برای مقیاس‌دهی RL با افق بلند
  • آموزش ترازسازی در برابر دانش نهفته‌ای که به‌طور محدود استخراج شده است
  • بهبودهای بیشتر در پیش‌آموزش

آن‌ها معتقدند که پیش‌آموزش، RL عامل‌محور (Agentic RL) و زمینه بلند (Long-context)، ستون‌های کافی برای ساخت عامل‌های کدنویسی فوق‌بشری و خودکارسازی R&D در هوش مصنوعی هستند. منتظر انتشار مدل آن‌ها و به‌روزرسانی «سیاست آمادگی AGI» باشید که گیت‌های استقرار و الزامات ایمنی در طول آموزش RL را پوشش می‌دهد.

گام بعدی شما

  • بررسی متدولوژی‌های کاهش FLOPs برای بهینه‌سازی هزینه‌های آموزش مدل‌های تخصصی.
  • دنبال کردن انتشار مدل V5 و سیاست آمادگی AGI شرکت Magic برای ارزیابی گیت‌های استقرار.
  • تحلیل اثر حذف داده‌های «دانش عمومی» بر روی تخصص مدل در حوزه‌های STEM.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد با تکیه بر تخصص در بهره‌وری الگوریتمی، هزینه ورود به باشگاه مدل‌های تریلیونی را به‌شدت کاهش می‌دهد. در نتیجه، استقلال مدل‌سازی از خوشه‌های عظیم سخت‌افزاری، امکان توسعه مدل‌های پیشرو را برای استارتاپ‌های کوچک فراهم می‌کند.

تأثیر برای ایران

این خبر برای پژوهشگران مدل‌های بنیادی در ایران اهمیت دارد؛ چراکه نشان می‌دهد برای رسیدن به نتایج سطح جهانی، لزوماً به خوشه‌های عظیم GPU نیاز نیست و بهینه‌سازی الگوریتمی می‌تواند کمبود سخت‌افزاری را جبران کند.

·نگاه ما
تحریریه دات‌هوش

این دستاورد نشان می‌دهد که «خندق محاسباتی» (Compute Moat) که غول‌های فناوری بر آن تکیه کرده‌اند، بسیار شکننده‌تر از آن است که تصور می‌شد. وقتی یک تیم کوچک می‌تواند با ۵۰ برابر هزینه کمتر به عملکرد مدل‌های پیشرو برسد، برتری رقابتی از «تعداد GPUها» به «خلاقیت الگوریتمی» منتقل می‌شود. احتمالاً بسیاری از مدل‌های وزن‌باز فعلی به‌شدت Over-trained شده‌اند و فضای وسیعی برای بهینه‌سازی معماری وجود دارد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.