پرش به محتوای اصلی
پرش به محتوای مقاله

Olmo-core 3 توان عملیاتی مدل‌های تریلیونی را با معماری MoE افزایش داد

·۹ مهر ۱۴۰۵۶ دقیقه مطالعه
پشته آموزش متن‌باز میکسچر-آو-اکسپرتز تریلیون‌پارامتری Ai2
پشته آموزش متن‌باز میکسچر-آو-اکسپرتز تریلیون‌پارامتری Ai2
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی کامل FSDP با DDP در یک استک باز برای مدل‌های MoE تریلیونی؛ این تغییر باعث شد افزایش ۱۰ برابری پارامترها، تنها ۵٪ کاهش در توان عملیاتی ایجاد کند.

اگر قصد دارید مدلی با تریلیون‌ها پارامتر آموزش دهید، احتمالاً با این واقعیت تلخ روبرو شده‌اید که سخت‌افزار شما بیشتر از آنکه محاسبه کند، مشغول جابه‌جایی داده‌هاست. مؤسسه Allen Institute for AI (Ai2) در ۱ اکتبر ۲۰۲۶ با معرفی Olmo-core 3، راهکاری برای حذف این «مالیات ارتباطی» در مدل‌های عظیم ارائه کرد. این پشته آموزشی بازطراحی شده، امکان بنچمارک کردن یک مدل ۱.۲ تریلیون پارامتری را با توان عملیاتی بالا و با استفاده از یک چارچوب متن‌باز فراهم می‌کند.

طبق اعلام این مؤسسه، چالش اصلی در معماری ترکیب خبره‌ها (Mixture of Experts یا MoE) — که شبیه به شرکتی است که هر درخواست را به متخصص‌ترین کارمندش می‌سپارد تا کل کارکنان درگیر نشوند — هزینه بالای هماهنگی بین پردازنده‌هاست. در مدل‌های MoE استاندارد، مسیریابی داده‌ها به سمت «خبره» درست در یک خوشه GPU، اغلب همان بازدهی‌ای را که مدل‌های پراکنده (Sparse) ایجاد می‌کنند، از بین می‌برد. Olmo-core 3 دقیقاً برای پر کردن این شکاف طراحی شده است تا با رشد مدل، زمان صرف‌شده برای جابه‌جایی داده‌ها از زمان محاسبات پیشی نگیرد.

زمینه و تکامل

کاوش‌های Ai2 در زمینه مدل‌های پراکنده با OlmoE آغاز شد که از یک معماری MoE با ۶۴ خبره مسیریابی شده استفاده می‌کرد. در مقابل، Olmo 3 از یک معماری متراکم (Dense) بهره می‌برد که در آن تقریباً تمام مدل برای هر توکن فعال می‌ماند. Olmo-core 3 اکنون این چارچوب را با ارائه یک سیستم آموزشی که به‌طور خاص برای مدل‌های MoE بسیار بزرگ‌تر طراحی شده است، گسترش می‌دهد.

در حالی که Megatron-Core شرکت NVIDIA پیش از این یک گزینه تثبیت‌شده برای آموزش MoEهای بزرگ بود، Ai2 توصیف می‌کند که Olmo-core 3 یک پشته آموزشی MoE کاملاً یکپارچه را مستقیماً به چارچوب پشتیبان Olmo می‌آورد. این انتشار با یک دموی تعاملی، کد باز و یک گزارش فنی با عنوان «Supercharging Olmo-core for Efficient and Scalable MoE Training» پشتیبانی می‌شود. این گزارش توسط پژوهشگران Ai2 و دانشگاه واشینگتن نوشته شده و Tianhua Tao نویسنده اصلی و توسعه‌دهنده کلیدی آن است.

از تکه‌تکه سازی تا خبره‌های مقیم

تیم توسعه‌دهنده به رهبری Tianhua Tao، رویکرد بنیادین تعامل مدل با سخت‌افزار را تغییر داده است. نسخه‌های قبلی از موازات داده‌های کاملاً تکه‌تکه شده (FSDP) استفاده می‌کردند که در آن وزن‌های مدل برای هر دسته کوچک از داده‌ها باید جمع‌آوری و دوباره توزیع می‌شدند.

در مقابل، Olmo-core 3 از موازات داده‌های توزیع‌شده (DDP) استفاده می‌کند. در این روش، خبره‌ها به‌صورت ثابت (Resident) روی GPUها مستقر می‌شوند و این داده‌ها هستند که به سمت آن‌ها مسیریابی می‌شوند. در یک تست با ۸ پردازنده NVIDIA B300، یک مدل MoE با ۴۷ میلیارد پارامتر توانست ۵۲,۰۰۰ توکن در ثانیه به ازای هر GPU پردازش کند؛ این رقم تقریباً ۲.۷ برابر بیشتر از پیاده‌سازی قبلی است که تنها ۱۹,۴۰۰ توکن را مدیریت می‌کرد. این تلاش برای بهینه‌سازی زیرساخت، در راستای موج جدیدی از متدهای آموزشی است که با استفاده از دستورالعمل‌های پیش‌آموزش بهینه، هزینه‌های محاسباتی مدل‌های باز را تا ۱۰ برابر کاهش داده‌اند.

مقیاس‌بندی استخر خبره‌ها

یکی از خیره‌کننده‌ترین بنچمارک‌ها، گسترش تعداد خبره‌ها از ۸ به ۱۲۸ مورد بود، در حالی که پارامترهای فعال برای هر توکن روی ۳.۲ میلیارد ثابت ماند. با وجود اینکه ظرفیت کل پارامترها از ۴.۶ میلیارد به ۴۷ میلیارد رسید، توان عملیاتی (Throughput) کمتر از ۵٪ کاهش یافت. این موضوع ثابت می‌کند که سیستم می‌تواند ظرفیت را بدون افزایش خطی هزینه‌های محاسباتی بالا ببرد.

جزئیات موازات و حافظه

برای استخراج حداکثری قدرت سخت‌افزار، Olmo-core 3 از سه تکنیک اصلی برای تقسیم مدل و وضعیت آموزش در سخت‌افزار استفاده می‌کند:

  • موازات خبره‌ها (Expert Parallelism): پخش کردن خبره‌ها در GPUهای مختلف.
  • موازات خط لوله (Pipeline Parallelism): تقسیم لایه‌ها بین گروه‌های GPU.
  • بهینه‌ساز توزیع‌شده (Distributed Optimizer): پخش وضعیت بهینه‌ساز بین GPUها برای جلوگیری از ایجاد کپی‌های کامل روی هر دستگاه.

به گزارش این تیم، بهینه‌سازی‌های فنی دیگری نیز اعمال شده است:

  • موازات خبره ردیفی (Rowwise Expert Parallelism): استفاده از طراحی مبتنی بر NVSHMEM برای نوشتن مستقیم توکن‌ها در بافرهای ورودی خبره، که این فرآیند را بدون نیاز به همگام‌سازی (Synchronization-free) می‌کند.
  • مسیریابی مستقر در GPU: متادیتای مسیریابی روی GPU می‌ماند تا CPU بتواند بدون انتظار برای کپی داده‌ها، صف کاری را مدیریت کند.
  • Grouped GEMM: ترکیب چندین محاسبه کوچک خبره در اجراهای بزرگ‌تر و بهینه‌تر GPU.
  • پشتیبانی از MXFP8: استفاده از این فرمت با دقت پایین‌تر، توان عملیاتی آموزش را در مقایسه با BF16 روی چهار GPU NVIDIA B300 حدود ۲۱٪ افزایش داد.
  • چک‌پوینت‌های مستقل از توپولوژی: این سیستم تنسورهای جهانی FP32 را مستقل از چیدمان موازات ثبت می‌کند، که اجازه می‌دهد یک اجرای متوقف شده روی توپولوژی سخت‌افزاری متفاوتی از سر گرفته شود.

مدیریت حافظه نیز بهبود یافت. حافظه فعال پیک (Peak active memory) هنگام استفاده از MXFP8 از ۱۰۳ گیگابایت به ۹۵ گیگابایت کاهش یافت که بیشتر این دستاورد مربوط به محاسبات Feed-forward و جابه‌جایی داده‌ها بود. علاوه بر این، بازمحاسبه فعال‌سازها (Activation Recompute) تقریباً دو-سوم از حافظه فعال‌ساز را حذف کرد و حافظه پیک را حدود یک چهارتم کاهش داد، هرچند که این کار توان عملیاتی را حدود یک پنجم کاهش داد.

فشار به مرز تریلیون پارامتر

طبق گزارش فنی، تیم سیستم را تا مرزهای افراطی پیش برد. آن‌ها یک مدل ۱.۲ تریلیون پارامتری را روی ۵۱۲ پردازنده تست کردند که در آن ۵۸.۳۶ میلیارد پارامتر به ازای هر توکن فعال بود و به توان عملیاتی ۸۵۸ TFLOP/s به ازای هر GPU رسیدند.

Ai2 همچنین از DeepEP v2 به عنوان یک بک‌اند ارتباطی جایگزین استفاده کرد. این ابزار به آن‌ها اجازه داد تا در یک تست ظرفیت کوتاه، به ۲.۳۸ تریلیون پارامتر کل دست یابند. تیم اشاره کرد که در این تست‌های سطح بالا، برای اندازه‌گیری عملکرد سیستم از مسیریابی تصادفی استفاده شده است و نه برای سنجش کیفیت واقعی یک مدل آموزش‌دیده. گزارش نقاط عملیاتی را از یک مدل ۱۲.۹ میلیارد پارامتری روی ۱۶ GPU تا پیکربندی ۱.۲ تریلیون پارامتری فهرست کرده است.

شکست‌های مستند شده و یافته‌ها

این گزارش در مورد مواردی که نتیجه نداده‌اند نیز بسیار شفاف است. پژوهشگران پدیده‌ای به نام «تجزیه توکن‌ها» (Token Gerrymandering) را شناسایی کردند؛ جایی که نمرات مسیریابی که برای تشویق تعادل طراحی شده بودند، بهبود می‌یافتند اما در واقعیت، حجم کاری بین خبره‌ها نامتوازن باقی می‌ماند.

سایر یافته‌های مستند شده عبارتند از:

  • نرخ‌های یادگیری: کاهش نرخ یادگیری برای خبره‌هایی که توکن‌های کمتری پردازش می‌کردند، در خانواده مدل‌های تست شده منجر به بهبود نتایج نشد.
  • واریانس GPU: محاسبات بر اساس مقادیر در حال پردازش، زمان‌های متفاوتی می‌برد، حتی زمانی که ابعاد ماتریس‌ها یکسان بود.
  • هم‌پوشانی جریان (Stream Overlap): هم‌پوشانی ارتباطات و محاسبات روی جریان‌های مجزای GPU گاهی اوقات باعث کند شدن اجرای کلی (End-to-end) می‌شد.
  • رویکردهای رد شده: تیم روش انتقال فعال‌سازها به CPU (به دلیل محدودیت‌های لینک میزبان) و دو طرح هم‌پوشانی که با محاسبات خبره برای منابع GPU رقابت می‌کردند را تست کرد اما نپذیرفت.

این زیرساخت اکنون پایه و اساس نسل بعدی Olmo است که قرار است با معماری MoE، بزرگ‌ترین مجموعه داده و طولانی‌ترین پنجره متنی ساخته شود. هدف Ai2 این است که این نسخه توانمندترین مدل آن‌ها باشد.

برای توسعه‌دهندگان، Olmo-core 3 کاملاً تحت لایسنس Apache-2.0 باز است. این ابزار به صورت بلوک‌های سازنده PyTorch از طریق GitHub یا PyPI با نام ai2-olmo-core در دسترس است.

این تغییر به سمت پشته‌های آموزشی متن‌باز تریلیون پارامتری، پیش‌فرض‌های این حوزه را درباره اینکه چه کسی می‌تواند مدل‌های مقیاس مرزی (Frontier-scale) بسازد، تغییر می‌دهد. Ai2 با حذف «مالیات ارتباطی» MoEها، مانع پژوهشگران را برای آزمایش پراکندگی‌های شدید بدون نیاز به لایه‌های ارکستراسیون بسته و اختصاصی کاهش می‌دهد.

پژوهشگران اکنون باید انتشار مدل Olmo MoE را زیر نظر بگیرند تا ببینند آیا این افزایش توان عملیاتی به هوش مدل و قابلیت‌های استدلال برتر تبدیل می‌شود یا خیر.

گام بعدی شما

  • اگر توسعه‌دهنده مدل‌های بزرگ هستید، کتابخانه ai2-olmo-core را برای جایگزینی FSDP با DDP در مدل‌های MoE خود تست کنید.
  • گزارش فنی «Supercharging Olmo-core» را برای درک جزئیات پیاده‌سازی MXFP8 و مدیریت حافظه مطالعه کنید.
  • منتظر انتشار نسخه MoE مدل Olmo باشید تا ببینید آیا این افزایش سرعت به بهبود استدلال مدل منجر شده است یا خیر.

اما تأثیر این بهینه‌سازی‌ها بر هزینه‌های استنتاج در مقیاس تجاری حتی پیچیده‌تر است — به تحلیل ما درباره‌ی کاهش هزینه‌های Inference در مدل‌های پراکنده مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار علمی مؤسسه Allen AI، دسترسی به آموزش مدل‌های تریلیونی را از انحصار شرکت‌های Big Tech خارج می‌کند. کاهش هزینه‌های ارتباطی در MoE، مسیر را برای مدل‌های تخصصی‌تر و کارآمدتر هموار می‌کند.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران مدل‌های بنیادی اهمیت دارد تا بازار مصرف ایران. با این حال، دسترسی باز به این کد به تیم‌های دانشگاهی ایران اجازه می‌دهد بدون نیاز به سخت‌افزارهای انحصاری، معماری‌های MoE را در مقیاس کوچک‌تر شبیه‌سازی کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز Ai2 بر حذف «مالیات ارتباطی» نشان می‌دهد که در مقیاس تریلیونی، معماری مدل دیگر اولویت اول نیست و گلوگاه واقعی، مهندسی لایه‌های ارتباطی سخت‌افزار است. این رویکرد، فرضیه نیاز به زیرساخت‌های بسته و انحصاری برای مدل‌های Frontier را به چالش می‌کشد و امکان آموزش مدل‌های عظیم را برای مراکز پژوهشی کوچک‌تر فراهم می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.