پرش به محتوای اصلی
پرش به محتوای مقاله

Nous Research: کاهش ۲.۵ برابری زمان پیش‌آموزش LLM بدون تغییر در معماری

·۲۶ اردیبهشت ۱۴۰۵۳ دقیقه مطالعه
Nous Research: کاهش ۲.۵ برابری زمان پیش‌آموزش LLM بدون تغییر در معماری
اشتراک‌گذاری

اگر در حال آموزش یک مدل پیشرو هستید، گران‌ترین هزینه شما زمان است، نه فقط سخت‌افزار. تصور کنید بتوانید بدون تغییر در معماری مدل یا داده‌های آموزشی، زمان رسیدن به نتیجه را بیش از نصف کاهش دهید.

Nous Research متدی را توسعه داده است که زمان واقعی (Wall-clock time) پیش‌آموزش (Pre-training) را تا ۲.۵ برابر کاهش می‌دهد. این دستاورد به مدل‌ها اجازه می‌دهد تا با مصرف کسری از بودجه‌ی محاسباتی معمول، به نرخ خطای پایین‌تری در آموزش برسند.

هزینه‌های پیش‌آموزش همچنان بزرگ‌ترین سد راه ورود به رقابت در توسعه هوش مصنوعی است. همان‌طور که در تحلیل قبلی ما درباره‌ی OpenHuman و لایه‌ی فشرده‌سازی TokenJuice دیدیم، کاهش هزینه‌های استنتاج (Inference) برای عامل‌ها حیاتی است، اما TST مستقیماً سراغ گران‌ترین مرحله، یعنی همان آموزش اولیه می‌رود تا مقدار داده‌ای که مدل در هر عملیات ریاضی (FLOP) پردازش می‌کند را بهینه کند.

طبق مستندات این پژوهش که در مه ۲۰۲۶ در arXiv (شناسه ۲۶۰۵.۰۶۵۴۶) منتشر شد، فرآیند TST در دو مرحله مجزا اجرا می‌شود:

  • فاز ۱ (برهم‌نهی): در ۲۰ تا ۴۰ درصد ابتدایی آموزش، مدل به جای تک‌توکن، «بسته‌هایی» شامل ۳ تا ۱۶ توکن متوالی را پردازش می‌کند. این بردارهای معنایی (Embeddings) در یک توکن نهفته میانگین‌گیری می‌شوند که نرخ پردازش متن را تا s برابر افزایش می‌دهد. در این مرحله از یک تابع زیان Cross-Entropy چند-داغ (MCE) برای پیش‌بینی بسته بعدی توکن‌ها استفاده می‌شود.
  • فاز ۲ (بازیابی): مدل به حالت استاندارد پیش‌بینی توکن بعدی باز می‌گردد. با وجود یک جهش موقت در نرخ خطا هنگام انتقال بین دو فاز، مدل در نهایت عملکردی بهتر از مدل‌های پایه (Baseline) نشان می‌دهد.

به نقل از نتایج آزمایش‌های رودررو روی ۶۴ پردازنده NVIDIA B200، یک مدل مخلوط خبرگان (MoE) با ۱۰ میلیارد پارامتر (10B-A1B) که با روش TST آموزش دیده بود، تنها به ۴٬۷۶۸ ساعت GPU نیاز داشت؛ در حالی که مدل پایه به ۱۲٬۳ idea۱۱ ساعت نیاز داشت. همچنین این مدل در بنچمارک‌های کلیدی، امتیاز ۷۱.۲ در HellaSwag و ۳۹.۰ در MMLU کسب کرد.

این تغییر نشان می‌دهد که توکن‌بندی با رزولوشن بالا لزوماً از اولین گام آموزش ضروری نیست. با تبدیل فاز اول به نوعی «پیش-پیش‌آموزش»، TST ابتدا هندسه‌ی بردارها را منظم کرده و مدل را با نسخه‌ای کلی‌تر از داده‌ها آشنا می‌کند و سپس دانش آن را صیقل می‌دهد. برای جامعه‌ی فنی، این یافته فرضیه «آموزش خطی برای بهینه‌سازی محاسبات» را می‌شکند و رویکرد «از کلی به جزئی» (Coarse-to-fine) را به عنوان جایگزینی کارآمد معرفی می‌کند.

گام بعدی شما

  • رصد پیاده‌سازی TST در مدل‌های بزرگ‌تر (بیش از ۱۰۰ میلیارد پارامتر) برای بررسی پایداری این بهره‌وری در مقیاس بالا.
  • بررسی نسخه‌ی «فقط خروجی» (Output-only) برای پروژه‌هایی که محدودیت آن‌ها داده است، نه قدرت محاسباتی.
  • تحلیل اثر این روش بر کاهش اثرات زیست‌محیطی مراکز داده در مراحل آموزش.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این متد با کاهش چشمگیر زمان آموزش، سد ورود برای آزمایشگاه‌های کوچک‌تر را می‌شکند و اجازه می‌دهد مدل‌های بنیادی با بودجه‌های کمتر توسعه یابند. اعتبار این ادعا با نتایج ملموس روی سخت‌افزار B200 و بنچمارک‌های استاندارد تأیید شده است.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.