پرش به محتوای اصلی
پرش به محتوای مقاله

پژوهش Jane Street: اثر وزن‌دهی داده‌ها در مقیاس‌های مختلف غیرخطی است

·۳۱ شهریور ۱۴۰۵۸ دقیقه مطالعه۱ بازدید
بررسی وزن‌دهی توالی در مقیاس بزرگ
بررسی وزن‌دهی توالی در مقیاس بزرگ
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کشف یک رابطه غیریکنواخت (صعودی-نزولی) بین اندازه مدل و حساسیت به وزن داده‌ها؛ برخلاف باور قبلی که این رابطه را خطی یا ثابت می‌پنداشتند.

تصور کنید در حال شرط‌بندی روی ترکیب داده‌ها برای آموزش یک مدل زبانی عظیم هستید و متوجه می‌شوید تمام پیش‌بینی‌های شما در مقیاس بزرگ، غلط است. در ۲۱ سپتامبر ۲۰۲۶، شرکت Jane Street افشا کرد که واکنش مدل‌ها به وزن‌دهی داده‌ها با تغییر مقیاس به‌طور بنیادی تغییر می‌کند و این یافته، فرض رایج مبنی بر تعمیم‌پذیری آزمایش‌های مقیاس کوچک به مدل‌های غول‌پیکر را به چالش می‌کشد.

هنگام آموزش شبکه‌های عصبی (Neural Network)، پژوهشگران زمان زیادی را صرف تصمیم‌گیری درباره این موضوع می‌کنند که مدل دقیقاً چه چیزی یاد بگیرد. این مسئله شامل پرسش‌های حیاتی درباره ترکیب داده‌هاست؛ مثلاً ایجاد تعادل بین هوش عمومی در تمام وظایف کدنویسی در برابر تخصص در زبان OCaml، یا وزن‌دهی به داده‌های بازارهای قدیمی در مقابل داده‌های تازه. در نهایت، این‌ها پرسش‌هایی درباره نحوه تخصیص ظرفیت بازنمایی مدل و عملیات اعشاری در ثانیه (FLOPs) است تا مشخص شود چه مقدار از داده‌های باکیفیت تقویت شوند و در مقابل، مدل تا چه حد اجازه داشته باشد از تمام داده‌های موجود یاد بگیرد.

بسیاری از آزمایشگاه‌های هوش مصنوعی برای پیش‌بینی رفتار ابرپارامترها (Hyperparameter) در مقیاس بالا، به قوانین مقیاس‌پذیری (Scaling Laws) — مانند رویکرد Chinchilla — تکیه می‌کنند. هدف این است که از هزینه‌های گزاف اجرای جست‌وجوی شبکه‌ای (Grid Search) روی مدل‌هایی با صدها میلیارد پارامتر اجتناب شود. اجرای چنین جست‌وجویی در مقیاس‌های متوسط دشوار است و در مقیاس‌های بزرگ، جایی که یک آزمایشگاه شاید فقط بتواند یک مدل را برای یک وظیفه خاص آموزش دهد، عملاً غیرممکن است. این چالش‌های محاسباتی یادآور تلاش‌هایی است که در دست‌وردهٔ پیش‌آموزش Magic برای کاهش ۱۰ برابری هزینه‌های محاسباتی دیده شد تا بهره‌وری در مقیاس‌های بزرگ افزایش یابد.

همان‌طور که در بحث‌های گذشته ما درباره امنیت مدل‌های بازمتن اشاره کردیم، تکیه بر پیش‌فرض‌های ساده در مقیاس‌های بزرگ می‌تواند منجر به نتایج غیرمنتظره شود. پژوهش Jane Street رفتارهای «ناهنجار» در ترکیب داده‌ها را شناسایی کرده است که استخراج نتایج را خطرناک می‌کند. برای اینکه یک استخراج (Extrapolation) درست باشد، رفتارها باید یا نسبت به مقیاس تغییرناپذیر باشند (مانند نتایج MuP که در آن بسیاری از بهینه‌های ابرپارامتری پایدار می‌مانند) یا از طریق تغییرات مقیاس کوچک قابل پیش‌بینی باشند (مانند نتایج Kaplan که در آن کاهش زیان به‌طور پیش‌بینی‌پذیری رخ می‌دهد). اما ترکیب داده‌ها به‌شدت مستعد این رفتارهای غیرقابل پیش‌بینی و ناهنجار است.

برای جداسازی اثر وزن از کیفیت داده، این تیم «وزن‌دهی توالی» را تحلیل کردند؛ روشی که در آن به هر توالی آموزشی در تابع زیان (Loss Function) یک وزن خاص اختصاص می‌یابد. این کار مانع از آن می‌شود که نتایج با تفاوت کیفیت داده‌ها در منابع مختلف یا تفاوت در منحصر‌به‌فرد بودن توکن‌های حاشیه‌ای در یک منبع خاص خلط شود.

آن‌ها «توانِ وزنِ توالیِ مؤثر» (که با $p^$ نمایش داده می‌شود) را اندازه‌گیری کردند. این معیار ردیابی می‌کند که کاهش زیان مدل در یک توالی، تا چه حد به وزن آن توالی وابسته است. به‌طور مشخص، $p^$ اندازه‌گیری می‌کند که کدام توان از وزن توالی، بیشترین تناسب را با کاهش زیان مورد انتظار مدل در آن توالی دارد.

کشف غیریکنواختی (Non-Monotonic)

به نقل از مستندات این پژوهش، $p^*$ از یک قانون توانِ هموار پیروی نمی‌کند، بلکه مسیری صعودی و سپس نزولی را در مقیاس‌های مدل طی می‌کند:

  • مدل‌های مقیاس کوچک: مقادیر $p^*$ کوچکی دارند. این مدل‌ها روی یادگیری الگوهای عمومی در کل مجموعه داده تمرکز می‌کنند و وزن اختصاص‌یافته به توالی‌ها را نادیده می‌گیرند. در این مرحله، کاهش زیان تا حد زیادی مستقل از وزن داده است.
  • مدل‌های مقیاس متوسط: با افزایش ظرفیت، $p^*$ بالا می‌رود. این مدل‌ها به یادگیری الگوهای خاصِ داده‌ها، متناسب با وزن‌های اختصاص‌یافته، تغییر وضعیت می‌دهند. در اینجا، کاهش زیان مدل به شدت به وزن توالی گره می‌خورد.
  • مدل‌های مقیاس بزرگ: وقتی مدل‌ها به رژیم صدها میلیارد پارامتر می‌رسند، $p^*$ دوباره کاهش می‌یابد. این مدل‌ها ظرفیت بازنمایی کافی برای یادگیری تمام الگوهای موجود در داده‌ها را دارند و در نتیجه، وزن‌دهی دوباره بی‌اهمیت می‌شود.

بررسی وزن‌دهی توالی در مقیاس بزرگ

متدولوژی آزمایش

خانواده‌های مدل و مقیاس

پژوهشگران برای اطمینان از اینکه این روند یک ناهنجاری در یک معماری خاص نیست، آن را روی سه خانواده مدل متمایز آزمایش کردند:

  • JS-dense: خانواده‌ای از مدل‌های زبانی متراکم داخلی شامل ۹ مدل، از ده‌ها میلیون تا صدها میلیارد پارامتر.
  • JS-sparse: خانواده‌ای از مدل‌های ترکیب خبره‌ها (Mixture of Experts) شامل ۸ مدل، که آن‌ها نیز از ده‌ها میلیون تا صدها میلیارد پارامتر را در بر می‌گیرند.
  • Qwen 2.5: خانواده‌ای از مدل‌های زبانی متراکم با وزن‌های باز (Open Weights) از ۵۰۰ میلیون تا ۷۲ میلیارد پارامتر.

در تمام زمینه‌های آزمایش شده، محققان مشاهده کردند که عملکرد مدل‌ها روی داده‌های خارج از آموزش (Held-out)، به‌طور مداوم با افزایش مقیاس بهبود می‌یابد.

فرآیند داده و وزن‌دهی

آن‌ها از یک محک متنی داخلی استفاده کردند که در آن وزن‌ها به‌صورت log-uniform بین ۰.۰۱ و ۱۰ توزیع شده بودند. مدل‌ها برای ۳ Epoch آموزش دیدند و ارزیابی‌ها پس از هر دوره برای ردیابی تغییرات $p^*$ انجام شد.

برای محاسبه $p^$، تیم مراحل زیر را دنبال کرد:
۱. آموزش مدل روی مجموعه داده با وزن $w_i$ برای هر توالی.
۲. ارزیابی مجدد مدل روی همان مجموعه داده.
۳. اندازه‌گیری کاهش زیان به‌دست‌آمده برای هر توالی از مرحله آموزش.
۴. برازش $p^
$ به‌گونه‌ای که کاهش زیان نرمال‌شده در یک توالی با وزن $w$، به بهترین شکل توسط $w^{p^*}$ توضیح داده شود.

درک معیار $p^*$

برای تفسیر نتایج، تیم سناریوهای زیر را برای این توان تعریف کرد:

  • $p^ = 0$*: کاهش زیان مورد انتظار تحت تأثیر وزن نیست؛ توالی‌های با وزن بالا و پایین کاهش مشابهی را تجربه می‌کنند.
  • $0 < p^ < 1$*: توالی‌های با وزن بیشتر، کاهش زیان بیشتری دارند، اما این مقیاس زیرخطی است.
  • $p^ = 1$*: کاهش زیان دقیقاً متناسب با وزن آموزش است.
  • $p^ > 1$: کاهش زیان بیش از حد روی توالی‌های با وزن بالا متمرکز است، حتی بیشتر از آنچه خودِ وزن‌ها القا می‌کنند (مثلاً اگر مدل فقط توالی‌های با بالاترین وزن را حفظ کند و برای بقیه پیش‌بینی‌های تصادفی ارائه دهد، $p^$ بسیار بالا خواهد بود).

بررسی وزن‌دهی توالی در مقیاس بزرگ

نقش Epoching

این مطالعه نشان داد که آموزش برای دوره‌های (Epoch) بیشتر، نقطه اوج منحنی $p^*$ را به سمت مدل‌های کوچک‌تر می‌برد. در واقع، دفعات بیشتر عبور از داده‌ها به مدل‌های کوچک اجازه می‌دهد الگوهای خاص و منحصر‌به‌فردی را ثبت کنند که پیش‌تر فقط برای مدل‌های متوسط یا بزرگ در دسترس بود. این یعنی Epoching، گذار از یادگیری الگوهای عمومی به یادگیری الگوهای خاصِ وزن‌دار را تسریع می‌کند.

فرضیه ظرفیت

به باور تحلیلگران Jane Street، این رفتار ناشی از تفاوت نرخ یادگیری الگوهای عمومی در برابر الگوهای خاص (Idiosyncratic) است. الگوهای عمومی، مانند درک زبان انگلیسی، به‌خوبی تعمیم می‌یابند و ابتدا و مستقل از وزن یاد گرفته می‌شوند.

الگوهای خاص، مربوط به گروه‌های کوچکی از توالی‌ها هستند. در مجموعه داده مورد استفاده، پتانسیل کاهش زیان از این الگوهای خاص بیشتر از الگوهای عمومی است. محققان پیشرفت مبتنی بر ظرفیت زیر را پیشنهاد می‌کنند:

۱. مدل‌های کوچک ظرفیت محدود خود را برای الگوهای عمومی به کار می‌برند و نمی‌توانند الگوهای خاص را بازنمایی کنند.
۲. مدل‌های متوسط ظرفیت کافی برای الگوهای عمومی و مهم‌ترین الگوهای خاص (با بالاترین وزن) را دارند.
۳. مدل‌های بزرگ ظرفیت یادگیری تمام الگوهای خاص را، فارغ از وزن آن‌ها، دارا هستند.

این یافته مشابه روندی است که در گزارش فنی MAI-Thinking-1 (بخش ۲.۵.۲) ذکر شده بود؛ جایی که کیفیت نسبی آموزش با ترکیب داده‌های متمرکز بر کد در برابر داده‌های STEM، با افزایش اندازه مدل معکوس شد.

پیامدهایی برای قوانین مقیاس‌پذیری

این تغییر رفتار به این معناست که ترکیب داده‌ای که برای یک مدل ۱ میلیارد پارامتری بهینه شده، ممکن است برای یک مدل ۱۰۰ میلیارد پارامتری بهینه نباشد. وزن «بهینه» برای یک حوزه خاص — مانند کدنویسی OCaml یا داده‌های اخیر بازار — یک هدف متغیر است که به ظرفیت کل بازنمایی مدل بستگی دارد.

علاوه بر این، محققان دریافتند که مقادیر واقعی $p^$ بین خانواده‌های مختلف مدل متفاوت است و رابطه ساده‌ای بین خانواده مدل و این توان وجود ندارد. برای مثال، کوچک‌ترین مدل JS-sparse به‌طور قابل‌توجهی بزرگ‌تر از کوچک‌ترین مدل JS-dense بود، اما $p^$ کوچک‌تری داشت. به همین ترتیب، بزرگ‌ترین مدل JS-sparse به‌طور قابل‌توجهی بزرگ‌تر از بزرگ‌ترین مدل Qwen 2.5 بود، اما $p^*$ بزرگ‌تری داشت.

برای متخصصان، این بدان معناست که قوانین مقیاس‌پذیری برای ترکیب داده‌ها را نمی‌توان یک‌بار تنظیم کرد و رها کرد. این پژوهش چند راهکار پیشنهاد می‌دهد:

  • ارزیابی و استخراج نتایج ترکیب داده‌ها را فقط از مدل‌هایی انجام دهید که به‌اندازه کافی بزرگ هستند تا از نقطه اوج $p^*$ عبور کرده باشند.
  • وزن‌های آموزش را به‌طور خاص برای جبران $p^*$ مشاهده‌شده در یک مقیاس معین تنظیم کنید.

Jane Street نتیجه می‌گیرد که حیاتی‌ترین بخش پژوهش‌های مقیاس‌پذیری، نه برازش منحنی‌ها، بلکه درک علت انحراف مدل‌ها از آن‌هاست. با شناسایی این رفتارهای ناهنجار، آزمایشگاه‌ها می‌توانند تجربیات خود را به‌گونه‌ای بازطراحی کنند که بزرگ‌ترین مدل‌ها پیش‌بینی‌پذیر شوند. آن‌ها فرآیند دقیقی برای اندازه‌گیری میزان انحراف مدل‌ها از پیش‌بینی‌ها دارند تا نقاط شکست قوانین مقیاس‌پذیری را شناسایی کرده و مدل‌های بزرگ‌تر و بهتری را با اطمینان بیشتری آموزش دهند.

گام بعدی شما

  • اگر در حال مقیاس‌دهی به مدل‌های خود هستید، از تکیه مطلق به نتایج مدل‌های زیر ۱۰ میلیارد پارامتر برای تعیین وزن داده‌های مدل‌های ۱۰۰ میلیارد پارامتری پرهیز کنید.
  • اثر Epoching را روی توزیع یادگیری الگوهای خاص در مدل‌های کوچک‌تر بررسی کنید تا شاید بتوانید با هزینه کمتر به نتایج مدل‌های متوسط برسید.
  • در استراتژی ترکیب داده‌ها، ظرفیت بازنمایی مدل را به عنوان یک متغیر فعال در نظر بگیرید، نه یک ثابت.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این یافته بر اساس تخصص در تحلیل مقیاس‌پذیری نشان می‌دهد که استراتژی‌های آموزش مدل‌های بزرگ نمی‌تواند صرفاً کپی‌برداری از مدل‌های کوچک باشد. این موضوع ریسک مالی و محاسباتی عظیمی را برای آزمایشگاه‌هایی که بدون در نظر گرفتن این ناهنجاری‌ها مدل‌های تریلیونی آموزش می‌دهند، ایجاد می‌کند.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران مدل‌های بنیادی اهمیت دارد تا بازار مصرف ایران. با این حال، توسعه‌دهندگانی که روی مدل‌های کوچک (SLM) کار می‌کنند، می‌توانند از تکنیک Epoching برای شبیه‌سازی رفتار مدل‌های بزرگ‌تر استفاده کنند.

·نگاه ما
تحریریه دات‌هوش

این پژوهش فرضیه «خطی بودن» در مقیاس‌دهی داده‌ها را می‌زند و نشان می‌دهد که بهینه‌سازی داده‌ها یک هدف متحرک است. در واقع، مدل‌های غول‌پیکر به دلیل ظرفیت بالا، نوعی «اشباع یادگیری» را تجربه می‌کنند که باعث می‌شود وزن‌دهی‌های دستیِ ما بی‌اثر شود. این یعنی در آینده، تمرکز از «چقدر داده را وزن دهیم» به «چگونه ظرفیت مدل را برای الگوهای خاص مدیریت کنیم» تغییر خواهد کرد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.