پرش به محتوای اصلی
پرش به محتوای مقاله

مدل‌های کوچک در پیش‌بینی‌های مالی نویزی بر مدل‌های غول‌آسا پیروز شدند

·۲۳ تیر ۱۴۰۵۸ دقیقه مطالعه۱ بازدید
تحلیل
تنظیم دقیق و RAG: درس‌هایی از دوازده آزمایش ناموفق
تنظیم دقیق و RAG: درس‌هایی از دوازده آزمایش ناموفق
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اثبات تجربی اینکه در پیش‌بینی‌های نویزی، مدل‌های کوچک‌تر به دلیل ظرفیت محدود، منظم‌سازی (Regularization) naturally پیدا می‌کنند و نرخ برد بالاتری نسبت به مدل‌های بزرگ دارند.

اگر امروز برای پیش‌بینی بازارهای مالی روی مدل‌های غول‌آسا سرمایه‌گذاری می‌کنید، احتمالاً در حال تعقیب یک سراب هستید. واقعیت این است که در داده‌های نویزی، مدل‌های کوچک‌تر نه تنها ارزان‌تر، بلکه دقیق‌تر عمل می‌کنند. طبق گزارشی که در ۱۴ ژوئیه ۲۰۲۶ در پلتفرم dev.to منتشر شد، دوازده آزمایش شکست‌خورده روی نتایج نویزی مالی ثابت می‌کند که نه تنظیم دقیق و نه RAG نمی‌توانند سیگنال پیش‌بینی‌کننده‌ای را از داده‌هایی که اساساً فاقد آن هستند، خلق کنند. محقق این اثر نشان می‌دهد که این تکنیک‌ها تنها لغات و زمینه (Context) را تغییر می‌دهند، اما قابلیت پیش‌بینی ذاتی یک هدف (Target) را تغییر نمی‌نداند.

برای توسعه‌دهندگانی که در حال ساخت هوش مصنوعی مالی هستند، صنعت اغلب تنظیم دقیق (Fine-tuning) و RAG را به عنوان ارتقاهای جایگزین یکدیگر می‌بیند. تصور کنید می‌خواهید قیمت نوسانی یک سهم را پیش‌بینی کنید؛ افزودن اسناد تاریخی بیشتر (RAG) یا آموزش مدل روی چند صد اتفاق گذشته (تنظیم دقیق) به نظر منطقی می‌رسد. با این حال، این رویکرد اغلب یک «سراب» از موفقیت ایجاد می‌کند که در معاملات واقعی و زنده به‌سرعت محو می‌شود.

زمینه و جزئیات آزمایش‌ها

این پژوهش بر پایه یک تست واحد نبود، بلکه مجموعه‌ای از حدود دوازده آزمایش مختلف بود. این آزمایش‌ها شامل تنظیم دقیق LLMها، تنظیم دقیق مدل‌های جاسازی (Embedders) و شش مدل مختلف از RAG بود. سیستم به گونه‌ای طراحی شده بود که پیش‌بینی‌های آینده‌نگر را در برابر نتایج نویزی مالی انجام دهد. نویسنده تأکید می‌کند که نتایج او با «اجماع کلی وبلاگ‌ها» متفاوت است، زیرا از سخت‌گیری آماری شدیدی استفاده کرده است. اکثر آزمایش‌ها در یک تقسیم ساده و ساده‌لوحانه (naive) بین داده‌های آموزش و تست موفق به نظر می‌رسیدند، اما شکست‌ها تنها زمانی آشکار شدند که یک چارچوب ارزیابی منضبط به کار گرفته شد. این چارچوب شامل موارد زیر بود:

  • تقسیم‌بندی‌های Walk-forward با اعمال Embargo: برای جلوگیری از نشت داده‌ها (Data Leakage) از آینده به گذشته.
  • آزمون‌های جایگشتی (Permutation Tests): برای اطمینان از اینکه نتایج دارای معناداری آماری هستند.
  • تصحیح Holm/BH-FDR: برای مدیریت خطای مقایسه‌های متعدد هنگام تست سلول‌های مختلف.
  • بررسی متقابل با SPY (Counterfactual): برای اطمینان از اینکه مدل صرفاً در حال ثبت بتای کلی بازار (روند general market) نیست.
  • دروازه کالیبراسیون الزام‌آور: هر نتیجه‌ای، فارغ از اینکه سود و ضرر (P&L) آن چقدر چشم‌گیر به نظر می‌رسید، باید از این دروازه عبور می‌کرد.

تله‌ی تنظیم دقیق (Fine-Tuning)

تحقیقات روی تنظیم دقیق مدل‌های باز-متن، شکاف خطرناکی را بین «زیان ارزیابی» (Evaluation Loss) و «کیفیت تصمیم‌گیری واقعی» آشکار می‌کند. در یک آزمایش، یک مدل ۷ میلیارد پارامتری (7B) و یک مدل ۱۴ میلیارد پارامتری (14B) هر دو روی حدود ۷۷۷ نمونه برچسب‌دار برای یک وظیفه یکسان آموزش دیدند. مدل 14B با زیان ارزیابی ۰.۹۷ به پایان رسید، در حالی که مدل 7B زیانی معادل ۱.۰۱ داشت.

با وجود زیان کمتر، مدل 14B تصمیمات بدتری روی داده‌های خارج از آموزش (held-out data) گرفت. نرخ برد (Win Rate) مدل 14B تنها ۴۶.۲٪ بود، در حالی که مدل 7B نرخ ۶۸.۴٪ را ثبت کرد؛ یک شکاف ۲۲ واحدی با مقدار p=0.019. این نشان می‌دهد که «زیان مولد» (Generative Loss) — که معیاری برای سنجش میزان بازتولید توکن‌ها توسط مدل است — پیش‌بینی‌کننده کیفیت نهایی در تصمیم‌گیری نیست. اگر توسعه‌دهنده‌ای مدل را بر اساس eval_loss انتخاب کند، ریسک ارسال مدلی پایین‌تر با اعتماد به نفسی کاذب را می‌پذیرد.

علاوه بر این، داده‌ها نشان می‌دهند که مجموعه‌های داده کوچک، مدل‌های بزرگ را تنبیه می‌کنند. با تنها چند صد تا چند هزار نمونه، ظرفیت اضافی مدل ساختارهای عمیق‌تر را نمی‌یابد، بلکه صرفاً «تولیدکننده برچسب» (label generator) و حتی نویزها و اشتباهات آن را حفظ می‌کند. در مقابل، ظرفیت محدود مدل‌های کوچک‌تر به عنوان یک «منظم‌ساز ضمنی» (implicit regularization) عمل می‌کند و مدل را مجبور می‌کند الگوهای ساده‌تر و تعمیم‌پذیرتری را بیابد. قاعده کلی این است: اگر تعداد نمونه‌ها زیر ۳۰۰۰ مورد است، مدل کوچک‌تر را انتخاب کنید.

یادگیری «پاسخ امن»

سه تلاش مجزا برای تنظیم دقیق یک مدل جهت پیش‌بینی جهت بازار (Directional Calls) به یک بن‌بست یکسان رسید: مدل به سمت «پاسخ امن» یا همان پاسخ اکثریت همگرا شد. مدل هیچ سیگنال پیش‌بینی‌کننده‌ای یاد نگرفت؛ بلکه صرفاً توزیع برچسب‌ها را آموخت. در اهداف نویزی، این بدان معناست که مدل تصمیم می‌گیرد کلاس رایج را پیش‌بینی کند و دیگر ریسک نکند. این یک خطر حیاتی را برجسته می‌کند: یک مدل با اعتماد به نفس بالا و زیان پایین، دلیلی بر وجود «لبه» (Edge) یا مزیت معاملاتی نیست؛ بلکه ممکن است صرفاً یک تطبیق کامل با توزیع برچسب‌ها باشد در حالی که ارزش پیش‌بینی صفر دارد.

تله‌ی ترنسفورمرهای کوچک (Tiny-Transformer)

در آزمایشی دیگر، جریان سفارشات (Order-flow) به توکن تبدیل شد و یک ترنسفورمر با حدود ۱۳۰ هزار پارامتر روی هدف تعیین جهت آموزش دید. نتایج تکان‌دهنده بود: ترنسفورمر هرگز همگرا نشد و زیان آموزش دقیقاً روی کف «پرتاب سکه» یا همان -log(0.5) باقی ماند.

در همین حال، یک مدل کلاسیک و خسته‌کننده Gradient Boosted Model (GBM) با استفاده از همان هدف اما با ۱۲ ویژگی دست‌ساز، به AUC ۰.۷۱ رسید. این ثابت می‌کند که سیگنال واقعی بود و قابل یادگیری، اما معماری ترنسفورمر ظرفیت کشف آن از توکن‌های خام را نداشت. «استفاده از ترنسفورمر» جایگزینی برای سیگنال یا مقیاس نیست؛ معماری باید با داده‌های موجود مطابقت داشته باشد، نه با معماری استفاده شده در یک مقاله پژوهشی کپی شده.

تنظیم دقیق در کجا واقعاً جواب می‌دهد؟

تنظیم دقیق بی‌استفاده نیست، اما ارزش آن محدود است. این ابزاری برای لغات و رفتار است — یعنی آموزش کلمات، فرمت‌ها و سبک‌ها. سازگارسازی دامنه (Domain-adapting) یک مدل جاسازی کوچک (all-MiniLM-L6-v2) روی دو مجموعه داده مختلف نشان داد که این کار دقیقاً چه زمانی سودمند است:

  • پیکره غنی (Rich Corpus): وقتی مدل پایه از قبل دامنه را می‌شناخت، هیچ بهبودی حاصل نشد. MRR پایه ۱.۰۰ $\rightarrow$ MRR تنظیم‌شده ۱.۰۰. تغییر صفر.
  • اصطلاحات مبهم (Opaque Jargon): وقتی مفاهیم پشت نام‌کدهایی بودند که مدل پایه هرگز ندیده بود، نتیجه znacign كانت. MRR پایه ۰.۳۰۶ $\rightarrow$ MRR تنظیم‌شده ۰.۵۴۷. این یک افزایش ۰.۲۴ واحدی در MRR یا بهبود نسبی ۷۹٪ بود.

این تایید می‌کند که تنظیم دقیق مدل‌های Embedding تنها زمانی باید انجام شود که دایره لغات پیکره داده‌ها واقعاً با داده‌های آموزشی مدل پایه متفاوت باشد. (این نتایج در مطالعه متن‌باز RE-call مستند شده است).

توهم RAG

تولید بازیابی‌افزا (RAG) در ۹ تکرار مختلف هنگام مواجهه با پیش‌بینی‌های آینده‌نگر شکست خورد. نویسنده تلاش کرد تاریخچه مرتبط را بازیابی کرده و آن را به Prompt مدل تزریق کند تا زمینه بیشتری فراهم شود. این رویکرد در حالی است که معماری RAG به طور کلی برای اتصال مدل‌های زبانی به داده‌های خارجی و کاهش توهمات طراحی شده است، اما در پیش‌بینی‌های مالی نویزی اثرگذار نبود. دامنه تست جامع بود: دو مدل، سه استک Embedding و چهار هدف بازیابی:

  1. تاریخچه خود مدل.
  2. همتایان بخشی (Sector Peers).
  3. یک آداپتور REPLUG-LSR تحت نظارت نتایج.
  4. برش‌های شرطی نیچ (Niche-conditional slicing).

علاوه بر این، سه پارادایم مورد آزمایش قرار گرفت: شباهت (Similarity)، تقطیر تحت نظارت نتایج (Outcome-supervised distillation) و استخراج ویژگی‌های ساختاریافته. در هر مورد، «تست سلامت» (Sanity Check) پاس شد — یعنی RAG فعال شد و ۲۵٪ تا ۳۳٪ از تصمیمات مدل را تغییر داد. با این حال، این تصمیمات تغییر یافته از نظر آماری با «نویز» در برابر نتایج واقعی آینده تفاوتی نداشتند. نرخ برد تغییر یافته ($\Delta$WR) حول محور صفر می‌چرخید و حتی پس از تصحیح مقایسه‌های متعدد، فواصل اطمینان همچنان صفر را در بر می‌گرفتند.

مکانیسم شکست دقیق بود: RAG بزرگیِ امتیاز (Score Magnitude) را تقویت می‌کرد بدون اینکه بداند آیا تاریخچه بازیابی شده واقعاً مرتبط است یا خیر. زمینه تاریخی مثبت، مدل را سوق می‌داد تا حتی زمانی که شرایط فعلی معکوس شده بود، خوش‌بین‌تر (Bullish) باشد. RAG «اعتماد به نفس» را اضافه کرد، نه «صحت» را.

تله‌ی آلفای ظاهری (Apparent-Alpha)

یکی از گونه‌های RAG برنده به نظر می‌رسید و آلفای ظاهری ۱۱٪+ در سال را ثبت کرد — رقمی که معمولاً برای عملیاتی کردن یک استراتژی کافی است. با این حال، AUC رتبه‌بندی آن ۰.۴۸۶ بود، که بدتر از پرتاب سکه است.

این سود ۱۱٪+ نتیجه «بهره‌برداری از رژیم» (Regime Exploitation) بود، نه مهارت. زیرا مدل بیشتر اوقات کلاس اکثریت را پیش‌بینی کرده بود و پنجره ارزیابی به‌طور اتفاقی آن کلاس را پاداش داده بود، P&L مثبت به نظر می‌رسید. با این حال، رتبه‌بندی با AUC زیر ۰.۵ هیچ توانایی در تشخیص برندگان از بازندگان ندارد. این خطرناک‌ترین نوع شکست است: معیاری که توسعه‌دهنده را خوشحال می‌کند (P&L) و معیاری که حقیقت را می‌گوید (AUC/کالیبراسیون) در جهت‌های مخالف هستند.

جایگاه واقعی RAG

علیرغم این شکست‌ها در پیش‌بینی، RAG برای وظایفی که ماهیت بازیابی دارند، ضروری باقی می‌ماند. برای مثال، استفاده از جست‌وجوی زنده در مقابل حافظه ایستا راهکاری موثر برای توقف توهمات در بسیاری از کاربردهاست. RAG در پیش‌بینی شکست خورد، اما در موارد زیر موفق بود:

  • پایگاه‌های دانش قابل جستجو: استخراج زمینه مرتبط برای مطالعه انسان.
  • دسترسی به حقایق: دادن دسترسی به سیستم به واقعیت‌هایی که روی آن‌ها آموزش ندیده است.
  • جستجوی معنایی کد: یافتن کدها بر اساس مفهوم.
  • حافظه فعال: دادن حافظه عملکردی به یک عامل (همان‌طور که در RE-call دیده شد).

RAG آنچه را که مدل می‌بیند تغییر می‌دهد، اما تغییر نمی‌کند که آیا هدف (Target) قابل پیش‌بینی است یا خیر. اگر سیگنال در داده‌ها باشد، بازیابی آن را بیرون می‌کشد. اگر نباشد، بازیابی فقط راهی با اعتماد به نفس بیشتر برای اشتباه کردن به مدل می‌دهد.

قانون پیش‌بینی‌پذیری

وقتی این شکست‌ها را کنار هم می‌گذارید، همه یک شکل دارند. تنظیم دقیق لغات و رفتار را مدیریت می‌کند؛ RAG زمینه در دسترس را مدیریت می‌کند. هیچ‌کدام به این سوال بنیادین پاسخ نمی‌دهند: «آیا هدف واقعاً تابعی از ورودی‌ها است؟»

بنابراین درخت تصمیم برای پیاده‌سازی AI باید این‌گونه باشد:

  • «مدل کلمات/فرمت/دامنه من را نمی‌شناسد» $\rightarrow$ تنظیم دقیق (Fine-tune). از Embedder برای مشکلات بازیابی (اگر لغات متفاوت است) یا از LLM برای سبک و رفتار استفاده کنید. همیشه با معیارهای پایین‌دستی (Downstream) اندازه‌گیری کنید، هرگز با تابع زیان (Loss) بسنجید.
  • «مدل نمی‌تواند به حقایق/کدها/حافظه دسترسی داشته باشد» $\rightarrow$ از RAG استفاده کنید. اینجا قلمرو اصلی آن است. برای بهینه‌سازی این بخش، برخی از توسعه‌دهندگان از روش‌های پیشرفته‌تری مانند تکه‌بندی عامل‌محور برای حذف توهمات در سیستم‌های RAG بهره می‌برند.
  • «مدل باید نتیجه نویزی من را بهتر پیش‌بینی کند» $\rightarrow$ هیچ‌کدام از این دو نجات‌تان نمی‌دهند. هیچ مقدار تنظیم دقیق یا بازیابی نمی‌تواند سیگنالی را که در داده‌ها نیست، خلق کند.

نقش حیاتی ارزیابی

تقریباً تمام این آزمایش‌ها امیدوارکننده به نظر می‌رسیدند تا زمانی که ارزیابی «صادقانه» شد. مدل بزرگ‌تر در زیان پیروز شد؛ گونه شکست‌خورده RAG در P&L پیروز شد؛ تقسیم‌بندی‌های ساده‌لوحانه بردهای چشم‌گیری تولید کردند.

اما تقسیم‌بندی‌های Walk-forward، آزمون‌های جایگشتی، تصحیح مقایسه‌های متعدد و دروازه‌های کالیبراسیون الزام‌آور، توده‌ای از بردهای جعلی را به دوازده «نه» قابل اعتماد و دو «بله» واقعی تبدیل کردند. تکنیک پیاده‌سازی RAG یا تنظیم دقیق بخش آسان کار است؛ دانستن اینکه آیا آن‌ها واقعاً عمل کرده‌اند یا خیر، تمامِ شغل است.

برای بررسی عمیق‌تر، مطالعات بازیابی و تنظیم دقیق Embedder از طریق RE-call در دسترس هستند. کاربرد RAG برای جستجوی کد و حافظه عامل در سری Beyond the Prompt در Claude Code با جزئیات ذکر شده است. اگر در شرف تنظیم دقیق یا افزودن RAG هستید، ابتدا یک ارزیابی صادقانه انجام دهید — این کار بسیار ارزان‌تر از تعقیب یک سراب است.

چرا این موضوع مهم است؟

این یافته‌ها اعتبار تکیه بر بنچمارک‌های کلی را برای کاربردهای تخصصی مالی می‌گیرد. تخصص در ارزیابی (Evaluation) اکنون مهم‌تر از انتخاب مدل است، زیرا مدل‌های بزرگ‌تر در داده‌های نویزی تمایل به ایجاد «توهم موفقیت» دارند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی در حوزه‌ی فین‌تک، این خبر خبر از کاهش هزینه است؛ چرا که استفاده از مدل‌های کوچک‌تر و بازمتن به جای APIهای گران‌قیمت، در پیش‌بینی‌های نویزی نتایج بهتری می‌دهد.

·نگاه ما
تحریریه دات‌هوش

بزرگ‌ترین توهم فعلی در توسعه AI این است که «مقیاس» (Scale) می‌تواند جایگزین «سیگنال» شود. این نتایج ثابت می‌کند که در حوزه‌هایی مثل مالی، افزایش پارامترها نه تنها کمک نمی‌کند، بلکه به دلیل حافظه قوی‌تر، مدل را به سمت حفظ نویزها می‌برد. استراتژی درست، بازگشت به مدل‌های کوچک‌تر و تمرکز بر مهندسی ویژگی است، نه امید به معجزه در لایه‌های ترنسفورمر.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.