پرش به محتوای اصلی
پرش به محتوای مقاله

بسیاری از بنچمارک‌های هوش مصنوعی گزارشِ شانس هستند، نه برتری الگوریتمی

·۳ شهریور ۱۴۰۵۶ دقیقه مطالعه
تحلیل
شش پست درباره گروه‌بندی و تنظیم، و آن چیز ناخوشایندی که همه درباره‌اش شدند.
شش پست درباره گروه‌بندی و تنظیم، و آن چیز ناخوشایندی که همه درباره‌اش شدند.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اثبات ریاضی این موضوع که در بسیاری از متدهای Tuning، نویز بذر تصادفی از اثر خودِ الگوریتم بزرگ‌تر است و عملاً نتایج را به شانس تبدیل می‌کند.

اگر امروز بر اساس یک افزایش ۰.۰۰۱ در صحت مدل، روشی را «بهینه» می‌نامید، احتمالاً در حال اندازه‌گیری شانس هستید، نه مهارت الگوریتمی. در دنیای یادگیری ماشین، تکرار یک آزمایش دو بار، بسیار حیاتی‌تر از انتخاب پیچیده‌ترین الگوریتم است. در مجموعه‌ای از ۶ تحلیل فنی عمیق که در ۲۵ اوت ۲۰۲۶ منتشر شد، یک پژوهشگر دریافت که بهبودهای ادعایی در روش‌های ترکیبی (Ensemble) و تنظیمات پیشرفته، اغلب کوچک‌تر از واریانس (Variance) — یا همان تفاوت‌های تصادفی در نتایج — است که تنها با تغییر یک بذر (Seed) ایجاد می‌شود.

برای اکثر متخصصان، تلاش برای یافتن تنظیمات «کامل» هایپرپارامترها شبیه به یک قمار است. ما اغلب افزایش ۰.۰۰۱ در دقت را به عنوان پیروزی یک متد خاص جشن می‌گیریم، اما این نگاه، نویز ذاتی در نحوه مقداردهی اولیه مدل‌ها و پردازش داده‌ها را نادیده می‌گیرد. این همان «رگه‌ی ناراحت‌کننده» در آزمایش‌های مدرن یادگیری ماشین است: ما در واقع در حال اندازه‌گیری شانس هستیم و سپس نام یک متد را روی آن می‌گذاریم.

زمینه و بستر تحلیل (The Context of the Arc Six)

یافته‌های این پژوهش از مجموعه‌ای از ۶ پست به دست آمد که هدف اولیه آن‌ها مقایسه روش‌های ترکیبی و تنظیمات بود. نویسنده در ابتدا قصد نداشت این مجموعه را به عنوان مطالعه‌ای درباره «خطای اندازه‌گیری» طراحی کند. با این حال، تا پست چهارم، الگویی ظاهر شد که نادیده گرفتن آن غیرممکن بود: شکاف بین متدهای مختلف، به طور مداوم کوچک‌تر از پراکندگی نتایج یک متد در برابر بذر (Seed) خودش بود.

این درک به این معناست که بسیاری از مقایسه‌های منتشر شده در این حوزه، به جای برتری الگوریتمی، در واقع گزارشِ شانس هستند. این موضوع اهمیت ارزیابی مدل‌ها بر اساس کدبیس‌های اختصاصی را دوچندان می‌کند تا به جای تکیه بر رده‌بندی‌های عمومی، پایداری مدل در محیط واقعی سنجیده شود. این سری تحلیل‌ها به دو محور اصلی تقسیم شده بود: نخست، نحوه مدیریت مدل‌های متعدد (Ensemble) و دوم، نحوه جست‌وجو برای تنظیمات بهینه یک مدل واحد.

توهمِ برتری در روش‌های ترکیبی

این تحقیق ابتدا روش استکینگ (Stacking) را بررسی کرد؛ سیستمی که در آن یک مدل کوچک (Combiner)، پیش‌بینی‌های مدل‌های دیگر را ترکیب می‌کند. برای اجرای درست این روش، مدل ترکیب‌کننده باید روی پیش‌بینی‌هایی آموزش ببیند که برای ردیف‌هایی تولید شده‌اند که مدل‌های پایه هرگز آن‌ها را ندیده‌اند. وقتی این کار به درستی انجام شد، مدل به صحت ۰.۹۳۳۱ در برابر ۰.۹۳۰۱ مدل تک‌بهترین رسید؛ بردی واقعی اما بسیار کوچک.

اما خطاهای رویه‌ای می‌توانند منجر به تفسیرهای فاجعه‌بار شوند. آموزش مدل ترکیب‌کننده روی پیش‌بینی‌های درون-تا (In-fold predictions) باعث ایجاد یک «نشت داده» (Data Leakage) شد. این نشت باعث شد وزن ۱.۱۲۳ به یک جنگل تصادفی (Random Forest) و وزن ۰.۰۳۵ به یک Gradient Booster اختصاص یابد، در حالی که دومی واقعاً مدل بهتری بود. این نشت صرفاً امتیاز را بالا نبرد، بلکه مدل اشتباهی را انتخاب کرد؛ زیرا یک جنگل تصادفی که ردیف‌های حفظ‌شده‌اش را پیش‌بینی می‌کند، شبیه به یک پیش‌گوی مطلق (Oracle) به نظر می‌رسد.

روش‌های بلندینگ (Blending) و رأی‌گیری (Voting) نیز شکنندگی مشابهی داشتند:

  • رأی‌گیری: این روش هیچ پارامتر یادگیری ندارد و نمی‌تواند نتایج را بیش از حد جلوه دهد. این متد در هر دو معیار سخت (۰.۹۲۹۶) و نرم (۰.۹۲۸۹)، در برابر بهترین مدل تک‌بهترین شکست خورد. رأی‌گیری نرم (Soft Voting) نتوانست بر رأی‌گیری سخت غلبه کند، زیرا اعضایی با احتمالات بد-کالیبره شده را در میانگین خود دخالت داده بود.
  • بلندینگ: عملکرد این روش بسته به اندازه داده‌های کنار گذاشته شده (Holdout size)، نوسان شدیدی داشت. با ۱۵۰ ردیف داده برای هر وزن، این روش با عدد ۰.۲۰۵۵ برنده همه شد. اما با تنها ۴۰ ردیف، عدد ۰.۱۴۹۲ را گزارش کرد در حالی که در عمل ۰.۲۵۷۶ تحویل داد؛ نتیجه‌ای که حتی از میانگین ساده و بدون وزن ۰.۲۵۱۵ نیز بدتر بود.

شش پست درباره مجموعه‌ها و تنظیم، و آن چیز ناخوشایندی که همه درباره‌اش شدند.

تنظیمات: نویز در برابر سیگنال

مقایسه بین جست‌وجوی شبکه‌ای (Grid Search) و جست‌وجوی تصادفی (Random Search) بحران اندازه‌گیری را آشکار کرد. برتری جست‌وجوی تصادفی یک مکانیسم واقعی است و همان‌طور که تبلیغ می‌شود عمل می‌کند، اما شکاف‌ها بسیار ناچیز بودند: ۰.۰۰۰۸ برای سه پارامتر و ۰.۰۰۳۹ برای شش پارامتر.

در مقابل، پراکندگی نتایج جست‌وجوی تصادفی در برابر بذرهای مختلف خودش ۰.۰۰۹۸ بود. چون نویز (۰.۰۰۹۸) از اثر متد (۰.۰۰۰۸ تا ۰.۰۰۳۹) بزرگ‌تر است، جست‌وجوی شبکه‌ای دقیقاً در ۵ مورد از ۱۰ بذر تصادفی برنده شد. این یعنی یک آزمایش تک‌بذری، شانس ۵۰-۵۰ دارد که هر کدام از این دو متد را برنده اعلام کند.

اما بهینه‌سازی بیزی (Bayesian Optimization یا TPE) سیگنال متفاوتی داد. برتری این روش با افزایش بودجه محاسباتی رشد کرد:

  • ۲۰ آزمایش: ۰.۰۰۳۲
  • ۵۰ آزمایش: ۰.۰۰۵۱
  • ۱۲۰ آزمایش: ۰.۰۰۶۳

این رشد، امضای متدی است که واقعاً از نتایجش یاد می‌گیرد. مهم‌تر از آن، پراکندگی نتایج در این روش به طرز چشمگیری کم بود. یک نسخه سی‌خطی از این متد، در سه بذر مختلف، در محدوده ۰.۰۰۰۴ قرار گرفت. در مقابل، جست‌وجوی تصادفی پراکندگی ۰.۰۱۲۸ داشت — یعنی ۳۲ برابر گسترده‌تر — برای میانگین برتری ناچیز ۰.۰۰۱۵. ارزش بهینه‌سازی بیزی لزوماً در رسیدن به جواب بهتر نیست، بلکه در ارائه جوابی است که به شانس وابسته نیست.

هزینه معیارهای «بروشوری»

ادعاهای مربوط به کارایی نیز اغلب گمراه‌کننده هستند. پژوهشگر دریافت که دو خط کد برای هرس کردن (Pruning) باعث حذف ۱۲ مورد از ۲۰ آزمایش و کاهش ۲۸ درصدی زمان اجرا (Wall-clock time) شد، اما هزینه آن افزایش تابع زیان (Log loss) از ۰.۱۹۰۸ به ۰.۱۹۱۳ بود.

با این حال، «نرخ حذف» (Kill rate) آزمایش‌ها با زمان واقعی ذخیره شده همخوانی نداشت، زیرا هر آزمایش حتی اگر زود متوقف شود، باز هم هزینه دوره گرم‌شدن (Warm-up period) را می‌پردازد. گزارش کردن نرخ حذف به جای زمان واقعی، همان‌طور که نویسنده می‌گوید، «نقل‌قول از بروشور» است، نه گزارش فنی. این رویکرد در تضاد با تلاش‌هایی است که برای فشرده‌سازی استدلال در وزن‌های مدل از طریق تقطیر محاسبات زمان استنتاج صورت می‌گیرد تا کارایی واقعی جایگزین اعداد نمایشی شود.

خلاصه اثر در برابر نویز

بر اساس مستندات این گزارش، تضاد شدیدی بین اثرات ادعایی و نویز واقعی وجود دارد:

  • شبکه‌ای در برابر تصادفی (۳ پارامتر): اثر ۰.۰۰۰۸ در برابر نویز ۰.۰۰۹۸
  • شبکه‌ای در برابر تصادفی (۶ پارامتر): اثر ۰.۰۰۳۹ در برابر نویز ۰.۰۰۹۸
  • TPE در برابر تصادفی (۲۰ آزمایش): اثر ۰.۰۰۳۲ در برابر نویز ۰.۰۱۲۸
  • بلندینگ در برابر میانگین: داده‌های کم ادعای ۰.۱۴۹۲ دارند اما ۰.۲۵۷۶ تحویل می‌دهند
  • استکینگ: تنظیمات دارای نشت، مدل کاملاً اشتباهی را انتخاب می‌کنند

در سه مورد اول، برتری ادعایی کاملاً توسط نویز محیط بلعیده شده است. در دو مورد آخر نیز مشکل از انتخاب الگوریتم نبود، بلکه روش اندازه‌گیری اشتباه بود. در این موارد، پژوهشگر الگوریتم غلطی انتخاب نکرده بود، بلکه آن را غلط اندازه گرفته بود.

درس‌هایی در توزیع و اجرا

فراتر از ریاضیات، یک درس در مورد توزیع محتوا وجود دارد. انتشار چهار پست در ۱۰ دقیقه باعث سقوط شدید بازدیدها شد: دو پست اول ۲۰ و ۱۲ بازدید گرفتند، اما دو پست آخر ۱ و ۰ بازدید داشتند. این نشان می‌دهد فاصله زمانی در انتشار، بسیار مهم‌تر از خالی کردن صف مقالات است.

این تغییر دیدگاه، تمرین بنیادی تنظیم مدل را عوض می‌کند. ارزشمندترین مهارت دیگر دانستن تکنیک‌های پیشرفته ترکیبی نیست، بلکه ایجاد یک عادت خسته‌کننده است: اجرای یک آزمایش با بذرهای مختلف و گزارش پراکندگی نتایج به جای گزارشِ «بهترین عدد». این عادت فقط یک حلقه تکرار اضافه هزینه دارد، اما می‌تواند نیمی از ادعاهای یک پژوهشگر را باطل کند.

برای یک توسعه‌دهنده معمولی، این یعنی مدل «بهینه شده» شما ممکن است فقط یک بذر خوش‌شانس باشد. اگر نمی‌توانید ثابت کنید بهبود شما بزرگ‌تر از واریانس مدل در برابر خودش است، شما متد بهتری پیدا نکرده‌اید؛ فقط یک اجرای خوش‌شانس داشتید.

برای پیشروی، متخصصان باید پایداری (Stability) را بر امتیازات اوج (Peak Scores) ترجیح دهند. هدف باید یافتن متدی باشد که نتایج ثابتی در چندین بذر ارائه دهد، نه متدی که از طریق شانس به یک نقطه اوج تک‌باره برسد. قبل از اینکه پست «X بر Y برنده شد» را منتشر کنید، X را دو بار اجرا کنید و ببینید آیا X بر خودش پیروز می‌شود یا خیر.

گام بعدی شما

  • هرگز بر اساس یک اجرای تک‌بذری (Single Seed) تصمیم نگیرید؛ حداقل ۳ بذر مختلف را تست کنید.
  • به جای گزارش بالاترین عدد (Peak Score)، میانگین و انحراف معیار نتایج را گزارش کنید.
  • در روش‌های ترکیبی، ابتدا از نشت داده (Data Leakage) در مرحله آموزش مدل ترکیب‌کننده مطمئن شوید.

اما داستان سخت‌افزاری این نوسانات حتی پیچیده‌تر است — به تحلیل ما درباره تأثیر حافظه VRAM بر پایداری استنتاج مراجعه کنید.

چرا این موضوع مهم است؟

این موضوع اعتبار بنچمارک‌های فعلی هوش مصنوعی را زیر سوال می‌برد و نشان می‌دهد تخصص واقعی در پایداری مدل است، نه ثبت رکوردهای تصادفی. اعتماد به نتایج بدون گزارش واریانس، ریسک شکست مدل‌ها در محیط عملیاتی را افزایش می‌دهد.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت منابع محاسباتی (GPU) روبرو هستند، این خبر یک نکته حیاتی است: به جای صرف زمان و هزینه برای متدهای پیچیده و گران‌قیمت، تمرکز روی پایداری مدل با بذرهای مختلف، بازدهی واقعی‌تری دارد.

·نگاه ما
تحریریه دات‌هوش

بسیاری از مقالات پژوهشی در حوزه ML دچار «سوگیری تایید» هستند و تنها نتایج خوش‌شانس را منتشر می‌کنند. این یافته نشان می‌دهد که ما به جای پیشرفت در معماری، در حال پیشرفت در هنرِ «گزارش‌دهی گزینشی» هستیم. برای خروج از این وضعیت، استانداردهای داوری مقالات باید از گزارش عدد به گزارش توزیع تغییر کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.