پرش به محتوای اصلی
پرش به محتوای مقاله

هوش مصنوعی Ataraxos با هزینه‌ای کمتر از ۸ هزار دلار قهرمان جهان در Stratego را

·۹ مهر ۱۴۰۵۵ دقیقه مطالعه
هوش مصنوعی قهرمان استراتژو را شکست داد و یکی از آخرین قلعه‌های انسانی در بازی‌های رومیزی را فتح کرد.
هوش مصنوعی قهرمان استراتژو را شکست داد و یکی از آخرین قلعه‌های انسانی در بازی‌های رومیزی را فتح کرد.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کاهش هزینه محاسباتی از میلیون‌ها دلار به کمتر از ۸ هزار دلار برای شکست دادن قهرمان جهان در یک بازی با اطلاعات ناقص؛ این اولین بار است که بهره‌وری در معماری بر قدرت سخت‌افزاری غلبه می‌کند.

تصور کنید با بودجه‌ای که برای خرید یک لپ‌تاپ رده‌بالا هزینه می‌کنید، بتوانید سخت‌ترین قلعه‌ی ذهنی یکی از باهوش‌ترین انسان‌های زمین را تسخیر کنید. این دقیقاً همان اتفاقی است که در دنیای بازی‌های استراتژیک رخ داده است.

یک سامانه هوش مصنوعی به نام Ataraxos توانست برتری دیرینه انسان در بازی Stratego را از بین ببرد و موفق شود پرافتخارترین بازیکن تاریخ این بازی را شکست دهد. این پیروزی، سقوط یکی از آخرین بازی‌های تخته‌ای رقابتی است که در آن انسان‌ها همچنان بر ماشین‌ها برتری داشتند.

بازی Stratego برای هوش مصنوعی یک آزمون دشوار است چون بر پایه «اطلاعات ناقص» بنا شده است. در این بازی، هر دو بازیکن ۴۰ مهره را به‌صورت رو به پایین و مخفی می‌چینند که بیش از ۱۰ به توان ۳۳ حالت شروع مختلف ایجاد می‌کند. رتبه هر مهره تنها هنگام برخورد با مهره حریف فاش می‌شود و هدف نهایی، تصرف پرچم دشمن است. به همین دلیل، هوش مصنوعی باید به‌جای تکیه بر وضعیت مشهود صفحه، بر اساس حدس‌ها و الگوها تصمیم بگیرد.

پیچیدگی اطلاعات پنهان

ساموئل سوکوتا (Samuel Sokota)، نویسنده اول این پژوهش، در شبکه اجتماعی X توضیح داد که در بازی‌های با اطلاعات ناقص، ارزش یک حرکت نه تنها به نحوه ادامه بازی، بلکه به اتفاقاتی که قبل و حین تصمیم‌گیری رخ داده، بستگی دارد. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی امنیت مدل‌های بازمتن و چالش‌های استدلال دیدیم، مدیریت عدم قطعیت سخت‌ترین بخش یادگیری ماشین است. این چالش‌ها در مدل‌های پیشرفته‌تر نیز دیده می‌شود؛ برای مثال، برخی مدل‌های داخلی OpenAI در حل مسائل پیچیده ریاضی با همین دشواری‌های استدلالی رو‌به‌رو بوده‌اند.

روش‌های پیشین که از هوش مصنوعی پوکر گرفته شده بودند، تنها زمانی کار می‌کردند که اطلاعات پنهان کم باشد. برای مثال، در پوکر تگزاس هولدم تنها ۱,۳۲۶ دست شروع ممکن است. اما در Stratego، تلاش محاسباتی مورد نیاز برای این روش‌ها با افزایش حجم اطلاعات پنهان، به‌صورت نمایی رشد می‌کند و سیستم‌ها را به بن‌بست می‌کشاند.

سال‌ها بود که این پیچیدگی حتی غول‌های این حوزه را متوقف کرده بود. طبق مستندات پژوهشی، شرکت DeepMind پیش‌تر با سامانه DeepNash تلاش کرد این بازی را فتح کند. این سامانه روی ۱۰۲۴ گره TPU (واحد پردازش تنسور) — شبیه به هزاران پردازنده قدرتمند که در یک اتاق بزرگ برای پردازش داده‌های عظیم کنار هم قرار گرفته‌اند — به مدت سه ماه آموزش دید. تخمین زده می‌شود هزینه این فرآیند با قیمت‌های سال ۲۰۲۵، بین ۳ تا ۴.۵ میلیون دلار باشد. با این حال، DeepNash در برابر بازیکنان تراز اول، از جمله اسطوره این بازی، «نیمایر» (Niemeijer)، شکست خورد. در مسابقات جهانی ۲۰۲۳، DeepNash توانست ۱۹ بازی از ۲۸ مورد را ببرد، اما در نهایت نتوانست اکثر رقبای سطح اول را شکست دهد.

جهش در بهره‌وری

در مقابل، Ataraxos پیروزی خود را نه با بودجه شرکتی، بلکه با بودجه دانشگاهی به دست آورد. پژوهشگران از ۱۶ واحد پردازش گرافیکی GPU (واحد پردازش گرافیکی) — مثل موتورهای شتاب‌دهنده‌ای که هر لحظه هزاران محاسبه کوچک را برای رندر کردن تصاویر یا اجرای مدل‌ها انجام می‌دهند — به مدت یک هفته استفاده کردند. علاوه بر این، چهار روز دیگر را روی چهار GPU برای یک شبکه باور تخصصی صرف کردند. هزینه کل این محاسبات با قیمت‌های سال ۲۰۲۵، کمتر از ۸,۰۰۰ دلار بود.

این جهش در بهره‌وری در مقایسه با DeepNash تکان‌دهنده است:

  • هزینه محاسبات: ۱/۵۰۰ هزینه تلاش قبلی
  • تعداد بازی‌های خود-بازی (Self-play): ۱/۳۰ حجم قبلی
  • نمونه‌های آموزشی: ۱/۱۰۰ داده‌های قبلی

تیم سازنده این موفقیت را مدیون یک شبیه‌ساز اختصاصی GPU و بهره‌وری بسیار بالاتر در نمونه‌برداری می‌داند. سوکوتا اشاره کرد که تیم آن‌ها به دلیل محدودیت در منابع محاسباتی دانشگاهی، به ترفندهایی متکی بود که طی سال‌ها یاد گرفته بودند. به گزارش منابع، وقتی پژوهشگران پیشنهاد رویارویی مستقیم Ataraxos و DeepNash را دادند، گوگل این درخواست را رد کرد چون کد DeepNash دیگر قابل اجرا نیست.

هوش مصنوعی بزرگ‌ترین بازیکن استراتژو را شکست داد و یکی از آخرین سنگرهای انسانی در بازی‌های رومیزی را فتح کرد.

مکانیسم پیروزی

Ataraxos صرفاً از طریق «خود-بازی» (Self-play) و بدون هیچ داده‌ای از بازی‌های انسانی یاد می‌گیرد. راز موفقیت آن در تکنیکی به نام منظم‌سازی (Regularization) — شبیه به یک مربی که بازیکن را مجبور می‌کند هر بار استراتژی متفاوتی را امتحان کند تا قابل پیش‌بینی نباشد — نهفته است. در Stratego، بازیکنان پیش‌بینی‌پذیر به‌راحتی توسط حریف مورد بهره‌برداری قرار می‌گیرند؛ Ataraxos با پخش کردن چیدمان‌ها و حرکات خود در مراحل اولیه آموزش، از این تله می‌گریزد.

با پیشرفت آموزش، سامانه گام‌های یادگیری خود را تغییر می‌دهد. ابتدا با تغییرات شدید و جهش‌های بزرگ شروع می‌کند و سپس به اصلاحات کوچک و دقیق می‌رسد. این کار مانع از آن می‌شود که فرآیند یادگیری دچار هرج‌ومرج یا حلقه‌های تکراری شود، که یک شکست رایج در بازی‌های با اطلاعات پنهان است. پژوهشگران منظم‌سازی را به یک «ذخیره انرژی» تشبیه می‌کنند؛ اگر AI این انرژی را خیلی سریع مصرف کند، در ابتدا پیشرفت سریعی دارد اما سپس به‌راحتی قابل پیش‌بینی و شکست می‌خورد.

برای مدیریت «مه جنگ» یا همان اطلاعات پنهان، این هوش مصنوعی از یک شبکه باور (Belief Network) استفاده می‌کند. این شبکه هویت مهره‌های پنهان حریف را پیش‌بینی می‌کند. قبل از هر حرکت، AI حالت‌های احتمالی بازی را تولید کرده و یک گام یادگیری اضافی را صرفاً برای همان تصمیم اجرا می‌کند. نویسندگان مقاله اشاره می‌کنند که کارهای قبلی از این نوع جست‌وجو صرف‌نظر می‌کردند چون با توجه به حجم اطلاعات پنهان، بسیار دشوار تلقی می‌شد.

رویارویی با انسان

در مجموعه‌ای از مسابقات که طی سه هفته در سال ۲۰۲۵ برگزار شد، Ataraxos با «نیمایر» رو‌به‌رو شد؛ مردی که چهار بار قهرمان جهان شده، ۱۵ عنوان قهرمانی ملی هلند و دو قهرمانی جهانی آنلاین را در کارنامه دارد. نیمایر بیش از ۶۰۰ هفته در صدر رتبه‌بندی جهانی بود و جورج فرانکا — تنها بازیکنی که در تمام مسابقات جهانی از سال ۱۹۹۷ شرکت کرده — او را «بهترین بازیکن تاریخ Stratego» می‌نامد.

برای اطمینان از اعتبار نتایج، پژوهشگران به نیمایر زمان کافی برای آماده‌سازی دادند و برای مشارکت او ۱,۰۰۰ دلار پرداخت کردند، به علاوه ۱۰۰ دلار برای هر برد و ۵۰ دلار برای هر تساوی. نیمایر می‌دانست که Ataraxos نمی‌تواند استراتژی خود را با سبک او تطبیق دهد، اما همچنان با یک نقص ساختاری رو‌به‌رو بود. وینسنت دی بور، قهرمان سه دوره جهان، این موضوع را یک نقص بزرگ می‌داند که AI نمی‌توانست خود را با انسان وفق دهد، در حالی که انسان می‌توانست در طول بازی‌های متعدد، خود را با AI تطبیق دهد.

با وجود این، Ataraxos نرخ برد ۸۵ درصدی (با احتساب تساوی‌ها به عنوان نیم‌برد) را ثبت کرد. این حاشیه پیروزی در بالاترین سطح بازی، بی‌سابقه است. مکس روئلوفس، نایب‌قهرمان سه دوره مسابقات جهانی، اشاره کرد که حاشیه پیروزی در سطوح بالا معمولاً بسیار کم است زیرا بازی بازیکنان را مجبور به ریسک می‌کند.

عملکرد و سبک بازی

Ataraxos همچنین در یک نمایش در مسابقات جهانی ۲۰۲۵ Stratego درخشید و ۳۸ بازی از ۴۰ مورد را مقابل بازیکنان تورنمنت برد. حریفان انسانی سبک بازی او را «غیرقابل خواندن» توصیف کردند:

  • ریسک‌پذیری: اجرای بلوف‌هایی که انسان‌ها بیش از حد خطرناک می‌دانند.
  • پشتکار: لجاجت در زمان عقب بودن که برخی بازیکنان آن را «بی‌ادبانه» دانستند.
  • دقت: شانس عجیبی در قرار دادن مهره‌ها در جای درست دارد، گویی همیشه مهره‌ها دقیقاً در نقطه مورد نیاز هستند.

فراتر از صفحه بازی

کاربرد این معماری فراتر از بازی‌های تخته‌ای است. پژوهشگران همین متد را روی سیستم‌های پیچیده دیگر هم پیاده کردند:

  • در Barrage Stratego، این AI در چهار سری ۵۰ بازی مقابل سه نفر از چهار بازیکن برتر جهان (که همگی دو بار قهرمان جهان Barrage بودند) پیروز شد.
  • در بازی کارتی Hanabi، رکوردهای جدیدی در تمام نسخه‌های این بازی همکاری ثبت کرد و در نسخه دو نفره، دو مرتبه (۱۰۰ برابر) کمتر از پیشروان قبلی هزینه محاسباتی مصرف کرد.
  • در بازی Dou dizhu نیز سیستم‌های معیار قبلی مانند PerfectDou و DouZero را شکست داد.

این تیم با اثبات اینکه حجم زیاد اطلاعات پنهان دیگر مانعی برای یادگیری تقویتی (Reinforcement Learning) و جست‌وجو نیست، معتقد است که هوش مصنوعی کاربردی برای مسائل استراتژیک دنیای واقعی — مانند بازارهای مالی، درگیری‌های نظامی و مذاکرات دیپلماتیک — در دسترس است، به شرطی که شبیه‌سازهای سریع و دقیق ساخته شوند. در بازارهای مالی نیز مدیریت دقیق نقاط خروج و ورود حیاتی است، مشابه آنچه در راهکارهای KestrelQuant برای حفظ سرمایه مشاهده می‌کنیم.

تنها محدودیت فعلی این است که متد جست‌وجوی فعلی، تنها یک گام یادگیری را تقلید می‌کند؛ یعنی نمی‌توان صرفاً با دادن زمان محاسباتی بیشتر در حین بازی، عملکرد را بهبود داد. یک متد جست‌وجوی پیچیده‌تر می‌تواند این سقف را بشکند. تیم سازنده کد Ataraxos را به‌صورت عمومی منتشر کرده است.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، کد باز Ataraxos را بررسی کنید تا با مکانیزم Regularization در محیط‌های با اطلاعات ناقص آشنا شوید.
  • در مورد کاربرد Belief Networks برای پیش‌بینی متغیرهای پنهان در تحلیل داده‌های تجاری مطالعه کنید.
  • منتظر گزارش‌های مربوط به استقرار این متد در شبیه‌سازهای نظامی و مالی باشید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell و بهینه‌سازی استنتاج مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص در یادگیری تقویتی، مرز بین شبیه‌سازی بازی و حل مسائل پیچیده استراتژیک واقعی را از بین می‌برد. اکنون مدل‌های AI می‌توانند در محیط‌هایی که داده‌ها ناقص یا مخفی هستند (مانند دیپلماسی یا بازار سرمایه) با دقت بسیار بالاتری عمل کنند.

تأثیر برای ایران

این پژوهش برای محققان هوش مصنوعی در ایران که با محدودیت شدید سخت‌افزاری و GPU رو‌به‌رو هستند، یک الگوی امیدوارکننده است؛ چرا که ثابت می‌کند با بهینه‌سازی الگوریتم می‌توان نتایجی در سطح جهانی گرفت.

·نگاه ما
تحریریه دات‌هوش

شکست DeepMind توسط یک تیم دانشگاهی با بودجه‌ای ناچیز، پایان عصر «برتری از طریق مقیاس» (Scaling Law) را در حل مسائل استراتژیک اعلام می‌کند. این نتیجه نشان می‌دهد که در محیط‌های با اطلاعات ناقص، معماری هوشمندانه و بهره‌وری در نمونه‌برداری بسیار حیاتی‌تر از ریختن میلیاردها دلار روی سخت‌افزار است. در واقع، Ataraxos ثابت کرد که «تفکر» در AI می‌تواند جایگزین «قدرت خام» شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.