پرش به محتوای اصلی
پرش به محتوای مقاله

درون مسیر ۱۵ ساله دیپ‌مایند از بازی‌های ساده تا EVE Online

·۳۰ مرداد ۱۴۰۵۴ دقیقه مطالعه۱ بازدید
۱۵ سال پژوهش بازی گوگل دیپ‌مایند و مسیر رسیدن به بازی EVE Online
۱۵ سال پژوهش بازی گوگل دیپ‌مایند و مسیر رسیدن به بازی EVE Online
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

انتقال از حل مسائل در محیط‌های بسته به استقرار عامل‌ها در یک شبیه‌ساز اقتصادی-سیاسی ۲۳ ساله؛ جایی که حافظه بلندمدت یک ضرورت عملی است، نه یک ویژگی تکمیلی.

تصور کنید عاملی که نه برای یک بازی کوتاه، بلکه برای زندگی در یک دنیای دیجیتال دائمی طراحی شده است؛ عاملی که باید هفته‌ها برنامه‌ریزی کند و در یک اقتصاد واقعی مذاکره نماید. گوگل دیپ‌مایند در ۲۱ اوت ۲۰۲۶ اعلام کرد که هدفش دیگر صرفاً پیروزی در بازی‌های تک‌امتیازی نیست، بلکه خلق عامل‌های عمومی است که بتوانند مانند انسان در هر محیط دیجیتالی عمل کنند. این رویکرد، اصل راهنمای مسیر پژوهشی است که دیپ‌مایند اکنون آن را دنبال می‌کند تا به مرزهای جدیدی از هوش مصنوعی دست یابد: عامل‌های عمومی که قادر به پیمایش در محیط‌های باز و پایدار هستند.

این چرخش راهبردی، تغییر بنیادین در تعریف هوش و نحوه برخورد آزمایشگاه‌های AI با مفهوم هوشمندی است. در حالی که پیش از این نقاط عطف موفقیت بر بردن در یک بازی خاص متمرکز بود، اکنون هدف نهایی «عاملیت عمومی» (General Agency) است. این تغییر رویکرد در راستای تغییرات ساختاری گسترده‌تر در گوگل برای جداسازی عملیات محصول از پژوهش‌های AGI صورت می‌گیرد تا تمرکز بر اهداف بلندمدت افزایش یابد. همان‌طور که در تحلیل قبلی ما درباره‌ی اهمیت زیرساخت‌های قطعی مانند Google Apps Script برای پایداری عامل‌ها اشاره کردیم، دیپ‌مایند اکنون می‌خواهد ببیند آیا یک عامل می‌تواند هدف و وضعیت خود را در یک اقتصاد زنده، برای هفته‌ها یا ماه‌ها حفظ کند یا خیر.

سیر تکامل پژوهشی دیپ‌مایند

به نقل از مستندات دیپ‌مایند، این مسیر با زنجیره‌ای از پیشرفت‌ها در یادگیری تقویتی (Reinforcement Learning) آغاز شد. این آزمایشگاه ابتدا در سال ۲۰۱۵ با شبکه Deep Q-Network بر ۴۹ بازی آتاری ۲۶۰۰ مسلط شد که نتایج آن در مقاله‌ای در مجله Nature مستند گردید. این موفقیت سپس در سال ۲۰۱۶ با پیروزی AlphaGo بر لی سدول، قهرمان جهان در بازی گو، ادامه یافت.

این روند با ظهور AlphaGo Zero و AlphaZero تکامل یافت؛ سیستم‌هایی که نیاز به داده‌های انسانی را کاملاً حذف کردند و توانستند در بازی‌های شطرنج، شوگی و گو به صورت عمومی عمل کنند. بعدها MuZero وارد میدان شد و توانست بدون دانستن قوانین بازی، در آن پیروز شود و AlphaStar در سال ۲۰۱۹ به سطح گرندمستر در بازی StarCraft II رسید. همین زیربناهای پژوهشی در نهایت توانستند سیستم AlphaFold را تغذیه کنند؛ سامانه‌ای برای پیش‌بینی ساختار پروتئین که در سال ۲۰۲۴ جایزه نوبل شیمی را به دست آورد. این دستاوردها در حالی حاصل شد که گوگل اخیراً تیم تخصصی AlphaFold را در مسیر ادغام با Gemini بازسازی کرد تا توانمندی‌های پیش‌بینی ساختاری را با مدل‌های زبانی بزرگ ترکیب کند.

برای پر کردن شکاف میان این موفقیت‌ها و دستیابی به عاملیت عمومی، دیپ‌مایند SIMA (عامل چندجهانی قابل دستور یا Scalable Instructable Multiworld Agent) را توسعه داد. برخلاف بات‌های سنتی، SIMA صفحه نمایش را می‌بیند و از کنترل‌های کیبورد و موس استفاده می‌کند، بدون آنکه به کد داخلی بازی دسترسی داشته باشد.

نسخه SIMA 2 که در نوامبر ۲۰۲۵ با هسته Gemini عرضه شد، توانایی‌های خود را از ۶۰۰ مهارت ساده دنبال کردن دستورات زبانی به استدلال‌های پیچیده، گفتگو با کاربر و بازی‌های خودگردان گسترش داد. طبق گزارش دیپ‌مایند، SIMA 2 بخش بزرگی از شکاف عملکردی را در محیط‌هایی مانند ASKA و یک پیاده‌سازی پژوهشی از Minecraft پر کرده است.

با این حال، این آزمایشگاه به محدودیت‌های فعلی اشاره می‌کند. عامل‌ها هنوز در وظایفی با افق زمانی بسیار بلند (Long-horizon tasks) دچار مشکل هستند و حافظه آن‌ها توسط پنجرهٔ زمینه (Context Window) محدود شده است؛ محدودیتی که برای حفظ تعاملات با تأخیر کم (Low-latency) ضروری است. در حال حاضر، این سیستم تنها در قالب یک پیش‌نمایش پژوهشی برای گروه کوچکی از دانشگاهیان و توسعه‌دهندگان در دسترس است.

میدان آزمایش EVE Online

همکاری با Fenris Creations دسترسی به دنیایی را فراهم می‌کند که از سال ۲۰۰۳ در حال اجراست. این استودیو مستقل، سازنده EVE Universe، بیش از دو دهه را صرف ساخت یکی از پایدارترین دنیاهای بازی تاریخ کرده است. این جهان تک‌سروری (Single-shard) هزاران بازیکن را در یک اقتصاد مشترک جای داده است که دارای دینامیک‌های واقعی عرضه و تقاضا و ساختارهای سیاسی است که توسط خود بازیکنان ساخته شده‌اند.

دیپ‌مایند قصد دارد از اکوسیستم EVE برای تمرین و تقویت چهار قابلیت کلیدی استفاده کند:

  • یادگیری مستمر (Continual Learning): توانایی کسب مهارت‌های جدید بدون فراموش کردن مهارت‌های قدیمی.
  • حافظه گسترده (Extended Memory): حفظ وضعیت و حالت (State) فراتر از پنجرهٔ زمینه فعلی مدل‌های زبانی (LLM).
  • برنامه‌ریزی افق بلند (Long-Horizon Planning): اجرای اهدافی که بازه زمانی آن‌ها هفته‌ها یا ماه‌هاست.
  • دینامیک‌های چندعاملی (Multi-Agent Dynamics): پیمایش در فضای همکاری، رقابت، مذاکره و اقتصاد.

هیلمار پترسون، مدیرعامل Fenris Creations، در این باره می‌گوید: «ما در کنار گوگل دیپ‌مایند به قلمروهای ناشناخته‌ای می‌رویم که در آن هوش مصنوعی باید در مقیاس‌های زمانی یاد بگیرد، سازگار شود و به خاطر بسپارد که هیچ محیط بازی دیگری چنین تقاضایی ندارد.»

جزئیات پیاده‌سازی

این پژوهش در سه محیط مجزا و متمایز اجرا می‌شود:

  • EVE Online: که دنیای پایدار در مقیاس بزرگ را فراهم می‌کند.
  • EVE Vanguard: که تصمیم‌گیری‌های تاکتیکی سریع و اول‌شخص را به سیستم اضافه می‌کند.
  • EVE Frontier: که دارای «مجموعه‌های هوشمند» (Smart Assemblies) برنامه‌ریزی‌شده است، جایی که حتی خود قوانین بازی می‌توانند تغییر کنند.

این برنامه از یک مسیر مرحله‌بندی شده پیروی می‌کند. ابتدا در یک نسخه آفلاین از EVE Online که از بازیکنان واقعی جداست آغاز می‌شود، سپس به EVE Frontier منتقل می‌شود تا همزیستی انسان و عامل بررسی شود، و تنها زمانی به بازی‌های زنده می‌رسد که قابلیت‌ها به بلوغ کامل رسیده باشند.

یک نمونه اولیه به نام Aura Guidance در ۱۷ فوریه ۲۰۲۶ فعال شد. این سیستم از Gemini برای پاسخ به سوالات بازیکنان جدید بر اساس یک بانک داده تأییدشده از تبادلات واقعی در بخش Rookie Help استفاده می‌کند. این سیستم در حال حاضر به عنوان یک تست A/B برای سنجش میزان ماندگاری بازیکنان در حال اجراست.

برای دنیای پژوهش، این یک گذار از «حل کردن بنچمارک‌ها» به «ساکن شدن در شبیه‌سازها» است. اگر عاملی بتواند در اقتصاد بازیکن‌محور EVE یک معامله را با موفقیت مذاکره کند یا یک اتحاد سیاسی را مدیریت نماید، ثابت می‌کند که به سطحی از پایداری شناختی رسیده است که مدل‌های فعلی با محدودیت پنجره زمینه قادر به آن نیستند. موفقیت این برنامه احتمالاً معیارهای AGI را از استدلال کوتاه‌مدت به خودمختاری عملیاتی بلندمدت تغییر می‌دهد.

در آینده باید منتظر انتقال این عامل‌ها از محیط آفلاین (Sandbox) به EVE Frontier باشید؛ جایی که توانایی هوش مصنوعی برای همزیستی با انسان‌ها در یک دنیای برنامه‌ریزی‌پذیر، آزمون نهایی برای تراز (Alignment) و کاربردی بودن آن‌ها خواهد بود.

گام بعدی شما

  • دنبال کنید که چه زمانی عامل‌های دیپ‌مایند از محیط آفلاین به EVE Frontier منتقل می‌شوند.
  • بررسی کنید که آیا مدل‌های زبانی جدید برای حل مشکل حافظه، به جای گسترش پنجره متنی، به سمت معماری‌های حافظه خارجی می‌روند یا خیر.
  • اگر توسعه‌دهنده هستید، روی پیاده‌سازی حافظه بلندمدت برای عامل‌های خود در محیط‌های پویا تمرکز کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پروژه اعتبار متدولوژی یادگیری تقویتی را در محیط‌های غیرخطی به چالش می‌کشد. اگر دیپ‌مایند موفق شود، تعریف استقلال عملیاتی در هوش مصنوعی از چند ثانیه به چند ماه تغییر می‌کند.

تأثیر برای ایران

این پژوهش بیشتر برای محققان مدل‌های بنیادی اهمیت دارد تا بازار مصرف ایران و در حال حاضر اثر مستقیمی بر کاربران ایرانی ندارد.

·نگاه ما
تحریریه دات‌هوش

جایگزینی بنچمارک‌های ایستا با شبیه‌سازهای پویا، پایان عصر «پاسخ درست» و آغاز عصر «رفتار درست» است. در محیطی مثل EVE، هیچ پاسخ قطعی وجود ندارد و موفقیت در گرو سازگاری با تغییرات اقتصادی و سیاسی است. این یعنی AGI دیگر با نمرات آزمون، بلکه با توانایی بقا و اثرگذاری در یک سیستم پیچیده سنجیده خواهد شد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.