تصور کنید عاملی که نه برای یک بازی کوتاه، بلکه برای زندگی در یک دنیای دیجیتال دائمی طراحی شده است؛ عاملی که باید هفتهها برنامهریزی کند و در یک اقتصاد واقعی مذاکره نماید. گوگل دیپمایند در ۲۱ اوت ۲۰۲۶ اعلام کرد که هدفش دیگر صرفاً پیروزی در بازیهای تکامتیازی نیست، بلکه خلق عاملهای عمومی است که بتوانند مانند انسان در هر محیط دیجیتالی عمل کنند. این رویکرد، اصل راهنمای مسیر پژوهشی است که دیپمایند اکنون آن را دنبال میکند تا به مرزهای جدیدی از هوش مصنوعی دست یابد: عاملهای عمومی که قادر به پیمایش در محیطهای باز و پایدار هستند.
این چرخش راهبردی، تغییر بنیادین در تعریف هوش و نحوه برخورد آزمایشگاههای AI با مفهوم هوشمندی است. در حالی که پیش از این نقاط عطف موفقیت بر بردن در یک بازی خاص متمرکز بود، اکنون هدف نهایی «عاملیت عمومی» (General Agency) است. این تغییر رویکرد در راستای تغییرات ساختاری گستردهتر در گوگل برای جداسازی عملیات محصول از پژوهشهای AGI صورت میگیرد تا تمرکز بر اهداف بلندمدت افزایش یابد. همانطور که در تحلیل قبلی ما دربارهی اهمیت زیرساختهای قطعی مانند Google Apps Script برای پایداری عاملها اشاره کردیم، دیپمایند اکنون میخواهد ببیند آیا یک عامل میتواند هدف و وضعیت خود را در یک اقتصاد زنده، برای هفتهها یا ماهها حفظ کند یا خیر.
سیر تکامل پژوهشی دیپمایند
به نقل از مستندات دیپمایند، این مسیر با زنجیرهای از پیشرفتها در یادگیری تقویتی (Reinforcement Learning) آغاز شد. این آزمایشگاه ابتدا در سال ۲۰۱۵ با شبکه Deep Q-Network بر ۴۹ بازی آتاری ۲۶۰۰ مسلط شد که نتایج آن در مقالهای در مجله Nature مستند گردید. این موفقیت سپس در سال ۲۰۱۶ با پیروزی AlphaGo بر لی سدول، قهرمان جهان در بازی گو، ادامه یافت.
این روند با ظهور AlphaGo Zero و AlphaZero تکامل یافت؛ سیستمهایی که نیاز به دادههای انسانی را کاملاً حذف کردند و توانستند در بازیهای شطرنج، شوگی و گو به صورت عمومی عمل کنند. بعدها MuZero وارد میدان شد و توانست بدون دانستن قوانین بازی، در آن پیروز شود و AlphaStar در سال ۲۰۱۹ به سطح گرندمستر در بازی StarCraft II رسید. همین زیربناهای پژوهشی در نهایت توانستند سیستم AlphaFold را تغذیه کنند؛ سامانهای برای پیشبینی ساختار پروتئین که در سال ۲۰۲۴ جایزه نوبل شیمی را به دست آورد. این دستاوردها در حالی حاصل شد که گوگل اخیراً تیم تخصصی AlphaFold را در مسیر ادغام با Gemini بازسازی کرد تا توانمندیهای پیشبینی ساختاری را با مدلهای زبانی بزرگ ترکیب کند.
برای پر کردن شکاف میان این موفقیتها و دستیابی به عاملیت عمومی، دیپمایند SIMA (عامل چندجهانی قابل دستور یا Scalable Instructable Multiworld Agent) را توسعه داد. برخلاف باتهای سنتی، SIMA صفحه نمایش را میبیند و از کنترلهای کیبورد و موس استفاده میکند، بدون آنکه به کد داخلی بازی دسترسی داشته باشد.
نسخه SIMA 2 که در نوامبر ۲۰۲۵ با هسته Gemini عرضه شد، تواناییهای خود را از ۶۰۰ مهارت ساده دنبال کردن دستورات زبانی به استدلالهای پیچیده، گفتگو با کاربر و بازیهای خودگردان گسترش داد. طبق گزارش دیپمایند، SIMA 2 بخش بزرگی از شکاف عملکردی را در محیطهایی مانند ASKA و یک پیادهسازی پژوهشی از Minecraft پر کرده است.
با این حال، این آزمایشگاه به محدودیتهای فعلی اشاره میکند. عاملها هنوز در وظایفی با افق زمانی بسیار بلند (Long-horizon tasks) دچار مشکل هستند و حافظه آنها توسط پنجرهٔ زمینه (Context Window) محدود شده است؛ محدودیتی که برای حفظ تعاملات با تأخیر کم (Low-latency) ضروری است. در حال حاضر، این سیستم تنها در قالب یک پیشنمایش پژوهشی برای گروه کوچکی از دانشگاهیان و توسعهدهندگان در دسترس است.
میدان آزمایش EVE Online
همکاری با Fenris Creations دسترسی به دنیایی را فراهم میکند که از سال ۲۰۰۳ در حال اجراست. این استودیو مستقل، سازنده EVE Universe، بیش از دو دهه را صرف ساخت یکی از پایدارترین دنیاهای بازی تاریخ کرده است. این جهان تکسروری (Single-shard) هزاران بازیکن را در یک اقتصاد مشترک جای داده است که دارای دینامیکهای واقعی عرضه و تقاضا و ساختارهای سیاسی است که توسط خود بازیکنان ساخته شدهاند.
دیپمایند قصد دارد از اکوسیستم EVE برای تمرین و تقویت چهار قابلیت کلیدی استفاده کند:
- یادگیری مستمر (Continual Learning): توانایی کسب مهارتهای جدید بدون فراموش کردن مهارتهای قدیمی.
- حافظه گسترده (Extended Memory): حفظ وضعیت و حالت (State) فراتر از پنجرهٔ زمینه فعلی مدلهای زبانی (LLM).
- برنامهریزی افق بلند (Long-Horizon Planning): اجرای اهدافی که بازه زمانی آنها هفتهها یا ماههاست.
- دینامیکهای چندعاملی (Multi-Agent Dynamics): پیمایش در فضای همکاری، رقابت، مذاکره و اقتصاد.
هیلمار پترسون، مدیرعامل Fenris Creations، در این باره میگوید: «ما در کنار گوگل دیپمایند به قلمروهای ناشناختهای میرویم که در آن هوش مصنوعی باید در مقیاسهای زمانی یاد بگیرد، سازگار شود و به خاطر بسپارد که هیچ محیط بازی دیگری چنین تقاضایی ندارد.»
جزئیات پیادهسازی
این پژوهش در سه محیط مجزا و متمایز اجرا میشود:
- EVE Online: که دنیای پایدار در مقیاس بزرگ را فراهم میکند.
- EVE Vanguard: که تصمیمگیریهای تاکتیکی سریع و اولشخص را به سیستم اضافه میکند.
- EVE Frontier: که دارای «مجموعههای هوشمند» (Smart Assemblies) برنامهریزیشده است، جایی که حتی خود قوانین بازی میتوانند تغییر کنند.
این برنامه از یک مسیر مرحلهبندی شده پیروی میکند. ابتدا در یک نسخه آفلاین از EVE Online که از بازیکنان واقعی جداست آغاز میشود، سپس به EVE Frontier منتقل میشود تا همزیستی انسان و عامل بررسی شود، و تنها زمانی به بازیهای زنده میرسد که قابلیتها به بلوغ کامل رسیده باشند.
یک نمونه اولیه به نام Aura Guidance در ۱۷ فوریه ۲۰۲۶ فعال شد. این سیستم از Gemini برای پاسخ به سوالات بازیکنان جدید بر اساس یک بانک داده تأییدشده از تبادلات واقعی در بخش Rookie Help استفاده میکند. این سیستم در حال حاضر به عنوان یک تست A/B برای سنجش میزان ماندگاری بازیکنان در حال اجراست.
برای دنیای پژوهش، این یک گذار از «حل کردن بنچمارکها» به «ساکن شدن در شبیهسازها» است. اگر عاملی بتواند در اقتصاد بازیکنمحور EVE یک معامله را با موفقیت مذاکره کند یا یک اتحاد سیاسی را مدیریت نماید، ثابت میکند که به سطحی از پایداری شناختی رسیده است که مدلهای فعلی با محدودیت پنجره زمینه قادر به آن نیستند. موفقیت این برنامه احتمالاً معیارهای AGI را از استدلال کوتاهمدت به خودمختاری عملیاتی بلندمدت تغییر میدهد.
در آینده باید منتظر انتقال این عاملها از محیط آفلاین (Sandbox) به EVE Frontier باشید؛ جایی که توانایی هوش مصنوعی برای همزیستی با انسانها در یک دنیای برنامهریزیپذیر، آزمون نهایی برای تراز (Alignment) و کاربردی بودن آنها خواهد بود.
گام بعدی شما
- دنبال کنید که چه زمانی عاملهای دیپمایند از محیط آفلاین به EVE Frontier منتقل میشوند.
- بررسی کنید که آیا مدلهای زبانی جدید برای حل مشکل حافظه، به جای گسترش پنجره متنی، به سمت معماریهای حافظه خارجی میروند یا خیر.
- اگر توسعهدهنده هستید، روی پیادهسازی حافظه بلندمدت برای عاملهای خود در محیطهای پویا تمرکز کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو