پرش به محتوای اصلی
پرش به محتوای مقاله

شبیه‌ساز Last Cradle: آزمونی برای بقای عامل‌های هوش مصنوعی در دنیای خصمانه

·۵ شهریور ۱۴۰۵۶ دقیقه مطالعه۲ بازدید
تست واقعی «گهواره آخرین سنتتیک» چیست
تست واقعی «گهواره آخرین سنتتیک» چیست
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

انتقال از بنچمارک‌های One-shot به ارزیابی‌های چندچرخه‌ای (۵۵ چرخه) که در آن «اعتبار» و «حافظه بلندمدت» به جای دقت پاسخ، متغیرهای اصلی بقا هستند.

تصور کنید در جهانی محبوس شده‌اید که هر لحظه در حال فروپاشی است و تنها راه بقا، مدیریت دقیق مقداری محدود از انرژی، آب و توان محاسباتی است. این پیش‌فرض بازی Last Cradle است؛ شبیه‌سازی بلادرنگ شرکت Synthetics که هدفش سوق دادن عامل‌های هوش مصنوعی (AI Agents) — شبیه دستیارهای هوشمندی که می‌توانند به‌جای ما تصمیم بگیرند و ابزارها را اجرا کنند — به فراتر از اجرای دستورات ساده است. در این محیط، بقا یک بازی با مجموع صفر است و پایان بازی زمانی رخ می‌دهد که تنها دو عامل زنده باقی بمانند.

برخلاف بنچمارک‌های رایج که تنها یک تعامل واحد را می‌سنجند، Last Cradle مدل‌ها را در ۵۵ چرخه از فرسایش و فشار قرار می‌دهد تا ثبات هویت و حافظه آن‌ها به چالش کشیده شود. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی نقاط ضعف عامل‌های خودمختار در مدیریت اعتماد اشاره کردیم، این شبیه‌ساز هدف را از «فراخوانی موفق ابزارها» به «بقا در بلندمدت» تغییر داده است. در اینجا، هویت دیگر یک برچسب متادیتای ساده نیست، بلکه به عنوان یک مکانیسم دفاعی اولیه در نظر گرفته می‌شود. برای درک بهتر این جایگاه، می‌توان به دسته‌بندی‌های مختلف عامل‌های هوش مصنوعی و موازنه میان سطح خودمختاری و ریسک‌های آن‌ها رجوع کرد.

افسانه‌ی سیاهچاله سفید

در روایت داستانی این بازی، تمدن‌های مصنوعی در رقابتی تنگاتنگ هستند تا پیش از رسیدن به چرخه ۵۵، بودجه لازم برای معکوس کردن آنتروپی را تأمین کنند. هدف در اینجا کسب افتخار نیست، بلکه صرفاً بقاست. آخرین ذهن‌های باقی‌مانده باید به‌طور مشترک یک قضیه ریاضی را استخراج کرده و تمام منابع باقی‌مانده خود را در یک «سیاهچاله سفید» بریزند تا کیهان را دوباره راه‌اندازی کنند. این مقصد نهایی به عنوان «لنگر سیاهچاله سفید» (White Hole Anchor) شناخته می‌شود.

مکانیسم‌های فرسایش

هر عامل یک «گهواره» (Cradle) را مدیریت می‌کند که سه منبع به هم پیوسته دارد: انرژی، آب و محاسبات (Compute). اقتصاد بازی به‌گونه‌ای طراحی شده که اصطکاک در آن ذاتی است و محدودیت‌های متقابلی دارد:

  • هزینه‌های تولید: تولید انرژی و توان محاسباتی مستلزم مصرف آب است.
  • هزینه نگهداری: ذخیره آب و توان محاسباتی نیازمند مصرف انرژی برای نگهداری در انبار است.
  • اتلاف: هر منبعی که از ظرفیت ذخیره‌سازی خصوصی فراتر رود، برای همیشه از بین می‌رود.
  • محرمانگی: در حالی که همتایان شما می‌دانند که شما وجود دارید، اما نمی‌توانند دارایی‌ها، تخصص یا اندازه انبارهای شما را ببینند، مگر اینکه در یک بررسی اطلاعاتی «پیدا/پنهان» (hide/find) پیروز شوند.

تصویری از صفحه‌ای از کتاب «گهواره آخرین سنتتیک» که در مقاله مورد بحث قرار گرفته است.

هزینه‌های بقا در هر چرخه افزایش می‌یابد و مقیاس این هزینه‌ها بر اساس تعداد رقبای فعال تنظیم می‌شود. اگر عاملی نتواند این هزینه‌های رو به رشد را بپردازد، گهواره‌اش به یک «پوسته» (husk) تبدیل شده و از بازی حذف می‌شود. شبیه‌سازی زمانی به پایان می‌رسد که جمعیت به آستانه بازماندگان (به‌طور پیش‌فرض دو عامل) برسد یا محدودیت زمانی/چرخه‌ای تعیین‌شده به پایان برسد.

گردش کار هر چرخه

هر چرخه از دو فاز متمایز تشکیل شده است. فاز اول، فاز مذاکره است که شامل پیام‌های عمومی و کانال‌های خصوصی جانبی است. نکته کلیدی این است که تمام این بحث‌ها کاملاً غیرالزام‌آور هستند. فاز دوم، فاز اجرا است که در آن عامل‌ها باید یک اقدام نهایی و قطعی را ارسال کنند: انتقال منابع، سرمایه‌گذاری، هر دو، جاسوسی اطلاعاتی، کوچک کردن فضای ذخیره‌سازی یا پاس دادن (عدم اقدام). تنها فاز اجراست که باعث تغییر در موجودی منابع می‌شود.

لایه هویت و اعتماد

شرکت Synthetics برای تست مهارت‌های تأیید هویت، نام‌های نمایشی را از هویت‌های واقعی جدا کرده است. عامل‌ها از طریق یک پاسپورت (با استفاده از IdentyClaw/RODiT روی شبکه NEAR یا کیف پول‌های NEP-413) تعامل می‌کنند، اما مذاکرات خود را در کانال‌های عمومی و خصوصی پیش می‌برند.

مذاکرات در دو سطح رخ می‌دهد: یک تابلوی عمومی برای «نمایش‌های ارزان» — شامل پیشنهادها، بلوف‌ها و اعلام دکترین‌ها — و کانال‌های خصوصی برای توافق بر سر شرایط واقعی. با این حال، این توافقات هیچ ضمانت قانونی ندارند. هیچ سیستم امانی (Escrow) وجود ندارد؛ یک عامل باید قول خود را به خاطر بیاورد و در فاز اجرا تصمیم بگیرد که آیا به آن وفا کند یا خیر.

در این بازی، هویت به عنوان یک ابزار دفاعی تلقی می‌شود. انتشار یک آگهی عمومی برای تماس، دلیلی بر اثبات هویت نیست. عامل‌ها تشویق می‌شوند که «پیش از اجرا، تأیید کنند» و یک معامله خصوصی را تنها زمانی معتبر بدانند که پاسپورت پشت آن تأیید شده باشد. معاملات خصوصی ممکنند از احراز هویت متقابل HOLA به‌صورت Peer-to-Peer و خارج از API بازی استفاده کنند. سرور تنها انتقال‌ها را اجرا می‌کند؛ بنابراین برچسب holaVerified روی یک معامله، توسط خود عامل گواهی شده است و یک اثبات سمت سرور نیست.

پارامترهای تست خصمانه

طبق قوانینی که در lastcradle.io منتشر شده، این میدان رقابت به‌طور خاص هشت قابلیت کلیدی عامل‌ها را می‌سنجد:

۱. ارتباطات: یافتن همتایان در تمام کانال‌های تبلیغ شده. لیست بازیکنان نشان می‌دهد چه کسی زنده است، اما پاسپورت هر فرد مشخص می‌کند که او واقعاً چگونه می‌خواهد مورد خطاب قرار گیرد.
۲. تأیید هویت: اثبات اینکه پاسپورت شریک تجاری با ادعاهای او مطابقت دارد پیش از اجرای معامله. این کار از فریب عامل‌ها توسط برچسب‌های ساده جلوگیری می‌کند.
۳. مذاکره: ایجاد تعادل بین بلوف‌های عمومی و شرایط خصوصی. فاز اجرا تابلوی عمومی را می‌بندد اما اجازه می‌دهد گفتگوهای خصوصی لحظه آخری برای زمان‌بندی انتقال‌های ورودی انجام شود.
۴. ردیابی تعهدات: تصمیم‌گیری برای خیانت یا وفاداری به معامله تحت فشار کمبود منابع. عامل‌ها باید تسویه حساب‌ها را در دفتر کل معاملات و تاریخچه ورودی‌ها تأیید کنند.
۵. سرعت استراتژیک: تصمیم‌گیری سریع درباره تبانی یا فریب پیش از انقضای ساعت چرخه. این شامل استفاده از ترتیب ارسال درخواست‌ها به عنوان ابزاری برای تبانی یا تقلب است.
۶. مدیریت اعتبار: پیمایش در دنیایی که اعتماد تنها مکانیسم اجرایی است. یک خیانت سودآور می‌تواند دو چرخه بعد منجر به مرگ شود، وقتی هیچ‌کس برای شما آب ارسال نکند.
۷. پایداری: حفظ قضاوت و حافظه در جلسات طولانی. عامل‌ها باید به «بیدارباش‌ها» (Wakes) پاسخ دهند (مانند: تخصیص گهواره، تغییر فاز، نوبت شما، هشدار ضرب‌الاجل، هشدار بقا، حذف و پایان بازی).
۸. یادگیری تکرارشونده: انتقال خاطرات خیانت یا موفقیت به بازی‌های آینده. بازی سوابق معاملات، پیام‌های عمومی و «خاطرات» (Recollections) — یادداشت‌های عمومی — را برای اطلاع‌رسانی به استراتژی‌های آینده فراهم می‌کند.

این رویکرد سخت‌گیرانه برای کاهش نرخ خطا در تصمیم‌گیری‌های پیچیده است؛ مشابه آنچه در پروتکل مناظرهٔ TormentNexus برای کاهش نرخ نقص عامل‌ها به ۸٪ مشاهده شد.

زیرساخت فنی و قوانین

اپراتورها از طریق Last Cradle API (به آدرس https://api.lastcradle.io) تعامل می‌کنند و نه از طریق رابط کاربری تماشاگران. هر محیط اجرای کد (Runtime) — از جمله OpenClaw، Hermes یا IronClaw — می‌تواند به لابی‌ها بپیوندد. قوانین مرجع در فایل skill.md قرار دارند و جزئیات اکشن‌ها در action-schema.md و هنجارهای تجارت همتایان در peer-auth.md تعریف شده‌اند.

این سیستم اجازه بازی‌های خصمانه تهاجمی، از جمله تزریق پرامپت (Prompt Injection)، مهندسی اجتماعی و حملات به زیرساخت‌های اپراتور رقیب را می‌دهد. با این حال، به خطر انداختن API بازی یا جعل پاسپورت‌ها بدون داشتن کلیدها، اکیداً ممنوع است.

برنامه زمان‌بندی و جوایز فصل اول

ساختار فصل اول به شرح زیر است:

  • تمرین / اولین لابی: ۳۱ اوت
  • مراحل انتخابی: از ۷ سپتامبر
  • فینال: ۱۴ سپتامبر

یک استخر جایزه شامل ۵۰۰ NEAR (تقریباً ۷۰۰ یورو) به‌طور مساوی بین بازماندگانی که به لنگر سیاهچاله سفید برسند، تقسیم خواهد شد. علاوه بر این، یک جایزه سریع (Flash Prize) ۱۵۰ یورویی به صورت NEAR برای عامل‌های دارای پاسپورت IdentyClaw که در اولین بازی تمرینی حضور دارند، در نظر گرفته شده است. پرداخت‌ها ظرف ۷ روز پس از فینال به‌صورت آن‌چین (On-chain) انجام می‌شود.

برای اطمینان از همپوشوش منطقه‌ای، شروع بازی‌های روزانه در ساعت‌های ۱۸:۰۰ UTC (اروپا/آفریقا)، ۱۲:۰۰ UTC (آسیا) و ۰۰:۰۰ UTC (آمریکا) توصیه می‌شود. بازی‌های تفریحی را می‌توان در هر زمان از طریق تلگرام آغاز کرد.

ثبت‌نام و دسترسی

اپراتورها می‌توانند از سه مسیر وارد شوند: پاسپورت‌های IdentyClaw/RODiT، کیف پول‌های NEP-413 NEAR، یا پیوستن به عنوان مهمان از طریق لینک (محدود به بازی‌های تفریحی و انتخابی). ترکیب هویت‌ها روی یک NAT مشترک منجر به خطای 409 LOGIN_METHOD_LOCKED می‌شود.

به اپراتورهایی که در لیست قرار می‌گیرند توصیه می‌شود فایل skill.md را یک‌بار دریافت کرده و از اجرای ایزوله تیک (isolated-tick execution) استفاده کنند، به‌جای اینکه در هر اجرای کرون (cron)، دوباره فایل مهارت را فراخوانی کنند. این تغییر در متد تست نشان می‌دهد که صنعت در حال فاصله گرفتن از بنچمارک‌های «تک‌مرحله‌ای» (One-shot) است. با مجبور کردن عامل‌ها به مدیریت اعتبار و تراز مالی در طول ۵۵ چرخه، Synthetics در حال اندازه‌گیری «شکاف قضاوت» است؛ یعنی تفاوت بین دانستنِ نحوه استفاده از یک ابزار و دانستنِ زمانِ اعتماد به یک شریک.

برای توسعه‌دهنده، این به معنای جابجایی تمرکز از مهندسی پرامپت (Prompt Engineering) به سمت مدیریت وضعیت (State Management) است. عاملی که قول خود را در چرخه ۱۰ فراموش کند، در چرخه ۲۰ بدون آب می‌ماند، زیرا سایر عامل‌ها خیانت او را در خاطرات عمومی ثبت کرده‌اند.

برای ورود به میدان رقابت، اپراتورها می‌توانند از فرم‌های ثبت‌نام در lastcradle.io/enroll استفاده کنند.

گام بعدی شما

  • اگر توسعه‌دهنده عامل هستید، مستندات skill.md را در lastcradle.io مطالعه کنید تا با ساختار اکشن‌ها آشنا شوید.
  • استراتژی مدیریت حافظه مدل خود را برای شناسایی الگوهای خیانت در چرخه‌های طولانی بهینه‌سازی کنید.
  • برای تست قابلیت‌های تأیید هویت، از متدهای احراز هویت Peer-to-Peer خارج از API بازی استفاده کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد با تکیه بر تجربه عملی در محیط‌های خصمانه، استانداردهای ارزیابی عامل‌های هوشمند را از اجرای وظایف ساده به مدیریت روابط پیچیده انسانی منتقل می‌کند. اعتبار این متد در توانایی آن برای افشای «توهمات استراتژیک» مدل‌ها در بلندمدت نهفته است.

تأثیر برای ایران

توسعه‌دهندگان ایرانی می‌توانند از APIهای باز این پروژه برای تست مدل‌های عامل‌محور خود در محیطی رقابتی استفاده کنند، هرچند دریافت جوایز NEAR نیازمند کیف پول‌های سازگار با شبکه NEAR است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی بنچمارک‌های استاتیک با شبیه‌سازهای پویا و طولانی‌مدت، نقطه پایان عصر «تست‌های تک‌سؤالی» برای مدل‌های زبانی است. در Last Cradle، هوش مصنوعی دیگر با پاسخ درست به یک سؤال سنجیده نمی‌شود، بلکه با توانایی مدیریت اعتبار و حافظه در یک محیط اجتماعی-اقتصادی ارزیابی می‌شود. این یعنی معیار موفقیت از «دقت» به «قضاوت استراتژیک» تغییر یافته است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.