تصور کنید یک سیستم هوش مصنوعی بدون دخالت انسان، چهار روز وقت بگذارد تا یک بازی شوتر اولشخص کامل را در موتور Godot 4 بسازد و حتی وبسایت و پوسترهای تبلیغاتی آن را طراحی کند. این اتفاق دیگر یک سناریوی تخیلی نیست، بلکه نتیجهٔ عملکرد Raven است؛ «هارنسِ هارنسها»یی که در ۲۹ سپتامبر ۲۰۲۶ توسط شرکت EverMind AI منتشر شد.
بیشتر عاملهای فعلی بر اساس پرامپتهای ایستا یا گردشکارهای ثابت عمل میکنند؛ یعنی اگر جایی شکست بخورند، یک برنامهنویس باید دستی پرامپت را تغییر دهد یا ابزار جدیدی اضافه کند. اما Raven با پیادهسازی خودبهسازی بازگشتی (Recursive Self-Improvement یا RSI) — شبیه به مهندسی که هر شب کدهای خودش را بازبینی میکند تا فردا سریعتر کار کند — این چرخه را تغییر میدهد. در این مدل، هوش مصنوعی نقاط ضعف خود را شناسایی کرده و منطق عملیاتیاش را برای رفع آنها بازنویسی میکند. این رویکرد تکاملی یادآور تلاشهای گوگل در بهکارگیری چارچوب RRSI برای کاهش بیشبرازش در عاملها است تا پایداری مدلها در محیطهای متغیر افزایش یابد.
به نقل از مستندات رسمی گیتهاب، Raven بهعنوان یک عامل میزبان عمل میکند که زیر-عاملهای متخصص را مدیریت میکند. این سیستم بهجای اجرای سادهٔ وظایف، از گرافهای جهتدار بدون دور (DAGs) برای مدیریت وابستگیهای پیچیده و اجرای موازی استفاده میکند. Raven چرخهای را مدیریت میکند که در آن تغییراتی برای نحوه برنامهریزی عاملها پیشنهاد میدهد، این تغییرات را در برابر بنچمارکها ارزیابی میکند و در نهایت نسخههای برنده را میپذیرد. همانطور که در تحلیلهای قبلی ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، مدیریت حافظه در این سیستمها حیاتی است؛ به همین دلیل Raven از EverOS استفاده میکند. EverOS یک محیط اجرای حافظه با محوریت Markdown و اولویت محلی (local-first) است که اجازه میدهد تجربه، بافتار (Context) و مهارتهای اکتسابی عامل در جلسات مختلف حفظ شود. این تمرکز بر یکپارچگی بافتار، مشابه پروتکل Auterix است که حافظه معماری پروژه را میان ابزارهای مختلف همگام میکند تا از تضاد در تصمیمات کدنویسی جلوگیری شود.
ناوگان عاملهای متخصص
سامانه Raven با چهار عامل داخلی عرضه شده است که برای دستیابی به عملکرد پیشرو (SOTA) در حوزههای خاص طراحی شدهاند. این عاملها ترکیبی از اجزای هارنس قابل استفاده مجدد با ابزارها، مهارتها و حلقههای عاملی تخصصی هستند. Raven میتواند یک وظیفه متمرکز را به یک عامل واحد بسپارد یا چندین عامل را در یک گردشکار مشترک سازماندهی کند:
- Raven-Research: این عامل پژوهشهای عمیق و خودمختار را برای پاسخ به سوالات پیچیده، مرور ادبیات فنی و تحلیلهای تخصصی ممکن میسازد. خروجی آن گزارشهای ساختاریافته با منابع قابل ردیابی است تا کاربران بتوانند جایگزینها را مقایسه کرده و حوزههای ناآشنا را درک کنند. عملکرد این عامل در محک DeepResearch Mixed تایید شده است.
- Raven-Code: تبدیل نیازمندیها به کد عملیاتی و تستشده. این عامل از پیادهسازی ویژگیها، دیباگ کردن، بازسازی کد (Refactoring) و تحلیل دادهها پشتیبانی میکند. طبق گزارشها، این عامل در ۲۴ اوت ۲۰۲۶ در محک DataAgentBench برای تحلیل دادهها رتبه اول را کسب کرد. این تفکیک میان برنامهریزی و اجرا، شباهت زیادی به رویکرد Ordewell در جداسازی ارکستراسیون کدنویسی از اجرای آن دارد.
- Raven-Design: تبدیل ایدهها به خروجیهای بصری صیقلخورده مانند مجموعههای اسلاید پاورپوینت، داراییهای برندینگ، نمودارها و رابطهای وب. این عامل در حال حاضر در PresentBench برای تولید اسلاید پیشتاز است.
- Raven-Oncall: اتوماسیون بدون نظارت برای آزمایشها و مانیتورینگ مستمر. این عامل میتواند پیشرفت کار را برای چندین ساعت یا حتی در طول شب ادامه دهد. EverMind AI ادعا میکند این عامل در وظایف AI-for-Science (AI4S) از نظر نرخ موفقیت و هزینه، بهطور قابلتوجهی از Claude Code بهتر عمل میکند و در وظایف AI4AI نیز کیفیت و هزینه بهینهتری دارد.
سازوکار تکامل خودکار
معماری Raven از ابتدا برای تکامل در زمان اجرا (Runtime Self-Evolution) طراحی شده است. حلقهٔ عملیاتی آن به چهار ماژول استراتژی مجزا تقسیم میشود:
- حافظه (Memory): تعیین میکند که در هر نوبت (Turn)، عامل به چه اطلاعاتی دسترسی داشته باشد.
- برنامهریزی (Planning): نحوه 접근 عامل به انجام کار و استراتژی پیشروی را تعریف میکند.
- قابلیت (Capability): کنترل میکند که در هر تکرار، کدام ابزارها در دسترس عامل قرار گیرند.
- اقدام (Action): تصمیم میگیرد چه کاری انجام شود و پیش از اجرای نهایی، آن اقدام را قضاوت میکند.
ابزاری به نام Curator (کیوریتور) بهعنوان موتور تکامل عمل میکند. کیوریتور فقط پرامپت را تغییر نمیدهد، بلکه با بهروزرسانی تنظیمات یا نوشتن قطعات کد کوچک برای قضاوت، چهار ماژول استراتژی را بازنویسی میکند. کیوریتور میتواند ابزارهایی که عامل به آنها دسترسی دارد، رویههایی که دنبال میکند و حتی نحوه قضاوت عامل در هر نقطه را جایگزین کند. این فرآیند دور به دور ادامه مییابد تا زمانی که کاربر راضی شود، سیستم به یک سطح اشباع (Plateau) برسد یا بودجه تعیینشده برای دورها تمام شود.
برای جلوگیری از توهم (Hallucination) — شبیه به دوستی که با اطمینان خاطرهای ساختگی را تعریف میکند — و جلوگیری از رسیدن سیستم به یک وضعیت خراب، Raven از یک دروازهٔ تأیید سختگیرانه استفاده میکند. هیچ تغییری پیش از تأیید نصب نمیشود و در صورت شکست در بررسی، فرآیند به نقطه شروع بازمیگردد. همچنین برای جلوگیری از «تقلب»، پاسخهای مرجع از سیگنالهای ارسالی به کیوریتور حذف میشوند تا هوش مصنوعی مجبور شود منطق زیربنایی خود را بهبود ببخشد، نه اینکه صرفاً پاسخ را پیدا کند.
بنچمارکهای عملکرد در دنیای واقعی
به گزارش EverMind AI، چهار مورد شاخص توانایی این سیستم را در هدایت تیمی از متخصصان از یک دستور اولیه تا خروجی نهایی ثابت میکند:
- پروژه THRESHOLD (توسعه بازی): Raven بهطور خودمختار حدود ۴ روز کار کرد و ۴۲ دور برنامهریزی، توسعه و تأیید را پشت سر گذاشت. نتیجه، یک بازی شوتر اولشخص در Godot 4 بود که بر محور یک نبرد با باس (Boss Fight) در یک میدان جنگ متمرکز بود. خروجی نهایی شامل خود بازی، یک پوستر، یک ارائه (PPTX) و یک وبسایت بود.
- آزمایش Raven RSI (خودبهسازی بازگشتی): در آزمایشهای پیشآموزش nanochat، این سیستم بهطور مستقل هر دور را برنامهریزی کرد، کد نوشت و آزمایشها را اجرا کرد. Raven توانست ۱۷۲ اجرای آموزشی را در ۷ دور بدون هیچ کرشی (Crash) به پایان برساند و مقدار val_bpb را در یک بودجه ۲۰ دقیقهای با یک GPU واحد، ۵.۸٪ کاهش داد.
- شبیهسازیهای مهندسی: این سیستم توانست مقدار overshoot در یک شبیهسازی شکست سد را تا سه مرتبه بزرگی کاهش دهد و یک جستجوی بار حدی FEA را در ۸ دور دوپارهسازی (Bisection) به پایان برساند. خروجیها شامل نتایج تجربی، بصریسازیها، یک پوستر و وبسایت پروژه بود.
- عرضه محصول (Product Launch): Raven یک کیت کامل عرضه تولید کرد که شامل یک مینیگیم فیزیک مبتنی بر مرورگر، یک معرفی محصول در ۱۶ اسلاید، پوسترهایی به زبانهای انگلیسی و چینی و یک فایل README جامع بود.
زیرساخت و اکوسیستم
Raven توسط ابزارهای داخلی پیشرفتهای پشتیبانی میشود که چرخه حیات هوش عاملی را مدیریت میکنند:
- Evolver: ابزاری مجزا که Raven را بهعنوان یک کتابخانه مصرف میکند. Evolver شکستها را تشخیص داده و تغییرات پیشنهادی هارنس را در برابر بنچمارکها تست میکند تا عاملها را توسعه دهد (به جای اینکه داخل آنها اجرا شود).
- SkillForge: تخصصهای مرتبط را از کتابخانههای محلی، حافظه EverOS و کاتالوگ SkillHub (شامل ۱۱۴,۱۹۰ مهارت تخصصی) بازیابی میکند.
- Proactivity: با ترکیب مانیتورینگ رویدادها و اجرای زمانبندیشده، نیازهای کاربر را پیشبینی کرده و کارهای تکمیلی را آغاز میکند.
- Persona Assembly: کیوریتور میتواند بر اساس توصیفات کاربر، یک «پرسونا»ی سفارشی بسازد؛ یعنی یک نقش رهبری و تیمی از متخصصان را با تقسیم کار مشخص و بررسیهای لازم سازماندهی کند.
این سامانه از طریق ACP، CLI یا APIهای سازگار با OpenAI به عاملهای شخص ثالث متصل میشود و شامل پیشتنظیماتی برای ۱۳ عامل خارجی است. Raven بخشی از یک استک گستردهتر «پژوهش-تا-اجرا» در EverMind AI است:
- پژوهشهای حافظه: شامل HyperMem (حافظه سلسلهمراتبی مبتنی بر هایپرگراف برای بازیابی از کلی به جزئی)، MSA Memory (توجه پراکنده برای حافظه نهفته مقیاسپذیر و بافتارهای ۱۰۰ میلیون توکنی) و EverAlgo (عملگرهای حافظه، رتبهبندی و تجزیه بدون وضعیت).
- ابزارهای ارزیابی: EverMemBench برای یادآوری حقایق و استدلال کاربردی، و EvoAgentBench برای ارزیابی طولی تکامل عاملی، کارایی انتقال مهارت و اجتناب از خطا.
- یکپارچهسازها: پلاگینهایی برای OpenClaw (بازیابی و ضبط خودکار حافظه جلسه)، Hermes Agent (حافظه پایدار بین جلسات)، DeepSeek Harness (DSH) (عاملهای آگاه به حافظه) و Dify (ابزارهای ابری و سلف-هاست برای جستجوی صریح حافظه).
استقرار و دسترسی فنی
برای توسعهدهندگان، Raven بهعنوان یک پروژه متنباز تحت لایسنس Apache 2.0 در دسترس است. این سیستم میتواند از طریق Docker (با دستور docker compose -f docker/docker-compose.yml up) یا مستقیماً روی لینوکس، مک و ویندوز از طریق اسکریپتهای شل نصب شود.
گزینههای نصب عبارتند از:
- خودکار: استفاده از پرامپت در عاملهایی مثل Claude Code یا Codex برای خواندن راهنمای شروع سریع.
- شل (Shell): برای سیستمهای یونیکسی از دستور
curl -fsSL https://raven.evermind.ai/install.sh | bashو برای پاورشل ازirm https://raven.evermind.ai/install.ps1 | iexاستفاده میشود. - سورس: کلون کردن مخزن گیتهاب و اجرای
./install.shبرای حالت editable که اجازه توسعه روی کد را میدهد.
سیستم شامل یک رابط کاربری وب (WebUI) در پورت ۱۸۷۹۳ است که اجازه میدهد کاربران با عاملها چت کنند، پیشرفت وظایف را دنبال کنند و حافظه و مهارتها را در یک مکان مرور کنند. این WebUI یک کامپوزر واحد فراهم میکند که مهارتها، پلیبوکها، دانش و حافظه را تنها با یک کلیک در دسترس قرار میدهد.
این چرخش راهبردی، صنعت را از «مهندسی پرامپت» به سمت «مهندسی هارنس» (Harness Engineering) میبرد. بهجای نوشتن دستورالعمل بینقص، توسعهدهندگان معیارهای ارزیابی را تعریف میکنند و اجازه میدهند سیستم مسیر بهینه را تکامل دهد. در واقع، هوش مصنوعی به توسعهدهندهٔ خودش تبدیل میشود و گلوگاه انسانی در خط لولههای پیچیده نرمافزاری و پژوهشی کاهش مییابد.
اگر این مسیر ادامه یابد، مهارت اصلی اپراتورهای هوش مصنوعی از «دانستن اینکه چگونه با مدل صحبت کنند» به «دانستن اینکه چگونه بنچمارکهایی بسازند که تکامل مدل را هدایت کند» تغییر خواهد کرد.
اگر توسعهدهنده هستید، مخزن گیتهاب Raven را کلون کرده و با دستور ./install.sh در حالت editable نصب کنید تا منطق تکامل آن را بررسی کنید.
- معیارهای ارزیابی (Benchmarks) دقیق برای وظایف تکراری خود تعریف کنید تا بتوانید از قابلیت RSI برای بهینهسازی خودکار گردشکارتان استفاده کنید.
- رابط WebUI را در پورت ۱۸۷۹۳ باز کنید و سعی کنید یک Persona سفارشی برای تیمی از متخصصان مجازی بسازید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو