پرش به محتوای اصلی
پرش به محتوای مقاله

سامانه Raven با خودبه‌سازی بازگشتی، توسعهٔ عامل‌های هوش مصنوعی را خودکار کرد

·۷ مهر ۱۴۰۵۹ دقیقه مطالعه
بستر چندعاملی خودتکاملی برای همکاری همه‌جانبه، ساخته‌شده برای RSI: پایدار، مورداعتماد و فراگیر.
بستر چندعاملی خودتکاملی برای همکاری همه‌جانبه، ساخته‌شده برای RSI: پایدار، مورداعتماد و فراگیر.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی مهندسی پرامپت با «خودبه‌سازی بازگشتی» (RSI)؛ جایی که عامل به‌جای اجرای دستور، منطق داخلی و ابزارهای خود را بر اساس نتایج ارزیابی بازنویسی می‌کند.

تصور کنید یک سیستم هوش مصنوعی بدون دخالت انسان، چهار روز وقت بگذارد تا یک بازی شوتر اول‌شخص کامل را در موتور Godot 4 بسازد و حتی وب‌سایت و پوسترهای تبلیغاتی آن را طراحی کند. این اتفاق دیگر یک سناریوی تخیلی نیست، بلکه نتیجهٔ عملکرد Raven است؛ «هارنسِ هارنس‌ها»یی که در ۲۹ سپتامبر ۲۰۲۶ توسط شرکت EverMind AI منتشر شد.

بیشتر عامل‌های فعلی بر اساس پرامپت‌های ایستا یا گردش‌کارهای ثابت عمل می‌کنند؛ یعنی اگر جایی شکست بخورند، یک برنامه‌نویس باید دستی پرامپت را تغییر دهد یا ابزار جدیدی اضافه کند. اما Raven با پیاده‌سازی خودبه‌سازی بازگشتی (Recursive Self-Improvement یا RSI) — شبیه به مهندسی که هر شب کدهای خودش را بازبینی می‌کند تا فردا سریع‌تر کار کند — این چرخه را تغییر می‌دهد. در این مدل، هوش مصنوعی نقاط ضعف خود را شناسایی کرده و منطق عملیاتی‌اش را برای رفع آن‌ها بازنویسی می‌کند. این رویکرد تکاملی یادآور تلاش‌های گوگل در به‌کارگیری چارچوب RRSI برای کاهش بیش‌برازش در عامل‌ها است تا پایداری مدل‌ها در محیط‌های متغیر افزایش یابد.

به نقل از مستندات رسمی گیت‌هاب، Raven به‌عنوان یک عامل میزبان عمل می‌کند که زیر-عامل‌های متخصص را مدیریت می‌کند. این سیستم به‌جای اجرای سادهٔ وظایف، از گراف‌های جهت‌دار بدون دور (DAGs) برای مدیریت وابستگی‌های پیچیده و اجرای موازی استفاده می‌کند. Raven چرخه‌ای را مدیریت می‌کند که در آن تغییراتی برای نحوه برنامه‌ریزی عامل‌ها پیشنهاد می‌دهد، این تغییرات را در برابر بنچمارک‌ها ارزیابی می‌کند و در نهایت نسخه‌های برنده را می‌پذیرد. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، مدیریت حافظه در این سیستم‌ها حیاتی است؛ به همین دلیل Raven از EverOS استفاده می‌کند. EverOS یک محیط اجرای حافظه با محوریت Markdown و اولویت محلی (local-first) است که اجازه می‌دهد تجربه، بافتار (Context) و مهارت‌های اکتسابی عامل در جلسات مختلف حفظ شود. این تمرکز بر یکپارچگی بافتار، مشابه پروتکل Auterix است که حافظه معماری پروژه را میان ابزارهای مختلف همگام می‌کند تا از تضاد در تصمیمات کدنویسی جلوگیری شود.

ناوگان عامل‌های متخصص

سامانه Raven با چهار عامل داخلی عرضه شده است که برای دستیابی به عملکرد پیشرو (SOTA) در حوزه‌های خاص طراحی شده‌اند. این عامل‌ها ترکیبی از اجزای هارنس قابل استفاده مجدد با ابزارها، مهارت‌ها و حلقه‌های عاملی تخصصی هستند. Raven می‌تواند یک وظیفه متمرکز را به یک عامل واحد بسپارد یا چندین عامل را در یک گردش‌کار مشترک سازماندهی کند:

  • Raven-Research: این عامل پژوهش‌های عمیق و خودمختار را برای پاسخ به سوالات پیچیده، مرور ادبیات فنی و تحلیل‌های تخصصی ممکن می‌سازد. خروجی آن گزارش‌های ساختاریافته با منابع قابل ردیابی است تا کاربران بتوانند جایگزین‌ها را مقایسه کرده و حوزه‌های ناآشنا را درک کنند. عملکرد این عامل در محک DeepResearch Mixed تایید شده است.
  • Raven-Code: تبدیل نیازمندی‌ها به کد عملیاتی و تست‌شده. این عامل از پیاده‌سازی ویژگی‌ها، دیباگ کردن، بازسازی کد (Refactoring) و تحلیل داده‌ها پشتیبانی می‌کند. طبق گزارش‌ها، این عامل در ۲۴ اوت ۲۰۲۶ در محک DataAgentBench برای تحلیل داده‌ها رتبه اول را کسب کرد. این تفکیک میان برنامه‌ریزی و اجرا، شباهت زیادی به رویکرد Ordewell در جداسازی ارکستراسیون کدنویسی از اجرای آن دارد.
  • Raven-Design: تبدیل ایده‌ها به خروجی‌های بصری صیقل‌خورده مانند مجموعه‌های اسلاید پاورپوینت، دارایی‌های برندینگ، نمودارها و رابط‌های وب. این عامل در حال حاضر در PresentBench برای تولید اسلاید پیشتاز است.
  • Raven-Oncall: اتوماسیون بدون نظارت برای آزمایش‌ها و مانیتورینگ مستمر. این عامل می‌تواند پیشرفت کار را برای چندین ساعت یا حتی در طول شب ادامه دهد. EverMind AI ادعا می‌کند این عامل در وظایف AI-for-Science (AI4S) از نظر نرخ موفقیت و هزینه، به‌طور قابل‌توجهی از Claude Code بهتر عمل می‌کند و در وظایف AI4AI نیز کیفیت و هزینه بهینه‌تری دارد.

سازوکار تکامل خودکار

معماری Raven از ابتدا برای تکامل در زمان اجرا (Runtime Self-Evolution) طراحی شده است. حلقهٔ عملیاتی آن به چهار ماژول استراتژی مجزا تقسیم می‌شود:

  • حافظه (Memory): تعیین می‌کند که در هر نوبت (Turn)، عامل به چه اطلاعاتی دسترسی داشته باشد.
  • برنامه‌ریزی (Planning): نحوه 접근 عامل به انجام کار و استراتژی پیشروی را تعریف می‌کند.
  • قابلیت (Capability): کنترل می‌کند که در هر تکرار، کدام ابزارها در دسترس عامل قرار گیرند.
  • اقدام (Action): تصمیم می‌گیرد چه کاری انجام شود و پیش از اجرای نهایی، آن اقدام را قضاوت می‌کند.

ابزاری به نام Curator (کیوریتور) به‌عنوان موتور تکامل عمل می‌کند. کیوریتور فقط پرامپت را تغییر نمی‌دهد، بلکه با به‌روزرسانی تنظیمات یا نوشتن قطعات کد کوچک برای قضاوت، چهار ماژول استراتژی را بازنویسی می‌کند. کیوریتور می‌تواند ابزارهایی که عامل به آن‌ها دسترسی دارد، رویه‌هایی که دنبال می‌کند و حتی نحوه قضاوت عامل در هر نقطه را جایگزین کند. این فرآیند دور به دور ادامه می‌یابد تا زمانی که کاربر راضی شود، سیستم به یک سطح اشباع (Plateau) برسد یا بودجه تعیین‌شده برای دورها تمام شود.

برای جلوگیری از توهم (Hallucination) — شبیه به دوستی که با اطمینان خاطره‌ای ساختگی را تعریف می‌کند — و جلوگیری از رسیدن سیستم به یک وضعیت خراب، Raven از یک دروازهٔ تأیید سخت‌گیرانه استفاده می‌کند. هیچ تغییری پیش از تأیید نصب نمی‌شود و در صورت شکست در بررسی، فرآیند به نقطه شروع بازمی‌گردد. همچنین برای جلوگیری از «تقلب»، پاسخ‌های مرجع از سیگنال‌های ارسالی به کیوریتور حذف می‌شوند تا هوش مصنوعی مجبور شود منطق زیربنایی خود را بهبود ببخشد، نه اینکه صرفاً پاسخ را پیدا کند.

بنچمارک‌های عملکرد در دنیای واقعی

به گزارش EverMind AI، چهار مورد شاخص توانایی این سیستم را در هدایت تیمی از متخصصان از یک دستور اولیه تا خروجی نهایی ثابت می‌کند:

  • پروژه THRESHOLD (توسعه بازی): Raven به‌طور خودمختار حدود ۴ روز کار کرد و ۴۲ دور برنامه‌ریزی، توسعه و تأیید را پشت سر گذاشت. نتیجه، یک بازی شوتر اول‌شخص در Godot 4 بود که بر محور یک نبرد با باس (Boss Fight) در یک میدان جنگ متمرکز بود. خروجی نهایی شامل خود بازی، یک پوستر، یک ارائه (PPTX) و یک وب‌سایت بود.
  • آزمایش Raven RSI (خودبه‌سازی بازگشتی): در آزمایش‌های پیش‌آموزش nanochat، این سیستم به‌طور مستقل هر دور را برنامه‌ریزی کرد، کد نوشت و آزمایش‌ها را اجرا کرد. Raven توانست ۱۷۲ اجرای آموزشی را در ۷ دور بدون هیچ کرشی (Crash) به پایان برساند و مقدار val_bpb را در یک بودجه ۲۰ دقیقه‌ای با یک GPU واحد، ۵.۸٪ کاهش داد.
  • شبیه‌سازی‌های مهندسی: این سیستم توانست مقدار overshoot در یک شبیه‌سازی شکست سد را تا سه مرتبه بزرگی کاهش دهد و یک جستجوی بار حدی FEA را در ۸ دور دوپاره‌سازی (Bisection) به پایان برساند. خروجی‌ها شامل نتایج تجربی، بصری‌سازی‌ها، یک پوستر و وب‌سایت پروژه بود.
  • عرضه محصول (Product Launch): Raven یک کیت کامل عرضه تولید کرد که شامل یک مینی‌گیم فیزیک مبتنی بر مرورگر، یک معرفی محصول در ۱۶ اسلاید، پوسترهایی به زبان‌های انگلیسی و چینی و یک فایل README جامع بود.

زیرساخت و اکوسیستم

Raven توسط ابزارهای داخلی پیشرفته‌ای پشتیبانی می‌شود که چرخه حیات هوش عاملی را مدیریت می‌کنند:

  • Evolver: ابزاری مجزا که Raven را به‌عنوان یک کتابخانه مصرف می‌کند. Evolver شکست‌ها را تشخیص داده و تغییرات پیشنهادی هارنس را در برابر بنچمارک‌ها تست می‌کند تا عامل‌ها را توسعه دهد (به جای اینکه داخل آن‌ها اجرا شود).
  • SkillForge: تخصص‌های مرتبط را از کتابخانه‌های محلی، حافظه EverOS و کاتالوگ SkillHub (شامل ۱۱۴,۱۹۰ مهارت تخصصی) بازیابی می‌کند.
  • Proactivity: با ترکیب مانیتورینگ رویدادها و اجرای زمان‌بندی‌شده، نیازهای کاربر را پیش‌بینی کرده و کارهای تکمیلی را آغاز می‌کند.
  • Persona Assembly: کیوریتور می‌تواند بر اساس توصیفات کاربر، یک «پرسونا»ی سفارشی بسازد؛ یعنی یک نقش رهبری و تیمی از متخصصان را با تقسیم کار مشخص و بررسی‌های لازم سازماندهی کند.

این سامانه از طریق ACP، CLI یا APIهای سازگار با OpenAI به عامل‌های شخص ثالث متصل می‌شود و شامل پیش‌تنظیماتی برای ۱۳ عامل خارجی است. Raven بخشی از یک استک گسترده‌تر «پژوهش-تا-اجرا» در EverMind AI است:

  • پژوهش‌های حافظه: شامل HyperMem (حافظه سلسله‌مراتبی مبتنی بر هایپرگراف برای بازیابی از کلی به جزئی)، MSA Memory (توجه پراکنده برای حافظه نهفته مقیاس‌پذیر و بافتارهای ۱۰۰ میلیون توکنی) و EverAlgo (عملگرهای حافظه، رتبه‌بندی و تجزیه بدون وضعیت).
  • ابزارهای ارزیابی: EverMemBench برای یادآوری حقایق و استدلال کاربردی، و EvoAgentBench برای ارزیابی طولی تکامل عاملی، کارایی انتقال مهارت و اجتناب از خطا.
  • یکپارچه‌سازها: پلاگین‌هایی برای OpenClaw (بازیابی و ضبط خودکار حافظه جلسه)، Hermes Agent (حافظه پایدار بین جلسات)، DeepSeek Harness (DSH) (عامل‌های آگاه به حافظه) و Dify (ابزارهای ابری و سلف-هاست برای جستجوی صریح حافظه).

استقرار و دسترسی فنی

برای توسعه‌دهندگان، Raven به‌عنوان یک پروژه متن‌باز تحت لایسنس Apache 2.0 در دسترس است. این سیستم می‌تواند از طریق Docker (با دستور docker compose -f docker/docker-compose.yml up) یا مستقیماً روی لینوکس، مک و ویندوز از طریق اسکریپت‌های شل نصب شود.

گزینه‌های نصب عبارتند از:

  • خودکار: استفاده از پرامپت در عامل‌هایی مثل Claude Code یا Codex برای خواندن راهنمای شروع سریع.
  • شل (Shell): برای سیستم‌های یونیکسی از دستور curl -fsSL https://raven.evermind.ai/install.sh | bash و برای پاورشل از irm https://raven.evermind.ai/install.ps1 | iex استفاده می‌شود.
  • سورس: کلون کردن مخزن گیت‌هاب و اجرای ./install.sh برای حالت editable که اجازه توسعه روی کد را می‌دهد.

سیستم شامل یک رابط کاربری وب (WebUI) در پورت ۱۸۷۹۳ است که اجازه می‌دهد کاربران با عامل‌ها چت کنند، پیشرفت وظایف را دنبال کنند و حافظه و مهارت‌ها را در یک مکان مرور کنند. این WebUI یک کامپوزر واحد فراهم می‌کند که مهارت‌ها، پلی‌بوک‌ها، دانش و حافظه را تنها با یک کلیک در دسترس قرار می‌دهد.

این چرخش راهبردی، صنعت را از «مهندسی پرامپت» به سمت «مهندسی هارنس» (Harness Engineering) می‌برد. به‌جای نوشتن دستورالعمل بی‌نقص، توسعه‌دهندگان معیارهای ارزیابی را تعریف می‌کنند و اجازه می‌دهند سیستم مسیر بهینه را تکامل دهد. در واقع، هوش مصنوعی به توسعه‌دهندهٔ خودش تبدیل می‌شود و گلوگاه انسانی در خط لوله‌های پیچیده نرم‌افزاری و پژوهشی کاهش می‌یابد.

اگر این مسیر ادامه یابد، مهارت اصلی اپراتورهای هوش مصنوعی از «دانستن اینکه چگونه با مدل صحبت کنند» به «دانستن اینکه چگونه بنچمارک‌هایی بسازند که تکامل مدل را هدایت کند» تغییر خواهد کرد.

اگر توسعه‌دهنده هستید، مخزن گیت‌هاب Raven را کلون کرده و با دستور ./install.sh در حالت editable نصب کنید تا منطق تکامل آن را بررسی کنید.

  • معیارهای ارزیابی (Benchmarks) دقیق برای وظایف تکراری خود تعریف کنید تا بتوانید از قابلیت RSI برای بهینه‌سازی خودکار گردش‌کارتان استفاده کنید.
  • رابط WebUI را در پورت ۱۸۷۹۳ باز کنید و سعی کنید یک Persona سفارشی برای تیمی از متخصصان مجازی بسازید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این سامانه با حذف نیاز به اصلاح دستی پرامپت‌ها، سرعت توسعه نرم‌افزارهای پیچیده را به‌شدت افزایش می‌دهد. اعتبار این رویکرد از نتایج ملموس در بنچمارک‌های کدنویسی و مهندسی EverMind AI تأیید شده است.

تأثیر برای ایران

به‌دلیل متن‌باز بودن (Apache 2.0) و قابلیت استقرار محلی (Local-first)، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به APIهای پولی و محدود، این سامانه را روی سرورهای داخلی اجرا کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز بر «مهندسی هارنس» به‌جای پرامپت، نشان می‌دهد که گلوگاه پیشرفت عامل‌ها دیگر قدرت مدل بنیادی نیست، بلکه ساختار نظارتی است که مدل را مجبور به اصلاح می‌کند. این رویکرد عملاً نقش برنامه‌نویس را از «نویسنده کد» به «طراح سیستم ارزیابی» تغییر می‌دهد. در آینده، برنده کسی نیست که بهتر پرامپت می‌نویسد، بلکه کسی است که دقیق‌ترین محک‌ها را برای تکامل مدل می‌سازد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.