پرش به محتوای اصلی
پرش به محتوای مقاله

۶ مخزن گیت‌هاب برای استقرار محلی زیرساخت عامل‌های هوش مصنوعی

·۱۳ مهر ۱۴۰۵۷ دقیقه مطالعه
گردآورده
۶ مخزن گیت‌هاب برای میزبانی شخصی این هفته: پشته عامل هوشمند
۶ مخزن گیت‌هاب برای میزبانی شخصی این هفته: پشته عامل هوشمند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر از مدل «مصرف سرویس ابری» به «مالکیت سیستم محلی» برای تمام لایه‌های یک عامل (حافظه، تصمیم‌گیری و اعلان‌ها)؛ چیزی که پیش از این فقط در سطح مدل (LLM) محلی رخ داده بود.

اگر امروز برای مدیریت عامل‌های هوش مصنوعی خود به سرویس‌های ابری متکی هستید، احتمالاً بخشی از کنترل داده‌ها و هزینه‌های استنتاج خود را از دست داده‌اید. اکنون زمان آن رسیده که «مغز» و «دفتر حسابات» عامل‌هایتان را به محیط محلی منتقل کنید. در تاریخ ۵ اکتبر ۲۰۲۶، موجی از مخازن ترند شده در گیت‌هاب سیگنالی از تغییر جهت به سمت زیرساخت‌های محلی برای عامل‌ها ارسال کرد؛ تغییری که اجزای حیاتی مانند حافظه و تصمیم‌گیری را از ابرهای انحصاری دور می‌کند.

تا پیش از این، روایت عامل‌های هوشمند تقریباً به‌طور کامل در فضای ابر جریان داشت. طی دو سال گذشته، اکثر توسعه‌دهندگان برای حفظ وضعیت (State) و ارکستراسیون به سرویس‌های مدیریت‌شده وابسته بودند. این موضوع علاوه بر ایجاد وابستگی شدید به APIهای خارجی، نگرانی‌های شدیدی درباره حریم خصوصی داده‌های حساس ایجاد می‌کرد.

تصور کنید عامل هوش مصنوعی شما یک کارمند دیجیتال است؛ تا به امروز، حافظه و ابزارهای این کارمند در اختیار شخص دیگری بود. میزبانی شخصی (Self-hosting) یعنی شما مالک حافظه و ابزارهای او هستید و تضمین می‌کنید که هیچ داده‌ای از شبکه محلی شما خارج نشود. همان‌طور که در بحث‌های گذشته ما درباره امنیت مدل‌های بازمتن اشاره کردیم، کنترل لایه‌های زیرساختی تنها راه دستیابی به حاکمیت داده است. این رویکرد در راستای تحولاتی است که در پروژه‌هایی مانند OpenClaw 2.0 برای میزبانی شخصی سریع‌ترین عامل‌ها مشاهده کردیم.

لایه حافظه و دستیار

Hindsight به عنوان مهم‌ترین ابزار این مجموعه ظهور کرده است که تنها در یک هفته حدود ۱۱,۰۰۰ ستاره دریافت کرد و مجموعاً به ۳۸,۴۰۰ ستاره رسید. این سامانه حافظه با مجوز MIT، حقایق جهان، تجربیات، مشاهدات و مدل‌های ذهنی را ذخیره می‌کند. در این ساختار، عامل‌ها به‌جای بازخوانی کل تاریخچه چت، از Hindsight برای یادگیری تدریجی در طول زمان استفاده می‌کنند.

این ابزار در قالب یک کانتینر داکر (Docker) با پایگاه‌داده داخلی Postgres عرضه می‌شود و از بیش از ۲۵ ارائه‌دهنده مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — پشتیبانی می‌کند. این مدل‌ها شامل گزینه‌های محلی مانند Ollama، LM Studio و llama.cpp و همچنین اشتراک‌های پولی Claude Pro/Max و ChatGPT هستند. برای استقرار، کاربران می‌توانند با اجرای یک دستور داکر از ایمیج ghcr.io/vectorize-io/hindsight:latest و مپ کردن پورت‌های ۸۸۸۸ و ۹۹۹۹، سامانه را فعال کنند.

به نقل از مستندات پروژه، Hindsight ابزارهای یکپارچه‌سازی حیاتی ارائه می‌دهد. این‌ها شامل یک سرور MCP و یک Wrapper برای LLM است که از طریق دستور pip install hindsight-litellm قابل نصب است. همچنین یک نصب‌کننده برای عامل‌های کدنویسی فراهم شده که حافظه پروژه را به‌صورت مجزا برای هر مخزن (per-repo) در ابزارهایی مثل Claude Code، Codex و Cursor مدیریت می‌کند. اگرچه پروژه ادعای نتایج پیشرو در LongMemEval را دارد، اما توصیه می‌شود ابتدا آن را روی عامل‌های خود آزمایش کنید.

برای کسانی که به یک رابط کاربری کامل نیاز دارند، Octop یک دستیار چندکاربره و چندعاملی است که توسط Tencent Cloud توسعه یافته است. این ابزار با مجوز MIT و نسخه ۱.۰.۲b۴، حدود ۵,۴۰۰ ستاره دارد. Octop به پایتون ۳.۱۲ به بالا نیاز دارد و به‌طور پیش‌فرض از SQLite استفاده می‌کند، هرچند PostgreSQL را نیز به عنوان گزینه اختیاری پشتیبانی می‌کند. تمام سیستم به صورت یک پردازش واحد اجرا می‌شود که در برابر ری‌استارت مقاوم است و هنگام بوت شدن، وضعیت خود را از پایگاه‌داده بازسازی می‌کند.

طبق گزارش توسعه‌دهندگان، Octop از کانال‌های ارتباطی متنوعی مثل داشبورد وب، اپلیکیشن دسکتاپ، CLI و پیام‌رسان‌هایی مانند تلگرام، دیسکورد، وی‌چت (WeChat) و دینگ‌تاک (DingTalk) پشتیبانی می‌کند. قابلیت‌های آن بسیار گسترده است:

  • یک پایگاه دانش تولید بازیابی‌افزا (RAG) — مثل دانش‌آموزی که قبل از جواب دادن، اول کتاب درسی را باز می‌کند و از آن نقل می‌آورد — برای بازیابی مستندات.
  • کارهای زمان‌بندی‌شده (Cron jobs) با زبان طبیعی برای برنامه‌ریزی وظایف.
  • اتوماسیون مرورگر و نمای ریموت دسکتاپ برای کنترل سیستم.
  • سیاست کنترل دسترسی (ACP) برای سپردن کارهای کدنویسی به OpenCode یا Claude Code در پشت گیت‌های مجوز.

نصب این ابزار از طریق pip install octop انجام می‌شود که از uv برای ساخت یک محیط مجازی ایزوله در مسیر ~/.octop/ استفاده می‌کند تا پایتون سیستم کاربر پاک بماند. همچنین یک فایل docker-compose.yml برای استقرار سریع ارائه شده است. با توجه به اینکه این ابزار در نسخه بتا است و «درهای» دسترسی زیادی را باز می‌کند، توصیه می‌شود ابتدا در شبکه‌های خصوصی یا محیط‌های آزمایشگاهی خانگی اجرا شود.

زیرساخت و مدل‌های تصمیم‌گیری

پروژه open-compute قابلیت‌های مشابه Cloudflare Workers را به یک ماشین واحد می‌آورد. این ابزار که با زبان Rust نوشته شده و مجوز Apache-2.0 دارد، حدود ۱,۳۰۰ ستاره دارد. این سامانه امکاناتی مثل KV stores، D1، R2، Durable Objects، Queues و Workflows را بدون نیاز به Kubernetes، Redis یا یک Service Mesh فراهم می‌کند. زیرساخت آن بر پایه SQLite و ذخیره‌سازهای محلی یا سازگار با S3 است.

پس از نصب از طریق اسکریپت open-compute.dev، کاربران با دستورات ocd setup --yes و ocd status سامانه را پیکربندی می‌کنند. استقرار کدها از طریق ocd wrangler deploy و با استفاده از wrangler نسخه ۴.۱۳۸.۰ صورت می‌گیرد. کد Worker روی یک فورک از workerd اجرا می‌شود که پین شده و Checksum آن تایید شده است. لازم به ذکر است که این ابزار فعلاً به یک ماشین محدود است و برای کسانی که به مقیاس بیشتر نیاز دارند، Portainer 3.0 یا Coolify گزینه‌های بهتری هستند.

در لایه مدل‌ها، CLM-8B نشان‌دهنده چرخش به سمت هوش مصنوعی تخصصی برای عامل‌ها است. این مدل که توسط Stanford و Nvidia توسعه یافته و در ۲۳ سپتامبر ۲۰۲۶ منتشر شده، یک مدل تصمیم‌گیری System One با مجوز Apache-2.0 است. برخلاف مدل‌های معمولی، خروجی‌های آن به‌جای پاراگراف‌های طولانی، مقادیر کوتاهی مثل 'Null'، 'Choice' یا 'Score' است تا عامل‌ها به‌جای تحلیل متن، مستقیماً تصمیم را دریافت کنند.

بر اساس داده‌های پروژه، CLM-8B روی ۶۰ میلیون جفت پرسش و پاسخ Nemotron پیش‌آموزش دیده و روی ۱ میلیون مسیر (Trajectory) عاملی پس‌آموزش دیده است. این مدل در وظایف استفاده از کامپیوتر، گیمینگ و فراخوانی ابزار، تا ۹ برابر تأخیر (Latency) کمتری نسبت به مدل Jev دارد. این مدل در Terminal-Bench 2.1 به دقت ۸۷.۶٪ و در DeepSWE به عنوان یک تاییدکننده (Verifier) پس از Fine-tuning سبک، به دقت ۸۱.۶٪ رسید.

برای اجرا، کاربران باید pip install contrastive-lm را نصب کرده و از vllm serve Qwen/Qwen3-8B به عنوان انکودر در کنار clm-serve استفاده کنند؛ ابزاری که یک Reference Head ۷۵ مگابایتی را فراخوانی می‌کند. این مدل به GPU انویدیا نیاز دارد. وضعیت‌های (States) بیش از ۲۰۴۸ توکن قطع می‌شوند مگر اینکه هر دو محدودیت افزایش یابند. این مدل برای عامل‌هایی که تصمیمات کوچک و سریع می‌گیرند، بسیار مناسب‌تر از چت‌های عمومی است.

مشاهده‌پذیری و اعلان‌ها

ابزار Agent Console مشکل «جعبه سیاه» هزینه‌های توکن را حل می‌کند. این ابزار مشاهده‌پذیری محلی برای عامل‌های کدنویسی است (مجوز MIT، حدود ۵۲۰ ستاره) که به Node.js ۲۲ یا جدیدتر نیاز دارد. این سامانه با خواندن ترنسکریپت‌های Claude Code و Codex که از قبل روی ماشین هستند، میزان توکن‌های مصرفی، خواندن/نوشتن کش، مدل‌های استفاده شده و هزینه‌های قیمت لیست را برای هر جلسه و هر ماشین نمایش می‌دهد.

برای تیم‌ها، یک هاب اختیاری میزبانی‌شده فراهم شده که نمای یکپارچه‌ای از تمام لپ‌تاپ‌ها و سرورهای بیلد ارائه می‌دهد. این ابزار می‌تواند متریک‌های Claude Code OpenTelemetry یا LiteLLM را دریافت کرده، یک Endpoint برای Prometheus در مسیر /metrics باز کند و یک داشبورد Grafana را تغذیه کند. همچنین دارای «حالت ارائه» (Presenting Mode) است که نام پروژه‌ها و ماشین‌ها را با نام‌های جایگزین عوض می‌کند تا اشتراک‌گذاری صفحه نمایش امن باشد و هیچ تلمتری (Telemetry) در آن وجود ندارد.

در نهایت، Boop یک سامانه اعلان‌های Push مینیمال است. این ابزار که یک باینری Go، یک فایل SQLite و یک کانتینر داکر است (مجوز MIT، حدود ۸۲۰ ستاره)، به شما اجازه می‌دهد اپلیکیشن‌هایتان یک رویداد را با API Key پروژه POST کنند. سرور اطلاعات را سانسور کرده، در ./data/boop.db ذخیره می‌کند و آن را با استفاده از کلید .p8 شما به APNs اپل ارسال می‌کند.

Boop تمام واسطه‌های ابری و حساب‌های میزبانی‌شده را حذف می‌کند. اعلان Push فقط شامل عنوان، متن و ID رویداد است و گوشی باید بقیه جزئیات را از سرور شما دریافت کند. این ساختار برای هشدارهای پشتیبان، خطاهای Cron Job و پینگ‌های استقرار عالی است. با این حال، اپلیکیشن iOS آن فقط به‌صورت کد منبع ارائه شده و باید توسط کاربر با تنظیمات توسعه‌دهنده اپل امضا و بیلد شود.

خلاصه نیازمندی‌های فنی

  • Hindsight: داکر، API Key مدل زبانی یا مدل محلی (Ollama, LM Studio, llama.cpp).
  • Octop: پایتون ۳.۱۲+، SQLite (PostgreSQL اختیاری).
  • open-compute: یک ماشین واحد، یک باینری Rust، wrangler 4.138.0.
  • CLM-8B: GPU انویدیا، vLLM، انکودر Qwen/Qwen3-8B.
  • Agent Console: Node.js ۲۲+.
  • Boop: داکر، حساب توسعه‌دهنده اپل (برای امضای اپلیکیشن iOS).

سایر ابزارهای ترند

علاوه بر موارد بالا، پروژه‌های دیگری نیز در حال رشد هستند:

  • ZCode: چارچوب (Harness) عامل کدنویسی Z.ai با مجوز Apache-2.0 و حدود ۶,۹۰۰ ستاره.
  • WeKnora: تبدیل مستندات به یک RAG، یک عامل و یک ویکی که خودش را مدیریت می‌کند (حدود ۳۰,۷۰۰ ستاره).
  • golive-skill: یک مهارت عاملی و CLI با مجوز MIT برای آنلاین کردن اپلیکیشن‌های ساخته شده توسط عامل‌ها روی هاست و دامین شخصی (حدود ۱,۰۰۰ ستاره).
  • AgentVerse-OS: یک سیستم‌عامل ابری شخصی در نسخه آلفا برای توسعه‌دهندگان و عامل‌ها روی یک سرور اوبونتو (حدود ۱,۰۰۰ ستاره).

این چرخش به سمت میزبانی شخصی، مفروضات بنیادی توسعه عامل‌ها را تغییر می‌دهد. ما از مدل «مصرف سرویس» به مدل «مالکیت سیستم» می‌رویم که منجر به کاهش هزینه‌های بلندمدت API و حذف تأخیرهای ناشی از رفت و برگشت داده‌ها به مراکز داده دوردست می‌شود. این تحول با مفاهیمی که در پلتفرم OtoDock برای تبدیل مدل‌ها به عامل‌های سخت‌افزارمحور بررسی کردیم، هم‌راستا است.

برای یک توسعه‌دهنده، این یعنی سد ورود برای ساخت عامل‌هایی با حافظه بلندمدت شکسته شده است. دیگر برای دادن «شخصیت» یا تاریخچه به عامل خود نیازی به معماری پیچیده ابری نیست؛ یک کانتینر داکر کافی است.

با این حال، بهای این آزادی، مسئولیت نگهداری است. میزبانی شخصی نیازمند مدیریت بک‌آپ‌ها و وصله‌های امنیتی است. همان‌طور که در مورد Octop دیدیم، اجرای نرم‌افزارهای بتا در شبکه عمومی ریسک‌پذیر است و این ابزارها فعلاً برای آزمایشگاه‌های خصوصی یا استقرار در محیط خانوادگی مناسب‌ترند.

گام بعدی شما

  • برای حل مشکل فراموشی عامل‌ها و ایجاد حافظه بلندمدت، ابتدا Hindsight را روی داکر نصب کنید.
  • اگر روزانه از عامل‌های کدنویسی استفاده می‌کنید، Agent Console را برای متوقف کردن اتلاف توکن‌ها و کنترل هزینه‌ها راه‌اندازی کنید.
  • در صورت داشتن سخت‌افزار انویدیا، مدل CLM-8B را برای تجربه آینده‌ای که در آن عامل‌ها به‌جای چت کردن، تصمیمات سریع و گسسته می‌گیرند، امتحان کنید.
  • برای کاربران آیفون که از بیلد کردن اپلیکیشن‌های خود لذت می‌برند، Boop یک پروژه عالی برای تعطیلات آخر هفته است.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تغییر پارادایم، حاکمیت داده‌ها را به توسعه‌دهندگان بازمی‌گرداند و هزینه‌های جاری استنتاج را حذف می‌کند. اعتبار این رویکرد از رشد سریع ستاره‌های مخازن ابزارهای حافظه محلی در گیت‌هاب تأیید می‌شود.

تأثیر برای ایران

این ابزارها به‌دلیل متن‌باز بودن و قابلیت استقرار محلی، بهترین مسیر برای توسعه‌دهندگان ایرانی جهت دور زدن تحریم‌های API و محدودیت‌های پرداخت ارزی هستند.

·نگاه ما
تحریریه دات‌هوش

انتقال زیرساخت عامل‌ها به محیط محلی، پایان عصر وابستگی مطلق به APIهای بسته است. این روند نشان می‌دهد که صنعت از مرحله «تست قابلیت‌ها» به مرحله «بهینه‌سازی عملیاتی» رسیده است، جایی که مالکیت حافظه و کاهش تأخیر استنتاج، بر قدرت خام مدل‌های ابری اولویت می‌یابد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.