پرش به محتوای اصلی
پرش به محتوای مقاله

۱۱ چارچوب متن‌باز برای مدیریت عامل‌های هوش مصنوعی محلی در سال ۲۰۲۶

·۲۷ شهریور ۱۴۰۵۷ دقیقه مطالعه۳ بازدید
راهنما
نمای کلی از چارچوب‌های متن‌باز عامل هوشمند برای مدل‌های زبانی محلی در سال ۲۰۲۶
نمای کلی از چارچوب‌های متن‌باز عامل هوشمند برای مدل‌های زبانی محلی در سال ۲۰۲۶
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تأیید این واقعیت که در سال ۲۰۲۶، «هارنس» (سیستم مدیریت) عامل محلی، تأثیر بیشتری بر خروجی نهایی دارد تا خودِ مدل زبانی. همچنین شناسایی ۶۴ هزار توکن به عنوان حداقل استاندارد برای عملیاتی شدن عامل‌های کدنویسی.

اگر امروز یک عامل هوش مصنوعی محلی را اجرا می‌کنید و با شکست مواجه می‌شوید، احتمالاً مشکل از هوش مدل نیست، بلکه پنجرهٔ زمینه (Context Window) شما بیش از حد کوچک است. تنظیم این مقدار روی ۶۴,۰۰۰ توکن، حیاتی‌ترین تغییری است که هر توسعه‌دهنده‌ای برای خروج از بن‌بستِ خطاهای سیستمی باید انجام دهد. بدون این تنظیمات، اکثر چارچوب‌های متن‌باز نه به دلیل کم‌هوشی مدل، بلکه به این دلیل شکست می‌خورند که سیستم نمی‌تواند وضعیت (State) کافی را برای اجرای یک وظیفه پیچیده در حافظه نگه دارد.

استقرار مدل‌های زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — از رابط‌های سادهٔ چت به سمت گردش‌کارهای «عامل‌محور» (Agentic) تغییر مسیر داده است. یک عامل از دو بخش تشکیل شده است: مدل و هارنس (Harness). هارنس در واقع سیستم مدیریتی است که دسترسی‌ها را کنترل می‌کند، ابزارها را اجرا می‌کند و زمینه را به مدل بازمی‌گرداند. همان‌طور که در تحلیل قبلی ما درباره‌ی نقش گراف‌های دانش در توقف توهمات از طریق زمینه‌سازی ساختاریافته اشاره کردیم، نحوه دسترسی هوش مصنوعی به اطلاعات و سازماندهی آن‌ها، گلوگاه اصلی قابلیت اطمینان است. در این راستا، پیاده‌سازی مکانیزم‌های مهندسی برای جلوگیری از فراموشی اهداف در لایه هارنس، برای حفظ تداوم عملیات در وظایف طولانی‌مدت ضروری است.

برای یک توسعه‌دهنده، نبرد اصلی در لایهٔ هارنس رخ می‌دهد. پنجره‌های زمینه کوچک و ضعف در قابلیت‌های فراخوانی ابزار (Tool-calling) در مدل‌های محلی، هر نقص طراحی در هارنس را برملا می‌کند. تمام حقایق مربوط به مخازن در این راهنما در تاریخ ۱۸ سپتامبر ۲۰۲۶ از گیت‌هاب استخراج شده است. طبق گزارشی از Marktechpost، اثربخشی این ابزارها به چهار عامل کلیدی بستگی دارد: مجوزهای مورد تأیید OSI، مستندات اجرای محلی، وضعیت نگهداری و به‌روزرسانی، و کنترل‌های ایمنی. بدون این زیرساخت‌ها، حتی قدرتمندترین مدل‌ها نیز در محیط محلی ناکارآمد هستند. این چالش‌ها را می‌توان در مشکل تعمیم عامل‌های هوش مصنوعی در محیط‌های جدید مشاهده کرد، جایی که تغییرات در مهندسی هارنس لزوماً به بهبود عملکرد در سناریوهای مختلف منجر نمی‌شود.

قوانین طلایی عامل‌های محلی

پیش از انتخاب هارنس، باید سه محدودیت سخت‌افزاری و نرم‌افزاری را برطرف کنید:

  • گسترش پنجرهٔ زمینه: طبق مستندات Ollama، مقدار پیش‌فرض بسته به VRAM متفاوت است: ۴ هزار توکن برای حافظه کمتر از ۲۴ گیگابایت؛ ۳۲ هزار توکن برای ۲۴ تا ۴۸ گیگابایت؛ و ۲۵۶ هزار توکن برای ۴۸ گیگابایت یا بیشتر. با این حال، عامل‌ها و ابزارهای کدنویسی برای عملکرد صحیح حداقل به ۶۴ هزار توکن نیاز دارند. راهکار ساده است و با یک دستور اجرا می‌شود: OLLAMA_CONTEXT_LENGTH=64000 ollama serve.
  • پشتیبانی از فراخوانی ابزار: مدل‌هایی که قابلیت بومی فراخوانی ابزار را ندارند، طبق مستندات ارائه‌دهنده Goose، تنها به تکمیل چت (Chat Completion) محدود می‌شوند. برای کاربرانی که از llama.cpp استفاده می‌کنند، فعال کردن پرچم --jinja برای فعال‌سازی قالب‌های چت سازگار و قابلیت فراخوانی ابزار ضروری است.
  • بودجهٔ حافظه: ابزار Cline پیشنهاد می‌کند برای مدل‌های کوانتیده (Quantized) کوچک ۱۶ تا ۳۲ گیگابایت رم، برای مدل‌های متوسط کدنویسی ۳۲ تا ۶۴ گیگابایت و برای مدل‌های بزرگتر بیش از ۶۴ گیگابایت رم در نظر بگیرید. برای مثال، مدل gemma4 به حدود ۱۶ گیگابایت VRAM و مدل qwen3.6 به حدود ۲۴ گیگابایت نیاز دارد.

برترین هارنس‌های متمرکز بر کدنویسی

OpenCode منعطف‌ترین گزینه برای توسعه‌دهندگان است. این ابزار سه مسیر محلی شامل Ollama، LM Studio و llama-server را مستند کرده و در مجموع از بیش از ۷۵ ارائه‌دهنده پشتیبانی می‌کند. راه‌اندازی آن می‌تواند به سادگی یک دستور باشد؛ کاربران اولاما می‌توانند ollama launch opencode را اجرا کنند. این هارنس پنجره زمینه حداقل ۶۴ هزار توکن را توصیه می‌کند، هرچند مستندات آن پیشنهاد می‌دهند اگر فراخوانی ابزارها با شکست مواجه شد، مقدار num_ctx را به ۱۶ تا ۳۲ هزار افزایش دهید. این ابزار با دو عامل عرضه می‌شود: 'build' برای دسترسی کامل و 'plan' برای عملیات خواندنی که پیش از اجرای دستورات bash اجازه می‌گیرد.

Pi جایگزینی مینیمالیست است. فایل README آن به مدل تنها چهار ابزار می‌دهد: خواندن (read)، نوشتن (write)، ویرایش (edit) و bash. این ابزار عمداً از MCP، زیر-عامل‌ها، حالت برنامه‌ریزی (plan mode) و پنجره‌های تأیید دسترسی صرف‌نظر کرده است تا فضای بیشتری از پنجرهٔ زمینه را برای کدها ذخیره کند. Pi در آوریل ۲۰۲۶ توسط شرکت Earendil تصاحب شد (و سازنده آن، ماریو زکنر، به این شرکت پیوست) و اکنون به عنوان زیربنای OpenClaw عمل می‌کند. این ابزار پشتیبانی بومی از سرور روتور llama.cpp برای بارگذاری فایل‌های GGUF در صورت نیاز دارد که از طریق /llama مدیریت می‌شود. با این حال، Pi فاقد سیستم مجوز داخلی است و با دسترسی کامل کاربر اجرا می‌شود؛ به همین دلیل در README توصیه شده است که برای ایزوله‌سازی از Docker، افزونه‌های micro-VM یا یک sandbox سیاستی استفاده کنید. این پروژه از badlogic/pi-mono به earendil-works/pi منتقل شده است.

Cline انتخاب اول کاربران VS Code است. این ابزار برای استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند — تنظیم «Use Compact Prompt» را پیشنهاد می‌دهد و توصیه می‌کند با رشد حجم زمینه، از وظایف متمرکز و جلسات (sessions) تازه استفاده کنید. به طور پیش‌فرض، هر ویرایش فایل و هر دستور نیاز به تأیید دارد، هرچند تأیید خودکار اختیاری است. Cline از دو حالت Plan و Act برای جداسازی استراتژی از اجرا استفاده می‌کند. در حالی که افزونه VS Code، CLI و SDK آن تحت مجوز Apache-2.0 هستند، پلاگین‌های JetBrains آن همچنان متن‌بسته باقی مانده‌اند.

OpenHands دقیق‌ترین راهنمای محلی را ارائه می‌دهد. طبق اعلام این پروژه در ۲۱ مه ۲۰۲۶، مدل Qwen3.6-35B-A3B به عنوان مدل محلی اصلی توصیه می‌شود. نیازهای سخت‌افزاری به طور صریح ذکر شده است: نسخه‌های کوانتیده حداقل به ۲۴ گیگابایت VRAM یا یک مک با تراشه Apple Silicon و ۶۴ گیگابایت حافظه یکپارچه نیاز دارند. این ابزار هشدار می‌دهد که مقدار پیش‌فرض ۴,۰۹۶ توکن در اولاما حتی برای گنجاندن پرامپت سیستمی (System Prompt) بیش از حد کوچک است و حداقل ۲۲,۰۰۰ تا ۳۲,۷۶۸ توکن توصیه می‌شود. کاربران لینوکس باید توجه کنند که LM Studio به طور پیش‌فرض به 127.0.0.1 متصل می‌شود؛ برای اینکه OpenHands (که در داکر اجرا شده) بتواند به آن دسترسی داشته باشد، فعال کردن گزینه "Serve on Local Network" ضروری است.

Aider مشکل ضعف در فراخوانی ابزار را با استفاده از فرمت‌های ویرایشی متنی (فایل‌های کامل یا بلوک‌های diff) به جای فراخوانی تابع حل کرده است. این ابزار همچنین یک نقشه از نمادهای کلیدی مخزن (repository map) را با هر درخواست می‌فرستد تا مدل بتواند در کدها پیمایش کند. مستندات اولامای آن هشدار می‌دهد که اولاما به طور بی‌صدا زمینه‌های فراتر از پنجره را دور می‌ریزد؛ Aider با اندازه‎‌گذاری پنجره بر اساس هر درخواست به علاوه ۸ هزار توکن برای پاسخ، با این مشکل مقابله می‌کند. وضعیت نگهداری این پروژه جای تأمل دارد؛ PyPI نسخه 0.86.2 را در ۱۲ فوریه ۲۰۲۶ نشان می‌دهد که پس از انتشار قبلی در ۱۳ اوت ۲۰۲۵ بوده است.

عامل‌های چندمنظوره و تخصصی

Goose که توسط Block به بنیاد Agentic AI Foundation (تأسیس ۹ دسامبر ۲۰۲۵) اهدا شده، با زبان Rust نوشته شده و بیش از ۷۰ افزونه MCP را پشتیبانی می‌کند. این ابزار برای اتوماسیون‌های کلی فراتر از کدنویسی طراحی شده و به صورت اپلیکیشن دسکتاپ، CLI و API عرضه می‌شود. مستندات ارائه‌دهنده آن شامل Ollama، LM Studio، Docker Model Runner، Ramalama و Atomic Chat است و از vLLM و KServe از طریق ارائه‌دهنده سازگار با OpenAI پشتیبانی می‌کند. راه‌اندازی آن ساده است: اجرای goose configure و انتخاب اولاما و وارد کردن نام مدل.

Codex CLI ابزاری با مجوز Apache-2.0 است که به طور پیش‌فرض از مدل gpt-oss:20b از طریق دستور codex --oss استفاده می‌کند. این ابزار شامل crateهای sandbox اختصاصی برای لینوکس و ویندوز است. یک شرط سخت‌گیرانه دارد: سرور محلی باید API پاسخ‌ها را در مسیر /v1/responses ارائه دهد، زیرا سورس کد اکنون wire_api = "chat" را رد می‌کند. این ابزار اولاما را روی پورت ۱۱۴۳۴ و LM Studio را روی پورت ۱۲۳۴ تعریف می‌کند.

Hermes Agent محصول Nous Research، روی یک حلقه یادگیری متمرکز است که مهارت‌ها را از تجربه می‌سازد. این یک عامل شخصی است و نه یک ابزار کدنویسی، که با بیش از ۷۰ مهارت و حافظه بین‌جلسه‌ای عرضه می‌شود. راه‌اندازی آن شامل متصل کردن Hermes به http://127.0.0.1:11434/v1 با تشخیص خودکار طول زمینه است. این عامل با تلگرام، دیسکورد، اسلک، واتس‌اپ، سیگنال و ایمیل ادغام می‌شود.

سایر موارد قابل ذکر:

  • Qwen Code: بهینه‌شده برای مدل‌های Qwen و پشتیبانی از پروتکل‌های OpenAI، Anthropic، Gemini و Qwen. این ابزار از Google Gemini CLI v0.8.2 شروع شد و به Node.js 22+ نیاز دارد.
  • Kilo Code: فورکی از OpenCode که در سال ۲۰۲۵ به عنوان فورکی از Roo شروع شد. این پروژه در ۲ آوریل ۲۰۲۶ یک افزونه بازسازی‌شده برای VS Code منتشر کرد و از Ollama، LM Studio و Atomic Chat پشتیبانی می‌کند.
  • OpenClaw: پرطرفدارترین پروژه (از نظر ستاره‌های گیت‌هاب) در این راهنما است. این یک دستیار پیام‌محور است که عامل‌های AI را به سرویس‌های چت متصل می‌کند. اولاما برای آن پنجره زمینه ۶۴ هزار توکن را توصیه می‌کند. کاربران باید به هشدار امنیتی مربوط به دسترسی به ابزارها در اولین اجرا توجه کنند.

تحلیل: گذار به عصر «هارنس»

این رتبه‌بندی نشان‌دهنده یک تغییر جهت در جامعه هوش مصنوعی محلی است. ما در حال فاصله گرفتن از ذهنیت «مدل-محور» — جایی که هدف صرفاً اجرای بزرگترین مدل ممکن بود — و حرکت به سمت رویکرد «سیستم-محور» هستیم. اکنون هارنس، تمایز اصلی در تجربه کاربری است.

برای کاربر نهایی، این بدان معناست که نیازهای سخت‌افزاری دیگر فقط مربوط به VRAM برای مدل نیست، بلکه مربوط به سربار مدیریت وضعیت (state management) عامل است. این واقعیت که OpenHands و OpenCode باید صراحتاً به کاربران درباره پنجره‌های زمینه پیش‌فرض Ollama هشدار دهند، نشان‌دهنده شکاف بین قابلیت مدل و پیش‌فرض‌های استقرار است.

در نهایت، ظهور حاکمیت‌های بی‌طرف مانند Agentic AI Foundation نشان می‌دهد که صنعت به دنبال راهی استاندارد برای مدیریت مجوزهای عامل و کشف ابزارها (مانند MCP) است تا از وابستگی به یک فروشنده خاص (Vendor Lock-in) در سطح محلی جلوگیری کند.

برای شروع بهینه‌سازی تنظیمات محلی خود، سعی کنید مصرف VRAM فعلی خود را حسابرسی کرده و اصلاحیه پنجره زمینه ۶۴ هزار توکن را اعمال کنید تا ببینید آیا نرخ موفقیت عامل شما بهبود می‌یابد یا خیر.

گام بعدی شما

  • میزان مصرف VRAM فعلی خود را بررسی کنید و دستور تغییر پنجرهٔ زمینه به ۶۴ هزار توکن را در اولاما اجرا کنید.
  • اگر از مدل‌های کوچک استفاده می‌کنید، برای جلوگیری از توهمات، از هارنس‌هایی با قابلیت RAG یا نقشه‌برداری مخزن مثل Aider استفاده کنید.
  • برای امنیت سیستم، هرگز عامل‌های محلی را با دسترسی کامل کاربر اجرا نکنید و از Docker استفاده کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تغییر رویکرد، نیازهای سخت‌افزاری را از صرفاً VRAM برای مدل به سمت حافظه برای مدیریت وضعیت عامل جابه‌جا می‌کند. ایجاد استانداردهایی مثل MCP توسط بنیادهای بی‌طرف، از وابستگی به یک فروشنده خاص در سطح محلی جلوگیری می‌کند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که به دلیل تحریم‌ها به مدل‌های محلی و وزن‌های باز متکی هستند، بهینه‌سازی هارنس‌ها تنها راه رسیدن به بهره‌وری مشابه ابزارهای ابری است.

·نگاه ما
تحریریه دات‌هوش

تمرکز جامعهٔ AI محلی از «مدل‌محوری» به «سیستم‌محوری» تغییر کرده است. دیگر داشتن بزرگ‌ترین مدل کافی نیست، بلکه مدیریت وضعیت (State Management) در لایهٔ هارنس است که تجربه کاربر را تعیین می‌کند. شکاف عمیق بین قابلیت‌های مدل و تنظیمات پیش‌فرض ابزارهایی مثل اولاما نشان می‌دهد که استقرار عملیاتی هنوز از توسعهٔ مدل‌ها عقب‌تر است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.