پرش به محتوای اصلی
پرش به محتوای مقاله

تبدیل پوشه‌های مارک‌داون به پایگاه‌داده‌های ساختاریافته با ابزار wiki CLI

·۳۰ تیر ۱۴۰۵۶ دقیقه مطالعه
اما چه کسی به رابط خط فرمان ویکی نیاز دارد؟
اما چه کسی به رابط خط فرمان ویکی نیاز دارد؟
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی مدل «خواندن کل فایل» با «پرس‌وجوی ساختاریافته» روی پوشه‌های مارک‌داون. این اولین باری است که یک لایه‌ی CLI مستقل، امکان مدیریت گراف‌وار داده‌ها را بدون نیاز به نرم‌افزارهای گرافیکی به عامل‌های AI می‌دهد.

یک عامل هوش مصنوعی که قصد دارد لینک‌های شکسته را در یک پایگاه دانش ۱۲۴ فایلی اصلاح کند، ممکن است تنها با خواندن مکرر همان فایل‌ها، هزاران توکن را به wasteful spend تبدیل کند. تصور کنید مدلی در حلقه‌ای بی‌پایان است: ابتدا فایل a.md را می‌خواند (۱۴۰۰ توکن)، سپس b.md (۱۱۰۰ توکن) و بعد c.md (۹۰۰ توکن)؛ این «پرش‌های بی‌هدف» می‌تواند دقایق زیادی از زمان تفکر مدل را تلف کند و هزینه‌ها را بالا ببرد.

برای حل این مشکل، ابزار wiki CLI یک لایه‌ی قطعی (Deterministic) ایجاد می‌کند تا عامل‌ها بتوانند از پوشه‌های مارک‌داون به‌گونه‌ای پرس‌وجو کنند که انگار با یک پایگاه‌داده رابطه‌ای طرف هستند. طبق مستندات این پروژه، اکثر توسعه‌دهندگان به‌دلیل دوام و قابلیت انتقال، از مارک‌داون استفاده می‌کنند، اما با رشد حجم داده‌ها، مدل‌های زبانی بزرگ (LLM) — که شبیه کتابخانه‌داری هستند که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — در حفظ دید کلی به داده‌ها دچار مشکل می‌شوند.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی مدیریت حافظه در عامل‌های هوش مصنوعی اشاره کردیم، وقتی یک عامل باید تمام کارهای «مسدود شده» (blocked) را پیدا کند، معمولاً هر فایل را تک‌تک می‌خواند که فرآیندی کند و گران است. اگرچه ابزارهایی مانند Obsidian ابزارهای خط فرمان (CLI) دارند، اما اکثر آن‌ها به اجرای برنامه دسکتاپ نیاز دارند و برای مقیاس‌پذیری در سمت سرور یا جریان‌های کاری بدون رابط کاربری (Headless) طراحی نشده‌اند. ابزار wiki CLI به‌صورت مستقل از سیستم‌عامل در macOS، لینوکس، ویندوز و WSL اجرا می‌شود.

تبدیل متن به داده‌های ساختاریافته

این ابزار با فهرست‌بندی (Indexing) ساختار پوشه‌ها و گراف لینک‌های آن‌ها عمل می‌کند. طبق اعلام سازندگان، این سیستم بخش YAML frontmatter — مانند فیلدهای type یا status — را به‌جای تزئینات ساده، به عنوان فیلدهای ساختاریافته می‌شناسد. در یک یادداشت معمولی، بلوک اطلاعاتی به این شکل است:


type: task
status: blocked
tags: [docker, networking, infra]
priority: high

این ساختار، یک فایل متنی ساده را به یک رکورد پایگاه‌داده تبدیل می‌کند. بر اساس بررسی مکانیزم‌های این ابزار، حالا یک عامل (Agent) می‌تواند دستور wiki list --where type=task --where status=blocked را اجرا کند تا فقط فایل‌های مرتبط را بازیابی کند، به‌جای اینکه کل بسته داده‌ها را پردازش کند. با این روش، عامل به‌جای حدس زدن، شروع به پرس‌وجو می‌کند. این رویکرد بهینه در مدیریت داده‌ها، شباهت زیادی به روش‌های توزیع‌شده برای افزایش سرعت دسترسی دارد، همان‌طور که شبکه Entire توانست سرعت انتقال کد را تا ۲۵ برابر افزایش دهد.

قابلیت‌های عملیاتی کلیدی

ابزار wiki CLI موتور مکانیکی‌ای را فراهم می‌کند که عامل‌ها پیش‌تر فاقد آن بودند. عملکردهای اصلی عبارتند از:

  • ناوبری گراف: عامل‌ها می‌توانند فوراً لبه‌های گراف دانش را شناسایی کنند. دستور wiki backlinks [file] تمام ورودی‌هایی که به یک صفحه اشاره می‌کنند را نشان می‌دهد و wiki orphans صفحاتی را می‌یابد که هیچ لینکی به آن‌ها نیست.
  • تحولات مکانیکی: انتقال فایل‌ها با دستور wiki move /old.md /new.md به‌صورت ایمن انجام می‌شود. این کار تمام لینک‌های نسبی در کل پایگاه را در یک مرحله بازنویسی می‌کند و از خطاهای رایج «جست‌وجو و جایگزینی» جلوگیری می‌کند.
  • استخراج داده: ابزار می‌تواند چک‌باکس‌های پراکنده در متن را با دستور wiki checkboxes --prefix /backlog جمع‌آوری کند. همچنین خروجی‌ها را به‌صورت JSON برای پردازش توسط ابزارهایی مثل jq ارائه می‌دهد.
  • عیب‌یابی سلامت: دستور wiki check لینک‌های شکسته و ورودی‌های بدون نوع را پیدا می‌کند و wiki tidy --all نام فایل‌ها و لینک‌ها را استاندارد می‌کند.
  • خروجی داده‌های جدولی: جداول مارک‌داون به عنوان مجموعه‌داده (Dataset) شناخته می‌شوند. یک عامل می‌تواند جدول را به CSV تبدیل کرده و برای تحلیل‌های SQL به DuckDB بفرستد.

اما چه کسی به یک رابط خط فرمان ویکی نیاز دارد؟

آموزش رانندگی به عامل‌ها

از آن‌جایی که مدل‌هایی مثل Claude یا Gemini به‌طور پیش‌فرض از نحو (Syntax) یک CLI خاص یا عادت‌های سازمان‌دهی کاربر خبر ندارند، این سیستم مکانیزم داربست‌بندی (Scaffolding) را معرفی می‌کند. کاربر با دستور wiki init --workflow product-docs دو فایل راهنمای حیاتی ایجاد می‌کند:

۱. AGENTS.md: دستورالعمل‌های کلی که به هوش مصنوعی می‌گوید چگونه با CLI کار کند تا شکاف میان استدلال مدل و قطعیت ابزار پر شود.
۲. WORKFLOW.md: کنوانسیون‌های خاص آن پایگاه دانش که نحوه بایگانی ورودی‌ها و ساختار بک‌لاگ را تعریف می‌کند.

این ساختار باعث می‌شود عامل به‌جای خواندن ساده‌ی متن، فعالانه یک سیستم دانش را مدیریت کند. این موتور می‌تواند در موارد مختلفی به کار رود:

  • پایگاه‌های دانش Zettelkasten شخصی یا تیمی
  • بردهای کانبان و ردیابی پروژه
  • مستندات دقیق محصول
  • مجموعه‌داده‌های جدولی و گزارشات مالی

به‌کارگیری چنین عامل‌های سازمان‌دهنده‌ای در محیط‌های عملیاتی، یادآور پلتفرم AgentCrew است که با استفاده از عامل‌های چندگانه، چرخه بازاریابی محتوایی را کاملاً خودکار کرده است.

پیاده‌سازی و استقرار

طبق مستندات نصب، این ابزار از طریق Homebrew (brew install agentic-wiki/tap/wiki) یا نصب Go در دسترس است. پس از نصب، کاربر می‌تواند یک مسیر دایرکتوری را به عامل معرفی کرده و دستوری سطح بالا بدهد. به‌طور مثال: «پوشه‌ی کد در مسیر ~/code/my-project را بررسی کن و یک بسته ویکی با مفاهیم، کامپوننت‌ها و مثال‌های مرتبط بساز... و مجموعه‌ای از آموزش‌های خطی آماده کن.»

عامل با پیروی از دستورات AGENTS.md و WORKFLOW.md یک پایگاه دانش ساختاریافته می‌سازد. نتیجه این است که انسان می‌تواند این مخزن را با Obsidian به‌صورت بصری باز کند، در حالی که عامل همچنان از طریق CLI آن را مدیریت می‌کند. کاربران همچنین می‌توانند مهارت‌های آماده را از مخزن agentic-wiki/skills در گیت‌هاب بارگذاری کنند.

این چرخش به معنای حرکت به سمت «محاسبات در جایی که لازم است» است. با سپردن بخش‌های مکانیکی بازیابی داده به یک ابزار قطعی، عامل‌ها در مصرف توکن صرفه‌جویی کرده و تأخیر را از دقایق به میلی‌ثانیه‌ها می‌رسانند. ترکیب پایگاه‌داده CLI با قدرت قضاوت LLM، سیستمی هیبریدی می‌سازد که در آن ابزار دقت و عامل استدلال را فراهم می‌کند.

گام بعدی شما

  • اگر از Obsidian یا Logseq استفاده می‌کنید، ابزار wiki CLI را نصب کنید تا بتوانید از LLM برای سازمان‌دهی خودکار یادداشت‌های قدیمی استفاده کنید.
  • فایل AGENTS.md را برای عامل خود تعریف کنید تا مدل به‌جای حدس زدن ساختار پوشه‌ها، از دستورات استاندارد برای جست‌وجو استفاده کند.
  • با استفاده از خروجی JSON و ابزار jq- فیلترهای پیچیده‌تری برای استخراج داده از یادداشت‌های خود طراحی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با حذف نیاز به خواندن کل اسناد، هزینه‌های عملیاتی عامل‌های هوش مصنوعی را به‌شدت کاهش می‌دهد. اعتبار این رویکرد از ترکیب دقتِ ابزارهای خط فرمان با انعطاف‌پذیری LLMها می‌آید که منجر به کاهش نرخ توهم در مدیریت دانش می‌شود.

تأثیر برای ایران

این ابزار به‌ دلیل متن‌باز بودن و اجرا در محیط محلی (Local)، برای توسعه‌دهندگان ایرانی که با محدودیت‌های API یا هزینه‌های بالای توکن مواجه‌اند، گزینه‌ای ایده‌آل برای ساخت سیستم‌های مدیریت دانش داخلی است.

·نگاه ما
تحریریه دات‌هوش

این ابزار در واقع مفهوم «پایگاه‌داده بدون سرور» را برای دنیای فایل‌های متنی پیاده می‌کند. به جای تکیه بر RAGهای پیچیده که گاهی در بازیابی دقیق سند شکست می‌خورند، در اینجا از قطعیتِ ساختار فایل (Deterministic) استفاده شده است. این رویکرد نشان می‌دهد که آینده‌ی عامل‌ها نه در مدل‌های بزرگ‌تر، بلکه در ابزارهای کمکی است که فضای جست‌وجو را برای مدل محدود و دقیق می‌کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.