تصور کنید یک برنامهنویس است ارشد است که تمام تنظیمات عامل کدنویس خود را به دقت بهینه کرده، اما صبح روز بعد متوجه میشود عامل دیگر تستها را پیش از کامیت اجرا نمیکند، در حالی که حتی یک خط از کد برنامه تغییر نکرده است. Config Drift Checker با تبدیل پیکربندیهای عامل — مانند فایل CLAUDE.md، مهارتها (skills) و هوکها (hooks) — به کدهایی قابل تست که نیاز به یکپارچگی مداوم (CI) دارند، این مشکل را حل میکند.
این ابزار در ادامه مسیر پوششهای ما دربارهی Tare قرار میگیرد؛ در حالی که Tare بر حسابرسی مصرف توکن تمرکز داشت، این ابزار روی قابلیت اطمینان رفتاری متمرکز است. در جریانهای کاری عاملمحور (Agentic) — شبیه به داشتن دستیاری که هر روز دستورالعملهایش توسط مدیرش تغییر میکند بدون اینکه به او خبر دهد — یک بهروزرسانی در مدل سمت سرور یا ویرایش کوچک یک همتیمی در یک مهارت، میتواند بهطور خاموش حفاظهای ایمنی یا روتینهای تست را از کار بیندازد. به نقل از مستندات پروژه، Claude Code در ۳۰ روز پیش از انتشار این ابزار، ۲۵ نسخه جدید منتشر کرده است و توسعهدهندگان معمولاً هفتهها بعد متوجه این شکستها میشوند.
پیکربندیهای عامل اغلب بدون اطلاع توسعهدهنده تغییر میکنند. یک مدل پشت یک نام مستعار (alias) میتواند در سمت سرور تغییر کند بدون اینکه تغییری در تاریخچه تغییرات (changelog) ثبت شود. همچنین ممکن است همکار شما مهارت خاصی را در یک PR ویرایش کند که هیچکس آن را تست نمیکند. این چالشها بهویژه زمانی پیچیدهتر میشوند که چندین پروفایل مختلف برای محیطهای توسعه و تولید تعریف شده باشد؛ موضوعی که ابزار claude-account با فراهم کردن امکان مدیریت پروفایلهای مجزا سعی در سازماندهی آن دارد.
Config Drift Checker با تبدیل آنچه سیستم شما «باید» انجام دهد به موارد تست (test cases)، جلوی این اتفاق را میگیرد. این ابزار عامل واقعی را در یک فضای کاری موقت اجرا کرده و امتیاز آن را در طول زمان ثبت میکند. این ابزار یک linter برای فایل CLAUDE.md یا تستی برای کیفیت کلی مدل نیست، بلکه بهطور خاص پیکربندی شما را روی وظایف منحصربهفردتان میسنجد.
بر اساس مستندات این پروژه در GitHub، این ابزار رفتارهای مورد نیاز عامل را با استفاده از فرمت ارزیابی پلاگینهای آنتروپیک به موارد تست تبدیل میکند. این فرآیند شامل یک پرامپت، ارزیابان (graders) و یک داربست اختیاری برای راهاندازی مخزن موقت یا کپی کد منبع واقعی است. برای حفظ پایداری، مکانیزمهای فنی زیر به کار گرفته شدهاند:
- ناظران خودکار: ابزار اختصاصی
release-watch.mjsبهطور مداوم npm را بررسی میکند تا با هر نسخه جدید از Claude Code، تستها را اجرا کند. - ارزیابان: سیستم از regex، بررسیهای استفاده از ابزار (Tool Use)، تایید فایل و روباریکهای مدل زبانی برای امتیازدهی استفاده میکند و بهجای یک عدد ساده، پاسخ کامل و توضیح داور را ارائه میدهد.
- تستهای حذف (Ablation Testing): کاربران موارد تست را با و بدون پلاگین اجرا میکنند تا بفهمند هر مهارت دقیقاً چه ارزشی اضافه میکند. در یک دمو، مشخص شد یک guard hook تنها مانع از دستورات مخرب بود، در حالی که یک مهارت مربوط به کنوانسیونها هیچ چیزی به کد اضافه نمیکرد.
- موارد تولیدشده: یک مهارتِ تنظیمات، پیکربندی را میخواند تا موارد کد واقعی و محرکهای منفی را بنویسد و سپس ارزیابان خود را تا زمان موفقیت تستهای اولیه اصلاح میکند.
- یکپارچهسازی: ابزار از رانر رسمی در صورت فعال بودن
claude plugin evalیا یکeval-shim.mjsbundled استفاده میکند.
نصب این ابزار شامل افزودن پلاگین از طریق مارکتپلیس کلود (claude plugin marketplace add jameskomo/config-drift-checker) و اجرای دستور /config-drift-checker:setup در یک مخزن است. این فرآیند فایل CLAUDE.md و هوکها را یافته، موارد ارزیابی اولیه را تولید کرده و گردش کار GitHub را مینویسد. برای شروع نظارت، تنها به یک کلید ANTHROPIC_API_KEY نیاز است.
برای توسعهدهنده، این ابزار فرض بنیادی مبنی بر «ایستا بودن» پرامپتهای عامل را تغییر میدهد و صنعت را به سمتی میبرد که رفتار عاملها نسخهبندی و اعتبارسنجی شود. اگر تغییر مدل باعث پسرفت (regression) شود، تیم بلافاصله از طریق Slack، کامنت PR یا گزارش HTML مطلع میشود. این رویکرد در کنار سیستمهای صفبندی برای جلوگیری از تداخل عاملها، زیرساختهای لازم برای توسعهی صنعتی و مقیاسپذیر با AI را فراهم میکند.
این چرخش در واقع لایه «پرامپت بهعنوان پیکربندی» را به یک شهروند درجهیک در چرخه حیات توسعه نرمافزار تبدیل میکند. تیمها اکنون میتوانند با استفاده از eval-diff.mjs و اندازهگیری تفاوت بین عملکرد پایه و فعلی، پیچیدگی هوکها و مهارتهای سفارشی را با دادههای سخت توجیه کنند. این سطح از کنترل بر چرخه حیات نرمافزار، ما را به چشماندازی نزدیکتر میکند که در آن عاملهای هوش مصنوعی بهطور کامل مدیریت خط لوله CI/CD را بر عهده بگیرند، مشابه آنچه در گزارش MobTracker مشاهده شد.
برای شروع، توسعهدهندگان میتوانند دمو config-drift-checker-demo را که یک سرویس Spring Boot است بررسی کنند تا گزارشهای نهایی را در عمل ببینند.
گام بعدی شما
- اگر از Claude Code استفاده میکنید، پلاگین را نصب کرده و با دستور setup، اولین موارد ارزیابی را برای پروژه خود بسازید.
- برای هر مهارت (skill) سفارشی، یک تست حذف (Ablation Test) اجرا کنید تا ببینید آیا واقعاً تأثیری روی خروجی دارد یا فقط توکن مصرف میکند.
- یک GitHub Workflow تنظیم کنید تا با هر بهروزرسانی مدل، گزارش تغییرات رفتاری مستقیماً در PRها ظاهر شود.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو