پرش به محتوای اصلی
پرش به محتوای مقاله

oh-my-agent با تفکیک کاملِ سازنده و بازبین، سوگیری مدل‌ها را حذف کرد

·۲۵ تیر ۱۴۰۵۲ دقیقه مطالعه
عنوان: اوه-مای-اِیجنت: بررسی‌های بین‌زمینه‌ای و آزمایش دقت محرک‌ها
عنوان: اوه-مای-اِیجنت: بررسی‌های بین‌زمینه‌ای و آزمایش دقت محرک‌ها
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی سیستم بازبینی متقاطع (Cross-Context Review) که با ایزوله کردن کامل زیر-عامل‌ها، امکان خود-ارزیابی مدل را می‌گیرد و سوگیری تأیید را از ریشه حذف می‌کند.

اگر برنامه‌نویسی هستید که از توهمات مدل‌های زبانی در بازبینی کد خسته شده‌اید، باید بدانید که دوران «تأیید کورکورانه» به پایان رسیده است. مدل‌های هوش مصنوعی معمولاً به طرح‌های خود نمره کامل می‌دهند، چون دچار نوعی سوگیری هستند که باعث می‌شود نقص‌های منطق خودشان را نبینند.

برای شکستن این چرخه، oh-my-agent در تاریخ ۱۶ ژوئیه ۲۰۲۶ به‌روزرسانی جدیدی را ادغام کرد که جدایی کامل میان «سازنده» و «بازبین» را اجباری می‌کند. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، اتکای مطلق به خروجی یک مدل واحد، بزرگ‌ترین ریسک در سیستم‌های خودکار است. این رویکرد سخت‌گیرانه برای اعتبارسنجی، یادآور ۵ آزمون امنیتی برای کنترل هوش مصنوعی گوگل است که بر اهمیت لایه‌های نظارتی مستقل تأکید داشت. در این معماری جدید، عامل (Agent) — مثل کارمندی که وظیفه‌ای خاص دارد و آن را تا انتها دنبال می‌کند — دیگر خودش را نقد نمی‌کند.

به گزارش وب‌سایت dev.to، این چارچوب اکنون ۱۱ مرحله بازبینی مجزا را به زیر-عامل‌های تازه‌ای می‌سپارد. این بازبین‌ها هیچ دسترسی به منطقِ سازنده ندارند و فقط آثار نهایی و راهنمای بازبینی را می‌بینند؛ فرآیندی شبیه به داوری دابل‌بلیند (Double-blind) در ژورنال‌های علمی که کیفیت تضمین‌شده‌ای را ایجاد می‌کند.

علاوه بر رفع سوگیری، این پلتفرم حفاظ‌های فنی جدیدی برای افزایش قابلیت اطمینان اضافه کرده است:

استانداردهای پایداری

  • ابزار بررسی دقت محرک (Trigger Accuracy Harness): با دستور oma verify triggers می‌توان نرخ خطای فعال‌سازی کلمات کلیدی را روی یک مجموعه داده ۱۶۷ موردی سنجید، بدون اینکه نیاز به فراخوانی مدل زبانی بزرگ (LLM) — که شبیه کتابخانه‌داری است که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — باشد. این تلاش برای سنجش دقیق عملکرد، در راستای استانداردسازی مستندات برای ماشین‌ها است تا بهره‌وری عامل‌ها به شکلی قابل‌اندازه‌گیری ارتقا یابد.
  • لینتینگ مهارت‌ها (Skills Linting): دستور oma skills lint اکنون بر اساس پژوهش‌های «آناتومی تا بوی کد» (Anatomy-to-Smells)، رفتارهای غیرقطعی را شناسایی و حذف می‌کند.
  • حسابرسی بسته‌ها (Bundle Audit): هرگاه یک مهارت بیش از ۲۵ هزار نویسه داشته باشد یا به بیش از ۲۰ فایل ارجاع دهد، سیستم آن را به عنوان «پخش‌شدگی» یا Sprawl علامت‌گذاری می‌کند.

طبق مستندات این پروژه، این تغییرات باعث ساده‌سازی بازار افزونه‌های Claude شده است. حالا دایرکتوری .claude-plugin تنها منبع حقیقت است و قلاب‌های SessionStart جدید در Claude Code اجازه می‌دهند مهارت‌ها هنگام فشرده‌سازی جلسه به‌طور پویا بارگذاری شوند. البته این سطح از دقت در ارزیابی لازم است، چرا که نشت داده‌ها در بنچ‌مارک‌های کدنویسی پیش‌تر نشان داد که چگونه نتایج متقلبانه می‌توانند تصور ما را از توانایی واقعی مدل‌ها تغییر دهند.

این چرخش، ارکستراسیون عامل‌ها را از «پرامپت‌نویسی» به سمت مهندسی نرم‌افزار حرفه‌ای می‌برد. وقتی با مهارت‌های عامل مانند کد برخورد شود — یعنی نیاز به بررسی خطا (Linting)، حسابرسی و تست کور داشته باشد — پیش‌بینی‌ناپذیریِ گردش‌های کاری خودکار به‌شدت کاهش می‌یابد.

گام بعدی شما

  • اگر از سیستم‌عامل macOS یا لینوکس استفاده می‌کنید، آخرین نسخه CLI را از طریق curl نصب کنید.
  • دستور oma skills lint را روی مهارت‌های فعلی خود اجرا کنید تا نقاط غیرقطعی کد را بیابید.
  • برای کاهش هزینه استنتاج، ساختار دایرکتوری‌های افزونه‌های خود را با استاندارد جدید Claude هم‌راستا کنید.

اما تأثیر این رویکرد بر مدل‌های کوچک‌تر و محلی حتی جذاب‌تر است؛ در گزارش بعدی، اثر این استانداردها بر مدل‌های Llama-3 را بررسی خواهیم کرد.

چرا این موضوع مهم است؟

این رویکرد با حذف سوگیری تأییدی، استانداردهای تضمین کیفیت (QA) را در سیستم‌های عامل‌محور ارتقا می‌دهد. این تغییر بر اساس تجربه عملی در توسعه نرم‌افزار است تا دقت مدل‌ها را از حالت «حدسی» به «اثباتی» تبدیل کند.

تأثیر برای ایران

توسعه‌دهندگان ایرانی که از Claude Code یا چارچوب‌های عامل‌محور استفاده می‌کنند، می‌توانند با ابزارهای رایگان CLI این پروژه، کیفیت و پایداری خروجی‌های مدل‌های خود را بدون هزینه API اضافی ارتقا دهند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی «پرامپت‌نویسی» با «لینتینگ» در مدیریت عامل‌ها، نشان‌دهنده بلوغ این صنعت است. وقتی توسعه‌دهندگان متوجه شدند که زبان طبیعی برای کنترل سیستم‌های پیچیده کافی نیست، به سراغ ابزارهای سخت‌گیرانه مهندسی نرم‌افزار رفتند تا خروجی‌های غیرقطعی را مهار کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.