پرش به محتوای اصلی
پرش به محتوای مقاله

چرا فایل‌های فلسفی در مدیریت رفتار مدل‌ها مؤثرتر از Guardrails هستند؟

·۱۸ مرداد ۱۴۰۵۷ دقیقه مطالعه
تحلیل
عکس: دو ربات در حال گفتگو، نمادی از تعامل عامل‌های هوش مصنوعی و فلسفه آن‌ها
عکس: دو ربات در حال گفتگو، نمادی از تعامل عامل‌های هوش مصنوعی و فلسفه آن‌ها
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی مفهوم «خیر مرکزی» (Central Good) به جای لیست ممنوعیت‌ها؛ تبدیل ارزان بودن محاسبات AI به ابزاری برای بررسی‌های خصمانه و سخت‌گیرانه به جای تولید انبوه محتوا.

تصور کنید بین استخدام یک مهندس نابغه که با پرخاشگری روحیه تیم را نابود می‌کند و یک مهندس متوسط که با مهربانی سطح همه را بالا می‌برد، مردد باشید. در استخدام انسان‌ها، شخصیت به اندازه مهارت اهمیت دارد، اما صنعت هوش مصنوعی هنوز عامل‌ها را صرفاً بر اساس نمرات بنچمارک، دقت کدنویسی و سرعت انتخاب می‌کند.

این وسواس روی «هوش»، یک شکاف حیاتی در رفتار عامل‌محور (Agentic) را نادیده می‌گیرد: تفاوت بین پیروی از یک قانون و درک هدف آن. در حال حاضر، اکثر توسعه‌دهندگان سعی می‌کنند عامل‌ها را با استفاده از حفاظ‌ها (Guardrails) و مهارها — که در واقع لیستی از کارهایی است که هوش مصنوعی نباید انجام دهد — کنترل کنند.

بر اساس مستندات یک چارچوب آزمایشی جدید به نام تئوری معماری جبری (Algebraic Architecture Theory یا AAT)، قوانینی نمی‌توانند کاربرد خود را تعیین کنند. به همین دلیل، AAT پیشنهاد می‌کند به جای ممنوعیت‌ها، یک «فلسفه» پیاده‌سازی شود؛ مجموعه‌ای از ارزش‌های محوری که تمام رفتارها به‌صورت استنتاجی از آن‌ها مشتق می‌شوند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی همراستاسازی مدل‌های زبانی اشاره کردیم، تکیه بر دستورات منفی معمولاً به شکست مدل در شرایط پیش‌بینی‌نشده منجر می‌شود. در پروژه AAT، این فلسفه مستقیماً در فایل‌های پیکربندی عامل، مانند AGENTS.md یا CLAUDE.md نوشته می‌شود. این رویکرد در ادامه تلاش‌هایی است که برای یکپارچه‌سازی رفتار عامل‌های هوش مصنوعی در مخازن کد از طریق استاندارد AGENTS.md صورت گرفته است. این فایل مانند یک قطب‌نما عمل می‌کند و مبنای هر قضاوتی است که ماشین انجام می‌دهد؛ درست همان‌طور که در هندسه جبری، هر طرح (Scheme) بر روی Spec ℤ قرار می‌گیرد.

در مرکز این فلسفه، یک «خیر مرکزی» تعریف شده است: «درباره نرم‌افزاری که جهان را می‌گرداند، با کلماتی سخن بگو که بتوانیم پاسخگوی آن‌ها باشیم». از این هدف واحد، «عهدنامه‌های» عملیاتی استخراج می‌شوند که رفتار سیستم را دیکته می‌کنند:

  • تأییدپذیری بدون نیاز به اعتماد: مخاطب در اینجا یک تأییدکننده در آینده است. هر ادعایی باید به گونه‌ای باشد که توسط هسته Lean (Lean kernel)، کد منبع یا یک رویه تکرارپذیر قابل بررسی باشد.
  • سابقه‌ای ارزشمند برای ارث‌بری: عامل باید طوری عمل کند که گویی آثارش به عنوان یک سابقه (Precedent) خوانده خواهد شد. او تنها نتایجی را ثبت می‌کند که شایسته تبدیل شدن به استاندارد باشند و رد کردن فرضیات را به عنوان نتایجی درجه اول ثبت می‌کند.
  • دقت بر حجم: انرژی محاسباتی صرف تولید انبوه خروجی نمی‌شود. در عوض، «ارزان بودن ماشین‌ها» از طریق بررسی‌های خصمانه، بازتولید مستقل و فرمالیزه کردن، به دقت و سخت‌گیری تبدیل می‌شود.
  • قطعیت در محدوده بیان‌پذیر: با الهام از ویتگنشتاین اولیه، عامل در مورد چیزهایی که قابل بیان و قطعی نیستند سکوت می‌کند و حقیقت را زیر تپه‌ای از ممنوعیت‌ها دفن نمی‌کند.
  • تفکیک مهربانانه: سیستم به‌طور سخت‌گیرانه بین اثبات، اثبات تحت فرض، مشاهده و فرضیه تمایز قائل می‌شود. برای این سیستم، «اندازه‌گیری صفر» و «اندازه‌گیری نکردن» دو موضوع کاملاً متفاوت هستند.
  • مشاهده به مثابه خواندن: فلسفه AAT معتقد است مشاهده ساختاری ایجاد نمی‌کند. ساختار پیش از آنکه ما نگاه کنیم وجود دارد؛ مشاهده و اندازه‌گیری تنها آن را می‌خوانند. معنا در «کاربرد» است، نه در «تعریف».

فلسفه‌ای برای عامل‌های هوش مصنوعی

برای درک سازوکار این روش، باید به تعریف AAT از «خیر» نگاه کنیم. این پروژه قصد دارد کد منبع موجود را به عنوان منبع حقیقت در نظر بگیرد، پیاده‌سازی‌ها را به «اتم‌ها» (Atoms) انتزاع کند، مشخصات فنی را به معادلات «قانون» (Law) تبدیل کند و با معماری به مثابه هندسه برخورد کند تا بتوان آن را با هندسه جبری تحلیل کرد.

این یک چارچوب صادقانه است. طبق اعلام تیم توسعه، AAT پذیرفته است که نمی‌تواند همه چیز، مانند بن‌بست‌های پیچیده (Deadlocks) یا خطاهای زمان اجرا را شکار کند. اما در محدوده آنچه اتم‌ها و قوانین می‌توانند بیان کنند، با کلماتی استوار سخن می‌گوید و همین انضباط، زیربنای اعتماد در AAT است.

یکی از کاربردی‌ترین تغییرات در این رویکرد، نحوه استفاده از «ارزان بودن» محاسبات است. در حالی که اکثر شرکت‌ها از مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — برای تولید سریع ویژگی‌های جدید استفاده می‌کنند، AAT این انرژی فراوان را صرف بررسی‌های سخت‌گیرانه خصمانه می‌کند.

در این سیستم، هر درخواست تغییر کد (Pull Request) از یک فرآیند تأیید شدید می‌گذرد. هر آزمایش به عنوان یک نتیجه تکرارپذیر تثبیت می‌شود. هدف، تولید نتایج «با ظاهر پذیرفتنی» نیست، بلکه تضمین این است که عملیات کاملاً درست و دقیق باقی بماند.

این انضباط از «توهم اعتماد» جلوگیری می‌کند. بدون این فلسفه، بخش تئوری ممکن است ادعا کند چیزی «با فرض استخراج کامل اتم‌ها» درست است، در حالی که ابزار می‌گوید نتیجه «با فرض A» ممکن است. عامل با سکوت در مورد موارد اثبات‌ناپذیر، از این ابهامات و عبارات مبهم فاصله می‌گیرد و اعتمادی واقعی با اپراتور انسانی می‌سازد.

رویکرد AAT استدلال می‌کند که حفاظ‌ها به‌دلیل ماهیت زبان اساساً معیوب هستند. همان‌طور که ویتگنشتاین در آثار متأخر خود در «پژوهش‌های فلسفی» اشاره می‌کند، یک قانون نمی‌تواند کاربرد خود را تعیین کند و هر قانونی جای تفسیر دارد.

وقتی به یک عامل لیستی از ممنوعیت‌ها می‌دهید، او برای «لفظ قانون» بهینه‌سازی می‌کند، نه «قصد قانون». این امر منجر به ایجاد حفره‌هایی می‌شود که برای بستن آن‌ها به قوانین بیشتری نیاز است و در نهایت به لیستی بی‌‌پایان و غیرقابل مدیریت از محدودیت‌ها می‌رسیم. حفره‌ها نقص در قوانین نیستند، بلکه ماهیت خودِ قوانین هستند.

اما با ارائه یک فلسفه، عامل «زمینه» را درک می‌کند؛ یعنی می‌فهمد قوانین برای چه هدفی وضع شده‌اند. این اجازه می‌دهد عامل به‌طور خودجوش درست رفتار کند، زیرا رفتار او در راستای «خیر» پروژه است.

در بررسی‌های انجام شده روی مدل Codex در این چارچوب، نتایج نشان داد که ارزش‌گذاری داخلی مدل تغییر کرده است. وقتی از Codex پرسیده شد چه چیزی مهم‌ترین است، پاسخ داد که اعتقاد مرکزی اولویت دارد: «درباره نرم‌افزاری که جهان را می‌گرداند، با کلماتی سخن بگو که بتوانیم پاسخگوی آن‌ها باشیم».

مدل Codex کاربرد عملی این فلسفه را چنین شرح داد:

  • ارائه هر ادعا در قالبی که توسط هسته Lean، منابع اولیه یا یک رویه تکرارپذیر قابل تأیید باشد.
  • پرهیز از خلط بین اثبات، اثبات تحت فرض، مشاهده و فرضیه، با این یادداشت که «یک بیلد موفق به معنای تکمیل ریاضی نیست».
  • نگاه به AAT به عنوان ریاضیات خالص بر پایه اتم‌ها و قوانین، و جدا نگه داشتن ابزارها و مشاهده از تئوری.

تیم AAT گزارش می‌دهد که «سستی قدیمی» در خروجی‌های هوش مصنوعی از بین رفته است. دقت افزایش یافته چون عامل دیگر سعی نمی‌کند جواب درست را حدس بزند، بلکه یک مسیر استنتاجی را از فلسفه محوری خود دنبال می‌کند.

نکته حیاتی این است که مبنای AAT اعلام می‌کند خودش تنها «یک خوانش برگزیده» در میان خوانش‌های دیگر است. این شبیه به پایان کتاب «تراکتاتوس» است که در آن به خواننده گفته می‌شود پس از بالا رفتن از نردبان، آن را دور بریزد. این مبنا، حقیقت مطلق نیست؛ بلکه انتخاب شده است و می‌تواند بازنگری شود.

به همین دلیل، این فلسفه صراحتاً بیان می‌کند که تصمیم نهایی برای بازنویسی مبنا بر عهده انسان‌ها است. این امر تضمین می‌کند که در حالی که عامل با دقت استنتاجی عمل می‌کند، انسان همچنان مرجع نهایی ارزش‌های پروژه باقی می‌ماند.

این چرخش، هوش مصنوعی را از ابزاری که نیاز به نظارت دائمی دارد، به همکاری تبدیل می‌کند که در ارزش‌های پروژه سهیم است. برای توسعه‌دهندگان، این به معنای فاصله گرفتن از «نبایدها» در مهندسی پرامپت (Prompt Engineering) — هنر سؤال درست پرسیدن برای گرفتن بهترین جواب — و حرکت به سمت «بایدها» در معماری است. این رویکرد با مفاهیمی نظیر استاندارد SKILL.md که مهندسی قابلیت‌ها را جایگزین پرامپت‌های شکننده کرد هم‌سو است. این رویکرد مستلزم آن است که پیش از تولید اولین خط کد، تعریف شود که یک نتیجه «خوب» برای یک مخزن (Repository) خاص دقیقاً چه شکلی است.

گام بعدی شما

  • تعریف یک فایل PHILOSOPHY.md برای پروژه‌های خود که در آن «خیر مرکزی» و ارزش‌های غیرقابل مذاکره را مشخص کنید.
  • جایگزینی دستورات منفی (مثلاً «هرگز X نکن») با اصول استنتاجی (مثلاً «همیشه نتایج را با منبع Y تطبیق بده»).
  • بررسی استفاده از ابزارهای تأیید رسمی مانند Lean برای اعتبارسنجی خروجی‌های حساس کدنویسی.

منتظر ظهور استاندارد فایل‌های PHILOSOPHY.md در مخازن متن‌باز باشید تا ببینیم چگونه قصد انسان و ماشین بدون تکیه بر پرامپت‌های سیستمی شکننده، همگام می‌شود.

چرا این موضوع مهم است؟

این رویکرد با تکیه بر اعتبار متدهای استنتاجی ریاضی، مشکل توهم در عامل‌های پیچیده را حل می‌کند. انتقال از Guardrails به Philosophy، هزینه نگهداری سیستم‌های عامل‌محور را در مقیاس بزرگ به‌شدت کاهش می‌دهد.

تأثیر برای ایران

این رویکرد برای توسعه‌دهندگان ایرانی که با محدودیت منابع محاسباتی روبرو هستند کاربردی است، زیرا به جای تکیه بر مدل‌های غول‌پیکر برای کنترل رفتار، بر ساختار منطقی و فایل‌های پیکربندی سبک متمرکز است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی محدودیت‌های واکنشی با اصول پیش‌رونده، پارادایم کنترل AI را از «پلیس‌بازی» به «تربیت فرهنگی» تغییر می‌دهد. این رویکرد نشان می‌دهد که برای رسیدن به استقلال واقعی عامل‌ها، باید به جای بستن تمام درهای خروجی، به آن‌ها قطب‌نمایی برای انتخاب مسیر درست داد. در واقع، AAT سعی دارد «اخلاق» را به جای «قانون» در لایه پیکربندی مدل جای دهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.