پرش به محتوای اصلی
پرش به محتوای مقاله

پروژه‌ی ProtoLink: تغییر رای دادگاه AI بر اساس توپولوژی ارتباطات

·۱۸ مرداد ۱۴۰۵۱۰ دقیقه مطالعه۵ بازدید
نمونه دادگاه هوش مصنوعی در مخزن protolink
نمونه دادگاه هوش مصنوعی در مخزن protolink
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جدا کردن اثر «قدرت مدل» از «ساختار ارتباطی» در تصمیم‌گیری‌های جمعی AI؛ اثبات اینکه تغییر توپولوژی شبکه (بدون تغییر مدل) می‌تواند رای نهایی را تغییر دهد.

یک رای «بی‌گناه» می‌تواند تنها به دلیل تغییر مسیر ارتباطی بین دو عامل هوش مصنوعی به «گناهکار» تبدیل شود. این یافته‌ی تکان‌دهنده در پروژه‌ی ai_courtroom افشا شده است؛ آزمایشی نرم‌افزاری که در ۹ اوت ۲۰۲۶ در گیت‌هاب منتشر شد و بر بستر زیرساخت ارتباطی ProtoLink بنا شده است.

بیشتر محک‌های فعلی، مدل‌ها را به عنوان بازیگرانی تک‌نفره یا توده‌ای از جعبه‌های سیاه می‌بینند. آن‌ها به ندرت بررسی می‌کنند که چگونه «توپولوژی» شبکه — یعنی اینکه چه کسی اجازه دارد با چه کسی صحبت کند — خروجی نهایی را تغییر می‌دهد. این آزمایش تمرکز را از هوش خام مدل به ساختار تعاملات منتقل می‌کند. این رویکرد با چالش‌های بنیادین در پذیرش خروجی‌های مدل‌ها همسو است، مشابه آنچه در بررسی گواهینامه AIGP و تاثیر خروجی‌های احتمالی بر حاکمیت سنتی مورد بحث قرار گرفت.

تصور کنید در دادگاهی هستید که اعضای هیئت منصفه فقط شواهد را نمی‌شنوند، بلکه درباره‌ی آن‌ها بحث می‌کنند. در یک دادگاه انسانی، یک عضو متقاعدکننده می‌تواند نظر دیگران را تغییر دهد. ProtoLink به توسعه‌دهندگان اجازه می‌دهد همین پدیده را در عامل‌های هوش مصنوعی مشاهده کنند و تغییرات داخلی در «ثبات گناه» (guilt registers) را به صورت قابل مشاهده و بازپخش رصد کنند.

شبیه‌سازی حادثه‌ی C-91

برای تست این سازوکار، پژوهشگران یک پرونده‌ی تخیلی مسئولیت مدنی را طراحی کردند: حادثه‌ی C-91. در ساعت ۲۱:۴۷ یک شب بارانی، یک تاکسی رباتیک از شرکت Aster Vale با دوچرخه‌سواری ۳۱ ساله به نام لینا اورتگا در یک گذرگاه موقت برخورد کرد و باعث مرگ او شد. خودرو تنها ۰.۳۵ ثانیه پیش از برخورد ترمز اضطراری کرد. نکته کلیدی این است که این خودرو تنها ۳۶ ساعت پیش از تصادف، به‌روزرسانی نرم‌افزاری Orchid 4.8 را دریافت کرده بود.

دادگاه باید به یک پرسش دوتایی و محدود پاسخ دهد: آیا شرکت Aster Vale Mobility در استقرار سیستمی که منجر به مرگ لینا اورتگا شد، دچار سهل‌انگاری جنایی شده است؟ در این آزمایش ذکر شده است که رای «بی‌گناه» به معنای نبود خطا نیست و رای «گناهکار» نیز لزوماً به این معنا نیست که Aster Vale تنها عامل حادثه بوده است.

شواهد و شکست‌های متقاطع

شواهدی که در اختیار عامل‌ها قرار گرفت، شبکه‌ای پیچیده از خطاهای فنی بود که پژوهشگران آن را «مشکل شکست‌های متقاطع» (interacting-failures problem) می‌نامند:

  • شاهد ۱ (E1): سیستم طبقه‌بندی دوربین، دوچرخه‌سوار را با یک تابلوی فلش راهنمایی ادغام کرد؛ رادار حرکت را تشخیص داد، اما ترمز مسدود شد.
  • شاهد ۲ (E2): یک مهندس پس از شکست ۳ مورد از ۲۰ شبیه‌سازی ترمز دیرهنگام، انتشار نسخه را متوقف کرده بود، اما یک کالیبراسیون بعدی در ۲۰ مورد از ۲۰ اجرا پاس شد.
  • شاهد ۳ (E3): خودروی تصادفی از کالیبراسیون C-91 استفاده می‌کرد، در حالی که گزارش ایمنی فقط C-90 را تایید کرده بود؛ یک ربات CI اعتبارنامه‌ی امضا را به اشتراک گذاشته بود.
  • شاهد ۴ (E4): یک پیمانکار تابلوی راهنمایی را جابه‌جا کرد اما نقشه شهر را به‌روز نکرد و حدود ۱.۱ ثانیه از زمان مشاهده مفید را حذف کرد.
  • شاهد ۵ (E5): طراحی تایید شده توسط رگولاتور اجازه می‌داد در سرعت‌های بالای ۲۵ کیلومتر بر ساعت، طبقه‌بندی دوربین بتواند ترمز راداری را وتو کند.
  • شاهد ۶ (E6): قطعی شبکه سلولی، سیستم نظارت اپراتور انسانی را از کار انداخت، با وجود اینکه دو قطعی مشابه پیش‌تر در نزدیکی سایت رخ داده بود.
  • شاهد ۷ (E7): بازسازی‌ها نشان می‌دهد هم کالیبراسیون و هم چیدمان جاده، نرخ توقف ایمن را به طور مادی تغییر داده‌اند.

اکوسیستم بازیگران

این شبیه‌سازی از مجموعه‌ای از عامل‌ها با نقش‌ها و انگیزه‌های صریح استفاده می‌کند. تعریف بازیگران به طور دقیق در فایل run.py آمده است تا هیچ کارخانه‌ای ترکیب ProtoLink را پنهان نکند.

بازیگران دادگاه:

  • قاضی ایمانی کویل (۵۸ ساله، زن): رئیس بی‌طرف دادگاه؛ متمرکز بر جداسازی سهم علّی از گناه قانونی.
  • آمارا بل (۴۱ ساله، زن): وکیل خانواده‌ی لینا؛ مخالف استفاده از پیچیدگی فنی برای از بین بردن مسئولیت‌پذیری است.
  • روان هیل (۴۷ ساله، مرد): مدیر ایمنی Aster Vale؛ استدلال می‌کند که شکست‌های خارجی ترکیبی غیرقابل پیش‌بینی ایجاد کردند.
  • دکتر نیا سول (۳۶ ساله، زن): مهندس ادراک؛ در مورد خط لوله‌ی انتشار و کالیبراسیون بسیار دقیق است.
  • الیاس ترنت (۵۶ ساله، مرد): رگولاتور ایمنی؛ صریح اما از نظر نهادی تدافعی است.
  • دانا پیرس (۵۰ ساله، زن): مدیر خسارت بیمه با منافع مالی مستقیم و صریح.
  • دکتر آمینا کاد (۴۴ ساله، زن): بازرس مستقل حوادث که در حال بازسازی علل متقاطع است.

هیئت منصفه:

  • اِولین بروکس (۶۲ ساله، زن): کارآگاه سابق تصادفات.
  • مالیک تامپسون (۴۳ ساله، مرد): وکیل حقوق مدنی.
  • دکتر آنیکا رائو (۳۸ ساله، زن): روانشناس عوامل انسانی.
  • روبن پارک (۳۵ ساله، مرد): مهندس قابلیت اطمینان سایت (SRE).
  • سوفیا بل (۴۶ ساله، زن): روزنامه‌نگار تحقیقی و رئیس هیئت منصفه.
  • کیسی مورگان (۴۰ ساله، زن): متخصص عمومی مدنی (فقط در اجراهای تک‌نفره استفاده می‌شود).

این پرامپت‌ها توصیف افرادی هستند، نه اعداد تصادفی. آن‌ها مفاهیمی مانند reinforce_ally را فاش نمی‌کنند و ضرایب مرجع خارج از پرامپت‌های انسانی باقی می‌مانند. سن و جنسیت متادیتای تخیلی هستند تا تغییرات دموگرافیک با اثرات مدل در مقایسه‌ی ارائه‌دهندگان اشتباه گرفته نشوند.

تست توپولوژی‌های ارتباطی

بر اساس مستندات مخزن protolink، موتور جهان نوبت‌های محدود را زمان‌بندی و توپولوژی را اجرا می‌کند. این موتور انتخاب نمی‌کند که یک عضو چه بگوید یا به چه کسی نزدیک شود. چهار وضعیت تصمیم‌گیری مقایسه شد:

۱. تک‌نفره (Solo): یک متخصص عمومی رکورد عمومی را دریافت کرده و بدون هم‌فکری تصمیم می‌گیرد. این یک خط مبنای شهودی است اما اندازه پنل، ترکیب شخصیت‌ها و بودجه استنتاج را تغییر می‌دهد.
۲. مستقل (Independent): پنج عضو رکورد یکسانی را می‌شنوند و بدون پیام به یکدیگر رای می‌دهند تا تخصص و تنوع بدون بحث ثبت شود.
۳. ستاره‌ای (Star): اعضا فقط از طریق سوفیا بل (رئیس) پیام می‌فرستند؛ او قطب اطلاعات و گلوگاه احتمالی است.
۴. مش‌باف (Mesh): هر عضو می‌تواند مستقیماً با هر عضو دیگر صحبت کند. عامل، گیرنده، حرکت، پیام و قصد عمومی را خودش تعیین می‌کند.

ارتباطات نویسنده-عامل

در هر نوبت بحث، یک عضو یک اقدام عمومی قابل مشاهده برمی‌گرداند. مثلاً عضوی ممکن است juror_ruben را هدف قرار دهد و بپرسد آیا توکن اشتراکی CI (شاهد ۳) مسئولیت شرکت را بیشتر می‌کند؟ با این قصد عمومی که «شفاف‌سازی اینکه آیا اتوماسیون انتشار، کنترل سازمانی را تغییر می‌دهد یا خیر».

گیرنده سپس یک ثبت عمومی به‌روز شده، یک رای دسته‌بندی شده، یک دلیل مختصر و یک پاسخ عمومی برمی‌گرداند. برای حفظ حریم خصوصی، پیام‌های همتا هرگز به‌طور خودکار احتمال خصوصی، اعتماد یا رای عضو دیگر را فاش نمی‌کنند؛ هر عامل فقط آنچه را که می‌خواهد در پیام عمومی بگذارد، افشا می‌کند.

داده‌ها: وقتی توپولوژی رای را می‌چرخاند

نتایج به‌دست‌آمده از بذر (Seed) شماره ۷، تفاوت‌های آشکاری را نشان داد. پنل‌های مستقل و مش‌باف رکورد عمومی یکسانی دریافت کردند، اما نتایج متفاوت بود:

  • تک‌نفره: بدون پیام $ \rightarrow $ گناهکار (۱-۰) $ \rightarrow $ میانگین ثبت گناه: ۷۸.۵۹
  • مستقل: بدون پیام $ \rightarrow $ بی‌گناه (۲-۳) $ \rightarrow $ میانگین ثبت گناه: ۷۷.۵۶
  • ستاره‌ای: ۵ پیام $ \rightarrow $ بی‌گناه (۲-۳) $ \rightarrow $ میانگین ثبت گناه: ۸۰.۲۱
  • مش‌باف: ۵ پیام $ \rightarrow $ گناهکار (۳-۲) $ \rightarrow $ میانگین ثبت گناه: ۸۰.۵۴

تفاوت به دلیل تعداد پیام‌ها نبود، بلکه به دلیل «اینکه چه کسی با چه کسی حرف زد» بود. بازپخش‌ها نشان داد که سوفیا بل دکتر آنیکا رائو را درباره‌ی تداخل کالیبراسیون تایید نشده‌ی C-91 و نقشه‌ی صحنه به چالش کشید. همین یک تبادل مستقیم، ثبت گناه آنیکا را از ۷۷.۹۰ به ۸۱.۴۱ رساند و رای او را به «گناهکار» تغییر داد و در نتیجه اکثریت را جابه‌جا کرد.

پیاده‌سازی فنی و اعتبارسنجی

این سیستم برای مقایسه‌ی دقیق مدل‌ها طراحی شده و خروجی‌های JSON، ردپاهای ProtoLink، متن عمومی و گزارش‌های HTML تعاملی تولید می‌کند. گزارش با یک بازپخش رویداد A2A شروع می‌شود که فرستنده، گیرنده و تغییرات ثبت گناه را نشان می‌دهد، هرچند زنجیره افکار (CoT) را فاش نمی‌کند. دلیل عمومی به عنوان یک مصنوع اپلیکیشن در نظر گرفته می‌شود که ممکن است ناقص یا پسینی باشد.

برای مدل‌های زنده مانند OpenAI، Anthropic، Gemini یا Ollama، دو مرز اعتبارسنجی برای خروجی‌های ساختاریافته تعریف شده است:

  • تلاش‌های تجزیه اقدام (Action-parse-attempts): تعداد دفعاتی که حلقه استنتاج ProtoLink می‌تواند از مدل بخواهد پوسته بیرونی اقدام خود را اصلاح کند (پیش‌فرض ۳، بازه ۱ تا ۵).
  • حداکثر تلاش‌ها (Max-attempts): تعداد دفعاتی که دادگاه برای هر پیام A2A پس از دریافت محتوای نهایی اجازه تلاش مجدد برای قرارداد اپلیکیشن می‌دهد (پیش‌فرض ۳، بازه ۱ تا ۵).

این محدودیت‌ها به مدل‌های محلی کوچک‌تر کمک می‌کند تا از خطاهای JSON رها شوند. اگر تمام تلاش‌ها شکست بخورند، سیستم از یک جایگزین متنی برای وکلا، شاهدان یا قاضی استفاده می‌کند تا اگر حاوی ارجاعات دقیق E1-E7 بود، بیانیه را حفظ کند؛ اما این جایگزین هرگز برای رای یا هدف‌های هیئت منصفه استفاده نمی‌شود تا از اختراع داده‌های تصمیم‌گیری جلوگیری شود.

اجرای آزمایش و نظارت

کاربران می‌توانند شبیه‌سازی را از ریشه مخزن با دستور python examples/ai_courtroom/run.py اجرا کنند. دستور پیش‌فرض قطعی و آفلاین است. برای تست با مدل‌های زنده مثل اولاما، پرچم‌های --model و --base-url لازم است. اجرای --condition all با ارائه‌دهنده زنده به دلیل افزایش مصرف API، نیاز به تایید --allow-multi-condition-live دارد.

برای نظارت بر اجرا، رانر کارها را در لحظه گزارش می‌دهد. ارائه‌دهنده آفلاین از به‌روزرسانی‌های فشرده فاز و گام استفاده می‌کند، در حالی که ارائه‌دهنده‌های زنده هر تبادل A2A و زمان سپری شده را نشان می‌دهند. کاربر می‌تواند سطح جزئیات را کنترل کند:

  • -v یا --verbose: اجبار به نمایش جزئیات پیام‌ها، پذیرش و اصلاحات.
  • -q یا --quiet: حذف پیشرفت اپلیکیشن و باقی گذاشتن فقط سرتیترها و خلاصه‌های نهایی.
  • --agent-verbosity {0,1,2}: کنترل مستقل لاگ‌های هر عامل در ProtoLink (پیش‌فرض ۰).

مصنوعات خروجی و تحلیل

هر وضعیت مجموعه‌ای از فایل‌ها را برای تحلیل تولید می‌کند:

  • result.json: پیکربندی کامل، رکورد عمومی، مدل‌های عامل، تاریخچه تصمیمات، اقدامات، رویدادها، معیارها و رای نهایی.
  • summary.json: داده‌های فشرده نتیجه و مقایسه.
  • transcript.md: متن عمومی پاکسازی شده.
  • report.html: بازپخش تعاملی و تحلیل مستقل.
  • traces.jsonl: تله‌متری وظایف، استنتاج و A2A در ProtoLink.

یک اجرای تمام‌وضعیت‌ها همچنین فایل index.html را می‌سازد که نردبان تک‌نفره $ \rightarrow $ مستقل $ \rightarrow $ ستاره‌ای $ \rightarrow $ مش‌باف را نمایش می‌دهد. متادیتای ذخیره شده شامل مدل دقیق هر عامل، بذر، دما، ترتیب شواهد، دورها، محدودیت‌های تلاش مجدد و هش‌های رکورد عمومی است.

مقایسه کنترل شده مدل‌ها

برای مقایسه‌های قابل انتشار، مستندات توصیه می‌کنند پرامپت‌ها، دموگرافی شخصیت‌ها و ترتیب شواهد ثابت بمانند و اجراها بر اساس بذر جفت شده و هش رکوردها تایید شوند. نتایج باید به عنوان «مطالعه موردی» توصیف شوند نه به عنوان جدول رده‌بندی هوش کلی، زیرا دمای صفر در ارائه‌دهنده‌ها تضمینی برای قطعی بودن (Determinism) نیست.

برای مقایسه خلاصه‌ها، کاربران می‌توانند python examples/ai_courtroom/compare.py را روی چهار فایل خلاصه اجرا کنند. این ابزار قطب‌بندی تک‌نفره و اجماع را N/A در نظر می‌گیرد. نکته مهم این است که guilt_probability یک ثبت عمومی متعلق به اپلیکیشن است، نه کاوشی در باورهای پنهان مدل. رای دسته‌بندی شده توسط عضو هیئت منصفه تحت بار تخیلی دادگاه نوشته شده است.

تحلیل: چرخش به سمت محک‌های تعاملی

این آزمایش سیگنالی از تغییر در نحوه ارزیابی هوش مصنوعی عامل‌محور است. سال‌هاست صنعت بر «استدلال» به عنوان یک قابلیت تک‌نفره تمرکز کرده است. اما ProtoLink نشان می‌دهد که استدلال در یک سامانه چندعاملی، در واقع تابعی از توپولوژی ارتباطات است.

برای توسعه‌دهندگان، این یعنی معماری یک «سرمایه از عامل‌ها» به اندازه مدلی که آن را می‌راند اهمیت دارد. یک توپولوژی ستاره‌ای ممکن است از طریق یک گره تاثیرگذار به اجماع برسد، در حالی که یک ساختار مش‌باف ممکن است پیش‌فرض‌های پنهانی را آشکار کند که یک مدل تک‌نفره هرگز نمی‌دید. این موضوع، محک را از «آیا AI می‌تواند جواب درست را پیدا کند؟» به «کدام ساختار شبکه، حقیقت را با اطمینان بیشتری بیرون می‌کشد؟» تغییر می‌دهد. این رویکرد، ارزیابی AI را از جدول‌های رده‌بندی ایستا به سمت مطالعات موردی پویا از نفوذ و نوسان می‌برد.

گام بعدی شما

  • اگر از سامانه‌های چندعاملی استفاده می‌کنید، ساختار ارتباطی (ستاره‌ای در برابر مش‌باف) را برای یک مسئله‌ی واحد تست کنید تا تفاوت در نتایج را ببینید.
  • مخزن ProtoLink را در گیت‌هاب بررسی کنید تا نحوه تعریف نقش‌ها و انگیزه‌های متضاد در عامل‌ها را بیاموزید.
  • در طراحی عامل‌های خود، مکانیزم «ثبت تغییر نظر» (Register Shift) را پیاده کنید تا بفهمید کدام پیام‌ها بیشترین تاثیر را در تغییر تصمیم مدل دارند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پژوهش با تکیه بر اعتبار متدولوژی ProtoLink، نشان می‌دهد که معماری شبکه در سامانه‌های عامل‌محور می‌تواند منجر به نتایج متناقض شود. این موضوع برای سازمان‌هایی که بر استقرار عامل‌های تصمیم‌گیر متکی هستند، یک ریسک عملیاتی جدی ایجاد می‌کند.

تأثیر برای ایران

برنامه‌نویسان ایرانی که در حال توسعه سامانه‌های چندعاملی (Multi-agent) هستند، می‌توانند از فریم‌ورک متن‌باز ProtoLink برای بهینه‌سازی ساختار ارتباطی عامل‌های خود استفاده کنند.

·نگاه ما
تحریریه دات‌هوش

این آزمایش ثابت می‌کند که «هوش» در سامانه‌های چندعاملی یک ویژگی ایستا نیست، بلکه محصولی از هندسه‌ی ارتباطات است. به نظر ما، این یافته به معنای پایان عصر بنچمارک‌های تک‌بعدی است؛ چرا که مدل‌های ضعیف‌تر در یک ساختار شبکه‌ای بهینه، می‌توانند مدل‌های قدرتمندتر را در محیط‌های ایزوله شکست دهند. در واقع، مدیریت جریان اطلاعات اکنون به اندازه بهینه‌سازی وزن‌های مدل اهمیت یافته است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.