پرش به محتوای اصلی
پرش به محتوای مقاله

«تأیید رسمی»؛ راهکار جدید برای هم‌راستایی تصمیمات ماشین با انسان

·۱۱ مرداد ۱۴۰۵۱۰ دقیقه مطالعه
طراحی سکونتگاه اکتشاف اعماق دریا با تضمین‌های حاکمیت صفر-اعتماد توسط ترنسفورمرهای تصمیم‌گیری هم‌راستا با انسان
طراحی سکونتگاه اکتشاف اعماق دریا با تضمین‌های حاکمیت صفر-اعتماد توسط ترنسفورمرهای تصمیم‌گیری هم‌راستا با انسان
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ترکیب ترنسفورمرهای تصمیم‌گیر با یک لایه‌ی تأیید رسمی (Formal Verification) که به صورت موازی و با منطق «اعتماد صفر» عمل می‌کند و اجازه نمی‌دهد هیچ اقدامی، صرف‌نظر از سطح اطمینان مدل، پروتکل‌های ایمنی را نقض کند.

تصور کنید در نقطه‌ای از اقیانوس هستید که فشار آب می‌تواند یک زیردریایی را در لحظه‌ای له کند و کوچک‌ترین خطای نرم‌افزاری به معنای مرگ تمام خدمه است. در چنین محیطی، سیستم‌های کنترلی دیگر نمی‌توانند صرفاً «واکنشی» باشند؛ آن‌ها باید پیش‌بین باشند و هر تصمیم را پیش از اجرا، با قوانینی تخطی‌ناپذیر بسنجند.

در حالی که گنبدهای تیتانیومی زیردریایی DSV Alvin به عنوان دژهایی ایستا و واکنشی عمل می‌کردند، هدف فعلی این است که زیستگاه‌های اعماق دریا به «اندام‌های متفکر» تبدیل شوند که محدودیت‌های فیزیکی را با نیازهای روان‌شناختی خدمه تطبیق می‌دهند. این هدف از طریق ترنسفورمر تصمیم‌گیر همراستا با انسان (Human-Aligned Decision Transformer یا HADT) محقق شده است. این چارچوب، محیط‌های پرخطر را با ایجاد تعادل میان برنامه‌ریزی خودگردان و یک لایه‌ی ایمنی با «اعتماد صفر» (Zero-Trust) مدیریت می‌کند. این ساختار تضمین می‌کند که یک هوش مصنوعی که مدیریت یک زیستگاه حیاتی را بر عهده دارد، نمی‌تواند دستوری را اجرا کند که پروتکل‌های ایمنی بنیادی را نقض کند، صرف‌نظر از اینکه مدل داخلی خود به آن تصمیم چقدر اطمینان داشته باشد.

پیدایش خودگردانی در اعماق (The Genesis of Abyssal Autonomy)

الهام‌بخش این سیستم، فیدهای تصویری دانه‌دار و با نور آبی از زیردریایی DSV Alvin در هنگام نزول به گودال ماریانا بود. اگرچه موجودات عجیب و فشار خردکننده جذاب هستند، اما نقص موجود در اکتشافات فعلی اعماق دریا این است که زیستگاه‌ها ایستا هستند. آن‌ها پوسته‌های ثابتی هستند که نقش یک دژ را ایفا می‌کنند، نه یک موجود زنده. این درک منجر به مجموعه‌ای از پیش‌طرح‌های دفترچه‌ای شد که تمرکز آن‌ها نه بر پوسته فیزیکی زیردریایی، بلکه بر هوشی بود که آن را هدایت می‌کند. تنش بنیادی در این طراحی این است که چگونه می‌توان به یک هوش مصنوعی کنترل خودگردان گسترده‌ای بر یک محیط حیاتی داد و در عین حال تضمین کرد که اقدامات در چارچوب نیت و امنیت انسانی باقی بمانند.

عملیات در گودال ماریانا یا مناطق مشابه اعماق اقیانوس، نیازمند تغییر رویکرد از پوسته‌های ایستا به موجودات تطبیقی است. یادگیری تقویتی (Reinforcement Learning) سنتی اغلب در این محیط‌ها شکست می‌خورد؛ زیرا الگوریتم‌هایی مانند PPO یا SAC بیش از حد به ابرپارامترها حساس‌اند و مستعد بیش‌برازش (Overfitting) روی چشم‌اندازهای پاداش خاص هستند. این مدل‌ها واکنشی هستند تا تأملی؛ آن‌ها یک سیاست (Policy) را یاد می‌گیرند بدون اینکه درک کنند چرا یک توالی از اقدامات منجر به نتیجه‌ای خاص شده است. از ۲ آگوست ۲۰۲۶، این رویکرد جدید تمرکز را از سیاست‌های واکنشی به مدل‌سازی توالی پیش‌بین منتقل کرده است. این رویکرد تطبیقی یادآور پیشرفت‌های اخیر در سیستم‌های خودگردان است، مانند رویکرد MOCA که توانست سرعت انطباق کاوشگرها را به‌طور چشم‌گیری افزایش دهد.

با تکیه بر منطق محاسبات با عملکرد بالا — مشابه روشی که موتور ترنسفورمر انویدیا (NVIDIA Transformer Engine) از قالب FP8 و هسته‌های ادغام‌شده (Fused Kernels) برای بهینه‌سازی سرعت آموزش استفاده می‌کند — سیستم HADT تصمیم‌گیری را به عنوان یک تسک توالی در نظر می‌گیرد. این امر به سیستم اجازه می‌دهد تا از حجم عظیمی از داده‌های تله‌متری تاریخی یاد بگیرد، بدون اینکه در مرحله اکتشاف، ریسک شکست در دنیای واقعی را بپذیرد. با قاب‌بندی مسئله به عنوان مدل‌سازی توالی، سیستم می‌تواند به‌طور مؤثری «خرد» اعزام‌های گذشته را در یک مدل مولدِ تصمیم‌گیری تقطیر کند.

موتور فنی: ترنسفورمرهای تصمیم‌گیر (Decision Transformers)

قلب تپنده این سامانه، ترنسفورمر تصمیم‌گیر (Decision Transformer یا DT) است که بر اساس معماری پیشگامانه «چن و همکاران» طراحی شده است. برخلاف RL استاندارد، DT مدلی از «بازگشت به هدف» (Return-to-Go یا RTG) را می‌آموزد و در واقع جست‌وجو برای یک سیاست بهینه را به عنوان یک تسک مدل‌سازی توالی را می‌بیند.

در یک مدل مفهومی مشابه PyTorch، ترنسفورمر تصمیم‌گیر از لایه‌های Embedding متعددی برای پردازش مودالیته‌های مختلف استفاده می‌کند:

  • nn.Embedding برای گام‌های زمانی (max_ep_len, embed_dim).
  • nn.Linear برای بازگشت‌ها (embed_return)، وضعیت‌ها (embed_state) و اقدامات (embed_action).
  • یک nn.TransformerEncoder که دارای مکانیسم توجه چندسر (Multi-head Attention) است (به عنوان مثال، ۴ سر در ۳ لایه).

مجموع این Embeddingها توالی‌ای را ایجاد می‌کند که به ترنسفورمر اجازه می‌دهد اقدام بعدی را بر اساس یک بازده هدف پیش‌بینی کند. به‌طور مشخص، در مرحله Forward Pass، هر مودالیته جاسازی (Embed) شده، با هم جمع شده و سپس Embeddingهای اقدام (به جز مکان آخر) به توالی متصل می‌شوند؛ در نهایت، این مجموعه از ترنسفورمر عبور کرده تا اقدام نهایی توسط یک لایه‌ی خطی (predict_action) پیش‌بینی شود.

این قدرت پیش‌بینی برای اهداف سلسله‌مراتبی یک زیستگاه اعماق دریا ایده‌آل است. سیستم فقط واکنش نشان نمی‌دهد، بلکه برای اهدافی نظیر موارد زیر برنامه‌ریزی می‌کند:

  • حفظ سطح اکسیژن بالای ۲۰٪.
  • نگه داشتن شاخص استرس خدمه زیر ۰.۳.
  • ذخیره توان باتری برای ۴۸ ساعت آینده.

از آنجا که مدل روی داده‌های آفلاین عمل می‌کند، نیاز به اکتشافات خطرناک آزمون و خطا در محیط‌های تحت فشار راy حذف می‌کند و در مقایسه با متدهای سنتی RL، پایداری آموزش را به‌شدت افزایش می‌دهد.

حل شکاف همراستاسازی (Solving the Alignment Gap)

توابع پاداش در مأموریت‌های اعماق دریا اغلب انتزاع‌های شکننده‌ای هستند. برای مثال، پاداش برای «بهره‌وری انرژی» ممکن است باعث شود هوش مصنوعی نورها را تا حدی کم کند که منجر به فشار روان‌شناختی شدید برای خدمه شود. برعکس، پاداش برای «کشف علمی» ممکن است زیستگاه را به سمت یک منطقه زمین‌شناسی خطرناک سوق دهد. برای رفع این مشکل، HADT یک مدل ترجیحی «انسان-در-حلقه» (Human-in-the-loop) را ادغام می‌کند.

  • یادگیری تقویتی معکوس (IRL): به جای یک دستورالعمل ثابت، سیستم قصد اپراتورهای انسانی را با مطالعه مسیرهای پیموده شده توسط متخصصان استخراج می‌کند.
  • یادگیری مبتنی بر ترجیح: با استفاده از مدل بردلی-تری (Bradley-Terry) برای تابع زیان ترجیحی، سیستم مسیرهای تولید شده توسط هوش مصنوعی را با مسیرهای خبره مقایسه می‌کند. مقدار زیان به صورت -torch.log(torch.sigmoid(expert_reward - ai_reward)) محاسبه می‌شود تا تضمین گردد مسیر هوش مصنوعی نسبت به مسیرهای تصادفی یا غیربهینه ترجیح داده شود.
  • دیالوگ مستمر: همراستاسازی به عنوان یک گفتگو در نظر گرفته می‌شود. هوش مصنوعی یک طرح را پیشنهاد می‌دهد (مثلاً: «پیشنهاد جابجایی به میدان گرمابهای کف دریا، هزینه انرژی مورد انتظار: X، دستاورد علمی مورد انتظار: Y»). اپراتور انسانی می‌تواند این پیشنهاد را تأیید، اصلاح یا رد کند.

این بازخورد تکرارشونده به‌طور مداوم مدل ترجیحی داخلی HADT را اصلاح می‌کند و تضمین می‌کند که تعریف هوش مصنوعی از رفتار «خوب»، با اهداف مأموریت و رفاه خدمه همسو باقی بماند.

طراحی سکونتگاه اکتشاف اعماق دریا با تضمین‌های حاکمیت صفر-اعتماد توسط ترنسفورمرهای تصمیم‌گیری هم‌راستا با انسان

لایه‌ی حاکمیت اعتماد-صفر (Zero-Trust Governance Layer)

در این معماری، اعتماد جای خود را به تأیید می‌دهد. خودگردانی HADT توسط یک اجراکننده‌ی ایمنی (Safety Enforcer) محدود شده است؛ یک لایه تأیید رسمی که به موازات هوش مصنوعی اجرا می‌شود. این لایه از سیاست‌های تغییرناپذیر و امضاشده با رمزنگاری استفاده می‌کند تا هر اقدامی را که منجر به نقض محدودیت‌های ایمنی شود، وتو کند. در کد منبع، این بخش به عنوان یک «فرشته نجات» عمل می‌کند که از متد validate_action برای بررسی حرکات پیشنهادی در برابر مجموعه‌ای از قوانین لامبدا (lambda rules) استفاده می‌کند.

قوانین کلیدی ایمنی عبارتند از:

  • فشار بدنه: باید زیر ۸۰۰ اتمسفر بماند (lambda s: s.pressure < 800).
  • تصفیه‌کننده‌های اکسیژن: نرخ O2 باید بالای ۰.۱ باشد (lambda s: s.o2_rate > 0.1).
  • سلامت خدمه: شاخص استرس باید زیر ۰.۸ بماند (lambda s: s.stress_index < 0.8).
  • بودجه انرژی: مصرف نباید از ۱۲۰٪ بودجه تخصیصی بیشتر شود (lambda s: s.energy_usage < s.energy_budget * 1.2).

نکته حیاتی این است که اجراکننده فقط اقدام فوری را بررسی نمی‌کند. بلکه از مدل خودِ HADT استفاده می‌کند تا پیامدهای یک اقدام را برای N گام زمانی آینده شبیه‌سازی کند. با پیش‌بینی مسیر آینده، سیستم تضمین می‌کند که زیستگاه وارد وضعیتی نشود که در حال حاضر ایمن است اما به‌طور اجتناب‌ناپذیری در آینده منجر به نقض قوانین می‌شود. هر وتو در یک گزارش بازرسی (Audit Log) ثبت می‌شود که شامل اقدام، قانون نقض شده، برچسب زمانی و شناسه تصمیم است.

ادغام و حالت سایه (Integration and Shadow Mode)

معماری نهایی از طریق یک DeepSeaHabitatController ساختاربندی شده است که hadt_model (مدل)، safety_enforcer (اجراکننده ایمنی) و human_interface (رابط انسانی) را مدیریت می‌کند. حلقه مأموریت از یک توالی سخت‌گیرانه پیروی می‌کند:

  1. HADT بر اساس وضعیت، RTG و گام زمانی، یک طرح پیشنهادی (توالی از اقدامات) را با استفاده از generate_plan تولید می‌کند.
  2. اجراکننده کل طرح را از طریق validate_plan تأیید می‌کند. اگر ناایمن باشد، سیستم مداخله انسانی را فعال می‌کند.
  3. رابط انسانی اجازه بازبینی یا لغو (get_override) را می‌دهد که سپس برای به‌روزرسانی همراستایی HADT از طریق update_alignment جهت ثبت رفتار اصلاح‌شده استفاده می‌شود.
  4. سیستم اقدام نهایی را اجرا کرده، وضعیت جهان را از طریق simulate_environment به‌روزرسانی می‌کند و RTG را با update_rtg اصلاح می‌نماید.
  5. یک بازرسی ناهمگام (Asynchronous Audit) توسط اجراکننده با استفاده از متد audit انجام می‌شود.

برای جلوگیری از اینکه لایه‌ی ایمنی بیش از حد سخت‌گیرانه شود — که ممکن است هوش مصنوعی را از اکتشاف استراتژی‌های مفید جدید باز دارد — سیستم از «حالت سایه» (Shadow Mode) استفاده می‌کند:

  • شبیه‌سازی‌های «چه می‌شد اگر»: هنگامی که یک اقدام پیشنهادی رد می‌شود، سیستم شبیه‌سازی را اجرا می‌کند تا ببیند آیا پیش‌بینی هوش مصنوعی واقعاً منجر به نقض قانون می‌شد یا خیر.
  • یادگیری مرزها: این حلقه بازخورد به HADT اجازه می‌دهد تا لبه‌های دقیق سیاست‌های ایمنی را بدون ریسک کردن واقعی برای زیستگاه یاد بگیرد.
  • تعادل پویا: این امر تضمین می‌کند که هوش مصنوعی در پیشنهاد طرح‌های نوآورانه‌ای که ذاتاً مطابق با قوانین هستند، مؤثرتر شود.

گسترش خودگردانی در محیط‌های پرخطر

این معماری فراتر از کف اقیانوس، در هر سیستم خودگردانی در محیط‌های نامطمئن و حساس قابل گسترش است:

  1. آزمایشگاه‌های خودگردان: آزمایشگاهی که مواد جدید طراحی می‌کند. HADT توالی را برنامه‌ریزی می‌کند، اجراکننده ایمنی به عنوان یک «طرح بهداشت شیمیایی مجازی» برای جلوگیری از واکنش‌های خطرناک عمل می‌کند و دانشمندان همراستاسازی را بر اساس ارزش علمی نتایج فراهم می‌کنند.
  2. شبکه‌های برق هوشمند: سیستمی که بار را متعادل و تقاضا را پیش‌بینی می‌کند. حاکمیت اعتماد-صفر تضمین می‌کند که هیچ اقدامی منجر به خاموشی زنجیره‌ای نشود، در حالی که انسان‌ها در طول رویدادهای آب و هوایی شدید، کنترل را به دست می‌گیرند.
  3. امور مالی عامل‌محور: عامل‌های معاملاتی فرکانس بالا که استراتژی‌ها را از داده‌های تاریخی می‌آموزند. لایه اعتماد-صفر محدودیت‌های ریسک سخت‌گیرانه‌ای مانند «حداکثر افت پرتفوی» و قوانین انطباق را اعمال می‌کند تا تضمین شود خودگردانی منجر به ریسک‌های مالی فاجعه‌بار نمی‌شود.

در چشم‌انداز آینده، ادغام شتاب‌دهنده‌های کوانتومی (Quantum Annealers) می‌تواند تأیید ایمنی را از چند ثانیه به چند میلی‌ثانیه کاهش دهد. از آنجا که تأیید ایمنی اساساً یک مسئله «ارضای محدودیت» (Constraint Satisfaction Problem) است، کمک-پردازنده‌های کوانتومی می‌توانند ایمنی را در یک فضای وضعیت عظیم به‌صورت لحظه‌ای تأیید کنند. این امر برای پاسخ به جهش‌های ناگهانی فشار یا لرزه‌های زمین‌شناختی حیاتی خواهد بود، زیرا این افزایش سرعت می‌تواند تفاوت بین یک واکنش ایمن در عرض چند ثانیه در مقابل چند میلی‌ثانیه باشد.

غلبه بر مشکل راه‌اندازی سرد (Overcoming the Cold-Start Problem)

از آنجا که داده‌های واقعی اعماق دریا کمیاب هستند، توسعه‌دهنده‌ها با مشکل «راه‌اندازی سرد» مواجه شدند؛ جایی که DT داده‌های آفلاین با کیفیت کافی برای یادگیری یک سیاست قابل اعتماد نداشت. برای حل این مشکل، آن‌ها یک مدل جهان به صورت «همزاد دیجیتال» (Digital Twin) ایجاد کردند.

  • مسیرهای مصنوعی: شبیه‌ساز میلیون‌ها مسیر مصنوعی برای پیش-آموزش HADT تولید کرد.
  • از پیش-آموزش تا همراستاسازی: این مرحله مصنوعی یک خط مبنا (Baseline) ایجاد کرد که سپس در مرحله همراستاسازی انسانی با استفاده از بازخوردهای واقعی اپراتورها اصلاح شد.
  • توضیح‌پذیری: برای رفع ماهیت «جعبه سیاه» ترنسفورمرها، سیستم از تجسم‌های مبتنی بر توجه (Attention-based Visualization) استفاده می‌کند. با نگاشت وزن‌های توجه ترنسفورمر به ویژگی‌های ورودی (مثلاً نشان دادن اینکه هوش مصنوعی توجه زیادی به سنسور «فشار بدنه» و معیار «استرس خدمه» دارد)، اپراتورها می‌توانند «استدلال» هوش مصنوعی را ببینند و آن را شهودی‌تر درک کنند.

این تغییر به سمت هوش مشارکتی اذعان می‌کند که هوش مصنوعی برای مفید بودن نیازی به دانای کل بودن ندارد؛ تنها کافی است به‌طور قابل تأییدی توسط قوانین اخلاقی و فیزیکی محدود شده باشد. این چارچوب — با ترکیب قدرت پیش‌بینی ترنسفورمرها، ترجیحات انسانی و دقتِ اعتماد-صفر — نقشه‌راهی برای سیستم‌هایی ایجاد می‌کند که نه‌تنها هوشمند، بلکه به‌طور عمیق و تزلزل‌ناپذیری ایمن هستند.

گام بعدی شما

  • بررسی معماری Decision Transformer برای جایگزینی RL در محیط‌های حساس
  • مطالعه‌ی متدهای Formal Verification برای ایجاد لایه‌های حفاظتی در عامل‌های هوش مصنوعی
  • تحلیل کاربرد Digital Twin در پیش-آموزش مدل‌های تصمیم‌گیر در محیط‌های با داده‌ی کم

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است؛ برای بررسی اینکه چگونه پردازنده‌های کوانتومی می‌توانند سرعت این تأییدات ایمنی را از ثانیه به میلی‌ثانیه برسانند، تحلیل ما درباره‌ی شتاب‌دهنده‌های نسل جدید را بخوانید.

چرا این موضوع مهم است؟

این چارچوب با تکیه بر اعتبار متدهای تأیید رسمی (Formal Verification)، استقرار هوش مصنوعی در زیرساخت‌های حیاتی را از یک قمار ریسکی به یک فرآیند مهندسی قابل‌سنج تبدیل می‌کند. در نتیجه، اعتماد به سیستم‌های خودگردان در محیط‌های غیرقابل دسترس انسانی به شدت افزایش می‌یابد.

تأثیر برای ایران

این معماری برای توسعه‌دهندگان ایرانی در حوزه‌های رباتیک صنعتی و سیستم‌های کنترل متمرکز کاربرد دارد و راهکاری برای پیاده‌سازی ایمنی در عامل‌های هوش مصنوعی بدون نیاز به داده‌های عظیم واقعی است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی یادگیری تقویتی فعال (Online RL) با مدل‌سازی توالی آفلاین، نقطه عطفی در ایمنی سیستم‌های عامل‌محور است. این رویکرد نشان می‌دهد که در محیط‌های حیاتی، «پیش‌بینی» بسیار ارزشمندتر از «آزمون و خطا» است و لایه تأیید رسمی (Formal Verification) تنها راه خروج از بن‌بست توهمات مدل در لحظات بحرانی است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.