پرش به محتوای اصلی
پرش به محتوای مقاله

یادگیری تقویتی در برابر منطق صلب برای حل مسائل تصمیم‌گیری متوالی

·۵ مرداد ۱۴۰۵۶ دقیقه مطالعه۳ بازدید
تحلیل
ساخت سیستم‌های خودران: از قوانین تا یادگیری تقویتی
ساخت سیستم‌های خودران: از قوانین تا یادگیری تقویتی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر تمرکز از «بهبود ادراک» (که توسط یادگیری نظارت‌شده حل شد) به «بهبود زنجیره تصمیمات» از طریق RL و تلاش برای بستن شکاف شبیه‌ساز به واقعیت.

وقتی یک خودروی خودران در مواجهه با یک منطقهٔ در حال تعمیر متوقف می‌شود، در واقع با یک نقص بنیادی به نام «مورد خاص» (Edge Case) دست‌وپنجه نرم می‌کند. این اتفاق ثابت می‌کند که شکست سامانه‌های خودمختار نه به‌دلیل ضعف در بینایی، بلکه به‌خاطر ناتوانی در تصمیم‌گیری در موقعیت‌هایی است که برنامه‌نویس از پیش پیش‌بینی نکرده و به‌طور صریح کدگذاری نکرده است.

این چالش، نقطهٔ گذار از منطق قطعی به رفتار اکتسابی است. تمام سامانه‌های خودمختاری که امروز می‌بینیم — از ربات‌های انبارگردان تا عامل‌های معاملاتی — از اجداد ساده‌تری می‌آیند: مجموعه‌ای از قوانین «اگر-آنگاه» (if-then) که مهندسان برای پیش‌بینی هر احتمال ممکن نوشته بودند. همان‌طور که در تحلیل قبلی ما درباره‌ی The Little Book of Reinforcement Learning اشاره کردیم، جایی که مبانی نظری با کتابخانه PyTorch پیوند خورده بود، صنعت اکنون از تئوری‌های آکادمیک به سمت فرآیند دشوار و طاقت‌فرسای استقرار این عامل‌ها در دنیای فیزیکی حرکت می‌کند.

بازوی صنعتی یک کارخانه در دههٔ ۱۹۸۰ را تصور کنید. این بازو فقط دنبال می‌کرد که توالی ثابتی از مختصات را اجرا کند؛ او «فکر» نمی‌کرد، بلکه فقط دستورات را اجرا می‌کرد. این همان ذات سامانه‌های قانون‌محور است. این سیستم‌ها دانش انسانی را به شکل منطق صریح کدگذاری می‌کردند؛ درست مانند یک سامانهٔ تشخیص پزشکی که علائم بیمار را با یک درخت تصمیم تطبیق می‌داد تا به نتیجه برسد.

چنین سامانه‌هایی پیش‌بینی‌پذیر هستند و بازرسان به‌راحتی می‌توانند آن‌ها را حسابرسی کنند. به همین دلیل است که هنوز محاسبات مالیاتی و بررسی‌های انطباق با قوانین (compliance checks) امروز نیز با همین روش انجام می‌شود. مهندسان می‌توانند هر تصمیم را تا یک خط کد خاص ردیابی کنند، و همین موضوع آن‌ها را برای وظایف محدود، دقیق و تعریف‌شده، ایده‌آل می‌کند.

اما طبق تحلیلی که در ۲۷ جولای ۲۰۲۶ در dev.to منتشر شد، سامانه‌های قانون‌محور زمانی می‌شکنند که محیط سریع‌تر از سرعت نوشتنِ منطق توسط انسان تغییر کند. شکست دقیقاً در لبه‌های سیستم رخ می‌دهد. اگر شرکتی یک خط تولید جدید، یک حسگر متفاوت یا شرایط بازار جدیدی را اضافه کند، باید کسی به‌صورت دستی مجموعه قوانین را گسترش دهد. مشکل اینجاست که هر قانون جدید ممکن است تعاملی غیرقابل‌پیش‌بینی با قوانین موجود ایجاد کند و باعث تداخل شود.

سامانه‌های خبرهٔ اولیه در دهه‌های ۷۰ و ۸۰، مانند MYCIN، ثابت کردند که اگرچه در دموهای کنترل‌شده عالی عمل می‌کردند، اما نمی‌توانستند حجم قوانین خود را برای تطبیق با پیچیدگی‌های عظیم و متغیر طبابت در دنیای واقعی مقیاس‌بندی کنند.

شکاف بین ادراک و تصمیم‌گیری

یادگیری نظارت‌شده (Supervised Learning) — شبیه به شاگردی که با دیدن هزاران عکس برچسب‌خورده یاد می‌گیرد چه چیزی چیست — نیمی از این معما را حل کرد: ادراک. مهندسان به‌جای کدنویسی برای جملاتی مثل «اگر تعداد لبه‌ها از حد آستانه بیشتر بود، آن را به عنوان مانع طبقه‌بندی کن»، هزاران تصویر برچسب‌خورده را به مدل دادند تا مدل بتواند رابطه بین ورودی و خروجی را مستقیماً بیاموزد.

با استفاده از شبکه‌های عصبی پیچشی (CNN)، بینایی ماشین از یک مسئلهٔ مهندسیِ قانون به یک مسئلهٔ داده تبدیل شد. تا اوسط دههٔ ۲۰۱۰، یادگیری نظارت‌شده بر کارهایی مثل تشخیص اشیا، بازشناسی گفتار و طبقه‌بندی تصاویر حاکم شد و استانداردهای جدیدی تعریف کرد.

امروز یک مدل می‌تواند یک عابر پیاده، یک تابلوی ایست یا یک قطعه معیوب در خط تولید را با دقتی بسیار بالا شناسایی کند؛ دقتی که سامانه‌های بینایی قانون‌محور هرگز نتوانستند حتی به نزدیکی آن برسند. اما باید به خاطر داشت که ادراک با تصمیم‌گیری متفاوت است.

یادگیری نظارت‌شده هیچ مفهوم ذاتی از «پیامد» ندارد. یک مجموعه دادهٔ برچسب‌خورده به مدل می‌گوید تابلوی ایست چه شکلی است، اما توضیح نمی‌دهد که یک تصمیم برای ترمز کردن، وضعیت خودرو را برای ۵ ثانیهٔ آینده چگونه تغییر می‌دهد. این روش فقط به مدل می‌گوید پاسخ درست در گذشته چه بوده است، که این موضوع تفاوت بنیادی با «تصمیم‌گیری متوالی» دارد.

مکانیسم‌های یادگیری تقویتی (RL)

برای تصمیمات متوالی، یادگیری تقویتی (RL) سیستم را به‌عنوان یک عامل (Agent) در تعامل با محیط در نظر می‌گیرد. راندن خودرو یا مدیریت ناوگان انبار، یک تک‌تکلیف طبقه‌بندی ساده نیست، بلکه زنجیره‌ای از انتخاب‌هاست که در آن هر اقدام، وضعیت آینده را تغییر می‌دهد. این رویکرد عامل‌محور، تفاوت‌های ساختاری عمیقی با مدل‌های سنتی دارد، چنان‌که در بررسی تفاوت عامل‌های هوشمند و هوش مصنوعی زاینده تحلیل کردیم که چگونه تمرکز از تولید محتوا به اجرای اهداف پیچیده تغییر یافته است.

مدل RL در یک حلقه عمل می‌کند: عامل اقدامی انجام می‌دهد، محیط وضعیت جدید و یک «سیگنال پاداش» برمی‌گرداند و عامل سیاست (Policy) خود را به‌روز می‌کند تا اقداماتی که در طول زمان پاداش تجمعی (cumulative reward) بیشتری دارند، تقویت شوند.

دو چالش اصلی در طراحی RL وجود دارد که موفقیت سیستم را تعیین می‌کنند:

  • شکل‌دهی پاداش (Reward Shaping): اگر تابع پاداش بد تعریف شود، مدل دچار «سوءاستفاده از پاداش» (Reward Hacking) می‌شود و به‌جای هدف واقعی، معیار ریاضی را بهینه می‌کند. برای مثال، یک عامل مسابقه‌ی قایق‌رانی OpenAI در سال ۲۰۱۶ یاد گرفت به‌جای تمام کردن مسابقه، مدام دور خودش بچرخد تا آیتم‌های جایزه را جمع کند، چون تابع پاداش امتیاز-گیری را بر پیروزی در مسابقه اولویت داده بود. طراحی تابع پاداشی که واقعاً هدف نهایی را نمایندگی کند، به اندازه خودِ معماری مدل نیاز به تلاش مهندسی دارد.
  • کاوش در برابر بهره‌برداری (Exploration vs. Exploitation): عامل باید بین امتحان کردن استراتژی‌های جدید (کاوش) و استفاده از روش‌های موفقِ شناخته‌شده (بهره‌برداری) تعادل برقرار کند. عاملی که فقط بهره‌برداری کند، هرگز استراتژی‌های بهتر را کشف نمی‌کند و عاملی که فقط کاوش کند، هرگز به یک روش قابل اتکا نمی‌رسد. DeepMind در مدل‌های AlphaGo و AlphaZero این مشکل را در مقیاس بزرگ با ترکیب بازی با خود (Self-play) و جست‌وجوی درختی مونت‌کارلو حل کرد تا میلیون‌ها موقعیت را کاوش کرده و هم‌زمان به سمت بازی قدرتمند میل کند. همین تعادل است که تعیین می‌کند یک ربات انبار چگونه بهینه‌ترین مسیرهای برداشت کالا را بیابد.

سیستم‌های خودمختار: از قوانین تا یادگیری تقویتی

بستن شکاف شبیه‌ساز به واقعیت

از آنجا که RL به میلیون‌ها تجربه آزمون و خطا نیاز دارد، آموزش روی سخت‌افزار فیزیکی بسیار خطرناک، کند و هزینه‌بر است. تصادف یک خودرو یا شکستن یک بازوی رباتیک در دنیای واقعی هزینه‌های هنگفتی دارد، اما در یک موتور فیزیک (Physics Engine)، این اتفاق هیچ هزینه‌ای ندارد.

صنعت بر شبیه‌سازها تکیه دارد، اما «شکاف واقعیت» (Reality Gap) همچنان پابرجاست. شبیه‌سازها اصطکاک، نویز حسگر، نورپردازی و خواص مواد را تقریب می‌زنند، اما هرگز نمی‌توانند آن‌ها را به‌طور کامل بازسازی کنند. در نتیجه، سیاستی که در شبیه‌ساز عالی عمل می‌کند، ممکن است هنگام انتقال به سخت‌افزار واقعی به‌شدت افت کند.

برای حل این مشکل، پژوهشگران از «تصادفی‌سازی دامنه» (Domain Randomization) استفاده می‌کنند. در این روش، بافت‌ها، نور و پارامترهای فیزیکی در طول آموزش به‌طور تصادفی تغییر می‌کنند تا عامل یک سیاست منعطف و مقاوم یاد بگیرد، نه سیاستی که فقط روی یک محیط خاص «بیش‌برازش» (Overfitting) شده باشد.

OpenAI در سال ۲۰۱۹ از این روش برای آموزش یک دست رباتیک جهت حل مکعب روبیک استفاده کرد؛ به‌طوری که ابتدا مهارت را در شبیه‌ساز آموخت و سپس آن را به ربات فیزیکی منتقل کرد. با این حال، انتقال از شبیه‌ساز به واقعیت (sim-to-real) هنوز یکی از دشوارترین و پرزحمت‌ترین بخش‌های استقرار RL در خارج از محیط آزمایشگاه است.

چرا خودمختاری کامل هنوز دست‌نیافتنی است؟

با وجود این جهش‌ها، هیچ سیستم گسترده‌ای در محیط‌های باز و بدون محدودیت به‌طور کامل خودمختار نیست. سه دلیل اصلی برای این سقف وجود دارد.

اول، «موارد خاص» (edge cases) سخت‌ترین مسئله حل نشده هستند. سیستمی که میلیون‌ها مایل در جاده‌های عادی آموزش دیده، هنوز با ترکیب‌های نادر مشکل دارد؛ مثلاً شیئی که در هوای بد نیمه‌پنهان است یا کارگری که در یک منطقه تعمیراتی به روشی غیرمعمول ترافیک را هدایت می‌کند. گزارش ۲۰۲۴ مک‌کینزی (McKinsey) در مورد وضعیت هوش مصنوعی تأکید می‌کند که قابلیت اطمینان در سناریوهای نادر و حساس (high-stakes)، بزرگ‌ترین مانع برای گسترش دامنه استقرار این سیستم‌هاست.

دوم، اثبات تضمین‌های ایمنی دشوار است. در حالی که مهندس می‌تواند یک سیستم قانون‌محور را خط‌به‌خط با مشخصات فنی تطبیق داده و تأیید کند، هیچ‌کس نمی‌تواند به‌راحتی ثابت کند که یک سیاست شبکه عصبی در برابر هر ورودی احتمالی، ایمن عمل خواهد کرد. رفتار سیستم از داده‌های آموزشی و شکل‌دهی پاداش بیرون می‌آید، نه از یک منطق صریح و قابل بازرسی.

سوم، تفسیرپذیری (Interpretability) این مشکلات را پیچیده‌تر می‌کند. وقتی یک سیستم قانون‌محور اشتباه می‌کند، مهندس دقیقاً می‌داند کدام قانون اجرا شده است. اما در یک سیاست RL عمیق، ردیابی یک تصمیم اشتباه در میان میلیون‌ها پارامتر یادگرفته‌شده، تلاش بسیار بیشتری می‌طلبد. این موضوع سرعت عیب‌یابی (debugging) را کاهش داده و دریافت تأییدیه‌های رگولاتورها را در حوزه‌های حیاتی مانند سلامت و حمل‌ونقل سخت می‌کند.

این وضعیت نشان می‌دهد آیندهٔ خودمختاری، یک «مدل واحد و جامع» نیست، بلکه یک معماری لایه‌بندی‌شده است؛ جایی که قوانین صلب، مرزهای انطباق و ایمنی را تعیین می‌کنند، یادگیری نظارت‌شده ادراک و تشخیص را مدیریت می‌کند و یادگیری تقویتی (RL) تصمیمات متوالی را به پیش می‌برد. برای درک اینکه چگونه مدل‌های زبانی نیز سعی می‌کنند به این سطح از خودمختاری برسند، می‌توان به بررسی الگوی ReAct پرداخت که مکانیزمی برای تبدیل مدل‌های زبانی به عامل‌های خودکار است. تیم‌هایی که خودمختاری را به عنوان یک سیستم لایه‌ای می‌بینند، عموماً نتایجی بسیار برتر از کسانی دارند که سعی می‌کنند یک مدل واحد «سرتا‌سر» (end-to-end) را آموزش دهند.

گام بعدی شما

  • برای توسعه‌دهندگان: بررسی متدهای Domain Randomization برای کاهش خطای انتقال مدل از محیط شبیه‌سازی شده به سخت‌افزار.
  • مطالعه در مورد معماری‌های Hybrid (ترکیبی) که در آن لایهٔ ایمنی با منطق صلب (Hard Rules) کنترل می‌شود.
  • دنبال کردن گزارش‌های جدید مک‌کینزی در مورد استانداردهای ایمنی برای سیستم‌های عامل‌محور.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تغییر پارادایم از قانون به یادگیری، مرز بین ابزارهای اتوماتیک ساده و عامل‌های واقعاً هوشمند را جابه‌جا می‌کند. اعتبار این رویکرد در موفقیت AlphaZero ثابت شده و اکنون کلید عبور از اتوماسیون خشک به خودمختاری منعطف است.

تأثیر برای ایران

این تحولات بیشتر برای پژوهشگران مدل‌های بنیادی و رباتیک در ایران اهمیت دارد تا بازار مصرف؛ چرا که استقرار RL در سخت‌افزار نیازمند زیرساخت‌های شبیه‌سازی سنگین است.

·نگاه ما
تحریریه دات‌هوش

تلاش برای رسیدن به یک مدل «سر به سر» (End-to-End) که هم ادراک و هم تصمیم را هم‌زمان مدیریت کند، احتمالاً یک بن‌بست مهندسی است. راهبرد برنده در خودمختاری، نه در حذف منطق صلب، بلکه در ایجاد یک «سلسله‌مراتب کنترل» است؛ جایی که یادگیری تقویتی موتور پیشران است اما قوانین صلب، ترمزهای ایمنی را نگه داشته‌اند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.