پرش به محتوای اصلی
پرش به محتوای مقاله

دیپ‌مایند: معماری جست‌وجوی AlphaGo کلید اعتمادپذیری در پزشکی و علوم است

·۱۰ مهر ۱۴۰۵۶ دقیقه مطالعه
تحلیل
هوش مصنوعی در حال تفکر نیست؛ فقط الگوها را تکرار می‌کند.
هوش مصنوعی در حال تفکر نیست؛ فقط الگوها را تکرار می‌کند.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

طرح یک معماری جایگزین که در آن LLMها نه به عنوان موتور اصلی استدلال، بلکه به عنوان پیشنهاددهنده در یک درخت جست‌وجوی صریح (شبیه آلفاگو) عمل می‌کنند.

اگر تصور می‌کنید چت‌بات‌ها واقعاً فکر می‌کنند، باید بدانید که آن‌ها تنها در حال انجام یک بازی سریع با احتمالات هستند. مدل‌های زبانی بزرگ (LLM) در واقع استدلال نمی‌کنند، بلکه در حال انجام یک فرآیند تکمیل الگوی سریع هستند.

ثور گراپل (Thore Graepel)، عضو سابق تیم اصلی آلفاگوی (AlphaGo) در گوگل دیپ‌مایند (Google DeepMind) و رئیس فعلی یادگیری ماشین در کالج دانشگاهی لندن، استدلال می‌کند که صنعت هوش مصنوعی، «روانی در بیان» (Linguistic Fluency) را با «توانایی تفکر و تامل» (Ability to Deliberate) اشتباه گرفته است.

این تمایز در حوزه‌هایی که ریسک بالایی دارند، مانند پزشکی و مهندسی، حیاتی است. در حالی که ما پیش از این بررسی کردیم که ابزارهایی مانند Sether چگونه حریم خصوصی داده‌ها را پیش از ارسال درخواست به LLMها مدیریت می‌کنند، مسئله‌ی عمیق‌تر این است که آیا می‌توان به مدل‌های زیربنایی اعتماد کرد تا به دلایل درست، به نتایج درست برسند؟

زمینه و بستر هوش ماشینی

برای درک این شکاف، گراپل به مسابقه‌ی مارس ۲۰۱۶ در سئول بین آلفاگو و لی سدول، یکی از برترین بازیکنان حرفه‌ای تاریخ بازی گو، اشاره می‌کند. در بازی دوم، آلفاگو «حرکت ۳۷» را اجرا کرد؛ انتخابی چنان غیرمتعارف و عجیب که تحلیلگران انسانی در ابتدا آن را یک خطای برنامه‌نویسی یا یک نقص فنی دانستند.

لی سدول بعدها در اظهاراتی اشاره کرد که در ابتدا فکر می‌کرد آلفاگو صرفاً ماشینی است که بر اساس محاسبات احتمالی عمل می‌کند، اما حرکت ۳۷ نظر او را تغییر داد و او را به این نتیجه رساند که آلفاگو دارای نوعی «خلاقیت» است. در نهایت، آلفاگو با نتیجه ۴ بر ۱ بر این قهرمان پیروز شد.

این پیروزی از نظر بنیادین با شکست گری کاسپاروف در برابر دیپ‌بلو در سال ۱۹۹۷ متفاوت بود. دیپ‌بلو بر قوانین سخت‌افزاری و قواعد کدنویسی شده توسط انسان تکیه داشت؛ این سیستم ۲۰۰ میلیون وضعیت را در ثانیه ارزیابی می‌کرد و شش تا هشت حرکت آینده را پیش‌بینی می‌نمود. اما بازی گو به مراتب پیچیده‌تر است؛ به گونه‌ای که محاسبه حتی بخش کوچکی از نتایج ممکن آن، میلیاردها سال زمان از یک ابرکامپیوتر را می‌طلبید. برای پیروزی، آلفاگو باید می‌توانست در یک نگاه تشخیص دهد چه کسی پیش است و حرکاتی را ابداع کند که هیچ انسانی هرگز به فکر اجرای آن‌ها نرسیده بود.

معماری آلفاگو

آلفاگو با استفاده از دو سیستم مجزا عمل می‌کرد که بازتابی از شناخت انسانی بود؛ به طور مشخص، این معماری بر اساس تئوری علوم رفتاری دانیل کانمن درباره «سیستم ۱» (سریع و غریزی) و «سیستم ۲» (کند و متفکر) طراحی شده بود:

  • شبکه سیاست (Policy Network - سیستم ۱): این بخش به عنوان ضلع «شهودی» عمل می‌کرد. این شبکه آموزش دیده بود تا حدس بزند یک انسان خبره چه حرکتی را انجام می‌دهد. از نظر این شبکه، حرکت ۳۷ هیچ ویژگی خاصی نداشت و احتمالی در حدود یک در ۱۰,۰۰۰ داشت که یک بازیکن خبره انسانی چنین حرکتی را انجام دهد.
  • مکانیزم جست‌وجو (Search Machinery - سیستم ۲): این موتور استدلالی و متفکر بود. این سیستم به طور صریح یک درخت بازی با هزاران شاخه می‌ساخت که هر شاخه نشان‌دهنده یک آینده احتمالی متفاوت بود. این موتور پیامدهای آتی حرکات پیشنهادی را می‌سنجید و در نهایت، شهود سیستم ۱ را کنار زد تا حرکت ۳۷ را انتخاب کند.

هوش مصنوعی واقعاً استدلال نمی‌کند، فقط الگو یاد گرفته است.

همان‌طور که در شناخت انسانی رخ می‌دهد، در آلفاگو نیز هیچ‌کدام از این دو بخش به‌تنهایی کار نمی‌کردند. شهود به‌تنهایی حرکت ۳۷ را رد می‌کرد و جست‌وجوی خام (Brute-force) در میان تعداد نجومی حرکات ممکن غرق می‌شد و نمی‌توانست آن‌ها را غربال کند.

چرا LLMها در آزمون استدلال شکست می‌خورند؟

طبق تحلیل گراپل، چت‌بات‌های امروزی تقریباً به‌طور کامل در حالت «سیستم ۱» عمل می‌کنند. یک مدل زبانی بزرگ صرفاً توکن (Token) بعدی را بارها و بارها پیش‌بینی می‌کند. این فرآیند در واقع یک تکمیل الگوی تداعی‌گرایانه و سریع در میان موضوعاتی است که انسان‌ها درباره آن‌ها نوشته‌اند.

حتی با استفاده از پردازش «زنجیره تفکر» (Chain of Thought یا CoT) — که در آن مدل‌ها گام‌های میانی را برای تجزیه یک مسئله تولید می‌کنند — باز هم آن‌ها فاقد یک مکانیزم استدلالی مجزا هستند. استدلال میانی همچنان توسط همان فرآیند پیش‌بینی توکن بعدی تولید می‌شود و تنها پیش از آنکه مدل به پاسخ نهایی متعهد شود، برای مدت طولانی‌تری تکرار می‌گردد. اگرچه این روش نتایج را در کدنویسی و ریاضیات بهبود بخشیده است، اما استدلال واقعی نیست. این تضاد میان توانایی‌های محاسباتی و استدلال عمیق، یادآور بررسی‌هایی است که نشان می‌دهد متخصصان پیشرفت‌های AI در حوزه‌های دیجیتال را سریع‌تر از تعاملات فیزیکی تخمین زده‌اند.

گراپل سه نقص بنیادی در استدلال LLMهای فعلی شناسایی کرده است:

  • فقدان وضعیت معرفتی (Lack of Epistemic State): مدل‌ها هیچ وضعیت معرفتی صریح، پایدار یا قابل‌بازرسی ندارند. هیچ دفتر کل باز وجود ندارد که فرضیات در حال بررسی، میزان اطمینان به توضیحات مختلف، شواهدی که در حال سنجش هستند یا پرسش‌های حل‌نشده‌ای که در حافظه نگه داشته شده‌اند را نمایش دهد.
  • درهم‌تنیدگی دانش (Interwoven Knowledge): هیچ تفکیک پاکی بین «آنچه سیستم می‌داند» و «چگونه آن دانش را دستکاری می‌کند» وجود ندارد. دانش و استدلال به‌طور جدایی‌ناپذیری در وزن‌های شبکه عصبی درهم‌تنیده شده‌اند، به این معنی که هیچ مجموعه مستقل و صریحی از باورها وجود ندارد.
  • توجیه پسینی (Post-hoc Justification): پژوهش‌ها نشان می‌دهد که بات‌ها اغلب زنجیره‌های تفکر خود را «بعد از وقوع» ابداع می‌کنند. آن‌ها ممکن است از یک مسیر به پاسخ برسند، اما مسیر دیگری را به کاربر گزارش کنند تا منطقی به نظر برسد.

این یک شکست بحرانی برای کاربردهای حساس است. در تشخیص و درمان پزشکی، داشتن نتیجه درست کافی نیست؛ ما باید بتوانیم دقیقاً شناسایی کنیم که آیا یک اشتباه ناشی از استدلال غلط بوده، یا شواهد نامعتبر و یا مفروضات نادرست.

مسیری نو برای هوش ماشینی

گراپل پیشنهاد می‌کند برای اینکه هوش مصنوعی در اکتشافات علمی مفید باشد، باید یک «وضعیت معرفتی» صریح، مشابه درخت بازی آلفاگو، حفظ کند. در آلفاگو، درخت بازی شامل تمام تغییرات بررسی شده و آینده‌های ممکن است و هر وضعیت توسط قضاوت‌های شبکه‌های عصبی یادداشت‌برداری می‌شود. با پیشرفت استدلال، این درخت به‌روزرسانی و ترکیب می‌شود تا تصمیمی گرفته شود.

در این چارچوب پیشنهادی، استدلال به عنوان توالی از حرکاتی تعریف می‌شود که وضعیت معرفتی را تغییر می‌دهد تا دانش پیش برود و عدم قطعیت کاهش یابد. این فرآیند شامل موارد زیر است:

  • استنتاج پیامدها و خرد کردن مسائل پیچیده به اجزای کوچک‌تر.
  • تصمیم‌گیری درباره اینکه کدام پرسش خاص باید پرسیده شود، کدام محاسبه باید انجام شود یا کدام آزمایش در گام بعدی اجرا گردد.
  • استفاده از LLMها برای پیشنهاد روش‌های مقابله با یک مسئله بر اساس منابع موجود.
  • تعامل با ابزارها از طریق APIها یا کدنویسی برای ارزیابی اینکه آیا یک ادعا توسط شواهد پشتیبانی می‌شود یا خیر.

برای تضمین صداقت، بخشی مستقل از سیستم باید هر حرکت را بر اساس میزان کاهش واقعی عدم قطعیت ارزیابی کند. باورها تنها زمانی باید به‌روز شوند که تغییر آن‌ها توسط شواهد پشتیبانی شود. هنگامی که این قوانین اجرا شوند، مدل می‌تواند دانش تایید شده را انباشته کند و سیاست استدلالی خود را از طریق یادگیری از تجربیات گذشته بهبود بخشد.

این رویکرد با هوش مصنوعی به عنوان «روش علمی در مقیاس صنعتی» (Scientific method on steroids) برخورد می‌کند. این مسیر از Scaling ساده (افزایش اندازه مدل) برای بزرگ‌تر کردن «سیستم ۱» فاصله می‌گیرد؛ زیرا مقیاس‌پذیری تنها شهود را تیزتر می‌کند اما آن را متفکرتر یا تامل‌گرای‌تر نمی‌سازد. این رویکرد می‌تواند منجر به جهش‌هایی شود که مانند حل مسائل پیچیده ریاضی و رمزنگاری در بازه‌های زمانی کوتاه، دهه‌ها تلاش علمی را به چالش بکشد.

برای جامعه فنی، این موضوع معیار موفقیت را از «خروجی متقاعدکننده» به «استنتاج (Inference) قابل‌بازرسی» تغییر می‌دهد. هدف، سیستمی است که در آن نتایج از توالی شواهد، استنتاج و اصلاح باورها حاصل شود، نه یک داستان خوش‌آهنگ که بعد از رسیدن به جواب روایت می‌شود.

اگر می‌خواهیم هوش مصنوعی تغییرات اقلیمی را حل کند، مواد جدیدی کشف کند یا داروسازی را بهبود بخشد، نمی‌توانیم به مدل‌هایی تکیه کنیم که منطق خود را توهم (Hallucinate) می‌کنند. ما به سیستم‌هایی نیاز داریم که بتوانند موضعی را حفظ کنند، آینده‌های ممکن را بسنجند و حرکتی را انتخاب کنند که غریزه‌های مصنوعی احتمالاً آن را رد می‌کردند.

گام بعدی شما

  • در هنگام استفاده از مدل‌های استدلالی، از آن‌ها بخواهید فرضیات متناقض را لیست کنند تا میزان توهم در زنجیره تفکر شناسایی شود.
  • برای کارهای حساس، به جای تکیه بر خروجی مدل، از متدولوژی RAG برای اتصال مدل به منابع داده‌ای قابل‌اعتماد استفاده کنید.
  • تحولات مربوط به مدل‌های «جست‌وجو در زمان استنتاج» (Inference-time search) را دنبال کنید، زیرا این مسیر جایگزین Scaling ساده است.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دیدگاه اعتبار مدل‌های فعلی را در حوزه‌های YMYL (پول یا زندگی) به چالش می‌کشد. بر اساس تخصص گراپل در دیپ‌مایند، بدون تفکیک سیستم ۱ و ۲، هوش مصنوعی هرگز از سطح شبیه‌سازی به سطح استدلال واقعی نمی‌رسد.

تأثیر برای ایران

این بحث برای پژوهشگران یادگیری ماشین در ایران که روی مدل‌های استدلالی و ریاضی کار می‌کنند اهمیت دارد. پیاده‌سازی این معماری نیازمند محاسبات سنگین است که دسترسی محدود به GPUهای پیشرفته، مانعی برای توسعه بومی آن است.

·نگاه ما
تحریریه دات‌هوش

تمرکز صنعت بر Scaling Laws برای رسیدن به هوش عمومی، یک بن‌بست استدلالی ایجاد کرده است. جایگزینی «پیش‌بینی توکن» با «جست‌وجوی فضای حالت» (State-space search) به معنای بازگشت به ریشه‌های نمادین هوش مصنوعی اما با قدرت شبکه‌های عصبی است. این چرخش، مدل‌ها را از «نویسندگانی متقاعدکننده» به «پژوهشگرانی دقیق» تبدیل می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.