اگر تصور میکنید چتباتها واقعاً فکر میکنند، باید بدانید که آنها تنها در حال انجام یک بازی سریع با احتمالات هستند. مدلهای زبانی بزرگ (LLM) در واقع استدلال نمیکنند، بلکه در حال انجام یک فرآیند تکمیل الگوی سریع هستند.
ثور گراپل (Thore Graepel)، عضو سابق تیم اصلی آلفاگوی (AlphaGo) در گوگل دیپمایند (Google DeepMind) و رئیس فعلی یادگیری ماشین در کالج دانشگاهی لندن، استدلال میکند که صنعت هوش مصنوعی، «روانی در بیان» (Linguistic Fluency) را با «توانایی تفکر و تامل» (Ability to Deliberate) اشتباه گرفته است.
این تمایز در حوزههایی که ریسک بالایی دارند، مانند پزشکی و مهندسی، حیاتی است. در حالی که ما پیش از این بررسی کردیم که ابزارهایی مانند Sether چگونه حریم خصوصی دادهها را پیش از ارسال درخواست به LLMها مدیریت میکنند، مسئلهی عمیقتر این است که آیا میتوان به مدلهای زیربنایی اعتماد کرد تا به دلایل درست، به نتایج درست برسند؟
زمینه و بستر هوش ماشینی
برای درک این شکاف، گراپل به مسابقهی مارس ۲۰۱۶ در سئول بین آلفاگو و لی سدول، یکی از برترین بازیکنان حرفهای تاریخ بازی گو، اشاره میکند. در بازی دوم، آلفاگو «حرکت ۳۷» را اجرا کرد؛ انتخابی چنان غیرمتعارف و عجیب که تحلیلگران انسانی در ابتدا آن را یک خطای برنامهنویسی یا یک نقص فنی دانستند.
لی سدول بعدها در اظهاراتی اشاره کرد که در ابتدا فکر میکرد آلفاگو صرفاً ماشینی است که بر اساس محاسبات احتمالی عمل میکند، اما حرکت ۳۷ نظر او را تغییر داد و او را به این نتیجه رساند که آلفاگو دارای نوعی «خلاقیت» است. در نهایت، آلفاگو با نتیجه ۴ بر ۱ بر این قهرمان پیروز شد.
این پیروزی از نظر بنیادین با شکست گری کاسپاروف در برابر دیپبلو در سال ۱۹۹۷ متفاوت بود. دیپبلو بر قوانین سختافزاری و قواعد کدنویسی شده توسط انسان تکیه داشت؛ این سیستم ۲۰۰ میلیون وضعیت را در ثانیه ارزیابی میکرد و شش تا هشت حرکت آینده را پیشبینی مینمود. اما بازی گو به مراتب پیچیدهتر است؛ به گونهای که محاسبه حتی بخش کوچکی از نتایج ممکن آن، میلیاردها سال زمان از یک ابرکامپیوتر را میطلبید. برای پیروزی، آلفاگو باید میتوانست در یک نگاه تشخیص دهد چه کسی پیش است و حرکاتی را ابداع کند که هیچ انسانی هرگز به فکر اجرای آنها نرسیده بود.
معماری آلفاگو
آلفاگو با استفاده از دو سیستم مجزا عمل میکرد که بازتابی از شناخت انسانی بود؛ به طور مشخص، این معماری بر اساس تئوری علوم رفتاری دانیل کانمن درباره «سیستم ۱» (سریع و غریزی) و «سیستم ۲» (کند و متفکر) طراحی شده بود:
- شبکه سیاست (Policy Network - سیستم ۱): این بخش به عنوان ضلع «شهودی» عمل میکرد. این شبکه آموزش دیده بود تا حدس بزند یک انسان خبره چه حرکتی را انجام میدهد. از نظر این شبکه، حرکت ۳۷ هیچ ویژگی خاصی نداشت و احتمالی در حدود یک در ۱۰,۰۰۰ داشت که یک بازیکن خبره انسانی چنین حرکتی را انجام دهد.
- مکانیزم جستوجو (Search Machinery - سیستم ۲): این موتور استدلالی و متفکر بود. این سیستم به طور صریح یک درخت بازی با هزاران شاخه میساخت که هر شاخه نشاندهنده یک آینده احتمالی متفاوت بود. این موتور پیامدهای آتی حرکات پیشنهادی را میسنجید و در نهایت، شهود سیستم ۱ را کنار زد تا حرکت ۳۷ را انتخاب کند.

همانطور که در شناخت انسانی رخ میدهد، در آلفاگو نیز هیچکدام از این دو بخش بهتنهایی کار نمیکردند. شهود بهتنهایی حرکت ۳۷ را رد میکرد و جستوجوی خام (Brute-force) در میان تعداد نجومی حرکات ممکن غرق میشد و نمیتوانست آنها را غربال کند.
چرا LLMها در آزمون استدلال شکست میخورند؟
طبق تحلیل گراپل، چتباتهای امروزی تقریباً بهطور کامل در حالت «سیستم ۱» عمل میکنند. یک مدل زبانی بزرگ صرفاً توکن (Token) بعدی را بارها و بارها پیشبینی میکند. این فرآیند در واقع یک تکمیل الگوی تداعیگرایانه و سریع در میان موضوعاتی است که انسانها درباره آنها نوشتهاند.
حتی با استفاده از پردازش «زنجیره تفکر» (Chain of Thought یا CoT) — که در آن مدلها گامهای میانی را برای تجزیه یک مسئله تولید میکنند — باز هم آنها فاقد یک مکانیزم استدلالی مجزا هستند. استدلال میانی همچنان توسط همان فرآیند پیشبینی توکن بعدی تولید میشود و تنها پیش از آنکه مدل به پاسخ نهایی متعهد شود، برای مدت طولانیتری تکرار میگردد. اگرچه این روش نتایج را در کدنویسی و ریاضیات بهبود بخشیده است، اما استدلال واقعی نیست. این تضاد میان تواناییهای محاسباتی و استدلال عمیق، یادآور بررسیهایی است که نشان میدهد متخصصان پیشرفتهای AI در حوزههای دیجیتال را سریعتر از تعاملات فیزیکی تخمین زدهاند.
گراپل سه نقص بنیادی در استدلال LLMهای فعلی شناسایی کرده است:
- فقدان وضعیت معرفتی (Lack of Epistemic State): مدلها هیچ وضعیت معرفتی صریح، پایدار یا قابلبازرسی ندارند. هیچ دفتر کل باز وجود ندارد که فرضیات در حال بررسی، میزان اطمینان به توضیحات مختلف، شواهدی که در حال سنجش هستند یا پرسشهای حلنشدهای که در حافظه نگه داشته شدهاند را نمایش دهد.
- درهمتنیدگی دانش (Interwoven Knowledge): هیچ تفکیک پاکی بین «آنچه سیستم میداند» و «چگونه آن دانش را دستکاری میکند» وجود ندارد. دانش و استدلال بهطور جداییناپذیری در وزنهای شبکه عصبی درهمتنیده شدهاند، به این معنی که هیچ مجموعه مستقل و صریحی از باورها وجود ندارد.
- توجیه پسینی (Post-hoc Justification): پژوهشها نشان میدهد که باتها اغلب زنجیرههای تفکر خود را «بعد از وقوع» ابداع میکنند. آنها ممکن است از یک مسیر به پاسخ برسند، اما مسیر دیگری را به کاربر گزارش کنند تا منطقی به نظر برسد.
این یک شکست بحرانی برای کاربردهای حساس است. در تشخیص و درمان پزشکی، داشتن نتیجه درست کافی نیست؛ ما باید بتوانیم دقیقاً شناسایی کنیم که آیا یک اشتباه ناشی از استدلال غلط بوده، یا شواهد نامعتبر و یا مفروضات نادرست.
مسیری نو برای هوش ماشینی
گراپل پیشنهاد میکند برای اینکه هوش مصنوعی در اکتشافات علمی مفید باشد، باید یک «وضعیت معرفتی» صریح، مشابه درخت بازی آلفاگو، حفظ کند. در آلفاگو، درخت بازی شامل تمام تغییرات بررسی شده و آیندههای ممکن است و هر وضعیت توسط قضاوتهای شبکههای عصبی یادداشتبرداری میشود. با پیشرفت استدلال، این درخت بهروزرسانی و ترکیب میشود تا تصمیمی گرفته شود.
در این چارچوب پیشنهادی، استدلال به عنوان توالی از حرکاتی تعریف میشود که وضعیت معرفتی را تغییر میدهد تا دانش پیش برود و عدم قطعیت کاهش یابد. این فرآیند شامل موارد زیر است:
- استنتاج پیامدها و خرد کردن مسائل پیچیده به اجزای کوچکتر.
- تصمیمگیری درباره اینکه کدام پرسش خاص باید پرسیده شود، کدام محاسبه باید انجام شود یا کدام آزمایش در گام بعدی اجرا گردد.
- استفاده از LLMها برای پیشنهاد روشهای مقابله با یک مسئله بر اساس منابع موجود.
- تعامل با ابزارها از طریق APIها یا کدنویسی برای ارزیابی اینکه آیا یک ادعا توسط شواهد پشتیبانی میشود یا خیر.
برای تضمین صداقت، بخشی مستقل از سیستم باید هر حرکت را بر اساس میزان کاهش واقعی عدم قطعیت ارزیابی کند. باورها تنها زمانی باید بهروز شوند که تغییر آنها توسط شواهد پشتیبانی شود. هنگامی که این قوانین اجرا شوند، مدل میتواند دانش تایید شده را انباشته کند و سیاست استدلالی خود را از طریق یادگیری از تجربیات گذشته بهبود بخشد.
این رویکرد با هوش مصنوعی به عنوان «روش علمی در مقیاس صنعتی» (Scientific method on steroids) برخورد میکند. این مسیر از Scaling ساده (افزایش اندازه مدل) برای بزرگتر کردن «سیستم ۱» فاصله میگیرد؛ زیرا مقیاسپذیری تنها شهود را تیزتر میکند اما آن را متفکرتر یا تاملگرایتر نمیسازد. این رویکرد میتواند منجر به جهشهایی شود که مانند حل مسائل پیچیده ریاضی و رمزنگاری در بازههای زمانی کوتاه، دههها تلاش علمی را به چالش بکشد.
برای جامعه فنی، این موضوع معیار موفقیت را از «خروجی متقاعدکننده» به «استنتاج (Inference) قابلبازرسی» تغییر میدهد. هدف، سیستمی است که در آن نتایج از توالی شواهد، استنتاج و اصلاح باورها حاصل شود، نه یک داستان خوشآهنگ که بعد از رسیدن به جواب روایت میشود.
اگر میخواهیم هوش مصنوعی تغییرات اقلیمی را حل کند، مواد جدیدی کشف کند یا داروسازی را بهبود بخشد، نمیتوانیم به مدلهایی تکیه کنیم که منطق خود را توهم (Hallucinate) میکنند. ما به سیستمهایی نیاز داریم که بتوانند موضعی را حفظ کنند، آیندههای ممکن را بسنجند و حرکتی را انتخاب کنند که غریزههای مصنوعی احتمالاً آن را رد میکردند.
گام بعدی شما
- در هنگام استفاده از مدلهای استدلالی، از آنها بخواهید فرضیات متناقض را لیست کنند تا میزان توهم در زنجیره تفکر شناسایی شود.
- برای کارهای حساس، به جای تکیه بر خروجی مدل، از متدولوژی RAG برای اتصال مدل به منابع دادهای قابلاعتماد استفاده کنید.
- تحولات مربوط به مدلهای «جستوجو در زمان استنتاج» (Inference-time search) را دنبال کنید، زیرا این مسیر جایگزین Scaling ساده است.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو