پرش به محتوای اصلی
پرش به محتوای مقاله

مثال‌های نقض در برابر اثبات‌های مفهومی در مدل‌های زبانی

·۲۱ مرداد ۱۴۰۵۲۵ دقیقه مطالعه
تحلیل
تصویر: نمودار مقایسه توانایی‌های ریاضیاتی مدل‌های زبانی بزرگ در مسائل مختلف
تصویر: نمودار مقایسه توانایی‌های ریاضیاتی مدل‌های زبانی بزرگ در مسائل مختلف
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تفکیک عملکرد مدل‌های زبانی در دو حوزه «مثال‌های نقض» و «اثبات‌های مفهومی»؛ مدل‌ها در اولی به دلیل سرعت جست‌وجو می‌درخشند اما در دومی به دلیل فقدان شهود (Intuition) محدود هستند.

تصور کنید ابزاری دارید که می‌تواند میلیون‌ها مسیر ریاضی را در ثانیه‌ای پیماید تا تنها یک مورد استثنا پیدا کند و کل یک نظریه را باطل کند. این دقیقاً همان نقطه‌ای است که مدل‌های زبانی بزرگ (LLM) در حال حاضر در ریاضیات پیشتازی می‌کنند.

به گزارش منابع فنی، مدل‌های OpenAI از نقش یک ماشین‌حساب ساده به یک «کاشف» تبدیل شده‌اند و ۱۰ مسئله پیچیده در ریاضیات و علوم کامپیوتر نظری را حل کرده‌اند. اما یک الگوی تکرار شونده در این موفقیت‌ها دیده می‌شود: علی‌رغم این پیشرفت‌های چشمگیر، مشهورترین مسائلی که توسط این مدل‌ها حل شده‌اند، تقریباً به‌طور انحصاری «مثال‌های نقض» (Counterexamples) هستند، نه اثبات‌های سنتی و مفهومی.

این تحول در حالی رخ می‌دهد که حوزه هوش مصنوعی از تعقیب بنچمارک‌های ساده به سمت حل حدس‌های بازی را که دهه‌ها مقاوم در برابر تلاش‌های انسانی بوده‌اند، حرکت می‌کند. همان‌طور که در تحلیل قبلی ما درباره‌ی اینکه چگونه بهینه‌سازی مبتنی بر LLM می‌تواند هزینه‌های نمونه‌سازی فیزیکی را به‌شدت کاهش دهد اشاره کردیم، اکنون شاهد اعمال همین بازدهی «برون‌فشر» (Brute-force) در قلمرو انتزاعی ریاضیات خالص هستیم. این روند با تلاش‌های گسترده‌تر برای تبدیل مدل‌های زبانی به ابزارهای پژوهشی همسو است، مشابه آنچه در بررسی نقش پرامپت‌نویسی در پژوهش‌های ریاضی رسمی مشاهده کردیم.

ماهیت این پیشرفت‌ها

طبق اعلام منابع داخلی در ۱۲ اوت ۲۰۲۶، OpenAI موفق به حل ۱۰ مسئله سطح بالا شده است. دو مورد از مهم‌ترین این دستاوردها عبارت‌اند از:

  • نخستین ساختار یک گروه غیرسوفیک (non-sofic group) که یکی از مسائل بنیادین در نظریه گروه‌ها است.
  • اثباتی مبنی بر اینکه عدد رمزی چندرنگی (multicolour Ramsey number) به‌صورت فوق‌نمایی رشد می‌کند.

R(3,3,...,3)

k

k

این نتایج خیره‌کننده است، اما به این معنا نیست که هوش مصنوعی در تمام ابعاد ریاضی از انسان پیشی گرفته است. اگر چنین بود، سرعت بالای AI تا کنون منجر به سیل عظیمی از نتایج در تمام زیرشاخه‌های ریاضی شده بود، اتفاقی که هنوز رخ نداده است.

مثال‌های نقض در برابر قضایا

تفاوت منطقی آشکاری میان یافتن یک مثال نقض و اثبات یک قضیه وجود دارد. مثال نقض در واقع یک «بیان وجودی» است؛ برای رد کردن گزاره «هر X دارای ویژگی Y است»، تنها کافی است یک مورد X پیدا شود که ویژگی Y را نداشته باشد.

N

n\geq N

n

N

N

البته هر بیان وجودی، مثال نقض نیست. برای نمونه، قضیه وینوگرادوف که می‌گوید هر عدد صحیح به‌اندازه کافی بزرگ، مجموع سه عدد اول است، از نظر منطقی یک بیان وجودی است اما چون چالش آن در تعمیم به تمام اعداد (کوانتیفیکیشن کلی) است و نه جست‌وجوی یک مورد خاص، یک «قضیه» محسوب می‌شود.

سبک ریاضیاتی مدل‌های زبانی

بر اساس تحلیل‌های منتشر شده در gowers.wordpress.com، مدل‌های زبانی دو مزیت اصلی دارند که رویکرد ریاضی آن‌ها را شکل می‌دهد:

۱. دانش دایره‌المعارفی: آن‌ها می‌توانند فوراً استدلال‌های نسبتاً استاندارد را از کل تاریخ ادبیات ریاضی بازیابی و اعمال کنند.
۲. سرعت محاسباتی: آن‌ها می‌توانند هزاران تلاش ناموفق را پیش از رسیدن به راه حل تحمل کنند.

این وضعیت منجر به یک سبک «احتمالاتی» در یافتن اثبات می‌شود. در حالی که یک ریاضی‌دان انسان برای یافتن یک استدلال مفهومی، غافلگیرکننده و عمیق در مسئله غرق می‌شود، یک مدل زبانی احتمالاً تعداد بی‌شماری از ایده‌ها را امتحان می‌کند — حتی اگر هیچ‌کدام از آن‌ها لزوماً نوآورانه نباشند — تا زمانی که یکی از آن‌ها به‌طور تصادفی درست از آب درآید.

استراتژی‌های جست‌وجوی AI

مدل‌های زبانی احتمالاً از چندین استراتژی خاص برای یافتن این مثال‌های نقض استفاده می‌کنند:

  • تست‌های آماده (Off-the-shelf): امتحان کردن مثال‌های استاندارد (مانند دیکتاتورها یا توابع توازن در تحلیل بولی) برای دیدن اینکه آیا حدس را رد می‌کنند یا خیر.
  • ساختارهای استاندارد: ساخت مثال‌های پیچیده از روی موارد پایه با استفاده از ضرب‌ها، خارج‌قسمت‌ها یا حدها.
  • روش‌های احتمالی: نشان دادن اینکه یک مثال تصادفی از یک توزیع خاص، احتمال بالایی دارد که ویژگی‌های مورد نیاز را داشته باشد.
  • اثبات‌های «فقط انجام بده» (Just-do-it): ساختن یک شیء به‌صورت استقرایی، تکه به تکه، برای ارضای ویژگی‌های بی‌شمار.

برای دستیابی به چنین دقت‌هایی در خروجی‌های فنی، استفاده از ساختارهای سخت‌گیرانه‌تر ضروری است؛ موضوعی که در تحلیل ما درباره زبان‌های تخصصی (DSL) برای کدنویسی قابل‌اعتماد به تفصیل بررسی شده است.

فقدان «شمّ» ریاضی

آنچه مدل‌های زبانی در حال حاضر فاقد آن هستند، چیزی است که ریاضی‌دانان به آن «شمّ» (Nose) می‌گویند؛ یعنی توانایی شهودی برای هرس کردن درخت جست‌وجو. یک متخصص انسانی حس می‌کند چه زمانی یک مسیر بی‌ثمر است و سریعاً آن را رها می‌کند. در مقابل، مدل‌های زبانی اغلب رویکردهایی را ارائه می‌دهند که در ابتدا امیدوارکننده به نظر می‌رسند اما در نهایت به بن‌بست می‌رسند.

این فقدان شهود احتمالاً به این دلیل است که داده‌های آموزشی شامل اثبات‌های «پاک‌سازی شده» هستند. نسخه‌های نهایی، تلاش‌های ناموفق، مسیرهای ذهنی کاذب و فرآیندهای فکری کاشفان اصلی را پنهان می‌کنند. در نتیجه، AI مقصد را می‌شناسد اما نقشه‌ی پیمایش بهینه در فضای جست‌وجو را نمی‌داند.

مسیر رسیدن به اکتشافات سطح انسانی

برای اینکه مدل‌های زبانی به اکتشافات واقعی در سطح انسان برسند، باید از رویکرد «امتحان کردن همه چیز» فراتر روند. این امر مستلزم ساختار پاداش جدیدی در زمان آموزش است که گشت‌وگذار در بن‌بست‌ها را جریمه و کشف تکنیک‌های واقعاً نوآورانه و غافلگیرکننده را پاداش دهد.

ما زمانی متوجه عبور از این مانع خواهیم شد که یک مدل زبانی اثباتی ارائه دهد که نه‌تنها درست، بلکه از نظر مفهومی زیبا و غیرمنتظره باشد؛ مشابه راه حل مسئله cap-set در سال ۲۰۱۶ که با استفاده از یک متد کاملاً جدید، مرزهای قبلی را جابه‌جا کرد و نتایج پیشین را به حاشیه راند.

این تغییر، هوش مصنوعی را از یک موتور جست‌وجوی سریع برای مثال‌های نقض، به یک شریک واقعی در نوآوری‌های مفهومی ریاضی تبدیل خواهد کرد.

گام بعدی شما

  • اگر از مدل‌های استدلالی برای حل مسائل فنی استفاده می‌کنید، نتایج را به عنوان «احتمالاتی» ببینید و برای تایید نهایی، به دنبال استدلال مفهومی بگردید.
  • بررسی کنید که آیا مسئله شما یک «مثال نقض» است یا یک «قضیه تعمیم‌یافته»؛ در مورد اول، مدل‌های زبانی ابزاری قدرتمندتر هستند.
  • منتظر به‌روزرسانی‌های مربوط به توابع پاداش (Reward Functions) در مدل‌های نسل بعد باشید که بر «نوآوری» تمرکز دارند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این یافته بر اساس تخصص در تحلیل مدل‌های استدلالی نشان می‌دهد که AI در حال حاضر برای ابطال نظریات (Disproving) بسیار کارآمدتر از اثبات آن‌هاست. این تغییر پارادایم، نقش AI را از یک جایگزین برای ریاضی‌دان به یک دستیار برای یافتن نقاط ضعف نظریات تبدیل می‌کند.

تأثیر برای ایران

این پیشرفت‌ها بیشتر برای پژوهشگران مدل‌های بنیادی و ریاضی‌دانان دانشگاهی در ایران اهمیت دارد تا بازار مصرف؛ چرا که ابزاری برای تسریع در پژوهش‌های نظری فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

برتری مدل‌ها در یافتن مثال‌های نقض نشان می‌دهد که AI فعلاً یک «جست‌وجوگر فوق‌سریع» است تا یک «متفکر». این شکاف بین توانایی محاسباتی و شهود مفهومی، احتمالاً به دلیل ماهیت داده‌های آموزشی است که فقط نتایج موفق را ثبت کرده‌اند و مسیرهای شکست را حذف کرده‌اند. برای رسیدن به خلاقیت ریاضی، مدل‌ها باید یاد بگیرند چگونه «اشتباه کنند» و از آن اشتباهات برای هرس کردن فضای جست‌وجو استفاده کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.