پرش به محتوای اصلی
پرش به محتوای مقاله

مدل داخلی OpenAI ۳۷۲ مسئلهٔ دشوار ریاضی و علوم کامپیوتر را حل کرد

·۱۵ مهر ۱۴۰۵۱۱ دقیقه مطالعه
نمودار: مدل زبانی بزرگ در حال تولید متنی درباره خودش، با حلقه بازخوردی بازگشتی.
نمودار: مدل زبانی بزرگ در حال تولید متنی درباره خودش، با حلقه بازخوردی بازگشتی.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تولید اثبات‌های ریاضی در مقیاس انبوه (۳۷۲ مورد) با استفاده از مدل‌های داخلی، بدون نیاز به سیستم‌های عامل‌محور گران‌قیمت و تنها با ۳ ساعت محاسبات برای هر مسئله.

تصور کنید مسئله‌ای که دهه‌هاست نخبگان ریاضی جهان روی آن متمرکز بوده‌اند، در عرض سه ساعت توسط یک ماشین حل شود. این دیگر یک سناریوی علمی-تخیلی نیست، بلکه واقعیت جدیدی است که OpenAI با انتشار ۳۷۲ اثبات ریاضی در ۶ اکتبر ۲۰۲۶ خلق کرد. این تخلیه عظیم داده‌ها شامل اثبات‌هایی برای برخی از گریزپای‌ترین حدس‌های این حوزه است و عملاً پیشرفت‌هایی را خودکار کرده است که پیش‌تر نیازمند کل دوران شغلی یک انسان برای دنبال کردن بود.

به نقل از مستندات منتشر شده، این انتشار گسترده بر اساس توصیه گروهی از مشاوران، از جمله ریاضیدانان برجسته‌ای چون تیموتی گاورز و ادوارد ویتن صورت گرفته است. برای دهه‌ها، مرز اکتشافات ریاضی با شهود انسانی و اثبات‌های دستی دقیق تعریف می‌شد. جامعه علمی بر این باور بود که مسائلی مانند «حدس بازی‌های منحصربه‌فرد» سال‌ها تلاش جمعی انسان‌ها را می‌طلبد. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی مدل‌های استدلالی اشاره کردیم، اکنون گلوگاه از «عمل اکتشاف» به «عمل درک انسانی» تغییر یافته است. این چالش دقیقاً با آنچه در بررسی نیاز به گسترش ظرفیت درک انسانی برای مواجهه با پیچیدگی‌های مدل‌های هوش مصنوعی اشاره کردیم، همسو است. در واقع، مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — حالا می‌تواند راه‌هایی را پیدا کند که ذهن انسان حتی تصورشان را نمی‌کرد.

حدس بازی‌های منحصربه‌فرد و فراتر از آن

یکی از مهم‌ترین دستاوردها، اثبات حدس بازی‌های منحصربه‌فرد (UGC) اثر سوبهاش خوت است. این نتیجه به این معناست که بسیاری از مسائل بهینه‌سازی، حتی زمانی که به دنبال تقریب‌هایی هستیم که کمی بهتر از نتایج ارائه شده توسط «آرام‌سازی برنامه‌ریزی نیمه‌معین» (semidefinite programming relaxation) باشند، از نوع NP-hard هستند؛ در حالی که این روش یکی از ابزارهای اصلی این حوزه است.

اگرچه این اثبات شامل یک گواه Lean برای تایید رسمی است، اما ریاضیدانان برای درک آن در تکاپو هستند. دانا موشکوویتز، نظریه‌پرداز پیچیدگی که تمام دوران شغلی خود را صرف تلاش برای این اثبات کرده بود، می‌گوید خواندن این متن شبیه به نوشته‌های کسی است که تحت تأثیر مواد توهم‌زا بوده است. او اشاره می‌کند که بدون کمک هوش مصنوعی، درک این مقاله تقریباً غیرممکن است؛ زیرا مدل از ارجاعات گیج‌کننده و نامرتبط استفاده کرده و تمایل دارد بدون توضیح دلیل استفاده از آن‌ها، صرفاً به کارهای قبلی اشاره کند، حتی در مواردی که نتایج «ناپذیری» (impossibility results) قبلی وجود داشته است.

منطق «بیگانه» در اثبات UGC

تحلیل موشکوویتز نشان می‌دهد که هوش مصنوعی مسیرهای سنتی انسانی را دنبال نکرده است. این مدل یک ساختار بازگشتی کاملاً جدید و عجیب برای کدی با تست نویز ابداع کرده است. او این روش را «دیوانگی‌های بیگانه» می‌نامد که نه کد بلند (long code) است و نه کد کوتاه (short code)، هرچند او گمان می‌کند که احتمالاً یک اثبات طبیعی‌تر با استفاده از «کد نیم‌فضا» (half space code) همچنان وجود داشته باشد.

علاوه بر این، مدل مستقیماً اثبات‌های بهینه برای سختی تقریب NP-hard برای کاربردهای اصلی UGC، به‌ویژه Max Cut و تمام CSPها را ارائه داده است، به‌طوری که اصلاً نیازی به عبور از خودِ UGC نبود. موشکوویتز برای فهم ادعاهای مربوط به کامل بودن (completeness) و صحت (soundness) گجت نویز، مجبور شد از مدل Astra استفاده کند تا تکه‌های پراکنده ادعاها در سراسر مقاله را کنار هم بچسباند.

کاتالوگی از پیشرفت‌های علمی

این انتشار OpenAI حوزه‌های گسترده‌ای از جمله نظریه اعداد، ترکیبات، هندسه جبری و تحلیل را پوشش می‌دهد. همچنین پیشرفت‌های جزئی در اکثر مسائل هزاره، به‌ویژه فرضیه ریمان، حدس هاج و حدس بیرچ-سوینرتون-دایر ثبت شده است.

نتایج کلیدی عبارتند از:

  • نظریه پیچیدگی: اثبات L=BPL که تایید می‌کند فضای لگاریتمی احتمالی و قطعی یکسان هستند. این موضوع یکی از بزرگ‌ترین حدس‌های حذف تصادفی‌سازی (derandomization) را، پیش از رسیدن به P=BPP، حل کرد. اگرچه حقیقت این موضوع هرگز مورد تردید جدی نبود، اما یک زیرجامعه کامل از پژوهشگران بر اثبات آن متمرکز شده بودند.
  • طراحی الگوریتم: شکستن سدی که از دهه ۱۹۶۰ پابرجا بود؛ دستیابی به تبدیل فوریه و ضرب اعداد صحیح در زمانی کمتر از O(n log n). زمان اجرای جدید تقریباً O(n log0.9999999999999 n) است (با کمی اختلاف در تعداد رقم‌های ۹).
  • رایانش کوانتومی:
    • حل مثبت مسئله سنتز واحد (Unitary Synthesis Problem) که توسط گرگ کوپربرگ و اسکات آرونسون در سال ۲۰۰۷ مطرح شده بود. این اثبات نشان می‌دهد برای هر تبدیل واحد n-کیوبیت U، یک اوراکل کلاسیک A وجود دارد به‌طوری که U را می‌توان در زمان چندجمله‌ای کوانتومی با دسترسی به A پیاده‌سازی کرد. این نتیجه دقیقاً برعکس انتظارات اکثر پژوهشگران بود و می‌تواند پیامدهایی برای مسئله محاسباتی رمزگشایی تابش هاوکینگ از یک سیاهچاله و سایر مسائل پیچیدگی کوانتومی داشته باشد، هرچند مقاله روشی کارآمد برای ساخت اوراکل A ارائه نمی‌دهد.
    • اثبات اینکه Parity در QAC0 نیست، مسئله‌ای که از سال ۱۹۹۹ یکی از سوالات اصلی نظریه پیچیدگی کوانتومی بود و بسیاری از همکاران در حال نزدیک شدن به پاسخ آن بودند.
    • ایجاد فاصله تقریباً توان ۴ بین پیچیدگی پرس‌وجوی تصادفی و کوانتومی برای توابع بولی کل. این موضوع داستانی را می‌بندد که از سال ۱۹۹۸ آغاز شد، زمانی که توان جداکننده بهینه تنها بین ۲ و ۶ شناخته می‌شد و در سال‌های اخیر بین ۳ و ۴ تخمین زده می‌شد.
  • نظریه گراف و ماتریس‌ها:
    • الگوریتم تصادفی با زمان تقریباً خطی برای تطبیق حداکثری (maximum matching) در گراف‌های عمومی.
    • ضرب ماتریس در زمان O(n9/4) با استفاده از یک توان گویا و رویکردی کاملاً متفاوت از روش‌های O(n2.373).
    • الگوریتم چندجمله‌ای تصادفی برای شمارش تقریبی تعداد تطبیق‌های کامل در یک گراف عمومی، و همچنین الگوریتم تصادفی با زمان تقریباً خطی برای یافتن تطبیق حداکثری در چنین گرافی.
  • سایر کران‌های ریاضی:
    • ایجاد فاصله فوق‌درجه‌دوم (superquadratic) بین حساسیت (sensitivity) و حساسیت بلوکی (block sensitivity).
    • ارائه قانون ناحیه (area law) برای هامیلتونی‌های شکاف‌دار دوبعدی، که یکی از مسائل باز اصلی در پیچیدگی هامیلتونی را حل می‌کند.
    • ارائه کران پایین Ω(n3) برای پیچیدگی دترمینانیِ پرمننت (permanent)، که کران درجه‌دوم قبلی را بهبود بخشید.
  • محاسب‌پذیری: اثبات غیرمحاسب‌پذیر بودن حل معادلات چندجمله‌ای روی اعداد گویا، که احتمالاً بزرگ‌ترین مسئله باز در نظریه محاسب‌پذیری بود. این نتیجه در ادامه اثبات دهه ۱۹۷۰ است که نشان داد حل معادلات دیوفانتی (معادلات چندجمله‌ای روی اعداد صحیح) غیرمحاسب‌پذیر است و پاسخی منفی به مسئله دهم هیلبرت داد.

Email, RSS

سازوکار اکتشاف

طبق گزارش اسکات آرونسون در ۷ اکتبر ۲۰۲۶، این نتایج توسط یک سامانه عظیم عامل‌محور با ۱۰,۰۰۰ عامل که میلیون‌ها دلار هزینه محاسباتی می‌سوزاند (مانند سیستمی که برای ساخت انفجار زمان-محدود برای معادلات ناویر-استوکس استفاده شد) تولید نشده‌اند. در عوض، این دستاوردها حاصل آخرین مدل داخلی OpenAI هستند که احتمالاً به‌زودی، بسته به توصیه‌های هیئت ایمنی، در دسترس کاربران پولی ChatGPT قرار می‌گیرد.

به‌طور متوسط، مدل برای هر مسئله حدود ۳ ساعت محاسبات (Compute) در سطح GPT-Pro مصرف کرده است. نرخ موفقیت حدود ۵٪ بود؛ یعنی مدل از حدود ۸۰۰۰ مسئله دشوار و قدیمی، ۵٪ را تنها با یک تلاش سه ساعته حل کرد. این یعنی هوش مصنوعی می‌تواند ۵٪ از سخت‌ترین مسائلی را که جوامع انسانی سال‌ها روی آن‌ها وقت گذاشته‌اند، در یک جلسه سه ساعته حل کند.

تقابل دو رویکرد: OpenAI در برابر Anthropic

در حالی که OpenAI اثبات‌های خام و هضم‌نشده را منتشر کرد، Anthropic رویکرد متفاوتی در مورد مسائل 3SUM و کوتاه‌ترین مسیرهای تمام‌جفت (All-Pairs Shortest Paths) داشت. دوشنبه شب، ویرجینیا ویلیامز و جاش آلمان پیش‌چاپ arXiv را منتشر کردند که 3SUM را در زمان O(n1.9992) و کوتاه‌ترین مسیرهای تمام‌جفت را در زمان O(n2.9995) حل می‌کند و حدس‌های نیم‌قرنی مبنی بر n2-o(1) و n3-o(1) بودن آن‌ها را رد می‌کند.

در این مورد، یک مدل Anthropic ایده کلیدی را ارائه داد. اما به‌جای انتشار خام راه حل، Anthropic به ویلیامز و آلمان فرصت داد تا در ازای دریافت پاداش، نسخه‌ای هضم‌شده و قابل‌فهم را بنویسند و اعلام کنند.

این وضعیت دو مسیر برای علمِ مبتنی بر هوش مصنوعی ایجاد می‌کند:

  • مدل OpenAI: ایجاد یک رقابت آشفته، رقابتی و احتمالاً ناسپاس میان انسان‌ها برای رمزگشایی و توضیح اثبات‌های به‌هم‌ریخته ماشین. این کار می‌تواند خسته‌کننده باشد و اعتبار کمی برای انسان داشته باشد.
  • مدل Anthropic: تبدیل یک شرکت خصوصی به دروازه‌بان (Gatekeeper) که تصمیم می‌گیرد کدام ریاضیدانان به‌عنوان سفیران هوش مصنوعی عمل کنند.

هزینه انسانی «ریاضی‌کالپس»

بسیاری از پژوهشگران اکنون احساس می‌کنند مانند «شکارچی-گردآورندگانی» هستند که کنار یک ریزورت لوکس با هلیکوپتر و استخر گرم ایستاده‌اند. توانایی تلپورت به قله یک کوه ریاضی از طریق هوش مصنوعی، لذت و سختی صعود را از بین برده است. همان‌طور که جوردانا سپله‌ویتز در مجله Quanta اشاره کرد، در مسیر صعود است که انسان‌ها با ارتفاع سازگار می‌شوند، ابزاری برای عبور از صخره‌ها اختراع می‌کنند و داروهای نجات‌بخش را در دره‌های پنهان می‌یابند؛ اما حالا ما در تاریکی روی قله‌ای نشسته‌ایم که سازنده ماشین به ما گفته است ماشین بهتر از هر انسانی در جنگل‌ها جستجو می‌کند.

با این حال، برخی سدهای بنیادین باقی مانده‌اند. مدل در حل P ≠ NP، P=BPP یا NEXP⊄P/poly شکست خورد، که نشان می‌دهد سخت‌ترین مسائل علوم کامپیوتر هنوز در برابر توانایی‌های فعلی مقاوم هستند و این یعنی بزرگ‌ترین مسائل باز واقعاً بسیار دشوارند.

این تغییر، نقش ریاضیدان را از «کاشف اصلی» به «کیوریتور و مفسر» منطق بیگانه تبدیل می‌کند. چالش فعلی حفظ جامعه‌ای است که برای ماجراجویی قهرمانانه در اکتشاف ارزش قائل است، در حالی که ماشین می‌تواند جواب را در سه ساعت پیدا کند. برخی منتقدان ممکن است این نتایج را «زباله‌های هوش مصنوعی» (AI slop) یا «معماهای مسابقاتی تجملاتی» بنامند، اما برای کسانی که در این حوزه هستند، «ریاضی‌کالپس» یک واقعیت تجربی است.

پیامدهای فکری گسترده‌تر

این اتفاق حتی به بحث‌های فلسفی گسترده‌تر AI کشیده شده است. اسکات الکساندر اخیراً در نامه‌ای باز به استیون پینکر، او را به یک دوئل واقعی با تفنگ به چالش کشیده است. الکساندر استدلال می‌کند که پینکر باید یک اپیستمولوژی (معرفت‌شناسی) «پینکری‌تر» را در مورد ریسک‌های هوش مصنوعی بپذیرد. این تنش نشان‌دهنده برخورد میان قهرمانان فکری سنتی و واقعیت جدید توانمندی‌های ماشین است.

برای نسل جدید، دنیا به‌سرعت در حال تغییر است. همان‌طور که یک کودک ۹ ساله اشاره کرد، اگر مدلی بتواند این مسائل ریاضی را حل کند، شاید انتشار آن ایمن نباشد. این نگرانی‌ها در حالی مطرح می‌شود که گزارش‌های اخیر نشان می‌دهد اکثریت نوجوانان آمریکایی پیش از این هوش مصنوعی زاینده را در زندگی شخصی خود جای داده‌اند و با این ابزارها رشد می‌کنند. شاید درس‌های عملی و بدون حاشیه فیلم‌هایی مثل ترمیناتور ۲، راهنمای بهتری برای دنیایی باشد که در آن حریم خصوصی خلاقیت انسانی تحت فشار دائمی ماشین‌هاست.

گام بعدی شما

  • اگر پژوهشگر هستید، ابزارهای تایید رسمی مانند Lean را یاد بگیرید تا بتوانید اثبات‌های ماشین را اعتبارسنجی کنید.
  • برای درک مفاهیم پیچیده ریاضی، از مدل‌های استدلالی برای «ترجمه» اثبات‌های بیگانه به زبان انسانی استفاده کنید.
  • روی مسائلی تمرکز کنید که مدل‌ها در آن‌ها شکست خورده‌اند (مانند P vs NP) تا مرزهای واقعی هوش انسانی را شناسایی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار ریاضیدانان تراز اول جهان، ثابت کرد که هوش مصنوعی زاینده می‌تواند در حوزه‌هایی که نیاز به استدلال سخت و دقیق دارند، از انسان پیشی بگیرد. این اتفاق مدل اقتصادی و آموزشی رشته‌های ریاضی و علوم کامپیوتر را به‌طور بنیادین تغییر می‌دهد.

تأثیر برای ایران

این تحول بیشتر برای پژوهشگران مدل‌های بنیادی و دانشجویان ریاضیات در ایران اهمیت دارد تا بازار مصرف؛ چرا که ابزارهای تایید رسمی مانند Lean به‌صورت متن‌باز در دسترس هستند و می‌توان از آن‌ها برای بررسی این اثبات‌ها استفاده کرد.

·نگاه ما
تحریریه دات‌هوش

این اتفاق نشان می‌دهد که ما از عصر «هوش مصنوعی به‌عنوان دستیار» به عصر «هوش مصنوعی به‌عنوان پیشرو در اکتشاف» وارد شده‌ایم. نکته کلیدی این است که مدل‌های جدید دیگر فقط الگوهای موجود را بازتولید نمی‌کنند، بلکه منطق‌های کاملاً جدیدی (Alien Logic) خلق می‌کنند که برای انسان غیرقابل‌فهم است. این شکاف در درک، ممکن است منجر به بحرانی در اعتبار علمی شود، جایی که ما نتایجی را می‌پذیریم که نمی‌توانیم آن‌ها را به‌طور شهودی درک کنیم.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.