پرش به محتوای اصلی
پرش به محتوای مقاله

GPT-5.6 Sol Ultra معمای ۵۰ ساله ریاضی را در یک ساعت حل کرد

·۲۰ تیر ۱۴۰۵۴ دقیقه مطالعه
هوش مصنوعی GPT-5.6 Sol Ultra مسئله ریاضی ۵۰ ساله را در کمتر از یک ساعت حل کرد.
هوش مصنوعی GPT-5.6 Sol Ultra مسئله ریاضی ۵۰ ساله را در کمتر از یک ساعت حل کرد.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

به‌کارگیری یک سیستم ۶۴-عاملی تخاصمی برای اجبار مدل به پذیرش وجود پاسخ و حذف هرگونه خروجی ناقص؛ این یک چرخش از «تولید متن» به «تولید اثبات صلب» است.

تصور کنید مسئله‌ای که ۵۰ سال است نخ‌جمعی‌ترین ذهن‌های ریاضی دنیا را به چالش کشیده، ناگهان در کمتر از ۶۰ دقیقه توسط یک ماشین حل شود. این اتفاق نه با یک کشف نبوغ‌آمیز، بلکه با «پشت‌کار» دیجیتالی رخ داد.

GPT-5.6 Sol Ultra توانست ثابت کند که استمرار در محاسبات می‌تواند بر محدودیت‌های ذهنی انسان غلبه کند. این موفقیت در حالی رخ می‌دهد که OpenAI همچنان در حال جابه‌جا کردن مرزهای استدلال است، هرچند این شرکت با نظارت‌های مستمری درباره روش‌های عملیاتی خود، از جمله نبردهای حقوقی پیشین بر سر اسرار تجاری سخت‌افزاری، دست‌وپنج نرم می‌کند. این چالش‌های نظارتی در حالی صورت می‌گیرد که دولت آمریکا حتی بر دسترسی کاربران به نسخه‌های جدید این مدل‌ها نظارت دقیقی دارد تا امنیت ملی را تضمین کند.

زمینه و بستر حدس ریاضی

این مسئله به یک پرسش بنیادی در نظریه گراف می‌پردازد: آیا ممکن است در هر شبکه‌ای از نقاط (رأس‌ها) و یال‌ها، مجموعه‌ای از چرخه‌ها یافت شود که هر یال را دقیقاً دو بار طی کند؟ این معما که به‌طور مستقل توسط چندین ریاضی‌دان در دهه ۱۹۷۰ میلادی مطرح شد، تا پیش از این تنها برای موارد خاص حل شده بود و هیچ اثبات کلی و پذیرفته‌شده‌ای برای آن وجود نداشت.

حدس‌های نظریه گراف اغلب نه به‌دلیل نیاز به تئوری‌های جدید، بلکه به‌دلیل نیاز به جست‌وجوی جامع در مسیرهایی که با شهود انسانی در تضاد هستند، باز می‌مانند. برای دهه‌ها، انسان‌ها به این مسئله خاص نزدیک شدند اما پس از شکست روش‌های بدیهی، از آن عقب‌نشینی کردند. در حالی که کارشناسان معتقدند این راه حل می‌توانست در دهه ۱۹۸۰ میلادی پیدا شود، نبودِ احساس دلسردگی در هوش مصنوعی به آن اجازه داد تا از طریق تغییرات تکرار شونده، به یک اثبات معتبر دست یابد.

به نقل از گزارش ۱۱ ژوئیه ۲۰۲۶ در وب‌سایت the-decoder.com، این اثبات به‌طور کامل توسط مدل تولید و مقاله آن توسط GPT-5.6 Sol نوشته شده است. توماس بلوم، ریاضی‌دان دانشگاه منچستر، این نتیجه را «کوتاه» و «ابتدایی» توصیف کرد، اما اشاره کرد که مدل به‌طور هوشمندانه‌ای ابزارهای موجود را ترکیب کرده است.

بلوم معتقد است کلید موفقیت در یک چرخش کوچک و غیرمنتظره بوده است. او توضیح می‌دهد انسانی احتمالاً ابتدا «برچسب‌گذاری طبیعی» را امتحان می‌کند، سپس «جبر خطی» را بررسی می‌کند و وقتی این روش‌ها شکست می‌خورند، شانه بالا می‌اندازد و مسیر را رها می‌کند؛ در حالی که هوش مصنوعی صرفاً به امتحان کردن تغییرات مختلف ادامه می‌دهد. این تکیه بر محاسبات ماتریسی و جبر خطی، در واقع همان زیربنایی است که مکانیسم‌های توجه در مدل‌های زبانی مدرن بر پایه آن شکل گرفته‌اند و قدرت تحلیل داده‌های حجیم را فراهم می‌کنند.

جزئیات اجرای فنی

برای تضمین اعتبار این اثبات، OpenAI از یک گردشِ کار عامل‌محور (Agentic) بسیار ساختاریافته — شبیه به تیمی از بازرسان سخت‌گیر که هر مرحله از کار را به‌شدت بازجویی می‌کنند — استفاده کرد:

  • مهندسی پرامپت: انسانی پرامپتی طراحی کرد که مدل را از جست‌وجوی اینترنتی یا ادعای «حل‌نشده بودن مسئله» منع می‌کرد. این پرامپت مدل را مجبور کرد فرض کند که اثباتی وجود دارد و بدین ترتیب، محتمل‌ترین پاسخ صادقانه (که حدس همچنان باز است) را مسدود کرد.
  • تأیید صلب: این چارچوب هرگونه نتایج ناقص، تقلیل مسئله به حدس‌های اثبات‌نشده دیگر یا خلاصه‌ای از پژوهش‌های پیشین را رد می‌کرد. مدل تا زمانی که یک اثبات کامل از یک آزمون تخاصمی عبور نمی‌کرد، اجازه پاسخ دادن نداشت.
  • بودجه محاسباتی: مدل دستور داشت دست‌کم ۸ ساعت روی مسئله فکر کند و محاسبات را انجام دهد، هرچند در نهایت در ساعت اول به جواب رسید.
  • تأیید تخاصمی: ۶۴ عامل (Agent) مجزا به کار گرفته شدند. اکثر آن‌ها برای تشویق تفکر مستقل، از پیشرفت‌های نویدبخش سایر عوامل بی‌خبر نگه داشته شدند، در حالی که گروهی دیگر به‌عنوان بازرسان تخاصمی عمل می‌کردند. این عوامل به‌دنبال خطاهای رایج می‌گشتند؛ مثلاً مسیرهای بسته‌ای که به‌اشتباه به عنوان چرخه شناسایی شده‌اند یا تقلیل‌هایی که به‌طور اتفاقی پل‌های جدیدی در گراف ایجاد می‌کنند.

توماس بلوم استدلال می‌کند که مدل احتمالاً ایده‌ها را از مقاله‌ای متعلق به سال ۱۹۸۳ میلادی توسط «برموند، جکسون و یگر» استخراج کرده است. او OpenAI را به‌دلیل عدم ارجاع به این اثر قدیمی نقد کرد و گفت هر کسی که مقاله را بخواند ممکن است تصور کند هوش مصنوعی استراتژی را خودش اختراع کرده است. بلوم معتقد است این یک مشکل رایج در مقالات تولید شده توسط هوش مصنوعی است: استفاده از استراتژی‌های ادبیات علمی بدون ذکر منبع مناسب. او تردید دارد که هوش مصنوعی کاملاً تنها عمل کرده باشد، چرا که غریزه اول این مدل‌ها معمولاً جست‌وجو و مطالعه تمام مقالات مرتبط با یک مسئله است.

این نتیجه نشان‌دهنده تغییری در اکتشافات علمی است. بلوم این مورد را با «حدس فاصله واحد» مقایسه می‌کند که اخیراً توسط OpenAI حل شد. هر دو مسئله بزرگ بودند که در نهایت ساده‌تر از حد انتظار به نظر رسیدند و نیازی به تئوری‌های بزرگ و جدید نداشتند.

ما اکنون وارد عصر مسائل «محدود به صبر» می‌شویم؛ مسائلی که با تئوری‌های شناخته‌شده قابل حل هستند اما نیاز به آزمون و خطای عظیم دارند. در این دنیای جدید، هوش مصنوعی از رویکردهای شکست‌خورده جبر خطی خسته یا ناامید نمی‌شود، بلکه صرفاً جهت خود را تغییر می‌دهد. برتری رقابتی از «چه کسی بینش بهتری دارد» به «چه کسی چارچوب تأیید سخت‌گیرانه‌تری دارد» تغییر می‌کند.

ارزش واقعی اکنون در مهندسی پرامپت و معماری عامل‌های تخاصمی است که از توهم (Hallucination) جلوگیری می‌کند. بلوم اشاره می‌کند در حالی که شرکت‌های بزرگ هوش مصنوعی با صرف منابع عظیم، آنچه را که «همواره در دسترس ما بود» آشکار می‌کنند، اما این احتمالاً تنها بخش کوچکی از مسائل باز را شامل می‌شود.

باید منتظر داوری تخصصی (Peer Review) جامعه علمی برای این اثبات بود. آزمون واقعی این خواهد بود که آیا GPT-5.6 Sol Ultra می‌تواند حدس‌هایی را حل کند که واقعاً نیازمند اختراع اصول ریاضی جدید هستند یا خیر.

گام بعدی شما

  • اگر پژوهشگر هستید، روی طراحی «سیستم‌های تأییدی تخاصمی» به‌جای تکیه بر خروجی مستقیم مدل تمرکز کنید.
  • بررسی کنید که آیا مسائل پیچیده کاری شما واقعاً نیاز به خلاقیت دارند یا فقط «صبر محاسباتی» بالایی می‌طلبند.
  • برای جلوگیری از سرقت ادبی دیجیتال، خروجی‌های مدل‌های استدلالی را با ابزارهای تحلیل منابع تطبیق دهید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار نتایج ریاضی، نشان می‌دهد که مدل‌های استدلالی می‌توانند در حوزه‌های سخت علم، نقش «شتاب‌دهنده» ایفا کنند. این موضوع تخصص را از یافتن جواب به طراحی سیستم‌های بازبینی و تأیید منتقل می‌کند.

تأثیر برای ایران

این پیشرفت برای پژوهشگران دانشگاهی ایران که با محدودیت منابع محاسباتی روبرو هستند، فرصتی است تا بر استفاده از مدل‌های استدلالی برای بررسی فرضیات ریاضی تمرکز کنند.

·نگاه ما
تحریریه دات‌هوش

موفقیت GPT-5.6 در حل این مسئله، نقطه پایان عصر «شهود ریاضی» و آغاز عصر «جست‌وجوی برق‌آسا» است. این اتفاق ثابت می‌کند بسیاری از گره‌های علمی نه به‌دلیل پیچیدگی تئوریک، بلکه به‌دلیل خستگی ذهنی انسان باز مانده‌اند. در واقع، مدل‌های جدید به‌جای کشف حقیقت، در حال «پاک‌سازی» تاریخچه خطاهای انسانی هستند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.