پرش به محتوای اصلی
پرش به محتوای مقاله

درون استراتژی OpenAI؛ اولویت دادن به ایمنی بر بهینه‌سازی ریاضیات

·۱۹ شهریور ۱۴۰۵۳ دقیقه مطالعه
آسترا-۶ ریاضیدانان را نفس‌گیری داد؛ اوپن‌ای‌ای: عمدی بود.
آسترا-۶ ریاضیدانان را نفس‌گیری داد؛ اوپن‌ای‌ای: عمدی بود.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تأیید رسمی این موضوع که برتری در ریاضیات می‌تواند محصول جانبی مقیاس‌بندی کلی باشد، نه نتیجه تنظیم دقیق (Fine-tuning) تخصصی.

تصور کنید ابزاری بسازید که بدون اینکه برای حل ریاضی آموزش دیده باشد، سخت‌ترین مسائل این رشته را حل کند. این دقیقاً همان اتفاقی است که اکنون با GPT-6 Astra رخ داده است. این مدل جدید توانسته است ۱۰۶ مسئله باز ریاضی را که با الهام از کارهای پل اردوش طراحی شده‌اند، حل کند. این موفقیت در ریاضیات، در کنار دستاورد خیره‌کننده این مدل در کسب نمره ۹۹.۹٪ در محک ARC-AGI-3، نشان‌دهنده جهشی بزرگ در توانایی‌های استدلالی است.

این دستاورد در حالی رخ می‌دهد که OpenAI یک چرخش راهبردی داشته است؛ آن‌ها تصمیم گرفتند به‌جای تخصص‌گرایی افراطی در ریاضیات، روی معماری کلی بهبود مدل تمرکز کنند. این تغییر استراتژی در زمانی رخ می‌دهد که آزمایشگاه‌های هوش مصنوعی با یک انتخاب حیاتی روبرو هستند: تمرکز بر هوش عمومی گسترده یا تخصص‌گرایی شدید. همان‌طور که پیش‌تر بررسی کردیم که چگونه هوش مصنوعی در ابزارهای تجاری مانند Amazon DSP برای تبلیغات محاوره‌ای ادغام می‌شود، اکنون مرز پژوهش‌ها به سمت معماری نحوه بهبود مدل‌ها توسط خودشان در حال تغییر است.

به گزارش وب‌سایت the-decoder.com در تاریخ ۱۰ سپتامبر ۲۰۲۶، مدل GPT-6 Astra به امتیاز ۳.۲۳ در این محک رسید. این نتیجه از مدل GPT-5.6 Sol که با امتیاز ۳.۱۲ و حل ۷۸ مسئله در رتبه بعدی قرار داشت، پیشی گرفته است. ویژگی بارز Astra در این آزمون، نوشتار علمی قوی‌تر و تمایل به بیان محتاطانه نتایج بود، به‌گونه‌ای که به‌جای ادعاهای اغراق‌آمیز، نتایج خود را کمتر از آنچه بود جلوه می‌داد.

هوش مصنوعی GPT-6 Astra فرصتی برای نفس کشیدن به ریاضیدانان می‌دهد

جزئیات عملکرد در محک

محک ErdosBench که توسط پرزمک چوژکی توسعه یافته، شامل ۲۲۶ مسئله باز ریاضی است. نتایج Astra به شرح زیر است:

  • حل مجموعاً ۱۰۶ مسئله.
  • حل کامل ۴۳ مسئله.
  • ابطال ۲۷ مسئله (و ۲۷ مورد دیگر به‌صورت مجزا).
  • بهبود «سولید» ۵ تا ۱۰ درصدی در مهارت‌های مختلف پژوهشی ریاضی که مورد آزمایش قرار گرفتند.

چوژکی اشاره کرد که با وجود پیشتازی Astra، این محک هنوز به نقطه اشباع نرسیده و فضای زیادی برای پیشرفت مدل‌های آینده وجود دارد.

موازنه بهینه‌سازی

یاکوب پاچوکی، دانشمند ارشد OpenAI، در جستاری با عنوان «ذهنی بیگانه»، دلیل این استراتژی را توضیح داد. او اشاره کرد که اگرچه می‌توان مدل را با تمرکز بیشتر در ریاضیات قوی‌تر کرد، اما شرکت دو اولویت حیاتی‌تر دارد:

۱. خودبهبودی بازگشتی (Recursive Self-Improvement یا RSI) — شبیه به مهندسی که هر روز ابزارهای کارش را خودش بازطراحی می‌کند تا سریع‌تر شود.
۲. پژوهش‌های خودکار در زمینه همراستاسازی (Automated Alignment Research) — یعنی اطمینان از اینکه اهداف مدل با ارزش‌های انسانی یکی است.

پاچوکی در نوشته خود می‌گوید: «[...] ما معتقدیم که می‌توانستیم مدل‌ها را با تمرکز بیشتر، به‌طور خاص در پژوهش‌های ریاضی بهتر کنیم، اما به دلیل فوریت و عجله‌ای که در مورد RSI و پژوهش‌های همراستاسازی خودکار احساس می‌کنیم، این مسیر را در اولویت قرار نمی‌دهیم.»

او استدلال می‌کند که RSI تنها راه عملی برای OpenAI است تا در لبه فناوری پژوهش‌های هوش مصنوعی باقی بماند. این رویکرد منجر به یک «مسیر توسعه ناهموار» (Spiky Trajectory) می‌شود؛ مفهومی که توسط آدام هانت، پژوهشگر دانشگاه کمبریج، بصری‌سازی شده است. هانت دو مسیر متفاوت را با هم مقایسه می‌کند:

  • AGI جریان اصلی: بهبود تدریجی و گسترده در تمام وظایف انسانی.
  • مسیر ناهموار: قدرت فوق‌العاده در حوزه‌هایی مثل کدنویسی و ریاضی، اما درجا زدن یا حتی افت کیفیت در کیفیت زبان، درک مشترک (Common Sense) یا استدلال‌های اجتماعی.

شرط‌بندی پژوهشگر سابق اوپن‌ای‌آی: ۱۰۰ میلیارد دلار برای داده آموزشی، چون مقیاس‌دهی به تنهایی کافی نیست

این یعنی برتری فعلی Astra در ریاضیات، نتیجه مقیاس‌بندی کلی (General Scaling) است، نه مهندسی هدفمند. هدف نهایی این است که مدل بتواند در نهایت بهینه‌سازی‌های خود را به‌طور خودکار انجام دهد و بدون دخالت دستی انسان، در تمام حوزه‌ها از جمله ریاضیات رشد کند.

با این حال، این سرعت پیشرفت بحرانی جدیدی برای دنیای آکادمیک ایجاد کرده است. ترنس تائو، ریاضی‌دان برجسته، در کنگره بین‌المللی ریاضی‌دانان ۲۰۲۶ هشدار داد که این رشته در حال حرکت از وضعیت «کمبود اثبات» به وضعیت «بیش‌باری از اثبات‌ها» (Proof Overload) است.

اگر هوش مصنوعی سریع‌تر از توان بررسی انسان‌ها اثبات تولید کند، چالش اصلی ریاضی‌دانان از «حل مسئله» به «تصمیم‌گیری درباره اینکه کدام نتایج واقعاً اهمیت دارند» تغییر می‌کند. تائو این وضعیت را با تحولات بنیادین و دگرگونی‌های اوایل قرن بیستم مقایسه می‌کند. با این حال، برخی ریاضی‌دانان همچنان تردید دارند و استدلال می‌کنند که مدل‌های زبانی فاقد خلاقیت انسانی لازم برای دستیابی به پیشرفت‌های واقعی و بنیادین هستند.

برای مدیران کسب‌وکار، این به معنای آن است که هوش مصنوعی عمومی (AGI) که در حال ساخت آن هستیم، احتمالاً شبیه به یک انسان همه‌فن‌حریف و روان نخواهد بود؛ بلکه مجموعه‌ای از ابزارهای فوق‌تخصصی است که در حوزه‌های فنی تسلط می‌یابند اما در استدلال‌های انسان‌محور همچنان نقص دارند.

گام بعدی شما

  • اگر از مدل‌های استدلالی برای تحلیل داده استفاده می‌کنید، روی خروجی‌های «محتاطانه» Astra تمرکز کنید تا نرخ خطای فنی را بسنجید.
  • منتظر انتشار مدل‌های داخلی ریاضی OpenAI باشید که گزارش شده‌اند اما هنوز عمومی نشده‌اند، تا ببینید آیا تز «مسیر ناهموار» درست از آب در می‌آید یا خیر.
  • بررسی کنید که آیا ابزارهای فعلی شما در حوزه‌های تخصصی دچار «مسیر ناهموار» شده‌اند یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد اعتبار مدل‌های استدلالی را از «آموزش داده‌شده» به «توانایی ذاتی» منتقل می‌کند. بر اساس تخصص دانشمندان OpenAI، تمرکز بر خودبهبودی بازگشتی می‌تواند سرعت تکامل AI را از کنترل انسان خارج کند.

تأثیر برای ایران

این تحول بیشتر برای پژوهشگران مدل‌های بنیادی اهمیت دارد تا بازار مصرف ایران. در حال حاضر دسترسی به نسخه‌های پیشرفته Astra برای توسعه‌دهندگان ایرانی محدود به APIهای واسط است.

·نگاه ما
تحریریه دات‌هوش

برتری Astra در ریاضیات بدون بهینه‌سازی تخصصی، نشان می‌دهد که قوانین مقیاس‌پذیری (Scaling Laws) هنوز پتانسیل‌های کشف‌نشده‌ای دارند. این موضوع فرضیه «تخصص‌گرایی اجباری» را می‌زند؛ یعنی مدل‌ها می‌توانند صرفاً با بزرگ‌تر شدن، در حوزه‌های سخت مهارت یابند. به نظر ما، این استراتژی OpenAI ریسک بزرگی است؛ آن‌ها روی احتمالی شرط‌بندی کرده‌اند که در آن «خودبهبودی» جایگزین مهندسی دستی شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.