پرش به محتوای اصلی
پرش به محتوای مقاله

مدل GPT-6 Astra نمره ۹۹.۹٪ را در محک ARC-AGI-3 ثبت کرد

·۱۳ شهریور ۱۴۰۵۷ دقیقه مطالعه
پرش نسلی OpenAI با GPT-6 آسترا: هوش مصنوعی چندوجهی در آستانه تحولی بزرگ
پرش نسلی OpenAI با GPT-6 آسترا: هوش مصنوعی چندوجهی در آستانه تحولی بزرگ
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ثبت نمره تقریباً کامل (۹۹.۹٪) در یکی از سخت‌ترین محک‌های استدلال (ARC-AGI-3) که جهشی عظیم نسبت به نسل قبلی است و مرز بین اتوماسیون و تفکر عمومی را کمرنگ می‌کند.

اگر امروز برای ابزارهای استدلال پیشرفته هزینه می‌کنید، باید بدانید سقف توانمندی ماشین‌ها به‌طور ناگهانی جابه‌جا شد. نمره ۹۹.۹٪ در محک ARC-AGI-3 که در ۴ سپتامبر ۲۰۲۶ توسط اوپن‌ای‌آی (OpenAI) گزارش شد، تنها یک عدد نیست؛ بلکه اعلام ورود به عصر جدیدی از تفکر ماشین است. این رقم نشان‌دهنده یک جهش عظیم در هوش ماشینی است و با عرضه GPT-6 Astra همراه شده است؛ مدلی که این شرکت آن را هوشمندترین و هم‌سوترین (Aligned) مدل جهان توصیف می‌کند.

این انتشار در حالی رخ می‌دهد که صنعت هنوز بر سر تعریف دقیق هوش مصنوعی عمومی (AGI) — یعنی سیستمی که مثل یک انسان همه‌فن‌حریف بتواند هر مهارت ذهنی را یاد بگیرد — بحث می‌کند. همان‌طور که در تحلیل قبلی ما درباره عملکرد Astra در محیط OSWorld V2-Offline اشاره کردیم که نمره ۷۲.۶٪ را کسب کرده بود، این داده‌های جدید نشان می‌دهد مدل از اتوماسیون ساده وظایف به سمت استدلال‌های پیچیده و چندمنظوره حرکت کرده است.

تصور کنید ابزاری دارید که فقط دستورات را اجرا نمی‌کند، بلکه مسائلی را حل می‌کند که هرگز در داده‌های آموزشی‌اش ندیده است. این همان «جهش نسلی» است که اوپن‌ای‌آی با این معماری جدید ادعا می‌کند. گرگ بروکمن، رئیس این شرکت، حتی فراتر رفته و صراحتاً به جهان خوش‌آمد گفت: «به عصر AGI خوش آمدید».

پیشرفت‌های خیره‌کننده در بنچمارک‌ها

به نقل از گزارش The Rundown AI، تفاوت عملکرد بین نسل‌ها تکان‌دهنده است. GPT-6 Astra با کسب نمره ۹۹.۹٪ در ARC-AGI-3، فاصله را با مدل GPT-5.6 Sol که تنها ۷.۸٪ کسب کرده بود، به‌طور کامل پر کرد و یک افزایش خیره‌کننده را ثبت نمود.

لوگوی OpenAI با عنوان «جهش نسلی GPT-6 آسترا»

سایر محک‌های حیاتی نیز تسلط این مدل را نشان می‌دهند:

  • FrontierMath T4: دقت ۹۸ درصدی در مسائل ریاضی پیشرفته.
  • ExploitBench: نمره ۱۰۰ برای وظایف مربوط به امنیت سایبری و شناسایی نقاط ضعف.
  • حوزه‌های عمومی: ثبت رکوردهای جدید در علوم، ریاضیات، استفاده از کامپیوتر و کدنویسی.

با این حال، Astra در همه جا برنده مطلق نیست. در شاخص هوش AA (AA’s Intelligence Index)، این مدل نمره ۶۱ را کسب کرد. این نتیجه باعث می‌شود Astra در رتبه‌ای پایین‌تر از چندین رقیب قرار بگیرد، از جمله Fable 5.1، Fable 5، Opus 5 و مدل Muse Spark 1.3 از شرکت متا.

پرش نسلی OpenAI با GPT-6 آسترا: هوش مصنوعی چندوجهی با درک واقعی محیط.

قیمت‌گذاری و دسترسی

اوپن‌ای‌آی برای این سطح از هوش، ساختار هزینه‌ها را تغییر داده است. قیمت API این مدل ۱۰ دلار برای هر میلیون توکن (Token) — تکه‌های کوچکی از متن که مدل مثل برش‌های کیک می‌خورد — ورودی و ۵۰ دلار برای هر میلیون توکن خروجی تعیین شده است.

این یعنی Astra حدود ۲.۵ برابر گران‌تر از GPT-5.6 Sol است. اوپن‌ای‌آی استدلال می‌کند که افزایش کارایی مدل در هر وظیفه (Efficiency per task)، هزینه بالاتر توکن‌ها را جبران می‌کند و در نهایت برای کاربر به‌صرفه‌تر خواهد بود.

دسترسی به مدل در سه مرحله عرضه می‌شود:

  • دسترسی زودهنگام: گروه کوچکی از سازمان‌ها ابتدا به مدل دسترسی پیدا می‌کنند.
  • عرضه عمومی: دسترسی برای کاربران طرح‌های پولی ChatGPT و در دسترس قرار گرفتن API در عرض چند روز.
  • سطح ویژه: معرفی یک سطح اختصاصی به نام «Astra Pro» برای کاربران طرح‌های Pro و بالاتر.

پیش‌نمایش مدل GPT-6 Astra با قابلیت‌های چندوجهی پیشرفته در رویداد OpenAI

بحث بر سر AGI

وقتی از گرگ بروکمن پرسیده شد که آیا این مدل بالاخره استاندارد AGI را رد کرده است، او پاسخ داد: «شخصاً فکر می‌کنم بله، ما به آنجا رسیده‌ایم». او البته اشاره کرد که قضاوت نهایی را به خوانندگان و کاربرانی می‌سپارد که به‌زودی سیستم را به‌طور واقعی تجربه می‌کنند.

این ادعا، اوپن‌ای‌آی را در تقابل مستقیم با Fable 5.1 قرار می‌دهد که با قیمتی مشابه در دسترس است. آزمون واقعی زمانی آغاز می‌شود که عموم مردم بتوانند این دو مدل را در جریان‌های کاری پیچیده و خارج از محیط بنچمارک‌های مصنوعی مقایسه کنند.

پیش‌نمایش رابط کاربری GPT-6 Astra با قابلیت‌های چندوجهی پیشرفته OpenAI

پیامدهای بازار و اکوسیستم

این رونمایی در فضای متلاطمی رخ داد. در همان روز اعلام Astra، شرکت انویدیا (Nvidia) شرکت Hugging Face را به مبلغ ۱۲.۹ میلیارد دلار خرید. جن‌سن هوانگ، مدیرعامل انویدیا، تأکید کرد که این پلتفرم برای همه ابرها و تراشه‌ها باز می‌ماند و انحصاری نخواهد شد.

هم‌زمان، فشارهای سیاسی افزایش یافته است. سناتور برنی سندرز و نماینده گرگ کاسار لایحه‌ای را معرفی کردند تا هوش مصنوعی فوق‌هوشمند (Superintelligent AI) را به‌طور کامل غیرقانونی کنند. جریمه‌های پیشنهادی برای این قانون، بر اساس قوانین سخت‌گیرانه مربوط به سلاح‌های هسته‌ای طراحی شده است.

سایر تحولات مهم صنعت عبارتند از:

  • سرمایه‌گذاری: طبق گزارش The Information، آزمایشگاه Thinking Machines متعلق به میرا موراتی در حال مذاکره برای جذب سرمایه‌ای است که ارزش شرکت را به ۴۰ میلیارد دلار می‌رساند.
  • پایداری: این عرضه با قطعی‌های گسترده در روز پنجشنبه در سرویس‌های اوپن‌ای‌آی، آنتروپیک، xAI و گوگل همراه بود.
  • رکوردهای ریاضی: در حالی که Axiom Math اخیراً ثابت کرد اعداد اول همیشه در فاصله ۲۱۲ واحدی از هم ظاهر می‌شوند، GPT-6 Astra در همان روز این فاصله را به ۱۸۶ واحد کاهش داد.

برای کاربران تجاری، این یعنی «کف هوش» دوباره جابه‌جا شد. توانایی مدیریت امنیت سایبری و ریاضیات پیشرفته با دقت تقریباً کامل، نیاز به نظارت انسانی در کارهای ممیزی فنی و تکراری را به‌شدت کاهش می‌دهد.

با این حال، نبود دسترسی عمومی فوری همچنان یک نقطه اصطکاک است. سام آلتمن اشاره کرد که عرضه مدل «باید سریع باشد»، اما فاصله بین معرفی و دسترسی، فرصتی برای رقبای بازار ایجاد می‌کند تا استراتژی‌های بازاریابی خود را تغییر دهند.

فراتر از مدل‌های زبانی

در کنار رقابت LLMها، مدل‌های تخصصی نیز در حال پیشرفت‌اند. گوگل دیپ‌مایند مدل WeatherNext 3 را معرفی کرد؛ یک مدل هواشناسی که با استفاده از تصاویر ماهواره‌ای زنده، پیش‌بینی‌ها را هر ساعت به‌روز می‌کند. این مدل با کسب بالاترین نمرات، رقبای خود و حتی سرویس‌های هواشناسی ایالات متحده و اروپا را شکست داد.

مدل WeatherNext 3 یک بهبود ۵ برابری در جزئیات دما تا سطح ۵ کیلومتر ارائه می‌دهد که به آن اجازه می‌دهد خطوط ساحلی و دره‌های کوچک را شناسایی کند. در حالی که پیش‌بین‌های قدیمی AI بر اساس شبیه‌سازی‌های فیزیکی بودند که حدود ۶ ساعت تأخیر داشتند، WeatherNext 3 داده‌های ایستگاه‌های زمینی و فیدهای زنده را برای سرعت بیشتر ادغام می‌کند. همچنین این مدل ضعف سنتی AI در پیش‌بینی باران را برطرف کرده و خطاها را تا ۶۰٪ در مقایسه با داده‌های ماهواره‌ای کاهش داده و پیش‌بینی‌های باران برای روز بعد را ۵۰٪ بهبود بخشیده است. گوگل اکنون در حال ادغام این قابلیت در Search، Maps، Gemini و Earth است.

آینده محتوا و چندوجهی بودن

ساندار پیچای، مدیرعامل گوگل، ابزارهای فعلی تولید محتوا را به اندازه «تلفن‌های تاشو» ابتدایی توصیف کرد. او پیش‌بینی می‌کند تا سه سال آینده، هر محتوایی بتواند از هر قالبی (Modality) به هر قالب دیگر تبدیل شود.

این یعنی سازندگان فقط برند، شخصیت و ایده‌ها را ارائه می‌دهند و AI فرمت نهایی را مدیریت می‌کند. برای مثال:

  • کلیپ‌های یوتیوب می‌توانند تنها با یک کلیک به وبلاگ تبدیل شوند.
  • خبرنامه‌ها می‌توانند بدون نیاز به ضبط صدا، به پادکست تبدیل شوند.

این تحول استراتژی «تولید محتوای انبوه» را می‌کشد. وقتی حجم دیگر مزیت رقابتی نیست، برندگان کسانی خواهند بود که بر کیفیت و ایده‌های اصیل تمرکز می‌کنند.

پیاده‌سازی عملی AI

کاربران برای بهینه‌سازی جریان‌های کاری خود از روش‌هایی مثل «متد حلقه» (Loop Method) در ChatGPT استفاده می‌کنند تا فرآیندهای متناقض را از طریق بررسی‌های متخاصم (Adversarial Review) بهبود ببخشند.

جریان کاری متد حلقه:

  • شناسایی: یافتن یک جریان کاری، پوشه پروژه یا مهارتی که نتایج ناپایداری دارد.
  • پرامپت: استفاده از دستور: «این جریان کاری را در ۳ حلقه بهبود بخش. یک پنل از عامل‌های فرعی هر حلقه را به‌صورت متخاصم بررسی کنند. کار زمانی تمام است که [تعریف پایان] محقق شود».
  • اجرا: تعیین خروجی نهایی با دستور /goal. این فرآیند معمولاً بین ۱۵ دقیقه تا یک ساعت زمان می‌برد.
  • اصلاح: اگر خروجی هنوز نیاز به کار دارد، از Codex برای تبدیل مراحل مبهم به اسکریپت‌های دقیق استفاده کنید.

توسعه عامل‌های سازمانی

تمرکز مهندسان اکنون به سمت مجموعه‌های چندعاملی (Multi-agent) در مقیاس تولید است. سری آموزشی Google Startup School: Agent Builder از ۱۵ سپتامبر، گذار از نمونه‌های اولیه به تولیدات سازمانی را با استفاده از Gemini Enterprise Agent Platform و Google Antigravity 2.0 بررسی می‌کند.

تمرکزهای فنی این انتقال عبارتند از:

  • انتقال وضعیت: کدنویسی تغییرات وضعیت عامل در پایتون با استفاده از ADK گوگل برای جلوگیری از وابستگی به یک فروشنده خاص (Vendor lock-in).
  • حافظه: ساخت حافظه بلندمدت عامل‌ها از طریق تداوم جلسات (Session persistence) و تولید بازیابی‌افزا (RAG) چندوجهی — مثل دانش‌آموزی که قبل از جواب دادن، اول کتاب را باز می‌کند و از آن نقل می‌آورد.
  • مقیاس‌پذیری: استقرار عامل‌های امن و بدون محدودیت نرخ درخواست (Rate-limit-free) در Cloud Run در مقیاس سازمانی.

راهکارهای جامعه‌محور

کاربرانی مثل «سم» بدون تجربه کدنویسی، اپلیکیشن Rally News را با هزینه حدود ۲۵ دلار در ماه ساختند. او با آموزش نسخه‌ای مصنوعی از شخصیت خود برای تعریف «اخبار مثبت» و اتصال مدل Mistral از طریق OpenRouter به فیدهای RSS سایت‌های معتبر، سیستمی ساخت که اخبار منفی را حذف و فقط داستان‌های مثبت را از بیش از ۲۰ سایت خبری نمایش می‌دهد تا جایگزینی برای «doomscrolling» (مرور اخبار بد) باشد.

منتظر اولین ممیزی‌های مستقل از توانایی استدلال Astra روی داده‌های غیرسنتتیک باشید تا ببینیم نمره ۹۹.۹٪ در دنیای واقعی چه معنایی دارد و آیا به قابلیت اطمینان در دنیای واقعی تبدیل می‌شود یا خیر.

گام بعدی شما

  • اگر از APIهای مدل‌های استدلالی استفاده می‌کنید، بودجه استنتاج خود را برای افزایش ۲.۵ برابری هزینه‌ها در Astra بازبینی کنید.
  • متد «حلقه» را برای اصلاح پرامپت‌های پیچیده خود امتحان کنید تا نرخ خطای خروجی را کاهش دهید.
  • در صورت دسترسی، مدل Astra را در مقابل Fable 5.1 در وظایف کدنویسی سخت‌آزمایی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره خرید Hugging Face توسط انویدیا مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با جابه‌جا کردن سقف استدلال ماشین، اعتبار ادعاهای مربوط به دستیابی به AGI را تقویت می‌کند. تخصص اوپن‌ای‌آی در همراستاسازی مدل‌های فوق‌هوشمند اکنون در برابر محک سختِ کاربردهای صنعتی قرار گرفته است.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی توسعه‌دهندگان ایرانی به Astra احتمالاً از طریق واسطه‌های OpenRouter یا سرویس‌های مشابه خواهد بود که هزینه استنتاج را برای آن‌ها باز هم افزایش می‌دهد.

·نگاه ما
تحریریه دات‌هوش

دستیابی به نمره ۹۹.۹٪ در ARC-AGI-3 نشان می‌دهد که مدل‌های زبانی از مرحله «تخمین کلمه بعدی» به مرحله «حل مسئله ساختاریافته» رسیده‌اند. با این حال، فاصله میان نمرات بنچمارک و عملکرد واقعی در محیط‌های غیرسنتتیک همچنان بزرگ‌ترین ریسک است. اگر Astra بتواند این دقت را در دنیای واقعی حفظ کند، نیاز به نظارت انسانی در لایه‌های میانی کدنویسی و امنیت سایبری عملاً حذف خواهد شد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.