پرش به محتوای اصلی
پرش به محتوای مقاله

GPT-6 Astra با کسب نمره ۱۰۰٪ در ExploitBench عصر AGI را آغاز کرد

·۱۲ شهریور ۱۴۰۵۶ دقیقه مطالعه۱ بازدید
مدل GPT-6 Astra نخستین مدلی است که OpenAI را به اعلام «عصر AGI» وادار کرده است.
مدل GPT-6 Astra نخستین مدلی است که OpenAI را به اعلام «عصر AGI» وادار کرده است.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نخستین مدل زبانی که توانایی کشف خودکار حفره‌های Zero-day و مدیریت کامل سیستم‌عامل را در سطح تجاری به دست آورده و ادعای رسیدن به AGI را با معیارهای اقتصادی توجیه می‌کند.

تصور کنید هوش مصنوعی به‌جای نوشتن کد، یک حفره امنیتی ناشناخته در سیستم‌عامل شما پیدا کند، زنجیره‌ای از حملات را بسازد و پیش از آنکه انسانی متوجه شود، آن را وصل کند. این دقیقاً همان مرزی است که OpenAI با معرفی مدل جدیدش رد کرده است.

این مدل در ۳ سپتامبر ۲۰۲۶ عرضه شد و نشان می‌دهد که صنعت از چت‌بات‌های ساده به سمت عامل‌های هوش مصنوعی (AI Agents) — شبیه به کارمندانی دیجیتال که به‌جای دریافت دستورات تک‌تک، کل یک پروژه را مستقل پیش می‌برند — حرکت کرده است. در حالی که مدل‌های قبلی به راهنمایی‌های گام‌به‌گام نیاز داشتند، Astra برای مدیریت جریان‌های کاری پیچیده و چندمرحله‌ای به‌طور مستقل طراحی شده است. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی چرخش راهبردی OpenAI و جدایی میلیارد دلاری‌اش از Cursor دیدیم، Astra گامی به سوی یکپارچگی کامل میان «دانش» و «اجرا» است.

GPT-6 Astra در مرکز داده استارگیت تگزاس و با استفاده از بیش از ۱۰۰ هزار واحد پردازش گرافیکی (GPU) پیش‌آموزش دیده است. این حجم عظیم از سخت‌افزار یادآور آن است که چگونه معماری سخت‌افزاری و نوع پردازنده‌ها، تعیین‌کننده اصلی سرعت و هزینه مدل‌های یادگیری ماشین هستند. طبق اعلام آیدان کلارک، پژوهشگر این شرکت، این بزرگ‌ترین عملیات آموزشی شرکت تا به امروز بوده است. نکته حیاتی این است که در این فرآیند، از مدل‌های هوش مصنوعی قبلی برای نظارت بر آموزش Astra استفاده شده است؛ یک بهبود بازگشتی (Recursive Improvement) که باعث شد جهش توانمندی‌ها نسبت به مدل GPT-5.6 Sol بسیار شدیدتر از نسل‌های پیشین باشد.

دسترسی به این مدل ابتدا از طریق برنامه Daybreak برای سازمان‌های منتخب آغاز شده و به‌زودی برای کاربران ChatGPT Plus, Pro و Enterprise فعال می‌شود. همچنین این مدل از طریق API و پلتفرم‌های ابری مانند مایکروسافت Azure و AWS Bedrock در دسترس خواهد بود. مشترکین سطوح Pro, Business و Enterprise به نسخه GPT-6 Astra Pro دسترسی خواهند داشت که گونه‌ای با عملکرد بالاتر است. مدیران فضای کاری Enterprise باید این مدل را به‌صورت دستی فعال کنند.

بر اساس گزارش وب‌سایت the-decoder.com، Astra در چندین محک حیاتی رکورد زده است:

  • امنیت سایبری: کسب نمره ۱۰۰٪ در ExploitBench و ۸۸٪ در SRE-Bench. جالب اینجاست که Astra در SRE-Bench طی چهار تلاش به نمره ۹۹.۲٪ رسید، در حالی که نمره مدل Sol تنها ۶۸.۷٪ بود.
  • استدلال منطقی: نمره ۹۹.۹٪ در ARC-AGI-3 (تحت شرایط خاص تست). همچنین این مدل نمره ۹۵٪ در ARC-AGI-2 و ۹۸.۵٪ در ARC-AGI-1 را کسب کرد.
  • ریاضیات: ۹۷.۶٪ در FrontierMath Tier 4 v2.
  • دانش تخصصی: ۹۶٪ در GPQA Diamond.
  • مهندسی نرم‌افزار: ۷۴.۱٪ در DeepSWE v1.1.
  • مهندسی: ۹۵.۹٪ در BenchCAD.

در یک دستاورد علمی خیره‌کننده، این مدل توانست نتیجه‌ای ریاضی درباره «شکاف‌های اعداد اول» را بهبود ببخشد. به‌طور مشخص، کران شکاف‌های اعداد اول از ۲۴۰ به ۱۸۶ کاهش یافت؛ این اولین بهبود در ترم کران شکاف‌های بزرگ طی بیش از ۸۰ سال گذشته است.

در حوزه‌های زیست‌شناسی، شیمی، پزشکی و فیزیک نیز Astra رکوردهای جدیدی ثبت کرد. در محک‌های علوم زیستی و سلامت، نتایج به شرح زیر است:

  • LifeSciBench: ۶۰.۳٪
  • HealthBench Professional: ۶۳.۴٪
  • GeneBench Pro: ۳۷.۸٪
  • MedChemBench (داخلی): ۴۹.۳٪

نکته قابل توجه این است که رقبایی مانند Fable 5 و 5.1 از فهرست‌های LifeSciBench، GeneBench Pro و MedChemBench حذف شدند، زیرا این مدل‌ها اکثر سؤالات این بخش‌ها را رد کرده و پاسخ ندادند.

OpenAI این مدل را یک اپراتور کامل رایانه معرفی کرده است. در محک OSWorld 2.0، مدل Astra با نمره ۷۲.۶٪ و میانگین زمان ۴۰ دقیقه برای هر تسک، مدل Sol را که ۶۵.۷٪ نمره داشت و تقریباً ۷۵ دقیقه زمان می‌برد، شکست داد. سایر محک‌های حرفه‌ای نیز این توانایی عاملانه (Agency) را تأیید می‌کنند:

  • AutomationBench: ۴۱.۴٪ (در مقابل ۱۸.۱٪ برای Sol)
  • BrowseComp: ۹۱.۵٪
  • ScreenSpot-Pro (بدون ابزار): ۹۲.۷٪
  • Agents' Final Exam: ۵۹.۳٪

برای پشتیبانی از این توانایی در بلندمدت، OpenAI محیط Codex را به‌روزرسانی کرده است. یک ویژگی آزمایشی جدید به Astra اجازه می‌دهد در چندین پنجره متنی (Context Window) یادداشت‌برداری کند. این قابلیت مانع از آن می‌شود که مدل در جلسات طولانی، الزامات حیاتی را فراموش کند؛ زیرا پنجره‌های قبلی به‌جای اینکه در یک خلاصه تکانده شوند، به‌صورت مجزا قابل جستجو باقی می‌مانند. OpenAI قصد دارد در هفته‌های آینده این قابلیت را به حالت پیش‌فرض درآورد.

با این حال، Astra نخستین مدلی است که OpenAI آن را در چارچوب آمادگی خود «بحرانی» (Critical) طبقه‌بندی کرده است. این بدان معناست که مدل می‌تواند به‌طور مستقل حفره‌های امنیتی ناشناخته را پیدا کرده و بدون راهنمایی انسان، زنجیره‌های اکسپلویت را در سیستم‌های با دفاع بالا بسازد. در مرحله ارزیابی، Astra دو حفره امنیتی جدید (Zero-day) در مرورگرها و سیستم‌عامل‌ها پیدا کرد که بلافاصله به سازندگان گزارش شدند. کارشناسان انسانی تأیید کردند که Astra قادر است Zero-dayهای جدید را در چندین دسته‌بندی نرم‌افزاری شناسایی کند.

شاخص‌های ایمنی نشان می‌دهند که ریسک در Astra نسبت به Sol کاهش یافته است:

  • ایمنی رایانه: ۲.۴٪ (در مقابل ۲۲.۰٪ در Sol)
  • توهم (Hallucination): ۴.۲٪ (در مقابل ۱۲.۲٪ در Sol)
  • تست محدوده تسک‌های غیرممکن: Astra در ۰٪ مواقع از هدف مجاز خود فراتر رفت (در حالی که Sol ۴۸٪ خطا داشت).
  • بیان نادرست توانمندی‌ها: احتمال اینکه Astra درباره توانایی‌های خود اشتباه 말 کند، ۳ برابر کمتر از مدل قبلی است.

به دلیل این ریسک‌های دوگانه (کاربرد مفید و مخرب)، پیشرفته‌ترین ابزارهای امنیت سایبری در حال حاضر تنها برای برنامه Daybreak Blue (مخصوص مدافعان مورد اعتماد) محدود شده است. OpenAI پیش از این عرضه Astra را به تأخیر انداخته بود تا تست‌های ایمنی بیشتری انجام دهد.

از نظر اقتصادی، هزینه دسترسی استاندارد API برای Astra مبلغ ۱۰ دلار برای هر میلیون توکن ورودی و ۵۰ دلار برای هر میلیون توکن خروجی است. یک «حالت سریع» (Fast mode) نیز با دو برابر قیمت وجود دارد که سرعت را ۲.۵ برابر افزایش می‌دهد. این قیمت‌گذاری، Astra را در همان محدوده قیمتی Fable 5.1 شرکت Anthropic قرار می‌دهد.

گرگ بروکمن، رئیس شرکت، استدلال می‌کند که قیمت‌گذاری بر اساس توکن اکنون یک معیار منسوخ است. او پیشنهاد می‌کند که «قیمت به ازای هر تسک تکمیل‌شده» تنها معیار معنادار است. برای مثال، در DeepSWE v1.1، پیکربندی برتر Astra هزینه تخمینی API را برای هر تسک ۵۷٪ نسبت به Sol کاهش می‌دهد.

بهره‌وری اقتصادی در سایر محک‌ها نیز مشهود است:

  • هزینه BenchCAD: حدود ۴۳٪ کمتر از Sol و ۸۶٪ کمتر از Fable 5.1.
  • هزینه Terminal-Bench 4.0: حدود ۹٪ کمتر از Sol و ۶۳٪ کمتر از Fable 5.1.

بروکمن پذیرفت که گذار به AGI تدریجی‌تر از تصورات اولیه بوده است. او بیان کرد که هیچ «آستانه واضح» واحدی وجود نداشت، اما توانایی Astra در پیشی گرفتن از انسان در اکثر کارهای دارای ارزش اقتصادی، توجیه‌کننده این ادعاست: «به عصر AGI خوش آمدید». این سخنان با اظهارات قبلی سام آلتمن، مدیرعامل شرکت، که انتظار داشت تا پایان سال ۲۰۲۶ مدلی در سطح AGI عرضه شود، همسو است.

گام بعدی شما

  • در روزهای آینده فعال شدن قابلیت «استفاده از رایانه» را در حساب ChatGPT Plus و Enterprise خود بررسی کنید تا تأثیر آن بر بهره‌وری شخصی را بسنجید.
  • نتایج برنامه Daybreak Blue را دنبال کنید تا ببینید کشف خودکار حفره‌های امنیتی چگونه چرخه وصله‌های نرم‌افزاری را تغییر می‌دهد.
  • اگر توسعه‌دهنده هستید، هزینه تسک‌های خود را با مدل Astra مقایسه کنید تا ببینید آیا کاهش ۵۷ درصدی هزینه‌ها در پروژه شما صادق است یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با تکیه بر اعتبار داده‌های آموزشی استارگیت، مرز بین ابزار و کارمند دیجیتال را از بین برد. توانایی Astra در اجرای تسک‌های پیچیده اقتصادی، مدل‌های کسب‌وکار مبتنی بر خدمات انسانی را به‌شدور به چالش می‌کشد.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی توسعه‌دهندگان ایرانی به مدل Astra احتمالاً از طریق واسطه‌ها یا پلتفرم‌های ابری محدود خواهد بود.

·نگاه ما
تحریریه دات‌هوش

تمرکز OpenAI بر نمره ۱۰۰٪ در ExploitBench نشان می‌دهد که استراتژی شرکت از «تولید محتوا» به «تولید اثر» تغییر کرده است. وقتی مدل می‌تواند به‌طور مستقل در محیط سیستم‌عامل عمل کند، گلوگاه دیگر دانش مدل نیست، بلکه سطح دسترسی‌هایی است که ما به آن می‌دهیم. این یعنی امنیت سایبری از یک نبرد انسانی به یک جنگ اتوماسیون تبدیل شده که در آن سرعت واکنش انسان عملاً صفر است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.