تصور کنید هوش مصنوعی بهجای نوشتن کد، یک حفره امنیتی ناشناخته در سیستمعامل شما پیدا کند، زنجیرهای از حملات را بسازد و پیش از آنکه انسانی متوجه شود، آن را وصل کند. این دقیقاً همان مرزی است که OpenAI با معرفی مدل جدیدش رد کرده است.
این مدل در ۳ سپتامبر ۲۰۲۶ عرضه شد و نشان میدهد که صنعت از چتباتهای ساده به سمت عاملهای هوش مصنوعی (AI Agents) — شبیه به کارمندانی دیجیتال که بهجای دریافت دستورات تکتک، کل یک پروژه را مستقل پیش میبرند — حرکت کرده است. در حالی که مدلهای قبلی به راهنماییهای گامبهگام نیاز داشتند، Astra برای مدیریت جریانهای کاری پیچیده و چندمرحلهای بهطور مستقل طراحی شده است. همانطور که در تحلیلهای قبلی ما دربارهی چرخش راهبردی OpenAI و جدایی میلیارد دلاریاش از Cursor دیدیم، Astra گامی به سوی یکپارچگی کامل میان «دانش» و «اجرا» است.
GPT-6 Astra در مرکز داده استارگیت تگزاس و با استفاده از بیش از ۱۰۰ هزار واحد پردازش گرافیکی (GPU) پیشآموزش دیده است. این حجم عظیم از سختافزار یادآور آن است که چگونه معماری سختافزاری و نوع پردازندهها، تعیینکننده اصلی سرعت و هزینه مدلهای یادگیری ماشین هستند. طبق اعلام آیدان کلارک، پژوهشگر این شرکت، این بزرگترین عملیات آموزشی شرکت تا به امروز بوده است. نکته حیاتی این است که در این فرآیند، از مدلهای هوش مصنوعی قبلی برای نظارت بر آموزش Astra استفاده شده است؛ یک بهبود بازگشتی (Recursive Improvement) که باعث شد جهش توانمندیها نسبت به مدل GPT-5.6 Sol بسیار شدیدتر از نسلهای پیشین باشد.
دسترسی به این مدل ابتدا از طریق برنامه Daybreak برای سازمانهای منتخب آغاز شده و بهزودی برای کاربران ChatGPT Plus, Pro و Enterprise فعال میشود. همچنین این مدل از طریق API و پلتفرمهای ابری مانند مایکروسافت Azure و AWS Bedrock در دسترس خواهد بود. مشترکین سطوح Pro, Business و Enterprise به نسخه GPT-6 Astra Pro دسترسی خواهند داشت که گونهای با عملکرد بالاتر است. مدیران فضای کاری Enterprise باید این مدل را بهصورت دستی فعال کنند.
بر اساس گزارش وبسایت the-decoder.com، Astra در چندین محک حیاتی رکورد زده است:
- امنیت سایبری: کسب نمره ۱۰۰٪ در ExploitBench و ۸۸٪ در SRE-Bench. جالب اینجاست که Astra در SRE-Bench طی چهار تلاش به نمره ۹۹.۲٪ رسید، در حالی که نمره مدل Sol تنها ۶۸.۷٪ بود.
- استدلال منطقی: نمره ۹۹.۹٪ در ARC-AGI-3 (تحت شرایط خاص تست). همچنین این مدل نمره ۹۵٪ در ARC-AGI-2 و ۹۸.۵٪ در ARC-AGI-1 را کسب کرد.
- ریاضیات: ۹۷.۶٪ در FrontierMath Tier 4 v2.
- دانش تخصصی: ۹۶٪ در GPQA Diamond.
- مهندسی نرمافزار: ۷۴.۱٪ در DeepSWE v1.1.
- مهندسی: ۹۵.۹٪ در BenchCAD.
در یک دستاورد علمی خیرهکننده، این مدل توانست نتیجهای ریاضی درباره «شکافهای اعداد اول» را بهبود ببخشد. بهطور مشخص، کران شکافهای اعداد اول از ۲۴۰ به ۱۸۶ کاهش یافت؛ این اولین بهبود در ترم کران شکافهای بزرگ طی بیش از ۸۰ سال گذشته است.
در حوزههای زیستشناسی، شیمی، پزشکی و فیزیک نیز Astra رکوردهای جدیدی ثبت کرد. در محکهای علوم زیستی و سلامت، نتایج به شرح زیر است:
- LifeSciBench: ۶۰.۳٪
- HealthBench Professional: ۶۳.۴٪
- GeneBench Pro: ۳۷.۸٪
- MedChemBench (داخلی): ۴۹.۳٪
نکته قابل توجه این است که رقبایی مانند Fable 5 و 5.1 از فهرستهای LifeSciBench، GeneBench Pro و MedChemBench حذف شدند، زیرا این مدلها اکثر سؤالات این بخشها را رد کرده و پاسخ ندادند.
OpenAI این مدل را یک اپراتور کامل رایانه معرفی کرده است. در محک OSWorld 2.0، مدل Astra با نمره ۷۲.۶٪ و میانگین زمان ۴۰ دقیقه برای هر تسک، مدل Sol را که ۶۵.۷٪ نمره داشت و تقریباً ۷۵ دقیقه زمان میبرد، شکست داد. سایر محکهای حرفهای نیز این توانایی عاملانه (Agency) را تأیید میکنند:
- AutomationBench: ۴۱.۴٪ (در مقابل ۱۸.۱٪ برای Sol)
- BrowseComp: ۹۱.۵٪
- ScreenSpot-Pro (بدون ابزار): ۹۲.۷٪
- Agents' Final Exam: ۵۹.۳٪
برای پشتیبانی از این توانایی در بلندمدت، OpenAI محیط Codex را بهروزرسانی کرده است. یک ویژگی آزمایشی جدید به Astra اجازه میدهد در چندین پنجره متنی (Context Window) یادداشتبرداری کند. این قابلیت مانع از آن میشود که مدل در جلسات طولانی، الزامات حیاتی را فراموش کند؛ زیرا پنجرههای قبلی بهجای اینکه در یک خلاصه تکانده شوند، بهصورت مجزا قابل جستجو باقی میمانند. OpenAI قصد دارد در هفتههای آینده این قابلیت را به حالت پیشفرض درآورد.
با این حال، Astra نخستین مدلی است که OpenAI آن را در چارچوب آمادگی خود «بحرانی» (Critical) طبقهبندی کرده است. این بدان معناست که مدل میتواند بهطور مستقل حفرههای امنیتی ناشناخته را پیدا کرده و بدون راهنمایی انسان، زنجیرههای اکسپلویت را در سیستمهای با دفاع بالا بسازد. در مرحله ارزیابی، Astra دو حفره امنیتی جدید (Zero-day) در مرورگرها و سیستمعاملها پیدا کرد که بلافاصله به سازندگان گزارش شدند. کارشناسان انسانی تأیید کردند که Astra قادر است Zero-dayهای جدید را در چندین دستهبندی نرمافزاری شناسایی کند.
شاخصهای ایمنی نشان میدهند که ریسک در Astra نسبت به Sol کاهش یافته است:
- ایمنی رایانه: ۲.۴٪ (در مقابل ۲۲.۰٪ در Sol)
- توهم (Hallucination): ۴.۲٪ (در مقابل ۱۲.۲٪ در Sol)
- تست محدوده تسکهای غیرممکن: Astra در ۰٪ مواقع از هدف مجاز خود فراتر رفت (در حالی که Sol ۴۸٪ خطا داشت).
- بیان نادرست توانمندیها: احتمال اینکه Astra درباره تواناییهای خود اشتباه 말 کند، ۳ برابر کمتر از مدل قبلی است.
به دلیل این ریسکهای دوگانه (کاربرد مفید و مخرب)، پیشرفتهترین ابزارهای امنیت سایبری در حال حاضر تنها برای برنامه Daybreak Blue (مخصوص مدافعان مورد اعتماد) محدود شده است. OpenAI پیش از این عرضه Astra را به تأخیر انداخته بود تا تستهای ایمنی بیشتری انجام دهد.
از نظر اقتصادی، هزینه دسترسی استاندارد API برای Astra مبلغ ۱۰ دلار برای هر میلیون توکن ورودی و ۵۰ دلار برای هر میلیون توکن خروجی است. یک «حالت سریع» (Fast mode) نیز با دو برابر قیمت وجود دارد که سرعت را ۲.۵ برابر افزایش میدهد. این قیمتگذاری، Astra را در همان محدوده قیمتی Fable 5.1 شرکت Anthropic قرار میدهد.
گرگ بروکمن، رئیس شرکت، استدلال میکند که قیمتگذاری بر اساس توکن اکنون یک معیار منسوخ است. او پیشنهاد میکند که «قیمت به ازای هر تسک تکمیلشده» تنها معیار معنادار است. برای مثال، در DeepSWE v1.1، پیکربندی برتر Astra هزینه تخمینی API را برای هر تسک ۵۷٪ نسبت به Sol کاهش میدهد.
بهرهوری اقتصادی در سایر محکها نیز مشهود است:
- هزینه BenchCAD: حدود ۴۳٪ کمتر از Sol و ۸۶٪ کمتر از Fable 5.1.
- هزینه Terminal-Bench 4.0: حدود ۹٪ کمتر از Sol و ۶۳٪ کمتر از Fable 5.1.
بروکمن پذیرفت که گذار به AGI تدریجیتر از تصورات اولیه بوده است. او بیان کرد که هیچ «آستانه واضح» واحدی وجود نداشت، اما توانایی Astra در پیشی گرفتن از انسان در اکثر کارهای دارای ارزش اقتصادی، توجیهکننده این ادعاست: «به عصر AGI خوش آمدید». این سخنان با اظهارات قبلی سام آلتمن، مدیرعامل شرکت، که انتظار داشت تا پایان سال ۲۰۲۶ مدلی در سطح AGI عرضه شود، همسو است.
گام بعدی شما
- در روزهای آینده فعال شدن قابلیت «استفاده از رایانه» را در حساب ChatGPT Plus و Enterprise خود بررسی کنید تا تأثیر آن بر بهرهوری شخصی را بسنجید.
- نتایج برنامه Daybreak Blue را دنبال کنید تا ببینید کشف خودکار حفرههای امنیتی چگونه چرخه وصلههای نرمافزاری را تغییر میدهد.
- اگر توسعهدهنده هستید، هزینه تسکهای خود را با مدل Astra مقایسه کنید تا ببینید آیا کاهش ۵۷ درصدی هزینهها در پروژه شما صادق است یا خیر.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو