۷۲.۶ درصد؛ این نمرهای است که GPT-6 Astra در محک OSWorld V2-Offline به دست آورده است. اگر تصور کنید ابزاری دارید که بهجای توضیح دادنِ نحوه انجام یک کار، مستقیماً موس و کیبورد شما را در اختیار بگیرد و تسکهای پیچیده را در مرورگر و اکسل پیش ببرد، با ماهیت این مدل روبرو هستید.
به نقل از گزارش Marktechpost، شرکت اوپنایآی (OpenAI) این مدل را نه به عنوان یک چتبات سنتی، بلکه به عنوان یک سامانه «استفاده از رایانه» (Computer-use) معرفی کرده است. این مدل برای اجرای عملیات چندمرحلهای در محیطهای مختلف طراحی شده تا نرمافزارها را دقیقاً همانگونه که یک انسان عمل میکند، به کار بگیرد.
در پوشش پیشین ما از نمره ۱۰۰ درصدی Astra در ExploitBench، دیدیم که این مدل پتانسیل بالایی در تحلیل کد دارد؛ اما انتشار فعلی، سیگنالی از چرخش کامل به سمت عاملهای (Agents) خودمختار است. در حالی که مدلهای پیشین تنها «توصیف» میکردند که چگونه کاری را انجام دهیم، Astra برای «به پایان رساندن» آن کار ساخته شده است. این گذار دقیقاً در زمانی رخ میدهد که صنعت از تولید متن ساده به سمت هوش مصنوعی «اکشنمحور» حرکت میکند که میتواند سیستمعامل کاربر را دستکاری کند.
استقرار و دسترسی
مدل Astra یک مدل بسته و میزبانیشده است و وزنهای باز (Open Weights) آن منتشر نشده است؛ بنابراین میزبانی شخصی (Self-hosting) برای آن ممکن نیست. طبق اعلام OpenAI، این مدل در حال حاضر تنها برای سازمانهای شرکتکننده در برنامههای Trusted Access و Daybreak فعال است. اگرچه هنوز برای عموم منتشر نشده، اما انتظار میرود در روزهای آینده ادغامهای API و AWS عرضه شوند.

مشخصات فنی
جزئیات فنی این مدل عبارتند از:
- پنجره زمینه (Context Window): ۱,۰۵۰,۰۰۰ توکن
- حداکثر خروجی: ۱۲۸,۰۰۰ توکن
- تاریخ قطع دانش: ۳۰ آوریل ۲۰۲۶
- ورودی/خروجی: ورودی متن و تصویر؛ خروجی فقط متن
- سطوح استدلال: افزودن تنظیمات جدید xhigh و max به پارامتر reasoning.effort
- پشتیبانی از ابزار: شامل استفاده از رایانه، شل میزبانیشده، اعمال وصله (Patch)، مهارتها، پروتکل زمینه مدل (MCP) و جستوجوی ابزار
- تنظیم دقیق (Fine-tuning): پشتیبانی نمیشود
جزئیات معماری
یک تغییر ساختاری کلیدی، جایگزینی مکانیزم فشردهسازی زمینه در Codex است. پیش از این، Codex هنگام پر شدن پنجره متنی، گفتگوهای قبلی را خلاصه میکرد که باعث حذف جزئیات حیاتی (مانند دلیل شکست یک اصلاح یا الزامات اولیه) میشد. Astra در مقابل، یادداشتهایی را در سراسر پنجرههای زمینه نگه میدارد و میتواند پیامهای قدیمی و خروجی ابزارها را دوباره جستوجو کند. این قابلیت در حال حاضر بهصورت آزمایشی در تنظیمات config.toml قرار دارد اما در هفتههای آینده پیشفرض Codex خواهد شد.
علاوه بر این، Astra اکنون میتواند در حین انجام کارهایی که وابسته به پاسخ کاربر نیستند، سؤالات شفافساز بپرسد. این ویژگی یک شکست رایج در عاملها را برطرف میکند؛ جایی که یک تصمیم حلنشده، کل فرآیند را متوقف میکرد.
بنچمارکهای عملکرد
دادههای عملکردی نشان میدهد که Astra میانگین زمان انجام تسکها را از ۷۵ دقیقه (در GPT-5.6 Sol) به ۴۰ دقیقه کاهش داده است. بر اساس مستندات OpenAI، این مدل در ARC-AGI-3 نمره ۹۸.۶٪ کسب کرد (البته با استفاده از Responses API که استدلال را بین نوبتها حفظ میکند). همچنین نمره ۹۷.۶٪ در FrontierMath Tier 4 و ۹۵.۹٪ در BenchCAD Vision2Code را ثبت کرد که برتری آن را نسبت به نمره ۸۴.۳٪ مدل Fable 5.1 نشان میدهد. در Terminal-Bench Science نیز Astra با ۶۴.۶٪، مدل ۵۲.۶ درصدی آنتروپیک را شکست داد.
در حوزه کدنویسی، پیشرفتها اندک است. Astra در DeepSWE v1.1 نمره ۷۴.۱٪ گرفت (در مقابل ۷۰.۸٪ برای Sol). این عدد او را در گروه نزدیکی با Muse Spark 1.3 متا (۷۵.۴٪)، Gemini 3.8 Flash و Claude Opus 5 قرار میدهد.
امنیت سایبری و ایمنی
برای نخستین بار، OpenAI یک مدل را در «چارچوب آمادگی» خود در سطح «بحرانی» (Critical) قرار داده است. در تستهای داخلی، Astra توانست اکسپلویتهایی برای سیستمعاملهای سختافزاری توسعه دهد و دو آسیبپذیری ناشناخته در V8 را کشف کند که اکنون در حال گزارش آنها به توسعهدهندگان است. همچنین در ExploitGym نمره ۴۲.۴٪ را کسب کرد (در مقابل ۳۰.۳٪ برای Sol).
به همین دلیل، دسترسی استاندارد API درخواستهای پیشرفته امنیت سایبری، از جمله کشف اکسپلویت را رد میکند. برای توسعهدهندگان API، یک بررسی امنیتی وجود دارد که تسک را بهجای توقف برای تأیید، بهطور کامل متوقف میکند. میا گلیس از OpenAI هشدار داد که کاربران خارج از برنامههای دسترسی مورد اعتماد، ممکن است حتی در کارهای غیرمرتبط با کندی یا مسدود شدن مواجه شوند. این رویکرد سختگیرانه در ادامه پروتکلهای مهار OpenAI برای کنترل توانمندیهای سایبری است که برای جلوگیری از سوءاستفاده از قابلیتهای پیشرفته مدل اتخاذ شده است.
این تغییر در آستانه امنیت سایبری، پیشفرضهای این حوزه را تغییر میدهد. با محدود کردن مدل، OpenAI پذیرفته است که توانایی یافتن آسیبپذیریهای روز-صفر (Zero-day) برای انتشار عمومی بیش از حد خطرناک است.
ساختار قیمتگذاری
قیمت استنتاج ۱۰ دلار برای هر میلیون توکن ورودی و ۵۰ دلار برای هر میلیون توکن خروجی تعیین شده است (ورودیهای کششده ۱ دلار). درخواستهای بیش از ۲۷۲ هزار توکن ورودی، با نرخ ۲ برابر برای ورودی و ۱.۵ برابر برای خروجی محاسبه میشوند. اجرای دستهای (Batch) و Flex با ۵۰٪ تخفیف عرضه میشوند، در حالی که حالت Fast دو برابر هزینه دارد.
گام بعدی شما
- اگر توسعهدهنده عاملهای هوشمند هستید، بررسی کنید که چگونه محدودیتهای امنیتی «سطح بحرانی» Astra ممکن است جریانهای کاری (Workflows) شما در API متوقف کند.
- برای بهینهسازی هزینه، استراتژیهای کشینگ توکنها را در درخواستهای حجیم (بیش از ۲۷۲ هزار توکن) بازبینی کنید.
- منتظر ادغام AWS باشید تا قابلیتهای کنترل دسکتاپ را در محیطهای ابری آزمایش کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو