پرش به محتوای اصلی
پرش به محتوای مقاله

GPT-6 Astra با نمره ۷۲.۶٪ در محک OSWorld مرزهای کنترل رایانه را جابه‌جا کرد

·۱۳ شهریور ۱۴۰۵۴ دقیقه مطالعه
مدل GPT-6 Astra با پنجره یک میلیون توکن و قابلیت کنترل کامپیوتر، پشت سد امنیتی سایبری «بحرانی» منتشر شد
مدل GPT-6 Astra با پنجره یک میلیون توکن و قابلیت کنترل کامپیوتر، پشت سد امنیتی سایبری «بحرانی» منتشر شد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نخستین مدل OpenAI که به‌طور رسمی در سطح «بحرانی» ایمنی سایبری قرار گرفته و قابلیت کنترل مستقیم رابط کاربری (Computer-use) را با پنجره متنی میلیونی ترکیب کرده است.

۷۲.۶ درصد؛ این نمره‌ای است که GPT-6 Astra در محک OSWorld V2-Offline به دست آورده است. اگر تصور کنید ابزاری دارید که به‌جای توضیح دادنِ نحوه انجام یک کار، مستقیماً موس و کیبورد شما را در اختیار بگیرد و تسک‌های پیچیده را در مرورگر و اکسل پیش ببرد، با ماهیت این مدل روبرو هستید.

به نقل از گزارش Marktechpost، شرکت اوپن‌ای‌آی (OpenAI) این مدل را نه به عنوان یک چت‌بات سنتی، بلکه به عنوان یک سامانه «استفاده از رایانه» (Computer-use) معرفی کرده است. این مدل برای اجرای عملیات چندمرحله‌ای در محیط‌های مختلف طراحی شده تا نرم‌افزارها را دقیقاً همان‌گونه که یک انسان عمل می‌کند، به کار بگیرد.

در پوشش پیشین ما از نمره ۱۰۰ درصدی Astra در ExploitBench، دیدیم که این مدل پتانسیل بالایی در تحلیل کد دارد؛ اما انتشار فعلی، سیگنالی از چرخش کامل به سمت عامل‌های (Agents) خودمختار است. در حالی که مدل‌های پیشین تنها «توصیف» می‌کردند که چگونه کاری را انجام دهیم، Astra برای «به پایان رساندن» آن کار ساخته شده است. این گذار دقیقاً در زمانی رخ می‌دهد که صنعت از تولید متن ساده به سمت هوش مصنوعی «اکشن‌محور» حرکت می‌کند که می‌تواند سیستم‌عامل کاربر را دست‌کاری کند.

استقرار و دسترسی

مدل Astra یک مدل بسته و میزبانی‌شده است و وزن‌های باز (Open Weights) آن منتشر نشده است؛ بنابراین میزبانی شخصی (Self-hosting) برای آن ممکن نیست. طبق اعلام OpenAI، این مدل در حال حاضر تنها برای سازمان‌های شرکت‌کننده در برنامه‌های Trusted Access و Daybreak فعال است. اگرچه هنوز برای عموم منتشر نشده، اما انتظار می‌رود در روزهای آینده ادغام‌های API و AWS عرضه شوند.

مشخصات فنی

جزئیات فنی این مدل عبارتند از:

  • پنجره زمینه (Context Window): ۱,۰۵۰,۰۰۰ توکن
  • حداکثر خروجی: ۱۲۸,۰۰۰ توکن
  • تاریخ قطع دانش: ۳۰ آوریل ۲۰۲۶
  • ورودی/خروجی: ورودی متن و تصویر؛ خروجی فقط متن
  • سطوح استدلال: افزودن تنظیمات جدید xhigh و max به پارامتر reasoning.effort
  • پشتیبانی از ابزار: شامل استفاده از رایانه، شل میزبانی‌شده، اعمال وصله (Patch)، مهارت‌ها، پروتکل زمینه مدل (MCP) و جست‌وجوی ابزار
  • تنظیم دقیق (Fine-tuning): پشتیبانی نمی‌شود

جزئیات معماری

یک تغییر ساختاری کلیدی، جایگزینی مکانیزم فشرده‌سازی زمینه در Codex است. پیش از این، Codex هنگام پر شدن پنجره متنی، گفتگوهای قبلی را خلاصه می‌کرد که باعث حذف جزئیات حیاتی (مانند دلیل شکست یک اصلاح یا الزامات اولیه) می‌شد. Astra در مقابل، یادداشت‌هایی را در سراسر پنجره‌های زمینه نگه می‌دارد و می‌تواند پیام‌های قدیمی و خروجی ابزارها را دوباره جست‌وجو کند. این قابلیت در حال حاضر به‌صورت آزمایشی در تنظیمات config.toml قرار دارد اما در هفته‌های آینده پیش‌فرض Codex خواهد شد.

علاوه بر این، Astra اکنون می‌تواند در حین انجام کارهایی که وابسته به پاسخ کاربر نیستند، سؤالات شفاف‌ساز بپرسد. این ویژگی یک شکست رایج در عامل‌ها را برطرف می‌کند؛ جایی که یک تصمیم حل‌نشده، کل فرآیند را متوقف می‌کرد.

بنچمارک‌های عملکرد

داده‌های عملکردی نشان می‌دهد که Astra میانگین زمان انجام تسک‌ها را از ۷۵ دقیقه (در GPT-5.6 Sol) به ۴۰ دقیقه کاهش داده است. بر اساس مستندات OpenAI، این مدل در ARC-AGI-3 نمره ۹۸.۶٪ کسب کرد (البته با استفاده از Responses API که استدلال را بین نوبت‌ها حفظ می‌کند). همچنین نمره ۹۷.۶٪ در FrontierMath Tier 4 و ۹۵.۹٪ در BenchCAD Vision2Code را ثبت کرد که برتری آن را نسبت به نمره ۸۴.۳٪ مدل Fable 5.1 نشان می‌دهد. در Terminal-Bench Science نیز Astra با ۶۴.۶٪، مدل ۵۲.۶ درصدی آنتروپیک را شکست داد.

در حوزه کدنویسی، پیشرفت‌ها اندک است. Astra در DeepSWE v1.1 نمره ۷۴.۱٪ گرفت (در مقابل ۷۰.۸٪ برای Sol). این عدد او را در گروه نزدیکی با Muse Spark 1.3 متا (۷۵.۴٪)، Gemini 3.8 Flash و Claude Opus 5 قرار می‌دهد.

امنیت سایبری و ایمنی

برای نخستین بار، OpenAI یک مدل را در «چارچوب آمادگی» خود در سطح «بحرانی» (Critical) قرار داده است. در تست‌های داخلی، Astra توانست اکسپلویت‌هایی برای سیستم‌عامل‌های سخت‌افزاری توسعه دهد و دو آسیب‌پذیری ناشناخته در V8 را کشف کند که اکنون در حال گزارش آن‌ها به توسعه‌دهندگان است. همچنین در ExploitGym نمره ۴۲.۴٪ را کسب کرد (در مقابل ۳۰.۳٪ برای Sol).

به همین دلیل، دسترسی استاندارد API درخواست‌های پیشرفته امنیت سایبری، از جمله کشف اکسپلویت را رد می‌کند. برای توسعه‌دهندگان API، یک بررسی امنیتی وجود دارد که تسک را به‌جای توقف برای تأیید، به‌طور کامل متوقف می‌کند. میا گلیس از OpenAI هشدار داد که کاربران خارج از برنامه‌های دسترسی مورد اعتماد، ممکن است حتی در کارهای غیرمرتبط با کندی یا مسدود شدن مواجه شوند. این رویکرد سخت‌گیرانه در ادامه پروتکل‌های مهار OpenAI برای کنترل توانمندی‌های سایبری است که برای جلوگیری از سوءاستفاده از قابلیت‌های پیشرفته مدل اتخاذ شده است.

این تغییر در آستانه امنیت سایبری، پیش‌فرض‌های این حوزه را تغییر می‌دهد. با محدود کردن مدل، OpenAI پذیرفته است که توانایی یافتن آسیب‌پذیری‌های روز-صفر (Zero-day) برای انتشار عمومی بیش از حد خطرناک است.

ساختار قیمت‌گذاری

قیمت استنتاج ۱۰ دلار برای هر میلیون توکن ورودی و ۵۰ دلار برای هر میلیون توکن خروجی تعیین شده است (ورودی‌های کش‌شده ۱ دلار). درخواست‌های بیش از ۲۷۲ هزار توکن ورودی، با نرخ ۲ برابر برای ورودی و ۱.۵ برابر برای خروجی محاسبه می‌شوند. اجرای دسته‌ای (Batch) و Flex با ۵۰٪ تخفیف عرضه می‌شوند، در حالی که حالت Fast دو برابر هزینه دارد.

گام بعدی شما

  • اگر توسعه‌دهنده عامل‌های هوشمند هستید، بررسی کنید که چگونه محدودیت‌های امنیتی «سطح بحرانی» Astra ممکن است جریان‌های کاری (Workflows) شما در API متوقف کند.
  • برای بهینه‌سازی هزینه، استراتژی‌های کشینگ توکن‌ها را در درخواست‌های حجیم (بیش از ۲۷۲ هزار توکن) بازبینی کنید.
  • منتظر ادغام AWS باشید تا قابلیت‌های کنترل دسکتاپ را در محیط‌های ابری آزمایش کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با جابه‌جایی از چت به کنترل مستقیم سیستم‌عامل، تعریف بهره‌وری در نرم‌افزارهای دسکتاپ را تغییر می‌دهد. اعتبار این ادعا از طریق نمرات بالای OSWorld و توانایی کشف آسیب‌پذیری‌های واقعی V8 تأیید شده است.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی توسعه‌دهندگان ایرانی به Astra تنها از طریق واسطه‌ها یا حساب‌های Trusted Access ممکن است و در حال حاضر اثر مستقیمی بر بازار مصرف داخلی ندارد.

·نگاه ما
تحریریه دات‌هوش

تمرکز OpenAI بر «اکشن» به‌جای «تولید متن»، نشان می‌دهد که مدل‌های زبانی بزرگ دیگر تنها به عنوان مشاور نیستند، بلکه در حال تبدیل شدن به اپراتورهای سیستم هستند. حذف فشرده‌سازی زمینه در Codex یک حرکت استراتژیک برای حل مشکل «فراموشی» در تسک‌های طولانی است که پیش از این بزرگ‌ترین مانع در مسیر عامل‌های خودمختار بود. به نظر ما، تعیین سطح «بحرانی» برای امنیت سایبری، اعترافی است به اینکه قدرت استدلالی مدل‌ها اکنون از سرعت توسعه‌ی حفاظ‌های امنیتی پیشی گرفته است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.