پرش به محتوای اصلی
پرش به محتوای مقاله

مدل GPT-6 Astra با امتیاز ۹۹.۹٪ در محک ARC-AGI-3 وارد Amazon Bedrock شد

·۱۸ شهریور ۱۴۰۵۵ دقیقه مطالعه۲ بازدید
لوگوی OpenAI و Amazon Bedrock در کنار عنوان مقاله درباره دسترسی عمومی GPT-6 Astra
لوگوی OpenAI و Amazon Bedrock در کنار عنوان مقاله درباره دسترسی عمومی GPT-6 Astra
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نخستین مدل OpenAI با طبقه‌بندی امنیتی «بحرانی» که توانایی کنترل مستقیم رابط کاربری (Computer Use) را در محیط ابری AWS برای سازمان‌ها فراهم می‌کند.

تصور کنید کارمندی دیجیتال داشته باشید که به‌جای درخواست API، مستقیماً مانند یک انسان روی صفحه نمایش شما کلیک می‌کند و نرم‌افزارها را مدیریت می‌کند. این دیگر یک رویای علمی-تخیلی نیست، بلکه قابلیت عملیاتی مدل جدید OpenAI است که اکنون برای سازمان‌ها در دسترس قرار گرفته است.

در ۸ سپتامبر ۲۰۲۶، شرکت AWS تأیید کرد که مدل GPT-6 Astra به‌صورت عمومی در سرویس Amazon Bedrock عرضه شده است. طبق اعلام AWS در یک پست در وبلاگ یادگیری ماشین (Machine Learning Blog)، این مدل پیشرفته‌ترین و توانمندترین دستاورد OpenAI تا به امروز است و دسترسی به تمام توان استدلالی و قابلیت‌های «استفاده از کامپیوتر» (Computer Use) را برای کاربران سازمانی فراهم می‌کند. این عرضه در ادامه گسترش دسترسی به مدل‌های پیشرفته در این پلتفرم صورت می‌گیرد؛ چنان‌که مدل‌های GPT-5.6 نیز پیش‌تر برای کاربران استرالیایی در Amazon Bedrock فعال شده بودند.

این عرضه در حالی رخ می‌دهد که صنعت هوش مصنوعی از چت‌بات‌های ساده به سمت عامل‌های (Agents) — شبیه به دستیاران هوشمندی که می‌توانند به‌تنهایی برنامه‌ای را از ابتدا تا انتها اجرا کنند — حرکت می‌کند. در حالی که ما پیش‌تر تحلیل کردیم که چگونه برخی از سایت‌های برتر به‌طور تصادفی استنادهای ChatGPT Search را مسدود کردند، اکنون تمرکز صنعت به سمت ادغام عمیق در زیرساخت‌های شرکتی تغییر یافته است. برای یک مدیر کسب‌وکار، Astra دیگر یک پنجره برای گفتگو نیست، بلکه نیرویی است که می‌تواند بدون نیاز به کدنویسی یا API، در محیط نرم‌افزاری شرکت جابه‌جا شود.

ادغام سازمانی و مقیاس‌پذیری

مدل Astra روی موتور استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند، مثل خودِ آشپزی و نه دوره‌ی آموزش آشپز — در Bedrock اجرا می‌شود. AWS مدعی است این زیرساخت، مقیاس‌پذیری و پایداری لازم برای بارهای کاری سنگین تولیدی (Production Workloads) را تضمین می‌کند. کاربران می‌توانند از طریق APIهای Bedrock یا پیکربندی ابزارهای ChatGPT Work و Codex به این مدل دسترسی داشته باشند. همچنین به عنوان بخشی از این عرضه، OpenAI پلاگین‌های سازمانی جدیدی را برای ChatGPT Work معرفی می‌کند.

برای بهینه‌سازی هزینه و سرعت، این مدل از قابلیت ذخیره‌سازی موقت پرامپت (Prompt Caching) به‌صورت ضمنی (Implicit) و صریح (Explicit) پشتیبانی می‌کند. توسعه‌دهندگان می‌توانند نقاط شکست (Breakpoints) خاصی را برای حافظه تعیین کنند تا مشخص شود کدام بخش از متن (Context) باید کش شود. به گزارش AWS، استفاده مجدد از این متن‌های ذخیره‌شده در درخواست‌های بعدی، باعث کاهش پردازش‌های تکراری، کاهش هزینه و کاهش تأخیر در کارهای متناوب می‌شود؛ کارهایی مانند تحلیل codebaseهای حجیم، ایجاد عامل‌های مستند (Grounded Agents) بر اساس استانداردهای شرکت یا بررسی‌های مکرر اسناد.

استدلال در سناریوهای حساس

AWS مدل Astra را ابزاری برای کارهایی توصیف می‌کند که نیاز به وزن‌سنجی ورودی‌های متضاد، ردیابی وابستگی‌ها و تعیین اولویت دارند:

  • تحلیل مالی: مدل می‌تواند تناقضات بین منابع داده‌ای متضاد را شناسایی کند؛ مواردی که پتانسیل تغییر کامل یک توصیه سرمایه‌گذاری یا تحلیل مالی را دارند.
  • حقوق و تطبیق: با پنجره متنی (Context Window) — میزان متنی که مدل هم‌زمان در ذهن نگه می‌دارد، مثل میز کاری که جا برای چند ورق دارد — یک میلیون توکنی، مدل می‌تواند صدها صفحه قرارداد را ببلعد تا مفاد و بندهایی را که بیشترین ریسک را ایجاد می‌کنند، علامت‌گذاری کند.
  • مهندسی نرم‌افزار: مدل قادر است یک مشکل را در کل codebase ردیابی کند، وابستگی‌های آن را تحلیل نماید و یک اصلاحیه (Fix) را از مرحله تشخیص اولیه تا تست نهایی پیش ببرد.

کنترل کامپیوتر و مرورگر

بزرگ‌ترین چرخش Astra، توانایی آن در پیشبرد استفاده از کامپیوتر و مرورگر است. وقتی هیچ API یا رابط برنامه‌نویسی (Connector) وجود ندارد، مدل می‌تواند مستقیماً روی رابط‌های گرافیکی نرم‌افزارها اثر بگذارد و بین اپلیکیشن‌های مختلف جابه‌جا شود.

ابزار ChatGPT Work از این قابلیت به‌عنوان یک عامل بهره‌وری استفاده می‌کند تا وظایف پیچیده تجاری را به خروجی‌های نهایی مانند فایل‌های اکسل، اسلایدها، اسناد و وب‌سایت‌ها تبدیل کند. این ابزار می‌تواند اطلاعات را از فایل‌ها استخراج کند، در وب جستجو نماید و دارایی‌های نهایی (Finished Assets) را تولید کند. کاربران با تعیین اینکه عامل به کدام اپلیکیشن‌ها و وب‌سایت‌ها دسترسی داشته باشد، مدیریت آپلود فایل‌ها و الزام به تأییدیه پیش از اقدامات حساس، کنترل کامل را حفظ می‌کنند. همچنین کاربران می‌توانند پیشرفت کار را به‌صورت لحظه‌ای مشاهده کرده و مسیر عامل را تغییر دهند. ChatGPT Work اکنون برای اپلیکیشن دسکتاپ مک و ویندوز در دسترس است.

در سوی دیگر، Codex به‌عنوان عامل مهندسی نرم‌افزار، با فایل‌های محلی، مخازن کد (Repositories)، ترمینال‌ها و IDEهایی مثل VS Code, JetBrains و Xcode ادغام می‌شود. Codex می‌تواند ویژگی‌های جدید بنویسد، باگ‌ها را رفع کند، تست‌ها را اجرا نماید و درخواست‌های Pull Request ارسال کند. همچنین از طریق Agent Toolkit برای AWS، مدل Codex می‌تواند مستندات AWS، APIها و قابلیت‌های سرویس‌های ابری را تنها با یک دستور ترمینال اجرا کند.

پلاگین‌های سازمانی جدید، قابلیت‌های استفاده از مرورگر Astra را به ابزارهای هوش تجاری (BI) از جمله Workday، Navan و Avalara می‌آورند. این قابلیت‌ها حوزه‌های مالی، عملیات و تحلیل داده‌ها را پوشش می‌دهند و از طریق حساب‌های کاربری موجود و تحت مجوزهای تعیین‌شده توسط مدیر سیستم (Administrator) اجرا می‌شوند.

امنیت و طبقه‌بندی «بحرانی»

OpenAI مدل Astra را با چارچوب آمادگی (Preparedness Framework) خود ارزیابی کرده است؛ چارچوبی که با پیشرفت قابلیت‌ها، حفاظ‌های سخت‌گیرانه‌تری را اعمال می‌کند. طبق مستندات AWS، Astra نخستین مدل OpenAI است که در حوزه قابلیت‌های امنیت سایبری، طبقه‌بندی «بحرانی» (Critical) دریافت کرده است.

این طبقه‌بندی باعث فعال شدن حفاظ‌های خودکار می‌شود که سوءاستفاده را به‌صورت لحظه‌ای رصد کرده و فعالیت‌هایی را که از مرزهای تعریف‌شده فراتر می‌روند، متوقف یا به حالت تعلیق درمی‌آورند. این حفاظ‌ها در محدوده سرویس Bedrock عمل کرده و مکمل کنترل‌های امنیتی AWS در زمان کار مدل با ابزارها و کدها هستند.

AWS همچنین دسترسی کارکنان خود را در سطح تراشه به‌صورت «بدون اپراتور» (Zero-operator access) مسدود کرده است تا هیچ انسانی نتواند پرامپت‌ها یا پاسخ‌ها را در طول استنتاج بخواند. تدابیر امنیتی شامل موارد زیر است:

  • رمزنگاری: داده‌ها در حالت سکون (At rest) و در حال انتقال (In transit) رمزنگاری می‌شوند.
  • حاکمیت: سیاست‌های IAM دسترسی‌ها را کنترل کرده و AWS CloudTrail تمام فراخوانی‌های مدل را ثبت می‌کند.
  • امنیت شبکه: ترافیک می‌تواند از طریق AWS PrivateLink VPC endpoints عبور کند و مشتریان می‌توانند سیاست‌های محیطی داده (Data Perimeter) را در سطح سازمان تنظیم کنند تا از خروج غیرمجاز داده‌ها جلوگیری شود.

AWS تصریح کرده است که داده‌های استنتاج مشتریان برای آموزش مدل‌ها استفاده نمی‌شود و اجرای Astra نیازی به پذیرش اشتراک‌گذاری داده‌ها با OpenAI ندارد. ترافیکی که به دلیل سوءاستفاده علامت‌گذاری شود، تا ۳۰ روز نگه داشته شده و به‌صورت برنامه‌نویسی‌شده پردازش می‌شود؛ با این حال، مشتریان می‌توانند از طریق تیم حساب کاربری خود، درخواست «عدم ذخیره‌سازی داده‌ها» (Zero data retention) را ثبت کنند.

بنچمارک‌ها و قیمت‌گذاری

بر اساس گزارش‌های OpenAI، این مدل در حوزه‌های تخصصی از جمله علوم و امنیت سایبری نتایج پیشرو (State-of-the-art) به جای گذاشته است. امتیازات کلیدی گزارش‌شده عبارتند از:

  • ARC-AGI-3: امتیاز ۹۹.۹٪ (دستیابی به سطح انسانی در ۹۶٪ مراحل طبق گفته گرگ کامرادت از بنیاد ARC Prize).
  • ExploitBench: امتیاز ۱۰۰٪.
  • FrontierMath Tier 4: امتیاز ۹۸٪.
  • Terminal-Bench 4.0: امتیاز ۵۷.۹٪ (در برابر ۳۷.۳٪ برای GPT-5.6 Sol).

قیمت استاندارد API برای gpt-6-astra مبلغ ۱۰ دلار به‌ازای هر میلیون توکن ورودی و ۵۰ دلار به‌ازای هر میلیون توکن خروجی تعیین شده است، در حالی که نرخ‌های جداگانه‌ای برای خواندن و نوشتن کش (Cache) وجود دارد. همچنین حالت «Fast mode» با سرعت دو برابر و قیمت دو برابر قیمت استاندارد در دسترس است.

چالش همراستاسازی

با وجود این قدرت، OpenAI اشاره کرده است که نظارت بر استدلال‌های مکتوب Astra سخت‌تر از مدل GPT-5.6 Sol است؛ زیرا Astra مسائل را در گام‌های مکتوب کمتر حل می‌کند و در کارهای ساده‌تر، کنترل شدیدتری روی منطق داخلی خود دارد. برای بهینه‌سازی این تعاملات، OpenAI راهنمای جدیدی برای پرامپت‌نویسی منتشر کرد تا با ممنوعیت «کلمات زائد»، تردید در عملکرد عامل‌های Astra را کاهش دهد.

برای مقابله با این موضوع، OpenAI سیستم‌های نظارت بر عدم‌همراستایی (Misalignment Monitoring) را در محیط عملیاتی مستقر کرده است. این طبقه‌بندها (Classifiers) استدلال‌ها و اقدامات مدل را بازرسی می‌کنند تا هرگونه رفتار غیرمجاز را متوقف کنند. بهبود قابلیت نظارت (Monitorability) همچنان یک اولویت پژوهشی است.

این حرکت نشان‌دهنده گذاری به مرحله‌ای است که در آن گلوگاه اصلی دیگر هوش خام نیست، بلکه توانایی حاکمیت ایمن بر مدلی است که می‌تواند به‌طور خودمختار روی یک کامپیوتر عمل کند. برنده مسابقه هوش مصنوعی سازمانی کسی خواهد بود که بتواند ثابت کند عامل او هنگام بهینه‌سازی یک فایل اکسل، به‌طور تصادفی پایگاه داده تولیدی (Production Database) شرکت را حذف نمی‌کند.

در آینده منتظر برنامه Daybreak باشید؛ برنامه‌ای که OpenAI می‌گوید دسترسی به جریان‌های کاری دفاعی امنیت سایبری، از جمله تحلیل بدافزارها، مهندسی شناسایی و اعتبارسنجی آسیب‌پذیری‌ها را گسترش می‌دهد. Astra اکنون به صف مدل‌های پیشرو در Bedrock می‌پیوندد که شامل GPT-5.6 Sol، Terra، Luna و همچنین نسخه‌های GPT-5.5 و GPT-5.4 است.

گام بعدی شما

  • اگر مدیر فنی هستید، قابلیت Prompt Caching را برای کاهش هزینه‌های تحلیل codebaseهای حجیم تست کنید.
  • دسترسی‌های Agentic را در محیط Sandbox آزمایش کنید تا مرزهای کنترل کامپیوتر توسط Astra را بسنجید.
  • برای کارهای حقوقی، پنجره متنی یک میلیون توکنی را برای تحلیل مجموعه‌ای از قراردادهای متضاد به کار بگیرید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با تکیه بر اعتبار زیرساخت AWS، استقرار عامل‌های خودمختار را در مقیاس سازمانی ممکن می‌کند. جابه‌جایی از API-centric به UI-centric، مدل‌های AI را به کاربران نهایی نرم‌افزارهای تجاری نزدیک‌تر می‌کند.

تأثیر برای ایران

به‌دلیل تحریم‌ها و محدودیت‌های API، دسترسی مستقیم سازمان‌های ایرانی به Amazon Bedrock دشوار است و استفاده از Astra احتمالاً از طریق واسطه‌های خارجی یا VPNهای سازمانی میسر خواهد بود.

·نگاه ما
تحریریه دات‌هوش

تمرکز OpenAI از تولید متن به تولید «عمل» تغییر کرده است. وقتی مدل می‌تواند رابط کاربری را بفهمد، دیگر نیازی به انتظار برای توسعه API توسط شرکت‌های ثالث نیست. این یعنی مدل‌های زبانی از نقش مشاور به نقش مجری تغییر جایگاه داده‌اند و قدرت واقعی اکنون در دست کسی است که بتواند ایمنی این «اجرا» را تضمین کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.