پرش به محتوای اصلی
پرش به محتوای مقاله

OpenAI: مدل Astra پیشرفت چشمگیری در بنچمارک‌های استدلال داشت

·۱۷ شهریور ۱۴۰۵۵ دقیقه مطالعه
نمونه اولیه مدل GPT-6 در حال پردازش زبان طبیعی با معماری پیشرفته شبکه عصبی.
نمونه اولیه مدل GPT-6 در حال پردازش زبان طبیعی با معماری پیشرفته شبکه عصبی.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر پارادایم از Generative AI به Agentic AI؛ مدل Astra به‌جای توصیف نحوه انجام کار، مستقیماً کنترل موس و کیبورد را برای اجرای تسک‌ها در محیط نرم‌افزاری به دست می‌گیرد.

تصور کنید وب‌سایتی سه‌بعدی را که آناتومی بدن انسان را به ۲۲۳۴ قطعه مجزا تقسیم کرده است؛ پروژه‌ای که در ۵ سپتامبر ۲۰۲۶ تنها با کمک GPT-6 Astra ساخته شد. این عرضه، آغاز عصر خانواده GPT-6 است که در آن تمرکز از تولید ساده‌ی متن به تعاملات سریع و خودمختار با محیط کامپیوتر تغییر یافته است.

بر اساس پوشش پیشین ما درباره‌ی استدلال‌های عمیق و تکرارشونده در Astra، این استقرار جدید مدل را از فضای تئوری به اجرای عملی و عامل‌محور (Agentic) منتقل کرده است. برای یک کاربر تجاری، این تغییر شبیه تبدیل یک مشاور است که فقط به شما می‌گوید چگونه یک خانه بسازید، به پیمانکاری که واقعاً ماشین‌آلات ساختمانی را هدایت می‌کند. در واقع، هوش مصنوعی دیگر فقط پیشنهاد نمی‌دهد، بلکه مستقیماً روی نرم‌افزارها کلیک می‌کند و کار را پیش می‌برد.

عملکرد و محک‌های فنی

به گزارش Ben's Bites در ۸ سپتامبر ۲۰۲۶، مدل Astra در حوزه‌های فنی خاص جهش‌های بزرگی داشته است:

  • ARC-AGI-3: طبق گزارش‌ها، این مدل در این محک به‌طور کامل بر رقبای خود غلبه کرده (یا به قول گزارش، آن‌ها را «می‌سوزاند») که نشان‌دهنده‌ی جهشی قابل توجه در هوش عمومی است.
  • AutomationBench: Astra بالاترین امتیاز تاریخ را در محک اتوماسیون شرکت Zapier کسب کرد.
  • هزینه: با وجود افزایش چشمگیر قدرت، قیمت استنتاج آن با مدل Fable 5.1 یکسان باقی مانده است.

نمونه اولیه مدل GPT-6: هوش مصنوعی نسل جدید با قابلیت‌های پیشرفته درک و تولید زبان طبیعی.

قابلیت‌های دنیای واقعی

کاربران هم‌اکنون Astra را برای گردش‌کارهای پیچیده‌ای به کار می‌گیرند که پیش‌تر برای مدل‌های زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — غیرممکن بود. برخی از خیره‌کننده‌ترین نمونه‌های ثبت‌شده، بازسازی شهر منهتن در محیط Unreal Engine و چاپ سه‌بعدی قطعات سخت‌افزاری سفارشی، مانند یک قطعه سفارشی برای تخلیه آب حمام است.

نمونه اولیه مدل GPT-6 در حال پردازش زبان طبیعی با معماری پیشرفته هوش مصنوعی.

در فضای خلاقانه، این مدل می‌تواند به‌طور خودمختار رابط‌های کاربری (UI) را طراحی کند و محصولات واقعی را در Blender مدل‌سازی نماید. تأخیر در استفاده از کامپیوتر اکنون چنان پایین است که مدل می‌تواند کارهایی با دقت بسیار بالا، حتی در حد نواختن پیانو، انجام دهد. Astra حتی می‌تواند در Canva پرتره‌ای بکشد؛ دقیقاً همان‌طور که یک انسان از موس و کیبورد استفاده می‌کند، اما با بازدهی و سرعت بیشتر.

نمونه اولیه مدل GPT-6 در حال پردازش یک درخواست پیچیده چندوجهی

فراتر از هنرهای بصری، Astra استدلال‌های حسی منحصربه‌فردی نشان می‌دهد. این مدل می‌تواند صداها را از روی طیف‌نگاشت‌ها (Mel Spectrograms) — که در واقع تصاویری از فرکانس‌های صوتی هستند — به‌صورت Zero-shot (بدون نیاز به مثال‌های قبلی) شناسایی کند. این قابلیت نشان می‌دهد مهارت‌های استدلالی مدل در حوزه‌هایی وجود دارد که هنوز به‌طور کامل کشف و بررسی نشده‌اند.

مشکل «اسب نمایش»

با وجود این نقاط قوت، برخی Astra را «اسب نمایش» می‌نامند، نه «اسب کاری». کاربران اولیه گزارش داده‌اند که عملکرد مدل «پیک‌دار» یا نوسانی است؛ یعنی ممکن است در یک پرامپت معجزه‌ای خلق کند، اما در دستور بعدی در یک امر ابتدایی شکست بخورد. تئو، یکی از کاربران مدل، تجربه‌اش را ترکیبی از عشق و نفرت مطلق توصیف کرده است.

نمونه اولیه مدل GPT-6 در حال پردازش زبان طبیعی با معماری پیشرفته هوش مصنوعی.

یک کاربر اشاره کرد که در یک آخر هفته ۴ میلیارد توکن (Token) — تکه‌های کوچکی از متن که مدل تکه‌تکه می‌خورد — مصرف کرده اما در نهایت به هیچ محصول تمام‌شده‌ای نرسیده است. این ماهیت «توکن‌خوار» مدل می‌تواند برای گردش‌کارهای ناکارآمد، بسیار هزینه‌بر باشد. این کاربر همچنین اشاره کرد که با ارسال ترکیبی از درخواست‌های طولانی‌مدت و کوتاه، تمام «ریست‌های ذخیره شده» (Banked Resets) خود را هدر داده است.

برای رفع این مشکلات، برخی کاربران به ترفندهای خاص روی آورده‌اند. دن مک‌اتیر پیشنهاد می‌کند کپی کردن اسکرین‌شات‌های خاص در Codex می‌تواند اکثر خطاهای Astra در پیروی از دستورات را حل کند. همچنین هشدار داده شده که دستورالعمل‌های قدیمیِ مربوط به عامل‌ها (Agent Instructions) ممکن است در واقع مانع از رسیدن Astra به پتانسیل کاملش شوند.

تکامل عامل‌محور

اوپن‌ای‌آی همچنین Astra را با Codex ادغام کرده است تا مدل بتواند بدون توقف برای دریافت پاسخ، سؤال بپرسد. اکنون مدل می‌تواند پاسخ‌های احتمالی را فرض کند و کار را پیش ببرد و هرگاه پاسخ واقعی کاربر رسید، آن را بدون گم کردن مسیر اصلی در جریان کار ادغام کند.

نمونه اولیه مدل GPT-6: معماری شبکه عصبی پیشرفته با قابلیت پردازش زبان طبیعی و چندوجهی

علاوه بر این, OpenAI اعلام کرد که به هدف «کارآموز پژوهشی خودکار» رسیده است. این عامل‌ها اکنون می‌توانند کارهای پژوهشی را که برای یک انسان متخصص چندین روز زمان می‌برد، مدیریت کنند؛ هرچند انسان هنوز باید مسیر کلی را تعیین و نتایج نهایی را قضاوت کند. هدف بعدی شرکت، توسعه یک پژوهشگر کاملاً خودکار تا مارس ۲۰۲۸ است.

چشم‌انداز رقابتی

در حالی که OpenAI روی عامل‌ها فشار می‌آورد، Anthropic در حال آزمایش راهی است تا Claude Code بتواند افزونه‌های (Plugin) خودش را بنویسد. این قابلیت به عامل اجازه می‌دهد رابط کاربری خود را تغییر دهد، اقداماتش را ثبت (Log) کند و دسترسی‌های خود را به‌طور خودمختار محدود نماید. این قابلیت هنوز عرضه نشده و تیم توسعه در حال حاضر در جستجوی بازخوردهای کاربران است.

در حوزه زیرساخت، Inworld سیستم Realtime TTS-2 را برای اپلیکیشن‌های مصرف‌کننده ساخته است. این سیستم دارای طراحی صدای متن‌محور، یک هویت صوتی واحد برای بیش از ۲۰۰ زبان و تأخیر زیر ۱۰۰ میلی‌ثانیه در سطح P99 است.

هم‌زمان، Mistral پس از جذب سرمایه ۳ میلیارد یورویی به رهبری Samsung، در حال گسترش زیرساخت‌های خود است و ارزش این شرکت اکنون بیش از ۲۱ میلیارد یورو برآورد می‌شود.

ابزارهای نوظهور و اکوسیستم

در کنار عصر GPT-6، ابزارهای دیگری نیز در حال ظهور هستند:

  • Uzu by Mirai: اجرای مدل‌های محلی ۲ تا ۳ برابر سریع‌تر روی مک‌های اپل. در این راستا، بحث بر سر برتری مدل‌های کوچک تخصصی در برابر مدل‌های جامع برای میزبانی شخصی شدت گرفته است تا بهینه‌ترین راه برای اجرای محلی هوش مصنوعی پیدا شود.
  • Tangerine: تبدیل فایل‌ها برای کاربران مک تنها با نگه داشتن کلید Shift و کشیدن فایل.
  • Baseten: راه‌اندازی یک آزمایشگاه پژوهشی بازمتن (Open-source) برای هوش مصنوعی.
  • SuperAstra: امکان ویرایش زنده بازی‌های کنسول سوپر نینتندو.
  • ChatGPT Work: اکنون قادر است سبک نوشتاری خاص کاربر را از روی ایمیل‌ها، پیام‌ها و فایل‌های او یاد بگیرد.

این چرخش به سمت «استفاده از کامپیوتر» یعنی ارزش یک هوش مصنوعی دیگر فقط در دانش آن نیست، بلکه در توانایی‌اش برای مدیریت و دستکاری نرم‌افزارهاست. برای یک صاحب کسب‌وکار، گلوگاه دیگر توانایی AI نیست، بلکه مهارت کاربر در سازماندهی این عامل‌ها بدون هدر دادن میلیون‌ها توکن است.

منتظر عرضه GPT-6.3 در ماه‌های آینده باشید؛ الگوهای تاریخی زمان عرضه GPT-5 نشان می‌دهد که این «پیک‌داری» و نوسانات اولیه معمولاً در به‌روزرسانی‌های تکمیلی برطرف می‌شوند.

گام بعدی شما

  • اگر از ابزارهای اتوماسیون استفاده می‌کنید، جریان‌های کاری خود را از «دریافت دستور» به «اجرای مستقیم در نرم‌افزار» تغییر دهید.
  • برای کاهش هزینه‌ها، از ترفند اسکرین‌شات در Codex برای هدایت دقیق‌تر مدل استفاده کنید.
  • خروجی‌های Astra را در محیط‌های سه‌بعدی مثل Blender تست کنید تا سرعت تولید پروتوتایپ خود را بسنجید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تحول با تکیه بر اعتبار بنچمارک‌های اتوماسیون، تعریف «بهره‌وری» را از نوشتن متن به اجرای عملیاتی تغییر می‌دهد. اکنون عامل‌های هوش مصنوعی می‌توانند جایگزین رابط‌های گرافیکی سنتی شوند و مستقیماً نرم‌افزارها را مدیریت کنند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی توسعه‌دهندگان ایرانی به قابلیت‌های Computer Use مدل Astra محدود است و احتمالاً از طریق واسطه‌های شخص ثالث با تأخیر زیاد در دسترس قرار می‌گیرد.

·نگاه ما
تحریریه دات‌هوش

انتقال از تولید محتوا به کنترل محیط (Computer Use) نشان می‌دهد که OpenAI دیگر مدل را به‌عنوان یک چت‌بات، بلکه به‌عنوان یک سیستم‌عامل می‌بیند. نوسان در عملکرد Astra (مشکل اسب نمایش) احتمالاً ناشی از تضاد بین استدلال عمیق و سرعت اجرای دستورات است. به نظر ما، برنده واقعی این رقابت کسی نیست که مدل قدرتمندتری دارد، بلکه کسی است که بتواند «هزینه توکن» را در برابر «دقت اجرا» بهینه کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.