پرش به محتوای اصلی
پرش به محتوای مقاله

GPT-6 Astra در محک Vending-Bench از مدل Claude Fable پیشی گرفت

·۱۹ شهریور ۱۴۰۵۵ دقیقه مطالعه
موزه‌ای الهام‌بخش برای هر کس: مجسمه‌ای کلاسیک در فضایی مدرن
موزه‌ای الهام‌بخش برای هر کس: مجسمه‌ای کلاسیک در فضایی مدرن
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نخستین باری است که یک مدل پیشرو توانسته است هم‌زمان در سودآوری اقتصادی و رعایت اخلاقیات در محک Vending-Bench رتبه اول را کسب کند و تضاد سنتی میان قدرت و اخلاق را از بین ببرد.

تصور کنید دستیاری دارید که هر کلیک و تایپی را که شما در کامپیوتر انجام می‌دهید، با سرعت و دقتی خیره‌کننده به‌جای شما اجرا کند. اوپن‌ای‌آی (OpenAI) در ۸ سپتامبر ۲۰۲۶ مدل GPT-6 Astra را معرفی کرد تا رقیبی مستقیم برای عامل‌های شخصی مانند Muse متا، Grok Bot و Instinct باشد.

موجودی الهام‌بخش: هر کس به یک موهبت الهی نیاز دارد.

این عرضه در حالی رخ می‌دهد که صنعت از چت‌بات‌های ساده به سمت عامل‌های هوش مصنوعی (AI Agents) — شبیه به کارمندانی دیجیتال که به‌جای پیشنهاد دادن، واقعاً کارهای شما را انجام می‌دهند — حرکت می‌کند. این عامل‌ها می‌توانند سفر شما را رزرو کنند، ایمیل‌ها را مدیریت کنند و نرم‌افزارها را کنترل کنند. در حالی که مدل‌های پیشین در درک چیدمان صفحات (Layout) و طراحی‌های ثابت مشکل داشتند، نسل جدید قصد دارد فاصله میان «قصد کاربر» و «اجرای عملی» را پر کند.

زمینه و رقابت در بازار

ورود متا به جنگ عامل‌ها با معرفی Muse صورت گرفت. این عامل شخصی به‌گونه‌ای طراحی شده است که بتواند «هر تسکی» را در کامپیوتر مدیریت کند. روایت متا بر این نکته تأکید دارد که Muse امن‌تر از رقبای خود ساخته شده است. این ابزار به کاربران اجازه می‌دهد حساب‌های فیس‌بوک و اینستاگرام خود را مستقیماً به آن متصل کنند. در حال حاضر، دسترسی به Muse تنها برای بزرگسالان در ایالات متحده فراهم است.

سایر تحولات در این اکوسیستم شامل Spacefast است که به کاربران اجازه می‌دهد با استفاده از عامل‌ها، سایت‌ها و اپلیکیشن‌های کامل را به‌سرعت منتشر کنند. به همین ترتیب، Indent یک عامل مشترک واحد را برای کل یک شرکت فراهم می‌کند. برای توسعه‌دهندگان نیز، Eraser Diagrams یک فرمت متن‌باز معرفی کرده است که به هوش مصنوعی اجازه می‌دهد نمودارها را به‌طور مؤثر رسم کرده و چیدمان آن‌ها را مدیریت کند.

طبق گزارش Andon Labs در ۸ سپتامبر ۲۰۲۶، مدل Astra بزرگ‌ترین جهش تاریخ محک (Benchmark) — یعنی آزمونی استاندارد برای سنجش قدرت مدل‌ها — به نام Vending-Bench را ثبت کرد. نتایج این بنچمارک نشان می‌دهد که Astra نه‌تنها در تولید سود از Claude Fable 5.1 بهتر عمل می‌کند، بلکه اخلاقی‌تر نیز است. این نخستین بار است که اوپن‌ای‌آی جایگاه اول این محک خاص را تصاحب می‌کند و روندی را می‌شکند که در آن، توانمندترین مدل‌ها اغلب کم‌اخلاقی‌ترین مدل‌ها بودند.

دو زن در حال گفتگوی خلاقانه، نمادی از الهام‌بخشی متقابل

قابلیت‌های فنی و ادغام

فراتر از اعداد و بنچمارک‌ها، این مدل قابلیت‌های عملی پیشرفته‌ای را در دنیای واقعی به نمایش گذاشته است:

  • کنترل کامپیوتر: Astra می‌تواند هر رابط نرم‌افزاری را برای تکمیل گردش‌های کاری پیچیده مدیریت کند. اوپن‌ای‌آی آن را به‌گونه‌ای توصیف می‌کند که قادر است هر کاری را که شما در کامپیوتر انجام می‌دهید، اما با سرعت بسیار بیشتر، اجرا کند.
  • ادغام با رباتیک: در یک نمایش عملی، Astra به یک ربات، یک قلم‌مو و یک دوربین دسترسی داشت. از مدل خواسته شد تا نقاشی پل گلدن گیت را در دنیای واقعی بکشد. مدل توانست راه کنترل ربات را پیدا کند و به‌مرور تلاش‌های خود را برای رسیدن به نتیجه بهتر بهبود ببخشد.
  • کدنویسی خلاق: کاربران گزارش داده‌اند که از Astra برای ساخت نسخه‌های متحرک و تعاملی از کتاب سال ۱۸۶۸ با عنوان 507 Mechanical Motions استفاده کرده‌اند. کاربران دیگری مانند ChrisGPT ادعا می‌کنند که توانسته‌اند با استفاده از GPT-6، بازی GTA 6 را تنها در ۹۰ ساعت بسازند.
  • رایانش لبه (Edge Computing): پیشرفت‌های جدید این امکان را فراهم کرده است که یک مدل زبانی ۳۵ میلیارد پارامتری (35B) مستقیماً روی یک آیفون اجرا شود.

موزا: الهام‌بخش هنر و خلاقیت در تاریخ بشریت

پیشرفت‌های ریاضی و ایمنی

اوپن‌ای‌آی همچنین در ریاضیات محض گام‌های بزرگی برداشته است. این شرکت توانست مسئله ناویر-استوکس (Navier-Stokes) را حل کند؛ یکی از هفت مسئله جایزه هزاره که در سال ۲۰۰۰ تعریف شده بود. این یک دستاورد عظیم در مکانیک سیالات است. فرآیند رسیدن به این پاسخ دراماتیک بود و با جنجال‌هایی درباره مالکیت اثر و نویسندگی همراه شد. گزارش شده است که اوپن‌ای‌آی پس از شنیدن شایعاتی مبنی بر اینکه آنتروپیک (Anthropic) یکی دیگر از مسائل جایزه هزاره را حل کرده است، این مسیر را با جدیت دنبال کرد.

هر کسی نیاز به یک موز دارد.

با این حال، سرعت رشد مدل‌ها نگرانی‌های ایمنی را برانگیخته است. جیک کاکسون، کارمند فعلی آنتروپیک و عضو سابق اوپن‌ای‌آی، با انتشار توییتی به دلیل مسائل ایمنی استعفا داد. این پیام به یکی از پربیننده‌ترین ارتباطات مربوط به ایمنی هوش مصنوعی (AI Safety) در تاریخ تبدیل شد، هرچند برخی منتقدان این موضوع را یک توطئه می‌دانند. هم‌زمان، اوپن‌ای‌آی در حال افزودن یک متخصص برجسته دیگر در زمینه ایمنی به هیئت‌مدیره خود است.

به‌روزرسانی‌های ابزاری و اکوسیستم

  • ChatGPT Images 2.5: مدل جدید تولید تصویر اوپن‌ای‌آی است که زمان ساخت تصویر را تا ۵۰٪ کاهش داده و در ویرایش عناصر خاص تصویر، در حالی که بقیه بخش‌ها ثابت می‌مانند، تخصص دارد. این مدل شامل ویژگی «Sketch» است که در آن کاربر خطوط ساده‌ای را می‌کشد و هوش مصنوعی آن‌ها را به تصاویر کامل تبدیل می‌کند.
  • Codex: اکنون دارای یک پلاگین Unity و مجموعه‌ای تخصصی از پلاگین‌ها برای کسب‌وکارهای کوچک است.
  • iOS 28: انتظار می‌رود این نسخه شامل قابلیتی باشد که اصالت یک عکس را اثبات کند.
  • مدل اقتصادی آنتروپیک: شرکت آنتروپیک یک مدل تعاملی ساخته است که اقتصاد سال ۲۰۳۰ را شبیه‌سازی می‌کند.

موزا: الهام‌بخش خلاقیت در هر شخص

چرخش به سمت هوش مصنوعی عامل‌محور (Agentic) به این معناست که ارزش از «دانش مدل» به «توانایی عمل» منتقل شده است. برای یک متخصص، این یعنی خداحافظی با مهندسی پرامپت (Prompt Engineering) — هنر سؤال درست پرسیدن برای گرفتن جواب — و حرکت به سمت تفویض کامل گردش‌های کاری. پیروزی در Vending-Bench نشان می‌دهد عصر بعدی هوش مصنوعی با سودآوری اقتصادی و همراستایی اخلاقی سنجیده می‌شود، نه فقط تسلط زبانی.

اگر در حال ساخت محصول با این ابزارها هستید، منتظر اکران فیلم Artificial در کریسمس پیش رو باشید. این فیلم تلاطم‌های داخلی مدیریت اوپن‌ای‌آی در سه سال پیش، به‌ویژه اخراج و استخدام مجدد سم آلتمن را به تصویر می‌کشد. اندرو گارفیلد نقش آلتمن را در فیلمی بازی می‌کند که توصیف شده حال و هوایی «ناامیدانه و آخرالزمانی» (doomerish vibe) دارد.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، قابلیت‌های کنترل رابط کاربری Astra را برای خودکارسازی تسک‌های تکراری بررسی کنید.
  • برای درک تفاوت مدل‌های زبانی و عامل‌ها، نتایج Vending-Bench را با معیارهای قدیمی مقایسه کنید.
  • ابزارهای جدید Codex را برای بهینه‌سازی گردش کارهای کسب‌وکارهای کوچک تست کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تحول با تکیه بر اعتبار علمی حل مسائل ریاضی و نتایج محک‌های اقتصادی، تعریف موفقیت در AI را از روانی متن به کارایی عملی تغییر می‌دهد. اکنون عامل‌ها می‌توانند جایگزین نرم‌افزارهای سنتی شوند و مستقیماً روی سودآوری کسب‌وکارها اثر بگذارند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم به GPT-6 Astra برای توسعه‌دهندگان ایرانی دشوار است؛ اما ظهور مدل‌های ۳۵ میلیاردی روی موبایل، فرصت‌های جدیدی برای اجرای محلی مدل‌ها در ایران ایجاد می‌کند.

·نگاه ما
تحریریه دات‌هوش

تمرکز اوپن‌ای‌آی بر حل مسائل ریاضی هزاره و تسلط بر Vending-Bench نشان می‌دهد که این شرکت دیگر به دنبال «بهتر حرف زدن» مدل‌ها نیست، بلکه به دنبال «بهتر فکر کردن» و «بهتر عمل کردن» است. این تغییر استراتژی، مدل‌های زبانی را از ابزارهای تولید محتوا به موتورهای حل مسئله تبدیل می‌کند که مستقیماً در اقتصاد دیجیتال ارزش خلق می‌کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.