پرش به محتوای اصلی
پرش به محتوای مقاله

OpenAI در برابر متا و آنتروپیک؛ رقابت برای تسلط بر عامل‌های خودگردان

·۱۵ شهریور ۱۴۰۵۹ دقیقه مطالعه
دستیار هوشمند OpenAI: آیا جارویس واقعی ساخته شد؟
دستیار هوشمند OpenAI: آیا جارویس واقعی ساخته شد؟
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

دستیابی به دقت ۹۹.۹٪ در داده‌های نیمه‌خصوصی ARC AGI 3 و توانایی استخراج خودکار نقاط ضعف امنیتی Zero-day، این مدل را از یک تولیدکننده متن به یک عامل عملیاتی تبدیل کرده است.

اگر امروز برای اشتراک مدل‌های زبانی هزینه می‌پردازید، باید بدانید که ابزار شما از یک پنجرهٔ متنی ساده به همکاری تبدیل شده که می‌تواند موس و کیبورد شما را کنترل کند. این همان اتفاقی است که با معرفی GPT-6 Astra در ۴ سپتامبر ۲۰۲۶ رخ داد. دقت ۹۹.۹٪ در مجموعه داده‌های نیمه‌خصوصی ARC AGI 3؛ این همان بنچمارکی است که OpenAI با عرضه Astra به آن دست یافت. این لانچ نشان‌دهنده یک تغییر بنیادین از چت‌بات‌ها به کارگران دیجیتال خودگردان است، زیرا اکنون یک مدل واحد می‌تواند به‌طور مستقل نرم‌افزارهای سه‌بعدی را مدیریت کند و بدون راهنمایی انسان، نقاط ضعف امنیتی روز-صفر (zero-day) را استخراج نماید.

این عرضه در بازه‌ای پرآشوب در اوایل سپتامبر ۲۰۲۶ رخ داد، جایی که تمام آزمایشگاه‌های پیشرو صنعت به‌روزرسانی‌های مرزی خود را منتشر کردند. همان‌طور که در تحلیل قبلی ما درباره‌ی تلاش‌های OpenAI برای خودبه‌بهبود بازگشتی اشاره کردیم، Astra در واقع کاربرد عملی همان اهداف پژوهشی است. این پیشرفت‌ها را می‌توان در راستای نقشه راه بلندمدت OpenAI برای دستیابی به AGI تا پایان سال ۲۰۲۶ دانست که هدف آن خلق سیستم‌های کاملاً خودگردان است. برای یک کاربر تجاری، این لحظه‌ای است که هوش مصنوعی از پنجره‌ای که در آن تایپ می‌کنید، به همکاری تبدیل می‌شود که کنترل موس و کیبورد شما را در دست می‌گیرد.

هرج‌ومرج در عرضه Astra

معمولاً هفته اول سپتامبر در دنیای فناوری آرام است، اما امسال انگار AGI منتظر هیچ‌کس نماند. روند عرضه با مجموعه‌ای از شکست‌های سینمایی همراه بود. درست پیش از معرفی، سرویس‌های بزرگی مثل ChatGPT، Claude، Grok و Cursor به‌طور هم‌زمان از دسترس خارج شدند. با اینکه منطقی‌ترین دلیل، اختلال گسترده در زیرساخت‌های ابری Azure بود، اما زمان‌بندی آن شایعاتی را برانگیخت که اولین اقدام Astra به عنوان یک مدل عمومی، ترور رقبایش بوده است.

رونمایی رسمی OpenAI هم به‌هم‌ریخته بود. شرکت صفحه معرفی را منتشر کرد و خبرگزاری‌های بزرگ داستان‌های خود را که تحت قرارداد عدم انتشار (embargo) بودند، چاپ کردند؛ اما سپس OpenAI به‌دلیل دلایلی که هیچ‌کس به‌طور کامل درک نمی‌کند، صفحه را برای ۹۰ دقیقه پایین کشید. این اتفاق باعث شد یک بازی جایگاه (status game) میان اینفلوئنسرهای فناوری شکل بگیرد؛ آن‌ها شروع به به رخ کشیدن این موضوع کردند که چه مدت به‌طور مخفیانه دسترسی زودهنگام به Astra داشته‌اند، در حالی که کاربران عادی در انتظار بودند.

سام آلتمن، مدیرعامل شرکت، در یکی از صادقانه‌ترین و بی‌رحمانه‌ترین پاسخ‌های تاریخ خدمات مشتریان، وقتی مشترکی مشتاق پرسید آیا برای انتظار برای عرضه بیدار بماند یا خیر، خیلی ساده جواب داد: «برو بخواب».

دستیار هوش مصنوعی OpenAI که شبیه جارویس آیرون من عمل می‌کند.

پشت صحنه، این مدل پیش از آنکه عموم حتی نگاهی به آن بیندازند، مورد بررسی رسمی دولت ترامپ قرار گرفت. مقیاس مهندسی این پروژه عظیم بود: آموزش روی بیش از ۱۰۰ هزار GPU (واحد پردازش گرافیکی) در سایت Stargate تگزاس. قابلیت‌های حاصله خیره‌کننده است، اما در محیطی به‌شدت رقابتی قرار دارد.

رقبا: آنتروپیک و متا

در حالی که OpenAI تیتر خبرها را گرفت، Anthropic روز سه‌شنبه ۲ سپتامبر ۲۰۲۶ با عرضه Fable 5.1 و Mythos 5.1 هفته را آغاز کرد. این مدل‌ها به عنوان هیولاهایی مطلق برای کارهای عمیق دانشی و برنامه‌نویسی طراحی شده‌اند.

  • Fable 5.1 و مورد Millennium: یک صندوق پوششی به نام Millennium نرم‌افزاری داشت که در طول پنج سال، تقریباً هر یک میلیون بار، یک بار کرش می‌کرد. مهندسان انسان نتوانستند علت را بیابند. Fable 5.1 یک عکس از حافظه (memory snapshot) در لحظه کرش گرفت، یک کتابخانه کامپایل‌شده فروشنده را به زبان اسمبلی خام بازگرداند (disassemble)، پایین‌ترین سطح کد ماشین را خواند و باگ دقیق را در نرم‌افزار فروشنده شناسایی کرد.
  • Mythos 5.1 و زیست‌شناسی: در پزشکی مدرن، طراحی پروتئینی که به هدفی خاص بچسبد، اولین قدم است. به‌طور تاریخی، سیستم‌های هوش مصنوعی این کار را حدود ۱۰٪ از مواقع با موفقیت انجام می‌دادند. Mythos 5.1 این نرخ موفقیت را به عدد خیره‌کننده ۵۰٪ رساند.
  • داده‌های ناسا: آنتروپیک همچنین تطبیق‌پذیری مدل را با آموزش یک شبکه عصبی روی داده‌های راداری ۳۰ ساله ناسا به نمایش گذاشت تا یک نقشه ارتفاعی کاملاً جدید برای بخش خاصی از سیاره زهره بسازد.

دستیار هوشمند OpenAI: آیا جارویس واقعی ساخته شد؟

در همین حال، Meta روز چهارشنبه ۳ سپتامبر ۲۰۲۶ با معرفی Muse Spark 1.3 بازی را تغییر داد. استراتژی متا این است که به‌طور تهاجمی کل بازار را از نظر قیمت پایین بیاورد و بر هزینه توکن‌های ورودی (داده‌های داده شده به AI) و توکن‌های خروجی (داده‌های تولید شده) تمرکز کند.

متا یک نقطه اتصال (endpoint) استاندارد معرفی کرد که همین حالا هم به‌شدت ارزان است، اما آن‌ها همچنین یک «سطح مشارکت‌کننده» (contributor tier) را راه‌اندازی کردند. تحت این سطح، اگر کاربران موافقت کنند که متا مدل‌های هوش مصنوعی آینده را روی تک‌تک داده‌هایی که ارسال می‌کنند آموزش دهد، دسترسی را با قیمتی در حد چند سنت دریافت می‌کنند. تحلیلگران صنعت گزارش می‌دهند که درصد دو رقمی توسعه‌دهندگان این گزینه را انتخاب کرده‌اند و حریم خصوصی داده‌های خود را با صرفه‌جویی شدید در هزینه‌ها معاوضه کرده‌اند.

شکستن پارادوکس استدلال

روی کاغذ، بنچمارک‌های کلی Astra متناقض است. وقتی OpenAI مدل را در روز پنجشنبه منتشر کرد، ۱۴ بنچمارک خاص را برجسته کرد که در آن‌ها Astra تسلط داشت. اما تخته‌های امتیازات مستقل شخص ثالث روایت دیگری دارند. در شاخص Artificial Analysis Intelligence Index، مدل GPT-6 Astra امتیاز ۶۱ گرفت. این امتیاز آن را ۵ امتیاز پشت سر Fable 5.1 آنتروپیک قرار داد و دقیقاً با مدل قدیمی‌تر OpenAI یعنی GPT-5.6 Soul برابر کرد. این مدل حتی پشت سر Muse Spark 1.3 متا قرار گرفت.

تصویری از رابط هوش مصنوعی مدرن که به جارویس آیرون من شباهت دارد.

این یک پارادوکس بنچمارک ایجاد می‌کند. یک بنچمارک ترکیبی در واقع یک پوشش (wrapper) است؛ همان‌طور که یک پوشش بد در توسعه نرم‌افزار می‌تواند مکانیسم‌های واقعی برنامه را پنهان کند، یک شاخص بنچمارک بد هم می‌تواند هوش واقعی را مخفی کند. برای دیدن پیشرفت، باید به تست‌های تک‌به‌تک نگاه کرد.

چالش ARC AGI 3
Astra در ARC AGI 3 به دقت ۹۹.۹٪ رسید. این محک به دلیل انتزاعی بودن بالا و عدم امکان حل از طریق حفظ کردن، بسیار معتبر است. مدل باید بازی‌های منطقی را بدون دریافت قوانین خاص حل کند. اگرچه عامل AVO انویدیا امتیاز ۱۰۰٪ گرفت، اما تفاوت در اینجا حیاتی است:

  • قالب: تست یک شبکه ۶۴ در ۶۴ با ۱۶ رنگ است. هوش مصنوعی یک شیء متنی JSON عظیم دریافت می‌کند و توکن‌های عملیاتی می‌فرستد؛ یعنی هیچ اسکرین‌شات یا ویدیویی نمی‌بیند.
  • مجموعه داده: انویدیا امتیاز خود را روی مجموعه داده‌های عمومی به دست آورد. اما Astra دقت ۹۹.۹٪ را روی مجموعه داده‌های نیمه‌خصوصی کسب کرد؛ به این معنی که محیط‌ها به‌طور امن توسط بنیاد Arc تهیه و از عموم پنهان شده بود. Astra مجبور بود پازل‌های منطقی کاملاً دیده‌نشده را در لحظه حل کند.

تسلط بر ریاضیات پیشرو
Astra در محک Frontier Math که توسط بیش از ۷۰ ریاضیدان خبره نوشته شده، ارزیابی شد. این تست بر اساس دشواری لایه‌بندی شده است:

  • لایه ۱: جبر خطی.
  • لایه ۳: نظریه اعداد پیچیده و چگالی اعداد اول.
  • لایه ۴: ریاضیاتی چنان دشوار که اکثر انسان‌ها حتی نمی‌توانند سوالات را درک کنند.

Astra لایه ۴ را با امتیاز ۹۷.۶٪ پشت سر گذاشت و رقبا را کاملاً کنار زد.

دستیار هوشمند OpenAI: آیا جارویس آیرون من واقعی شد؟

امنیت سایبری و بهره‌وری توکن

Astra نخستین مدلی است که در چارچوب آمادگی OpenAI به آستانه بحرانی سایبری رسید. این یعنی مدل آن‌قدر هوشمند است که بتواند نقاط ضعف امنیتی Zero-day را کاملاً به‌تنهایی و بدون دستور انسان پیدا و استخراج کند. این توانایی هک خودکار منجر به امتیاز کامل ۱۰۰٪ در ارزیابی Exploit Bench شد.

OpenAI همچنین از بهینه‌سازی هزینه به سمت بهینه‌سازی توکن چرخش کرد. در محک Deep Suite، مدل Astra امتیاز ۷۴٪ گرفت. پیشرفت اصلی این است که GPT-6 Astra برای رسیدن به همان نتایج درست، نیمی از تعداد توکن‌های خروجی مدل‌های قبلی را مصرف کرد.

دستیار هوش مصنوعی OpenAI که شبیه جارویس آیرون من است.

برای درک اهمیت این موضوع، قیمت مدل‌های پیشرو فعلی را مقایسه می‌کنیم:

  • GPT-6 Astra: ۱۰ دلار (ورودی) / ۵۰ دلار (خروجی) هر میلیون توکن. مزیت کلیدی: بهره‌وری شدید توکن.
  • Fable 5.1: ۱۰ دلار (ورودی) / ۵۰ دلار (خروجی) هر میلیون توکن. مزیت کلیدی: استدلال سطح بالا.
  • GPT-5.6 Soul: ۴ دلار (ورودی) / ۲۰ دلار (خروجی) هر میلیون توکن. خط پایه نسل قبل.
  • Muse Spark 1.3: ۱.۲۵ دلار (ورودی) / ۴.۲۵ دلار (خروجی) هر میلیون توکن. قیمت استاندارد باورنکردنی.
  • Muse Spark 1.3 (مشارکتی): ۰.۱۰ دلار (ورودی) / ۰.۲۰ دلار (خروجی) هر میلیون توکن. تقریباً رایگان، نیازمند اشتراک داده.

اگرچه ۵۰ دلار برای هر میلیون توکن خروجی گران به نظر می‌رسد، اما Astra مثل یک پیمانکار خبره عمل می‌کند. اگر یک پیمانکار ۲۰ دلار در ساعت بگیرد اما یک هفته زمان ببرد، و دیگری ۵۰ دلار بگیرد اما کار را در دو روز بی‌نقص تمام کند، دومی بهینه‌تر است. Astra همان پیمانکار بهینه است که در زمان و قدرت محاسباتی صرفه‌جویی می‌کند.

مسیر رسیدن به یک «جارویس» واقعی

بزرگ‌ترین جهش در «استفاده از رایانه» (computer use) است؛ تبدیل هوش مصنوعی از یک چت‌بات به یک کارگر دیجیتال خودگردان. در محک OSWorld — که مدل را در یک محیط دسکتاپ واقعی قرار می‌دهد تا کارهای اداری را با استفاده از موس و کیبورد انجام دهد — Astra امتیاز ۷۳٪ گرفت.

نکته کلیدی این است که این وظایف در حدود ۴۰ دقیقه انجام شد، که پیشرفتی عظیم نسبت به مدل‌های قبلی است که بیش از یک ساعت زمان می‌بردند و امتیاز کمتری می‌گرفتند. تسترها نتایج خیره‌کننده‌ای را تنها با دستورات صوتی گزارش کرده‌اند:

  • مدلسازی سه‌بعدی: یک تستر مشاهده کرد که Astra به‌طور خودکار نرم‌افزار Blender را برای بازسازی دقیق «کاخ هنرهای زیبا» در فضای سه‌بعدی اجرا کرد.
  • موتورهای بازی: تستر دیگری از Astra خواست محیطی کاملاً قابل پیمایش در Unreal Engine 5 بسازد.
  • همکاری عامل‌ها: یک توسعه‌دهنده از Astra خواست دنیایی در Unreal Engine بسازد و آن را با دوجین عامل (Agent) — دستیارهای کوچکی که هر کدام وظیفه‌ای دارند — پر کند. یک روز بعد، توسعه‌دهنده متوجه شد عامل‌ها فعالانه با هم همکاری می‌کنند و درباره ساخت یک اپلیکیشن دوست‌یابی برای اسب‌ها بحث می‌کنند! با این حال، این سطح از اتوماسیون هنوز با چالش‌های ساختاری روبروست؛ همان‌طور که در بررسی ما درباره چالش‌های استارتاپ‌های AI در تولید معماری‌های نرم‌افزاری پایدار اشاره شد، سرعت تولید کد لزوماً به معنای خلق محصولات انقلابی نیست.

دستیار هوشمند OpenAI: آیا جارویس آیرون من واقعی شد؟

این گذار یعنی هوش مصنوعی از ابزاری که به سوالات پاسخ می‌دهد، به عاملی تبدیل می‌شود که گردش‌های کاری (workflows) را اجرا می‌کند. توانایی اجرای نرم‌افزارهای پیچیده از طریق دستورات صوتی، صنعت را به دستیار خودکاری که به عنوان «جارویس» تصور می‌شد، نزدیک‌تر می‌کند.

دستیار هوشمند OpenAI که شبیه جارویس مرد آهنی است، در حال تایپ روی کیبورد در یک اتاق مدرن.

برای یک صاحب کسب‌وکار، این یعنی هزینه نیروی کار دیجیتال پیچیده در حال سقوط است. ارزش دیگر در توانایی مدل برای نوشتن یک پاراگراف نیست، بلکه در توانایی مدیریت یک پشته نرم‌افزاری (software stack) است. ما از مدل‌هایی که فقط متن تولید می‌کنند، به سمت سیستم‌هایی می‌رویم که می‌توانند زبان اسمبلی را دیباگ کنند، پروتئین‌های نجات‌بخش طراحی کنند و رایانه‌های ما را مدیریت نمایند.

منتظر موج بعدی ادغام‌ها در سطح سیستم‌عامل باشید، زیرا OpenAI و Meta برای تبدیل شدن به رابط اصلی سیستم‌عامل شما با هم می‌جنگند.

گام بعدی شما

  • اگر از ابزارهای اتوماسیون استفاده می‌کنید، بررسی کنید که آیا گردش‌های کاری شما قابلیت تبدیل به مدل‌های عامل‌محور (Agentic) دارند یا خیر.
  • برای توسعه‌دهندگان: بررسی کنید که آیا کاهش توکن‌های خروجی در Astra می‌تواند هزینه استنتاج شما را علی‌رغم قیمت بالاتر هر توکن، کاهش دهد.
  • قابلیت‌های کنترل دسکتاپ را در محیط‌های ایزوله تست کنید تا حد از خطاهای احتمالی در دسترسی به فایل‌ها آگاه شوید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با عبور از مرز استدلال انتزاعی و کنترل مستقیم سیستم‌عامل، اعتبار ادعاهای OpenAI درباره نزدیکی به AGI را تقویت می‌کند. تغییر پارادایم از تولید محتوا به اجرای عملیاتی، مدل‌های زبانی را به زیرساختی برای اتوماسیون کامل کسب‌وکارها تبدیل می‌کند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی توسعه‌دهندگان ایرانی به قابلیت‌های کنترل رایانه Astra محدود است و احتمالاً تنها از طریق واسطه‌های ابری در دسترس قرار می‌گیرد.

·نگاه ما
تحریریه دات‌هوش

تمرکز OpenAI بر «بهره‌وری توکن» به‌جای کاهش قیمت خام، نشان می‌دهد که شرکت متوجه شده است در دنیای عامل‌های خودگردان، سرعت و دقت در رسیدن به نتیجه، بسیار ارزشمندتر از هزینه هر کلمه است. این استراتژی در واقع پاسخ به مدل اقتصادی متا است؛ جایی که OpenAI می‌خواهد به جای «ارزان‌ترین»، «کارآمدترین» باشد. در واقع، ما شاهد تولد اولین مدل‌هایی هستیم که برای «انجام دادن» بهینه شده‌اند، نه فقط برای «سخن گفتن».

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.