پرش به محتوای اصلی
پرش به محتوای مقاله

جمینای ۴ آرگون گوگل در ۱۳ محک فنی از رقبای اصلی پیشی گرفت

·۱۰ مهر ۱۴۰۵۷ دقیقه مطالعه
آرگون در پی بازگرداندن گوگل به پیش‌زمینه فناوری است
آرگون در پی بازگرداندن گوگل به پیش‌زمینه فناوری است
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کاهش چشمگیر نرخ توهم (از ۵۱٪ در رقیب به ۱۵٪) و جهش پنجره خروجی به ۱ میلیون توکن، سیگنال اصلی این به‌روزرسانی است.

اگر امروز برای تحلیل اسناد حجیم یا ویدیوهای طولانی به هوش مصنوعی تکیه می‌کنید، استانداردهای دقت به‌شدت جابه‌جا شده‌اند. گوگل با معرفی جمینای ۴ آرگون (Gemini 4 Argon)، دوباره جایگاه خود را در خط مقدم مدل‌های پیشرو بازپس گرفت.

به گزارش The Rundown AI در ۱ اکتبر ۲۰۲۶، این مدل در ۱۳ مورد از ۱۹ محک داخلی، موفق شد هر دو رقیب سرسخت خود یعنی GPT-6 Astra و Claude Opus 5.5 را شکست دهد و با کسب ۱۵۲۵ امتیاز، صدر جدول متن LMArena را به دست آورد.

گوگل سال ۲۰۲۶ را در سکوتی استراتژیک گذراند. این شرکت مدل Gemini 3.5 Pro را کنار گذاشت و بیشتر روی مدل‌های کوچک‌تر Flash تمرکز کرد، در حالی که رقبا در حال جابه‌جا کردن مرزهای استدلال بودند. این فاصله باعث شد گوگل برای ماه‌ها از بحث‌های مربوط به مدل‌های پیشرو دور بماند. پس از آنکه جمینای ۳ در نوامبر ۲۰۲۵ شرکت را به نزدیکی صدر جدول رساند، سال بعد به عنوان سالی آشفته توصیف شد؛ سالی که با فقدان مدل‌های بزرگ‌تر از خط تولید Flash شناخته می‌شد.

همان‌طور که در تحلیل قبلی ما درباره‌ی سیستم Kauldron در گوگل اشاره کردیم، جداسازی پیکربندی‌های یادگیری ماشین از کد، مسیر را برای توسعه سریع‌تر هموار کرده بود و آرگون نتیجه‌ی همین فشار جدید برای دستیابی به قابلیت‌های مقیاس‌بزرگ است. برای یک کاربر تجاری، این پیشرفت یعنی تفاوت میان ابزاری که فقط یک جلسه را خلاصه می‌کند با ابزاری که می‌تواند به‌طور خودکار یک نمودار پیچیده شرکتی یا یک ویدیوی طولانی را با دقتی شبیه به انسان تحلیل کند. مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — در نسخه آرگون به بلوغ بیشتری در درک چندوجهی رسیده است.

عملکرد و محک‌های فنی

پروفایل فنی آرگون جهشی قابل‌توجه در قابلیت‌های کدنویسی و چندوجهی نشان می‌دهد. طبق مستندات، این مدل در محک DeepSWE v1.1 که بر وظایف واقعی کدنویسی تمرکز دارد، به امتیاز ۷۷.۹٪ رسید.

آرگون هدفش بازگرداندن گوگل به پیش‌خط فناوری است

سایر معیارهای کلیدی عملکرد عبارت‌اند از:

  • شاخص هوش: کسب امتیاز ۵۳ در شاخص AA، هم‌تراز با 5.1 Fable و Astra و اندکی پایین‌تر از 5.5 Opus.
  • درک ویدیو: دستیابی به نرخ ۹۱.۷٪ در LVBench.
  • نرخ توهم: ثبت نرخ ۱۵٪، که به‌طور چشمگیری کمتر از نرخ ۵۱ درصدی Astra است. توهم (Hallucination) — وقتی مدل با اطمینان چیزی می‌گوید که اصلاً وجود ندارد، شبیه دوستی که خاطره‌ای را اشتباه تعریف می‌کند — در این مدل به‌شدت کنترل شده است.
  • پنجره متنی: ارائه پنجره خروجی ۱ میلیون توکن (Token) — تکه‌های کوچکی از متن شبیه برش‌های کیک که مدل می‌خورد — که جهشی عظیم نسبت به محدودیت ۶۴ هزار توکنی قبلی است.
  • کارهای دانشی: کسب رتبه اول در آزمون‌های مربوط به کارهای دانشی، اسناد طولانی و خواندن نمودارها و ویدیوها.

دسترسی و قیمت‌گذاری

با وجود این اعداد، احتمالاً امروز نمی‌توانید از آرگون استفاده کنید. گوگل این مدل را به‌طور انحصاری برای تیم‌های تأییدشده‌ی امنیت سایبری عرضه کرده و هنوز تاریخی برای انتشار عمومی اعلام نکرده است. این رویکرد محتاطانه در راستای جلوگیری از تزریق پرامپت و ارتقای امنیت است که پیش‌تر به عنوان اولویت اصلی گوگل در عرضه این مدل مطرح شده بود.

آرگون هدفش بازگرداندن گوگل به پیش‌زمینه فناوری است

بر اساس اعلام گوگل، هنگام فعال شدن API، یک بازه قیمتی تشویقی اعمال خواهد شد. هزینه‌های اولیه از ۲ دلار به‌ازای هر میلیون توکن ورودی و ۱۰ دلار به‌ازای هر میلیون توکن خروجی شروع می‌شود. پس از پایان این دوره، قیمت‌ها دو برابر شده و به ترتیب به ۴ و ۲۰ دلار می‌رسند.

اصطکاک‌های داخلی

همه در داخل گوگل متقاعد به این پیروزی نیستند. به گزارش Bloomberg، منابع داخلی تردیدهایی درباره عملکرد کدنویسی آرگون دارند. این منابع مدعی‌اند مدل در محک‌های کنترل‌شده خوب عمل می‌کند اما در محیط واقعی تولید (Production) دچار ضعف می‌شود.

آرگون هدفش بازگرداندن گوگل به پیش‌خط فناوری است

گوگل رسماً این ادعاها را رد کرده و تأکید دارد که کاربرد واقعی مدل با موفقیت‌های آن در محک‌ها کاملاً هم‌راستا است.

چشم‌انداز رقابتی

آرگون در زمانی معرفی شد که صنعت به سمت «ابر‌هوش» حرکت می‌کند. در همان روز، رهبران OpenAI، Google، Anthropic، Meta، Nvidia و xAI در کاخ سفید «پیمان ابر‌هوش» را امضا کردند تا اجازه دهند حسابرسان خارجی مدل‌های برتر آن‌ها را نظارت کنند.

آرگون هدفش بازگرداندن گوگل به پیش‌زمینه فناوری است

این اقدام نشان می‌دهد در حالی که شرکت‌ها برای تسلط بر بنچمارک‌ها می‌جنگند، اضطرابی جمعی درباره مقیاس مدل‌های مستقر وجود دارد. این پیمان در جریان یک رویداد سطح بالای هوش مصنوعی در کاخ سفید امضا شد، جایی که دولت پلتفرم جدید AI خود را راه‌اندازی کرد. فضای رویداد آرام و خوش‌بینانه توصیف شد و دولت تأکید کرد که ایالات متحده باید پیشرو در توسعه AI باشد؛ چرا که رئیس‌جمهور اشاره کرد که هیچ «جایگاه دومی» برای آمریکا پذیرفته نیست.

در طول این مراسم، جی.‌دی ونس، معاون رئیس‌جمهور، خاطرنشان کرد که قوانین موجود از سوی FTC و سازمان‌های مشابه، پیش از این شرکت‌ها را ملزم کرده‌اند محصولاتی با در نظر گرفتن ایمنی کاربر توسعه دهند. او استدلال کرد که مقررات دولتی بیشتر، تنها مانع پیشرفت خواهد شد. در ادامه، «عصر طلایی هوش مصنوعی» توسط ایلان ماسک، جنسن هوانگ و تام براون (بنیان‌گذار Anthropic) روی صحنه مورد بحث قرار گرفت و آن‌ها از ابتکارات یکدیگر تمجید کردند. نیک آدامز که در محل حضور داشت، اشاره کرد که تیم رابینز میزبان رویداد بود و گروه را از طریق تمرینات «ذهنیت مثبت» هدایت کرد.

روندهای اکوسیستم هوش مصنوعی

در حالی که گوگل برای جایگاه پیشرو می‌جنگد، بازیگران دیگر رویکردهای متفاوتی را دنبال می‌کنند. مدل Jev از شرکت TypeSafe به سمت «تفویض شدید» حرکت کرده است. برخلاف مدل‌های زبانی که مقاله می‌نویسند، Jev فقط گزینه‌ها را انتخاب می‌کند، امتیاز می‌دهد یا با اعداد اطمینان، پاسخ بله/خیر می‌دهد. این باعث می‌شود استنتاج — لحظه‌ای که مدل واقعاً جواب تولید می‌کند، شبیه خودِ آشپزی و نه دوره آموزش آشپز — تقریباً آنی و بسیار ارزان باشد. این مدل برای کارهایی مانند مرتب‌سازی اینباکس یا اجرای دستورالعمل‌های ارزیابی سرمایه‌گذار در مقیاس بزرگ، از طریق تبدیل یک تز به یک کارت امتیاز با استفاده از مدل‌هایی مثل Fable یا Astra، ایده‌آل است.

هم‌زمان، متا با Muse Desktop حضور خود را در دسکتاپ گسترش داده است. کاربران می‌توانند Muse را روی مک با دانلود اپلیکیشن، ورود به حساب و استفاده از جادوگر نصب برای بررسی مجوزهای برنامه‌های محلی راه‌اندازی کنند. توصیه می‌شود اکثر مجوزها روی حالت «فقط خواندنی» (Read-only) تنظیم شوند. سپس کاربران می‌توانند کانکتورهایی برای برنامه‌هایی مانند Gmail اضافه کنند و دسترسی‌ها را از سطوح پایین شروع کنند تا اعتماد مدل ایجاد شود.

این قابلیت اجازه می‌دهد کارهای پیچیده متقاطع را اجرا کنید؛ مثلاً کاربر می‌تواند از Muse بخواهد هر روز لیست مانیتورهای HP مشابه در بازارهای محلی را چک کرده و آن‌ها را در یک جدول ثبت کند تا برای ساخت یک آگهی بهتر کمک بگیرد. جفت کردن Muse با اپلیکیشن آیفون به کاربران اجازه می‌دهد تسک‌هایی را فعال کنند که روی مک اجرا می‌شوند.

در بخش امنیت، شرکت Wiz یک «دفترچه راهنمای آمادگی تهدیدات AI» معرفی کرده است. این چارچوب چهار ستونی به رهبران امنیتی کمک می‌کند تا با تهدیدات مبتنی بر هوش مصنوعی از طریق روش‌های زیر مقابله کنند:

  • کاهش سطح مواجهه با نقاط حمله بحرانی.
  • بهبود پاسخ و رفع آسیب‌پذیری‌های روز صفر (Zero-day).
  • تقویت امنیت اپلیکیشن‌ها از طریق تحلیل‌های به کمک AI.
  • مدرن‌سازی تشخیص و پاسخ با استفاده از گردش‌کارهای مبتنی بر AI.

کاربرد واقعی: تدوین ویدیو با AI

کاربرد عملی این مدل‌ها در گردش‌کارهای تخصصی ظاهر شده است. برای مثال، مت آروماندو، مهندس عمران و عکاس، با ترکیب ChatGPT، Gemini و Claude Code وب‌سایتی ساخت که عکس‌های ملک، رندرهای معماری یا حتی آدرس‌ها را به ویدیوهای سینمایی تبدیل می‌کند.

او اصول تدوین انسانی را به منطق نرم‌افزاری تبدیل کرد تا موارد زیر تضمین شود:

  • شات‌های آشپزخانه و پذیرایی در کنار هم قرار گیرند و مدت زمان بیشتری داشته باشند.
  • اتاق‌های خواب در نزدیکی حمام‌ها قرار گیرند.
  • شات‌های افتتاحیه با شات‌های جزئیات متفاوت باشند.
  • هر کلیپ شامل حرکت باشد تا از حالت «اسلایدشو ساده» خارج شود.

این سیستم از AI برای تحلیل تصاویر، ساخت استوری‌بورد، رتبه‌بندی صحنه‌ها، ایجاد پرامپت برای مدل‌های ویدیویی و در نهایت مونتاژ محصول نهایی استفاده می‌کند.

ابزارهای نوظهور و پروژه‌های دولتی

ابزارهای دیگری نیز در حال ورود به بازار هستند تا وضعیت موجود را به چالش بکشند:

  • Dot: عامل همیشه-بیدار OpenAI برای رقابت با Muse متا.
  • Ideogram 4.5: هوش مصنوعی ویرایش تصویر برای حفظ ثبات در تغییرات مکرر.
  • Mercury Voice: مدل استدلالی ارزان و سریع از Inception برای عامل‌های صوتی.
  • Utopai X: هوش مصنوعی ویدیویی مبتنی بر MiniMax که در حال حاضر رتبه ۲ جدول متن-به-ویدیو است.
  • HeyGen: مدل ویدیویی تجاری همه‌منظوره مبتنی بر H3 شرکت MiniMax، با قیمت یک سنت به‌ازای هر ثانیه ویدیو همراه با صدا.

به‌روزرسانی‌های قابل‌توجه دیگر شامل «فصل سوم ظهور عامل‌ها» در گوگل کلاود است که ۳۱ روز آموزش رایگان برای ساخت و ایمن‌سازی عامل‌های AI با Gemini و ADK ارائه می‌دهد. همچنین DoorDash کانکتوری برای عامل‌های AI معرفی کرد تا ناهارهای تیمی و خریدهای میان‌وعده دفتر را مدیریت کنند، در کنار یک اپلیکیشن جدید مبتنی بر AI برای پیک‌ها.

در بخش دولتی، پیت هگسث از پنتاگون، پروژه Meridian را معرفی کرد. این ابتکار ۱۲۰ روزه که توسط ایلان ماسک، نیوت گینگریچ و پالمر لاکی رهبری می‌شود، به دنبال یافتن سلاح‌های آینده‌نگرانه برای محیط‌هایی است که «از اعماق زمین تا فراتر از ماه» گسترده شده‌اند.

برای کاربر سازمانی، قدرت آرگون در خواندن نمودارها و اسناد طولانی یعنی گلوگاه «کارهای دانشی» در حال از بین رفتن است. اگر نرخ توهم ۱۵ درصدی در محیط واقعی ثابت بماند، گوگل احتمالاً مشکل قابلیت اطمینانی را که در عصر Gemini 3 وجود داشت، حل کرده است.

با این حال، عرضه محدود نشان می‌دهد گوگل محتاط است. پس از چالش‌های روابط عمومی در سال ۲۰۲۶، این شرکت نمی‌تواند شکست پرسرصدا دیگری را در خط مدل‌های پیشرو تحمل کند. باید منتظر انتشار گسترده‌تر API و اولین حسابرسی‌های مستقل از پیمان ابر‌هوش بود تا مشخص شود آیا پیشتازی آرگون پایدار است یا خیر.

گام بعدی شما

  • اگر در تیم‌های امنیت سایبری هستید، برای دسترسی زودهنگام به API آرگون درخواست ارسال کنید.
  • برای کاهش نرخ توهم در پروژه‌های خود، استراتژی‌های کنترل خروجی مدل‌های چندوجهی را بررسی کنید.
  • قابلیت‌های جدید درک ویدیو را برای اتوماسیون تحلیل محتوای بصری در کسب‌وکارتان تست کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با تکیه بر اعتبار بنچمارک‌های LMArena، توازن قدرت را در بازار مدل‌های پیشرو به نفع گوگل تغییر می‌دهد. کاهش شدید نرخ توهم در کارهای دانشی، اعتماد سازمان‌ها برای جایگزینی تحلیلگران انسانی با عامل‌های AI را افزایش می‌دهد.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم توسعه‌دهندگان ایرانی به آرگون دشوار است؛ اما بهبود درک ویدیو در مدل‌های پیشرو، ابزارهای واسط تولید محتوای بصری در ایران را متحول می‌کند.

·نگاه ما
تحریریه دات‌هوش

تمرکز گوگل بر کاهش نرخ توهم به ۱۵٪ در مقابل ۵۱٪ رقیب، نشان می‌دهد که میدان نبرد از «افزایش هوش» به «قابلیت اطمینان» تغییر کرده است. این مدل با گسترش پنجره خروجی به یک میلیون توکن، عملاً مفهوم «خلاصه کردن» را به «تحلیل جامع» تبدیل می‌کند. به نظر ما، عرضه محدود آرگون بیشتر یک استراتژی مدیریت ریسک برای جلوگیری از رسوایی‌های احتمالی است تا یک محدودیت فنی.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.