اگر امروز برای تحلیل اسناد حجیم یا ویدیوهای طولانی به هوش مصنوعی تکیه میکنید، استانداردهای دقت بهشدت جابهجا شدهاند. گوگل با معرفی جمینای ۴ آرگون (Gemini 4 Argon)، دوباره جایگاه خود را در خط مقدم مدلهای پیشرو بازپس گرفت.
به گزارش The Rundown AI در ۱ اکتبر ۲۰۲۶، این مدل در ۱۳ مورد از ۱۹ محک داخلی، موفق شد هر دو رقیب سرسخت خود یعنی GPT-6 Astra و Claude Opus 5.5 را شکست دهد و با کسب ۱۵۲۵ امتیاز، صدر جدول متن LMArena را به دست آورد.
گوگل سال ۲۰۲۶ را در سکوتی استراتژیک گذراند. این شرکت مدل Gemini 3.5 Pro را کنار گذاشت و بیشتر روی مدلهای کوچکتر Flash تمرکز کرد، در حالی که رقبا در حال جابهجا کردن مرزهای استدلال بودند. این فاصله باعث شد گوگل برای ماهها از بحثهای مربوط به مدلهای پیشرو دور بماند. پس از آنکه جمینای ۳ در نوامبر ۲۰۲۵ شرکت را به نزدیکی صدر جدول رساند، سال بعد به عنوان سالی آشفته توصیف شد؛ سالی که با فقدان مدلهای بزرگتر از خط تولید Flash شناخته میشد.
همانطور که در تحلیل قبلی ما دربارهی سیستم Kauldron در گوگل اشاره کردیم، جداسازی پیکربندیهای یادگیری ماشین از کد، مسیر را برای توسعه سریعتر هموار کرده بود و آرگون نتیجهی همین فشار جدید برای دستیابی به قابلیتهای مقیاسبزرگ است. برای یک کاربر تجاری، این پیشرفت یعنی تفاوت میان ابزاری که فقط یک جلسه را خلاصه میکند با ابزاری که میتواند بهطور خودکار یک نمودار پیچیده شرکتی یا یک ویدیوی طولانی را با دقتی شبیه به انسان تحلیل کند. مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن کتابها جواب میدهد — در نسخه آرگون به بلوغ بیشتری در درک چندوجهی رسیده است.
عملکرد و محکهای فنی
پروفایل فنی آرگون جهشی قابلتوجه در قابلیتهای کدنویسی و چندوجهی نشان میدهد. طبق مستندات، این مدل در محک DeepSWE v1.1 که بر وظایف واقعی کدنویسی تمرکز دارد، به امتیاز ۷۷.۹٪ رسید.

سایر معیارهای کلیدی عملکرد عبارتاند از:
- شاخص هوش: کسب امتیاز ۵۳ در شاخص AA، همتراز با 5.1 Fable و Astra و اندکی پایینتر از 5.5 Opus.
- درک ویدیو: دستیابی به نرخ ۹۱.۷٪ در LVBench.
- نرخ توهم: ثبت نرخ ۱۵٪، که بهطور چشمگیری کمتر از نرخ ۵۱ درصدی Astra است. توهم (Hallucination) — وقتی مدل با اطمینان چیزی میگوید که اصلاً وجود ندارد، شبیه دوستی که خاطرهای را اشتباه تعریف میکند — در این مدل بهشدت کنترل شده است.
- پنجره متنی: ارائه پنجره خروجی ۱ میلیون توکن (Token) — تکههای کوچکی از متن شبیه برشهای کیک که مدل میخورد — که جهشی عظیم نسبت به محدودیت ۶۴ هزار توکنی قبلی است.
- کارهای دانشی: کسب رتبه اول در آزمونهای مربوط به کارهای دانشی، اسناد طولانی و خواندن نمودارها و ویدیوها.
دسترسی و قیمتگذاری
با وجود این اعداد، احتمالاً امروز نمیتوانید از آرگون استفاده کنید. گوگل این مدل را بهطور انحصاری برای تیمهای تأییدشدهی امنیت سایبری عرضه کرده و هنوز تاریخی برای انتشار عمومی اعلام نکرده است. این رویکرد محتاطانه در راستای جلوگیری از تزریق پرامپت و ارتقای امنیت است که پیشتر به عنوان اولویت اصلی گوگل در عرضه این مدل مطرح شده بود.

بر اساس اعلام گوگل، هنگام فعال شدن API، یک بازه قیمتی تشویقی اعمال خواهد شد. هزینههای اولیه از ۲ دلار بهازای هر میلیون توکن ورودی و ۱۰ دلار بهازای هر میلیون توکن خروجی شروع میشود. پس از پایان این دوره، قیمتها دو برابر شده و به ترتیب به ۴ و ۲۰ دلار میرسند.
اصطکاکهای داخلی
همه در داخل گوگل متقاعد به این پیروزی نیستند. به گزارش Bloomberg، منابع داخلی تردیدهایی درباره عملکرد کدنویسی آرگون دارند. این منابع مدعیاند مدل در محکهای کنترلشده خوب عمل میکند اما در محیط واقعی تولید (Production) دچار ضعف میشود.

گوگل رسماً این ادعاها را رد کرده و تأکید دارد که کاربرد واقعی مدل با موفقیتهای آن در محکها کاملاً همراستا است.
چشمانداز رقابتی
آرگون در زمانی معرفی شد که صنعت به سمت «ابرهوش» حرکت میکند. در همان روز، رهبران OpenAI، Google، Anthropic، Meta، Nvidia و xAI در کاخ سفید «پیمان ابرهوش» را امضا کردند تا اجازه دهند حسابرسان خارجی مدلهای برتر آنها را نظارت کنند.

این اقدام نشان میدهد در حالی که شرکتها برای تسلط بر بنچمارکها میجنگند، اضطرابی جمعی درباره مقیاس مدلهای مستقر وجود دارد. این پیمان در جریان یک رویداد سطح بالای هوش مصنوعی در کاخ سفید امضا شد، جایی که دولت پلتفرم جدید AI خود را راهاندازی کرد. فضای رویداد آرام و خوشبینانه توصیف شد و دولت تأکید کرد که ایالات متحده باید پیشرو در توسعه AI باشد؛ چرا که رئیسجمهور اشاره کرد که هیچ «جایگاه دومی» برای آمریکا پذیرفته نیست.
در طول این مراسم، جی.دی ونس، معاون رئیسجمهور، خاطرنشان کرد که قوانین موجود از سوی FTC و سازمانهای مشابه، پیش از این شرکتها را ملزم کردهاند محصولاتی با در نظر گرفتن ایمنی کاربر توسعه دهند. او استدلال کرد که مقررات دولتی بیشتر، تنها مانع پیشرفت خواهد شد. در ادامه، «عصر طلایی هوش مصنوعی» توسط ایلان ماسک، جنسن هوانگ و تام براون (بنیانگذار Anthropic) روی صحنه مورد بحث قرار گرفت و آنها از ابتکارات یکدیگر تمجید کردند. نیک آدامز که در محل حضور داشت، اشاره کرد که تیم رابینز میزبان رویداد بود و گروه را از طریق تمرینات «ذهنیت مثبت» هدایت کرد.
روندهای اکوسیستم هوش مصنوعی
در حالی که گوگل برای جایگاه پیشرو میجنگد، بازیگران دیگر رویکردهای متفاوتی را دنبال میکنند. مدل Jev از شرکت TypeSafe به سمت «تفویض شدید» حرکت کرده است. برخلاف مدلهای زبانی که مقاله مینویسند، Jev فقط گزینهها را انتخاب میکند، امتیاز میدهد یا با اعداد اطمینان، پاسخ بله/خیر میدهد. این باعث میشود استنتاج — لحظهای که مدل واقعاً جواب تولید میکند، شبیه خودِ آشپزی و نه دوره آموزش آشپز — تقریباً آنی و بسیار ارزان باشد. این مدل برای کارهایی مانند مرتبسازی اینباکس یا اجرای دستورالعملهای ارزیابی سرمایهگذار در مقیاس بزرگ، از طریق تبدیل یک تز به یک کارت امتیاز با استفاده از مدلهایی مثل Fable یا Astra، ایدهآل است.
همزمان، متا با Muse Desktop حضور خود را در دسکتاپ گسترش داده است. کاربران میتوانند Muse را روی مک با دانلود اپلیکیشن، ورود به حساب و استفاده از جادوگر نصب برای بررسی مجوزهای برنامههای محلی راهاندازی کنند. توصیه میشود اکثر مجوزها روی حالت «فقط خواندنی» (Read-only) تنظیم شوند. سپس کاربران میتوانند کانکتورهایی برای برنامههایی مانند Gmail اضافه کنند و دسترسیها را از سطوح پایین شروع کنند تا اعتماد مدل ایجاد شود.
این قابلیت اجازه میدهد کارهای پیچیده متقاطع را اجرا کنید؛ مثلاً کاربر میتواند از Muse بخواهد هر روز لیست مانیتورهای HP مشابه در بازارهای محلی را چک کرده و آنها را در یک جدول ثبت کند تا برای ساخت یک آگهی بهتر کمک بگیرد. جفت کردن Muse با اپلیکیشن آیفون به کاربران اجازه میدهد تسکهایی را فعال کنند که روی مک اجرا میشوند.
در بخش امنیت، شرکت Wiz یک «دفترچه راهنمای آمادگی تهدیدات AI» معرفی کرده است. این چارچوب چهار ستونی به رهبران امنیتی کمک میکند تا با تهدیدات مبتنی بر هوش مصنوعی از طریق روشهای زیر مقابله کنند:
- کاهش سطح مواجهه با نقاط حمله بحرانی.
- بهبود پاسخ و رفع آسیبپذیریهای روز صفر (Zero-day).
- تقویت امنیت اپلیکیشنها از طریق تحلیلهای به کمک AI.
- مدرنسازی تشخیص و پاسخ با استفاده از گردشکارهای مبتنی بر AI.
کاربرد واقعی: تدوین ویدیو با AI
کاربرد عملی این مدلها در گردشکارهای تخصصی ظاهر شده است. برای مثال، مت آروماندو، مهندس عمران و عکاس، با ترکیب ChatGPT، Gemini و Claude Code وبسایتی ساخت که عکسهای ملک، رندرهای معماری یا حتی آدرسها را به ویدیوهای سینمایی تبدیل میکند.
او اصول تدوین انسانی را به منطق نرمافزاری تبدیل کرد تا موارد زیر تضمین شود:
- شاتهای آشپزخانه و پذیرایی در کنار هم قرار گیرند و مدت زمان بیشتری داشته باشند.
- اتاقهای خواب در نزدیکی حمامها قرار گیرند.
- شاتهای افتتاحیه با شاتهای جزئیات متفاوت باشند.
- هر کلیپ شامل حرکت باشد تا از حالت «اسلایدشو ساده» خارج شود.
این سیستم از AI برای تحلیل تصاویر، ساخت استوریبورد، رتبهبندی صحنهها، ایجاد پرامپت برای مدلهای ویدیویی و در نهایت مونتاژ محصول نهایی استفاده میکند.
ابزارهای نوظهور و پروژههای دولتی
ابزارهای دیگری نیز در حال ورود به بازار هستند تا وضعیت موجود را به چالش بکشند:
- Dot: عامل همیشه-بیدار OpenAI برای رقابت با Muse متا.
- Ideogram 4.5: هوش مصنوعی ویرایش تصویر برای حفظ ثبات در تغییرات مکرر.
- Mercury Voice: مدل استدلالی ارزان و سریع از Inception برای عاملهای صوتی.
- Utopai X: هوش مصنوعی ویدیویی مبتنی بر MiniMax که در حال حاضر رتبه ۲ جدول متن-به-ویدیو است.
- HeyGen: مدل ویدیویی تجاری همهمنظوره مبتنی بر H3 شرکت MiniMax، با قیمت یک سنت بهازای هر ثانیه ویدیو همراه با صدا.
بهروزرسانیهای قابلتوجه دیگر شامل «فصل سوم ظهور عاملها» در گوگل کلاود است که ۳۱ روز آموزش رایگان برای ساخت و ایمنسازی عاملهای AI با Gemini و ADK ارائه میدهد. همچنین DoorDash کانکتوری برای عاملهای AI معرفی کرد تا ناهارهای تیمی و خریدهای میانوعده دفتر را مدیریت کنند، در کنار یک اپلیکیشن جدید مبتنی بر AI برای پیکها.
در بخش دولتی، پیت هگسث از پنتاگون، پروژه Meridian را معرفی کرد. این ابتکار ۱۲۰ روزه که توسط ایلان ماسک، نیوت گینگریچ و پالمر لاکی رهبری میشود، به دنبال یافتن سلاحهای آیندهنگرانه برای محیطهایی است که «از اعماق زمین تا فراتر از ماه» گسترده شدهاند.
برای کاربر سازمانی، قدرت آرگون در خواندن نمودارها و اسناد طولانی یعنی گلوگاه «کارهای دانشی» در حال از بین رفتن است. اگر نرخ توهم ۱۵ درصدی در محیط واقعی ثابت بماند، گوگل احتمالاً مشکل قابلیت اطمینانی را که در عصر Gemini 3 وجود داشت، حل کرده است.
با این حال، عرضه محدود نشان میدهد گوگل محتاط است. پس از چالشهای روابط عمومی در سال ۲۰۲۶، این شرکت نمیتواند شکست پرسرصدا دیگری را در خط مدلهای پیشرو تحمل کند. باید منتظر انتشار گستردهتر API و اولین حسابرسیهای مستقل از پیمان ابرهوش بود تا مشخص شود آیا پیشتازی آرگون پایدار است یا خیر.
گام بعدی شما
- اگر در تیمهای امنیت سایبری هستید، برای دسترسی زودهنگام به API آرگون درخواست ارسال کنید.
- برای کاهش نرخ توهم در پروژههای خود، استراتژیهای کنترل خروجی مدلهای چندوجهی را بررسی کنید.
- قابلیتهای جدید درک ویدیو را برای اتوماسیون تحلیل محتوای بصری در کسبوکارتان تست کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو