پرش به محتوای اصلی
پرش به محتوای مقاله

Grok 4.7 دقت بنچمارک EEBench را به ۶۴٪ رساند اما قیمت را ثابت نگه داشت

·۲ مهر ۱۴۰۵۴ دقیقه مطالعه۲ بازدید
انتشار Grok 4.7 توسط SpaceXAI: مدل پایه بزرگ‌تر با قیمت مشابه Grok 4.6
انتشار Grok 4.7 توسط SpaceXAI: مدل پایه بزرگ‌تر با قیمت مشابه Grok 4.6
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

افزایش چشمگیر اندازه مدل بنیادی و توان استدلالی بدون تغییر در قیمت API؛ در حالی که رقبایی مثل Fable برای عملکرد مشابه تا ۸ برابر هزینه بیشتری می‌گیرند.

اگر امروز برای استنتاج از مدل‌های پیشرفته هزینه می‌پردازید، SpaceXAI با یک حرکت جسورانه، معادله‌ی قیمت و عملکرد را تغییر داده است. مدل جدید Grok 4.7 در محک EEBench به امتیاز ۶۴٪ رسید، در حالی که قیمت آن دقیقاً مشابه نسل قبلی باقی مانده است. این مدل که در ۲۱ سپتامبر منتشر شد، به‌طور خاص برای کارهای دانشی حرفه‌ای، گردش‌های کاری عامل‌محور (Agentic) و برنامه‌نویسی سطح بالا طراحی شده است، بدون آنکه هزینه‌ای اضافی بر کاربران API تحمیل کند.

این به‌روزرسانی در حالی رخ می‌دهد که کل صنعت به سمت مدل‌های استدلالی (Reasoning Models) حرکت می‌کند؛ مدل‌هایی که محاسبات زمان استنتاج (test-time compute) را بر پیش‌بینی ساده‌ی توکن بعدی اولویت می‌دهند. SpaceXAI با حفظ قیمت ۲ دلار برای هر میلیون توکن ورودی و ۶ دلار برای هر میلیون توکن خروجی، در تلاش است تا قابلیت‌های استدلالی سطح بالا را که معمولاً توسط رقبا با قیمت‌های ممتاز (Premium) عرضه می‌شوند، به یک کالای ارزان‌قیمت و در دسترس تبدیل کند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی رقابت مدل‌های استدلالی اشاره کردیم، کاهش هزینه در کنار افزایش دقت، خطرناک‌ترین استراتژی برای رقبایی است که قیمت‌های بالا دریافت می‌کنند.

Grok 4.7 اکنون به صورت مدل میزبانی‌شده در دسترس است. کاربران می‌توانند همین امروز از طریق APIهای xAI، Cursor، Grok Build، OpenRouter، Vercel و Cloudflare از این مدل استفاده کنند. برای کاربرانی که نیاز به اقامت داده‌ای خاص دارند، یک نقطه اتصال (Endpoint) منطقه‌ای در ایالات متحده در آدرس https://us.api.x.ai/v1 در دسترس است. این نقطه اتصال، استنتاج را در داخل خاک آمریکا نگه می‌دارد و در مقابل، ۱۰٪ هزینه اضافی دارد. همچنین SpaceXAI به توسعه‌دهندگان توصیه می‌کند که برای اطمینان از نرخ موفقیت بالای حافظه پنهان (cache hits) در هنگام فراخوانی‌های API، حتماً یک prompt_cache_key تنظیم کنند.

طبق مستندات فنی منتشر شده در marktechpost.com، Grok 4.7 چهار تغییر معماری بنیادین را معرفی کرده است:

  • مدل بنیادی جدید: این نسخه مدل پایه Grok 4.6 را به‌طور کامل کنار گذاشته و از یک مدل بنیادی (Foundation Model) بزرگ‌تر استفاده می‌کند.
  • یادگیری تقویتی گسترده (Extended RL): اجرای طولانی‌تر فرآیند یادگیری تقویتی با تمرکز ویژه بر وظایفی که تکمیل آن‌ها نیاز به ساعت‌ها زمان دارد.
  • خود-راستی‌سنجی (Self-Verification): تقویت بررسی‌های داخلی برای مدیریت دقیق‌تر پنجره‌های متنی طولانی و افزایش صحت پاسخ‌ها.
  • Bot Harness: آموزش بومی برای زیرساخت Grok Bot جهت بهبود عملکرد در کارهای دانشی متنی و تعاملی.

مشخصات فنی این مدل شامل پنجره زمینه (Context Window) ۵۰۰ هزار توکنی و تاریخ قطع دانش تا مه ۲۰۲۶ است. این مدل از چهار سطح استدلال (Low, Medium, High به عنوان پیش‌فرض، و xHigh) پشتیبانی می‌کند. از نظر مودالیته، مدل ورودی‌های متنی و تصویری را می‌پذیرد و خروجی را به صورت متن ارائه می‌دهد. ابزارهای در دسترس شامل فراخوانی تابع (Function Calling)، جست‌وجوی وب، جست‌وجوی شبکه X و اجرای کد است. همچنین از APIهای Responses و Chat Completions پشتیبانی می‌کند.

بر اساس گزارش‌های عملکردی، Grok 4.7 در حالت xHigh در تمامی معیارها از نسخه ۴.۶ پیشی گرفته است. بیشترین جهش در Terminal-Bench 4.0 رخ داده که امتیاز مدل را از ۲۰.۳٪ به ۳۸.۰٪ رسانده است. همچنین در محک Harvey Legal Agent با امتیاز ۱۹.۶٪، مدل Fable 5.1 Max را که تنها ۶.۷٪ کسب کرده بود، به‌شدت شکست داد.

سایر نتایج کلیدی عبارتند از:

  • EEBench: افزایش ۱۱ امتیازی و رسیدن به ۶۴.۰٪ که بالاترین امتیاز در جدول عرضه است.
  • CursorBench 4.0: کسب امتیاز ۴۶.۳٪ و پیشی گرفتن از Grok 4.6 (۴۰.۴٪) و GPT-5.6 Sol Max (۴۱.۷٪).
  • DeepSWE v1.1: دستیابی به صحت ۷۱.۰٪ در سطح تلاش بالا.
  • HealthBench Professional: کسب امتیاز ۵۶.۷٪.
  • AA Briefcase v1.1: رسیدن به امتیاز ۱,۶۵۷.

با این حال، این مدل در همه دسته‌ها برنده نیست. Fable 5.1 Max همچنان در چهار محک از هفت محک پیشتاز است، از جمله کسب امتیاز ۵۷.۹٪ در Terminal-Bench 4.0؛ هرچند هزینه ورودی آن ۵ برابر (۱۰ دلار در میلیون) و هزینه خروجی آن ۸.۳ برابر (۵۰ دلار در میلیون) بیشتر از Grok است. همچنین GPT-5.6 Sol Max با ۷۲.۷٪ همچنان صدرنشین DeepSWE v1.1 است.

در محک GDPval که کارهای دانشی حرفه‌ای را می‌سنجد، Grok 4.7 xhigh امتیاز ۱,۶۹۵ Elo را کسب کرد که نسبت به ۱,۶۰۵ در Grok 4.6 high پیشرفت قابل توجهی است. اگرچه Fable 5.1 max با ۱,۷۳۵ پیشتاز است و GPT-6 Astra max امتیاز ۱,۵۴۲ را ثبت کرده، اما SpaceXAI اشاره می‌کند که Grok 4.7 در ایجاد اسناد و ارائه‌ها (Presentations) برتری دارد.

در حوزه امنیت، SpaceXAI یک پشته حفاظتی جدید را پیاده کرده است. به نقل از اعلام شرکت، این مدل در برابر jailbreak و درخواست‌های غیرمجاز مقاوم‌ترین مدل آزمایش‌شده آن‌هاست و در محک زیست‌امنیتی LatchBio امتیاز ۶۲.۴٪ را کسب کرده است. همچنین با استفاده از HackerBench v0.3 (محک اختصاصی SpaceXAI برای وظایف سایبری خطرناک و مخرب)، این مدل تنها ۳.۳٪ از پرامپت‌های خطرناک با کاربرد دوگانه را پذیرفته است. شرکت تأکید می‌کند که این مدل به‌ندرت کارهای امنیتی مشروع را مسدود می‌کند. برای تقویت این بخش، دسترسی محدود و دعوت‌نامه‌ای به قابلیت‌های Red-team برای تحقیقات دفاعی در اختیار شرکای منتخب امنیت سایبری قرار گرفته است.

از منظر استراتژیک، این عرضه نشان می‌دهد SpaceXAI به‌جای تسلط مطلق بر بنچمارک‌ها، «مرز قیمت-عملکرد» را اولویت قرار داده است. با ثابت نگه داشتن هزینه‌ها در حالی که اندازه مدل پایه افزایش یافته، آن‌ها در حال فشار آوردن به رقبا برای کاهش قیمت مدل‌های استدلالی سطح بالا هستند.

علاوه بر این، ادغام هم‌زمان Grok Bot در خودروهای تسلا نشان می‌دهد که ارزش اصلی مدل دیگر تنها در API نیست، بلکه در اکوسیستم است؛ جایی که مدل به یک عامل صوتی تبدیل شده که قادر است ایمیل‌ها و رزروها را به‌صورت بدون دست (hands-free) در کابین تسلا مدیریت کند. این پیشروی در تعاملات صوتی در ادامه بهبودهای چشمگیر در دقت تبدیل گفتار به متن صورت گرفته که تجربه کاربری را در محیط‌های پویا ارتقا می‌دهد.

توسعه‌دهندگان می‌توانند نسخه تخصصی Grok 4.7 Fast را در Cursor و Grok Build تجربه کنند که سرعت خروجی را دو برابر می‌کند، اما هزینه آن نیز دو برابر است. این نسخه سریع در سطح رایگان Grok Build قرار ندارد و در API عمومی xAI در دسترس نیست.

گام بعدی شما

  • اگر از Cursor استفاده می‌کنید، مدل Grok 4.7 را برای پروژه‌های با codebase بزرگ (به دلیل پنجره متنی ۵۰۰ هزار توکنی) تست کنید.
  • برای کاهش هزینه‌های API، حتماً از prompt_cache_key برای افزایش نرخ hit در حافظه پنهان استفاده کنید.
  • عملکرد مدل را در وظایف استدلالی طولانی‌مدت با مدل‌های رقیب مقایسه کنید تا نقطه شکست دقت را بیابید.

اما داستان سخت‌افزاری این تحول و نحوه مدیریت این حجم از محاسبات حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این اقدام با تکیه بر اعتبار زیرساختی xAI، استانداردهای قیمت‌گذاری مدل‌های استدلالی را در صنعت جابه‌جا می‌کند. شرکت‌های نرم‌افزاری اکنون می‌توانند قابلیت‌های Agentic پیچیده را با هزینه‌ای بسیار کمتر در مقیاس صنعتی پیاده کنند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم توسعه‌دهندگان ایرانی به xAI دشوار است، اما در دسترس بودن این مدل در OpenRouter و Vercel مسیر جایگزینی برای استفاده از آن را فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

استراتژی SpaceXAI در این نسخه، تبدیل «استدلال» از یک ویژگی لوکس به یک کالا (Commoditization) است. با ثابت نگه داشتن قیمت در حالی که اندازه مدل بنیادی افزایش یافته، آن‌ها در واقع در حال فشار آوردن به رقبایی هستند که مدل‌های استدلالی خود را با قیمت‌های گزاف عرضه می‌کنند. این حرکت نشان می‌دهد که جنگ بعدی AI نه بر سر بالاترین امتیاز بنچمارک، بلکه بر سر پایین‌ترین هزینه برای هر واحد استدلال است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.