پرش به محتوای اصلی
پرش به محتوای مقاله

Grok 4.5 در برابر Opus 4.8؛ بهینه‌سازی برای گردش‌های کاری نرم‌افزاری

·۱۸ تیر ۱۴۰۵۴ دقیقه مطالعه
انتشار Grok 4.5 توسط SpaceXAI: مدل آموزش‌دیده با Cursor برای کدنویسی، وظایف عاملی و کار دانشی با قیمت ۲ دلار به ازای میلیون ت
انتشار Grok 4.5 توسط SpaceXAI: مدل آموزش‌دیده با Cursor برای کدنویسی، وظایف عاملی و کار دانشی با قیمت ۲ دلار به ازای میلیون ت
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر پارادایم از «دقت مطلق» به «دقت بهینه در هر توکن»؛ Grok 4.5 اولین مدلی است که به‌طور فعال حجم پاسخ‌های فنی را برای کاهش هزینه استنتاج بدون افت شدید کیفیت، به شدت کاهش داده است.

هزینه استنتاج در پروژه‌های نرم‌افزاری بزرگ دیگر یک مانع نیست؛ SpaceXAI با مدل جدیدش بازی را به نفع بهره‌وری تغییر داد. اگر امروز از مدل‌های سنگین برای کدنویسی استفاده می‌کنید، باید بدانید که Grok 4.5 می‌تواند همان نتایج را با توکن‌های بسیار کمتر و سرعت خیره‌کننده‌ای تحویل دهد.

این مدل بر پایه یک استراتژی تهاجمی برای کاهش توکن‌های خروجی ساخته شده است. طبق گزارش‌های منتشر شده، کاهش ۴.۲ برابری در توکن‌های خروجی نسبت به Opus 4.8 (max) در محک SWE Bench Pro، ارزش پیشنهادی اصلی Grok 4.5 را تعریف می‌کند. این بهره‌وری اجازه می‌دهد تا تکالیف پیچیده مهندسی نرم‌افزار سریع‌تر حل شوند و هزینه هر نتیجه برای کاربر نهایی به‌طور قابل توجهی کاهش یابد. این رویکرد در راستای تلاش‌های مستمر شرکت برای بهینه‌سازی است که چگونگی کاهش هزینه‌های عملیاتی از طریق افزایش بهره‌وری در Grok 4.5 را به خوبی نشان می‌دهد.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی امنیت مدل‌های بازمتن و بهینه‌سازی استنتاج (مانند استفاده Cosine AI از مدل‌های آموزش‌دیده برای حملات در ممیزی‌های امنیتی) اشاره کردیم، صنعت در حال حرکت از «مدل‌های غول‌پیکر کلی‌منظور» به سمت «ابزارهای تخصصی با دقت بالا» است. عرضه Grok 4.5 یک چرخش حیاتی برای SpaceXAI است. پس از آنکه نسخه‌های قبلی این شرکت از رقبا عقب افتادند، اکنون آن‌ها رویکردی فوق‌تخصصی برای کارهای فنی در پیش گرفته‌اند و از تولید محتوای کلی و زائد به سمت کاربردهای مهندسی با دقت بالا حرکت کرده‌اند.

به نقل از گزارش Marktechpost، مدل Grok 4.5 یک مدل همه‌منظوره است که به‌طور ویژه برای کارهای واقعی مهندسی تنظیم دقیق (Fine-tuning) شده است. این مدل در همکاری با ویرایشگر کد Cursor و با استفاده از مجموعه‌داده‌های گسترده در حوزه‌های علوم، ریاضیات، مهندسی و کدنویسی آموزش دیده است. تیم تحقیقاتی توصیف می‌کنند که استدلال حاصل از این آموزش، همزمان هوشمند و کارآمد است.

زیرساخت مورد نیاز برای این مدل عظیم بود و اجرای آموزش آن نیازمند ده‌ها هزار واحد پردازش گرافیکی (GPU) مدل NVIDIA GB300 بود. برای تضمین پایداری در طول این اجراهای مقیاس‌بزرگ، SpaceXAI تکنیک‌های خاص پایداری را پیاده کرده و سرمایه‌گذاری سنگینی روی کیوریتوری (گزینش) داده‌ها انجام داد. این خط لوله شامل مراحل سخت‌گیرانه حذف موارد تکراری (Deduplication)، امتیازدهی کیفیت و انتخاب‌های متمرکز بر دامنه تخصصی بود تا از بالاترین کیفیت ورودی اطمینان حاصل شود.

پس از مرحله پیش‌آموزش، SpaceXAI یادگیری تقویتی (RL) را با تمرکز بر «هوش در هر توکن» مقیاس‌بندی کرد. بر اساس مستندات، این فرآیند RL صدها هزار تکلیف را پوشش داد که اکثریت آن‌ها بر کارهای فنی و مهندسی نرم‌افزار چندمرحله‌ای متمرکز بود. برای نمره‌دهی به این تکالیف، روش‌های خودکار با ارزیابی‌های مدل‌محور ترکیب شدند. علاوه بر این، پشته آموزشی از عملیات‌های به‌شدت ناهمگام پشتیبانی می‌کند؛ این یعنی استقرار عامل‌های هوشمند (Agentic rollouts) می‌توانند برای ساعت‌های طولانی اجرا شوند در حالی که فرآیند یادگیری مدل همچنان در پس‌زمینه ادامه دارد.

در بررسی عملکرد فنی، داده‌ها نشان می‌دهند که اگرچه مدل Fable (max) همچنان در بسیاری از معیارها پیشتاست، اما Grok 4.5 در محک Terminal Bench 2.1 بسیار رقابتی عمل می‌کند. SpaceXAI در ادعاهای تبلیغاتی خود می‌گوید که این مدل از مدل‌های پیشرو مشابه پیشی گرفته است، هرچند داده‌های ارائه شده چشم‌اندازی ترکیبی را نشان می‌دهد. برای درک بهتر، معیار “pass@1” تنها دفعاتی که مدل در اولین تلاش موفق شده را می‌شمارد و “resolve rate” سهم تکالیفی که به‌طور کامل اصلاح شده‌اند را ردیابی می‌کند.

نتایج کلیدی بنچمارک‌ها به شرح زیر است:

  • DeepSWE 1.0 (pass@1): ۶۲.۰٪ (در مقابل ۶۶.۱٪ برای Fable max، ۶۴.۳۱٪ برای GPT 5.5 xhigh و ۵۵.۷۵٪ برای Opus 4.8 max)
  • DeepSWE 1.1: ۵۳٪ (در مقابل ۷۰٪ برای Fable max، ۶۷٪ برای GPT 5.5 xhigh، ۵۹٪ برای Opus 4.8 max و ۴۴٪ برای GLM 5.2)
  • Terminal Bench 2.1: ۸۳.۳٪ (در مقابل ۸۴.۳٪ برای Fable max، ۸۳.۴٪ برای GPT 5.5 xhigh و ۷۸.۹٪ برای Opus 4.8 max)
  • SWE Bench Pro (نرخ حل): ۶۴.۷٪ (در مقابل ۸۰.۴٪ برای Fable max، ۶۹.۲٪ برای Opus 4.8 max، ۶۲.۱٪ برای GLM 5.2 و ۵۸.۶٪ برای GPT 5.5 xhigh)

جالب است که این مدل رتبه نخست را در محک عامل‌های حقوقی Harvey کسب کرده است که SpaceXAI آن را به عنوان مدرک اصلی برای اثبات قدرت مدل در کارهای اداری حرفه‌ای و استدلال‌های حقوقی ذکر می‌کند.

از نظر اقتصادی، SpaceXAI قیمت‌گذاری تهاجمی را انتخاب کرده است: ۲ دلار برای هر میلیون توکن ورودی و ۶ دلار برای هر میلیون توکن خروجی، با سرعت سرویس‌دهی ۸۰ توکن در ثانیه (TPS).

در تحلیل دقیق‌تر روی SWE Bench Pro، مدل Grok 4.5 به‌طور میانگین به ۱۵٬۹۵۴ توکن خروجی برای حل تکالیف نیاز داشت، در حالی که Opus 4.8 (max) به ۶۷٬۰۲۰ توکن نیاز داشت. این تفاوت چشمگیر، نشان‌دهنده بهبود ۴.۲ برابری در بهره‌وری توکن است. این یعنی مدل جدید در کمتر از نصف مراحل رقیبان خود به جواب می‌رسد، که مستقیماً باعث کاهش هزینه خروجی و تأخیر در هر تکلیف می‌شود.

در حال حاضر کاربران می‌توانند از طریق Grok Build (که مدل پیش‌فرض است)، کنسول SpaceXAI یا در تمامی طرح‌های Cursor با شناسه grok-4.5 به این مدل دسترسی داشته باشند. این سرویس فعلاً در اتحادیه اروپا در دسترس نیست و تاریخ عرضه آن برای اواسط ژوئیه پیش‌بینی شده است. همچنین استفاده رایگان برای مدت محدودی در Grok Build و Cursor ارائه شده است.

کاربردهای عملی این مدل شامل موارد زیر است:

  • ترمیم کد: شناسایی یک باگ، رفع آن و توضیح علت ریشه‌ای وقوع آن.
  • ساخت نمونه اولیه: خلق یک شبیه‌سازی منظومه شمسی با Three.js تنها با یک پرامپت واحد.
  • تکالیف عامل حقوقی: بهره‌گیری از رتبه اول در بنچمارک Harvey برای استدلال‌های قانونی.
  • کار با صفحات گسترده: ایجاد مدل‌های چندبرگی اکسل که با تحقیقات وب ادغام شده‌اند.
  • مستندسازی: تبدیل یک طرح کلی (Outline) به یک گزارش رسمی Word و یک اسلاید ارائه.

برای جامعه فنی، این رویکرد معیار موفقیت را از «توانایی خام» به «هوش در هر توکن» تغییر می‌دهد. SpaceXAI با کاهش حجم خروجی مورد نیاز برای رسیدن به پاسخ صحیح، گلوگاه‌های تأخیر و هزینه‌ای را هدف قرار داده است که در حال حاضر بر عامل‌های خودکار (Autonomous Agents) سایه انداخته است.

شما می‌توانید همین امروز تست مدل را از طریق نقطه پایانی (endpoint) پاسخ‌های API یا با نصب Grok Build CLI با دستور curl -fsSL https://x.ai/cli/install.sh | bash آغاز کنید.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، مدل grok-4.5 را در Cursor تست کنید تا تفاوت در تعداد توکن‌های مصرفی برای حل باگ‌ها را ببینید.
  • از طریق API در نقطه پایانی (endpoint) پاسخ‌ها، سرعت ۸۰ توکن در ثانیه را در پروژه‌های Agentic خود بسنجید.
  • ابزار Grok Build CLI را با دستور curl -fsSL https://x.ai/cli/install.sh | bash نصب کنید تا محیط توسعه را سریع‌تر تجربه کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است؛ برای درک اینکه تراشه‌های GB300 چگونه این سرعت را ممکن کردند، به تحلیل ما درباره معماری Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با کاهش ۴.۲ برابری توکن‌های خروجی، هزینه و تأخیر عامل‌های هوشمند را به شدت پایین می‌آورد. اعتبار این ادعا توسط نتایج محک SWE Bench Pro تأیید شده و استقرار تجاری آن در Cursor، دسترسی برنامه‌نویسان به استدلال ارزان‌تر را ممکن می‌کند.

تأثیر برای ایران

دسترسی به این مدل برای توسعه‌دهندگان ایرانی از طریق کنسول SpaceXAI و Cursor امکان‌پذیر است، اما هزینه ارزان‌تر توکن‌ها در مقایسه با مدل‌های رقیب، جذابیت بیشتری برای استقرار عامل‌های هوشمند در استارتاپ‌های داخلی ایجاد می‌کند.

·نگاه ما
تحریریه دات‌هوش

تمرکز SpaceXAI بر «هوش در هر توکن» نشان می‌دهد که عصر رقابت بر سر اندازه مدل‌ها به پایان رسیده و اکنون رقابت بر سر نرخ بهره‌وری است. این مدل با کاهش چشمگیر حجم خروجی، در واقع «پرت‌وپلاهای زبانی» مدل‌های زبانی بزرگ را حذف کرده تا به پاسخ‌های مهندسی خالص برسد. این رویکرد، مدل Grok 4.5 را از یک چت‌بات به یک ابزار تولیدی تبدیل می‌کند که برای محیط‌های عملیاتی (Production) طراحی شده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.