پرش به محتوای اصلی
پرش به محتوای مقاله

Grok 4.5 سرعت استنتاج را دوبرابر کرد اما در کدنویسی سه‌بعدی شکست خورد

·۱۸ تیر ۱۴۰۵۵ دقیقه مطالعه
گروک ۴.۵، جی‌پی‌تی ۵.۵ و کلود در حال ساخت یک اپلیکیشن مشابه
گروک ۴.۵، جی‌پی‌تی ۵.۵ و کلود در حال ساخت یک اپلیکیشن مشابه
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

SLA یا سطح خدمات مدل‌ها اکنون به جای دقت محض، بر روی توان عملیاتی و هزینه متمرکز شده است. برای نخستین بار، شکاف قیمتی و سرعتی بین یک مدل پیشرو (Grok) و رقبای سنتی‌اش تا ۲ برابر افزایش یافت.

اگر امروز برای تولید کد در مقیاس بالا هزینه می‌کنید، Grok 4.5 می‌تواند هزینه‌های شما را به شدت کاهش دهد. اما یک حقیقت تلخ وجود دارد: سرعت بالا لزوماً به معنای دقت در اجرای منطق‌های پیچیده نیست. ورود Grok 4.5 به میدان به عنوان هوشمندترین مدل xAI تا به امروز — که به‌طور خاص در کنار Cursor برای کارهای کدنویسی عاملی (Agentic Coding) آموزش دیده است — یک توازن سخت در چشم‌انداز مدل‌های پیشرو را برجسته می‌کند: انتخاب بین هوشمندی سریع‌ترین و ارزان‌ترین، یا اجرای قابل‌اطمینان‌ترین.

این رقابت در حالی رخ می‌دهد که صنعت از چت‌های ساده به سمت وایب-کدینگ (Vibe Coding) — شبیه به کارگردانی یک فیلم که فقط کلیات را می‌گوید و منتظر است فیلم ساخته شود — حرکت می‌کند. در این رویکرد، کاربر انتظار دارد با یک دستور (Prompt) ساده، یک اپلیکیشن کامل و کاربردی دریافت کند. این رویکرد اگرچه جذاب است، اما همواره با چالش‌های فنی همراه است؛ چنان‌که پیش‌تر در بررسی نقاط ضعف Gemini Flash در محیط استودیو مشاهده کردیم، تکیه صرف بر «وایب» بدون دقت مهندسی می‌تواند منجر به شکست در پروژه‌های واقعی شود. همان‌طور که در تحلیل قبلی ما درباره‌ی بازنویسی Runtime زبان Bun با استفاده از Claude 5 اشاره کردیم، تکیه بر مدل‌های هوشمند برای حذف کدهای دستی در حال تبدیل شدن به استاندارد است. اکنون تمرکز بر این است که کدام مدل در تولید کدهای HTML خام و مستقل (Self-contained)، کمترین اصطکاک را دارد.

طبق گزارش وب‌سایت tryai.dev که در ۸ ژوئیه ۲۰۲۶ منتشر شد، چهار مدل Grok 4.5، GPT-5.5، Claude Opus 4.8 و Claude Fable 5 برای ساخت سه اپلیکیشن در قالب وان-شات (One-shot) — یعنی تولید خروجی درست تنها با یک تلاش بدون اصلاحات بعدی یا کلنجار رفتن با دستورات — به چالش کشیده شدند. قوانین بسیار سخت‌گیرانه بود: هر مدل باید یک فایل HTML واحد تولید می‌کرد که هیچ کتابخانه خارجی در آن نباشد و هیچ فراخوانی شبکه‌ای (Network Call) انجام ندهد. اگر یک اپلیکیشن به طور کامل رندر نمی‌شد و نمایش داده نمی‌شد، تنها یک بار تلاش مجدد (Retry) مجاز بود.

جزئیات نبرد مدل‌ها

  • مکعب روبیک سه‌بعدی: این دشوارترین و «بدجنس‌ترین» تکلیف بود. این پروژه نیازمند ریاضیات واقعی سه‌بعدی، مدیریت وضعیت برای هر وجه مکعب و انیمیشن‌های چرخش قابل‌مشاهده، همگی در یک فایل واحد بود. این سطح از پیچیدگی در تولید assets بصری، دقیقاً همان نقطه‌ای است که بسیاری از استودیوهای بازی‌سازی طبق گزارش یونیتی برای بهینه‌سازی فرآیندهای خود به هوش مصنوعی روی آورده‌اند.

    • برنده‌ها: Claude Opus 4.8 و Fable 5 در یک رتبه قرار گرفتند. هر دو مدلی توانستند مکعب‌هایی با رنگ‌بندی صحیح بسازند که در اولین تلاش به درستی به‌هم می‌ریختند و حل می‌شدند.
    • شکست‌ها: Grok 4.5 در تلاش اول با یک فضای خالی (Blank Void) مواجه شد و تنها با استفاده از آن یک بار تلاش مجاز، موفق شد در نهایت یک مکعب سه‌بعدی تمیز تولید کند. GPT-5.5 بیشترین مشکل را داشت و تنها یک وجه تیره رندر کرد که تقریباً هیچ رنگی نداشت.
  • سیمولاتور گرانشی ذرات: هدف ساخت یک محیط Sandbox مبتنی بر Canvas بود که صدها ذره، دنباله‌های حرکتی (Trails) و یک جذب‌کننده قوی (Attractor) داشته باشد که با کلیک کردن کاربر اضافه شود.

    • برنده: GPT-5.5 از نظر «وایب» و زیبایی‌شناختی برنده شد. این مدل جذب‌کننده‌های نئونی درخشان با دنباله‌های رنگی متراکم و چرخان ایجاد کرد.
    • سایر نتایج: Grok 4.5 ظاهری مداری و تمیز با حلقه‌های مرتب و ذرات خطی ارائه داد. Fable 5 از گوی‌های درخشان و نرم استفاده کرد، در حالی که Opus 4.8 یک میدان شلوغ و تار-مانند ساخت که فیزیک بسیار خوبی داشت اما جذابیت بصری کمتری نسبت به بقیه داشت.
  • بازی Breakout: یک بازی کلاسیک تخریب آجری که در آن پدل (Paddle) دنبال می‌کند موش را و توپ باید آجرهای رنگارنگ را بشکند.

    • نتیجه: این رقابت یک بازی مساوی بود. هر چهار مدل در اولین تلاش، بازی‌هایی با کیفیت تجاری (Ship-quality) شامل سیستم امتیازدهی، تعداد جان‌ها و یک پدل درخشان تولید کردند.
    • استایل: Grok 4.5 و GPT-5.5 هر دو به شدت به سمت زیبایی‌شناسی آرکیدهای نئونی متمایل بودند.

گروک ۴.۵، جی‌پی‌تی ۵.۵ و کلود در حال ساخت یک اپلیکیشن مشابه

فراتر از ظاهر، معیارهای عملکردی شکاف عظیمی را در بهره‌وری نشان می‌دهند. برای این کار از یک سیستم تست سفارشی با سه دستور ثابت در زمینه‌های کدنویسی، استدلال و خلاصه‌سازی (هر کدام سه بار تکرار شده و سقف خروجی ۴۰۰ توکن بود) استفاده شد تا سربار (Overhead) واقعی اجرای این مدل‌ها سنجیده شود.

به نقل از مستندات این آزمون، Grok 4.5 با تأخیر تنها ۰.۴۴ ثانیه تا اولین توکن، با سرعت تقریبی ۱۱۰ توکن در ثانیه پاسخ داد. این توان عملیاتی (Throughput) تقریباً دو برابر رقبایش است. همچنین این مدل با هزینه ۰.۰۰۲ سنت برای هر پاسخ، ارزان‌ترین گزینه موجود است. این نتایج دقیقاً با ادعای xAI مبنی بر ارائه «هوش در واحد زمان و هزینه» همسو است.

گروک ۴.۵، جی‌پی‌تی ۵.۵ و کلود در حال ساخت یک اپلیکیشن مشابه

با این حال، داده‌های Grok 4.5 نوسانی است. به دلیل پرگویی مدل و تولید توکن‌های بیشتر برای هر پاسخ، تأخیر میانه‌ی زمان واقعی (Wall-clock latency) آن در حد متوسط قرار گرفت و دمِ توزیع آن دارای جهش‌های شدید بود، به طوری که در معیار p95 تا ۹ ثانیه زمان برد.

در مقابل، Claude Fable 5 در نقطه‌ی مقابل طیف قرار داشت. این مدل با ۳.۴۷ ثانیه تأخیر تا اولین توکن و میانگین تأخیر ۶.۳ ثانیه، کندترین گزینه بود و با هزینه ۰.۰۰۹ سنت، گران‌ترین مدل بود. این در واقع «مالیات هوشمندی» است که کاربر برای قرار گرفتن در صدر جدول‌های دقت و هوش پرداخت می‌کند. GPT-5.5 و Opus 4.8 در ناحیه میانی بودند، به طوری که GPT-5.5 برای پاسخ‌های کوتاه و ساده، سریع‌ترین عملکرد (میانگین تأخیر ۲.۰ ثانیه) را داشت.

گروک ۴.۵، جی‌پی‌تی ۵.۵ و کلود در حال ساخت یک اپلیکیشن مشابه

برای سنجش تخیل فضایی، مدل‌ها باید تصاویر SVG دست‌نویس (بدون استفاده از تصاویر رستر یا کتابخانه) از یک اسب که سوار بر یک فضانورد در ماه است، خلق می‌کردند.

Claude Fable 5 در اینجا ستاره میدان بود. مدل نه‌تنها صحنه را به درستی کشید، بلکه با اضافه کردن جنبه‌های کمدی و روایت، به اثر عمق بخشید؛ به طوری که اسبی با کلاه گاوچرانی فریاد می‌زد: «بجنب انسان!» و فضانوردی که نفس‌نفس می‌زد پاسخ می‌داد: «هف... هف...». GPT-5.5 در جایگاه دوم قرار گرفت و اسبی را کشید که فریاد می‌زد: «ووهوو!». Grok 4.5 دستورالعمل را به دقت اجرا کرد و صحنه‌ای رنگارنگ و خوانا ساخت. جالب این‌که Opus 4.8 با وجود طراحی بصری شخصیت‌پردازی شده، در تست صحت شکست خورد؛ زیرا کد raw SVG آن دارای یک ویژگی تکراری (Duplicate attribute) بود که باعث می‌شود پارسرهای سخت‌گیر SVG با خطا مواجه شوند.

گروک ۴.۵، جی‌پی‌تی ۵.۵ و کلود در حال ساخت یک اپلیکیشن مشابه

برای توسعه‌دهندگان، این یعنی انتخاب مدل اکنون به حجم گردش‌کار شما بستگی دارد. اگر در حال اجرای تولید کد در مقیاس انبوه هستید که در آن هر میلی‌ثانیه و هر کسر از سنت در مجموع جمع می‌شود و اثر می‌گذارد، Grok 4.5 یک غول اقتصادی و ارزشمند است. این مدل توان عملیاتی عظیم و کمترین هزینه را برای کسانی که می‌توانند چند بار تلاش مجدد برای کارهای پیچیده و وابسته به وضعیت (Stateful) را تحمل کنند.

با این حال، برای کارهای حساس با وضعیت‌های پیچیده مانند رندرینگ سه‌بعدی یا منطق‌های دشوار، پرداخت «مالیات هوشمندی» خانواده Claude همچنان هزینه‌ای ضروری برای تضمین قابلیت اطمینان است. Opus 4.8 و Fable 5 همچنان قابل‌اطمینان‌ترین سازندگان برای دقت در حالت وان-شات هستند. GPT-5.5 نیز به عنوان یک گزینه میانی قوی برای کسانی که اولویت‌شان استایل بصری و پاسخ‌های کوتاه و سریع است، باقی می‌ماند.

اگر می‌خواهید ببینید آیا این نتایج برای پروژه خاص شما نیز صادق است، می‌توانید همین نسخه‌های مدل را به صورت پرداخت-به-اندازه-استفاده (Pay-as-you-go) در پلتفرم TryAI تست کنید تا نبردهای ساخت مدل خود را اجرا نمایید. تمام مدل‌های ذکر شده در اینجا با یک اکانت واحد و بدون نیاز به اشتراک ماهانه در دسترس هستند.

گام بعدی شما

  • اگر اولویت شما سرعت و هزینه است، گردش‌کارهای تکراری خود را به Grok 4.5 منتقل کنید.
  • برای ساختاربندی منطق‌های پیچیده و کدهای State-heavy، همچنان از Claude Fable 5 استفاده کنید.
  • برای تعادل بین زیبایی بصری و سرعت در پاسخ‌های کوتاه، GPT-5.5 را امتحان کنید.

می‌توانید این مدل‌ها را بدون نیاز به اشتراک و به صورت پرداخت-به-اندازه-استفاده در پلتفرم TryAI بسنجید؛ اما برای درک اینکه سخت‌افزارهای پشتیبان این سرعت‌ها چگونه کار می‌کنند، تحلیل ما درباره تراشه‌های Blackwell را بخوانید.

چرا این موضوع مهم است؟

این نتایج مهر تأییدی بر افزایش تخصص مدل‌هاست؛ جایی که دیگر یک مدل «بهترین در همه چیز» نیست. اعتبار داده‌های TryAI نشان می‌دهد که برای توسعه‌دهندگان، انتخاب مدل از یک تصمیم فنی به یک تصمیم مالی و عملیاتی تبدیل شده است.

تأثیر برای ایران

به دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم به این مدل‌ها برای توسعه‌دهندگان ایرانی دشوار است؛ با این حال، استفاده از واسطه‌هایی مثل TryAI تنها راه تست مقایسه‌ای این نسخه‌هاست.

·نگاه ما
تحریریه دات‌هوش

جایگاه Grok 4.5 نشان می‌دهد که xAI استراتژی «بهینه‌سازی استنتاج» را جایگزین «رهبری در دقت» کرده است. این مدل به جای تلاش برای شکست دادن Claude در بنچمارک‌های سخت، روی کاهش هزینه به حدی حرکت کرده که مدل را برای عامل‌های خودکار (Agents) بسیار جذاب می‌کند. در واقع، ما شاهد تفکیک بازار هستیم: مدل‌های «کارگری» ارزان و سریع در برابر مدل‌های «متفکر» گران و دقیق.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.