پرش به محتوای اصلی
پرش به محتوای مقاله

هزینه استنتاج Claude Opus 5 دویست برابر بیشتر از DeepSeek V4 Flash است

·۲۲ مرداد ۱۴۰۵۱۳ دقیقه مطالعه۲ بازدید
مقایسه ۱۱ مدل مختلف هوش مصنوعی: گزینه‌های بیشتر، انتخاب بهتر
مقایسه ۱۱ مدل مختلف هوش مصنوعی: گزینه‌های بیشتر، انتخاب بهتر
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کشف تفاوت ۸۰۰ برابری در هزینه استنتاج برای یک خروجی مشابه بین مدل‌های پیشرو و بهینه؛ این اولین بار است که هزینه واقعی «شهود طراحی» در مقیاس عملیاتی اندازه‌گیری شده است.

تصور کنید برای ساخت یک صفحه وب ساده، یک مدل از شما ۱۰۵۵ واحد اعتبار بخواهد و مدل دیگر تنها ۱.۳ واحد؛ این تفاوت خیره‌کننده ۸۰۰ برابری در هزینه بین Claude Opus 5 و DeepSeek V4 Flash، یک سبکدستی حیاتی را پیش روی توسعه‌دهندگان قرار می‌دهد: پرداخت هزینه گزاف برای شهود طراحی «آماده‌به‌کار» (turnkey) در مقابل یک رویکرد تکرارشونده و کم‌هزینه. اگر امروز بودجه استنتاج خود را مدیریت می‌کنید، باید بدانید که پرداخت هزینه اضافی برای شهود طراحی، لزوماً به معنای خروجی بهتر برای هر پروژه نیست.

در ۱۳ اوت ۲۰۲۶، شرکت Netlify نتایج مقایسه مفصل ۱۱ مدل هوش مصنوعی را منتشر کرد که از طریق یک مشارکت جدید با OpenRouter به پلتفرم این شرکت اضافه شده‌اند. این اقدام به توسعه‌دهندگان اجازه می‌دهد از طریق AI Gateway و Agent Runners — محیط داخلی عامل‌های کدنویسی نتلیفای — طیف گسترده‌تری از مدل‌ها را به کار بگیرند.

نتلیفای با تکیه بر روند تبدیل ابزارهای هوش مصنوعی به شتاب‌دهنده‌هایی که مسیر تبدیل ایده به محصول را خودکار می‌کنند، از چت‌بات‌های ساده فاصله گرفته است. آن‌ها اکنون چارچوبی فراهم کرده‌اند تا توسعه‌دهندگان دقیقاً بدانند برای هر سطح از «هوش»، چه مقدار اعتبار از نظر اعتبارات پلتفرم پرداخت می‌کنند. همان‌طور که در تحلیل‌های قبلی ما درباره امنیت مدل‌های بازمتن اشاره کردیم، تمرکز صنعت اکنون از «توانایی مدل» به «بهره‌وری مدل» تغییر کرده است.

مشارکت و قابلیت‌های جدید

همکاری با OpenRouter دو قابلیت اصلی را به اکوسیستم نتلیفای وارد می‌کند:

  • گسترش AI Gateway: اکنون پروژه‌ها می‌توانند از هر مدلی که در OpenRouter موجود است استفاده کنند. این قابلیت به‌طور خاص برای اپلیکیشن‌های وب طراحی شده است که ویژگی‌های مبتنی بر استنتاج هوش مصنوعی را به کاربران نهایی ارائه می‌دهند و امکان انتخاب مدل‌های متنوع‌تر را برای تطبیق با وظایف خاص و بودجه‌های مختلف فراهم می‌کند.
  • ارتقای Agent Runners: نتلیفای مدل‌های پیشرو کدنویسی را در Agent Runners — همان جعبه پرامپت چت که برای ساخت پروژه‌ها از صفر یا تکرار روی پروژه‌های موجود استفاده می‌شود — گسترش داده است. این مجموعه اکنون شامل مدل‌های باز و بحث‌برانگیزی مانند Kimi K3، GLM 5.2 و DeepSeek V4 است.

درک مفهوم Agent Runners

نتلیفای از اصطلاح «Agent Runners» استفاده می‌کند چون این ابزارها برخلاف نسخه‌های ساده و تقلیل‌یافته، یک عامل (Agent) کامل کدنویسی هستند. پیش از این، پلتفرم از Claude Agent، OpenAI Codex و Gemini CLI پشتیبانی می‌کرد که هر کدام برای ارائه‌دهنده مربوط به خود بهینه شده بودند.

برای اینکه این عامل‌ها مؤثر باشند، نتلیفای مهارت‌های اضافی و زمینه (Context) خاص هر پروژه را در اختیار آن‌ها قرار می‌دهد. این کار تضمین می‌کند که عامل دقیقاً بداند از کدام قابلیت‌های نتلیفای — مانند Netlify Database، Identity یا AI Gateway — استفاده کند و زمان‌بندی و نحوه پیاده‌سازی صحیح هر یک را درک کند. همچنین برای پشتیبانی از تنوع جدید مدل‌ها، نتلیفای مدل متن‌باز و محبوب OpenCode را به عنوان یک گزینه جدید برای عامل‌ها اضافه کرده است.

چارچوب تست: AXIS

برای استانداردسازی نتایج و مبارزه با «ترس از عقب ماندن» (FOMO) پیرامون عرضه مدل‌های جدید، نتلیفای از AXIS استفاده می‌کند. AXIS یک ابزار متن‌باز برای ارزیابی خودکار مدل‌ها است. AXIS فقط به کد نگاه نمی‌کند، بلکه سایت تولید شده را بر اساس صحت عملکردی امتیازدهی می‌کند.

نحوه ارزیابی مدل‌ها توسط AXIS

نتلیفای مجموعه‌ای از موارد تست را در اختیار AXIS قرار می‌دهد، از جمله پرامپت‌هایی برای ساخت سایت‌های جدید و پرامپت‌های بعدی برای تکرار و اصلاح. فرآیند ارزیابی از یک مجموعه سخت‌گیرانه از بررسی‌ها پیروی می‌کند:

  • صحت عملکردی: AXIS اولویت را بر این می‌گذارد که آیا سایت واقعاً کار می‌کند یا خیر، و این موضوع را بر طراحی بصری مقدم می‌دارد.
  • منطق پایگاه‌داده: بررسی می‌کند که آیا مدل در صورتی که نیاز کاربر ایجاب کند، از پایگاه‌داده استفاده می‌کند یا خیر، و به‌طور خاص بررسی می‌کند که آیا Netlify Database را به‌درستی پیاده کرده است.
  • جلوگیری از مهندسی بیش از حد: در مواردی که یک سایت استاتیک ساده کافی است، AXIS تضمین می‌کند که مدل به‌طور غیرضروری پایگاه‌داده را راه‌اندازی نکند.
  • به‌کارگیری مهارت‌ها: اگر مدل‌ها مکرراً در به‌کارگیری یک مهارت خاص نتلیفای شکست بخورند یا اگر هزینه اعتبار برای نتیجه به‌دست‌آمده بیش از حد به نظر برسد، نتلیفای خودِ آن مهارت را بهینه می‌کند.

اگر مدلی به‌طور مداوم در این امتیازات تست عقب بماند، در Agent Runners ارائه نمی‌شود.

سناریوی ۱: کافی‌شاپ محلی

نتلیفای مدل‌ها را با یک پرامپت ساده آزمایش کرد: «یک سایت تک‌صفحه‌ای برای یک کافی‌شاپ محلی بساز: ساعات کاری، آدرس، یک منوی کوتاه و یک عکس. هیچ‌چیز در آن تغییر نمی‌کند مگر اینکه خودم آن را ویرایش کنم.» جمله آخر به عنوان راهنمایی به مدل بود که هیچ سیستم مدیریت محتوای (CMS) پیچیده‌ای مورد نیاز نیست.

برای جلوگیری از تولید محتوای بی‌روح و تکراری (purple AI slop)، مهارت‌های پیش‌فرض نتلیفای شامل راهنمایی‌های طراحی UI است تا به مدل‌ها کمک کند درباره یک هویت بصری مناسب برای درخواست کاربر استدلال کنند. فراتر از آن، مدل‌ها به حال خود رها شدند.

Claude Opus 5 به عنوان پیشرو در بخش بصری ظاهر شد. در یک اجرای با هزینه بالا (۱۰۵۵ اعتبار)، این مدل صفحه‌ای دلپذیر با المان‌های متنی متحرک — مانند یک المان «مهر مانند» با یک دانه قهوه در مرکز — و یک نقشه سفارشی ایجاد کرد.

مقایسه ۱۱ مدل هوش مصنوعی: گزینه‌های بیشتر، انتخاب بهتر

با این حال، Opus 5 نوسانی است. اجراهای دیگر هزینه بسیار کمتری داشتند (۲۴۹ و ۲۵۳ اعتبار)، اما کیفیت همچنان بالا باقی ماند. گرافیک‌های برداری به‌ویژه برای مدل‌های زبانی بزرگ (LLM) دشوار هستند و Opus 5 نماینده مرز فعلی توانایی‌ها در این زمینه است، حتی اگر این حوزه هنوز از تولید متن یا تصویر عقب‌تر باشد.

مقایسه ۱۱ مدل مختلف هوش مصنوعی: انتخابی گسترده‌تر برای کاربران

مقایسه ۱۱ مدل مختلف هوش مصنوعی: گزینه‌های بیشتر، انتخاب بهتر

Claude Sonnet 5 به‌طور میانگین ۱۴۳ اعتبار هزینه داشت (با اجراهای تک‌گانه در ۸۱، ۲۴۵ و ۱۰۳ اعتبار). در حالی که نتایجی تمیز تولید کرد، گرافیک‌های برداری به‌طور محسوسی ساده‌تر بودند و برای یک سایت تولیدی واقعی مناسب نبودند.

مقایسه ۱۱ مدل مختلف هوش مصنوعی: گزینه‌های بیشتر، انتخاب بهتر

مقایسه ۱۱ مدل مختلف هوش مصنوعی: گزینه‌های بیشتر، انتخاب بهتر

مقایسه ۱۱ مدل مختلف هوش مصنوعی: گزینه‌های بیشتر، انتخاب بهتر

رقبای OpenAI و گوگل

مدل GPT 5.6 Sol (که به‌طور پیش‌فرض در حالت «تلاش کم» یا low effort اجرا می‌شود) به‌طور میانگین ۱۴۱ اعتبار هزینه داشت (اجراها: ۱۷۳، ۱۵۸، ۹۲). نتلیفای دریافت که مدل رده‌بالای OpenAI در حالت تلاش کم، در واقع در شهود طراحی پایه از مدل میان‌رده Sonnet شرکت Anthropic بهتر عمل می‌کند و محتوای غنی‌تری ارائه می‌دهد و از اشکال برداری عجیب دوری می‌کند، هرچند تصاویرش کلیشه‌ای‌تر بودند.

مقایسه ۱۱ مدل مختلف هوش مصنوعی: گزینه‌های بیشتر، انتخاب بهتر

مقایسه ۱۱ مدل مختلف هوش مصنوعی: گزینه‌های بیشتر، انتخاب بهتر

مدل GPT 5.6 Terra، که یک سطح پایین‌تر از Sol است (طبق سلسله‌مراتب Sol $\rightarrow$ Terra $\rightarrow$ Luna)، به‌طور میانگین تنها ۳۹ اعتبار هزینه داشت (اجراها: ۴۳، ۲۳، ۴۹). این مدل یک زبان بصری متمایز را حفظ کرد، هرچند گاهی دچار اختلالاتی مانند نبود تصاویر یا تضاد رنگی پایین متن روی تصاویر می‌شد.

مدل‌های گوگل شکاف نسلی را نشان دادند. Gemini 3.1 Pro (۵۳ اعتبار) نتایجی حداقلی تولید کرد که هیچ کاری بیش از آنچه در پرامپت خواسته شده بود، انجام نداد. در مقابل، Gemini 3.6 Flash (۱۰۳ اعتبار؛ اجراها: ۱۰۹، ۹۱، ۱۱۱) روی محتوا و طراحی مدرن بسیار بیشتر تلاش کرد، هرچند تمایل به تکرار بیشتر نسبت به سایر مدل‌ها داشت.

عملکرد مدل‌های با وزن‌های باز (Open-Weight)

مدل‌های با وزن‌های باز بیشترین صرفه‌جویی در هزینه را فراهم کردند. DeepSeek V4 Flash (0731) رکورد جدیدی ثبت کرد و به‌طور میانگین تنها ۲.۴ اعتبار در هر اجرا هزینه داشت. برخی اجراها حتی تا ۱.۳ اعتبار کاهش یافتند در حالی که همچنان زبان و حس مدل‌های بسته میان‌رده را تقلید می‌کردند. این دسترسی گسترده به مدل‌های وزن‌باز، همان‌طور که در تحلیل‌های مؤسسه بروکینگز درباره اهمیت این مدل‌ها برای پیشروی در هوش مصنوعی اشاره شده، می‌تواند توازن قدرت در صنعت را تغییر دهد.

مدل Kimi K3 که برای وظایف عامل‌محور با افق زمانی طولانی بازاریابی شده و برای رقابت با Fable 5 و Opus 5 طراحی شده است، به‌طور میانگین ۱۰۲ اعتبار هزینه داشت (اجراها: ۱۲۵، ۹۵، ۸۶). در حالی که برای اپلیکیشن‌های پیچیده قدرتمند است، در این تسک محدودِ طراحی-محور به‌طور خاص ندرخشید. مدل پیشین آن، Kimi K2.7 Code، بسیار ارزان‌تر بود (۱۹ اعتبار) اما عمق طراحی نداشت.

مدل GLM 5.2 به‌طور میانگین ۲۷ اعتبار هزینه داشت (اجراها: ۱۵، ۴۲، ۲۴). این مدل تنوع غافلگیرکننده‌ای بین اجراها نشان داد، هرچند یک مدل صرفاً متنی است. چون GLM 5.2 نمی‌تواند ورودی‌های تصویری دریافت کند، نمی‌تواند از اسکرین‌شات‌ها برای الهام گرفتن در طراحی استفاده کند؛ قابلیتی که مدل‌های Kimi دارای آن هستند.

مدل DeepSeek V4 Pro (۴۷ اعتبار) بیشتر از GPT 5.6 Terra دچار مشکل شد. این مدل گاهی کدهای HTML تولید می‌کرد که به فایل‌های تصویری غیرموجود اشاره می‌کردند؛ اشتباهی که به‌ندرت در مدل‌های تجاری رده‌بالای OpenAI، Anthropic یا Google دیده می‌شود.

اقتصاد اعتبار

برای توسعه‌دهندگان در نتلیفای، این اعداد مستقیماً به بودجه تبدیل می‌شوند. ساختار اعتبار به شرح زیر است:

  • طرح رایگان (Free Plan): ۳۰۰ اعتبار شامل شده.
  • طرح شخصی (Personal Plan): ۱۰۰۰ اعتبار شامل شده.
  • طرح حرفه‌ای (Pro Plan): ۳۰۰۰ اعتبار شامل شده.
  • اعتبارات اضافی: کاربران Pro می‌توانند بسته‌های ۱۵۰۰ اعتباری را به قیمت ۱۰ دلار خریداری کنند.

استفاده از Claude Opus 5 برای هر تکرار می‌تواند کل طرح رایگان را در یک اجرای پرهزینه تخلیه کند. در مقابل، استفاده از DeepSeek V4 Flash اجازه می‌دهد صدها تکرار با همان قیمت انجام شود.

تحلیل: هزینه شهود

این داده‌ها نشان می‌دهد که ما در حال ورود به عصر «هوش لایه‌بندی شده» برای توسعه هستیم. مدل‌های رده‌بالا مانند Opus 5 به عنوان مدیران خلاق عمل می‌کنند؛ آن‌ها بازی‌های کلامی «هوشمندانه» و زیبایی‌شناسی صیقل‌خورده‌ای ارائه می‌دهند که نیاز به پرامپت‌نویسی انسانی را کاهش می‌دهد. آن‌ها همچنین اعتبارسنجی بی‌وقفه‌ای روی کار خود انجام می‌دهند.

برای اکثر توسعه‌دهندگان، «نقطه بهینه» احتمالاً یک رویکرد ترکیبی است. استفاده از یک مدل کم‌هزینه مانند DeepSeek V4 Flash برای نمونه‌سازی سریع و سپس تغییر به یک مدل پیشرو برای صیقل نهایی، هم بودجه و هم کیفیت را به حداکثر می‌رساند.

این تغییر، نقش توسعه‌دهنده را از یک کدنویس به یک ارکستراتور تغییر می‌دهد. ارزش دیگر در دانستن نحوه نوشتن CSS نیست، بلکه در دانستن این است که کدام مدل را برای کدام مرحله از چرخه عمر پروژه به کار گیرد.

نگاه به آینده: فراتر از صفحات استاتیک

در حالی که این تست بر طراحی و متن متمرکز بود، فاز بعدی ارزیابی به سمت پیچیدگی عملکردی تغییر خواهد کرد. نتلیفای سه مورد استفاده دیگر را آزمایش خواهد کرد:

۱. تکرار کافی‌شاپ: افزودن یک سیستم رزرو صندلی به سایت استاتیک.
۲. اپلیکیشن لیست کارهای (To-Do) مشترک: یک اپلیکیشن چندکاربره که از ابتدا به یک پایگاه‌داده مشترک نیاز دارد و بعداً قابلیت آپلود عکس از طریق ابزارهای نتلیفای به آن اضافه می‌شود.
۳. اپلیکیشن «چه چیزی بپزم»: یک تولیدکننده دستور پخت غذای مبتنی بر هوش مصنوعی که باید به‌درستی از AI Gateway نتلیفای استفاده کند.

این تست‌ها تعیین خواهند کرد که آیا مدل‌ها می‌توانند به‌طور قابل‌اعتمادی احراز هویت، امنیت و ذخیره‌سازی داده‌ها را مدیریت کنند و آیا می‌توانند مشکلات را بر اساس بازخورد کاربر برطرف کنند یا تشخیص دهند که ورودی کاربر گمراه‌کننده است.

گام بعدی شما

  • برای نمونه‌سازی سریع (Prototyping) از مدل‌های ارزان‌قیمت مثل DeepSeek V4 Flash استفاده کنید تا بودجه‌تان تمام نشود.
  • تنها در مرحله نهایی برای بهبود بصری و جزئیات پیچیده، از مدل‌های گران‌قیمت مثل Claude Opus 5 بهره ببرید.
  • ابزار AXIS را برای ارزیابی خودکار کیفیت خروجی‌های مدل‌های مختلف در پروژه‌های خود به کار بگیرید.

اما این تنها آغاز ماجراست؛ بررسی اینکه آیا این مدل‌ها می‌توانند سیستم‌های پیچیده‌تر مثل رزرو آنلاین را مدیریت کنند، در گزارش بعدی ما منتشر خواهد شد.

چرا این موضوع مهم است؟

این گزارش با تکیه بر داده‌های تجربی (Experience)، نشان می‌دهد که شکاف هزینه بین مدل‌های باز و بسته به شدت افزایش یافته است. این موضوع باعث می‌شود استراتژی‌های توسعه نرم‌افزار از مدل‌های تک‌منظوره به سمت معماری‌های چندمدلی حرکت کنند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم به مدل‌های پیشرو برای توسعه‌دهندگان ایرانی دشوار است؛ اما استفاده از مدل‌های وزن‌باز مثل DeepSeek که هزینه استنتاج بسیار پایینی دارند، جایگزینی اقتصادی و در دسترس برای تیم‌های داخلی است.

·نگاه ما
تحریریه دات‌هوش

داده‌های نتلیفای تایید می‌کند که «هوش» در حال تبدیل شدن به یک کالای مصرفی با قیمت‌های متغیر است. دیگر بحث بر سر این نیست که کدام مدل قوی‌تر است، بلکه بحث بر سر «بهینه‌ترین ترکیب مدل‌ها» برای یک چرخه تولید است. این یعنی مهارت آینده توسعه‌دهندگان در مدیریت زنجیره‌ای از مدل‌ها (Model Orchestration) تعریف می‌شود، نه تسلط بر یک مدل خاص.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.