تصور کنید برای ساخت یک صفحه وب ساده، یک مدل از شما ۱۰۵۵ واحد اعتبار بخواهد و مدل دیگر تنها ۱.۳ واحد؛ این تفاوت خیرهکننده ۸۰۰ برابری در هزینه بین Claude Opus 5 و DeepSeek V4 Flash، یک سبکدستی حیاتی را پیش روی توسعهدهندگان قرار میدهد: پرداخت هزینه گزاف برای شهود طراحی «آمادهبهکار» (turnkey) در مقابل یک رویکرد تکرارشونده و کمهزینه. اگر امروز بودجه استنتاج خود را مدیریت میکنید، باید بدانید که پرداخت هزینه اضافی برای شهود طراحی، لزوماً به معنای خروجی بهتر برای هر پروژه نیست.
در ۱۳ اوت ۲۰۲۶، شرکت Netlify نتایج مقایسه مفصل ۱۱ مدل هوش مصنوعی را منتشر کرد که از طریق یک مشارکت جدید با OpenRouter به پلتفرم این شرکت اضافه شدهاند. این اقدام به توسعهدهندگان اجازه میدهد از طریق AI Gateway و Agent Runners — محیط داخلی عاملهای کدنویسی نتلیفای — طیف گستردهتری از مدلها را به کار بگیرند.
نتلیفای با تکیه بر روند تبدیل ابزارهای هوش مصنوعی به شتابدهندههایی که مسیر تبدیل ایده به محصول را خودکار میکنند، از چتباتهای ساده فاصله گرفته است. آنها اکنون چارچوبی فراهم کردهاند تا توسعهدهندگان دقیقاً بدانند برای هر سطح از «هوش»، چه مقدار اعتبار از نظر اعتبارات پلتفرم پرداخت میکنند. همانطور که در تحلیلهای قبلی ما درباره امنیت مدلهای بازمتن اشاره کردیم، تمرکز صنعت اکنون از «توانایی مدل» به «بهرهوری مدل» تغییر کرده است.
مشارکت و قابلیتهای جدید
همکاری با OpenRouter دو قابلیت اصلی را به اکوسیستم نتلیفای وارد میکند:
- گسترش AI Gateway: اکنون پروژهها میتوانند از هر مدلی که در OpenRouter موجود است استفاده کنند. این قابلیت بهطور خاص برای اپلیکیشنهای وب طراحی شده است که ویژگیهای مبتنی بر استنتاج هوش مصنوعی را به کاربران نهایی ارائه میدهند و امکان انتخاب مدلهای متنوعتر را برای تطبیق با وظایف خاص و بودجههای مختلف فراهم میکند.
- ارتقای Agent Runners: نتلیفای مدلهای پیشرو کدنویسی را در Agent Runners — همان جعبه پرامپت چت که برای ساخت پروژهها از صفر یا تکرار روی پروژههای موجود استفاده میشود — گسترش داده است. این مجموعه اکنون شامل مدلهای باز و بحثبرانگیزی مانند Kimi K3، GLM 5.2 و DeepSeek V4 است.
درک مفهوم Agent Runners
نتلیفای از اصطلاح «Agent Runners» استفاده میکند چون این ابزارها برخلاف نسخههای ساده و تقلیلیافته، یک عامل (Agent) کامل کدنویسی هستند. پیش از این، پلتفرم از Claude Agent، OpenAI Codex و Gemini CLI پشتیبانی میکرد که هر کدام برای ارائهدهنده مربوط به خود بهینه شده بودند.
برای اینکه این عاملها مؤثر باشند، نتلیفای مهارتهای اضافی و زمینه (Context) خاص هر پروژه را در اختیار آنها قرار میدهد. این کار تضمین میکند که عامل دقیقاً بداند از کدام قابلیتهای نتلیفای — مانند Netlify Database، Identity یا AI Gateway — استفاده کند و زمانبندی و نحوه پیادهسازی صحیح هر یک را درک کند. همچنین برای پشتیبانی از تنوع جدید مدلها، نتلیفای مدل متنباز و محبوب OpenCode را به عنوان یک گزینه جدید برای عاملها اضافه کرده است.
چارچوب تست: AXIS
برای استانداردسازی نتایج و مبارزه با «ترس از عقب ماندن» (FOMO) پیرامون عرضه مدلهای جدید، نتلیفای از AXIS استفاده میکند. AXIS یک ابزار متنباز برای ارزیابی خودکار مدلها است. AXIS فقط به کد نگاه نمیکند، بلکه سایت تولید شده را بر اساس صحت عملکردی امتیازدهی میکند.
نحوه ارزیابی مدلها توسط AXIS
نتلیفای مجموعهای از موارد تست را در اختیار AXIS قرار میدهد، از جمله پرامپتهایی برای ساخت سایتهای جدید و پرامپتهای بعدی برای تکرار و اصلاح. فرآیند ارزیابی از یک مجموعه سختگیرانه از بررسیها پیروی میکند:
- صحت عملکردی: AXIS اولویت را بر این میگذارد که آیا سایت واقعاً کار میکند یا خیر، و این موضوع را بر طراحی بصری مقدم میدارد.
- منطق پایگاهداده: بررسی میکند که آیا مدل در صورتی که نیاز کاربر ایجاب کند، از پایگاهداده استفاده میکند یا خیر، و بهطور خاص بررسی میکند که آیا Netlify Database را بهدرستی پیاده کرده است.
- جلوگیری از مهندسی بیش از حد: در مواردی که یک سایت استاتیک ساده کافی است، AXIS تضمین میکند که مدل بهطور غیرضروری پایگاهداده را راهاندازی نکند.
- بهکارگیری مهارتها: اگر مدلها مکرراً در بهکارگیری یک مهارت خاص نتلیفای شکست بخورند یا اگر هزینه اعتبار برای نتیجه بهدستآمده بیش از حد به نظر برسد، نتلیفای خودِ آن مهارت را بهینه میکند.
اگر مدلی بهطور مداوم در این امتیازات تست عقب بماند، در Agent Runners ارائه نمیشود.
سناریوی ۱: کافیشاپ محلی
نتلیفای مدلها را با یک پرامپت ساده آزمایش کرد: «یک سایت تکصفحهای برای یک کافیشاپ محلی بساز: ساعات کاری، آدرس، یک منوی کوتاه و یک عکس. هیچچیز در آن تغییر نمیکند مگر اینکه خودم آن را ویرایش کنم.» جمله آخر به عنوان راهنمایی به مدل بود که هیچ سیستم مدیریت محتوای (CMS) پیچیدهای مورد نیاز نیست.
برای جلوگیری از تولید محتوای بیروح و تکراری (purple AI slop)، مهارتهای پیشفرض نتلیفای شامل راهنماییهای طراحی UI است تا به مدلها کمک کند درباره یک هویت بصری مناسب برای درخواست کاربر استدلال کنند. فراتر از آن، مدلها به حال خود رها شدند.
Claude Opus 5 به عنوان پیشرو در بخش بصری ظاهر شد. در یک اجرای با هزینه بالا (۱۰۵۵ اعتبار)، این مدل صفحهای دلپذیر با المانهای متنی متحرک — مانند یک المان «مهر مانند» با یک دانه قهوه در مرکز — و یک نقشه سفارشی ایجاد کرد.

با این حال، Opus 5 نوسانی است. اجراهای دیگر هزینه بسیار کمتری داشتند (۲۴۹ و ۲۵۳ اعتبار)، اما کیفیت همچنان بالا باقی ماند. گرافیکهای برداری بهویژه برای مدلهای زبانی بزرگ (LLM) دشوار هستند و Opus 5 نماینده مرز فعلی تواناییها در این زمینه است، حتی اگر این حوزه هنوز از تولید متن یا تصویر عقبتر باشد.


Claude Sonnet 5 بهطور میانگین ۱۴۳ اعتبار هزینه داشت (با اجراهای تکگانه در ۸۱، ۲۴۵ و ۱۰۳ اعتبار). در حالی که نتایجی تمیز تولید کرد، گرافیکهای برداری بهطور محسوسی سادهتر بودند و برای یک سایت تولیدی واقعی مناسب نبودند.



رقبای OpenAI و گوگل
مدل GPT 5.6 Sol (که بهطور پیشفرض در حالت «تلاش کم» یا low effort اجرا میشود) بهطور میانگین ۱۴۱ اعتبار هزینه داشت (اجراها: ۱۷۳، ۱۵۸، ۹۲). نتلیفای دریافت که مدل ردهبالای OpenAI در حالت تلاش کم، در واقع در شهود طراحی پایه از مدل میانرده Sonnet شرکت Anthropic بهتر عمل میکند و محتوای غنیتری ارائه میدهد و از اشکال برداری عجیب دوری میکند، هرچند تصاویرش کلیشهایتر بودند.


مدل GPT 5.6 Terra، که یک سطح پایینتر از Sol است (طبق سلسلهمراتب Sol $\rightarrow$ Terra $\rightarrow$ Luna)، بهطور میانگین تنها ۳۹ اعتبار هزینه داشت (اجراها: ۴۳، ۲۳، ۴۹). این مدل یک زبان بصری متمایز را حفظ کرد، هرچند گاهی دچار اختلالاتی مانند نبود تصاویر یا تضاد رنگی پایین متن روی تصاویر میشد.
مدلهای گوگل شکاف نسلی را نشان دادند. Gemini 3.1 Pro (۵۳ اعتبار) نتایجی حداقلی تولید کرد که هیچ کاری بیش از آنچه در پرامپت خواسته شده بود، انجام نداد. در مقابل، Gemini 3.6 Flash (۱۰۳ اعتبار؛ اجراها: ۱۰۹، ۹۱، ۱۱۱) روی محتوا و طراحی مدرن بسیار بیشتر تلاش کرد، هرچند تمایل به تکرار بیشتر نسبت به سایر مدلها داشت.
عملکرد مدلهای با وزنهای باز (Open-Weight)
مدلهای با وزنهای باز بیشترین صرفهجویی در هزینه را فراهم کردند. DeepSeek V4 Flash (0731) رکورد جدیدی ثبت کرد و بهطور میانگین تنها ۲.۴ اعتبار در هر اجرا هزینه داشت. برخی اجراها حتی تا ۱.۳ اعتبار کاهش یافتند در حالی که همچنان زبان و حس مدلهای بسته میانرده را تقلید میکردند. این دسترسی گسترده به مدلهای وزنباز، همانطور که در تحلیلهای مؤسسه بروکینگز درباره اهمیت این مدلها برای پیشروی در هوش مصنوعی اشاره شده، میتواند توازن قدرت در صنعت را تغییر دهد.
مدل Kimi K3 که برای وظایف عاملمحور با افق زمانی طولانی بازاریابی شده و برای رقابت با Fable 5 و Opus 5 طراحی شده است، بهطور میانگین ۱۰۲ اعتبار هزینه داشت (اجراها: ۱۲۵، ۹۵، ۸۶). در حالی که برای اپلیکیشنهای پیچیده قدرتمند است، در این تسک محدودِ طراحی-محور بهطور خاص ندرخشید. مدل پیشین آن، Kimi K2.7 Code، بسیار ارزانتر بود (۱۹ اعتبار) اما عمق طراحی نداشت.
مدل GLM 5.2 بهطور میانگین ۲۷ اعتبار هزینه داشت (اجراها: ۱۵، ۴۲، ۲۴). این مدل تنوع غافلگیرکنندهای بین اجراها نشان داد، هرچند یک مدل صرفاً متنی است. چون GLM 5.2 نمیتواند ورودیهای تصویری دریافت کند، نمیتواند از اسکرینشاتها برای الهام گرفتن در طراحی استفاده کند؛ قابلیتی که مدلهای Kimi دارای آن هستند.
مدل DeepSeek V4 Pro (۴۷ اعتبار) بیشتر از GPT 5.6 Terra دچار مشکل شد. این مدل گاهی کدهای HTML تولید میکرد که به فایلهای تصویری غیرموجود اشاره میکردند؛ اشتباهی که بهندرت در مدلهای تجاری ردهبالای OpenAI، Anthropic یا Google دیده میشود.
اقتصاد اعتبار
برای توسعهدهندگان در نتلیفای، این اعداد مستقیماً به بودجه تبدیل میشوند. ساختار اعتبار به شرح زیر است:
- طرح رایگان (Free Plan): ۳۰۰ اعتبار شامل شده.
- طرح شخصی (Personal Plan): ۱۰۰۰ اعتبار شامل شده.
- طرح حرفهای (Pro Plan): ۳۰۰۰ اعتبار شامل شده.
- اعتبارات اضافی: کاربران Pro میتوانند بستههای ۱۵۰۰ اعتباری را به قیمت ۱۰ دلار خریداری کنند.
استفاده از Claude Opus 5 برای هر تکرار میتواند کل طرح رایگان را در یک اجرای پرهزینه تخلیه کند. در مقابل، استفاده از DeepSeek V4 Flash اجازه میدهد صدها تکرار با همان قیمت انجام شود.
تحلیل: هزینه شهود
این دادهها نشان میدهد که ما در حال ورود به عصر «هوش لایهبندی شده» برای توسعه هستیم. مدلهای ردهبالا مانند Opus 5 به عنوان مدیران خلاق عمل میکنند؛ آنها بازیهای کلامی «هوشمندانه» و زیباییشناسی صیقلخوردهای ارائه میدهند که نیاز به پرامپتنویسی انسانی را کاهش میدهد. آنها همچنین اعتبارسنجی بیوقفهای روی کار خود انجام میدهند.
برای اکثر توسعهدهندگان، «نقطه بهینه» احتمالاً یک رویکرد ترکیبی است. استفاده از یک مدل کمهزینه مانند DeepSeek V4 Flash برای نمونهسازی سریع و سپس تغییر به یک مدل پیشرو برای صیقل نهایی، هم بودجه و هم کیفیت را به حداکثر میرساند.
این تغییر، نقش توسعهدهنده را از یک کدنویس به یک ارکستراتور تغییر میدهد. ارزش دیگر در دانستن نحوه نوشتن CSS نیست، بلکه در دانستن این است که کدام مدل را برای کدام مرحله از چرخه عمر پروژه به کار گیرد.
نگاه به آینده: فراتر از صفحات استاتیک
در حالی که این تست بر طراحی و متن متمرکز بود، فاز بعدی ارزیابی به سمت پیچیدگی عملکردی تغییر خواهد کرد. نتلیفای سه مورد استفاده دیگر را آزمایش خواهد کرد:
۱. تکرار کافیشاپ: افزودن یک سیستم رزرو صندلی به سایت استاتیک.
۲. اپلیکیشن لیست کارهای (To-Do) مشترک: یک اپلیکیشن چندکاربره که از ابتدا به یک پایگاهداده مشترک نیاز دارد و بعداً قابلیت آپلود عکس از طریق ابزارهای نتلیفای به آن اضافه میشود.
۳. اپلیکیشن «چه چیزی بپزم»: یک تولیدکننده دستور پخت غذای مبتنی بر هوش مصنوعی که باید بهدرستی از AI Gateway نتلیفای استفاده کند.
این تستها تعیین خواهند کرد که آیا مدلها میتوانند بهطور قابلاعتمادی احراز هویت، امنیت و ذخیرهسازی دادهها را مدیریت کنند و آیا میتوانند مشکلات را بر اساس بازخورد کاربر برطرف کنند یا تشخیص دهند که ورودی کاربر گمراهکننده است.
گام بعدی شما
- برای نمونهسازی سریع (Prototyping) از مدلهای ارزانقیمت مثل DeepSeek V4 Flash استفاده کنید تا بودجهتان تمام نشود.
- تنها در مرحله نهایی برای بهبود بصری و جزئیات پیچیده، از مدلهای گرانقیمت مثل Claude Opus 5 بهره ببرید.
- ابزار AXIS را برای ارزیابی خودکار کیفیت خروجیهای مدلهای مختلف در پروژههای خود به کار بگیرید.
اما این تنها آغاز ماجراست؛ بررسی اینکه آیا این مدلها میتوانند سیستمهای پیچیدهتر مثل رزرو آنلاین را مدیریت کنند، در گزارش بعدی ما منتشر خواهد شد.




گفتگو