اگر امروز برای استنتاج مدلهای زبانی هزینه پرداخت میکنید، احتمالاً از این به بعد نیازی به پرداختهای ماهانه ندارید. کلودفلر اکنون ۲۴ مدل زبانی پیشرفته را از طریق یک ایپیآی (API) واحد در اختیار تمام حسابهای رایگان قرار داده است.
به نقل از گزارش ۲۸ سپتامبر ۲۰۲۶ در وبسایت dev.to، این اقدام به توسعهدهندگان اجازه میدهد بدون نیاز به اشتراکهای گرانقیمت Anthropic یا OpenAI، عاملهای هوش مصنوعی (AI Agents) — شبیه به دستیارهای دیجیتالی که میتوانند بهجای شما تصمیم بگیرند و ابزارها را اجرا کنند — را در مقیاس تولیدی مستقر کنند.
برای بسیاری از توسعهدهندگان مستقل (Indie Hackers)، مانع اصلی دیگر هزینه خرید GPU نیست، بلکه مدیریت پیچیده ارکستراسیون ایپیآیهاست. این رویکرد کلودفلر در واقع پاسخی به نیاز بازار برای مدیریت متمرکز مدلهاست که پیشتر در مقایسه جامع درگاههای API هوش مصنوعی به بررسی توازن میان هزینه و مدیریت مدلها در این سرویسها پرداخته بودیم. همانطور که در تحلیل قبلی ما دربارهی امنیت مدلهای بازمتن اشاره کردیم و بررسی کردیم که چگونه قالبهای چت (Chat Templates) میتوانند باعث فعال شدن سلب مسئولیتهای «من یک هوش مصنوعی هستم» در مدلهای مختلف شوند، اکنون چالش اصلی یافتن استنتاج رایگان و پایدار برای گردشکارهای پیچیده است. استنتاج (Inference) — یعنی همان لحظهای که مدل واقعاً جواب تولید میکند، شبیه به خودِ آشپزی و نه دورهی آموزش آشپز — در محیطهای عملیاتی، حیاتیترین بخش است. سرویس کلودفلر اکنون مانند یک مرکز توزیع متمرکز برای مدلهای با وزنهای باز (Open Weights) عمل میکند تا نیاز به ساخت حسابهای متعدد در ارائهدهندگان مختلف را از بین ببرد.
فرآیند کشف مدلها
برای شناسایی این قابلیتها، یک اسکریپت اکتشافی از طریق دستور Invoke-RestMethod کاتالوگ مدلها را بررسی کرد. اگرچه این حساب کاربری بیش از ۳۰۰ مدل را برگرداند، اما همه آنها در دسترس نبودند. طبق گزارش مذکور، چندین مدل مطرح از جمله zai-org/glm-5.3، zai-org/glm-5.3-flash و moonshotai/kimi-k2.7-code با کد خطای ۵۰۳۵ مواجه شدند که پیام آن به این صورت بود: «مدل در طرح رایگان Workers در دسترس نیست» (Model is not available on the Workers Free plan).

با این حال، بررسیهای dev.to تایید میکند که لایه رایگان شامل مجموعهای متنوع از مدلهاست. در حالی که برخی نسخههای جدیدتر مانند GLM 5.3 به طرحهای پولی محدود شدهاند، مدلهای زیر تستهای استنتاج را در لایه رایگان با موفقیت پشت سر گذاشتهاند:
مدلهای برتر کدنویسی
- GPT-OSS-120B (@cf/openai/gpt-oss-120b): به عنوان بهترین مدل کلی برای Terraform، Kubernetes، DevOps و معماری AWS رتبهبندی شده است. این مدل در بازنویسی (Refactoring) مخازن کد چندفایلی بسیار توانمند است.
- Qwen2.5-Coder-32B (@cf/qwen/qwen2.5-coder-32b-instruct): مدلی که بهطور اختصاصی برای کدنویسی ساخته شده و برای بررسی Pull Requestها، رفع باگ و درک عمیق مخازن کد بهینه شده است. این مدل با ابزارهایی مثل Continue.dev و Cline سازگاری بسیار خوبی دارد.
- DeepSeek-R1-Distill-Qwen-32B (@cf/deepseek-ai/deepseek-r1-distill-qwen-32b): انتخاب اول برای تحلیل ریشهای خطاها (Root Cause Analysis)، دیباگهای پیچیده و گردشکارهای عاملمحور؛ مدلی که به عنوان ایدهآلترین گزینه برای رفع خطاهای خط لوله (Pipeline) در ساعت ۲ صبح توصیف شده است.
مدلهای عمومی و استدلالی
- Llama 4 Scout (17B) (@cf/meta/llama-4-scout-17b-16e-instruct): تعادلی میان سرعت و هوشمندی.
- Llama 3.3 70B (@cf/meta/llama-3.3-70b-instruct-fp8-fast): بسیار موثر برای طراحی سیستم، مستندسازی و بررسیهای فنی.
- QWQ-32B (@cf/qwen/qwq-32b): دارای قابلیتهای استدلالی (Reasoning) قوی.
- Gemma 4 (26B) (@cf/google/gemma-4-26b-a4b-it): بخشی از جدیدترین خانواده مدلهای با وزن باز گوگل، در کنار نسخههای لورا (LoRA) ۲ و ۷ میلیارد پارامتری Gemma.
- سایر مدلهای در دسترس: Mistral Small 3.1 (24B)، GLM 4.7 Flash و NVIDIA Nemotron-3-120B.
درک محدودیتها
مدیریت منابع در کلودفلر به طور بنیادی با ارائهدهندگانی مثل Groq متفاوت است. در حالی که Groq معمولاً محدودیتها را به ازای هر مدل اعمال میکند (مثلاً مدل A دارای X درخواست در دقیقه و مدل B دارای Y درخواست در دقیقه است)، کلودفلر از یک سیستم سهمیه در سطح حساب (Account-level quota) استفاده میکند:
- بودجه روزانه: ۱۰,۰۰۰ «نورون» (Neuron) در روز که بین تمام مدلهای حساب مشترک است.
- توان عملیاتی: ۳۰۰ درخواست در دقیقه (RPM) برای بارهای کاری تولید متن.
- ساختار: بودجه روزانه در سطح حساب + RPM تولید متن + بازنویسیهای خاص برای هر مدل (Model-Specific Overrides).
این تغییر در چشمانداز استنتاج، به نفع مدلهای «استارتآپ ناب» (Lean Startup) است. توسعهدهندگان اکنون میتوانند بدون نیاز به سرورهای گرانقیمت GPU، نقاط انتهایی استنتاج AWS یا سرویس RunPod، اپلیکیشنهای Copilot داخلی و سیستمهای تولید بازیابیافزا (RAG) — شبیه به دانشآموزی که قبل از جواب دادن، اول کتاب درسی را باز میکند و از آن نقل میآورد — را پیاده کنند. این انعطافپذیری در انتخاب مدلها، در واقع بخشی از استراتژی گستردهتری است که در آن زیرساختهای ماژولار در برابر اکوسیستمهای بسته قرار میگیرند تا از وابستگی شدید به یک ارائهدهنده خاص (Vendor Lock-in) جلوگیری شود. امکان جابهجایی سریع بین یک مدل استدلالی مثل DeepSeek R1 و یک متخصص کدنویسی مثل Qwen 2.5 بدون تغییر ارائهدهنده، چرخه ساخت MVP را بهشدت سرعت میبخشد.
برای شما به عنوان کاربر، این یعنی هزینه آزمایش با عاملهای هوش مصنوعی عملاً به صفر رسیده است. دیگر نیازی نیست برای مقایسه عملکرد مدلها روی یک تسک خاص، پنج کلید ایپیآی مختلف را مدیریت کنید.
توسعهدهندگان اکنون باید تست کنند که چه تعداد درخواست واقعی کدنویسی در بودجه ۱۰,۰۰۰ نورونی روزانه جای میگیرد تا متوجه شوند آیا لایه رایگان میتواند یک MVP در مقیاس تولید را پشتیبانی کند یا خیر.
گام بعدی شما
- بررسی کنید که چند درخواست واقعی کدنویسی در بودجه ۱۰,۰۰۰ نورونی روزانه جای میگیرد تا متوجه شوید لایه رایگان برای MVP شما کافی است یا خیر.
- مدل DeepSeek R1 را برای تحلیل خطاهای پیچیده سیستم خود جایگزین مدلهای عمومی کنید.
- یک سامانه RAG ساده را روی Workers AI پیاده کنید تا هزینه استنتاج خود را به صفر برسانید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو