۶۰۰ میلیارد پارامتر؛ این مقیاس خیرکننده، قلب تپنده مدل جدید Step 5 Preview است که برای جابهجایی مرزهای هزینه در استقرار عاملهای خودمختار طراحی شده است. هدف این مدل ساده است: ارائه هوش سطح بالا با هزینهای بهمراتب کمتر از رقبای فعلی برای متخصصان حوزههای مالی، مهندسی نرمافزار و کارهای دانشی حرفهای.
در حالی که صنعت از چتباتهای ساده به سمت عاملهای بلندمدت (Long-horizon Agents) حرکت میکند، گلوگاه اصلی، هزینه استنتاج (Inference) برای استدلالهای طولانی و پنجرههای متنی عظیم شده است. StepFun با بهینهسازی «حلقه عاملمحور» (Agentic Loop) وارد میدان شده است؛ جایی که مدل باید برای مدتهای طولانی جستوجو کند، کد اجرا نماید و نتایج ابزارها را پردازش کند.
همانطور که در تحلیلهای پیشین ما دربارهی بهینهسازی هزینههای استنتاج در مدلهای بازمتن اشاره کردیم، کاهش هزینه بدون افت کیفیت، کلید پذیرش گسترده عاملهای AI است. این رویکرد با روند کاهش هزینههای استنتاج توسط مدلهای کوچک و وزنباز همسو است که پیشتر به تأثیر ۷۰ درصدی آنها بر کاهش هزینهها پرداخته بودیم. مدل Step 5 Preview در حال حاضر از طریق API و پلتفرم StepFun در دسترس است. برای کسانی که به دنبال یکپارچگی عمیقتر هستند، StepFun مستندات اتصال به Claude Code را از طریق «برنامه استپ» (Step Plan) ارائه داده است.
در حال حاضر، در حالی که API در دسترس است، امکان میزبانی شخصی (Self-hosting) وجود ندارد. StepFun انتشار وزنهای باز (Open Weights) را برای ۱۵ اکتبر ۲۰۲۶ برنامهریزی کرده است. این بازه زمانی به سازمانها فرصت میدهد تا سختافزارهای لازم، یعنی سرورهای مجهز به چندین GPU را آماده کنند.
طبق اعلام StepFun، این مدل از معماری ترکیب خبرهها (Mixture-of-Experts یا MoE) پراکنده استفاده میکند. اگرچه مجموع پارامترها ۶۰۰ میلیارد است، اما برای هر توکن تنها ۲۷ میلیارد پارامتر فعال میشوند؛ این بدان معناست که تنها حدود ۴.۵٪ از وزنها برای پردازش هر توکن واحد به کار گرفته میشوند.
جزئیات فنی این مدل عبارتند از:
- شناسه مدل: step-5-preview
- پنجره زمینه (Context Window): ۱ میلیون توکن
- ورودیها: متن، تصویر و ویدیو
- خروجی: متن
- سطح استدلال: پایین، متوسط و بالا
- قابلیتها: استریمینگ، فراخوانی تابع (Tool Calling)، حالت JSON، طرحواره JSON (JSON Schema) و کشینگ پرامپت
- معماری: ساختار «باریک و عمیق» با ۹۲ لایه ترنسفورمر برای تسهیل استدلالهای چندمرحلهای ضمنی
- بهینهسازیها: رمزگشایی گمانهزنانه (Speculative Decoding) MTP-3، مدل MoE با دقت FP8 و تخلیه KV-cache
این ظرفیت عظیم پردازش متن، یادآور قابلیتهای مدل Kimi K3 در Amazon Bedrock است که آن هم با پنجره متنی ۱ میلیون توکنی، استانداردهای جدیدی را برای تحلیل دادههای حجیم تعریف کرد. تیم پژوهشی StepFun استدلال میکند که لایههای عمیقتر، مسیرهای طولانیتری برای استدلالهای چندمرحلهای ضمنی فراهم میکنند. آموزش مدل بر پایه یادگیری تقویتی (RL) بلندمدت و On-policy استوار است. همچنین از ترازسازی (Alignment) بیت-به-بیت در آموزش و استنتاج در مسیرهای مسیریابی MoE استفاده شده است. گزارش شده است که این تکنیکها منجر به افزایش ۳ برابری سرعت در فرآیندهای RL سرتاسری (End-to-End) شده است.
در بخش عملکرد، StepFun گزارش داده که این مدل توانسته در یک اقدام واحد از یک عامل، ۹۵۰ درخواست وب را برای کارهای پژوهشی هماهنگ کند. همچنین در یک آزمایش ۲۴ ساعته، این مدل یک کرنل H100 را به ۵۰۸ TFLOPS بهینه کرد که از رکورد ۴۹۳ TFLOPS مدل Claude Opus 5 بیشتر است. در آزمون ۲۴ ساعته دیگری، این مدل توانست دقت Qwen3-30B-A3B را در محک AIME24 از ۵۳.۳٪ به ۶۰٪ از طریق آموزش پسین (Post-training) خودکار برساند.
با این حال، در بنچمارکهای کدنویسی، رقیبان همچنان پیشرو هستند. مدل Step 5 Preview در DeepSWE v1.1 امتیاز ۶۷.۷، در StepCodeBench (بنچمارک داخلی خود شرکت) امتیاز ۴۹.۰ و در ProgramBench امتیاز ۸۰.۵ را کسب کرد. در مقابل، GPT-6 Astra و Claude Opus 5 در هر سه محک اصلی برتری خود را حفظ کردهاند. در حوزه مالی نیز این مدل در FrontierFinance امتیاز ۶۶.۴ و در DRACO امتیاز ۸۳.۳ گرفت، در حالی که Claude Opus 5 به ترتیب امتیازات ۶۹.۷ و ۸۷.۶ را به دست آورد.
به گزارش Artificial Analysis، این مدل در شاخص هوش (Intelligence Index) امتیاز ۴۴ را کسب کرده که بهطور قابلتوجهی بالاتر از میانگین مدلهای همرده قیمتی (۲۴ امتیاز) است. سرعت خروجی این مدل در API حدود ۹۹.۸ توکن در ثانیه اندازهگیری شده است.
قیمتگذاری API بهشدت تهاجمی است:
- ورودی (بدون کش/Cache Miss): ۱ دلار به ازای هر ۱ میلیون توکن
- ورودی (با کش/Cache Hit): ۰.۰۵ دلار به ازای هر ۱ میلیون توکن
- خروجی (شامل استدلال): ۲.۷ دلار به ازای هر ۱ میلیون توکن
برای مقایسه، Artificial Analysis میانگین مدلهای مشابه را ۱.۸۸ دلار برای ورودی و ۱۰ دلار برای خروجی برآورد کرده است. البته یک نکته وجود دارد: این مدل بسیار پرحرف (Verbose) است. در اجرای شاخص، این مدل ۱۶۰ میلیون توکن خروجی تولید کرد، در حالی که میانگین مدلها ۹۲ میلیون توکن بود؛ این موضوع بخشی از صرفهجویی در هزینه هر توکن را خنثی میکند.
چرخش به سمت معماریهای «باریک و عمیق» نشان میدهد که دیگر افزایش عرض شبکهها برای ارتقای هوش کافی نیست. StepFun روی این فرضیه شرط بسته است که مسیرهای داخلی طولانیتر، برای استدلالهای پیچیده و چندمرحلهای مورد نیاز عاملها مؤثرتر هستند.
میزبانی شخصی (Self-hosting) این مدل به سختافزار سنگینی نیاز دارد؛ ۶۰۰ میلیارد پارامتر در فرمت BF16 حدود ۱.۲ ترابایت VRAM میطلبد، پیش از آنکه حجم KV-cache محاسبه شود. همانطور که ذکر شد، انتشار وزنهای باز برای ۱۵ اکتبر ۲۰۲۶ برنامهریزی شده است.
باید منتظر ماند و دید جامعه توسعهدهندگان چگونه با این وزنها سازگار میشوند، زیرا ترکیب پنجره زمینه ۱ میلیون توکنی با کارایی MoE میتواند استقرار محلی عاملهای AI را بازتعریف کند.
گام بعدی شما
- اگر در حال توسعه عاملهای AI با حجم داده بالا هستید، قیمتهای تهاجمی Step 5 را برای کاهش هزینه استنتاج بررسی کنید.
- برای کسانی که به دنبال استقرار محلی هستند، از همین حالا زیرساختهای VRAM بالای ۱.۲ ترابایت را برای انتشار وزنها در اکتبر ۲۰۲۶ پیشبینی کنید.
- عملکرد مدل در بهینهسازی کرنلهای سختافزاری را به عنوان معیاری برای تواناییهای استدلالی آن در کارهای سیستمی بسنجید.
اما تأثیر این معماری عمیق بر مصرف انرژی در مقیاس مراکز داده، بحثی است که در گزارشهای بعدی به آن خواهیم پرداخت.




گفتگو