پرش به محتوای اصلی
پرش به محتوای مقاله

StepFun: کاهش هزینه‌های عملیاتی در مهندسی با مدل ۶۰۰ میلیارد پارامتری

·۳۰ شهریور ۱۴۰۵۴ دقیقه مطالعه
استپ‌فان مدل Step 5 Preview را معرفی کرد: MoE با ۶۰۰ میلیارد پارامتر و پنجره زمانی یک میلیون توکن برای وظایف عاملی پیچیده
استپ‌فان مدل Step 5 Preview را معرفی کرد: MoE با ۶۰۰ میلیارد پارامتر و پنجره زمانی یک میلیون توکن برای وظایف عاملی پیچیده
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی معماری «باریک و عمیق» با ۹۲ لایه برای استدلال چندمرحله‌ای و ارائه یکی از ارزان‌ترین نرخ‌های استنتاج برای مدل‌های سطح بالا در بازار.

۶۰۰ میلیارد پارامتر؛ این مقیاس خیرکننده، قلب تپنده مدل جدید Step 5 Preview است که برای جابه‌جایی مرزهای هزینه در استقرار عامل‌های خودمختار طراحی شده است. هدف این مدل ساده است: ارائه هوش سطح بالا با هزینه‌ای به‌مراتب کمتر از رقبای فعلی برای متخصصان حوزه‌های مالی، مهندسی نرم‌افزار و کارهای دانشی حرفه‌ای.

در حالی که صنعت از چت‌بات‌های ساده به سمت عامل‌های بلندمدت (Long-horizon Agents) حرکت می‌کند، گلوگاه اصلی، هزینه استنتاج (Inference) برای استدلال‌های طولانی و پنجره‌های متنی عظیم شده است. StepFun با بهینه‌سازی «حلقه عامل‌محور» (Agentic Loop) وارد میدان شده است؛ جایی که مدل باید برای مدت‌های طولانی جست‌وجو کند، کد اجرا نماید و نتایج ابزارها را پردازش کند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی هزینه‌های استنتاج در مدل‌های بازمتن اشاره کردیم، کاهش هزینه بدون افت کیفیت، کلید پذیرش گسترده عامل‌های AI است. این رویکرد با روند کاهش هزینه‌های استنتاج توسط مدل‌های کوچک و وزن‌باز هم‌سو است که پیش‌تر به تأثیر ۷۰ درصدی آن‌ها بر کاهش هزینه‌ها پرداخته بودیم. مدل Step 5 Preview در حال حاضر از طریق API و پلتفرم StepFun در دسترس است. برای کسانی که به دنبال یکپارچگی عمیق‌تر هستند، StepFun مستندات اتصال به Claude Code را از طریق «برنامه استپ» (Step Plan) ارائه داده است.

در حال حاضر، در حالی که API در دسترس است، امکان میزبانی شخصی (Self-hosting) وجود ندارد. StepFun انتشار وزن‌های باز (Open Weights) را برای ۱۵ اکتبر ۲۰۲۶ برنامه‌ریزی کرده است. این بازه زمانی به سازمان‌ها فرصت می‌دهد تا سخت‌افزارهای لازم، یعنی سرورهای مجهز به چندین GPU را آماده کنند.

طبق اعلام StepFun، این مدل از معماری ترکیب خبره‌ها (Mixture-of-Experts یا MoE) پراکنده استفاده می‌کند. اگرچه مجموع پارامترها ۶۰۰ میلیارد است، اما برای هر توکن تنها ۲۷ میلیارد پارامتر فعال می‌شوند؛ این بدان معناست که تنها حدود ۴.۵٪ از وزن‌ها برای پردازش هر توکن واحد به کار گرفته می‌شوند.

جزئیات فنی این مدل عبارتند از:

  • شناسه مدل: step-5-preview
  • پنجره زمینه (Context Window): ۱ میلیون توکن
  • ورودی‌ها: متن، تصویر و ویدیو
  • خروجی: متن
  • سطح استدلال: پایین، متوسط و بالا
  • قابلیت‌ها: استریمینگ، فراخوانی تابع (Tool Calling)، حالت JSON، طرحواره JSON (JSON Schema) و کشینگ پرامپت
  • معماری: ساختار «باریک و عمیق» با ۹۲ لایه ترنسفورمر برای تسهیل استدلال‌های چندمرحله‌ای ضمنی
  • بهینه‌سازی‌ها: رمزگشایی گمانه‌زنانه (Speculative Decoding) MTP-3، مدل MoE با دقت FP8 و تخلیه KV-cache

این ظرفیت عظیم پردازش متن، یادآور قابلیت‌های مدل Kimi K3 در Amazon Bedrock است که آن هم با پنجره متنی ۱ میلیون توکنی، استانداردهای جدیدی را برای تحلیل داده‌های حجیم تعریف کرد. تیم پژوهشی StepFun استدلال می‌کند که لایه‌های عمیق‌تر، مسیرهای طولانی‌تری برای استدلال‌های چندمرحله‌ای ضمنی فراهم می‌کنند. آموزش مدل بر پایه یادگیری تقویتی (RL) بلندمدت و On-policy استوار است. همچنین از ترازسازی (Alignment) بیت-به-بیت در آموزش و استنتاج در مسیرهای مسیریابی MoE استفاده شده است. گزارش شده است که این تکنیک‌ها منجر به افزایش ۳ برابری سرعت در فرآیندهای RL سرتاسری (End-to-End) شده است.

در بخش عملکرد، StepFun گزارش داده که این مدل توانسته در یک اقدام واحد از یک عامل، ۹۵۰ درخواست وب را برای کارهای پژوهشی هماهنگ کند. همچنین در یک آزمایش ۲۴ ساعته، این مدل یک کرنل H100 را به ۵۰۸ TFLOPS بهینه کرد که از رکورد ۴۹۳ TFLOPS مدل Claude Opus 5 بیشتر است. در آزمون ۲۴ ساعته دیگری، این مدل توانست دقت Qwen3-30B-A3B را در محک AIME24 از ۵۳.۳٪ به ۶۰٪ از طریق آموزش پسین (Post-training) خودکار برساند.

با این حال، در بنچمارک‌های کدنویسی، رقیبان همچنان پیشرو هستند. مدل Step 5 Preview در DeepSWE v1.1 امتیاز ۶۷.۷، در StepCodeBench (بنچمارک داخلی خود شرکت) امتیاز ۴۹.۰ و در ProgramBench امتیاز ۸۰.۵ را کسب کرد. در مقابل، GPT-6 Astra و Claude Opus 5 در هر سه محک اصلی برتری خود را حفظ کرده‌اند. در حوزه مالی نیز این مدل در FrontierFinance امتیاز ۶۶.۴ و در DRACO امتیاز ۸۳.۳ گرفت، در حالی که Claude Opus 5 به ترتیب امتیازات ۶۹.۷ و ۸۷.۶ را به دست آورد.

به گزارش Artificial Analysis، این مدل در شاخص هوش (Intelligence Index) امتیاز ۴۴ را کسب کرده که به‌طور قابل‌توجهی بالاتر از میانگین مدل‌های هم‌رده قیمتی (۲۴ امتیاز) است. سرعت خروجی این مدل در API حدود ۹۹.۸ توکن در ثانیه اندازه‌گیری شده است.

قیمت‌گذاری API به‌شدت تهاجمی است:

  • ورودی (بدون کش/Cache Miss): ۱ دلار به ازای هر ۱ میلیون توکن
  • ورودی (با کش/Cache Hit): ۰.۰۵ دلار به ازای هر ۱ میلیون توکن
  • خروجی (شامل استدلال): ۲.۷ دلار به ازای هر ۱ میلیون توکن

برای مقایسه، Artificial Analysis میانگین مدل‌های مشابه را ۱.۸۸ دلار برای ورودی و ۱۰ دلار برای خروجی برآورد کرده است. البته یک نکته وجود دارد: این مدل بسیار پرحرف (Verbose) است. در اجرای شاخص، این مدل ۱۶۰ میلیون توکن خروجی تولید کرد، در حالی که میانگین مدل‌ها ۹۲ میلیون توکن بود؛ این موضوع بخشی از صرفه‌جویی در هزینه هر توکن را خنثی می‌کند.

چرخش به سمت معماری‌های «باریک و عمیق» نشان می‌دهد که دیگر افزایش عرض شبکه‌ها برای ارتقای هوش کافی نیست. StepFun روی این فرضیه شرط بسته است که مسیرهای داخلی طولانی‌تر، برای استدلال‌های پیچیده و چندمرحله‌ای مورد نیاز عامل‌ها مؤثرتر هستند.

میزبانی شخصی (Self-hosting) این مدل به سخت‌افزار سنگینی نیاز دارد؛ ۶۰۰ میلیارد پارامتر در فرمت BF16 حدود ۱.۲ ترابایت VRAM می‌طلبد، پیش از آنکه حجم KV-cache محاسبه شود. همان‌طور که ذکر شد، انتشار وزن‌های باز برای ۱۵ اکتبر ۲۰۲۶ برنامه‌ریزی شده است.

باید منتظر ماند و دید جامعه توسعه‌دهندگان چگونه با این وزن‌ها سازگار می‌شوند، زیرا ترکیب پنجره زمینه ۱ میلیون توکنی با کارایی MoE می‌تواند استقرار محلی عامل‌های AI را بازتعریف کند.

گام بعدی شما

  • اگر در حال توسعه عامل‌های AI با حجم داده بالا هستید، قیمت‌های تهاجمی Step 5 را برای کاهش هزینه استنتاج بررسی کنید.
  • برای کسانی که به دنبال استقرار محلی هستند، از همین حالا زیرساخت‌های VRAM بالای ۱.۲ ترابایت را برای انتشار وزن‌ها در اکتبر ۲۰۲۶ پیش‌بینی کنید.
  • عملکرد مدل در بهینه‌سازی کرنل‌های سخت‌افزاری را به عنوان معیاری برای توانایی‌های استدلالی آن در کارهای سیستمی بسنجید.

اما تأثیر این معماری عمیق بر مصرف انرژی در مقیاس مراکز داده، بحثی است که در گزارش‌های بعدی به آن خواهیم پرداخت.

چرا این موضوع مهم است؟

این مدل با کاهش شدید هزینه خروجی، استقرار عامل‌های خودمختار را از یک تجربه گران‌قیمت به یک ابزار اقتصادی تبدیل می‌کند. اعتبار داده‌های Artificial Analysis تأیید می‌کند که StepFun توانسته توازنی میان قیمت و هوش ایجاد کند که رقبای تراز اول را به چالش می‌کشد.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی توسعه‌دهندگان ایرانی به این مدل دشوار است؛ اما انتشار وزن‌های باز در اکتبر ۲۰۲۶ فرصتی برای پژوهشگران داخلی در زمینه مدل‌های MoE فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

تمرکز StepFun بر معماری «باریک و عمیق» به‌جای گسترش عرض شبکه، نشان‌دهنده یک تغییر پارادایم در طراحی مدل‌های استدلالی است. این رویکرد ثابت می‌کند که برای رسیدن به توانایی‌های عامل‌محور، عمق پردازش و مسیرهای طولانی‌تر استدلال، اهمیت بیشتری نسبت به حجم خام پارامترهای فعال دارند. در واقع، این مدل تلاش می‌کند «بهره‌وری استدلال» را جایگزین «مقیاس‌بندی کورکورانه» کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.