پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Step 3.7 Flash عملکرد نسخه‌های Pro را با یک‌نهم هزینه بازتولید کرد

·۱۲ مهر ۱۴۰۵۶ دقیقه مطالعه
مرحله ۳.۷ فلش: مدل ۱۹۸B MoE که همه واقعاً در حال اجرای آن هستند
مرحله ۳.۷ فلش: مدل ۱۹۸B MoE که همه واقعاً در حال اجرای آن هستند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

دستیابی به ۹۷٪ عملکرد مدل‌های Pro با کاهش ۸۹ درصدی هزینه استنتاج از طریق ترکیب معماری MoE و استراتژی Executor-Advisor.

اگر امروز برای اجرای مدل‌های بینایی پیشرفته بودجه‌ای کلان اختصاص می‌دهید، احتمالاً از این به بعد با یک‌نهم آن هزینه به همان نتیجه می‌رسید. مدل جدید Step 3.7 Flash ثابت کرد که برای رسیدن به عملکرد سطح Pro، لزوماً نیازی به زیرساخت‌های غول‌آسا نیست. در حالی که اکثر مدل‌های بینایی با ۱۹۸ میلیارد پارامتر به زیرساخت‌های عظیم نیاز دارند، Step 3.7 Flash اکنون روی یک باکس DGX Spark در اندازه دسکتاپ، بدون هیچ فشاری اجرا می‌شود.

به نقل از گزارش‌های منتشر شده در شبکه X، این مدل روی یک دستگاه که دقیقاً کنار مانیتور جای می‌گیرد، بدون هیچ مشکلی اجرا می‌شود. این پست صرفاً یک نمایش قدرت یا «فلکس» نبود، بلکه راهنمایی برای یک پیکربندی (Config) بود که سه ساعت از زمان کاربر را در عیب‌یابی (Debugging) ذخیره کرد. Stepfun در ۲۹ مه ۲۰۲۶ با عرضه این مدل، بحث را از «اندازه خام مدل» به «قابلیت استقرار واقعی» تغییر داده است. ما با تغییری در ریاضیات تولید هوش مصنوعی در مقیاس صنعتی روبه‌رو هستیم.

بسیاری از توسعه‌دهندگان با یک دوگانگی سخت مواجه‌اند: یا از مدل‌های کوچک و ارزان استفاده کنند که در کارهای پیچیده شکست می‌خورند، یا به سراغ مدل‌های پیشرو (Frontier) بروند که بودجه را می‌بلعند. Step 3.7 Flash تلاش می‌کند این دوقطبی را بشکند. این مدل دقیقاً نقطه میانی و «عامل‌محور» (Agentic) را هدف قرار داده است؛ جایی که قابلیت اطمینان و هزینه به ازای هر تسک تنها معیارهای مهم هستند. این رویکرد یادآور استراتژی‌های مشابه در مدل‌های دیگر است، همان‌طور که مدل V4.1-Flash دیپ‌سیک نیز توانست با بهینگی بیشتر جایگزین نسخه پرچمدار خود شود.

معماری بهره‌وری

همان‌طور که در تحلیل‌های قبلی ما درباره بهینه‌سازی استنتاج در مدل‌های بازمتن اشاره کردیم، کاهش هزینه بدون افت کیفیت، مقدس‌ترین هدف فعلی صنعت است. این مدل برای رسیدن به این هدف از معماری ترکیب خبره‌ها (Sparse Mixture of Experts یا MoE) استفاده می‌کند؛ شبیه به تیمی از متخصصان که هر کس در یک زمینه مهارت دارد و فقط وقتی لازم است فراخوانده می‌شود. اگرچه مدل در مجموع ۱۹۸ میلیارد پارامتر (Parameters) دارد، اما برای هر توکن (Token) — تکه‌های کوچکی از متن که مدل می‌خورد — تنها حدود ۱۱ میلیارد پارامتر فعال می‌شوند و ۱۸۷ میلیارد پارامتر دیگر در حالت استراحت می‌مانند و منتظر ورودی خاصی هستند که به تخصص آن‌ها نیاز باشد. این تلاش برای بهینه‌سازی منابع، در راستای تحولات جدیدی است که دست‌ورده‌های پیش‌آموزش جدید مانند Magic، هزینه محاسباتی مدل‌های باز را تا ۱۰ برابر کاهش داده‌اند.

سیستم بر اساس نیازهای خاص هر پرامپت، ورودی‌ها را به ۸ خبره از میان ۲۸۸ خبره موجود هدایت می‌کند. این سازوکار مسیریابی (Routing) تضمین می‌کند که هزینه محاسباتی هر توکن، شبیه به یک مدل متراکم ۱۱ میلیارد پارامتری باشد، نه یک غول ۱۹۸ میلیارد تایی. نتیجه این طراحی، رسیدن به توان عملیاتی (Throughput) ۴۰۰ توکن در ثانیه است که برای تعاملات بلادرنگ عامل‌های هوش مصنوعی، سرعتی خیره‌کننده و واقعاً کاربردی محسوب می‌شود.

مرحله ۳.۷ فلش: مدل ۱۹۸B میکس‌آف‌اکسپرتس که همه واقعاً در حال اجرای آن هستند

قدرت بینایی و کدنویسی

در بخش بینایی، Stepfun یک رمزگذار ViT ۱.۸ میلیارد پارامتری را در بدنه زبانی مدل ادغام کرده تا درک بومی تصاویر را فراهم کند. این یعنی مدل می‌تواند طرح‌های رابط کاربری (UI Wireframes)، اسناد متراکم، صحنه‌های طبیعی و نمودارها را بدون پرداخت «مالیات چندوجهی» (هزینه پردازشی سنگین مدل‌های بزرگتر) تحلیل کند. مدل پس از پردازش ورودی بصری، می‌تواند بر اساس آنچه می‌بیند، کدنویسی کند یا ابزارها را فراخوانی نماید.

بر اساس ارزیابی‌های Stepfun، نتایج این مدل با برترین‌های جهان رقابت می‌کند:

  • در آزمون SimpleVQA با جست‌وجو، امتیاز ۷۹.۲ را کسب کرد و با رتبه اول در دسته خود، با اختلافی بسیار اندک از GPT 5.5 (۷۹.۱) پیشی گرفت.
  • در آزمون V* با ابزارهای پایتون به امتیاز ۹۵.۳ رسید که تنها کمی پایین‌تر از Kimi K2.6 (۹۶.۹) و Gemini 3 Flash (۹۶.۳) است.
  • در محک ClawEval-1.1 با امتیاز ۶۷.۱، پیشتازی کرد و فاصله زیادی با رقیب بعدی که امتیاز ۵۹.۸ داشت، ایجاد کرد.
  • در BrowseComp به ۷۵.۸۲٪ رسید که آن را به Claude Opus 4.7 با امتیاز ۷۹.۳٪ نزدیک می‌کند.

ترفند «حالت مشاور» (Advisor Mode)

مهم‌ترین ویژگی برای محیط‌های تولیدی، «حالت مشاور» است. اکثر گردش‌کارهای عامل‌محور روتین هستند — مانند فراخوانی ابزارها، خواندن نتایج و تکرار گام‌های ساده — که نیازی به مدل‌های پیشرو و گران‌قیمت ندارند.

Step 3.7 Flash کل مسیر را به‌صورت سرتاسری (End-to-End) مدیریت می‌کند. اما وقتی به یک نقطه تصمیم‌گیری بحرانی می‌رسد — مثلاً در یک گام برنامه‌ریزی که می‌تواند کل مسیر را منحرف کند یا هنگام بازیابی از شکست‌های مکرر — برای دریافت راهنمایی به یک مدل «مشاور» بزرگ‌تر مراجعه می‌کند. سپس بر اساس آن راهنمایی سطح بالا، به اجرای عملیات ادامه می‌دهد.

این پیاده‌سازی استراتژی «مجری-مشاور» (که ابتدا توسط Anthropic توصیف شد)، هزینه مدل گران‌قیمت را در میان تعداد زیادی گام ارزان توزیع (Amortize) می‌کند. مدل گران‌قیمت فقط در جایی استفاده می‌شود که واقعاً اهمیت دارد.

در محک SWE-Bench Verified، این استراتژی اجازه داد Step 3.7 Flash به نرخ موفقیت ۷۶.۳٪ با هزینه تنها ۰.۱۹ دلار به ازای هر تسک برسد. برای مقایسه، Claude Opus 4.6 به موفقیت ۷۸.۷٪ می‌رسد اما هزینه آن ۱.۷۶ دلار به ازای هر تسک است. در واقع شما ۹۷٪ عملکرد را با یک‌نهم هزینه به دست می‌آورید.

نقاط ضعف و چالش‌ها

البته این مدل جایگزین همه‌جانبه برای سیستم‌های پیشرو نیست. یک شکاف واضح در تعاملات ترمینال و اجرای دستورات پیچیده وجود دارد. در Terminal-Bench 2.1، امتیاز ۵۹.۵ این مدل در برابر ۸۲.۷ امتیاز GPT 5.5 و ۷۶.۲ امتیاز Gemini 3.5 Flash، نشان می‌دهد که این رقابت هنوز یک رقابت نزدیک نیست.

همچنین پوشش وظایف حرفه‌ای عمومی نیز کمتر است. در آزمون GDPval در ۴۴ شغل مختلف، این مدل امتیاز ۴۵.۸٪ را کسب کرد در حالی که Claude Opus 4.7 به ۶۳٪ رسید. برای سخت‌ترین تسک‌های استدلالی شامل ابزارها (HLE)، این مدل با ۴۷.۲٪ پشت سر Claude Opus 4.7 (۵۴.۷٪) و GPT 5.5 (۵۲.۲٪) قرار دارد.

باید به خاطر داشت که این اعداد از ارزیابی‌های داخلی Stepfun است و نتایج خوداظهاری همیشه باید با این هشدار خوانده شوند.

استراتژی اولویت‌دهی به استقرار

من یک بار دو ساعت وقتم را صرف خواندن نسخه اشتباه یک مستند API کردم چون URL می‌گفت «v2» اما صفحه می‌گفت «v3». مستندات به‌طور تصادفی زود منتشر شده بودند و من گیج شده بودم که چرا نقاط انتهایی (Endpoints) مطابقت ندارند. به همین دلیل است که من برای دستورالعمل‌های استقرار شفاف ارزش قائلم.

Stepfun برخلاف بسیاری از آزمایشگاه‌ها که فقط یک پست وبلاگی و یک API بسته ارائه می‌دهند، وزن‌های مدل را در فرمت‌های BF16، FP8، NVFP4 و GGUF به‌صورت هم‌زمان در Hugging Face منتشر کرد. این یعنی مدل روی هر چیزی، از Mac Studio با ۱۲۸ گیگابایت حافظه یکپارچه تا نمونه‌های ابری از طریق NIM و OpenRouter، قابل اجراست.

این پشتیبانی اکوسیستمی، فاصله بین «در دسترس بودن فنی» و «قابلیت استفاده واقعی» را کاهش می‌دهد. مدل همچنین ثبات بهتری نشان می‌دهد و واریانس عملکرد در هر اجرا را از بازه ۴۳-۷۳٪ در نسخه ۳.۵ به ۶۴.۵-۷۱.۵٪ کاهش داده است.

برای توسعه‌دهندگانی که عامل‌های تولیدی می‌سازند، این پیش‌بینی‌پذیری اغلب ارزشمندتر از یک افزایش جزئی در نمرات بنچمارک است. این یعنی عامل هوشمند فارغ از داربست (Scaffold) مورد استفاده، یکسان رفتار می‌کند.

تحلیل نهایی و صادقانه

اگر در حال ساخت یک چت‌بات ساده هستید که به سوالات از یک پایگاه دانش پاسخ می‌دهد، یک مدل متراکم کوچک‌تر برای شما بهتر عمل می‌کند. اگر کمتر از ۱۰ هزار درخواست در روز دارید، تفاوت قیمت، پیچیدگی زیرساختی را توجیه نمی‌کند. و اگر به بالاترین عملکرد مطلق در ترمینال نیاز دارید، مدل‌های پیشرو همچنان جلوتر هستند.

اما برای ارکستراسیون ابزارها در حجم بالا، جایی که قابلیت اطمینان و هزینه به ازای هر تسک مهم‌تر از سقف نمرات بنچمارک است، این مدل ارزش بررسی جدی دارد. پیشتازی در ClawEval و پروفایل هزینه در حالت مشاور، تمایزهای واقعی این مدل هستند.

من مدام به آن پست X برمی‌گردم که یک مدل بینایی ۱۹۸ میلیارد پارامتری روی یک دسکتاپ اجرا می‌شد. داستان واقعی اینجا قیمت یا نمرات نیست؛ داستان این است که این سطح از توانایی اکنون به چیزی تبدیل شده که می‌توانید به‌سادگی اجرا کنید. شکاف بین مدل‌های پیشرو و باز در حال کوچک شدن است، اما شکاف بین «در دسترس» و «کاربردی» حتی سریع‌تر در حال بسته شدن است. اگر Stepfun در نسخه ۳.۹ Flash شکاف Terminal-Bench را پر کند، بحث بسیار جالب‌تر خواهد شد.

گام بعدی شما

  • اگر از مدل‌های گران‌قیمت برای تسک‌های تکراری استفاده می‌کنید، معماری «مجری-مشاور» را با Step 3.7 Flash تست کنید تا هزینه‌هایتان را کاهش دهید.
  • فرمت‌های GGUF مدل را برای استقرار روی سخت‌افزارهای محلی (Local) بررسی کنید تا وابستگی به APIهای ابری را کم کنید.
  • در صورت نیاز به دقت بالا در ترمینال، همچنان از مدل‌های Frontier استفاده کنید اما برای تحلیل‌های بینایی-زبانی، این مدل را جایگزین کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با اثبات امکان اجرای مدل‌های ۱۹۸ میلیارد پارامتری روی سخت‌افزارهای کوچک، سد ورود به تولید عامل‌های هوش مصنوعی مقیاس‌پذیر را می‌شکند. اعتبار این ادعا از طریق انتشار وزن‌های باز در فرمت‌های متنوع تأیید شده است.

تأثیر برای ایران

به دلیل انتشار وزن‌های باز در Hugging Face، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به APIهای تحریمی، این مدل را روی سخت‌افزارهای محلی یا سرورهای داخلی استقرار دهند.

·نگاه ما
تحریریه دات‌هوش

تمرکز Stepfun بر کاهش فاصله بین «در دسترس بودن» و «قابلیت استفاده» نشان می‌دهد که رقابت مدل‌های زبانی از مرحله کورکورانه افزایش پارامترها به مرحله بهینه‌سازی استقرار رسیده است. استراتژی Advisor Mode در واقع پذیرشی از این واقعیت است که هوش مصنوعی نباید در هر لحظه در بالاترین سطح پردازشی باشد، بلکه باید مانند یک سازمان، بین لایه‌های اجرایی ارزان و لایه‌های مدیریتی گران تفکیک شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.