پرش به محتوای اصلی
پرش به محتوای مقاله

بنچمارک ۱۵ مدل: Step-3.5-Flash با ۸۰ توکن بر ثانیه پیشتاز سرعت شد

·۲۶ مرداد ۱۴۰۵۶ دقیقه مطالعه۱ بازدید
تست سرعت ۱۵ API هوش مصنوعی: نتایج شگفت‌انگیز
تست سرعت ۱۵ API هوش مصنوعی: نتایج شگفت‌انگیز
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ارائه یک ماتریس مقایسه‌ای دقیق میان سرعت استریمینگ، هزینه و موقعیت جغرافیایی برای ۱۵ مدل مختلف که نشان می‌دهد مدل‌های Flash اکنون در سرعت پاسخ‌دهی (TTFT) به مرزهای انسانی رسیده‌اند.

اگر برای اپلیکیشن خود به دنبال مدل‌هایی هستید که کاربر را با یک نشانگر چرخان منتظر نگذارند، اعداد جدید بازی را تغییر می‌دهند. ۸۰ توکن در ثانیه و زمان رسیدن به اولین توکن (TTFT) تنها ۱۲۰ میلی‌ثانیه؛ این‌ها دستاوردهای مدل Step-3.5-Flash در ۱۵۰ تست سرعت است که در ۲۰ مه ۲۰۲۶ انجام شد. چنین عملکردی حیاتی است، زیرا در دنیای چت‌بات‌ها، یک تأخیر دو ثانیه‌ای اغلب مرز میان تبدیل کاربر به مشتری یا خروج او از برنامه (Bounce) است.

بسیاری از محک‌های هوش مصنوعی روی کیفیت تمرکز می‌کنند، اما برای برنامه‌های عملیاتی، تأخیر ادراک‌شده توسط کاربر (User-perceived Latency) محدودکننده اصلی است. وقتی کاربر به یک نشانگر در حال چرخش خیره می‌شود، کیفیت فنی پاسخ نهایی اهمیتش را به سرعتِ شروع پاسخ می‌بازد. این تنش، مرز میان انتخاب مدل‌های کوچک و سریع در برابر مدل‌های استدلالی کند است.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی بهینه‌سازی هزینه‌های استنتاج اشاره کردیم، سرعت در لایه‌ی رابط کاربری (UI) مستقیماً با نرخ تبدیل کاربر در ارتباط است.

مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — اکنون در مدل‌های Flash به سرعت‌های خیره‌کننده‌ای رسیده است. طبق گزارش منتشر شده، برای تولید این داده‌ها از یک پرامپت استاندارد («بازگشت یا Recursion را در ۲۰۰ کلمه توضیح بده») استفاده شده تا وظایفی با حجم متوسط در محیط تولید شبیه‌سازی شود. این پرامپت خاص به این دلیل انتخاب شد که مدل را مجبور می‌کند تا ساختار، توضیح و متدولوژی آموزشی را مدیریت کند، بدون اینکه آنقدر سنگین باشد که هر الگوی زنجیره تفکر (Chain-of-Thought) را فعال کند.

جزئیات فنی این تست به شرح زیر است:

  • حجم خروجی: حدود ۱۵۰ توکن برای هر درخواست.
  • تعداد نمونه: هر تست ۱۰ بار تکرار شد تا میانگین دقیق محاسبه شود.
  • استریمینگ: تمام پاسخ‌ها به‌صورت جریانی (Streamed) دریافت شدند تا TTFT و سرعت توکن‌ها به‌طور مجزا اندازه‌گیری شوند.
  • مسیریابی: تمام درخواست‌ها از طریق نقطه اتصال یکپارچه Global API (به آدرس https://global-apis.com/v1) ارسال شدند تا مدیریت ۱۵ کلید API مختلف برای ارائه‌دهندگان متفاوت حذف شود.

رتبه‌بندی سرعت‌ها سلسله‌مراتب واضحی را نشان می‌دهد. سه مدل برتر در عملکرد استریمینگ عبارت‌اند از:

  • Step-3.5-Flash (محصول StepFun): ۸۰ توکن در ثانیه (TTFT: ۱۲۰ میلی‌ثانیه)
  • Qwen3-8B (محصول Qwen): ۷۰ توکن در ثانیه (TTFT: ۱۵۰ میلی‌ثانیه)
  • DeepSeek V4 Flash (محصول DeepSeek): ۶۰ توکن در ثانیه (TTFT: ۱۸۰ میلی‌ثانیه)

در رتبه‌های بعدی، مدل‌های Hunyuan-TurboS (۵۵ توکن در ثانیه، TTFT: ۲۰۰ میلی‌ثانیه)، Doubao-Seed-Lite (۵۰ توکن در ثانیه، TTFT: ۲۲۰ میلی‌ثانیه) و Qwen3-32B (۴۵ توکن در ثانیه، TTFT: ۲۵۰ میلی‌ثانیه) قرار دارند. مدل‌های میان‌رده‌ای مثل Hunyuan-Turbo (۴۲ توکن در ثانیه، TTFT: ۲۸۰ میلی‌ثانیه) و GLM-4-32B (۳۸ توکن در ثانیه، TTFT: ۳۰۰ میلی‌ثانیه) نیز در این فهرست هستند.

در انتهای فهرست، مدل‌های سنگین‌تر قرار دارند: Qwen3.5-27B با ۳۵ توکن در ثانیه و TTFT ۳۵۰ میلی‌ثانیه، DeepSeek V4 Pro با ۳۰ توکن در ثانیه (TTFT: ۴۰۰ میلی‌ثانیه) و MiniMax M2.5 با ۲۸ توکن در ثانیه (TTFT: ۴۵۰ میلی‌ثانیه). کندترین‌ها شامل GLM-5 (۲۵ توکن در ثانیه، TTFT: ۵۰۰ میلی‌ثانیه)، Kimi K2.5 (۲۰ توکن در ثانیه، TTFT: ۶۰۰ میلی‌ثانیه)، DeepSeek-R1 (۱۵ توکن در ثانیه، TTFT: ۸۰۰ میلی‌ثانیه) و Qwen3.5-397B (۱۰ توکن در ثانیه، TTFT: ۱۲۰۰ میلی‌ثانیه) هستند.

بر اساس مستندات این تست، مدل‌های استدلالی (Reasoning Model) — مدل‌هایی که قبل از جواب، یک قدم درنگ می‌کنند و فکر می‌کنند، شبیه شطرنج‌بازی که چند حرکت جلوتر را می‌بیند — به‌شدت عقب ماندند. این کندی به دلیل ناکارآمدی نیست، بلکه چون این مدل‌ها زمان بیشتری را صرف «تفکر» می‌کنند تا کیفیت خروجی را تضمین کنند. این یک سبک مبادله (Trade-off) بنیادی برای دستیابی به خروجی با کیفیت بالاتر است.

تحلیل داده‌ها نشان‌دهنده یک همبستگی غافلگیرکننده میان هزینه و سرعت است. مدل‌ها به چهار سطح قیمتی تقسیم شدند:

  • بسیار ارزان (زیر ۰.۱۵ دلار در هر میلیون توکن): مدل Qwen3-8B با قیمت ۰.۰۱ دلار و سرعت ۷۰ توکن، ارزشمندترین گزینه است. Step-3.5-Flash نیز با قیمت ۰.۱۵ دلار در این دسته قرار می‌گیرد. این مدل‌ها برای ترجمه‌های سریع، تغییر فرمت یا طبقه‌بندی متون ایده‌آل هستند.
  • ارزان (۰.۱۵ تا ۰.۳۰ دلار): مدل DeepSeek V4 Flash با قیمت ۰.۲۵ دلار و سرعت ۶۰ توکن، نقطه‌ی تعادل (Goldilocks) میان سرعت و کیفیتی در سطح مدل‌های کلاس GPT-4o است. گزینه‌های دیگر شامل Hunyuan-TurboS (۰.۲۸ دلار، ۵۵ توکن) و Qwen3-32B (۰.۲۸ دلار، ۴۵ توکن) هستند.
  • میان‌رده (۰.۳۰ تا ۰.۸۰ دلار): با بزرگ‌تر شدن مدل‌ها، سرعت کاهش می‌یابد. Doubao-Seed-Lite سریع‌ترین مدل این گروه (۵۰ توکن با قیمت ۰.۴۰ دلار) است، در حالی که DeepSeek V4 Pro به ۳۰ توکن (۰.۷۸ دلار) کاهش یافت. Qwen3.5-27B نیز با ۳۵ توکن و قیمت ۰.۱۹ دلار در این رده است. در این سطح، شما در واقع هزینه کیفیت را می‌پردازید و سرعت قربانی می‌شود.
  • پریمیوم (بالای ۰.۸۰ دلار): این‌ها مدل‌های «اول-صحت» هستند. مدل‌هایی مثل MiniMax M2.5 (۲۸ توکن، ۱.۱۵ دلار)، GLM-5 (۲۵ توکن، ۱.۹۲ دلار) و Kimi K2.5 (۲۰ توکن، ۳ دلار) زمانی استفاده می‌شوند که هر پاسخ اهمیت بیشتری نسبت به زمان انتظار دارد.

علاوه بر سخت‌افزار، جغرافیا نیز یک «مالیات پنهان» بر عملکرد است. تست‌ها از دو منطقه شرق آمریکا (اوهایو) و آسیا (سنگاپور) نشان داد مدل‌های آسیایی در محیط بومی خود ۱۶ تا ۲۰ درصد تأخیر کمتری دارند. برای مثال:

  • Kimi K2.5 در سنگاپور بهبود ۱۲۰ میلی‌ثانیه‌ای داشت (۴۸۰ میلی‌ثانیه در مقابل ۶۰۰ میلی‌ثانیه در آمریکا).
  • GLM-5 حدود ۸۰ میلی‌ثانیه بهبود یافت (۴۲۰ میلی‌ثانیه در آسیا در مقابل ۵۰۰ میلی‌ثانیه در آمریکا).
  • Qwen3-32B حدود ۴۰ میلی‌ثانیه بهبود یافت (۲۱۰ میلی‌ثانیه در آسیا در مقابل ۲۵۰ میلی‌ثانیه در آمریکا).

در مقابل، DeepSeek V4 Flash تنها ۳۰ میلی‌ثانیه تفاوت داشت (۱۵۰ میلی‌ثانیه در آسیا در مقابل ۱۸۰ میلی‌ثانیه در آمریکا) که نشان‌دهنده زیرساخت توزیع‌شده‌تر این مدل در سطح جهانی است. برای توسعه‌دهندگانی که بازارهای آسیایی را از مراکز داده آمریکا سرو می‌کنند، این یک اتلاف «رایگان» تا ۱۲۰ میلی‌ثانیه است. استفاده از نقطه اتصال آگاه به منطقه (Region-aware endpoint) برای جلوگیری از این جریمه حیاتی است.

برای درک بهتر، این بنچمارک TTFT را به چهار تجربه کاربری تقسیم می‌کند تا میلی‌ثانیه‌های خام را به احساس انسانی تبدیل کند:

  • زیر ۲۰۰ میلی‌ثانیه: آنی (تجربه عالی)
  • ۲۰۰ تا ۴۰۰ میلی‌ثانیه: سریع (پذیرفتنی)
  • ۴۰۰ تا ۸۰۰ میلی‌ثانیه: تأخیر محسوس (ایجاد نارضایتی در برخی کاربران)
  • بالای ۸۰۰ میلی‌ثانیه: کند (ترک اپلیکیشن توسط کاربر)

برای قابلیت‌هایی مثل تکمیل خودکار (Autocomplete)، دستیارهای صوتی یا چت‌های زنده، توصیه می‌شود فقط از مدل‌هایی با TTFT زیر ۴۰۰ میلی‌ثانیه استفاده کنید. این یعنی مدل‌هایی مثل Step-3.5-Flash (۱۲۰ میلی‌ثانیه)، Qwen3-8B (۱۵۰ میلی‌ثانیه)، DeepSeek V4 Flash (۱۸۰ میلی‌ثانیه)، Hunyuan-TurboS (۲۰۰ میلی‌ثانیه)، Doubao-Seed-Lite (۲۲۰ میلی‌ثانیه) و Qwen3-32B (۲۵۰ میلی‌ثانیه) گزینه‌های اصلی برای تجربه کاربری تعاملی هستند.

در مقابل، برای کارهای غیرهمزمان (Asynchronous) مثل پردازش دسته‌ای اسناد در شب یا جریان‌های کاری دسته‌ای، تأخیر ۱۲۰۰ میلی‌ثانیه‌ای یک مدل عظیم مثل Qwen3.5-397B هیچ اهمیتی ندارد. بنابراین، انتخاب مدل باید بر اساس الگوی تعامل محصول باشد، نه یک عدد کلی در بنچمارک.

این تغییر دیدگاه یعنی «بهترین مدل» دیگر آن مدلی نیست که بالاترین نمره MMLU را دارد، بلکه مدلی است که با بودجه تأخیر (Latency Budget) رابط کاربری شما سازگار است. توسعه‌دهندگان اکنون باید وظایف خود را بر روی یک ماتریس «سرعت-هزینه-کیفیت» نگاشت کنند، به جای اینکه صرفاً به دنبال «باهوش‌ترین» مدل باشند.

جزئیات پیاده‌سازی

برای پیاده‌سازی این بنچمارک‌ها در استک فنی خود، می‌توانید از یک اسکریپت ساده پایتون با کلاینت سازگار با OpenAI استفاده کنید. با استفاده از time.perf_counter() و httpx.stream می‌توانید دلتای دقیق بین درخواست و دریافت اولین توکن را اندازه‌گیری کنید تا TTFT واقعی در محیط تولید را بیابید.

تستر از منطق زیر استفاده کرد:

  • کلاینت: استفاده از httpx.stream برای درخواست‌های POST به نقطه اتصال /chat/completions.
  • زمان‌بندی: استفاده از time.perf_counter() برای ثبت زمان شروع و لحظه رسیدن اولین توکن.
  • میانگین‌گیری: استفاده از statistics.mean در ۱۰ اجرای مختلف برای حذف داده‌های پرت (Outliers).

این رویکرد تضمین می‌کند که TTFT اندازه‌گیری شده، دقیقاً همان زمان انتظاری است که کاربر قبل از ظاهر شدن اولین کاراکتر روی صفحه تجربه می‌کند.

گام بعدی شما

  • اگر از مدل‌های سنگین برای چت‌های زنده استفاده می‌کنید، مدل‌های Flash را برای لایه‌ی اول پاسخ‌دهی تست کنید.
  • برای کاهش تأخیر در بازارهای هدف، نقطه اتصال (Endpoint) خود را به نزدیک‌ترین مرکز داده مدل منتقل کنید.
  • با استفاده از کتابخانه httpx.stream در پایتون، TTFT واقعی مدل خود را در محیط تولید اندازه‌گیری کنید.

اما تأثیر این سرعت‌ها بر مدل‌های صوتی و تعاملات بلادرنگ حتی پیچیده‌تر است — به تحلیل ما درباره‌ی مدل‌های چندوجهی مراجعه کنید.

چرا این موضوع مهم است؟

این بنچمارک با تکیه بر داده‌های تجربی، معیار انتخاب مدل را از نمرات آکادمیک به بودجه تأخیر کاربر تغییر می‌دهد. توسعه‌دهندگان اکنون می‌توانند با دقت ریاضی، مدل را بر اساس هزینه و سرعت برای هر بخش از محصول خود بهینه کنند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم به مدل‌های StepFun و Qwen برای توسعه‌دهندگان ایرانی دشوار است و استفاده از واسطه‌های API (Aggregators) تنها راه تست این سرعت‌هاست.

·نگاه ما
تحریریه دات‌هوش

این داده‌ها نشان می‌دهند که رقابت در بازار مدل‌های زبانی از «جنگ هوشمندی» به «جنگ تجربه کاربری» تغییر مسیر داده است. وقتی مدل‌های مختلف به سقف مشابهی از کیفیت می‌رسند، برنده کسی است که بتواند پاسخ را سریع‌تر به دست کاربر برساند. در واقع، سرعت استنتاج اکنون به یک ویژگی رقابتی (Competitive Feature) تبدیل شده است، نه فقط یک جزئیات فنی.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.