اگر برای اپلیکیشن خود به دنبال مدلهایی هستید که کاربر را با یک نشانگر چرخان منتظر نگذارند، اعداد جدید بازی را تغییر میدهند. ۸۰ توکن در ثانیه و زمان رسیدن به اولین توکن (TTFT) تنها ۱۲۰ میلیثانیه؛ اینها دستاوردهای مدل Step-3.5-Flash در ۱۵۰ تست سرعت است که در ۲۰ مه ۲۰۲۶ انجام شد. چنین عملکردی حیاتی است، زیرا در دنیای چتباتها، یک تأخیر دو ثانیهای اغلب مرز میان تبدیل کاربر به مشتری یا خروج او از برنامه (Bounce) است.
بسیاری از محکهای هوش مصنوعی روی کیفیت تمرکز میکنند، اما برای برنامههای عملیاتی، تأخیر ادراکشده توسط کاربر (User-perceived Latency) محدودکننده اصلی است. وقتی کاربر به یک نشانگر در حال چرخش خیره میشود، کیفیت فنی پاسخ نهایی اهمیتش را به سرعتِ شروع پاسخ میبازد. این تنش، مرز میان انتخاب مدلهای کوچک و سریع در برابر مدلهای استدلالی کند است.
همانطور که در تحلیلهای قبلی ما دربارهی بهینهسازی هزینههای استنتاج اشاره کردیم، سرعت در لایهی رابط کاربری (UI) مستقیماً با نرخ تبدیل کاربر در ارتباط است.
مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن کتابها جواب میدهد — اکنون در مدلهای Flash به سرعتهای خیرهکنندهای رسیده است. طبق گزارش منتشر شده، برای تولید این دادهها از یک پرامپت استاندارد («بازگشت یا Recursion را در ۲۰۰ کلمه توضیح بده») استفاده شده تا وظایفی با حجم متوسط در محیط تولید شبیهسازی شود. این پرامپت خاص به این دلیل انتخاب شد که مدل را مجبور میکند تا ساختار، توضیح و متدولوژی آموزشی را مدیریت کند، بدون اینکه آنقدر سنگین باشد که هر الگوی زنجیره تفکر (Chain-of-Thought) را فعال کند.
جزئیات فنی این تست به شرح زیر است:
- حجم خروجی: حدود ۱۵۰ توکن برای هر درخواست.
- تعداد نمونه: هر تست ۱۰ بار تکرار شد تا میانگین دقیق محاسبه شود.
- استریمینگ: تمام پاسخها بهصورت جریانی (Streamed) دریافت شدند تا TTFT و سرعت توکنها بهطور مجزا اندازهگیری شوند.
- مسیریابی: تمام درخواستها از طریق نقطه اتصال یکپارچه Global API (به آدرس https://global-apis.com/v1) ارسال شدند تا مدیریت ۱۵ کلید API مختلف برای ارائهدهندگان متفاوت حذف شود.
رتبهبندی سرعتها سلسلهمراتب واضحی را نشان میدهد. سه مدل برتر در عملکرد استریمینگ عبارتاند از:
- Step-3.5-Flash (محصول StepFun): ۸۰ توکن در ثانیه (TTFT: ۱۲۰ میلیثانیه)
- Qwen3-8B (محصول Qwen): ۷۰ توکن در ثانیه (TTFT: ۱۵۰ میلیثانیه)
- DeepSeek V4 Flash (محصول DeepSeek): ۶۰ توکن در ثانیه (TTFT: ۱۸۰ میلیثانیه)
در رتبههای بعدی، مدلهای Hunyuan-TurboS (۵۵ توکن در ثانیه، TTFT: ۲۰۰ میلیثانیه)، Doubao-Seed-Lite (۵۰ توکن در ثانیه، TTFT: ۲۲۰ میلیثانیه) و Qwen3-32B (۴۵ توکن در ثانیه، TTFT: ۲۵۰ میلیثانیه) قرار دارند. مدلهای میانردهای مثل Hunyuan-Turbo (۴۲ توکن در ثانیه، TTFT: ۲۸۰ میلیثانیه) و GLM-4-32B (۳۸ توکن در ثانیه، TTFT: ۳۰۰ میلیثانیه) نیز در این فهرست هستند.
در انتهای فهرست، مدلهای سنگینتر قرار دارند: Qwen3.5-27B با ۳۵ توکن در ثانیه و TTFT ۳۵۰ میلیثانیه، DeepSeek V4 Pro با ۳۰ توکن در ثانیه (TTFT: ۴۰۰ میلیثانیه) و MiniMax M2.5 با ۲۸ توکن در ثانیه (TTFT: ۴۵۰ میلیثانیه). کندترینها شامل GLM-5 (۲۵ توکن در ثانیه، TTFT: ۵۰۰ میلیثانیه)، Kimi K2.5 (۲۰ توکن در ثانیه، TTFT: ۶۰۰ میلیثانیه)، DeepSeek-R1 (۱۵ توکن در ثانیه، TTFT: ۸۰۰ میلیثانیه) و Qwen3.5-397B (۱۰ توکن در ثانیه، TTFT: ۱۲۰۰ میلیثانیه) هستند.
بر اساس مستندات این تست، مدلهای استدلالی (Reasoning Model) — مدلهایی که قبل از جواب، یک قدم درنگ میکنند و فکر میکنند، شبیه شطرنجبازی که چند حرکت جلوتر را میبیند — بهشدت عقب ماندند. این کندی به دلیل ناکارآمدی نیست، بلکه چون این مدلها زمان بیشتری را صرف «تفکر» میکنند تا کیفیت خروجی را تضمین کنند. این یک سبک مبادله (Trade-off) بنیادی برای دستیابی به خروجی با کیفیت بالاتر است.
تحلیل دادهها نشاندهنده یک همبستگی غافلگیرکننده میان هزینه و سرعت است. مدلها به چهار سطح قیمتی تقسیم شدند:
- بسیار ارزان (زیر ۰.۱۵ دلار در هر میلیون توکن): مدل Qwen3-8B با قیمت ۰.۰۱ دلار و سرعت ۷۰ توکن، ارزشمندترین گزینه است. Step-3.5-Flash نیز با قیمت ۰.۱۵ دلار در این دسته قرار میگیرد. این مدلها برای ترجمههای سریع، تغییر فرمت یا طبقهبندی متون ایدهآل هستند.
- ارزان (۰.۱۵ تا ۰.۳۰ دلار): مدل DeepSeek V4 Flash با قیمت ۰.۲۵ دلار و سرعت ۶۰ توکن، نقطهی تعادل (Goldilocks) میان سرعت و کیفیتی در سطح مدلهای کلاس GPT-4o است. گزینههای دیگر شامل Hunyuan-TurboS (۰.۲۸ دلار، ۵۵ توکن) و Qwen3-32B (۰.۲۸ دلار، ۴۵ توکن) هستند.
- میانرده (۰.۳۰ تا ۰.۸۰ دلار): با بزرگتر شدن مدلها، سرعت کاهش مییابد. Doubao-Seed-Lite سریعترین مدل این گروه (۵۰ توکن با قیمت ۰.۴۰ دلار) است، در حالی که DeepSeek V4 Pro به ۳۰ توکن (۰.۷۸ دلار) کاهش یافت. Qwen3.5-27B نیز با ۳۵ توکن و قیمت ۰.۱۹ دلار در این رده است. در این سطح، شما در واقع هزینه کیفیت را میپردازید و سرعت قربانی میشود.
- پریمیوم (بالای ۰.۸۰ دلار): اینها مدلهای «اول-صحت» هستند. مدلهایی مثل MiniMax M2.5 (۲۸ توکن، ۱.۱۵ دلار)، GLM-5 (۲۵ توکن، ۱.۹۲ دلار) و Kimi K2.5 (۲۰ توکن، ۳ دلار) زمانی استفاده میشوند که هر پاسخ اهمیت بیشتری نسبت به زمان انتظار دارد.
علاوه بر سختافزار، جغرافیا نیز یک «مالیات پنهان» بر عملکرد است. تستها از دو منطقه شرق آمریکا (اوهایو) و آسیا (سنگاپور) نشان داد مدلهای آسیایی در محیط بومی خود ۱۶ تا ۲۰ درصد تأخیر کمتری دارند. برای مثال:
- Kimi K2.5 در سنگاپور بهبود ۱۲۰ میلیثانیهای داشت (۴۸۰ میلیثانیه در مقابل ۶۰۰ میلیثانیه در آمریکا).
- GLM-5 حدود ۸۰ میلیثانیه بهبود یافت (۴۲۰ میلیثانیه در آسیا در مقابل ۵۰۰ میلیثانیه در آمریکا).
- Qwen3-32B حدود ۴۰ میلیثانیه بهبود یافت (۲۱۰ میلیثانیه در آسیا در مقابل ۲۵۰ میلیثانیه در آمریکا).
در مقابل، DeepSeek V4 Flash تنها ۳۰ میلیثانیه تفاوت داشت (۱۵۰ میلیثانیه در آسیا در مقابل ۱۸۰ میلیثانیه در آمریکا) که نشاندهنده زیرساخت توزیعشدهتر این مدل در سطح جهانی است. برای توسعهدهندگانی که بازارهای آسیایی را از مراکز داده آمریکا سرو میکنند، این یک اتلاف «رایگان» تا ۱۲۰ میلیثانیه است. استفاده از نقطه اتصال آگاه به منطقه (Region-aware endpoint) برای جلوگیری از این جریمه حیاتی است.
برای درک بهتر، این بنچمارک TTFT را به چهار تجربه کاربری تقسیم میکند تا میلیثانیههای خام را به احساس انسانی تبدیل کند:
- زیر ۲۰۰ میلیثانیه: آنی (تجربه عالی)
- ۲۰۰ تا ۴۰۰ میلیثانیه: سریع (پذیرفتنی)
- ۴۰۰ تا ۸۰۰ میلیثانیه: تأخیر محسوس (ایجاد نارضایتی در برخی کاربران)
- بالای ۸۰۰ میلیثانیه: کند (ترک اپلیکیشن توسط کاربر)
برای قابلیتهایی مثل تکمیل خودکار (Autocomplete)، دستیارهای صوتی یا چتهای زنده، توصیه میشود فقط از مدلهایی با TTFT زیر ۴۰۰ میلیثانیه استفاده کنید. این یعنی مدلهایی مثل Step-3.5-Flash (۱۲۰ میلیثانیه)، Qwen3-8B (۱۵۰ میلیثانیه)، DeepSeek V4 Flash (۱۸۰ میلیثانیه)، Hunyuan-TurboS (۲۰۰ میلیثانیه)، Doubao-Seed-Lite (۲۲۰ میلیثانیه) و Qwen3-32B (۲۵۰ میلیثانیه) گزینههای اصلی برای تجربه کاربری تعاملی هستند.
در مقابل، برای کارهای غیرهمزمان (Asynchronous) مثل پردازش دستهای اسناد در شب یا جریانهای کاری دستهای، تأخیر ۱۲۰۰ میلیثانیهای یک مدل عظیم مثل Qwen3.5-397B هیچ اهمیتی ندارد. بنابراین، انتخاب مدل باید بر اساس الگوی تعامل محصول باشد، نه یک عدد کلی در بنچمارک.
این تغییر دیدگاه یعنی «بهترین مدل» دیگر آن مدلی نیست که بالاترین نمره MMLU را دارد، بلکه مدلی است که با بودجه تأخیر (Latency Budget) رابط کاربری شما سازگار است. توسعهدهندگان اکنون باید وظایف خود را بر روی یک ماتریس «سرعت-هزینه-کیفیت» نگاشت کنند، به جای اینکه صرفاً به دنبال «باهوشترین» مدل باشند.
جزئیات پیادهسازی
برای پیادهسازی این بنچمارکها در استک فنی خود، میتوانید از یک اسکریپت ساده پایتون با کلاینت سازگار با OpenAI استفاده کنید. با استفاده از time.perf_counter() و httpx.stream میتوانید دلتای دقیق بین درخواست و دریافت اولین توکن را اندازهگیری کنید تا TTFT واقعی در محیط تولید را بیابید.
تستر از منطق زیر استفاده کرد:
- کلاینت: استفاده از
httpx.streamبرای درخواستهای POST به نقطه اتصال/chat/completions. - زمانبندی: استفاده از
time.perf_counter()برای ثبت زمان شروع و لحظه رسیدن اولین توکن. - میانگینگیری: استفاده از
statistics.meanدر ۱۰ اجرای مختلف برای حذف دادههای پرت (Outliers).
این رویکرد تضمین میکند که TTFT اندازهگیری شده، دقیقاً همان زمان انتظاری است که کاربر قبل از ظاهر شدن اولین کاراکتر روی صفحه تجربه میکند.
گام بعدی شما
- اگر از مدلهای سنگین برای چتهای زنده استفاده میکنید، مدلهای Flash را برای لایهی اول پاسخدهی تست کنید.
- برای کاهش تأخیر در بازارهای هدف، نقطه اتصال (Endpoint) خود را به نزدیکترین مرکز داده مدل منتقل کنید.
- با استفاده از کتابخانه
httpx.streamدر پایتون، TTFT واقعی مدل خود را در محیط تولید اندازهگیری کنید.
اما تأثیر این سرعتها بر مدلهای صوتی و تعاملات بلادرنگ حتی پیچیدهتر است — به تحلیل ما دربارهی مدلهای چندوجهی مراجعه کنید.




گفتگو