اگر مدل هوش مصنوعی شما روی سختافزار قدرتمندی اجرا میشود اما همچنان در شروع هر پاسخ مکث میکند، مشکل احتمالاً از مدل نیست، بلکه از لایهی مدیریت است. برای حذف این تأخیرهای تکراری، اولاما (Ollama) در ۲۰ اوت ۲۰۲۶ در نسخه پیشانتشار ۰.۳۲.۱۵، حافظهٔ متاداده (Metadata Cache) را معرفی کرد.
بسیاری از توسعهدهندگان تنها روی «تعداد توکن در ثانیه» تمرکز میکنند چون معیاری ساده برای مقایسه است. اما کاربر واقعی مسیری طولانیتر را تجربه میکند: از صف انتظار و تجزیه درخواست گرفته تا شناسایی مدل، جستوجوی متاداده، بارگذاری، گرم کردن مدل و در نهایت استنتاج (Inference) — که شبیه لحظه آشپزی واقعی است، نه دورهی آموزش آشپز. همانطور که در تحلیل قبلی ما دربارهی روندهای استنتاج محلی و مدلهایی مثل Kimi-K3 اشاره کردیم، مشخص شده که خودِ مدل همیشه کندترین بخش زنجیره نیست. این تلاش برای بهینهسازی تجربه کاربر، مشابه رویکردی است که Oxlo.ai برای حذف مالیات تأخیر در درخواستها به کار گرفت تا پاسخدهی سریعتر شود.
طبق مستندات منتشرشده در گیتهاب اولاما، این حافظهٔ جدید دقیقاً مرحله جستوجوی متاداده را هدف قرار داده است. برای اینکه بفهمید این تغییر روی سیستم شما اثرگذار است یا خیر، نویسنده پیشنهاد میکند مسیر درخواست را به بخشهای زیر تقسیم و اندازهگیری کنید:
- فاصله رسیدن درخواست تا ارسال (Dispatch)
- جستوجوی متاداده و مدل
- بارگذاری یا گرم کردن مدل
- زمان تا نخستین توکن (Time to First Token)
- تولید توکن و تکمیل پاسخ
به نقل از تیم توسعه، برای دقت در این تستها باید تنظیمات کوانتیزاسیون (Quantization)، پرامپت و سختافزار ثابت بماند و هر دو حالت «راهاندازی سرد» و «گرم» بررسی شوند. بدون این کنترلها، اعداد بهدستآمده معمولاً بیشتر از آنکه توضیح دهند، حقیقت را پنهان میکنند.
این یعنی «سرعت» یک معیار ترکیبی است. اگر مدل محلی شما با وجود توان عملیاتی بالا، کند به نظر میرسد، گلوگاه احتمالاً در لایهی ارکستراسیون است نه در وزنهای مدل. در واقع، مدیریت بهینه لایههای میانی میتواند مشابه استفاده از مسیریابی پویا برای کاهش هزینهها بدون افت کیفیت، کارایی سیستم را به شدت افزایش دهد. البته حافظهٔ پنهان یا کشینگ، بدون هزینه نیست و نیازمند قوانین سختگیرانه برای بهروزرسانی دادههای قدیمی است.
گام بعدی شما
- نسخه پیشانتشار ۰.۳۲.۱۵ را نصب کنید و «زمان تا نخستین توکن» را در چندین درخواست متوالی بسنجید.
- تفاوت تأخیر بین اولین درخواست (Cold Start) و درخواستهای بعدی را ثبت کنید.
- منتظر نسخه نهایی تولیدی باشید تا بنچمارکهای رسمی تأخیر (Latency) منتشر شوند.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو