پرش به محتوای اصلی
پرش به محتوای مقاله

چرا مدل‌های بزرگ در Ollama 0.30 روی کارت‌های ۴ گیگابایتی کرش می‌کنند؟

·۱۸ خرداد ۱۴۰۵۱ دقیقه مطالعه
چرا مدل‌های بزرگ در Ollama 0.30 روی کارت‌های ۴ گیگابایتی کرش می‌کنند؟
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

یک عقب‌گرد (Regression) در تخصیص حافظه Vulkan در نسخه ۰.۳۰.x که باعث می‌شود مدل‌هایی که در نسخه ۰.۲۴ اجرا می‌شدند، اکنون در کارت‌های ۴ گیگابایتی کرش کنند.

اگر از کارت گرافیک با حافظه ۴ گیگابایت استفاده می‌کنید، احتمالاً مدل‌های هوش مصنوعی شما در لحظه کرش می‌کنند. شما با یک عقب‌گرد فنی در مدیریت حافظه مواجه هستید که دسترسی سخت‌افزارهای میان‌رده به AI محلی را مسدود کرده است.

میزبانی مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — به مدیریت دقیق حافظه گرافیکی (VRAM) نیاز دارد. این حافظه شبیه میز کاری است که مدل باید تمام ابزارهایش را روی آن بچیند تا بتواند پاسخ دهد. همان‌طور که در تحلیل‌های پیشین ما درباره بهینه‌سازی مدل‌های لبه اشاره کردیم، هر میلی‌بایت در اینجا حیاتی است.

طبق گزارش ۷ ژوئن ۲۰۲۶، مشکل اصلی در تخصیص حافظه Vulkan در نسخه Ollama 0.30.x نهفته است. بر اساس مستندات فنی این نسخه، سیستم در رزرو حافظه برای تانسورها بیش از حد تهاجمی عمل می‌کند. برای مثال، بارگذاری مدل‌های کوانتیزه شده (Quantized) — که شبیه تبدیل یک عکس باکیفیت به JPEG برای کاهش حجم است — مانند مدل gemma4:26b-a4b-it-q4_K_M، بلافاصله منجر به خطای کمبود حافظه (OOM) می‌شود؛ وضعیتی شبیه تلاش برای جا دادن یک چمدان بزرگ در یک کمد کوچک. این رفتار در نسخه ۰.۲۴ بسیار محافظه‌کارانه‌تر و پایدارتر بود.

این به‌روزرسانی نشان می‌دهد که توسعه‌دهندگان اولویت را به سخت‌افزارهای قدرتمند داده‌اند و کاربران لبه را فراموش کرده‌اند. وقتی یک تغییر کوچک در نحوه رزرو حافظه بتواند اجرای مدل را برای میلیون‌ها کاربر مسدود کند، یعنی پایداری فدای عملکرد حداکثری شده است.

گام بعدی شما

  • نسخه Ollama خود را بررسی کنید.
  • اگر کرش دارید، متغیر محیطی OLLAMA_VULKAN_MEMORY_FRACTION="0.5" را تنظیم کنید تا مصرف حافظه به ۵۰٪ محدود شود.
  • منتظر پچ رسمی برای بازگشت به رفتار پایدار نسخه ۰.۲۴ باشید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این اتفاق نشان می‌دهد که حتی در ابزارهای متن‌باز، یک تغییر کوچک در لایه تخصیص حافظه می‌تواند دسترسی دموکراتیک به AI را مختل کند. تخصص در مدیریت VRAM اکنون به اندازه معماری خود مدل اهمیت یافته است.

تأثیر برای ایران

بسیاری از توسعه‌دهندگان ایرانی به دلیل محدودیت بودجه از کارت‌های گرافیکی قدیمی یا میان‌رده استفاده می‌کنند. این باگ مستقیماً دسترسی این کاربران به مدل‌های محلی را مختل می‌کند و استفاده از راهکار متغیر محیطی برای آن‌ها ضروری است.

·نگاه ما
تحریریه دات‌هوش

تحلیل ما این است که Ollama در حال عبور از دوران «سادگی برای همه» به دوران «بهینه‌سازی برای حرفه‌ای‌ها» است. این ریسک می‌کند که با حذف پشتیبانی غیرمستقیم از سخت‌افزارهای قدیمی، جامعه کاربران خانگی خود را به نفع مراکز داده کوچک از دست بدهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.