پرش به محتوای اصلی
پرش به محتوای مقاله

حد ۴,۰۰۰ توکنی در macOS 0.30.6: چرا مدل Qwen3 باعث کرش Metal GPU می‌شود؟

·۱۸ خرداد ۱۴۰۵۱ دقیقه مطالعه
راهنما
حد ۴,۰۰۰ توکنی در macOS 0.30.6: چرا مدل Qwen3 باعث کرش Metal GPU می‌شود؟
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

یک کرش سطح سخت‌افزار در Metal GPU که تنها هنگام مواجهه با ورودی‌های طولانی در مدل Qwen3 رخ می‌دهد؛ این یک پس‌رفت است، یعنی قابلیتی که پیش‌تر پایدار بود، اکنون خراب شده است.

اگر از مدل‌های محلی برای تحلیل متن‌های طولانی روی مک استفاده می‌کنید، سیستم شما در معرض یک توقف ناگهانی است. یک باگ بحرانی در نسخه‌ی ۰.۳۰.۶ باعث می‌شود هر ورودی طولانی، کل پردازش گرافیکی شما را به زمین بزند.

این مشکل مستقیماً برنامه‌نویسانی را هدف قرار داده که از بردار معنایی (Embedding) — که مثل یک کارت شناسایی عددی برای هر واژه است تا مدل بفهمد کدام کلمات به هم شبیه‌اند — در محیط‌های محلی استفاده می‌کنند. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی مدل‌های کوچک اشاره کردیم، پایداری در محیط‌های لبه (Edge) همیشه چالش‌برانگیز است.

به گزارش منتشر شده در ۷ ژوئن ۲۰۲۶، این خطا دقیقاً در نقطه اتصال /api/embed رخ می‌دهد. طبق مستندات فنی، این یک پس‌رفت (Regression) در نسخه‌ی ۰.۳۰.۶ است که در نسخه‌ی ۰.۲۴.۰ وجود نداشت. جزئیات فنی این شکست عبارتند از:

  • هدف: مدل qwen3-embedding:0.6b.
  • محرک: ورودی‌های بیش از ۴,۰۰۰ توکن (Token) — یعنی تکه‌های کوچکی از متن مثل برش‌های یک کیک.
  • علت: خطای Segmentation Fault هنگام استفاده از شتاب‌دهنده گرافیکی Metal GPU در llama-server.

این اتفاق برای شما به معنای قطعی ناگهانی در جریان‌های کاری تولید بازیابی‌افزا (RAG) است؛ سیستمی که مثل دانش‌آموزی است که قبل از جواب دادن، اول کتاب را باز می‌کند تا دقیق‌تر پاسخ دهد. وقتی اسناد شما طولانی باشند، اپلیکیشن شما بدون هیچ هشدار قبلی کرش می‌کند و تمام محاسبات جاری از بین می‌رود.

گام بعدی شما

  • دانگرید به نسخه ۰.۲۴.۰ از طریق Homebrew برای بازگرداندن پایداری سیستم.
  • تقسیم متن‌های ورودی به تکه‌های ۲,۰۰۰ کاراکتری و میانگین‌گیری از بردارهای حاصل.
  • نظارت بر انتشار پچ رسمی در نسخه‌های آینده برای جایگزینی راهکارهای موقت.

اما این تنها مشکل Metal نیست؛ در مقاله بعدی بررسی می‌کنیم که چگونه نشت حافظه در نسخه‌های جدیدتر، سرعت استنتاج را کاهش داده است.

چرا این موضوع مهم است؟

این نقص فنی قابلیت اطمینان پایپلاین‌های RAG محلی را برای پردازش اسناد حجیم از بین می‌برد. بر اساس تجربه استقرار مدل‌ها، این موضوع ثابت می‌کند که شتاب‌دهنده‌های GPU در محیط‌های محلی هنوز شکننده هستند و نیاز به تثبیت نسخه (Version Locking) دارند.

تأثیر برای ایران

این یک باگ فنی در ابزارهای AI مک است و اثر مستقیمی بر بازار ایران ندارد، مگر برای توسعه‌دهندگانی که از سخت‌افزار Mac برای اجرای مدل‌های محلی استفاده می‌کنند.

·نگاه ما
تحریریه دات‌هوش

تحلیل ما این است که این باگ، خطر «به‌روزرسانی‌های کورکورانه» در اکوسیستم AI محلی را برملا می‌کند. ما شاهد روندی هستیم که در آن عرضه سریع مدل‌های جدید، پایداری سخت‌افزاری پایه را فد می‌کند و توسعه‌دهندگان را مجبور می‌کند مدیریت نسخه‌ها را به‌صورت دستی و سخت‌گیرانه انجام دهند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.