پرش به محتوای اصلی
پرش به محتوای مقاله

چطور DwarfStar 4 مدل‌های سنگین را به سخت‌افزار خانگی آورد؟

·۱۱ مهر ۱۴۰۵۳ دقیقه مطالعه
لوگوی پروژه DwarfStar 4: ترکیب مدل‌های محلی DeepSeek V4.1، Qwen و GLM
لوگوی پروژه DwarfStar 4: ترکیب مدل‌های محلی DeepSeek V4.1، Qwen و GLM
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از کوانتش نامتقارن ۲ بیتی برای حفظ مسیرهای استدلالی در مدل‌های MoE و تبدیل KV Cache به یک موجودیت دیسکی برای حذف نیاز به پیش‌پُرکردن مجدد.

اگر امروز یک ورک‌استیشن با حافظه بالا دارید، دیگر برای اجرای مدل‌های پیشرو نیازی به پرداخت هزینه API یا اجاره سرورهای ابری ندارید. موتور استنتاج DwarfStar 4 (ds4) ریاضیات اجرای مدل‌های عظیم را برای سخت‌افزارهای شخصی تغییر داده است. اجرای محلی یک مدل با ۲۸۴ میلیارد پارامتر معمولاً نیازمند یک مرکز داده است، اما ds4 این معادله را برای ایستگاه‌های کاری با حافظه بالا دگرگون کرده است.

طبق مستندات رسمی dwarfstar.sh، این موتور که در ۲ اکتبر ۲۰۲۶ منتشر شد، برخلاف اکثر ابزارهای مشابه که سعی می‌کنند همه‌پسند باشند و هر فرمتی را پشتیبانی کنند، روی چند خانوادهٔ خاص از مدل‌ها تمرکز کرده است تا اعتبارسنجی چیدمان (Layout Validation) را به صورت سرتاسری تضمین کند. این تخصص‌گرایی به ds4 اجازه می‌دهد تا سقف ظرفیت سخت‌افزاری یک ماشین واحد را جابه‌جا کند و محدودیت‌های سخت‌افزاری را به چالش بکشد.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی بهینه‌سازی مدل‌های بازمتن اشاره کردیم، حذف لایه‌های اضافی در موتورهای استنتاج، کلید دسترسی به مدل‌های غول‌آساست. DwarfStar 4 یک مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — را به جای محیط‌های ابری، مستقیماً در محیط محلی مستقر می‌کند.

زمینه و پشتیبانی از مدل‌ها

برخلاف اجراکننده‌های عمومی GGUF، موتور ds4 برای مجموعه‌ای خاص از مدل‌های پیشرو طراحی شده است. این سیستم از مدل‌های DeepSeek V4 و V4.1 Flash، GLM 5.x و Qwen3.8 Flash Next پشتیبانی می‌کند. نکته حائز اهمیت این است که این موتور هر دو نوع مدل‌های متنی و بینایی (Vision) را در یک پشتهٔ واحد مدیریت می‌کند.

این پروژه تحت لایسنس MIT منتشر شده است. توسعه‌دهندگان آن را به عنوان «فاز ۱ پشته مدل محلی» (Local Model Stack Phase 1) معرفی کرده‌اند که هدف آن تغییر مسیر از سرویس‌دهی راه دور به سمت محدودیت‌های اولویت‌دار محلی است. این رویکرد اجازه می‌دهد تا مدل غول‌آسای DeepSeek V4 Flash MoE با ۲۸۴ میلیارد پارامتر، روی سخت‌افزار شخصی جای بگیرد.

مکانیسم فشرده‌سازی

قلب تپنده این موتور فرآیندی به نام «فروپاشی» (The Collapse) است. در این روش، به جای کوانتش (Quantization) یکنواخت — که شبیه به کاهش کیفیت یک عکس برای کم کردن حجم آن است — از کوانتش نامتقارن ۲ بیتی استفاده می‌شود. به نقل از توسعه‌دهندگان، این تکنیک به طور خاص روی خبره‌های مسیریابی (Routed Experts) در مدل‌های ترکیب خبره‌ها (MoE) تمرکز می‌کند، در حالی که مسیرهای مشترک و حیاتی را دقیق نگه می‌دارد. این استراتژی مانع از آن می‌شود که مدل در حین فشرده‌سازی دچار «لوبوتومی» (از دست دادن توانایی‌های ذهنی) شود.

این رویکرد نامتقارن تضمین می‌کند که نسخه‌های routed-MoE مورد پشتیبانی، بدون قربانی کردن مسیرهای منطقی ضروری برای استدلال در سطح مدل‌های پیشرو، در ماشین‌های هدف جای بگیرند.

معماری فنی

علاوه بر فشرده‌سازی، معماری فنی این سیستم لایه‌های بهره‌وری جدیدی را معرفی کرده است:

  • استریمینگ KV Cache از دیسک: حافظه KV Cache — مثل یادداشت‌های سریع یک دانش‌آموز برای یادآوری جملات قبلی — به عنوان یک «شهروند دیسکی» شناخته می‌شود. این بهینه‌سازی در ادامه پیشرفت‌هایی است که مدل DeepSeek-V4.1-Flash با کاهش چشمگیر حجم حافظه KV Cache ایجاد کرد تا بهره‌وری استنتاج را افزایش دهد. پیشوندهای طولانی روی SSD ذخیره شده و از طریق هش پرامپت بازیابی می‌شوند؛ این یعنی ری‌استارت‌ها نیازی به پیش‌پُرکردن (Prefill) کامل ندارند.
  • رابط یکپارچه: یک موتور واحد سه ابزار مجزا را تغذیه می‌کند: ./ds4 برای چت تعاملی، ./ds4-server برای APIهای سازگار با OpenAI و Anthropic، و ./ds4-agent برای جلسات کدنویسی مستمر و پایدار.
  • پشتیبانی از بک‌اِند: این موتور با زبان C نوشته شده و از Metal (مک)، CUDA و ROCm پشتیبانی می‌کند. همچنین از قابلیت‌های Session Batching، استریمینگ SSD و موازی‌سازی تنسور (Tensor Parallelism) بهره می‌برد.
  • مدیریت حافظه: سیستم از ترکیب dSpark + MTP و کلاس‌های حافظه توزیع‌شده برای مدیریت جریان داده بین RAM و SSD استفاده می‌کند.

عملکرد سخت‌افزاری

عملکرد سیستم بسته به ظرفیت حافظه متفاوت است. روی یک M5 Max با ۱۲۸ گیگابایت رم، مدل DeepSeek V4 Flash Q2 به سرعت پیش‌پُرکردن ۷۹۰.۲ توکن در ثانیه (t/s) در پنجره متنی ۲۰۴۸ توکنی می‌رسد. با افزایش پنجره متنی به ۶۵,۵۳۶ توکن، سرعت تولید به ۲۷.۶ توکن در ثانیه کاهش می‌یابد.

برای کاربرانی که ۱۲۸ گیگابایت حافظه دارند، این موتور می‌تواند مدل‌های GLM 5.3 Q2 و Qwen Q4 را نیز مدیریت کند. با این حال، مدل بزرگ‌تر V4.1 Q2 برای اجرا نیازمند استریمینگ مستقیم از SSD است. در یک سیستم DGX Spark با ۱۲۸ گیگابایت رم، سرعت پیش‌پُرکردن برای ۶۵,۵۳۶ توکن به ۸۲۳.۰ توکن در ثانیه و سرعت تولید به ۱۳.۸ توکن در ثانیه می‌رسد.

این چرخش به سمت موتورهای «تخصصی»، نشان می‌دهد که آینده هوش مصنوعی محلی در ابزارهای عمومی نیست، بلکه در پشته‌های بهینه‌شده برای معماری‌های خاص است. با تبدیل SSD به امتدادی از RAM، موتور ds4 عملاً سد سخت‌افزاری برای استنتاج مدل‌های کلاس پیشرو را پایین آورده است.

برای توسعه‌دهندگان، این یعنی عامل‌های کدنویسی محلی مانند Codex، Claude Code یا OpenCode را می‌توان اکنون از طریق یک Base URL به یک سرور خصوصی و محلی متصل کرد و دغدغه حریم خصوصی یا تأخیرهای مربوط به استنتاج ابری را کاملاً حذف نمود.

گام بعدی شما

  • مخزن GitHub پروژه را کلون کرده و اسکریپت دانلود لایوت‌های GGUF (مانند ds4f-q2) را اجرا کنید.
  • بسته به سخت‌افزار خود، از دستور make یا make cuda-spark برای ساخت بک‌اِند استفاده کنید.
  • برای کاهش فشار روی RAM، مدل‌های Q2 را روی SSDهای NVMe سریع‌تر تست کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با تبدیل SSD به امتداد RAM، سد سخت‌افزاری برای استنتاج مدل‌های عظیم را می‌شکند. این یعنی تخصص در بهینه‌سازی لایه استنتاج، اهمیتش را از افزایش حجم حافظه VRAM پیشی گرفته است.

تأثیر برای ایران

به دلیل ماهیت متن‌باز و محلی بودن، این ابزار برای توسعه‌دهندگان ایرانی که با محدودیت‌های API و تحریم‌های ابری مواجه‌اند، راهکاری ایده‌آل برای میزبانی مدل‌های پیشرو است.

·نگاه ما
تحریریه دات‌هوش

تمرکز DwarfStar 4 بر «تخصص‌گرایی» به جای «جامعیت»، یک سیگنال مهم است. این رویکرد ثابت می‌کند که برای اجرای مدل‌های Frontier روی سخت‌افزار مصرف‌کننده، باید از استانداردهای عمومی مثل GGUF فاصله گرفت و موتورهایی ساخت که دقیقاً با توپولوژی مدل‌های MoE همسو باشند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.