پرش به محتوای اصلی
پرش به محتوای مقاله

پروژه Deltafin مدل ۲.۸ تریلیون پارامتری Kimi K3 را روی لپ‌تاپ‌های اپل اجرا کرد

·۱۸ شهریور ۱۴۰۵۸ دقیقه مطالعه۳ بازدید
دلتافین: اجرای استریمد مدل کیمی K3 (۲.۸ تریلیون پارامتر MoE) از روی SSD روی پردازنده‌های اپل سیلیکون با فناوری ذخیره‌سازی ARG
دلتافین: اجرای استریمد مدل کیمی K3 (۲.۸ تریلیون پارامتر MoE) از روی SSD روی پردازنده‌های اپل سیلیکون با فناوری ذخیره‌سازی ARG
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اجرای کامل و بدون هرس (Unpruned) یک مدل ۲.۸ تریلیون پارامتری روی سخت‌افزار مصرف‌کننده از طریق استریم SSD؛ برخلاف متدهای رایج، در اینجا هیچ فشرده‌سازی یا کاهش بیتی در وزن‌ها صورت نگرفته است.

تصور کنید یک مدل زبانی با ۲.۸ تریلیون پارامتر — که پیش‌تر تنها در مراکز داده عظیم جای می‌گرفت — اکنون روی لپ‌تاپ شخصی شما اجرا شود. این اتفاق بدون حذف یا هرس کردن حتی یک وزن از مدل رخ داده است. طبق مستندات منتشر شده در گیت‌هاب در ۸ سپتامبر ۲۰۲۶، Deltafin یک باینری بومی تخصصی است که اجازه می‌دهد مدل Kimi K3 با استریم کردن بانک خبره‌های عظیم خود مستقیماً از حافظه SSD روی تراشه‌های اپل سیلیکون اجرا شود. این مدل که به دلیل مقیاس عظیم خود جلب توجه کرده، در بنچمارک‌های کدنویسی در برابر رقبایی چون GPT-5.6 و Claude Fable 5 قرار گرفته بود. این پروژه در واقع یک فورک (Fork) از gavamedia/deltafin (تحت لایسنس MIT) است که از دستاوردهای ذخیره‌سازی ARGODRIVE برای اجرای K3 از روی SSDها در محیط اپل سیلیکون بهره می‌برد. بسته بنچمارک‌ها، مانیفست‌های جایگذاری و نتایج در پوشه k3-public-bench/ قرار دارند، در حالی که ابزارهای اندازه‌گیری به‌طور جداگانه تحت عنوان ARGODRIVE منتشر شده‌اند.

برای درک این دستاورد باید بدانید که اجرای مدلی در این مقیاس معمولاً به زیرساخت‌های صنعتی نیاز دارد. به نقل از Moonshot AI، پیکربندی پیشنهادی برای K3 شامل ۱۶ گره (Node) و حدود ۴.۸ ترابایت حافظه VRAM مجموع است تا بتواند ۲.۸ تریلیون پارامتر و پنجره متنی یک میلیون توکنی را پشتیبانی کند. برای یک کاربر عادی، این یعنی یک غیرممکن مالی و فیزیکی. Deltafin تلاش می‌کند این شکاف را با تبدیل SSD به لایه ذخیره‌سازی اصلی برای ۱۶ خبره مسیریابی شده مدل پر کند.

این تلاش در راستای یک روند گسترده‌تر برای بهینه‌سازی مدل‌های پیشرو (Frontier Models) جهت اجرا روی سخت‌افزارهای محلی است. اگر به پوشش قبلی ما درباره‌ی Perplexity Lily بازگردیم، آن پروژه توانست سرعت رمزگشایی (Decode) را برای Qwen3.6 روی اپل سیلیکون ۱.۳۵ برابر افزایش دهد. اما Deltafin تمرکز خود را از سرعت خالص به «وفاداری مطلق» تغییر داده است. در حالی که Lily برای بهره‌وری بهینه شده بود، Deltafin حاضر نیست در مورد وزن‌های اصلی مدل هیچ سازشی کند.

معماری وفاداری به داده

Deltafin به عنوان یک باینری بومی واحد با هسته‌ای از زبان Rust و ارائه‌دهندگان C-ABI طراحی شده است. این سیستم یک قانون کیفی سخت‌گیرانه را اجرا می‌کند: K3 باید برای هر توکن تصمیم بگیرد. تمام ۱۶ خبره برای هر تک توکن به کار گرفته می‌شوند؛ هیچ میان‌بر یا تقریب «تقریباً درست» در اینجا وجود ندارد. برخلاف سایر پروژه‌ها که بانک خبره‌ها را برای جا شدن در حافظه به حدود ۳ بیت بازرمزگذاری (Re-encode) می‌کنند، Deltafin هر بایت را دقیقاً همان‌طور که Moonshot آن را عرضه کرده است، استفاده می‌کند. توسعه‌دهندگان پروژه استدلال می‌کنند که چون وزن‌های ۳ بیتی دیگر همان وزن‌هایی نیستند که Moonshot منتشر کرده، هزینه این سازش‌ها هنوز اندازه‌گیری نشده و ناشناخته است.

برای مدیریت حجم ۱.۷ ترابایتی مدل، این پروژه دو مسیر اصلی نصب را ارائه می‌دهد:

  • نصب کامل (Full Installation): کل مدل ۱.۷ ترابایتی را برای سریع‌ترین دسترسی محلی ممکن روی دیسک دانلود می‌کند. این کار از طریق دستور ./target/release/deltafin setup --full انجام می‌شود.
  • حالت استریم (Streaming Mode): در ابتدا تنها به ۲۱۵ گیگابایت فضا نیاز دارد و خبره‌های خاص را بر اساس تقاضا (On-demand) فراخوانی می‌کند. این حالت از طریق دستور ./target/release/deltafin setup --stream فعال می‌شود. این روش تا زمانی که یک حافظه پنهان (Cache) محلی روی دیسک ساخته شود، به‌طور قابل توجهی کندتر است، اما اجازه می‌دهد مدل روی سخت‌افزارهایی با فضای ذخیره‌سازی محدود اجرا شود، زیرا تنها بخش‌هایی از مدل را ذخیره می‌کند که کاربر واقعاً از آن‌ها استفاده می‌کند.

جزئیات فنی پیاده‌سازی

زمان اجرای بومی (Native Runtime) در Deltafin برای محدودیت‌های شدید طراحی شده است، جایی که هر ۱٪ بهبود سخت به دست می‌آید. معماری سیستم شامل چندین جزء تخصصی است:

  • آماده‌سازی ذخیره‌سازی: سیستم از یک ستون فقرات مقیم row-int8 پیش‌فرض استفاده می‌کند. این سیستم به‌طور صریح BF16 اصلی را انتخاب کرده و آن را در فایل‌های DFSP متوالی با sidecarهای scale4 بدون اتلاف برای خبره‌ها بسته‌بندی می‌کند.
  • طراحی زمان اجرا: طراحی تک-باینری در-فرآیند (in-process) شامل ردیابی مسیریاب (Router Tracing)، پیش‌خوانی خبره‌ها (Expert Prefetch) و توکن‌سازی بومی است.
  • توکن‌سازی: پروژه از یک مسیر توکن‌سازی موازی با ترتیب پایدار و خودکار برای تاریخچه‌های بزرگ سرور استفاده می‌کند که از GigaToken اثر Marcel Rød الهام گرفته شده است.
  • پشتیبانی سخت‌افزاری: این پروژه از کلاس‌های میزبان متعددی پشتیبانی می‌کند، از جمله MPS/Metal برای اپل سیلیکون، CUDA برای پردازنده‌های گرافیکی انویدیا و CPU بومی.
  • مکانیزم ارتقا: دستور ./target/release/deltafin upgrade باینری را بازسازی کرده و به‌روزرسانی‌های لازم را بدون نیاز به دانلود مجدد K3 یا پاک کردن حافظه‌های پنهان دریافت می‌کند. این دستور محیط ساخت را حفظ می‌کند (مثلاً اگر ساخت CUDA بوده، همان می‌ماند) و برای اجرا به یک شاخه git تمیز و بدون تغییرات (non-diverged) نیاز دارد.

بنچمارک‌های عملکرد و سرعت

در این سطح از کیفیت، سرعت قربانی اصلی است. بر اساس آخرین بنچمارک‌ها روی یک لپ‌تاپ M1 Max، توان عملیاتی ۰.۲۹۰۱ توکن بر ثانیه ثبت شده است که به معنای حدود ۳.۴۴۷ ثانیه برای تولید هر توکن است. این رقم نشان‌دهنده افزایش ۱.۹ درصدی توان عملیاتی نسبت به به‌روزرسانی قبلی است.

بنچمارک‌های تاریخی M1 یک منحنی بهینه‌سازی شدید را نشان می‌دهند:

  • ۲۷ جولای ۲۰۲۶: ۰.۰۱۴۱ توکن بر ثانیه
  • ۲۸ جولای ۲۰۲۶: ۰.۱۳۱۱ توکن بر ثانیه (۸۲۹.۸٪ افزایش توان عملیاتی)
  • ۳۰ جولای ۲۰۲۶: ۰.۲۶۶۰ توکن بر ثانیه (۱۰۲.۹٪ افزایش توان عملیاتی)
  • ۲ اوت ۲۰۲۶: ۰.۲۸۴۷ توکن بر ثانیه (۷.۰٪ افزایش توان عملیاتی)

بهینه‌سازی سرعت از طریق گمانه‌زنی

برای کاهش اثر سرعت پایین خام، Deltafin از مدل‌های پیش‌نویس (Draft Models) استفاده می‌کند تا توکن‌ها را پیش از مدل اصلی حدس بزند. مدل‌های پیش‌نویس کوچک توکن بعدی را حدس می‌زنند، اما K3 هر حدس را بررسی می‌کند؛ هیچ چیزی بدون تایید رسمی K3 به دست کاربر نمی‌رسد.

این سیستم Kimi-K3-DSpark اثر Inferact را یکپارچه می‌کند که ۶.۶۳۵ گیگابایت فضا روی دیسک و حدود ۴.۴۹ گیگابایت در زمان اجرا اشغال می‌کند. Deltafin با جلوگیری از ایجاد یک کپی تکراری از embeddingهای K3 در DSpark، این فرآیند را بهینه می‌کند. درخواست‌های چت و سرور به‌طور خودکار در صورت سودمند بودن از DSpark استفاده می‌کنند؛ اگر فضای کافی نداشته باشد یا اقتصاد اجرای زنده (Live Economics) نامناسب باشد، سیستم به‌سادگی اجازه می‌دهد K3 به‌تنهایی اجرا شود.

کاربران می‌توانند با نصب یک افزونه اختیاری Qwen از طریق دستور ./target/release/deltafin setup-qwen سرعت تکمیل متن خام را بیشتر کنند. این کار ۴.۳۳۷ گیگابایت به فضای دیسک اضافه می‌کند. در یک تست اندازه‌گیری شده، تکمیل یک متن ۱۷ توکنی با فعال بودن Qwen، ۲.۷ برابر سریع‌تر اجرا شد، در حالی که شناسه‌های خروجی (Output IDs) دقیقاً با K3 مستقل یکسان بود. این قابلیت به‌ویژه برای تکمیل خودکار کد (Code Autocomplete) و ترافیک /v1/completions مفید است.

استقرار و یکپارچه‌سازی

Deltafin یک سرور سازگار با OpenAI ارائه می‌دهد که مسیرهای /v1/chat/completions ، /v1/completions و /v1/models را پیاده‌سازی می‌کند. این سرور برای تولید یک پاسخ در هر لحظه طراحی شده و از رمزگشایی حریصانه (Greedy Decoding) برای تضمین بازتولیدپذیری نتایج استفاده می‌کند. این سیستم از پنجره متنی تا یک میلیون توکن را پشتیبانی می‌کند، هرچند به کاربران توصیه می‌شود به‌دلیل سرعت پایین تولید، زمان انتظار (Timeout) کلاینت را افزایش دهند.

مشخصات کلیدی سرور عبارتند از:

  • محدودیت درخواست‌ها: حجم JSON درخواست توسط --max-request-bytes محدود می‌شود که به‌طور پیش‌فرض ۱۲۸ مگابایت است.
  • بهره‌وری: چت‌های در حال رشد از بازاستفاده دقیق از وضعیت گفتگو (Conversation-state reuse)، افزایش سرعت DSpark تایید شده توسط پیش‌نویس و یک یادداشت پاسخ دقیق (Exact-response memo) بهره می‌برند.
  • سخت‌گیری: سرور هر فیلد API را که نتواند دقیقاً اجرا کند رد می‌کند و به‌جای نادیده گرفتن بی‌صدا، یک خطای استاندارد با فرمت OpenAI برمی‌گرداند.
  • استفاده از CLI: کاربران می‌توانند چت را از طریق --chat (که قالب چت بازرسی شده K3 را اعمال می‌کند) یا ادامه متن خام را از طریق --prompt با محدودیت --max-new اجرا کنند. افزودن پرچم --stats به‌جای استریم استاندارد، توان عملیاتی تجمعی و آمار تراکنش‌های بومی را ارائه می‌دهد.

پروژه همچنین شامل مجموعه‌ای از بررسی‌های سلامت (Health Checks) است؛ حسابرس‌هایی فقط-خواندنی و بدون نیاز به شبکه که پس از نصب یا ارتقا، زمان اجرا و اجزا را تایید می‌کنند.

فلسفه مسیر سخت

Deltafin نه به عنوان یک محصول، بلکه به عنوان آزمایشی در مرزهای سخت‌افزار مصرف‌کننده تعریف شده است. توسعه‌دهندگان استدلال می‌کنند که کاربردی کردن مدل‌های پیشرو روی یک سیستم خانگی ۱۵ هزار دلاری، به‌جای زیرساختی ۲ میلیون دلاری، گامی حیاتی برای سفر هوش مصنوعی خود-میزبان (Self-hosted) است. آن‌ها صراحتاً رویکرد «حداقل محصول پذیرفتنی» (MVP) را که مورد علاقه سرمایه‌گذاران خطرپذیر است رد کرده و در عوض استراتژی اندازه‌گیری «اول-درست‌بودن» (Correctness-first) را برگزیدند.

این رویکرد این فرض صنعت را به چالش می‌کشد که مدل‌های عظیم MoE (ترکیب خبره‌ها) برای همیشه پشت دیوارهای API قفل شده‌اند. با اثبات اینکه یک مدل ۲.۸ تریلیونی می‌تواند — هرچند کند — روی یک لپ‌تاپ عمل کند، Deltafin نقشه‌ای برای آینده هوش مصنوعی پیشرو با اولویت محلی ارائه می‌دهد. ماموریت پروژه با نقل‌قولی تغییر یافته از JFK خلاصه شده است: «ما اجرای کامل مدل ۲.۸ تریلیون پارامتری را به‌صورت محلی انتخاب می‌کنیم... نه چون آسان است، بلکه چون سخت است.»

اعتبار و منشأ

Deltafin یک پروژه مستقل است و هیچ وابستگی به Moonshot AI ندارد. این پروژه بر چندین مشارکت کلیدی تکیه دارد:

  • Moonshot AI: وزن‌ها، معماری و معناشناسی مدل K3 را فراهم کرد.
  • Inferact: چک‌پوینت تغییرنیافته DSpark مخصوص K3 را منتشر کرد.
  • تحقیقات جامعه: تحقیقات یکپارچه‌سازی و حافظه پنهان از تیم vLLM، مستندات چارچوب آموزشی از TorchSpec و پیشینه‌های فنی از llama.cpp/ggml، PyTorch و tiktoken.
  • مشارکت‌کنندگان فردی: موریس براون (trumb) یافته‌های مربوط به لینوکس، aarch64، x86 SIMD و اندازه‌گیری‌های NVIDIA DGX Spark را در Pull Request شماره ۲ ارائه کرد. ایده‌های استریم MoE و پیش‌بینی مسیریاب (Router-lookahead) از colibri گرفته شده و ds4/DwarfStar هنر استریم خبره‌ها، مالکیت حافظه پنهان و اندازه‌گیری اول-درست‌بودن را فراهم کردند.

برای کاربر نهایی، این به معنای توانایی اجرای یک مدل در سطح جهانی بدون هیچ‌گونه سانسور یا نشت داده است، به شرطی که صبر لازم برای چند ثانیه برای هر توکن را داشته باشند. این ابزار لپ‌تاپ را از یک ترمینال ساده به یک ایستگاه تحقیقاتی با وفاداری بالا تبدیل می‌کند.

باید منتظر ماند و دید که چگونه تکنیک‌های استریم SSD ممکن است در اجراکننده‌های محلی رایج‌تر مانند llama.cpp ادغام شوند تا سایر مدل‌های تریلیون-پارامتری را به دسکتاپ بیاورند.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص در مدیریت حافظه، ثابت می‌کند که مدل‌های تریلیونی دیگر محصور در مراکز داده نیستند. این تغییر، استقلال پژوهشگران از شرکت‌های ارائه‌دهنده API را به شدت افزایش می‌دهد.

تأثیر برای ایران

این پروژه برای پژوهشگران ایرانی که به دلیل تحریم‌ها و هزینه‌های بالای API با محدودیت مواجه‌اند، مسیری برای اجرای مدل‌های پیشرو در محیط‌های آفلاین و امن فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

تمرکز Deltafin بر «صحت» به‌جای «سرعت»، یک چرخش در فلسفه مدل‌های محلی است. این پروژه ثابت می‌کند که محدودیت‌های سخت‌افزاری لزوماً به معنای پذیرش کوانتش‌های تخریبی نیست و می‌توان با قربانی کردن زمان، به کیفیت مدل‌های تجاری دست یافت. این رویکرد، مدل‌های MoE عظیم را از حصار APIهای شرکت‌های بزرگ خارج می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.