تصور کنید یک مدل زبانی با ۲.۸ تریلیون پارامتر — که پیشتر تنها در مراکز داده عظیم جای میگرفت — اکنون روی لپتاپ شخصی شما اجرا شود. این اتفاق بدون حذف یا هرس کردن حتی یک وزن از مدل رخ داده است. طبق مستندات منتشر شده در گیتهاب در ۸ سپتامبر ۲۰۲۶، Deltafin یک باینری بومی تخصصی است که اجازه میدهد مدل Kimi K3 با استریم کردن بانک خبرههای عظیم خود مستقیماً از حافظه SSD روی تراشههای اپل سیلیکون اجرا شود. این مدل که به دلیل مقیاس عظیم خود جلب توجه کرده، در بنچمارکهای کدنویسی در برابر رقبایی چون GPT-5.6 و Claude Fable 5 قرار گرفته بود. این پروژه در واقع یک فورک (Fork) از gavamedia/deltafin (تحت لایسنس MIT) است که از دستاوردهای ذخیرهسازی ARGODRIVE برای اجرای K3 از روی SSDها در محیط اپل سیلیکون بهره میبرد. بسته بنچمارکها، مانیفستهای جایگذاری و نتایج در پوشه k3-public-bench/ قرار دارند، در حالی که ابزارهای اندازهگیری بهطور جداگانه تحت عنوان ARGODRIVE منتشر شدهاند.
برای درک این دستاورد باید بدانید که اجرای مدلی در این مقیاس معمولاً به زیرساختهای صنعتی نیاز دارد. به نقل از Moonshot AI، پیکربندی پیشنهادی برای K3 شامل ۱۶ گره (Node) و حدود ۴.۸ ترابایت حافظه VRAM مجموع است تا بتواند ۲.۸ تریلیون پارامتر و پنجره متنی یک میلیون توکنی را پشتیبانی کند. برای یک کاربر عادی، این یعنی یک غیرممکن مالی و فیزیکی. Deltafin تلاش میکند این شکاف را با تبدیل SSD به لایه ذخیرهسازی اصلی برای ۱۶ خبره مسیریابی شده مدل پر کند.
این تلاش در راستای یک روند گستردهتر برای بهینهسازی مدلهای پیشرو (Frontier Models) جهت اجرا روی سختافزارهای محلی است. اگر به پوشش قبلی ما دربارهی Perplexity Lily بازگردیم، آن پروژه توانست سرعت رمزگشایی (Decode) را برای Qwen3.6 روی اپل سیلیکون ۱.۳۵ برابر افزایش دهد. اما Deltafin تمرکز خود را از سرعت خالص به «وفاداری مطلق» تغییر داده است. در حالی که Lily برای بهرهوری بهینه شده بود، Deltafin حاضر نیست در مورد وزنهای اصلی مدل هیچ سازشی کند.
معماری وفاداری به داده
Deltafin به عنوان یک باینری بومی واحد با هستهای از زبان Rust و ارائهدهندگان C-ABI طراحی شده است. این سیستم یک قانون کیفی سختگیرانه را اجرا میکند: K3 باید برای هر توکن تصمیم بگیرد. تمام ۱۶ خبره برای هر تک توکن به کار گرفته میشوند؛ هیچ میانبر یا تقریب «تقریباً درست» در اینجا وجود ندارد. برخلاف سایر پروژهها که بانک خبرهها را برای جا شدن در حافظه به حدود ۳ بیت بازرمزگذاری (Re-encode) میکنند، Deltafin هر بایت را دقیقاً همانطور که Moonshot آن را عرضه کرده است، استفاده میکند. توسعهدهندگان پروژه استدلال میکنند که چون وزنهای ۳ بیتی دیگر همان وزنهایی نیستند که Moonshot منتشر کرده، هزینه این سازشها هنوز اندازهگیری نشده و ناشناخته است.
برای مدیریت حجم ۱.۷ ترابایتی مدل، این پروژه دو مسیر اصلی نصب را ارائه میدهد:
- نصب کامل (Full Installation): کل مدل ۱.۷ ترابایتی را برای سریعترین دسترسی محلی ممکن روی دیسک دانلود میکند. این کار از طریق دستور
./target/release/deltafin setup --fullانجام میشود. - حالت استریم (Streaming Mode): در ابتدا تنها به ۲۱۵ گیگابایت فضا نیاز دارد و خبرههای خاص را بر اساس تقاضا (On-demand) فراخوانی میکند. این حالت از طریق دستور
./target/release/deltafin setup --streamفعال میشود. این روش تا زمانی که یک حافظه پنهان (Cache) محلی روی دیسک ساخته شود، بهطور قابل توجهی کندتر است، اما اجازه میدهد مدل روی سختافزارهایی با فضای ذخیرهسازی محدود اجرا شود، زیرا تنها بخشهایی از مدل را ذخیره میکند که کاربر واقعاً از آنها استفاده میکند.
جزئیات فنی پیادهسازی
زمان اجرای بومی (Native Runtime) در Deltafin برای محدودیتهای شدید طراحی شده است، جایی که هر ۱٪ بهبود سخت به دست میآید. معماری سیستم شامل چندین جزء تخصصی است:
- آمادهسازی ذخیرهسازی: سیستم از یک ستون فقرات مقیم row-int8 پیشفرض استفاده میکند. این سیستم بهطور صریح BF16 اصلی را انتخاب کرده و آن را در فایلهای DFSP متوالی با sidecarهای scale4 بدون اتلاف برای خبرهها بستهبندی میکند.
- طراحی زمان اجرا: طراحی تک-باینری در-فرآیند (in-process) شامل ردیابی مسیریاب (Router Tracing)، پیشخوانی خبرهها (Expert Prefetch) و توکنسازی بومی است.
- توکنسازی: پروژه از یک مسیر توکنسازی موازی با ترتیب پایدار و خودکار برای تاریخچههای بزرگ سرور استفاده میکند که از GigaToken اثر Marcel Rød الهام گرفته شده است.
- پشتیبانی سختافزاری: این پروژه از کلاسهای میزبان متعددی پشتیبانی میکند، از جمله MPS/Metal برای اپل سیلیکون، CUDA برای پردازندههای گرافیکی انویدیا و CPU بومی.
- مکانیزم ارتقا: دستور
./target/release/deltafin upgradeباینری را بازسازی کرده و بهروزرسانیهای لازم را بدون نیاز به دانلود مجدد K3 یا پاک کردن حافظههای پنهان دریافت میکند. این دستور محیط ساخت را حفظ میکند (مثلاً اگر ساخت CUDA بوده، همان میماند) و برای اجرا به یک شاخه git تمیز و بدون تغییرات (non-diverged) نیاز دارد.
بنچمارکهای عملکرد و سرعت
در این سطح از کیفیت، سرعت قربانی اصلی است. بر اساس آخرین بنچمارکها روی یک لپتاپ M1 Max، توان عملیاتی ۰.۲۹۰۱ توکن بر ثانیه ثبت شده است که به معنای حدود ۳.۴۴۷ ثانیه برای تولید هر توکن است. این رقم نشاندهنده افزایش ۱.۹ درصدی توان عملیاتی نسبت به بهروزرسانی قبلی است.
بنچمارکهای تاریخی M1 یک منحنی بهینهسازی شدید را نشان میدهند:
- ۲۷ جولای ۲۰۲۶: ۰.۰۱۴۱ توکن بر ثانیه
- ۲۸ جولای ۲۰۲۶: ۰.۱۳۱۱ توکن بر ثانیه (۸۲۹.۸٪ افزایش توان عملیاتی)
- ۳۰ جولای ۲۰۲۶: ۰.۲۶۶۰ توکن بر ثانیه (۱۰۲.۹٪ افزایش توان عملیاتی)
- ۲ اوت ۲۰۲۶: ۰.۲۸۴۷ توکن بر ثانیه (۷.۰٪ افزایش توان عملیاتی)
بهینهسازی سرعت از طریق گمانهزنی
برای کاهش اثر سرعت پایین خام، Deltafin از مدلهای پیشنویس (Draft Models) استفاده میکند تا توکنها را پیش از مدل اصلی حدس بزند. مدلهای پیشنویس کوچک توکن بعدی را حدس میزنند، اما K3 هر حدس را بررسی میکند؛ هیچ چیزی بدون تایید رسمی K3 به دست کاربر نمیرسد.
این سیستم Kimi-K3-DSpark اثر Inferact را یکپارچه میکند که ۶.۶۳۵ گیگابایت فضا روی دیسک و حدود ۴.۴۹ گیگابایت در زمان اجرا اشغال میکند. Deltafin با جلوگیری از ایجاد یک کپی تکراری از embeddingهای K3 در DSpark، این فرآیند را بهینه میکند. درخواستهای چت و سرور بهطور خودکار در صورت سودمند بودن از DSpark استفاده میکنند؛ اگر فضای کافی نداشته باشد یا اقتصاد اجرای زنده (Live Economics) نامناسب باشد، سیستم بهسادگی اجازه میدهد K3 بهتنهایی اجرا شود.
کاربران میتوانند با نصب یک افزونه اختیاری Qwen از طریق دستور ./target/release/deltafin setup-qwen سرعت تکمیل متن خام را بیشتر کنند. این کار ۴.۳۳۷ گیگابایت به فضای دیسک اضافه میکند. در یک تست اندازهگیری شده، تکمیل یک متن ۱۷ توکنی با فعال بودن Qwen، ۲.۷ برابر سریعتر اجرا شد، در حالی که شناسههای خروجی (Output IDs) دقیقاً با K3 مستقل یکسان بود. این قابلیت بهویژه برای تکمیل خودکار کد (Code Autocomplete) و ترافیک /v1/completions مفید است.
استقرار و یکپارچهسازی
Deltafin یک سرور سازگار با OpenAI ارائه میدهد که مسیرهای /v1/chat/completions ، /v1/completions و /v1/models را پیادهسازی میکند. این سرور برای تولید یک پاسخ در هر لحظه طراحی شده و از رمزگشایی حریصانه (Greedy Decoding) برای تضمین بازتولیدپذیری نتایج استفاده میکند. این سیستم از پنجره متنی تا یک میلیون توکن را پشتیبانی میکند، هرچند به کاربران توصیه میشود بهدلیل سرعت پایین تولید، زمان انتظار (Timeout) کلاینت را افزایش دهند.
مشخصات کلیدی سرور عبارتند از:
- محدودیت درخواستها: حجم JSON درخواست توسط
--max-request-bytesمحدود میشود که بهطور پیشفرض ۱۲۸ مگابایت است. - بهرهوری: چتهای در حال رشد از بازاستفاده دقیق از وضعیت گفتگو (Conversation-state reuse)، افزایش سرعت DSpark تایید شده توسط پیشنویس و یک یادداشت پاسخ دقیق (Exact-response memo) بهره میبرند.
- سختگیری: سرور هر فیلد API را که نتواند دقیقاً اجرا کند رد میکند و بهجای نادیده گرفتن بیصدا، یک خطای استاندارد با فرمت OpenAI برمیگرداند.
- استفاده از CLI: کاربران میتوانند چت را از طریق
--chat(که قالب چت بازرسی شده K3 را اعمال میکند) یا ادامه متن خام را از طریق--promptبا محدودیت--max-newاجرا کنند. افزودن پرچم--statsبهجای استریم استاندارد، توان عملیاتی تجمعی و آمار تراکنشهای بومی را ارائه میدهد.
پروژه همچنین شامل مجموعهای از بررسیهای سلامت (Health Checks) است؛ حسابرسهایی فقط-خواندنی و بدون نیاز به شبکه که پس از نصب یا ارتقا، زمان اجرا و اجزا را تایید میکنند.
فلسفه مسیر سخت
Deltafin نه به عنوان یک محصول، بلکه به عنوان آزمایشی در مرزهای سختافزار مصرفکننده تعریف شده است. توسعهدهندگان استدلال میکنند که کاربردی کردن مدلهای پیشرو روی یک سیستم خانگی ۱۵ هزار دلاری، بهجای زیرساختی ۲ میلیون دلاری، گامی حیاتی برای سفر هوش مصنوعی خود-میزبان (Self-hosted) است. آنها صراحتاً رویکرد «حداقل محصول پذیرفتنی» (MVP) را که مورد علاقه سرمایهگذاران خطرپذیر است رد کرده و در عوض استراتژی اندازهگیری «اول-درستبودن» (Correctness-first) را برگزیدند.
این رویکرد این فرض صنعت را به چالش میکشد که مدلهای عظیم MoE (ترکیب خبرهها) برای همیشه پشت دیوارهای API قفل شدهاند. با اثبات اینکه یک مدل ۲.۸ تریلیونی میتواند — هرچند کند — روی یک لپتاپ عمل کند، Deltafin نقشهای برای آینده هوش مصنوعی پیشرو با اولویت محلی ارائه میدهد. ماموریت پروژه با نقلقولی تغییر یافته از JFK خلاصه شده است: «ما اجرای کامل مدل ۲.۸ تریلیون پارامتری را بهصورت محلی انتخاب میکنیم... نه چون آسان است، بلکه چون سخت است.»
اعتبار و منشأ
Deltafin یک پروژه مستقل است و هیچ وابستگی به Moonshot AI ندارد. این پروژه بر چندین مشارکت کلیدی تکیه دارد:
- Moonshot AI: وزنها، معماری و معناشناسی مدل K3 را فراهم کرد.
- Inferact: چکپوینت تغییرنیافته DSpark مخصوص K3 را منتشر کرد.
- تحقیقات جامعه: تحقیقات یکپارچهسازی و حافظه پنهان از تیم vLLM، مستندات چارچوب آموزشی از TorchSpec و پیشینههای فنی از llama.cpp/ggml، PyTorch و tiktoken.
- مشارکتکنندگان فردی: موریس براون (trumb) یافتههای مربوط به لینوکس، aarch64، x86 SIMD و اندازهگیریهای NVIDIA DGX Spark را در Pull Request شماره ۲ ارائه کرد. ایدههای استریم MoE و پیشبینی مسیریاب (Router-lookahead) از colibri گرفته شده و ds4/DwarfStar هنر استریم خبرهها، مالکیت حافظه پنهان و اندازهگیری اول-درستبودن را فراهم کردند.
برای کاربر نهایی، این به معنای توانایی اجرای یک مدل در سطح جهانی بدون هیچگونه سانسور یا نشت داده است، به شرطی که صبر لازم برای چند ثانیه برای هر توکن را داشته باشند. این ابزار لپتاپ را از یک ترمینال ساده به یک ایستگاه تحقیقاتی با وفاداری بالا تبدیل میکند.
باید منتظر ماند و دید که چگونه تکنیکهای استریم SSD ممکن است در اجراکنندههای محلی رایجتر مانند llama.cpp ادغام شوند تا سایر مدلهای تریلیون-پارامتری را به دسکتاپ بیاورند.




گفتگو