پرش به محتوای اصلی
پرش به محتوای مقاله

اجرای مدل ۲.۸ تریلیون پارامتری Kimi K3 روی یک دستگاه مک‌بوک

·۷ مرداد ۱۴۰۵۱۴ دقیقه مطالعه۱ بازدید
اجرای Kimi K3، مدل ۲.۸ تریلیون پارامتری MoE، روی مک اپل سیلیکون با استریمینگ هوشمند و API سازگار با OpenAI.
اجرای Kimi K3، مدل ۲.۸ تریلیون پارامتری MoE، روی مک اپل سیلیکون با استریمینگ هوشمند و API سازگار با OpenAI.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نقل مکان گلوگاه از RAM به Disk I/O؛ برای نخستین بار یک مدل ۲.۸ تریلیون پارامتری را نه با افزایش رم، بلکه با استریم کردن هوشمندانه وزن‌ها روی سخت‌افزار مصرف‌کننده اجرا کردند.

۱۶ ثانیه برای تولید هر توکن؛ این سرعت فعلی یک مک‌بوک M1 Max با ۶۴ گیگابایت رم هنگام اجرای مدل ۲.۸ تریلیون پارامتری Kimi K3 است. طبق مستندات پروژه Deltafin که در ۲۸ ژوئیه ۲۰۲۶ منتشر شد، این دستاورد ثابت می‌کند که دیگر ظرفیت حافظه موقت (RAM)، مانع اصلی برای اجرای محلی بزرگ‌ترین مدل‌های جهان نیست و گلوگاه کاملاً به سرعت خواندن داده‌ها از دیسک و شبکه (I/O) منتقل شده است. این رویکرد یادآور تلاش‌های مشابه در پروژه Colibrì بود که اجرای مدل‌های غول‌پیکری مانند GLM-5.2 را با رم بسیار محدود ممکن ساخت.

این پروژه در حالی معرفی می‌شود که صنعت به سمت معماری‌های عظیم ترکیب خبره‌ها (Mixture-of-Experts یا MoE) حرکت می‌کند؛ سیستمی شبیه به شرکتی که به‌جای یک کارمند همه‌فن‌حریف، تیمی از متخصصان دارد و برای هر سؤال فقط فرد مربوطه را صدا می‌زند. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی افشاگری‌های Moonshot AI اشاره کردیم، مدل Kimi K3 از یک معماری NoPE برای رسیدن به تعداد ۲.۸ تریلیون پارامتر استفاده می‌کند. تمرکز Deltafin بر «چگونگی» اجرای محلی چنین غولی است. برای یک کاربر عادی، این وضعیت مثل این است که بخواهد تمام کتاب‌های یک کتابخانه را از طریق یک نی باریک بخواند؛ این کار ممکن است، اما سرعت آن کاملاً به این بستگی دارد که صفحات با چه سرعتی منتقل شوند.

معماری مقیاس‌بندی محلی

پروژه Deltafin با تقسیم مدل به دو بخش مجزا عمل می‌کند. بخش اول «ستون فقرات مقیم» (Resident Spine) است که شامل مکانیسم‌های توجه (Attention) و خبره‌های مشترک است. این بخش در حالت دقت bf16 حدود ۱۱۴ گیگابایت فضا می‌گیرد. برای جای دادن این حجم در یک سیستم ۶۴ گیگابایتی، Deltafin از کوانتش (Quantization) — یعنی کاهش دقت اعداد برای اشغال فضای کمتر، شبیه به تبدیل یک عکس باکیفیت به فرمت JPEG — استفاده کرده تا حجم ستون فقرات را به ۶۰ گیگابایت (در سطح int8) برساند و آن را در هر مرحله از تولید توکن، لایه به لایه از حافظه NVMe SSD بخواند.

از سوی دیگر، ۸۲,۴۳۲ خبرهٔ مسیریابی‌شده در مجموع تقریباً ۱.۴۵ ترابایت فضا می‌گیرند. چون یک مدل MoE در هر توکن تنها بخش بسیار کوچکی از وزن‌های خود را فعال می‌کند، Deltafin تنها ۱۶ خبرهٔ منتخب توسط مسیریاب (Router) را برای هر یک از ۹۲ لایه بارگذاری می‌کند. به نقل از توسعه‌دهندگان، این یعنی برای هر توکن تنها ۲۵.۸ گیگابایت داده از خبره‌ها خوانده می‌شود، نه کل ۱.۵۶ ترابایت وزن‌های مدل.

معیارهای اجرا و عملکرد

بر اساس گزارش مخزن گیت‌هاب این پروژه، دو حالت اصلی برای استقرار مدل وجود دارد:

  • نصب کامل (Full Install): این حالت به حدود ۱.۷ ترابایت فضای دیسک نیاز دارد. در این حالت، سرعت رمزگشایی (Decode) روی یک دستگاه M1 Max به حدود ۱۵ ثانیه برای هر توکن می‌رسد.
  • حالت استریم (Streaming Mode): این حالت تنها به ۲۱۵ گیگابایت فضای دیسک نیاز دارد. در اینجا، خبره‌ها به‌صورت On-demand و از طریق درخواست‌های HTTP range از Hugging Face فراخوانی می‌شوند. این روش برای داده‌های کش‌نشده، سرعت را به شدت کاهش داده و منجر به زمان بسیار کندِ بیش از ۳ دقیقه برای تولید هر توکن می‌شود.

برای بهینه‌سازی این فرآیند، تیم توسعه چندین تکنیک پیشرفته و با کارایی بالا را پیاده کرده است:

  • هسته Fused MXFP4: یک هسته سفارشی NEON که عملیات رمزگشایی (Dequantization) و ضرب ماتریس-بردار را در یک مرحله (One Pass) انجام می‌دهد و نتایج آن بیت‌به‌بیت با پیاده‌سازی مرجع مطابقت دارد. این بهینه‌سازی‌های سطح پایین، مشابه رویکرد فریم‌ورک Espresso است که با دسترسی مستقیم به ANE توانست سرعت استنتاج را در مک‌ها به‌طور چشم‌گیری افزایش دهد.
  • بارگذاری با بافر دوگانه (Double-Buffered Loading): یک رشته مجزا (Worker Thread) داده‌های ستون فقرات لایه بعدی را فراخوانی می‌کند، در حالی که GPU هنوز در حال محاسبه لایه‌ی فعلی است.
  • گمانه‌زنی N-gram: این سیستم از تطبیق پسوندهای بدون تلفات (Lossless Suffix Matching) برای پیش‌بینی توکن‌های بعدی استفاده می‌کند. وقتی یک پیش‌نویس پذیرفته شود، سیستم دو توکن را با هزینه یک بار اجرای مدل (Forward Pass) تولید می‌کند.
  • خواندن موازی خبره‌ها: با استفاده از دستور pread به همراه پرچم F_NOCACHE در سطح سیستم‌عامل، سرعت خواندن به ۶.۸۵ گیگابایت بر ثانیه رسید، در حالی که تکیه بر Page Fault‌های استاندارد تنها ۰.۸۷ گیگابایت بر ثانیه سرعت داشت.

محدودیت‌های سخت‌افزاری و مقیاس‌پذیری

در مک M1 Max پایه (با ۶۴ گیگابایت رم)، سیستم حدود ۵ ثانیه از زمان تولید هر توکن را صرف انتظار برای خواندن ستون فقرات از SSD می‌کند. توسعه‌دهندگان اشاره کرده‌اند که تراشه‌های جدیدتر اپل سیلیکون (مانند M3/M4 Max یا Ultra) به‌دلیل پهنای باند حافظه بالاتر و ذخیره‌سازهای NVMe سریع‌تر، عملکرد به‌مراتب بهتری خواهند داشت.

نکته کلیدی این است که ظرفیت رم بازی را کاملاً تغییر می‌دهد. در یک دستگاه ۱۲۸ گیگابایتی، ستون فقرات ۵۳ گیگابایتی می‌تواند به‌طور کامل در Page Cache قرار بگیرد و این امر به‌طور موثری نیمی از تأخیر فعلی هر توکن را از بین می‌برد. Deltafin به‌صورت خودکار و بدون نیاز به تنظیمات کاربر، با افزایش رم در دسترس، بخش‌های بیشتری از مدل را در حافظه پین می‌کند.

یکپارچگی و کاربرد

با وجود ماهیت پژوهشی، Deltafin یک سرور API سازگار با OpenAI ارائه می‌دهد. این یعنی می‌توان آن را به رابط‌های چت موجود و ایجنت‌های کدنویسی متصل کرد، به شرطی که کاربر زمان انتظار (Timeout) درخواست‌ها را به‌جای ثانیه، روی ساعت تنظیم کند. این سیستم صرفاً در حالت «حریصانه» (Greedy) عمل می‌کند؛ به این معنا که تنظیماتی مانند Temperature و top_p را نادیده می‌گیرد و در هر لحظه تنها یک درخواست را پردازش می‌کند. این حرکت به سمتی است که پروژه‌هایی نظیر Nativ نیز دنبال می‌کنند تا با انتقال پردازش به سیستم، نیاز به اشتراک‌های ابری را حذف کنند.

موازنه‌های فنی

تیم توسعه بهینه‌سازی‌های متعددی را آزمایش کرد که در نهایت شکست خوردند. تقریب‌های کم‌رتبه (Low-rank approximations) برای خبره‌ها کنار گذاشته شد، زیرا خبره‌های K3 به‌صورت متراکم (Dense) آموزش دیده‌اند و تقریب‌های Rank-128 تنها ۱۳٪ از انرژی مدل را بازتاب می‌دادند. همچنین متوجه شدند که پروتکل HTTP/1.1 با قابلیت keep-alive برای دریافت خبره‌ها سریع‌تر از HTTP/2 است. علاوه بر این، فشرده‌سازی‌های استاندارد فایل (مانند zstd یا lz4) به‌دلیل آنتروپی بالای داده‌های MXFP4 هیچ سودی در سرعت انتقال نداشتند.

این پروژه بحث را از «آیا مدل در رم جا می‌شود؟» به «چقدر بهینه می‌توانیم وزن‌ها را استریم کنیم؟» تغییر می‌دهد. این نتیجه می‌گیرد که آینده مدل‌های زبانی محلی احتمالاً بر مسیرهای I/O فوق‌بهینه و هسته‌های سفارشی در سطح سخت‌افزار متکی خواهد بود، نه فقط افزودن رم بیشتر. برای توسعه‌دهندگان، مک حالا از یک کلاینت ساده به یک بستر آزمایشی (هرچند کند) برای منطق‌های تریلیون-پارامتری تبدیل شده است.

گام بعدی شما

  • اگر مک‌بوک با رم بالا دارید، خروجی K3_PROFILE=1 را بررسی کنید تا ببینید آیا هزینه خواندن ستون فقرات کاملاً حذف شده است یا خیر؛ این کار می‌تواند اولین تجربه «تعاملی» با یک مدل ۲.۸ تریلیونی را ممکن کند.
  • سرعت SSD خود را با ابزارهای بنچمارک بسنجید تا تخمین بزنید تأخیر هر توکن در سیستم شما چقدر خواهد بود.
  • داکیومنت‌های Hugging Face را برای نحوه مدیریت درخواست‌های HTTP Range مطالعه کنید تا درک بهتری از حالت استریم داشته باشید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پروژه با تکیه بر تخصص در مدیریت حافظه، اثبات کرد که سخت‌افزارهای مصرف‌کننده می‌توانند مدل‌هایی با مقیاس دیتاسنتر را اجرا کنند. این موضوع اعتبار ادعای «دمکراتیزه کردن دسترسی به مدل‌های غول‌پیکر» را افزایش می‌دهد.

تأثیر برای ایران

به‌دلیل دسترسی آزاد به وزن‌های مدل‌های باز و عدم نیاز به APIهای ابری، این متد برای پژوهشگران ایرانی که با محدودیت بودجه خرید GPUهای صنعتی مواجه‌اند، یک راهکار جایگزین برای تست مدل‌های عظیم است.

·نگاه ما
تحریریه دات‌هوش

تمرکز روی I/O به‌جای ظرفیت رم، پارادایم جدیدی در اجرای محلی مدل‌های عظیم است. این رویکرد نشان می‌دهد که دسترسی به مدل‌های تریلیون-پارامتری دیگر وابسته به خرید سخت‌افزارهای فوق‌گران‌قیمت نیست، بلکه به بهینه‌سازی مسیر انتقال داده وابسته است. در واقع، ما در حال حرکت از عصر «ذخیره‌سازی در حافظه» به عصر «جریان داده‌های هوشمند» هستیم.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.