پرش به محتوای اصلی
پرش به محتوای مقاله

موتور WASTE مدل ۲.۷۸ تریلیون پارامتری Kimi K3 را روی لپ‌تاپ‌های معمولی اجرا کرد

·۹ مرداد ۱۴۰۵۲۴ دقیقه مطالعه۲ بازدید
موتور استنتاج C بدون وابستگی برای اجرای مدل ۲.۷۸ تریلیون پارامتری Kimi K3 با پخش وزن‌های فعال از NVMe بدون محدودیت RAM
موتور استنتاج C بدون وابستگی برای اجرای مدل ۲.۷۸ تریلیون پارامتری Kimi K3 با پخش وزن‌های فعال از NVMe بدون محدودیت RAM
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از NVMe به‌عنوان گسترش مستقیم حافظه برای اجرای مدل‌های تریلیون-پارامتری روی سخت‌افزار مصرف‌کننده. برخلاف روش‌های معمول که مدل را فشرده می‌کنند، WASTE با استریم هوشمند وزن‌ها، کیفیت مدل اصلی را حفظ کرده و محدودیت رم را دور می‌زند.

تصور کنید مدل‌های هوش مصنوعی که پیش از این فقط در مراکز داده‌ی غول‌پیکر و سرورهای صنعتی جای می‌گرفتند، اکنون روی لپ‌تاپ شخصی شما اجرا شوند. با ظهور موتور جدید WASTE، دیوار حافظه که تا پیش از این مانعی عبورناپذیر برای اجرای مدل‌های تریلیون-پارامتری بود، فرو ریخته است.

طبق مستندات منتشر شده در گیت‌هاب در تاریخ ۳۱ جولای ۲۰۲۶، پروژه‌ی WASTE (موتور تنسور استریم آگاه به وزن یا Weight-Aware Streaming Tensor Engine) نشان داد که مدل عظیم Kimi K3 با ۲.۷۸ تریلیون پارامتر می‌تواند روی یک مک‌بوک پرو با ۶۴ گیگابایت رم اجرا شود و متن تولید کند، بدون اینکه با مشکل کمبود حافظه (Memory Wall) مواجه شود. این دستاورد در حالی رخ می‌دهد که مدل Kimi K3 پیش‌تر با مقیاس خیره‌کننده‌اش مرز مدل‌های وزن‌باز را جابه‌جا کرده بود و استانداردهای جدیدی را برای مدل‌های عظیم تعریف کرد. سال‌ها تصور می‌شد که مدل‌های در این مقیاس، لزوماً نیازمند سخت‌افزارهای سطح سرور با ترابایت‌ها رم DDR5 هستند. اکثر علاقه‌مندان به مدل‌های زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — محدود به مدل‌هایی با کمتر از ۱۰۰ میلیارد پارامتر یا نسخه‌هایی بودند که به شدت فشرده شده بودند تا در رم جای بگیرند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی مدل‌های بازمتن اشاره کردیم، بهینه‌سازی حافظه همواره گلوگاه اصلی بوده است. WASTE این فرض قدیمی را با تبدیل حافظه‌ی NVMe به گسترشی از رم تغییر داد. این سیستم به جای بارگذاری کل مدل، تنها «خبره‌های» (Experts) مورد نیاز برای تولید هر توکن (Token) — تکه‌های کوچکی از متن شبیه برش‌های یک کیک که مدل تکه‌تکه می‌خورد — را از دیسک استریم می‌کند. این رویکرد مهندسی، در واقع مکمل موفقیت‌های معماری این مدل است که به عنوان اولین مدل وزن‌باز با ۲.۸ تریلیون پارامتر توانست سدهای سخت‌افزاری را به چالش بکشد.

مکانیسم استریم از NVMe

پروژه‌ی WASTE یک موتور استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند، شبیه خودِ آشپزی و نه دوره‌ی آموزش آشپز — است که به زبان C نوشته شده است. این موتور به گونه‌ای طراحی شده که هیچ وابستگی به کتابخانه‌های زمان اجرای شخص ثالث (third-party runtime dependencies) ندارد. در واقع، WASTE در هنگام اجرا از پایتون (Python)، کودا (CUDA) یا کتابخانه‌های BLAS استفاده نمی‌کند. بر اساس مستندات این پروژه، موتور مذکور «تنه» (Trunk) مدل را در رم نگه می‌دارد و وزن‌های فعال را مستقیماً از دیسک فراخوانی می‌کند.

از آنجا که Kimi K3 یک مدل ترکیب خبره‌ها (Mixture of Experts یا MoE) است، در هر لحظه تنها حدود ۴٪ از وزن‌های آن برای پردازش یک توکن فعال هستند. WASTE از این ویژگی بهره می‌برد و خبره‌ها را در چیدمان خاصی ذخیره می‌کند تا هر خبره دقیقاً با یک بار خواندن از دیسک فراخوانی شود. برای جلوگیری از اینکه سیستم‌عامل به‌دلیل حجم عظیم ۹۸۲ گیگابایتی مدل دچار اختلال شود یا حافظه کش سیستم را اشغال کند، این موتور با استفاده از دستورات F_NOCACHE در macOS و O_DIRECT در لینوکس، حافظه‌ی موقت (Page Cache) سیستم‌عامل را دور می‌زند.

محدودیت‌های سخت‌افزاری و عملکرد

در آزمایش‌های انجام شده روی یک مک‌بوک پرو ۶۴ گیگابایتی با حافظه SSD NVMe داخلی، WASTE به سرعت رمزگشایی ۰.۴۹ تا ۰.۵۴ توکن در ثانیه دست یافت. اگرچه این سرعت برای چت‌های سریع پایین است، اما یک «اثبات مفهوم» (Proof of Concept) کاربردی برای مدلی است که در حالت عادی به یک خوشه‌ی سروری عظیم نیاز دارد.

جزئیات فنی عملکرد به شرح زیر است:

  • اندازه مدل: مدل Kimi K3 در حالت منتشر شده اولیه ۱.۴۲ ترابایت است و پس از تبدیل به فرمت بهینه‌شده‌ی WASTE، حجم آن به ۹۸۲ گیگابایت می‌رسد.
  • حداقل رم: برای باز کردن K3 با پنجره متنی (Context Window) — میزان متنی که مدل هم‌زمان در ذهن نگه می‌دارد، شبیه میز کاری که فقط چند ورق جا دارد — ۴ هزار توکنی، حداقل ۲۹.۰۵ گیگابایت رم به صورت مطلق نیاز است.
  • پنجره کش: بیشترین توان عملیاتی در بودجه ۴۶ گیگابایتی (شامل یک کش خبره ۱۷.۵۶ گیگابایتی) رخ می‌دهد. اگر مصرف رم از ۵۲ گیگابایت فراتر رود، سیستم‌عامل شروع به Paging می‌کند و سرعت از ۰.۳۲ به ۰.۰۴ توکن در ثانیه سقوط می‌کند.
  • سرعت ذخیره‌سازی: استفاده از NVMe داخلی اجباری است. استفاده از محفظه‌های USB سرعت را از ۱۲.۷۸ گیگابایت بر ثانیه به ۰.۹۴ می‌رساند و باعث می‌شود تولید هر یک توکن حدود ۱۳ ثانیه زمان ببرد.

بهینه‌سازی حافظه و کوانتش

برای جای‌گیری چنین مدل غول‌پیکری در سخت‌افزار محلی، WASTE از کوانتش (Quantization) برداری باقی‌مانده (RVQ) استفاده می‌کند. در این روش، خبره‌ها با دقت ۳.۰۰ بیت در هر وزن و در سه مرحله از کتاب‌های کد (Codebooks) با ۲۵۶ ورودی ذخیره شده‌اند. یک نکته مهندسی مهم این است که موتور WASTE هرگز ماتریس‌ها را به طور کامل بازسازی (Materialize) نمی‌کند؛ در عوض، از خواندن جداول و عملیات جمع برای محاسبه ضرب‌های نقطه‌ای استفاده می‌کند.

کارایی حافظه با استفاده از یک KV Cache جذب‌شده (Absorbed) بیشتر تقویت شده است. WASTE با بهره‌گیری از ترکیبی از Kimi Delta Attention و توجه نهانی چندسره گیت‌دار (Gated Multi-head Latent Attention)، نیاز به حافظه KV Cache را در بستر ۴ هزار توکنی از ۱۱.۲۵ گیگابایت به تنها ۰.۲۱ گیگابایت کاهش داد. این بهینه‌سازی اجازه می‌دهد تا پنجره‌های متنی طولانی‌تر بدون مصرفset شدید رم پشتیبانی شوند.

قابلیت‌های چندوجهی

این موتور از ماهیت چندوجهی (Multimodal) — مدلی که هم‌زمان متن، عکس و صدا را می‌فهمد، شبیه ما که با چند حس دنیا را می‌خوانیم — مدل K3 نیز پشتیبانی می‌کند. این شامل پشتیبانی از Vision Transformer (ViT) با ۴۰۱ میلیون پارامتر است. موتور WASTE می‌تواند تصاویر را با تبدیل شبکه پیکسلی به Embeddingهایی که سپس به عنوان توکن‌های متنی پردازش می‌شوند، تحلیل کند.

در یک مورد آزمایشی، یک تصویر با ابعاد ۴۴۸x۳۳۶ به ۱۹۲ توکن تبدیل شد. برج بینایی (Vision Tower) ۱۵.۷ ثانیه زمان برد تا تصویر را کدگذاری کند و پس از آن، تولید توصیف تصویر با سرعت ۰.۳۳ توکن در ثانیه، مجموعاً ۲۳۴.۲۵ ثانیه به طول انجامید. این نتایج ثابت می‌کند که درک بصری پیچیده و با رزولوشن بالا به صورت محلی ممکن است، به شرطی که کاربر برای سرعت پایین تولید توکن صبر داشته باشد.

تحلیل تبادلات مهندسی

توسعه‌دهندگان WASTE تمرکز خود را بیش از آنکه روی محاسبات ریاضی بگذارند، روی عملیات ورودی/خروجی (I/O) متمرکز کردند. به نقل از گزارش EFFICIENCY.md این پروژه، ورودی/خروجی خبره‌ها ۵۳.۵٪ از زمان هر گام رمزگشایی را به خود اختصاص می‌دهد، در حالی که ضرب ماتریسی (matmul) واقعی تنها ۲۰٪ از زمان را می‌گیرد. این یعنی گلوگاه اصلی سرعت، پهنای باند دیسک است، نه قدرت خام پردازنده.

نکته جالب این است که توسعه‌دهندگان دریافتند انتقال محاسبات به GPU از طریق Metal، حدود ۲۲٪ کندتر از مسیر CPU بود. دلیل این اتفاق آن است که موتور WASTE صدها عملیات ضرب ماتریس-بردار (matvec) کوچک و وابسته را برای هر توکن صادر می‌کند؛ این نوع حجم کاری برای شتاب‌دهنده‌های گرافیکی ناکارآمد است اما با پروفایل پهنای باند حافظه‌ی CPU سازگاری بیشتری دارد.

تغییر منحنی امکان‌پذیری AI

پروژه‌ی WASTE بحث «هوش مصنوعی محلی» را از بحث «امکان‌پذیری» به بحث «مهندسی» تغییر داد. با اثبات اجرای مدل ۲.۷۸ تریلیون پارامتری روی یک لپ‌تاپ، این پروژه نیاز به شبکه و پرداخت صورت‌حساب‌های به‌ازای هر توکن را برای دسترسی به هوش سطح پیشرو (Frontier-scale Intelligence) حذف کرد.

برای کاربر نهایی، این به معنای تغییر وضعیت از «نباید این داده‌ها را به API ارسال کنید» به «آن را همین‌جا اجرا کنید» است. هرچند سرعت ۰.۵ توکن در ثانیه برای یک دستیار چت تعاملی کاربردی نیست، اما برای پردازش‌های دسته‌ای آفلاین (Batch Processing)، وظایف استدلالی پیچیده یا بازرسی‌های امنیتی سطح بالا که در آن‌ها حاکمیت داده (Data Sovereignty) مهم‌تر از زمان است، کاملاً ایده‌آل است.

گام بعدی شما

  • برای تست اولیه و آشنایی با موتور، از مدل کوچک‌تر Kimi-Linear-48B استفاده کنید که تنها ۱.۸۷ گیگابایت رم می‌خواهد و با سرعت ۱۰.۷ توکن در ثانیه اجرا می‌شود.
  • به‌روزرسانی‌های مربوط به بک‌اند AVX-512 را دنبال کنید تا بهینه‌سازی‌های جدید برای پردازنده‌های x86 را دریافت کنید.
  • اگر حریم خصوصی داده‌های شما حیاتی است، این مدل را برای تحلیل اسناد محرمانه در حالت کاملاً آفلاین در نظر بگیرید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص در مدیریت حافظه، نیاز به اتصال اینترنتی و API برای مدل‌های تریلیون-پارامتری را حذف می‌کند. این تغییر، حاکمیت داده و امنیت را برای سازمان‌هایی که نمی‌توانند داده‌های حساس خود را به ابر بفرستند، تضمین می‌کند.

تأثیر برای ایران

به دلیل تحریم‌ها و محدودیت دسترسی به APIهای پیشرفته، اجرای محلی مدل‌های تریلیونی برای پژوهشگران و شرکت‌های ایرانی یک فرصت حیاتی برای داشتن هوش مصنوعی حاکمیتی بدون نیاز به زیرساخت‌های ابری خارجی است.

·نگاه ما
تحریریه دات‌هوش

پروژه‌ی WASTE با جابه‌جایی گلوگاه از RAM به NVMe، پارادایم استقرار مدل‌های بزرگ را تغییر می‌دهد. این رویکرد نشان می‌دهد که در آینده، به جای خرید سخت‌افزارهای گران‌قیمت با رم‌های عظیم، می‌توان با بهینه‌سازی لایه‌ی I/O و استفاده از ذخیره‌سازهای فوق‌سریع، مدل‌های عظیم را محلی کرد. عملاً مرز بین «سرور» و «کلاینت» در اجرای مدل‌های پیشرو در حال محو شدن است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.