پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Kimi K3 با ۲.۸ تریلیون پارامتر مرز وزن‌های باز را جابه‌جا کرد

·۲۶ تیر ۱۴۰۵۴ دقیقه مطالعه۲ بازدید
مدل کیمی K3: معماری MoE باز با ۲.۸ تریلیون پارامتر، توجه دلتا و پنجره زمانی یک میلیون توکن
مدل کیمی K3: معماری MoE باز با ۲.۸ تریلیون پارامتر، توجه دلتا و پنجره زمانی یک میلیون توکن
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نخستین مدل با وزن‌های باز در کلاس ۳ تریلیون پارامتر با پنجرهٔ زمینه ۱ میلیون توکنی؛ معرفی مکانیزم KDA برای افزایش ۶.۳ برابری سرعت رمزگشایی در متون طولانی.

۲.۸ تریلیون پارامتر؛ این است عدد جدیدی که استانداردهای مدل‌های با وزن‌های باز را تغییر می‌دهد. شرکت Moonshot AI با عرضهٔ Kimi K3، مقیاسی را به دنیای متن‌باز آورد که پیش از این تنها در انحصار غول‌های مدل‌های بسته بود. این مدل از معماری پراکندهٔ ترکیب خبره‌ها (Mixture-of-Experts یا MoE) بهره می‌برد و به‌طور خاص برای کارهای پیچیدهٔ دانشی و کدنویسی‌های طولانی‌مدت طراحی شده است تا چالش‌های مقیاسی را که پیش‌تر مختص مدل‌های تجاری بود، به چالش بکشد. طبق اعلام Moonshot، مدل K3 اولین مدل باز در کلاس ۳ تریلیون پارامتر در جهان است و این شرکت اشاره می‌کند که در ۹ ماه از ۱۲ ماه گذشته، مدل‌های خانوادهٔ Kimi همواره سقف اندازهٔ مدل‌های باز را جابه‌جا کرده‌اند.

اما مقیاس به‌تنهایی گره‌گشای مشکل «زمینهٔ طولانی» نیست؛ نبرد واقعی بر سر بهره‌وری است. در دورانی که پنجرهٔ زمینه (Context Window) در حال گسترش است، توانایی بازیابی اطلاعات بدون هزینه‌های تصاعدی تعیین می‌کند که یک مدل برای مخازن دادهٔ سازمانی در مقیاس بزرگ کاربردی باشد یا صرفاً یک ویترین تکنولوژیک و نوظهور. این رقابت برای گسترش پنجره‌های متنی در مدل‌های باز، پیش‌تر توسط شرکت MiniMax نیز دنبال می‌شد که مدل M3 را با پنجره متنی یک میلیون توکنی عرضه کرد تا استانداردهای پردازش متون طولانی را ارتقا دهد. هدف Moonshot AI این است که از طریق دو تغییر ساختاری مشخص، این شکاف بهره‌وری را پر کند.

جزئیات معماری

بر اساس گزارش فنی منتشرشده در وبلاگ Kimi، مدل K3 از مکانیزم Kimi Delta Attention (KDA) استفاده می‌کند. این یک سازوکار توجه خطی ترکیبی است که سرعت رمزگشایی (Decoding) را در بسترهای یک میلیون توکنی تا ۶.۳ برابر افزایش می‌دهد. در کنار آن، سیستم Attention Residuals (AttnRes) روی محور عمق مدل عمل می‌کند. این سیستم به‌جای انباشت یکنواخت نمایش‌ها، آن‌ها را به‌صورت گزینشی بازیابی می‌کند که طبق گزارش شرکت، بهره‌وری آموزش را با افزایشی کمتر از ۲٪ در هزینه، حدود ۲۵٪ بهبود بخشیده است.

این تغییرات ساختاری، در ترکیب با دستورالعمل‌های اصلاح‌شدهٔ داده و آموزش، منجر به افزایش ۲.۵ برابری بهره‌وری کلی در مقیاس‌بندی نسبت به Kimi K2 شده است. با این حال، تیم توسعه‌دهنده شفاف اعلام کرده که عملکرد کلی K3 همچنان از قدرتمندترین مدل‌های تجاری و انحصاری، به‌ویژه Claude Fable 5 و GPT 5.6 Sol عقب‌تر است.

مدل باز ۲.۸ تریلیون پارامتری Kimi K3 با معماری MoE و توجه دلتا و پنجره یک میلیون توکن

مشخصات فنی

  • مقیاس مدل: ۲.۸ تریلیون پارامتر. این مدل از Stable LatentMoE استفاده می‌کند که در هر لحظه تنها ۱۶ خبره از مجموع ۸۹۶ خبره را فعال می‌کند.
  • پنجرهٔ زمینه: ۱ میلیون توکن با قابلیت‌های بینایی بومی (Native Vision) برای پردازش هم‌زمان متن، تصویر و ویدیو.
  • مسیریابی و بهینه‌سازی: استفاده از Quantile Balancing برای تخصیص خبره‌ها که امتیازات مسیریاب را بر اساس چندک‌ها (Quantiles) استخراج می‌کند. این روش باعث حذف به‌روزرسانی‌های اکتشافی (Heuristic) و وابستگی به ابرپارامترهای حساس می‌شود. همچنین از Per-Head Muon برای بهینه‌سازی مستقل سرهای توجه استفاده شده است.
  • کنترل فعال‌ساز: به‌کارگیری Sigmoid Tanh Unit (SiTU) و Gated MLA برای بهبود کنترل فعال‌سازها و افزایش گزینش‌پذیری در مکانیزم توجه.
  • سخت‌افزار هدف: شرکت Moonshot پیکربندی‌های Supernode با ۶۴ شتاب‌دهنده یا بیشتر را توصیه می‌کند.
  • کوانتیزاسیون: اعمال آموزش آگاه از کوانتش (Quantization-Aware Training) از مرحلهٔ SFT به بعد، با استفاده از وزن‌های MXFP4 و فعال‌سازهای MXFP8.

محک‌های عملکرد

در تمامی تست‌های K3، میزان تلاش استدلالی (Reasoning Effort) روی حالت حداکثر (Max) تنظیم شده است. K3 در چندین دستهٔ با پیچیدگی بالا پیشتاز است:

  • Program Bench: امتیاز ۷۷.۸ (در برابر ۷۶.۸ برای Fable 5 و ۷۷.۶ برای GPT 5.6 Sol).
  • BrowseComp: امتیاز ۹۱.۲ (لازم به ذکر است که بدون فشرده‌سازی زمینه در ۳۰۰ هزار توکن، این امتیاز ۹۰.۴ است).
  • OmniDocBench: امتیاز ۹۱.۱.
  • SWE Marathon: امتیاز ۴۲.۰ (برتر از Fable 5 که امتیاز ۳۵.۰ کسب کرد).
  • Automation Bench: امتیاز ۳۰.۸.

با این حال، K3 در برخی وظایف خاص استدلالی و مهندسی نرم‌افزار از مدل‌های پیشرو تجاری عقب است. برای مثال، در FrontierSWE امتیاز ۸۱.۲ در برابر ۸۶.۶ برای Fable 5، و در HLE-Full امتیاز ۴۳.۵ در برابر ۵۳.۳ برای Fable 5 کسب کرده است. همچنین در DeepSWE با امتیاز ۶۷.۵ از GPT 5.6 Sol با امتیاز ۷۳.۰ شکست می‌خورد.

کاربردهای عملی

  • مهندسی در مقیاس مخزن (Repo-scale): استفاده در Kimi Code برای جلسات طولانی کدنویسی با کمترین نظارت انسانی.
  • چرخه بینایی (Vision-in-the-loop): امکان تکرار و اصلاح بین کد و اسکرین‌شات‌های زنده با استفاده از شناسه‌های فایل مانند ms://<file-id>.
  • بازتولید پژوهشی: توانایی پردازش بیش از ۲۰ مقاله و ۳۰۰۰ خط کد پایتون به‌صورت هم‌زمان از طریق پنجرهٔ یک میلیون توکنی و قابلیت Auto-caching.
  • پژوهش عمیق: انجام یک مطالعهٔ ۴۲ ساله روی ASIC که شامل بیش از ۲.۸ هزار فراخوانی داده و بررسی ۱۱ هزار صفحه سند از طریق Kimi Work و Widgetها بود.

مدل متن‌باز ۲.۸ تریلیون پارامتری Kimi K3 با معماری MoE و پنجره زمانی یک میلیون توکن توسط Moonshot AI معرفی شد.

توسعه‌دهندگان می‌توانند از طریق Kimi.com، Kimi Work، Kimi Code و یک API سازگار با OpenAI-SDK به این مدل دسترسی داشته باشند. ساختار قیمت‌گذاری بر اساس «اصابت حافظه» (Cache Hit) تنظیم شده است؛ جایی که Moonshot گزارش می‌دهد در بارهای کاری کدنویسی، نرخ اصابت بیش از ۹۰٪ است. هزینه برای هر میلیون توکن در صورت اصابت ۰.۳۰ دلار، در صورت عدم اصابت ۳.۰۰ دلار و برای خروجی‌ها ۱۵.۰۰ دلار است. هنگام فراخوانی API، کاربران باید reasoning_effort را روی "max" قرار دهند و از پارامترهای تفکر K2.x استفاده نکنند؛ همچنین مقدار temperature، top_p و n ثابت هستند.

این عرضه نشان‌دهندهٔ چرخش اکوسیستم «وزن‌های باز» از بهینه‌سازی مدل‌های متراکم کوچک به سمت تسلط بر پراکندگی (Sparsity) عظیم است. با فعال کردن تنها بخشی کوچک از ۲.۸ تریلیون پارامتر، K3 ثابت کرد که مقیاس عظیم اگر مسیریابی آن بر اساس تخصیص چندک‌محور باشد و نه ابرپارامترهای حساس، از نظر محاسباتی شدنی و باداش است.

همچنین، انتقال به کوانتش MXFP4 و ارائه پیاده‌سازی KDA برای vLLM — که چالش‌های جدید KDA در زمینهٔ Prefix Caching را حل می‌کند — نشان می‌دهد که Moonshot اولویت خود را از بنچمارک‌های صرفاً آکادمیک به استقرار در محیط عملیاتی و تولیدی تغییر داده است. این اقدام، خط پایان «مدل‌های با وزن باز» را به اندازه- و جایگاهی منتقل کرد که بتواند واقعاً با پیشرفته‌ترین مدل‌های استدلالی تجاری رقابت کند.

چرا این موضوع مهم است؟

این مدل با تکیه بر تخصص Moonshot در مدیریت پنجره‌های متنی عظیم، دسترسی به مدل‌های تریلیونی را برای جامعهٔ متن‌باز ممکن کرد. این اتفاق اعتبار مدل‌های باز را در کارهای مهندسی سطح بالا افزایش می‌دهد.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم توسعه‌دهندگان ایرانی به مدل‌های Moonshot دشوار است؛ با این حال، انتشار وزن‌های باز این مدل فرصتی برای پژوهشگران داخلی در زمینهٔ مدل‌های MoE عظیم فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

تسلط بر پراکندگی (Sparsity) در مقیاس تریلیونی، پایان ادعای برتری مطلق مدل‌های بسته در زمینهٔ اندازه است. K3 ثابت می‌کند که با مسیریابی هوشمند، می‌توان مدل‌های عظیم را بدون نیاز به سخت‌افزارهای دست‌نیافتنی اجرا کرد. این رویکرد احتمالاً مسیر توسعهٔ مدل‌های باز بعدی را از «بزرگ‌تر کردن مدل» به «بهینه‌تر کردن فعال‌سازی پارامترها» تغییر می‌دهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.