اگر امروز برای استفاده از مدلهای کدنویسی پیشرفته به APIهای گرانقیمت متکی هستید، ظهور یک غول ۲.۸ تریلیونی با وزنهای باز، قواعد بازی را تغییر میدهد. Moonshot AI در ۲۷ ژوئیه ۲۰۲۶ مدل Kimi K3 را منتشر کرد و عملاً سقف تواناییهای هوش مصنوعی باز را بازتعریف کرد. تا اوت ۲۰۲۶، این مدل به عنوان بزرگترین مدل با وزنهای باز (Open-weight) منتشر شده در تاریخ شناخته میشود. این دستاورد در راستای تغییر استراتژی رقابتی چین در برابر مدلهای آمریکایی است که بر روی «قدرت خالص» و مقیاسپذیری متمرکز شده است.
این مدل در حالی معرفی میشود که صنعت از رابطهای سادهی چت به سمت جریانهای کاری عاملمحور (Agentic) — شبیه به داشتن کارمندانی دیجیتال که میتوانند بهطور مستقل مراحل یک پروژه را پیش ببرند — حرکت میکند. در حالی که مدلهای باز پیشین با مدیریت زمینههای متنی بسیار حجیم یا چندوجهی بودن بومی (Native Multimodality) دست و پنجه نرم میکردند، Kimi K3 مستقیماً شکاف موجود در مدلهای «پیشرو» (Frontier) را هدف قرار داده است. این مدل بهگونهای طراحی شده تا پژوهشهای بلندمدت و وظایف کدنویسی حرفهای را که معمولاً نیازمند غولهای بسته-منبع بودند، مدیریت کند. Kimi K3 در واقع جایگزین Kimi K2.7 Code شده و برای نخستین بار قابلیت پردازش بومی متن، تصویر و ویدیو را به ارمغان آورده است.
همانطور که در تحلیلهای پیشین ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، دسترسی به وزنهای مدل، کنترل کامل بر دادهها را ممکن میکند؛ اما در Kimi K3، این کنترل با مقیاسی بیسابقه همراه شده است. این مدل با جابهجا کردن مرزهای وزنهای باز و ارائه پنجره متنی ۱ میلیون توکنی، استانداردهای جدیدی را برای مدلهای Open-weight تعریف کرده است.
معماری فنی و مشخصات
به نقل از گزارش فنی منتشر شده در arXiv، مدل Kimi K3 از معماری ترکیب خبرهها (Mixture-of-Experts یا MoE) — شبیه به یک تیم متخصص که در هر لحظه فقط افراد لازم برای حل یک مسئله خاص فراخوانده میشوند — استفاده میکند. این مدل برای رقابت با مدلهایی چون GLM-5.2 و Kimi K2.7 Code طراحی شده است که معمولاً بین ۷۰۰ میلیارد تا کمی بیش از ۱ تریلیون پارامتر دارند.
- تعداد کل پارامترها: ۲.۸ تریلیون
- پارامترهای فعال: ۱۰۴ میلیارد برای هر توکن
- معماری: Mixture-of-Experts (MoE)، بهطور مشخص Stable LatentMoE
- تعداد خبرهها: ۸۹۶ خبره در مجموع، که از این میان ۱۶ خبره برای هر توکن انتخاب میشوند و ۲ خبره مشترک (Shared Experts) وجود دارد.
- تعداد لایهها: ۹۳ لایه در مجموع (شامل ۶۹ لایه KDA، ۲۴ لایه Gated MLA و ۱ لایه متراکم یا Dense).
- پنجره متنی (Context Window) — میزان متنی که مدل همزمان در ذهن نگه میدارد، شبیه به میز کاری که جا برای چند ورق دارد — برابر با ۱,۰۴۸,۵۷۶ توکن است؛ این مقدار دقیقاً چهار برابر پنجره متنی ۲۶۲,۱۴۴ توکنی در مدل Kimi K2.7 Code است.
- چندوجهی (Multimodal) — مدلی که همزمان متن، عکس و صدا را میفهمد — با استفاده از رمزگذار بینایی moonViT-V2 با ۴۰۱ میلیون پارامتر پیادهسازی شده است.
- کوانتیزاسیون (Quantization) — فرآیند فشردهسازی مدل برای اشغال فضای کمتر — برای وزنهای خبرهها از MXFP4 و برای فعالسازها از MXFP8 استفاده شده است. این مدل از مرحله SFT (تنظیم دقیق نظارت شده) به بعد، بهصورت «آگاه از کوانتیزاسیون» (Quantization-aware) آموزش دیده است، هرچند اجزای غیرخبره در دقت بالاتری باقی ماندهاند.
- مجوز: تحت مجوز اختصاصی Kimi K3 منتشر شده است که با مجوزهای سادهای مانند MIT تفاوت دارد.
شرکت Moonshot AI بر اساس مستندات خود، افزایش ۲.۵ برابری کارایی کلی مقیاسپذیری نسبت به Kimi K2 را مدیون سه نوآوری خاص میداند: Kimi Delta Attention, Attention Residuals و Stable LatentMoE.
جزئیات پیادهسازی و استقرار
انتشار Kimi K3 در دو مرحله رخ داد. ابتدا در ۱۶ ژوئیه ۲۰۲۶ دسترسی API باز شد تا توسعهدهندگان اولیه بتوانند قابلیتهای مدل را پیش از انتشار کامل وزنها در ۲۷ ژوئیه بسنجند. این استراتژی تضمین کرد که زیرساختهای ارائهدهندگان API پیش از هجوم حجم عظیم ۲.۸ تریلیون پارامتر به Hugging Face، به ثبات برسند. در ادامه، انتشار رسمی وزنهای مدل صورت گرفت تا امکان میزبانی شخصی برای سازمانهای دارای زیرساخت فراهم شود.
قابلیت چندوجهی بومی در این مدل یک جهش بزرگ است. با ادغام رمزگذار بینایی moonViT-V2، مدل K3 تصاویر را صرفاً توصیف نمیکند، بلکه آنها را بهعنوان ورودیهای بومی در کنار متن و ویدیو پردازش میکند. این ویژگی باعث میشود رفتار عاملهای هوش مصنوعی در محیطهای بصری، مانند اتوماسیون مرورگر یا تحلیل اسناد پیچیده، بسیار روانتر و یکپارچهتر شود.

محکهای کدنویسی و عاملمحور
طبق گزارش وبلاگ فنی Moonshot AI، مدل Kimi K3 در رقابت مستقیم با Claude Fable 5 و GPT-5.6 Sol قرار دارد. هر معیاری که در وبلاگ فنی Moonshot ذکر شده نشان میدهد K3 با این مدلهای بسته و پیشرو برابری میکند، هرچند برخی اعداد در گزارش فنی اصلاحشدهی arXiv کمی تغییر کردهاند.
عملکرد در کدنویسی:
- Program Bench: کسب امتیاز ۷۷.۸ و شکست دادن تمام مدلهای دیگر، و پیشی گرفتن بسیار اندک از امتیاز ۷۷.۶ مدل GPT-5.6 Sol.
- FrontierSWE: کسب امتیاز ۸۱.۲ و قرارگیری در جایگاه دوم پس از Claude Fable 5 (۸۶.۶) و برتری نسبت به GPT-5.6 Sol، GLM-5.2 و Opus 4.8.
- DeepSWE: کسب امتیاز ۶۷.۵ و پیشی گرفتن اندک از GPT-5.5 (۶۷.۰)، هرچند از Claude Fable 5 (۷۰.۰) و GPT-5.6 Sol (۷۳.۰) عقبتر ماند.
- Terminal Bench 2.1: کسب امتیاز ۸۸.۳ و رقابت تنگاتنگ با GPT-5.6 Sol (۸۸.۸) برای کسب جایگاه دوم.
- Kimi Code Bench 2.0 (داخلی): کسب رتبه دوم با امتیاز ۷۲.۹، در حالی که Claude Fable 5 با ۷۶.۹ در جایگاه اول بود.
- SWE Marathon: کسب امتیاز ۴۲.۰ و برتری مطلق نسبت به تمام مدلهای آزمایش شده. نکته قابل توجه این است که Claude Fable 5 امتیاز ۳۵.۰ را کسب کرد زیرا در ۳۵٪ از این وظایف با خطاهای سیستمی (Harness Fallbacks) مواجه شد.

عملکرد عاملهای عمومی:
Kimi K3 در چندین دستهبندی از رفتارهای عاملمحور عمومی پیشتاز است:
- Automation Bench: کسب امتیاز ۳۰.۸ و رتبه اول (GPT-5.6 Sol نزدیکترین رقیب با امتیاز ۲۹.۷ بود).
- SpreadsheetBench 2: صدر جدول با امتیاز ۳۴.۸ و پیشی گرفتن از امتیاز ۳۴.۷ مدل Claude Fable.
- BrowseComp: کسب امتیاز ۹۱.۲ و برتری نسبت به تمام مدلها. این امتیاز با استفاده از استراتژی «فشردهسازی زمینه» (Context-compaction) به دست آمده است؛ در صورتی که مدل با پنجره کامل ۱ میلیون توکنی و بدون مدیریت اجرا شود، امتیاز آن به ۹۰.۴ میرسد که با GPT-5.6 Sol برابر است.
- AA-Briefcase Elo: کسب رتبه دوم (۱۵۴۸) پس از Claude Fable 5 (۱۵۸۳).
- GDPval-AA V2 Elo: قرارگیری پس از Fable 5 و GPT-5.6 Sol، اما برتری نسبت به تمام مدلهای دیگر.
- JobBench: کسب رتبه دوم (۵۲.۹) پس از Claude Fable 5 (۵۷.۴).

عملکرد عاملهای بصری:
قابلیتهای بصری قوی هستند اما بهشدت به ابزارها وابستهاند. در اجراهایی که از ابزارهای پایتون کمک گرفته شده بود، Kimi K3 در هر دو تست اصلی رتبه دوم را پس از Claude Fable 5 کسب کرد:
- CharXiv (RQ): کسب امتیاز ۹۱.۳ با کمک پایتون (Fable 5 امتیاز ۹۳.۵ گرفت). بدون ابزارها، امتیاز K3 به ۸۴.۸ کاهش مییابد که در این حالت با Fable 5 برابر میشود.
- ZeroBench: کسب امتیاز ۴۱.۰ با کمک پایتون، برابری با GPT-5.5 و عقبتر از Fable 5 (۴۶.۰). بدون ابزارها، امتیاز آن به ۲۳.۰ میرسد که باز هم با Fable 5 برابر است.
دسترسی و هزینهها
دسترسی به مدل از طریق چندین ارائهدهنده با قیمتهای استاندارد امکانپذیر است. هر یک از ارائهدهندگان درجه اول، همان قیمتهای پلتفرم Moonshot را اعمال میکنند: ۳ دلار برای هر میلیون توکن ورودی، ۰.۳۰ دلار برای ورودیهای کششده و ۱۵ دلار برای هر میلیون توکن خروجی.
| ارائهدهنده | ورودی (هر ۱ میلیون) | ورودی کششده | خروجی (هر ۱ میلیون) |
|---|---|---|---|
| پلتفرم رسمی Kimi | ۳.۰۰ دلار | ۰.۳۰ دلار | ۱۵.۰۰ دلار |
| Fireworks AI | ۳.۰۰ دلار | ۰.۳۰ دلار | ۱۵.۰۰ دلار |
| Baseten | ۳.۰۰ دلار | ۰.۳۰ دلار | ۱۵.۰۰ دلار |
| Together AI | ۳.۰۰ دلار | ۰.۳۰ دلار | ۱۵.۰۰ دلار |
| OpenRouter (ارزانترین) | ۲.۸۰ دلار | ۰.۲۹ دلار | ۱۴.۰۰ دلار |
جزئیات ارائهدهندگان:
- وبسایت رسمی Kimi: از طریق platform.kimi.ai و با فرمت API سازگار با OpenAI/Anthropic (نام مدل
kimi-k3) در دسترس است. این مستقیمترین راه دسترسی به Moonshot است. - OpenRouter: یک لایه مسیریابی با قابلیت جایگزینی خودکار (Failover) و سه حالت: Balanced، Nitro (برای سرعت) و Exacto (برای فراخوانی ابزار). اگرچه ارزانترین مسیر ۲.۸۰/۱۴.۰۰ دلار است، اما نقاط انتهایی (Endpoints) مختلف میتوانند بین ۲.۸۰ تا ۶ دلار برای ورودی و ۱۴ تا ۲۲.۵۰ دلار برای خروجی متغیر باشند. کاربران برای کنترل هزینه باید مسیر خود را «پین» کنند.
- Fireworks AI: لایههای Serverless شامل Fast، Priority و US-only (برای صنایع تحت نظارت) را ارائه میدهد. لایه Priority هزینه ۲۵٪ بیشتر، Fast هزینه ۵۰٪ بیشتر و US-only هزینه ۱۰٪ بیشتر دارد. این سرویس بهطور پیشفرض عدم ذخیرهسازی دادهها (Zero Data Retention) را تضمین کرده و از استقرار GPU اختصاصی و Fine-tuning مدلهای LoRA پشتیبانی میکند.
- Baseten: یک Model API ارائه میدهد. توجه داشته باشید که صفحه Baseten بهاشتباه مجوز را MIT ذکر کرده است؛ در حالی که Hugging Face مرجع صحیح است. Baseten معمولاً استقرارهای اختصاصی و Self-hosted را میفروشد، اما K3 تنها روی Model API عرضه شد.
- Together AI: استنتاج Serverless و Dedicated را ارائه میدهد. آنها مقایسهای دقیق از بنچمارکهای عمومی در برابر Claude Fable 5، Claude Opus 5، GPT-5.6 Sol، GPT-5.6 Luna و Grok 4.5 ارائه کردهاند. در حالی که وزنها در ۲۷ ژوئیه منتشر شدند، دسترسی در Together AI از اول اوت آغاز شد.
واقعیتهای میزبانی شخصی (Self-Hosting)
با وجود انتشار وزنها در Hugging Face، سختافزار مورد نیاز برای اجرای این مدل تکاندهنده است. حجم مخزن مدل تقریباً ۱.۵۶۱ ترابایت (۱,۵۶۱,۰۸۲,۴۳۶,۶۶۸ بایت) است که در ۹۶ قطعه (Safetensors shards) تقسیم شده است. تنها این قطعات ۱.۵۶۰۹ ترابایت را اشغال میکنند و باقی فضا مربوط به فایلهای پیکربندی و Tokenizer است.
نیازمندیهای سختافزاری:
- حداقل VRAM مورد نیاز: ۱۶۸۰ گیگابایت. این تخمین vLLM بر اساس ۲.۸ تریلیون پارامتر با نیم بایت برای هر پارامتر بهعلاوه ۲۰٪ فضای ذخیره (Headroom) است و KV Cache را شامل نمیشود.
- حداقل گره تک (Single-Node): ۸ عدد شتابدهنده B300، GB300 یا MI355X (هر کدام ۲۸۸ گیگابایت).
- سطح ۱۶-GPU (Hopper/Blackwell): ۱۶ عدد H200 (۱۴۱ گیگابایت) یا ۱۶ عدد B200 (۱۸۰ گیگابایت). این سطح وزنها را جای میدهد اما پنجره متنی را محدود میکند؛ دستورالعمل Hopper در vLLM پنجره متنی را به ۳۲,۷۶۸ توکن محدود میکند. برای پنجره ۱ میلیون توکنی، نیاز به پروفایل Blackwell با fp8 KV cache است.
- سطح تولیدی (Production): Moonshot توصیه میکند از ۶۴ شتابدهنده یا بیشتر در پیکربندیهای سوپرنود استفاده شود.
- ذخیرهسازی: ۴ ترابایت NVMe برای استقرار Checkpoint و انجام کوانتیزاسیون توصیه میشود. این یک قاعده کلی از Kingy AI برای نگهداری چکپوینت بهعلاوه فضای لازم برای تبدیل آن است.
هزینههای مالی میزبانی شخصی بازدارنده است. هشت عدد B300 تقریباً ۴۲۴,۰۰۰ دلار (هر عدد ۵۳,۰۰۰ دلار) هزینه دارد. یک گره کامل شامل CPUها، NVSwitch fabric، شبکه و سیستم خنککننده مایع بین ۴۰۰,۰۰۰ تا ۵۰۰,۰۰۰ دلار قیمت دارد. یک سیستم مبتنی بر AMD MI355X کمی ارزانتر و بین ۲۵۰,۰۰۰ تا ۳۵۰,۰۰۰ دلار است. اجاره ساعتی ۸ عدد B300 حدود ۵۹ دلار یا ۴۳,۰۰۰ دلار در ماه هزینه دارد. استخراجکنندگان ارزهای دیجیتال عموماً سختافزار کافی برای اجرای K3 را ندارند.

کوانتیزاسیونهای جامعه، مانند GGUF یک-بیتی Unsloth، مدل را به حدود ۵۹۴ گیگابایت کاهش میدهند. این امر اجازه میدهد مدل روی یک ورکاستیشن با رم بالا یا تنها با چهار GPU دیتاسنتر اجرا شود، اما این کار به قیمت کاهش واقعی دقت (Accuracy) تمام میشود. همانطور که لوک مرکادو در لینکدین اشاره کرد، برای محیطهای تولیدی، شما اساساً به دیتاسنتر شخصی خود نیاز دارید.
پیادهسازی عملی با OpenCode
توسعهدهندگان میتوانند Kimi K3 را از طریق OpenCode ادغام کنند. ابتدا ابزار را نصب کنید:npm install -g opencode-ai
سپس احراز هویت کرده و اجرا کنید:opencode auth loginopencode

برای دادن دسترسی وب به مدل، میتوان از Firecrawl MCP — پروتکل زمینه مدل (MCP) که مانند یک پل ارتباطی بین مدل و ابزارهای خارجی عمل میکند — استفاده کرد تا پایگاه دانش مدل با دادههای زنده گسترش یابد. ابتدا CLI را نصب کنید:npm install -g firecrawl-cli
سپس اتصال MCP را پیکربندی کنید:firecrawl setup mcp
محیط خود (OpenCode، Claude Code، Cursor و غیره) را انتخاب کرده و OpenCode را مجدداً اجرا کنید.

در تستهای انجام شده، Kimi K3 توانست با موفقیت از جستجوی Firecrawl برای بازیابی اخبار جاری درباره سیاست، جنگها، انتخابات و بیماریها استفاده کند که تایید میکند سیستم MCP بهدرستی کار میکند.

نکات اجرا در ویندوز: اجرای OpenCode روی ویندوز بومی مشکلساز است. یک باگ شناخته شده باعث میشود کرشهای برنامه، ترمینال را با کدهای ANSI خام پر کرده و مکاننما (Cursor) را مخفی کند که نیازمند ریاستارت PowerShell است. این مشکل هنوز باز است. راهکار توصیه شده استفاده از WSL در اوبونتو است.
علاوه بر این، اگر قبلاً از firecrawl login استفاده کردهاید، دستور setup mcp به دلایل امنیتی از نوشتن کلید API شما در پیکربندی کلاینت خودداری میکند. شما باید یا FIRECRAWL_API_KEY را بهصورت دستی Export کنید یا از لانچر استفاده کنید:firecrawl launch opencode
تحلیل: تغییر قدرت در مدلهای وزن-باز
مدل Kimi K3 نشاندهنده یک تغییر جهت در چشمانداز هوش مصنوعی «باز» است. برای سالها، مدلهای وزن-باز به عنوان جایگزینهای بهینه برای مدلهای اختصاصی دیده میشدند، اما بهندرت در استدلال خام (Raw Reasoning) با آنها برابر بودند. Moonshot AI با رسیدن به ۲.۸ تریلیون پارامتر، در تلاش است تا هوش سطح پیشرو (Frontier-level Intelligence) را به یک کالای عمومی تبدیل کند.
برای توسعهدهندگان، این بدان معناست که «خندق» (Moat) مدلهای اختصاصی در حال کوچک شدن است. اگر مدلی با مهارتهای کدنویسی در سطح GPT-5 بتواند روی زیرساختهای خصوصی میزبانی شود، انگیزه ارسال کدهای حساس به APIهای شخص ثالث از بین میرود. با این حال، سد سختافزاری همچنان نگهبان واقعی است. هزینه ششرقمی یک گره واحد به این معناست که اگرچه وزنها باز هستند، اما محاسبات (Compute) همچنان در دست کسانی است که سرمایه کلانی دارند. انتظار نداشته باشید Kimi K3 را بدون داشتن بودجه Series A یا سرمایهگذاری Seed بهصورت محلی اجرا کنید.
برای بررسی جزئیات کامل فنی، میتوانید گزارش 'Kimi K3: Open Frontier Intelligence' را در arXiv مطالعه کنید.




گفتگو