پرش به محتوای اصلی
پرش به محتوای مقاله

Kimi K3: پنجره متنی ۱ میلیون توکنی در Amazon Bedrock

·۲۷ شهریور ۱۴۰۵۴ دقیقه مطالعه
مدل کیمی K3 مون‌شات با پنجره یک میلیون توکن روی آمازون بدراک عرضه شد
مدل کیمی K3 مون‌شات با پنجره یک میلیون توکن روی آمازون بدراک عرضه شد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نخستین مدل وزن‌باز در Bedrock که از کشینگ صریح پرامپت (Explicit Prompt Caching) پشتیبانی می‌کند و پنجره متنی یک میلیون توکنی را برای کاربردهای سازمانی بهینه کرده است.

اگر امروز برای مدیریت پروژه‌های نرم‌افزاری حجیم یا تحلیل اسناد چندصد صفحه‌ای مدل‌های هوش مصنوعی را به خدمت می‌گیرید، هزینه و سرعت استنتاج شما با ورود Kimi K3 به اکوسیستم AWS تغییر می‌کند. این مدل با ۲.۸ تریلیون پارامتر، کفِ هزینه‌ها و کارایی را برای سازمان‌هایی که با متون بسیار طولانی سروکار دارند، جابه‌جا کرده است. در ۱۸ سپتامبر ۲۰۲۶، شرکت Moonshot AI مدل Kimi K3 را برای کاربران Amazon Bedrock فعال کرد تا جریان‌های کاری برنامه‌نویسی و مدیریت دانش در مقیاس بالا را بهینه کند.

این اقدام، مدل را از کانال‌های اختصاصی شرکت سازنده به اکوسیستم گسترده‌تر AWS منتقل می‌کند. برای یک کاربر تجاری، این اتفاق شبیه جابه‌جایی یک ابزار تخصصی از یک کارگاه خصوصی به یک کارخانه جهانی با استانداردهای امنیتی و مقیاس‌پذیری یکپارچه است. همان‌طور که در تحلیل قبلی ما درباره‌ی اهداف درآمدی ۲ میلیارد دلاری Moonshot AI برای مدل K3 اشاره کردیم، این ادغام گامی استراتژیک برای دسترسی به بازار سازمانی است. مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — در اینجا با مقیاسی خیره‌کننده عرضه شده است.

زمینه و دسترسی

شرکت Moonshot AI در ابتدا Kimi K3 را در جولای ۲۰۲۶ معرفی کرد و وزن‌های کامل مدل را تا ۲۷ جولای ۲۰۲۶ منتشر نمود. پیش از عرضه در Bedrock، این مدل منحصراً از طریق کانال‌های داخلی Moonshot AI در دسترس بود؛ این کانال‌ها شامل اپلیکیشن Kimi، برنامه دسکتاپ Kimi Work، ابزار ترمینال Kimi Code و API اختصاصی Kimi می‌شد.

به نقل از وبلاگ یادگیری ماشین AWS، مدل Kimi K3 توانمندترین عضو خانواده Moonshot است. این مدل قابلیت‌های بینایی بومی (Native Vision) را با یک پنجره متنی (Context Window) — شبیه میز کاری که جا برای چند ورق دارد، نه برای کل کتابخانه — به اندازه یک میلیون توکن ترکیب می‌کند. این شرکت گزارش داده است که کارایی مقیاس‌پذیری این مدل نسبت به نسل قبلی خود یعنی Kimi K2، ۲.۵ برابر بهبود یافته است.

معماری فنی

شرکت Moonshot AI این پیشرفت‌ها را مدیون دو به‌روزرسانی ساختاری اصلی و اصلاح دستورالعمل‌های آموزش و داده‌ها می‌داند:

  • Kimi Delta Attention و Attention Residuals: این مکانیزم‌ها نحوه جریان یافتن اطلاعات در عمق مدل و طول توالی‌ها را بهینه می‌کنند تا دقت در متون طولانی حفظ شود.
  • Stable LatentMoE: یک طراحی «ترکیب خبره‌ها» (Mixture of Experts) که برای حفظ کارایی، در هر لحظه تنها ۱۶ خبره از مجموع ۸۹۶ خبره را فعال می‌کند.
  • آموزش آگاه از کوانتش (Quantization-Aware Training): این مدل از وزن‌های MXFP4 و فعال‌سازهای MXFP8 از مرحله تنظیم نظارت‌شده (SFT) به بعد استفاده می‌کند تا سرعت پردازش افزایش و مصرف حافظه کاهش یابد.

ادغام در Bedrock و ابزارها

AWS مدل Kimi K3 را در قابلیت‌های استاندارد پلتفرم خود ادغام کرده است؛ به این معنا که این مدل به صورت بومی از فراخوانی ابزار (Tool Calling)، خروجی ساختاریافته، استدلال و استریم پاسخ‌ها پشتیبانی می‌کند. این‌ها قابلیت‌های سطح پلتفرم هستند و نه ادغام‌های مجزا برای هر مدل. کاربران می‌توانند از طریق کنسول Bedrock در بخش Test > Playground یا از طریق نقطه اتصال bedrock-runtime با استفاده از APIهای سازگار با OpenAI (مانند Responses و Chat Completions) و همچنین APIهای Invoke و Converse در Amazon Bedrock به مدل دسترسی داشته باشند.

برای مدیریت هزینه‌ها، AWS دو پروفایل استنتاج ارائه می‌دهد. پروفایل جهانی (global.moonshotai.kimi-k3) درخواست‌ها را در سراسر جهان مسیریابی می‌کند و هزینه آن تقریباً ۱۰٪ کمتر از پروفایل جغرافیایی اختصاصی ایالات متحده (us.moonshotai.kimi-k3) است که برای سازمان‌هایی با الزامات سخت‌گیرانه اقامت داده‌ها (Data Residency) رزرو شده است.

مدل Kimi K3 همچنین اولین مدل وزن‌باز در Bedrock است که از کشینگ صریح پرامپت (Explicit Prompt Caching) پشتیبانی می‌کند. توسعه‌دهندگان می‌توانند با قرار دادن یک نشانگر promptcachebreakpoint پس از حداقل ۱۰۲۴ توکن، متون ثابت مانند دستورالعمل‌های مخزن کد یا اسناد مرجع را ذخیره کنند. اگرچه توکن‌های کش‌شده در ابتدا با نرخ بالاتری صورت‌حساب می‌شوند و حداقل برای ۳۰ دقیقه نگه داشته می‌شوند، اما درخواست‌های بعدی نرخ ورودی تخفیف‌یافته‌ای دریافت می‌کنند و از برخی سقف‌های محدودیت توکن در دقیقه (TPM) عبور می‌کنند.

عملکرد و محدودیت‌ها

شرکت Moonshot AI اذعان دارد که Kimi K3 هنوز از غول‌های اختصاصی مانند Claude Fable 5 و GPT 5.6 Sol عقب‌تر است. این رقابت در محیط‌های ابری AWS شدت یافته است، به‌طوری که ادغام مدل‌های پیشرفته‌ای مانند GPT-5.6 در محیط Kiro توانسته است هزینه‌های عملیاتی کدنویسی را تا ۸۲٪ کاهش دهد. با این حال، این شرکت ادعا می‌کند که در مجموعه ارزیابی‌های داخلی خود، نتایجی در سطح مدل‌های پیشرو (Frontier-level) کسب کرده و به طور مداوم از سایر مدل‌های آزمایش‌شده پیشی گرفته است.

با این حال، ریسک‌های پایداری قابل توجهی وجود دارد. از آنجایی که مدل در حالت «تاریخچه تفکر حفظ‌شده» (Preserved Thinking History) آموزش دیده است، اگر یک عامل (Agent) — شبیه دستیاری که وظایف را مرحله‌به‌مرحله پیش می‌برد — نتواند محتوای تفکر تاریخی را بازگرداند، کیفیت تولید پاسخ‌ها افت می‌کند. علاوه بر این، تمرکز مدل بر وظایف طولانی‌مدت ممکن است باعث شود در صورت مبهم بودن دستورات کاربر، تصمیمات خودسرانه غیرمنتظره‌ای بگیرد؛ موضوعی که ممکن است نیاز به محدودیت‌های رفتاری صریح‌تر در پرامپت سیستم داشته باشد.

اکوسیستم و امنیت

این استقرار نشان‌دهنده استراتژی گسترده‌تر AWS است. از سال ۲۰۲۵، Bedrock ده‌ها مدل وزن‌باز (Open Weights) — یعنی مدل‌هایی که «دستور پخت» آن‌ها علناً منتشر شده — از تامین‌کنندگانی چون DeepSeek، Google، MiniMax، Mistral AI، NVIDIA، OpenAI و Qwen را اضافه کرده است.

AWS تضمین می‌کند که داده‌های مشتریان در مرز داده‌های AWS باقی می‌ماند و با تامین‌کننده مدل به اشتراک گذاشته نمی‌شود و برای آموزش مدل‌های زیربنایی استفاده نمی‌گردد. قابلیت «حذف داده‌ها در لحظه» (Zero Data Retention) برای درخواست‌های استنتاج فعال است و «دسترسی صفر اپراتور» مانع از دسترسی کارکنان AWS به پرامپت‌ها و پاسخ‌ها می‌شود.

مدل Kimi K3 به دو مدل دیگر Moonshot AI در Bedrock می‌پیوندد: Kimi K2.5 که یک مدل چندوجهی با استدلال بهبودیافته و قابلیت‌های چندزبانه است، و Kimi K2 Thinking که یک مدل استدلالی با قابلیت‌های زنجیره تفکر (Chain-of-Thought) برای ریاضیات، کدنویسی و منطق است.

برای کسانی که قصد پیاده‌سازی فوری دارند، این مدل با OpenCode (یک عامل کدنویسی متن‌باز) و Hermes Agent (یک دستیار بهره‌وری) سازگار است. AWS همچنین یک مخزن نمونه‌های اختصاصی در گیت‌هاب منتشر کرده تا استقرار را تسریع کند. پیش‌نیازها شامل پایتون ۳.۱۰ به بالا، یک حساب فعال AWS و مجوزهای IAM برای bedrock:InvokeModel ،bedrock:InvokeModelWithResponseStream و bedrock:CreateInference است.

گام بعدی شما

  • اگر از مدل‌های کدنویسی استفاده می‌کنید، Kimi K3 را با OpenCode یا Hermes Agent تست کنید تا قدرت پنجره متنی یک میلیونی را در تحلیل کل پروژه بسنجید.
  • برای کاهش هزینه‌های API، از قابلیت promptcachebreakpoint برای اسناد مرجع تکراری استفاده کنید.
  • مخزن نمونه‌های AWS در گیت‌هاب را برای پیاده‌سازی سریع با پایتون ۳.۱۰ بررسی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

ورود یک مدل ۲.۸ تریلیون پارامتری با وزن‌های باز به Bedrock، دسترسی سازمان‌ها به قدرت مدل‌های غول‌پیکر را بدون نیاز به زیرساخت‌های سخت‌افزاری شخصی فراهم می‌کند. این موضوع اعتبار AWS را به عنوان توزیع‌کننده اصلی مدل‌های پیشرو تقویت می‌کند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌های AWS، دسترسی مستقیم توسعه‌دهندگان ایرانی به این مدل دشوار است، اما در دسترس بودن وزن‌های باز آن، فرصتی برای میزبانی شخصی (Self-hosting) در مراکز داده داخلی فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

تمرکز Moonshot AI بر پنجره متنی عظیم و کشینگ پرامپت، نشان می‌دهد که رقابت مدل‌های بازمتن از «دقت خام» به سمت «کارایی در عملیات» تغییر مسیر داده است. این مدل به جای تلاش برای شکست دادن GPT-5 در بنچمارک‌های کلی، روی نقاط ضعف مدل‌های تجاری در مدیریت پروژه‌های کدنویسی حجیم دست گذاشته است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.