پرش به محتوای اصلی
پرش به محتوای مقاله

هزینه‌ی پنهان پرگویی؛ چرا قیمت ارزان توکن‌های Kimi K3 گمراه‌کننده است؟

·۲۶ تیر ۱۴۰۵۸ دقیقه مطالعه
تحلیل
کلید API اوپن‌ای‌ای رایگان است، اما استفاده از آن رایگان نیست.
کلید API اوپن‌ای‌ای رایگان است، اما استفاده از آن رایگان نیست.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی اولین مدل پیشرو با ۲.۸ تریلیون پارامتر که ادعای وزن‌های باز دارد اما در عمل هزینه هر تسک را به‌دلیل پرگویی خروجی افزایش می‌دهد.

اگر امروز بودجه‌ی استنتاج خود را بر اساس قیمت توکن‌ها برنامه‌ریزی می‌کنید، احتمالاً در پایان ماه با صورت‌حسابی دو برابر آنچه انتظار داشتید روبرو خواهید شد. تضاد میان «توکن ارزان» و «تسک ارزان» در مدل جدید Moonshot AI، ریسک مالی جدیدی برای توسعه‌دهندگان ایجاد کرده است. برای مهندسان، ریسک واقعی بودجه در فاصله میان یک «توکن ارزان» و یک «تسک ارزان» نهفته است.

شرکت Moonshot AI در ۱۶ ژوئیه ۲۰۲۶، مدل Kimi K3 را به عنوان رقیبی در سطح مدل‌های پیشرو (Frontier) معرفی کرد. این مدل با مقیاسی عظیم و پنجرهٔ زمینه (Context Window) یک میلیون توکنی عرضه شده است. این عرضه در زمانی رخ می‌دهد که صنعت از تعقیب صرفِ تعداد پارامترها به سمت بهینه‌سازی «هزینه به‌ازای هر تسک تکمیل‌شده» در محیط‌های عملیاتی حرکت کرده است. این روند بهینه‌سازی هزینه‌ها در سایر شرکت‌ها نیز مشهود است؛ برای نمونه، استراتژی قیمت‌گذاری Hy3 تنسنت نیز دقیقاً با هدف کاهش هزینه‌های عملیاتی برای توسعه‌دهندگان طراحی شده است.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی نقاط عطفی در مقیاس‌گذاری Moonshot AI اشاره کردیم، انتشار K3 تلاشی برای پر کردن شکاف میان قدرت مدل‌های اختصاصی و دسترسی به وزن‌های باز (Open Weights) است. با این حال، واقعیت فعلی برای مهندسان، ترکیبی از مشخصات تاییدشده و موارد گم‌شده است. در زمان رونمایی، سه ادعای هم‌زمان مطرح شد: استفاده از تمام ۲.۸ تریلیون پارامتر برای هر توکن، در دسترس بودن وزن‌ها و ارزان‌تر بودن خودکار هزینه هر تسک. طبق بررسی‌ها، دو مورد اول نادرست و مورد سوم ناقص است.

شکاف معماری

شرکت Moonshot تایید می‌کند که K3 یک مدل ترکیب خبره‌ها (Mixture-of-Experts یا MoE) با ۲.۸ تریلیون پارامتر است. اگرچه ظرفیت کلی مدل بسیار زیاد است، اما تعداد پارامترهای فعال به‌ازای هر توکن اعلام نشده است. این یک حذف حیاتی برای هر کسی است که قصد تخمین نیازهای سرویس‌دهی محلی یا تأخیر (Latency) استنتاج را دارد.

به نقل از اطلاعیه رسمی، K3 هر توکن را از طریق ۱۶ خبره از میان ۸۹۶ خبره هدایت می‌کند. این مدل از طراحی‌های تخصصی مانند Kimi Delta Attention, Attention Residuals و Stable LatentMoE بهره می‌برد. چون تعداد پارامترهای فعال عمومی نشده است، مهندسان نمی‌توانند ترافیک حافظه به‌ازای هر توکن را به‌طور دقیق محاسبه کنند.

من افسانهٔ کلید API رایگان OpenAI را بررسی کردم. کلید رایگان است. استفاده نه.

برخلاف روایت «وزن‌های باز» در زمان عرضه، وزن‌ها تا ۱۶ ژوئیه قابل دانلود نبودند. Moonshot متعهد شده است که آن‌ها را تا ۲۷ ژوئیه ۲۰۲۶ منتشر کند. تا زمانی که این نقاط بازرسی (Checkpoints) و مجوزها عمومی نشوند، ادعاهای میزبانی شخصی (Self-hosting) تنها یک قول است، نه یک واقعیت تکمیل‌شده. تمایز این موضوع اهمیت دارد، زیرا یک مدل ۲.۸ تریلیونی با وزن‌های باز، هم‌زمان به دو چیز اشاره دارد: محاسبات فعال عظیم و امکان میزبانی فوری؛ در حالی که هیچ‌کدام از این دو از داده‌های فعلی حاصل نمی‌شود. این حرکت Moonshot در راستای تبدیل شدن به یک مدل وزن‌باز، در حالی صورت می‌گیرد که مدل‌های وزن‌باز در حال حاضر ۶۵٪ از حجم توکن‌های جهانی را تصاحب کرده‌اند و نفوذ گسترده‌ای در بازار یافته‌اند.

برای تخمین فضای ذخیره‌سازی، یک مدل ۲.۸ تریلیون پارامتری که با دقت ۴ بیت ذخیره شده باشد، به حدود ۱.۴ ترابایت فضای خام نیاز دارد (۲.۸ تریلیون پارامتر × ۴ بیت / ۸). این رقم شامل متادیتای مدل، مقیاس‌ها، بافرهای زمان اجرا، KV Cache و تکثیر (Replication) نمی‌شود. Moonshot برای استقرار این مدل حداقل ۶۴ شتاب‌دهنده را توصیه می‌کند که اجرای محلی روی سخت‌افزارهای رده دسکتاپ را برای مدل کامل غیرممکن می‌کند.

ریاضیات پنهان پرگویی

قیمت‌گذاری رسمی API بین‌المللی به شرح زیر است:

  • ورودی با کش موفق (Cache-hit): ۰.۳۰ دلار به‌ازای هر ۱ میلیون توکن
  • ورودی بدون کش (Cache-miss): ۳.۰۰ دلار به‌ازای هر ۱ میلیون توکن
  • خروجی: ۱۵.۰۰ دلار به‌ازای هر ۱ میلیون توکن

روی کاغذ، این نرخ‌ها جذاب هستند و ورودی‌های بدون کش را ارزان‌تر از بسیاری از APIهای سطح بالا قرار می‌دهند. نرخ ۰.۳۰ دلاری برای کش، انگیزه‌ای قوی برای مهندسان است تا پیشوندهای پرامپت (Prompt Prefixes) پایدار پیاده کنند. برای درک بهتر، این سه سناریوی حجم کاری ماهانه را در نظر بگیرید:

  • حجم پایین: ۱۰ میلیون ورودی + ۲ میلیون خروجی = ۶۰ دلار (۱۰ میلیون × ۳ دلار + ۲ میلیون × ۱۵ دلار).
  • حجم متوسط: ۱۰۰ میلیون ورودی + ۲۰ میلیون خروجی = ۶۰۰ دلار (بدون کش)، اما اگر ۸۰٪ ورودی کش شود، هزینه به ۳۸۴ دلار کاهش می‌یابد (۲۰ میلیون بدون کش × ۳ دلار + ۸۰ میلیون کش‌شده × ۰.۳۰ دلار + ۲۰ میلیون خروجی × ۱۵ دلار).
  • حجم بالا: ۱ میلیارد ورودی + ۲۰۰ میلیون خروجی = ۶,۰۰۰ دلار (بدون کش)، اما اگر ۹۰٪ ورودی کش شود، هزینه به ۳,۵۷۰ دلار می‌رسد.

با این حال، داده‌های Artificial Analysis یک هزینه پنهان را فاش می‌کند: پرگویی (Verbosity). در ارزیابی‌ها، K3 حدود ۱۳۰ میلیون توکن خروجی تولید کرد، در حالی که مدل‌های مشابه به‌طور متوسط تنها ۶۳ میلیون توکن تولید کردند.

در نرخ ۱۵ دلار به‌ازای هر میلیون، این تفاوت تکان‌دهنده است. برای یک مجموعه از تسک‌های ارزیابی، ۶۳ میلیون توکن ۹۴۵ دلار هزینه دارد، اما ۱۳۰ میلیون توکن ۱,۹۵۰ دلار هزینه می‌کند. این اختلاف ۱,۰۰۵ دلاری ثابت می‌کند که یک مدل می‌تواند به‌ازای هر توکن «ارزان» به نظر برسد، اما به‌ازای هر پاسخ تکمیل‌شده دو برابر گران‌تر باشد، چون برای رسیدن به همان نتیجه، توکن‌های بیشتری تولید می‌کند.

عملکرد و بنچمارک‌ها

بر اساس مستندات داخلی Moonshot، مدل K3 در دسته‌بندی‌های خاصی پیشتاز است، هرچند نتایج بسته به پیکربندی ابزار و حالت استدلال متفاوت است. گزارش‌های تامین‌کننده ترکیبی از پیشتازی و رقابتی بودن را نشان می‌دهند:

  • BrowseComp: ۹۱.۲ (K3 پیشتاز جدول است)
  • OmniDocBench: ۹۱.۱ (K3 پیشتاز جدول است)
  • GPQA Diamond: ۹۳.۵ (رقابتی است، اما رتبه‌ی اول با ۹۴.۱ است)
  • MMMU-Pro: ۸۱.۶ (رقابتی است، اما رتبه‌ی اول با ۸۳.۰ است)
  • DeepSWE: ۶۷.۵ (پیشتاز نیست؛ بالاترین مورد مقایسه‌ای ۷۳.۰ است)
  • Terminal-Bench 2.0: ۸۸.۳ (نزدیک به صدر با ۸۸.۸ است)

من این اعداد را به عنوان یک رتبه‌بندی جهانی تبدیل نمی‌کنم. یادداشت‌های خود Moonshot نشان می‌دهد که مدل‌ها با حالت‌های استدلالی و پیکربندی‌های ابزاری متفاوتی تست شده‌اند. امتیازی که با یک چارچوب تولید شده، به‌طور خودکار با امتیازی که با چارچوب دیگر تولید شده، قابل مقایسه نیست.

پایگاه‌های مستقل از Artificial Analysis دیدگاه محتاطانه‌تری ارائه می‌دهند. K3 در حال حاضر شاخص هوش ۵۷ را دارد، با زمان تا نخستین توکن (TTFT) ۱.۹۹ ثانیه و سرعت خروجی حدود ۶۲ توکن در ثانیه. این‌ها بیشتر یک خط‌کشی اولیه هستند تا یک حکم نهایی، زیرا با بهینه‌سازی سرویس‌دهنده توسط ارائه‌دهندگان، اعداد تغییر می‌کنند.

اصطکاک در مهاجرت

اگرچه API این مدل با OpenAI سازگار است، اما انتقال به آن یک تغییر ساده در رشته متنی نیست. چندین «لبه تیز» در پیاده‌سازی فعلی وجود دارد:

  • کنترل استدلال: در حال حاضر فقط حالت max برای تلاش استدلالی کار می‌کند. پارامترهای تفکر سبک K2 باید حذف شوند.
  • نمونه‌گیری: دمای (Temperature) ۱ و top_p ۰.۹۵ ثابت هستند و تغییرات سفارشی پشتیبانی نمی‌شوند.
  • وضعیت گفتگو: برای حفظ پایداری، تمام پیام‌های دستیار (Assistant Messages) باید در تاریخچه حفظ شوند.
  • مدیریت تصویر: URLهای عمومی پشتیبانی نمی‌شوند و تصاویر باید آپلود یا از طریق مسیرهای پشتیبانی شده کدگذاری شوند.
  • جست‌وجوی وب: مستندات رسمی توصیه می‌کنند از ابزار جست‌وجوی داخلی ارائه‌دهنده استفاده نکنید و ابزار خودتان را به کار ببرید.
  • تغییر مدل: تغییر مدل در میانه‌ی گفتگو پشتیبانی نمی‌شود و باید یک گفتگوی جدید آغاز شود.

برای کسانی که از نسخه K2.6 مهاجرت می‌کنند، جهش هزینه قابل توجه است. قیمت‌ها در چین نشان می‌دهد K3 برای توکن‌های کش‌شده/بدون کش/خروجی به ترتیب ۲، ۲۰ و ۱۰۰ یوان به‌ازای هر میلیون توکن هزینه دارد، در حالی که این ارقام برای K2.6 به ترتیب ۱.۱۰، ۶.۵۰ و ۲۷ یوان بود. این یعنی افزایش هزینه تقریباً ۱.۸۲ برابر برای کش، ۳.۰۸ برابر برای ورودی بدون کش و ۳.۷۰ برابر برای خروجی.

حکم مهندسی

این عرضه با وعده مقیاس ۲.۸ تریلیون پارامتر، معیار مدل‌های پیشروی «باز» را تغییر می‌دهد. اما یک حقیقت رو به رشد در صنعت را تقویت می‌کند: قیمت‌گذاری توکن یک معیار ظاهری (Vanity Metric) است، اگر حجم خروجی مدل کنترل‌نشده باشد.

برای رهبران فنی، K3 ابزاری با پتانسیل بالا برای پژوهش‌های با زمینه بلند و کارهای چندوجهی است. با این حال، پنجره زمینه بزرگ تنها زمانی مفید است که مدل شواهد را به‌طور قابل‌اعتماد و اقتصادی بازیابی کند. تا زمانی که انتشار وزن‌ها در ۲۷ ژوئیه تایید نشود و پرگویی خروجی مهار گردد، انتقال ترافیک عملیاتی بر اساس قیمت‌های تیتروار، یک قمار است.

اگر امروز برای مسیریابی ترافیک تصمیم می‌گیرید، این منطق را دنبال کنید:

  • نیاز فوری به وزن‌ها: منتظر بمانید. ابتدا نقطه بازرسی و مجوز ۲۷ ژوئیه را تایید کنید.
  • نیاز به تلاش استدلالی پایین: تا زمان عرضه حالت‌های استدلالی پایین‌تر در K3، از مدل‌های دیگر استفاده کنید.
  • وابستگی به جست‌وجوی ارائه‌دهنده: از ابزار جست‌وجوی خودتان استفاده کنید یا مدل فعلی را نگه دارید.
  • زمینه بلند/چندوجهی: مدل K3 را با محدودیت خروجی و ثبت هزینه به‌ازای هر تسک، A/B تست کنید.
  • حساسیت به هزینه خروجی: پیش از هدایت ترافیک عملیاتی، میزان پرگویی را تست کنید.

شما باید اکنون K3 را با ۵٪ از ترافیک خود A/B تست کنید و به‌جای «هزینه به‌ازای توکن»، «هزینه به‌ازای پاسخ پذیرفته‌شده» را رصد کنید. مقدار max_completion_tokens را تثبیت کنید و پیشوندهای سیستمی پایدار نگه دارید تا از نرخ ۰.۳۰ دلاری کش بیشترین بهره را ببرید. تنها ارزیابی شماست که تعیین می‌کند آیا پنجره زمینه یک میلیون توکنی و نرخ جذاب کش، هزینه‌های ناشی از پرگویی خروجی را جبران می‌کند یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

گام بعدی شما

  • برای کاهش هزینه‌ها، حتماً از پیشوندهای پرامپت ثابت استفاده کنید تا حداکثر بهره از Cache-hit به‌دست آید.
  • پارامتر max_completion_tokens را برای مهار پرگویی مدل و جلوگیری از تورم هزینه‌ها تنظیم کنید.
  • اگر به دنبال میزبانی شخصی هستید، تا ۲۷ ژوئیه منتظر انتشار رسمی وزن‌ها و بررسی مجوزها بمانید.

این تنها آغاز ماجراست؛ اثر موج‌گونه‌ی این تصمیم بر اکوسیستم متن‌باز را در گزارش بعدی بررسی خواهیم کرد.

چرا این موضوع مهم است؟

این مدل با مقیاس ۲.۸ تریلیون پارامتر، استاندارد مدل‌های باز را جابه‌جا می‌کند و فشار را بر رقبای غربی برای انتشار مدل‌های مشابه افزایش می‌دهد. از نظر اعتبار فنی، این اتفاق نشان می‌دهد که بهینه‌سازی هزینه در لایه استنتاج باید از قیمت توکن فراتر رفته و بر اساس بهره‌وری هر تسک سنجیده شود.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی توسعه‌دهندگان ایرانی به K3 سخت است؛ اما انتشار احتمالی وزن‌های باز در ۲۷ ژوئیه، فرصتی برای پژوهشگران داخلی در زمینه مدل‌های عظیم فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

تمرکز Moonshot AI بر روی پنجره‌های متنی عظیم و تعداد پارامترهای نجومی، در حالی که کنترل خروجی را نادیده گرفته، نشان‌دهنده یک شکاف استراتژیک در مدل‌های لبه است. ما معتقدیم صنعت در حال حرکت به سمتی است که در آن «بهینگی پاسخ» (Conciseness) به اندازه «دقت پاسخ» در بنچمارک‌ها ارزش داشته باشد، زیرا در مقیاس عملیاتی، توکن‌های اضافی مستقیماً به معنای اتلاف پول و افزایش تأخیر هستند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.