
هزینهی پنهان پرگویی؛ چرا قیمت ارزان توکنهای Kimi K3 گمراهکننده است؟
مدل Kimi K3 با ۲.۸ تریلیون پارامتر و پنجره زمینه یک میلیون توکنی معرفی شد، اما تمایل شدید به تولید پاسخهای طولانی (Verbosity) ممکن است هزینهی نهایی هر تسک را دو برابر کند. در…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۷۸۹ مقاله منتشر شده

مدل Kimi K3 با ۲.۸ تریلیون پارامتر و پنجره زمینه یک میلیون توکنی معرفی شد، اما تمایل شدید به تولید پاسخهای طولانی (Verbosity) ممکن است هزینهی نهایی هر تسک را دو برابر کند. در…

شرکت Moonshot AI مدل Kimi K3 را معرفی کرد؛ نخستین مدل با وزنهای باز در کلاس ۳ تریلیون پارامتر که پنجرهٔ زمینه ۱ میلیون توکنی دارد. این مدل با معرفی مکانیزمهای KDA و AttnRes،…

یک محک جدید برای جریانهای کاری K8sGPT نشان میدهد که دقت هوش مصنوعی در تشخیص خطاها هنوز برای ایمنی کامل محیط تولید کافی نیست. این پژوهش تأکید میکند که توانایی «اجتناب از اقدام»…

مدل K3 با ۲.۸ تریلیون پارامتر و پنجره متنی یک میلیون توکنی معرفی شد. این مدل در زمینه هوش استدلالی بهطور قابلتوجهی از میانگین مدلهای همرده پیشی گرفته، اما در سرعت تولید خروجی…

پلتفرم Artificial Analysis مجموعهای از محکهای جدید برای ارزیابی گردشهای کاری پیچیده و نرخ توهم در مدلهای پیشرو معرفی کرد. این چارچوبها به جای امتیازات کلی، ارزش اقتصادی واقعی…

یک چارچوب عاملمحور جدید به نام Schema با تبدیل جهان به برنامههای قابل اجرا، مدلهای پیشرو را به کارایی انسانی در حل مسائل پیچیده استدلالی رسانده است. این سیستم با جداسازی فرآیند…

شرکت Kimi با عرضه مدلهای K3 و K2.7 Code، دسترسی به پنجرهٔ زمینهٔ یک میلیون توکنی را برای کاربران سطح بالا فراهم کرد. این بهروزرسانی شامل نسخهای با سرعت بالا (HighSpeed) و سیستم…

Simbastack ابزار متنباز Sentinel را معرفی کرد؛ عاملی که پیش از اجرای تست، کد منبع را میخواند تا جریانهای کاری تجاری را استخراج کند. این ابزار برخلاف مدلهای رایج، وضعیت سرور را…

گوگل با معرفی مدل آزمایشی DiffusionGemma، گلوگاه حافظه در تولید متن را به توان محاسباتی منتقل کرد. این معماری با پردازش موازی بلوکهای متنی، سرعت استنتاج را بهشدت افزایش داده و…

یک مکانیزم تست جدید در AuraSDK با مشاهده اجرای کد و تلاش فعال برای رد فرضیات خود، تستهای ویژگی Rust را بهطور خودکار میسازد. این سیستم برخلاف استخراجکنندههای استاتیک، در صورت…

نسخه بتا GPT-5.6 Sol از OpenAI امکان هماهنگی یک عامل ریشه با زیر-عاملهای متخصص را فراهم میکند. این مدل با تفکیک بازبینی کد به جریانهای مستقلِ صحت، امنیت و تست، زمان انتظار را…

تحلیل رفتار مدلهای زبانی نشان میدهد که تفاوت عمیقی میان فرآیند تصمیمگیری داخلی و توضیحات بیرونی آنها وجود دارد. در حالی که مدلهایی مثل Claude قادر به برنامهریزی پیشدستانه…