
Kimi K3: اجرای هزاران محیط ایزوله برای آموزش عاملهای هوشمند
تیم Kimi و kvcache-ai ابزار متنباز AgentENV را برای رفع گلوگاههای تأخیر در آموزش عاملهای هوش مصنوعی معرفی کردند. این پلتفرم با استفاده از میکرو-ماشینهای مجازی، امکان اجرای…
موضوع
روشی برای آموزش مدلهای هوش مصنوعی با استفاده از چندین پردازنده یا سرور بهصورت همزمان
۷۳ مقاله منتشر شده

تیم Kimi و kvcache-ai ابزار متنباز AgentENV را برای رفع گلوگاههای تأخیر در آموزش عاملهای هوش مصنوعی معرفی کردند. این پلتفرم با استفاده از میکرو-ماشینهای مجازی، امکان اجرای…

معماری جدید KDA با جایگزینی بهروزرسانیهای جمعی ساده با قانون دلتا و فراموشی کانالبهکانال، مشکل تداخل در حافظههای با اندازه ثابت را برطرف میکند. این رویکرد به مدلها اجازه…

تیم Kimi و kvcache-ai پلتفرم متنباز AgentENV را برای مقیاسدهی یادگیری تقویتی (RL) در مدلهای عظیم معرفی کردند. این سامانه با استفاده از ماشینهای مجازی بسیار کوچک (microVMs)،…

پژوهشهای تازه در Hugging Face مدلهای خود-اصلاحگر و روشهای آموزش DeepSeek-V4 روی سختافزارهای غیرانویدیا را معرفی کردند. این پیشرفتها شکافهای حیاتی در خودمختاری عاملهای هوش…

گروه پژوهشی Reactor با معرفی Open Dreamer، معماری و جزئیات آموزشی مدلهای جهانی Dreamer 4 را بهصورت متنباز منتشر کرد. این پروژه با تمرکز بر پایداری آموزش در مقیاس بالا، دموهای…

پایتورتچ با انتقال Runtime Monarch به پردازندههای AMD، امکان بازیابی خودکار آموزشهای توزیعشده پس از خرابی گرهها را فراهم کرد. این سیستم اجازه میدهد پردازندههای سالم به کار…

شرکت AMD با سرمایهگذاری ۵ میلیارد دلاری، خوشهای عظیم از پردازندههای گرافیکی MI450 را در اختیار Anthropic قرار میدهد. این توافق با هدف شکستن انحصار انویدیا و تامین زیرساخت لازم…

استارتآپ سختافزاری Etched با جذب ۳۰۰ میلیون دلار سرمایه در راند Series C، ارزش خود را در هفت ماه به ۱۰.۳ میلیارد دلار رساند. این شرکت با طراحی تراشههایی که صرفاً برای استنتاج…

پروژه Petals با توزیع بار محاسباتی میان کاربران، امکان اجرای مدلهای عظیم مانند Llama 3.1 را روی GPUهای معمولی فراهم میکند. در این مدل غیرمتمرکز، هر کاربر بخش کوچکی از مدل را…

آزمایش روی دو کارت RTX 3090 نشان میدهد که پلهای NVLink گلوگاه پهنای باند PCIe را در سختافزارهای خانگی میشکنند. این سختافزار بهویژه در آموزش مدلها با متد FSDP و پردازش…

تحلیل کدهای LLVM از معماری جدید شتابدهندههای سری MI400 شرکت AMD پرده برداشت. مدل MI455X با افزایش چشمگیر تخصیص رجیستر و یکپارچهسازی حافظهٔ کش، قصد دارد کارایی استنتاج مدلهای…

چارچوب NeMo AutoModel انویدیا اکنون امکان اجرای خط لوله تنظیمی LoRA برای مدل Qwen3-0.6B را تنها با یک پردازشگر گرافیکی فراهم میکند. این رویکرد با استفاده از دستورالعملهای YAML،…