
۳ مقاله از Hugging Face برای ارتقای استدلال عاملها و زیرساخت LLM
پژوهشهای تازه در Hugging Face مدلهای خود-اصلاحگر و روشهای آموزش DeepSeek-V4 روی سختافزارهای غیرانویدیا را معرفی کردند. این پیشرفتها شکافهای حیاتی در خودمختاری عاملهای هوش…
موضوع
روشی برای آموزش مدلهای هوش مصنوعی با استفاده از چندین پردازنده یا سرور بهصورت همزمان
۴۶ مقاله منتشر شده

پژوهشهای تازه در Hugging Face مدلهای خود-اصلاحگر و روشهای آموزش DeepSeek-V4 روی سختافزارهای غیرانویدیا را معرفی کردند. این پیشرفتها شکافهای حیاتی در خودمختاری عاملهای هوش…

گروه پژوهشی Reactor با معرفی Open Dreamer، معماری و جزئیات آموزشی مدلهای جهانی Dreamer 4 را بهصورت متنباز منتشر کرد. این پروژه با تمرکز بر پایداری آموزش در مقیاس بالا، دموهای…

پایتورتچ با انتقال Runtime Monarch به پردازندههای AMD، امکان بازیابی خودکار آموزشهای توزیعشده پس از خرابی گرهها را فراهم کرد. این سیستم اجازه میدهد پردازندههای سالم به کار…

شرکت AMD با سرمایهگذاری ۵ میلیارد دلاری، خوشهای عظیم از پردازندههای گرافیکی MI450 را در اختیار Anthropic قرار میدهد. این توافق با هدف شکستن انحصار انویدیا و تامین زیرساخت لازم…

استارتآپ سختافزاری Etched با جذب ۳۰۰ میلیون دلار سرمایه در راند Series C، ارزش خود را در هفت ماه به ۱۰.۳ میلیارد دلار رساند. این شرکت با طراحی تراشههایی که صرفاً برای استنتاج…

پروژه Petals با توزیع بار محاسباتی میان کاربران، امکان اجرای مدلهای عظیم مانند Llama 3.1 را روی GPUهای معمولی فراهم میکند. در این مدل غیرمتمرکز، هر کاربر بخش کوچکی از مدل را…

آزمایش روی دو کارت RTX 3090 نشان میدهد که پلهای NVLink گلوگاه پهنای باند PCIe را در سختافزارهای خانگی میشکنند. این سختافزار بهویژه در آموزش مدلها با متد FSDP و پردازش…

تحلیل کدهای LLVM از معماری جدید شتابدهندههای سری MI400 شرکت AMD پرده برداشت. مدل MI455X با افزایش چشمگیر تخصیص رجیستر و یکپارچهسازی حافظهٔ کش، قصد دارد کارایی استنتاج مدلهای…

چارچوب NeMo AutoModel انویدیا اکنون امکان اجرای خط لوله تنظیمی LoRA برای مدل Qwen3-0.6B را تنها با یک پردازشگر گرافیکی فراهم میکند. این رویکرد با استفاده از دستورالعملهای YAML،…

کتابخانه NeMo Automodel با ادغام در Diffusers، امکان تنظیم دقیق مدلهای عظیم تصویر و ویدیو را بدون نیاز به تبدیل فرمت وزنها فراهم کرد. این ابزار آموزش توزیعشده در مقیاس صنعتی را…

استفاده از مدلهای بینایی-زبانی امکان شناسایی الگوهای پیچیده mixers را بهجای تحلیل دادههای خام، از طریق تحلیل بصری گرافهای تراکنش فراهم میکند. با تنظیم دقیق Qwen2-VL روی…

پیادهسازی متنباز جدیدی از توجه پراکنده Minimax (MSA)، آموزش مدلها با پنجرههای متنی میلیونی را روی GPUهای Hopper و Blackwell ممکن کرد. این ابزار با استفاده از پراکندگی بلوکی و…