
درون معماری Petals برای تبدیل GPUهای خانگی به یک ابرکامپیوتر
پروژه Petals با توزیع بار محاسباتی میان کاربران، امکان اجرای مدلهای عظیم مانند Llama 3.1 را روی GPUهای معمولی فراهم میکند. در این مدل غیرمتمرکز، هر کاربر بخش کوچکی از مدل را…
موضوع
روشی برای آموزش مدلهای هوش مصنوعی با استفاده از چندین پردازنده یا سرور بهصورت همزمان
۶۵ مقاله منتشر شده

پروژه Petals با توزیع بار محاسباتی میان کاربران، امکان اجرای مدلهای عظیم مانند Llama 3.1 را روی GPUهای معمولی فراهم میکند. در این مدل غیرمتمرکز، هر کاربر بخش کوچکی از مدل را…

آزمایش روی دو کارت RTX 3090 نشان میدهد که پلهای NVLink گلوگاه پهنای باند PCIe را در سختافزارهای خانگی میشکنند. این سختافزار بهویژه در آموزش مدلها با متد FSDP و پردازش…

تحلیل کدهای LLVM از معماری جدید شتابدهندههای سری MI400 شرکت AMD پرده برداشت. مدل MI455X با افزایش چشمگیر تخصیص رجیستر و یکپارچهسازی حافظهٔ کش، قصد دارد کارایی استنتاج مدلهای…

چارچوب NeMo AutoModel انویدیا اکنون امکان اجرای خط لوله تنظیمی LoRA برای مدل Qwen3-0.6B را تنها با یک پردازشگر گرافیکی فراهم میکند. این رویکرد با استفاده از دستورالعملهای YAML،…

کتابخانه NeMo Automodel با ادغام در Diffusers، امکان تنظیم دقیق مدلهای عظیم تصویر و ویدیو را بدون نیاز به تبدیل فرمت وزنها فراهم کرد. این ابزار آموزش توزیعشده در مقیاس صنعتی را…

استفاده از مدلهای بینایی-زبانی امکان شناسایی الگوهای پیچیده mixers را بهجای تحلیل دادههای خام، از طریق تحلیل بصری گرافهای تراکنش فراهم میکند. با تنظیم دقیق Qwen2-VL روی…

پیادهسازی متنباز جدیدی از توجه پراکنده Minimax (MSA)، آموزش مدلها با پنجرههای متنی میلیونی را روی GPUهای Hopper و Blackwell ممکن کرد. این ابزار با استفاده از پراکندگی بلوکی و…

یک ادغام استراتژیک بین SkyPilot و Hugging Face، امکان اجرای مدلهای هوش مصنوعی روی هر کلاودی را فراهم میکند در حالی که دادهها در Hub ذخیره میشوند. این اقدام هزینههای گزاف…

یک بررسی فنی عمیق نشان داد که خوشه ۱۶ پردازنده Blackwell با استفاده از Megatron-LM قادر به آموزش مدلهای MoE و ترکیبی است. این پروژه ثابت کرد که کنترل دقیق روی محورهای موازیسازی…

شرکت Photoroom جزئیات خط لوله دادههای مدل PRX 7B را افشا کرد. این استراتژی بر جایگزینی شرحهای کوتاه با توصیفات مفصل تولیدشده توسط مدلهای بینایی-زبانی تأکید دارد تا تنوع مفاهیم…

یک گردشکار فنی جدید نشان میدهد چگونه میتوان مدل Gemma-3 گوگل را با استفاده از بهینهسازی سیاست نسبی گروهی (GRPO) و آداپتورهای لورا برای ریاضیات تنظیم دقیق کرد. این فرآیند یک…

یک چارچوب جدید با ترکیب یادگیری بازنمایی پراکنده و یادگیری فدرال، پیشبینی دقیق خرابی در رباتهای نرم را ممکن کرد. این سامانه با محلی نگاه داشتن دادهها، نرخ دقت ۹۴ درصدی را با…