پرش به محتوای اصلی

موضوع

آموزش توزیع‌شده

روشی برای آموزش مدل‌های هوش مصنوعی با استفاده از چندین پردازنده یا سرور به‌صورت همزمان

۷۳ مقاله منتشر شده

ساختار مدل‌های زبانی بزرگ Granite 4.2: معماری و روش آموزش
آموزش کاربردی

مدل‌های Granite 4.2 آی‌بی‌ام با یادگیری تقویتی مرحله‌بندی‌شده استدلال می‌کنند

آی‌بی‌ام خانواده مدل‌های استدلالی Granite 4.2 را با وزن‌های باز منتشر کرد که بر اساس ۱۵ تریلیون توکن آموزش دیده‌اند. این مدل‌ها با استفاده از یک خط لوله یادگیری تقویتی…

۲۵ دقیقه خواندن۲
ZeRO و FSDP: چگونه آموزش LLM از محدودیت حافظه GPU فراتر می‌رود
آموزش کاربردی

تحلیل فنی: توزیع حافظه در خوشه‌های پردازشی، گلوگاه مدل‌های عظیم را می‌زداید

آموزش مدل‌های عظیم زبانی اغلب به‌جای قدرت پردازشی، با محدودیت حافظه GPU متوقف می‌شود. ZeRO و FSDP با توزیع تکه‌های مدل در کل خوشه، این گلوگاه حافظه را به یک مسئله مدیریت‌پذیر در…

۱۳ دقیقه خواندن
یادگیری پای‌تورچ، ساختن ناخواسته چارچوب آموزش هوش مصنوعی شخصی

درون Tensorless؛ چارچوبی برای خودکارسازی آموزش مدل‌های هوش مصنوعی

یک توسعه‌دهنده با هدف ساده‌سازی فرآیند آموزش مدل‌ها، فریم‌ورک متن‌باز Tensorless را معرفی کرد. این ابزار با حذف تنظیمات پیچیده و کاهش حجم وابستگی‌ها، مسیر تبدیل داده‌های خام به…

۹ دقیقه خواندن
استفاده اوپن‌ای‌ای از انویدیا GB200 NVL72 برای آموزش مدل‌ها با گسترش استقرار روبین

OpenAI برای آموزش نسل جدید مدل‌ها به سیستم‌های رک‌مقیاس GB200 روی آورد

انویدیا تأیید کرد که OpenAI از سیستم GB200 NVL72 برای آموزش و استنتاج مدل‌های پیشرو استفاده می‌کند. این تغییر نشان‌دهنده گذار از تمرکز بر تعداد GPUها به سمت زیرساخت‌های یکپارچه در…

۵ دقیقه خواندن۴
شبکه‌های نسبیت ۲۲ میلیون دلار برای توسعه فیبر نوری سریع‌تر در مراکز داده جذب کرد

فیبر توخالی در برابر شیشه‌ای؛ سرعت بیشتر در انتقال داده‌های AI

شرکت Relativity Networks با جذب ۲۲ میلیون دلار سرمایه، فناوری فیبر نوری توخالی را برای انتقال داده‌ها با سرعت ۳۰٪ بیشتر از شیشه‌های سنتی عرضه می‌کند. این پیشرفت به توسعه‌دهندگان…

۳ دقیقه خواندن۲
خوشه یکسان، ۳۳ امتیاز بهره‌وری بیشتر: تغییر کرده ترتیب بود
آموزش کاربردی

تخصیص هوشمند GPU بهره‌وری خوشه‌های پردازشی را ۳۳ درصد افزایش داد

یک تخصیص‌کننده جدید با جایگزینی زمان‌بندی FIFO، ظرفیت‌های بلااستفاده GPU را بازیابی کرده و بهره‌وری را در سناریوهای سنگین آموزش ۳۳ درصد بالا برده است. این سیستم با تبدیل تقاضای…

۱۳ دقیقه خواندن۲
موتور Colibri: اجرای مدل‌های عظیم MoE روی شبکه همتا به همتا با زبان C خالص.
آموزش کاربردی

Lumabri مدل‌های عظیم MoE را روی شبکه‌ای از پردازنده‌های معمولی اجرا می‌کند

پروژه Lumabri با توزیع وزن‌ها و محاسبات میان گره‌های Peer-to-Peer، اجرای مدل‌های غول‌پیکر ترکیب خبره‌ها را بدون نیاز به GPU ممکن کرده است. این سیستم خروجی‌های کاملاً یکسانی را روی…

۲۱ دقیقه خواندن۲
توسعه بزرگ‌ترین مدل هوش مصنوعی چین در بایت‌دنس
اخبار کوتاه روزانهگزارش تأییدنشده

بایت‌دنس با مدل ۱۰ تریلیون پارامتری به رقابت با آنتروپیک می‌رود

شرکت بایت‌دنس در حال آموزش مدل عظیمی با ۱۰ تریلیون پارامتر است تا جایگاه خود را در برابر سیستم‌های پیشرو غربی تثبیت کند. این پروژه با هدف رسیدن به توانمندی‌های مدل Mythos 5…

۱ دقیقه خواندن۲