چرا Muon جایگزین AdamW در آموزش مدلهای ترلیونی میشود؟
پشتیبانی رسمی DeepSpeed از بهینهساز Muon، حافظهی مورد نیاز برای حالتهای بهینهساز را ۴۵٪ کاهش داد. این رویکرد ترکیبی به آزمایشگاههای پیشرو اجازه میدهد مدلهای عظیم را سریعتر…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۵٬۷۸۲ مقاله منتشر شده
پشتیبانی رسمی DeepSpeed از بهینهساز Muon، حافظهی مورد نیاز برای حالتهای بهینهساز را ۴۵٪ کاهش داد. این رویکرد ترکیبی به آزمایشگاههای پیشرو اجازه میدهد مدلهای عظیم را سریعتر…
پلتفرم متنباز Cast با انتقال قوانین دسترسی از پرامپتها به فایلهای تنظیمات سخت، امنیت عاملهای هوش مصنوعی را تضمین میکند. این ابزار اجازه میدهد تیمها بدون ترس از نشت اطلاعات،…
شرکت Perplexity سیستمی را معرفی کرد که وظایف هوش مصنوعی را بر اساس حساسیت دادهها و نیاز پردازشی، بین سختافزار محلی و ابر تقسیم میکند. این ارکستراتور هیبریدی از جولای ۲۰۲۶ با…
مدل GPT-5.4 در اصلاح کدهای برنامهنویسی دچار «ویرایش بیشازحد» میشود و بدون افزایش دقت، ۶.۵ برابر بیشتر از Claude Opus 4.6 توکن تولید میکند. این شکاف کارایی منجر به اتلاف منابع…
جنسن هوانگ، مدیرعامل انویدیا، با حمایت علنی و سرمایهگذاری ۲ میلیارد دلاری در شرکت Marvell، سیگنالی از تغییر مرکز ثقل سختافزاری AI داد. این حرکت نشان میدهد که محدودیت اصلی رشد…
Contorium v2 یک لایهی زماناجرای دائمی معرفی کرده است تا عاملهای کدنویسی هنگام جابجایی بین ابزارها، متن پروژه را فراموش نکنند. این سیستم وضعیت فضای کاری را میان محیطهای توسعه…
ربات Reachy Mini اکنون با پشتیبانی از پروتکل MCP، قابلیت افزودن ابزارهای از راه دور از طریق Hugging Face Spaces را دارد. کاربران میتوانند بدون دستکاری کدهای پایتونی ربات،…
تنظیم دقیق نظارتی (SFT) اغلب در توقف حلقههای تکرار در وظایف ساختاریافته شکست میخورد. DharmaOCR با تبدیل این خروجیهای معیوب به سیگنالهای منفی در بهینهسازی مستقیم ترجیحات…
ائتلافی از ۱۶ ریاضیدان برجسته و اتحادیه بینالمللی ریاضیات با انتشار اعلامیه لایدن، وضعیت پژوهشهای ریاضی را به خطر افتاده اعلام کردند. این مانیفست هشدار میدهد که اثباتهای…
سرمایهگذاری ۵ میلیارد دلاری انویدیا و همکاری استراتژیک گوگل، بازگشت اینتل به مرکز قدرت هوش مصنوعی را تثبیت کرد. این اقدامات، پردازندههای اینتل را از یک پشتیبان ساده به لایهی…
IBM استدلال میکند که مقیاسپذیری هوش مصنوعی سازمانی نیازمند «منطق عاملمحور» (Agent Logic) است تا مدلهای زبانی بزرگ را هدایت کند. این رویکرد با استفاده از گرافهای دانش، توهمات…
شرکت H خانواده مدلهای Holo3.1 را برای استقرار محلی و موبایلی عاملهای کامپیوتری معرفی کرد. این بهروزرسانی با بهرهگیری از کوانتایزیشن NVFP4، تأخیر اجرای هر گام را از ۶.۸ ثانیه…