
درون prime-rl 0.6.0؛ سازوکار آموزش مدلهای عظیم ترکیب خبرهها
شرکت Prime Intellect چارچوب متنباز prime-rl 0.6.0 را برای یادگیری تقویتی مدلهای ترکیب خبرهها (MoE) با مقیاس تریلیون پارامتر منتشر کرد. این سیستم با جداسازی زیرساخت آموزش و…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۶۸۱ مقاله منتشر شده

شرکت Prime Intellect چارچوب متنباز prime-rl 0.6.0 را برای یادگیری تقویتی مدلهای ترکیب خبرهها (MoE) با مقیاس تریلیون پارامتر منتشر کرد. این سیستم با جداسازی زیرساخت آموزش و…

ابزار متنباز Sipcode با بهینهسازی بهداشت پنجرهٔ زمینه در Claude Code، نویزهای تکراری و خروجیهای طولانی ابزارها را حذف میکند. دادههای محصول نشان میدهد کاهش این تداخلات، منجر…

پروژه Dhi الگویی جامع برای ساخت محیط توسعه (IDE) مبتنی بر هوش مصنوعی ارائه میدهد که تماماً از ابزارهای متنباز استفاده میکند. این سیستم با ادغام مدلهای محلی و لایههای…

مدل GLM-5.2 با وجود قیمت پایینتر بهازای هر توکن، بهدلیل تولید حجم بالای توکنهای استدلالی داخلی، تنها ۳۰ تا ۳۵ درصد ارزانتر از رقبا تمام میشود. این تفاوت نشان میدهد که کاهش…

یک پروژه شبیهسازی شده نشان میدهد که یادگیری تقویتی عمیق چگونه میتواند تجارت باتریهای صنعتی را با پیشبینی جهشهای قیمتی بهینه کند. این سیستم با یادگیری روابط علی میان تقاضای…

بهروزرسانیهای جدید در کلودفلر، آزور و ورسل، اصطکاکهای انسانی در استقرار عاملهای هوش مصنوعی را حذف میکنند. برجستهترین تغییر، ظرفیت عظیم پنجرهٔ زمینه در مدل Kimi K2.7 Code…

پلتفرم Unsloth با عرضه نسخههای کوانتیزه GLM-5.2، اجرای مدل ۷۴۴ میلیارد پارامتری Z.ai را روی سختافزارهای مصرفکننده ممکن کرد. این بهروزرسانی فضای دیسک را از ۱.۵۱ ترابایت به ۲۱۷…

هوش مصنوعی در انجام تکالیفی که پاسخهای قابلسنجش دارند بیرقیب است، اما نمیتواند تعیین کند چه چیزی «ارزش خواستن» دارد. توانایی چارچوببندی سؤالات و اعمال سلیقه، همچنان مزیت…

شرکت xAI با افزودن حالت /goal به ابزار Grok Build، امکان برنامهریزی و اجرای خودکار وظایف پیچیده کدنویسی را فراهم کرد. این سیستم برخلاف پرامپتهای معمولی، تا زمان تأیید نهایی کد…

بوریس چرنی، خالق Claude Code، معتقد است عصر «حلقهها» (Loops) آغاز شده است؛ جایی که عاملهای هوش مصنوعی در چرخهای مداوم، یکدیگر را برای بهینهسازی کد هدایت میکنند. این رویکرد،…

عاملهای کدنویسی در تکمیل پروژههای پیچیده Swift شکست میخورند زیرا نمیتوانند قصد کاربر (Intent) را ارزیابی کرده یا تداخلهای زمان اجرا را مدیریت کنند. این نقص باعث ایجاد «تلهٔ…

پژوهشگران پیوندی ریاضیاتی میان درختهای تصمیم سلسلهمراتب و فرآیندهای انتشار یافتهاند. این یکپارچهسازی با معرفی یک اصل بهینهسازی مشترک، سرعت تولید دادههای جدولی را افزایش داده…