
«تغییر استانداردهای اجرایی»؛ دستاورد مدل Fable 5 در بنچمارک RLI
شاخص جدید RLI نشان میدهد نرخ خودکارسازی کارهای تخصصی در ۸ ماه گذشته بیش از ۴ برابر شده است. مدل Fable 5 با پیشتازی در این بنچمارک، استانداردهای جدیدی را برای اجرای پروژههای…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۳٬۵۹۴ مقاله منتشر شده

شاخص جدید RLI نشان میدهد نرخ خودکارسازی کارهای تخصصی در ۸ ماه گذشته بیش از ۴ برابر شده است. مدل Fable 5 با پیشتازی در این بنچمارک، استانداردهای جدیدی را برای اجرای پروژههای…

پژوهشهای جدید نشان میدهد دستاوردهای یادگیری تقویتی در مدلهای زبانی بزرگ بهجای توزیع در کل مدل، در چند لایه میانی متمرکز شدهاند. آموزش تنها یک لایه مجزا میتواند بخش بزرگی از…

توسعه هوش مصنوعی برای عبور از محدودیتهای انرژی و قوانین زمین به فضای مدار منتقل میشود. نخستین مدل زبانی بزرگ به نام nanoGPT با استفاده از پردازنده H100 در مدار زمین آموزش دیده…

ممنوعیت دسترسی به مدل Mythos توسط دولت آمریکا بهجای محافظت از امنیت ملی، به رقبای آسیایی کمک کرد تا اهداف فنی خود را دقیقاً شناسایی کنند. شرکتهای 360 چین و Sakana AI ژاپن…

پژوهشگران روشی برای آموزش سختافزارهای محاسباتی ترمودینامیکی با استفاده از پسانتشار (Backpropagation) ابداع کردند که دقتی مشابه شبکههای عصبی سنتی دارد. این رویکرد با جایگزینی…

دادههای جدید شکاف عمیقی را میان بنچمارکهای کوتاه و وظایف واقعی-طولانی کدنویسی نشان میدهند. مدل Opus 4.8 در جریانهای کاری چندساعته و پیچیده، عملکردی بهمراتب برتر از رقبا دارد.

چارچوب جدید TypeScript به نام darwin-agents اجازه میدهد عاملهای هوش مصنوعی پرامپتهای خود را بازنویسی کنند، اما برای جلوگیری از افت کیفیت، آنها را از درگاههای سختگیرانه عبور…

پلتفرم MarketFish با ایجاد ۱۲۸ شخصیت متنوع از هوش مصنوعی، امکان تست ایدههای تجاری را پیش از تولید کد فراهم میکند. این ابزار بهجای پرسوجوهای ساده، ۳۰ دور شبیهسازی برای…

کورسور بنچمارک CursorBench 3.1 را برای ارزیابی عاملهای کدنویسی در محیطهای واقعی عرضه کرد. در حالی که مدل Fable 5 Max بالاترین دقت را دارد، مدلهای کوچکتری مانند Composer 2.5…

آزمایشهای مدل Gemma 4 2B روی سختافزار محلی نشان میدهد که فاصله میان تولید توابع ساده و تغییرات واقعی در مخازن کد بسیار زیاد است. در حالی که مدل در وظایف محدود موفق است، در…

تحلیل قوانین مقیاسپذیری OpenAI نشان میدهد عملکرد مدلها به تعادل دقیق میان محاسبات، داده و پارامترها وابسته است. این تغییر، دسترسی به سختافزارهای سطح بالا را به اصلیترین مانع…

پژوهشگران Unit 42 دریافتند مهاجمان با پیشبینی دامنههایی که مدلهای زبانی بهطور مداوم توهم میزنند، وبسایتهای جعلی میسازند. این روش که «اسکواتینگ شبحی» نام دارد، اجازه میدهد…