
«تراکم دادهها» کلید برتری مدلهای کوچک بر مدلهای عظیم
تحلیل قوانین مقیاسپذیری نشان میدهد تعادل بین حجم داده و تعداد پارامترها بسیار مؤثرتر از افزایش صرف پارامترها است. یافتههای مطالعهٔ Chinchilla ثابت کرد مدلهای کوچکتر که بهطور…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۵٬۷۷۳ مقاله منتشر شده

تحلیل قوانین مقیاسپذیری نشان میدهد تعادل بین حجم داده و تعداد پارامترها بسیار مؤثرتر از افزایش صرف پارامترها است. یافتههای مطالعهٔ Chinchilla ثابت کرد مدلهای کوچکتر که بهطور…

پروتکل open-format جدیدی به نام QUALITY.md معرفی شده است که معیارهای کیفیت، امنیت و نگهداری نرمافزار را استاندارد میکند. این چارچوب به عاملهای هوش مصنوعی و انسانها اجازه…

آزمونی دقیق روی ۱۱ مدل زبانی بزرگ نشان داد که Fable-5 در بازسازی ساختارهای پیچیده کد و شناسایی باگهای منطقی، دقیقترین عملکرد را دارد. این مدل توانست با ارجاع دقیق به خطوط کد،…

لایه نهایی مدلهای زبانی بزرگ از فرمول ریاضی سال ۱۷۸۷ برای تبدیل لاجیتها به احتمال استفاده میکند. این دوگانگی ریاضی، مبنای عملکرد تابع سافتمکس و تنظیمات دمای مدل است.

یک آزمون استرس روی مدل محلی Ornith-1.0-35b نشان داد که عملکرد این مدل در مواجهه با پیچیدگیهای دنیای واقعی بهطور کامل فرو میپاشد. در حالی که مدل در وظایف ساده موفق بود، در تمامی…

تیمهای مهندسی بهجای ثبت دقیق تاریخچه جلسات، مهارتهای عاملهای هوش مصنوعی را بر اساس حدس و گمان بازنویسی میکنند. این رویکرد منجر به حذف لبههای حیاتی و جزئیات فنی میشود که در…

سیستم ZeroFS با تبدیل باکتهای S3 به فایلسیستمهای POSIX، تأخیرهای طولانی ذخیرهسازی ابری را حذف کرده است. این ابزار با استفاده از کش محلی و معماری Log-structured، امکان اجرای…

شاخص جدید RLI نشان میدهد نرخ خودکارسازی کارهای تخصصی در ۸ ماه گذشته بیش از ۴ برابر شده است. مدل Fable 5 با پیشتازی در این بنچمارک، استانداردهای جدیدی را برای اجرای پروژههای…

پژوهشهای جدید نشان میدهد دستاوردهای یادگیری تقویتی در مدلهای زبانی بزرگ بهجای توزیع در کل مدل، در چند لایه میانی متمرکز شدهاند. آموزش تنها یک لایه مجزا میتواند بخش بزرگی از…

توسعه هوش مصنوعی برای عبور از محدودیتهای انرژی و قوانین زمین به فضای مدار منتقل میشود. نخستین مدل زبانی بزرگ به نام nanoGPT با استفاده از پردازنده H100 در مدار زمین آموزش دیده…

ممنوعیت دسترسی به مدل Mythos توسط دولت آمریکا بهجای محافظت از امنیت ملی، به رقبای آسیایی کمک کرد تا اهداف فنی خود را دقیقاً شناسایی کنند. شرکتهای 360 چین و Sakana AI ژاپن…

پژوهشگران روشی برای آموزش سختافزارهای محاسباتی ترمودینامیکی با استفاده از پسانتشار (Backpropagation) ابداع کردند که دقتی مشابه شبکههای عصبی سنتی دارد. این رویکرد با جایگزینی…