پرش به محتوای اصلی

دسته‌بندی

تحلیل و بررسی تخصصی

تحلیل‌های عمیق مدل‌ها، مقالات و بنچمارک‌ها — پیش‌چاپ‌ها، ارزیابی‌ها، مدل‌های زبانی پیشرو و پژوهش همراستاسازی.

۵٬۷۷۳ مقاله منتشر شده

تحلیل پست وبلاگ Scaling Law اثر ونگ لی
آموزش کاربردی

«تراکم داده‌ها» کلید برتری مدل‌های کوچک بر مدل‌های عظیم

تحلیل قوانین مقیاس‌پذیری نشان می‌دهد تعادل بین حجم داده و تعداد پارامترها بسیار مؤثرتر از افزایش صرف پارامترها است. یافته‌های مطالعهٔ Chinchilla ثابت کرد مدل‌های کوچک‌تر که به‌طور…

۶ دقیقه خواندن۱
مغایرت‌های خدایان: افسانه و ۱۰ مدل زبانی بزرگ در بازآرایی کد. مقایسه.
آموزش کاربردی

کدام مدل زبانی بازسازی ساختارهای پیچیده کد را دقیق‌تر انجام می‌دهد؟

آزمونی دقیق روی ۱۱ مدل زبانی بزرگ نشان داد که Fable-5 در بازسازی ساختارهای پیچیده کد و شناسایی باگ‌های منطقی، دقیق‌ترین عملکرد را دارد. این مدل توانست با ارجاع دقیق به خطوط کد،…

۴۲ دقیقه خواندن۲
نوشتن از روی حافظه را متوقف کنید: مهارت‌های واقعی با تمرین هدفمند
آموزش کاربردی

درون سازوکار حذف لبه‌های فنی هنگام انتقال مهارت‌های عامل‌های هوشمند

تیم‌های مهندسی به‌جای ثبت دقیق تاریخچه جلسات، مهارت‌های عامل‌های هوش مصنوعی را بر اساس حدس و گمان بازنویسی می‌کنند. این رویکرد منجر به حذف لبه‌های حیاتی و جزئیات فنی می‌شود که در…

۵ دقیقه خواندن۱
ZeroFS — استفاده از S3 به‌عنوان فضای ذخیره‌سازی اصلی
آموزش کاربردی

ZeroFS ذخیره‌سازی ابری S3 را به دیسک‌های POSIX با سرعت میکروثانیه تبدیل کرد

سیستم ZeroFS با تبدیل باکت‌های S3 به فایل‌سیستم‌های POSIX، تأخیرهای طولانی ذخیره‌سازی ابری را حذف کرده است. این ابزار با استفاده از کش محلی و معماری Log-structured، امکان اجرای…

۵ دقیقه خواندن۱
آیا یک لایه کافی است؟ آموزش یک لایه ترنسفورمر می‌تواند با آموزش تقویتی کامل برابری کند.

آیا آموزش یک لایه مجزا برای بهبود عملکرد مدل‌های زبانی کافی است؟

پژوهش‌های جدید نشان می‌دهد دستاوردهای یادگیری تقویتی در مدل‌های زبانی بزرگ به‌جای توزیع در کل مدل، در چند لایه میانی متمرکز شده‌اند. آموزش تنها یک لایه مجزا می‌تواند بخش بزرگی از…

۲ دقیقه خواندن۱
نظر توالی شماره ۸۸۸: همه‌چیز درباره مسابقه فضایی هوش مصنوعی

مدار زمین: راهکار جدید برای عبور از محدودیت‌های انرژی هوش مصنوعی

توسعه هوش مصنوعی برای عبور از محدودیت‌های انرژی و قوانین زمین به فضای مدار منتقل می‌شود. نخستین مدل زبانی بزرگ به نام nanoGPT با استفاده از پردازنده H100 در مدار زمین آموزش دیده…

۱ دقیقه خواندن
چیپ‌های ترمودینامیکی یاد گرفتند تصاویر را بدون افت دقت تشخیص دهند

سخت‌افزار ترمودینامیکی در برابر مدل‌های سنتی؛ توازن میان دقت و انرژی

پژوهشگران روشی برای آموزش سخت‌افزارهای محاسباتی ترمودینامیکی با استفاده از پس‌انتشار (Backpropagation) ابداع کردند که دقتی مشابه شبکه‌های عصبی سنتی دارد. این رویکرد با جایگزینی…

۲ دقیقه خواندن