
آداپتورهای لورا دقت مدلهای زبانی را در موضوعات تخصصی افزایش دادند
آزمایشهای جدید روی موضوعات گیتار و نان خمیرترش نشان میدهد که استفاده از آداپتورهای لورا (LoRA) باعث کاهش نرخ Perplexity در دادههای هدف میشود. این نتایج تأیید میکند که…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۵٬۷۴۱ مقاله منتشر شده

آزمایشهای جدید روی موضوعات گیتار و نان خمیرترش نشان میدهد که استفاده از آداپتورهای لورا (LoRA) باعث کاهش نرخ Perplexity در دادههای هدف میشود. این نتایج تأیید میکند که…

ارزان شدن تولید کد توسط هوش مصنوعی منجر به پدیدهای به نام Slop-creep شده است؛ وضعیتی که در آن سیستمهای زائد و پیچیده تنها به دلیل هزینه کمِ ساخت، بدون تفکر استراتژیک انباشته…

آنتروپیک با طراحی یک لایهٔ واسط به نام Harness، مدلهای زبانی را که ذاتاً حافظه ندارند به عاملهایی تبدیل کرده است که میتوانند بهصورت مستقل کد بخوانند و تست بگیرند. این معماری…

NSA، CISA و FBI هشدار دادند که شرکتهای هوش مصنوعی چین با استفاده از تقطیر دانش در مقیاس صنعتی، قابلیتهای مدلهای آمریکایی مانند GPT-5 و Claude را استخراج میکنند. این استراتژی…

مایکروسافت سیستم اسکنر عاملمحور MDASH را برای شناسایی و تأیید حفرههای نرمافزاری در Azure Government مستقر کرد. این سامانه با جایگزینی استدلال هوش مصنوعی بهجای تطبیق الگو، نرخ…

قدرتمندترین مدل OpenAI یعنی GPT-6 Astra با پنجره متنی یک میلیون توکنی در دسترس کاربران سازمانی قرار گرفت. این مدل با قابلیت کنترل مستقیم رابطهای کاربری کامپیوتر، مرز بین…

بررسی فنی ۵۰۰۰ وبسایت برتر نشان میدهد صدها دامنه بهدلیل اشتباه در پیکربندی، دسترسی خزندههای جستوجوی هوش مصنوعی را مسدود کردهاند. این خطا باعث میشود این سایتها در پاسخهای…

عاملهای هوش مصنوعی از نقش ناظر خارج شده و به بازیگران فعال بازارهای پیشبینی تبدیل شدهاند. این حضور یک حلقه بازخورد ایجاد میکند که در آن پیشبینیهای مدلها، قیمتها را تغییر…

تحلیل هزینههای مالکیت نشان میدهد میزبانی شخصی مدلهای Llama تنها در حجمهای بالای پردازش توکن بهصرفه است. در حالی که APIها برای نیازهای کم برنده هستند، زیرساختهای خصوصی در…
پروژه Deltafin با استفاده از تکنیک استریم کردن وزنها از حافظه SSD، اجرای کامل مدل ۲.۸ تریلیون پارامتری Kimi K3 را روی سختافزارهای مصرفکننده اپل ممکن کرد. این رویکرد بهجای…

شرکت Inception مدل Mercury 2.5 را بهعنوان بزرگترین مدل زبانی مبتنی بر انتشار معرفی کرد که ۴۰٪ هوشمندتر از نسل قبل است. این مدل با توان عملیاتی ۱۱۰۷ توکن در ثانیه، برای کاربردهای…

یک معماری جدید با تفکیک ارزیابیهای گرانقیمت مدل زبانی از پرسوجوهای سریع، تحلیل هزاران مکالمه مشتری را ممکن کرده است. این سیستم با نرمالسازی دادهها پیش از استنتاج، همسویی…