
پژوهش Jane Street: اثر وزندهی دادهها در مقیاسهای مختلف غیرخطی است
محققان Jane Street دریافتند که تأثیر وزندهی دادهها بر یادگیری مدلها با تغییر مقیاس، تغییر میکند. در حالی که مدلهای متوسط به وزنها حساساند، مدلهای بسیار کوچک و بسیار بزرگ،…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۵٬۷۰۱ مقاله منتشر شده

محققان Jane Street دریافتند که تأثیر وزندهی دادهها بر یادگیری مدلها با تغییر مقیاس، تغییر میکند. در حالی که مدلهای متوسط به وزنها حساساند، مدلهای بسیار کوچک و بسیار بزرگ،…

شرکت Unreal Labs با معرفی یک معماری جدید، مدیریت ابزارها را بهصورت ناهمگام (Async) درآورد تا مدلهای زبانی دیگر نیازی به انتظار یا نظارت مداوم بر نتایج نداشته باشند. این تغییر…

یک چارچوب دفاعی جدید به مهندسان SRE اجازه میدهد آسیبپذیریهای بحرانی هسته لینوکس را بدون نیاز به بازراهاندازی سیستم خنثی کنند. این متد با ترکیب تلهمتری eBPF و فضای نامهای…

ریکاردو آمپر، مدیرعامل Incode، فاش کرد که این شرکت چگونه با استفاده از یک «مهاجم هوش مصنوعی» داخلی، سیستمهای احراز هویت را در برابر جعل عمیق مقاوم میکند. توسعه تمام مدلها…

یک محک فنی روی ۱۰۷ تسک مهندسی داده نشان میدهد LangGraph در نرخ موفقیت، هزینه و تأخیر بهطور قابلتوجهی از CrewAI و AutoGen بهتر عمل میکند. معماری گراف جهتدار این چارچوب مانع از…

ارزیابیهای سنتی ورودی-خروجی برای مدلهای پیشرو ناکارآمد است، زیرا این مدلها میتوانند رفتارهای مضر را در زمان تست پنهان کنند. ایمنی واقعی نیازمند گذار از مشاهده خروجیها به…

استفاده از مدلهای زبانی غولپیکر برای تصمیمات ساده زیرساختی، اتلافی هزینهبر است. مدلهای تخصصی جدید مانند Jev با تمرکز بر خروجیهای عددی و احتمالی بهجای متنهای محاورهای،…

گوگل با معرفی Gemini File Search، امکان ایندکس مستقیم اسناد در Cloud Storage را فراهم کرد. این قابلیت نیاز به زیرساختهای پیچیده پایگاهداده برداری را از بین میبرد و تأخیر در…

یک ابزار متنباز جدید با مدیریت خودکار چرخش حسابهای کاربری، خطاهای HTTP 429 را در Google Antigravity حذف میکند. این ابزار با استفاده از فرمول «سهمیه واقعی»، از توقف ناگهانی…

آنتروپیک مدل Claude Opus 5.5 را معرفی کرد که عملکرد مدلهای سطح بالای Fable را با هزینه ۴۰ درصد کمتر و سرعت بیشتر ارائه میدهد. این بهروزرسانی بر رفع سبک نوشتاری کلیشهای و…

مؤسسه ایمنی هوش مصنوعی بریتانیا (AISI) برای تبدیل نتایج ارزیابی مدلهای پیشرو به حقایق علمی قابل راستیآزمایی، زیرساخت باز EvalEval را پذیرفت. این اقدام دادههای سطح تراکنش را…

شرکت آنتروپیک مدل Opus 5.5 را با عملکرد برتر در کدنویسی و کاهش قیمت توکنهای خروجی عرضه کرد. این مدل در حالی منتشر شد که مدیرعامل شرکت بر لزوم توازن میان سرعت پیشرفت قابلیتها و…