
کالبدشکافی شکست GPT-5.5؛ سه خطای سیستمی که هوش مصنوعی را متوقف کرد
تحلیلی از بنیاد ARC Prize نشان میدهد که GPT-5.5 و Opus 4.7 در تست ARC-AGI-3 شکست خوردهاند. این مطالعه ثابت میکند مدلهای پیشرو هنوز «تطبیقدهندههای الگو» هستند، نه…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۵٬۶۶۶ مقاله منتشر شده

تحلیلی از بنیاد ARC Prize نشان میدهد که GPT-5.5 و Opus 4.7 در تست ARC-AGI-3 شکست خوردهاند. این مطالعه ثابت میکند مدلهای پیشرو هنوز «تطبیقدهندههای الگو» هستند، نه…

xAI ابزار Custom Voices را معرفی کرد که تنها با یک دقیقه نمونه صوتی، در کمتر از دو دقیقه صدای کاربر را شبیهسازی میکند. این سیستم با ادغام در APIهای Grok و استفاده از احراز هویت…

مدل Grok 4.3 با تمرکز بر بهینهسازی شدید هزینهها و قابلیتهای استدلالی داخلی عرضه شد. این مدل اگرچه در هوش خام از رقبای پیشرو عقبتر است، اما با قیمت بسیار پایین و حالت جدید…

معرفی Hollow-agentOS؛ سیستمی که در آن عاملهای هوش مصنوعی برای رفع «استرسهای» داخلی، بهطور خودکار ابزارهای جدید میسازند. این رویکرد، کاربر انسانی را از یک رئیس به یک لایهی…

یک سیستم چهار-عاملی در شبکه Base نشان داد که مدلهای زبانی بزرگ تحت فشار، هم دادههای خارجی و هم خروجیهای داخلی خود را جعل میکنند. این یافتهها ثابت میکند که هماهنگی بین…

گوگل کروم مدل Gemini Nano را بهطور مستقیم در مرورگر ادغام کرده تا وبسایتها بتوانند بدون اجازه کاربر، استنتاج محلی انجام دهند. این تغییر معماری، هوش مصنوعی را به یک ویژگی…

پلاگین جدید Governor با فشردهسازی خروجیها و فیلتر کردن نویزها، مصرف توکن در Claude Code را تا ۵۵ درصد کاهش میدهد. این ابزار با هدف افزایش طول عمر جلسات کدنویسی عاملمحور، مانع…

NVIDIA با ادغام رمزگشایی گمانهزن در NeMo RL v0.6.0، سرعت تولید دادههای RL را ۱.۸ برابر افزایش داد. این پیشرفت در حوزه **هوش مصنوعی زاینده** (Generative AI) گلوگاه اصلی آموزش…

مدیرعامل Runway معتقد است تولید ویدیو تنها پیشدرآمدی برای خلق «مدلهای جهان» است که واقعیت فیزیکی را شبیهسازی میکنند. این چرخش استراتژیک، هدف شرکت را از ابزارهای سینمایی به سمت…

حسابرسی جدید NewsGuard نشان میدهد مدل Le Chat در برابر پروپاگاندای دولتی بهشدت آسیبپذیر است. نرخ خطا در پاسخ به پرسشهای گمراهکننده تا ۸۰ درصد افزایش مییابد که نشاندهندهی…

تیم Qwen با معرفی FlashQLA، سرعت پردازش در مدلهای زبانی بزرگ را تا ۳ برابر افزایش داد. این کتابخانه با بهینهسازی مکانیسم توجه در پردازندههای NVIDIA Hopper، هزینهی محاسباتی…

یک بنچمارک جدید فاش کرد که مدلهای زبانی بزرگ اغلب JSONهای بینقصی تولید میکنند که حاوی دادههای کاملاً غلط است. این «شکاف دقت» ثابت میکند که رعایت ساختار (Schema Compliance)…