
۷ مهارت مهندسی که مانع از خطای رفتاری Claude Code میشوند
ارزیابی جدیدی از قابلیتهای Claude Code نشان میدهد ابزارهایی که متدولوژیهای سختگیرانه مانند TDD را تحمیل میکنند، بسیار مؤثرتر از ابزارهای صرفاً کدنویس هستند. این محدودیتها از…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۵٬۷۰۳ مقاله منتشر شده

ارزیابی جدیدی از قابلیتهای Claude Code نشان میدهد ابزارهایی که متدولوژیهای سختگیرانه مانند TDD را تحمیل میکنند، بسیار مؤثرتر از ابزارهای صرفاً کدنویس هستند. این محدودیتها از…

مقیاسدهی خودکار بر اساس CPU برای مدلهای زبانی شکست میخورد زیرا گلوگاه واقعی در پهنایباند حافظه و KV-cache است. توسعهدهندگان با جایگزینی معیارهای سنتی با «عمق صف»، میتوانند…

محک جدید Glasshouse v0.1 با تمرکز بر حافظه بلندمدت، مدلهای هوش مصنوعی را بهجای بازیابی ساده، بر اساس صداقت در مواجهه با دادههای متناقض میسنجد. این ابزار توهمات با اعتمادبهنفس…

مدل MiMo-V2.6-Pro بر اساس تازهترین دادههای Artificial Analysis، به پیشروترین مدل در دستهبندی وزنهای باز تبدیل شده است. این تحلیل توازن میان سطح هوش، سرعت استنتاج و هزینهٔ هر…

بایتدنس در نسل سوم مدل Seedance از نمایشهای بصری خیرهکننده به سمت ابزارهای تولیدی قابلاعتماد حرکت میکند. هدف این مدل حل چالشهای فیزیک، ثبات شخصیتها و ویرایشهای موضعی در…

پژوهشگران انویدیا با معرفی SoL-Pi، لایهی مدیریت ابزارها در عاملهای کدنویسی را بهینه کردند. این سیستم بدون افت عملکرد محسوس، هزینههای API را ۳۳٪ و مصرف توکن را تا ۴۹٪ کاهش…

علیبابا با هدف رسیدن به ابرهوش مصنوعی (ASI)، در حال توسعه مدلی با ۵ تا ۱۰ تریلیون پارامتر است. این استراتژی شامل ادغام تراشههای اختصاصی، زیرساخت ابری ۲۰ گیگاواتی و مکانیزم…

شیائومی سری MiMo-V2.6 را با یک مدل پرچمدار ۱.۰۲ تریلیون پارامتری منتشر کرد که در حال حاضر رتبه اول جدول مدلهای وزنباز Artificial Analysis را در اختیار دارد. این مدل با…

اجرای مستقیم کدهای تولیدشده توسط مدلهای زبانی بدون یک دروازه امنیتی میتواند منجر به نابودی دادهها یا نفوذ خاموش به سیستم شود. این چارچوب جدید، فراتر از پاکسازی متنی، بر…

مهاجمان با سرقت اعتبارنامههای CI، کدهای مخربی را به دو نسخه از کتابخانه LiteLLM تزریق کردند. این درِ پشتی (Backdoor) با هدف سرقت کلیدهای SSH، توکنهای ابری و API مدلهای زبانی از…

سازنده Oathra فاش کرد که عاملهای صوتی هوش مصنوعی اغلب پاسخهای مبهم را بهاشتباه بهعنوان رزرو موفق ثبت میکنند. این پروژه برای جلوگیری از «تکمیل کاذب»، یک لایه اعتبارسنجی مجزا…

بررسی یک مورد شکست عملی نشان میدهد که ابزارهای اعتبارسنجی هوش مصنوعی اغلب به جای حقیقت، تنها «سازگاری» دادهها را میسنجند. این وضعیت باعث میشود اطلاعات غلط اما یکدست، با…