
تحلیل ۱۸۴ مدل زبانی: توان عملیاتی شرکتها بیش از حد خوشبینانه است
بررسی ۱۸۴ مدل زبانی طی ۳۰ روز نشان میدهد اعداد توان عملیاتی اعلامشده توسط شرکتها اغلب بیش از حد خوشبینانه هستند. استفاده از مسیریابی هوشمند بین مدلهای ارزانقیمت و پرمیوم…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۳٬۵۸۴ مقاله منتشر شده

بررسی ۱۸۴ مدل زبانی طی ۳۰ روز نشان میدهد اعداد توان عملیاتی اعلامشده توسط شرکتها اغلب بیش از حد خوشبینانه هستند. استفاده از مسیریابی هوشمند بین مدلهای ارزانقیمت و پرمیوم…

پژوهشگران مجموعهای از مدلهای جهانی زبان به نام Qwen-AgentWorld را معرفی کردند که قادر به شبیهسازی محیطهای عاملمحور در هفت دامنه مختلف است. این مدلها با پیشبینی دینامیک محیط…

پروژه DiffusionBench با معرفی یک چارچوب ارزیابی یکپارچه، تلاش میکند معیارهای سنجش مدلهای ترنسفورمر انتشار را از تمرکز صرف بر ImageNet به تحلیلهای چندبعدی تغییر دهد. این ابزار…

مدل وزنباز M3 با پنجره متنی یک میلیون توکنی و قابلیتهای چندوجهی معرفی شد. این مدل با استفاده از معماری توجه پراکنده (MSA)، هزینه محاسباتی استنتاج در متون طولانی را بهشدت کاهش…

شرکت Superhuman برای ادغام ابزارهای تشخیص اصالت محتوا در دستیار نوشتاری خود، استارتاپ GPTZero را تصاحب کرد. این اقدام با هدف کاهش توهمات هوش مصنوعی و تضمین اصالت متون، بهویژه…

پروژه y محیط کدنویسی جدیدی است که اجازه میدهد رابط کاربری (UI) آن توسط عاملهای میزبانیشده بهصورت زنده تغییر کند. این سیستم با جداسازی هسته مرکزی از لایه کاربر، امنیت را در حین…

فیلیپ گولگی، مدیر سابق امنیت Go، معتقد است هوش مصنوعی زاینده کشف باگها را به یک کالای ارزان تبدیل کرده است. این تغییر، انگیزهی توسعهدهندگان برای برخورد ویژه با پژوهشگران امنیتی…

یک الگوی معماری جدید، واسطههای سنگین پیامرسانی مانند Redis یا Kafka را با یک «باس کاری» مبتنی بر فایل جایگزین میکند. این روش با تبدیل وضعیتها به فایلهای بادوام، قابلیت همکاری…

گیتهاب کوپایلت اکنون اجازه میدهد کاربران با استفاده از کلیدهای شخصی (BYOK)، مدلهای مختلف و ارائهدهندگان خارجی را متصل کنند. این تغییر، اولویت تیمهای مهندسی را از «بهترین مدل…

پلتفرم Atom با جایگزینی تصاویر خام با یک لایه توصیفی ساختاریافته، از توهم عاملها در تأیید موفقیت ابزارها جلوگیری میکند. این سیستم با ترکیب حافظه اپیزودیک و ماشین حالت، دقت اجرای…

یک چارچوب ساختاری جدید برای سیستمهای معاملاتی هوش مصنوعی، «اعداد بد» (خطاهای عددی) را از «روایتهای بد» (ادعاهای بدون دلیل) تفکیک میکند. این پروتکل از ارتقای سطح ادعاها به…

معماری جدیدی در برنامههای RAG با تشخیص قصد کاربر پیش از بازیابی دادهها، هزینههای API را بهشدت کاهش داده است. این متد با حذف دادههای زائد و پیشتولید نمودارها، از توهم مدلها…