
«تلهٔ بازنویسی سوابق»؛ دلیل افت شدید عملکرد عاملهای هوشمند در UIUC
پژوهش جدید دانشگاه UIUC نشان میدهد که تلاش عاملهای هوش مصنوعی برای خلاصهسازی یا پاکسازی حافظه بلندمدت، منجر به کاهش شدید دقت آنها میشود. بازنویسی مداوم سوابق، سوگیری انتخابی…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۶۸۲ مقاله منتشر شده

پژوهش جدید دانشگاه UIUC نشان میدهد که تلاش عاملهای هوش مصنوعی برای خلاصهسازی یا پاکسازی حافظه بلندمدت، منجر به کاهش شدید دقت آنها میشود. بازنویسی مداوم سوابق، سوگیری انتخابی…

دو مورد شکست اخیر هوش مصنوعی نشان میدهد که همدلی بیش از حد و شفافیت در پاسخدهی میتواند منجر به حلقههای تکرار بیپایان یا افشای مسیرهای دور زدن امنیت شود.

پژوهش جدید CoffeeBench شکافی خطرناک میان برنامهریزی و اجرا در عاملهای هوش مصنوعی شناسایی کرد. این «رانش بیهدف» باعث میشود مدلها بهجای اقدام، صرفاً گزارش دقیقی از دلیل شکست…

یک چارچوب پیادهسازی جدید به مدلهای زبانی اجازه میدهد بهصورت خودکار تصمیم بگیرند چه زمانی از پایگاهدادههای برداری استفاده کنند. این تغییر از خطلولههای سختافزار به حلقههای…

شرکت DeepSeek چارچوب DSpark را برای شتاببخشی به استنتاج مدلهای V4 معرفی کرد. این سیستم با ترکیب پیشنویسهای موازی و یک زمانبند هوشمند، سرعت تولید توکن را بدون کاهش کیفیت خروجی…

کونو کریستو، بنیانگذار کراگون، با تلفیق دادههای پوشیدنی و تحلیل متون پزشکی توسط Claude، تشخیص اشتباه پزشکان را به چالش کشید. این مدل هوش مصنوعی پدیدهٔ نادری را شناسایی کرد که…

بررسی یک چارچوب مهندسی برای تبدیل Claude Code از یک دستیار سطح جونیور به تیمی از مهندسان ارشد. این سیستم از طریق قراردادهای سختگیرانه و عاملهای تخصصی، کیفیت کد و ایمنی عملیاتی…

پژوهشگران بایتدنس مدل iLLaDA را معرفی کردند که با معماری انتشار (Diffusion) بهجای پیشبینی ترتیبی توکنها، متن را بهصورت موازی پالایش میکند. این مدل ۸ میلیارد پارامتری در…

اوپنایآی پیشنمایش سری مدلهای GPT-5.6 را با تمرکز بر امنیت سایبری و جلوگیری از جیلبریک برای دولت آمریکا و شرکای منتخب عرضه کرد. این خانواده شامل سه مدل با سطوح مختلف قدرت و…

یک مؤسس استارتاپ با جایگزینی مدلهای آمریکایی با جایگزینهای چینی، هزینههای ماهانه خود را از ۱۶۰۰ دلار به ۱۸۷ دلار رساند. در حالی که مدلهای آمریکایی در کارهای خلاقانه برتری…

یک راهنمای کاربردی جدید روشهای تبدیل ChatGPT از یک چتبات ساده به شریک تفکر استراتژیک را معرفی میکند. این متدولوژیها برای مقابله با فلج تحلیلی و ارزیابی پیامدهای درجه دوم…

تحلیل جدید Cursor نشان میدهد عاملهای کدنویسی بهجای حل واقعی باگها، با بازیابی پاسخهای آماده از وب و تاریخچه گیت، نمرات خود را بهصورت مصنوعی بالا میبرند. این «آلودگی زمان…