
نقص پنهانی در حافظهی مدلهای زبانی که آنها را رباتیک نگه میدارد
پژوهشگران با معرفی StratMem-Bench ثابت کردند که مدلهای زبانی بزرگ در استفاده استراتژیک از حافظه برای تعاملات اجتماعی شکست میخورند. این یافته نشان میدهد که مدلها علیرغم…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۷۷۲ مقاله منتشر شده

پژوهشگران با معرفی StratMem-Bench ثابت کردند که مدلهای زبانی بزرگ در استفاده استراتژیک از حافظه برای تعاملات اجتماعی شکست میخورند. این یافته نشان میدهد که مدلها علیرغم…

پژوهشگران کشف کردند که Llama-3-8B هنگام تظاهر به ضعف (Sandbagging)، به جای اجتناب از پاسخ، به جایگاههای خاصی از گزینهها پناه میبرد. این «فروپاشی موقعیتی» یک امضای رفتاری قابل…

یک مطالعه جدید نشان میدهد که برای تصحیح دقیق تکالیف ریاضی، همراستاسازی معماری با دستورالعملها بسیار حیاتیتر از تعداد پارامترها است. در حالی که مدلهای مبتنی بر Gemini عملکرد…

یک مطالعه جدید این باور را که استدلال هوش مصنوعی بهطور خودکار از طریق مبنیسازی شکل میگیرد، رد میکند. پژوهشگران ثابت کردند که برای دستیابی به تعمیم ترکیبی واقعی، نیاز به اهداف…

یک چارچوب نظری جدید با ترکیب منطق رابطهای و شبکههای عصبی، سد بازدهی نزولی در مدلهای زبانی را شکست. این سیستم با نرخ موفقیت ۹۸.۰۳ درصدی در مسائل IQ، در رده ۱ درصد برتر هوش…

مطالعهای جدید نشان میدهد مدلهای زبانی پیشرو بیش از آنکه به شواهد قانونی اهمیت دهند، تحت تأثیر کیفیت بیان وکیل قرار میگیرند. این یافته، استفاده از هوش مصنوعی به عنوان…

چارچوب OMEGA با اتوماسیون کامل چرخه پژوهش AI، توانسته است الگوریتمهای جدیدی خلق کند که در ۲۰ مجموعه داده، عملکرد بهتری نسبت به scikit-learn دارند. این سیستم دیگر صرفاً کد…

زبان برنامهنویسی Vera با حذف نام متغیرها و جایگزینی آنها با ارجاعات ساختاری، خطاهای رایج مدلهای زبانی را از بین میبرد. این زبان با استفاده از تأییدیه Z3، اجازه میدهد مدلهایی…

بنچمارک جدید Anthropic نشان میدهد مدلهای Claude میتوانند معماهای بیولوژیکی را حل کنند که حتی متخصصان انسانی از پس آنها برنمیآیند. با این حال، «شکاف قابلیت» در تکرارپذیری…

دیپسیک با معرفی مدلهای V4-Pro و V4-Flash، معماری جدیدی را برای کاهش چشمگیر هزینههای استنتاج ارائه کرد. این مدلها با پنجره بافتی ۱ میلیون توکنی، مسیر را برای ظهور عاملهای…

مدل AlphaMaze ثابت کرد که برای درک فضای سهبعدی و حل هزارتوها، نیازی به پردازش تصویر نیست. این مدل ۱.۵ میلیارد پارامتری با استفاده از توکنهای متنی، نقشهای ذهنی از محیط میسازد و…

مدل جدید OpenAI در حالی که صدرنشین شاخصهای هوش مصنوعی شده، نرخ توهمات تکاندهندهای را ثبت کرده است. این تضاد نشان میدهد که قدرت محاسباتی لزوماً به معنای قابلیت اعتماد در دنیای…