
تست نفوذ مدلهای استدلالی بزرگ: معیاری تازه برای سنجش اعتمادپذیری
پژوهشگران معیار RT-LRM را برای ارزیابی صداقت، امنیت و کارایی مدلهای استدلالی بزرگ پیشنهاد کردهاند. یافتهها نشان میدهد این مدلها در مقایسه با مدلهای زبانی معمولی، با چالشهای…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۵٬۶۵۶ مقاله منتشر شده

پژوهشگران معیار RT-LRM را برای ارزیابی صداقت، امنیت و کارایی مدلهای استدلالی بزرگ پیشنهاد کردهاند. یافتهها نشان میدهد این مدلها در مقایسه با مدلهای زبانی معمولی، با چالشهای…

پژوهشگران روش «رمزگشایی از طریق اختلال» (DeP) را معرفی کردهاند که بدون نیاز به آموزش مجدد، توهمات مدلهای زبانی چندوجهی را کاهش میدهد. این روش با اعمال مداخلات متنی کنترلشده در…

پژوهشگران در نخستین مطالعه جامع، نزدیک به ۱۷۰۰۰ اجرای عامل هوش مصنوعی را بررسی کردند. یافتهها نشان داد که برنامههای ساختارمند عملکرد را بهبود میبخشند، اما برنامههای ضعیف…

پژوهشگران چارچوبی به نام اسپکباند معرفی کردهاند که با استفاده از تابکاری دمایی لایهبهلایه و کرانگذاری تطبیقی بر طول حدس، سرعت استنتاج مدلهای زبانی را تا ۲.۳۳ برابر افزایش…

پژوهشگران چارچوبی یکپارچه به نام Text2Model و Text2Zinc معرفی کردهاند که با بهرهگیری از مدلهای زبانی بزرگ، مشکلات بهینهسازی را از زبان طبیعی به مدلهای رسمی تبدیل میکند. این…

پژوهشگران کمریزنر را معرفی کردند؛ چارچوبی که با استدلال ساختاریافته، درک حرکت دوربین در ویدئو را بهبود میدهد و به دستاوردهای دقت قابلتوجهی در معیارهای ارزیابی دست یافته است.

چارچوب RationalRewards مدلهای پاداش چندبُعدی را معرفی میکند که در زمان آموزش و آزمایش، کیفیت تولیدکنندههای تصویر را بهبود میبخشند. این مدل به دقت بالا در پیشبینی ترجیحات دست…

پژوهشگران چارچوب «MemJack» را معرفی کردهاند؛ یک سیستم حمله چندعامله که با بهرهگیری از ساختارهای معنایی تصاویر، مدلهای بینایی-زبانی را هدف قرار میدهد. این روش در آزمایشها علیه…

پژوهشگران چارچوب مُدیکس را توسعه دادهاند که بدون نیاز به آموزش، نحوه تخصیص موقعیت در مدلهای بینایی-زبان را بر اساس چگالی اطلاعات در هر بخش تنظیم میکند. این روش با اختصاص دقت…

IDEA با تبدیل فرایند تصمیمگیری مدلهای زبانی بزرگ به یک مدل پارامتری قابل تفسیر، مشکل احتمالهای نادقیق، توضیحات غیرواقعی و ناتوانی در ادغام دقیق دانش تخصصی را حل میکند. این…

پژوهشگران rDPO را معرفی کردند؛ چارچوبی نوآورانه که از چکلیستهای معیارمحور خاص هر نمونه برای بهبود استدلال بصری در سیستمهای هوش مصنوعی چندوجهی بهره میبرد. این روش با ارائه…

پژوهشگران رویکرد «استدلال مبتنی بر محاسبه» (CGR) را معرفی کردهاند که در آن، محاسبات قطعی پیش از تولید پاسخ توسط مدلهای زبانی، اطلاعات فضایی را تأیید میکند. این روش خطاهای…