
گزارش arXiv: ارتقای نرخ حل مسائل SWE-bench به ۳۲.۲٪ با روش SRFT
روش جدید SRFT با فیلتر کردن گامهای اشتباه به جای حذف کل مسیرهای ناموفق، نرخ حل مسائل در بنچمارک SWE-bench Verified را به ۳۲.۲٪ رسانده است. این رویکرد به مدلها میآموزد که چگونه…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۸۳۴ مقاله منتشر شده

روش جدید SRFT با فیلتر کردن گامهای اشتباه به جای حذف کل مسیرهای ناموفق، نرخ حل مسائل در بنچمارک SWE-bench Verified را به ۳۲.۲٪ رسانده است. این رویکرد به مدلها میآموزد که چگونه…

پژوهشگران کشف کردند که مدلهای زبانی حتی پس از تنظیمات مخرب، یک «فضای شخصیتی» پایدار دارند. با تقویت بردارهای معنایی خاص، میتوان نرخ عدم همراستاسازی را از ۴۰٪ به کمتر از ۳٪ کاهش…

چارچوب جدیدی به نام Metis با استفاده از یک حلقه فراشناختی تکاملی، توانسته است با نرخ موفقیت ۸۹.۲ درصد از سدهای امنیتی مدلهای پیشرو عبور کند. این سیستم بهطور ویژه مدلهای GPT-5 و…

پژوهشگران پروتکل سختگیرانه Acceptance Cards را برای تأیید دفاعهای تنظیم دقیق معرفی کردند. نتایج اولیه نشان میدهد SafeLoRA در مدل Gemma-2-2B-it شکست خورده و ادعاهای ایمنی فعلی…

پژوهشگران با معرفی بنچمارک ThreatCore نشان دادند که مدلهای زبانی بزرگ در شناسایی تهدیدات غیرمستقیم ضعف شدیدی دارند. این مطالعه پیشنهاد میکند که استفاده از برچسبگذاری نقش معنایی…

پژوهش جدید StereoTales نشان میدهد تمام مدلهای زبانی بزرگ، بدون توجه به اندازه یا سازنده، در تولید داستانهای باز، کلیشههای مضر اجتماعی را بازتولید میکنند. این سوگیریها ایستا…

تیم Phoenix و Mistral AI مدل Phoenix-VL 1.5 Medium را معرفی کردند؛ یک مدل چندوجهی با ۱۲۳ میلیارد پارامتر که در عین حفظ توانمندیهای جهانی در STEM، در حقوق و فرهنگ سنگاپور به سطح…

چارچوب استدلالی جدیدی به نام SFFL با تفکیک مسیرهای استدلال برای هر مودالیته، توهمات در مدلهای زبانی چندوجهی را بهطور چشمگیری کاهش داده است. این متد دقت کلی را ۵.۱۶٪ و نرخ کاهش…

متد جدیدی به نام TRACE با هدفگیری توکنهای حیاتی در فرآیند تقطیر، نرخ خطای مدلهای استدلالی را کاهش داد. این رویکرد برخلاف روشهای متراکم، از نشت اطلاعات ممتاز جلوگیری کرده و…

بنچمارکهای سنجش سمیت در مدلهای زبانی بزرگ به دلیل سوگیریهای ساختاری، نتایج غیرقابلاعتمادی ارائه میدهند. پژوهشی جدید نشان میدهد تغییرات ساده در نوع تکلیف یا دامنه دادهها…

سیستم دفاعی PRISM با رصد لحظهای دینامیکهای تولید متن، نشت دادههای حساس در خطلولههای چند-عاملی را بهطور کامل متوقف کرده است. این ابزار بدون کاهش کیفیت خروجی، نرخ نشت در سطح…

چارچوب GuardAD با تبدیل ایمنی به یک وضعیت منطقی پویا، نرخ تصادفات در مدلهای زبانی چندوجهی (MLLM) را ۳۲.۰۷٪ کاهش داده است. این سیستم بدون نیاز به بازآموزی مدل، خطرات پنهان را…