پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۶۵ مقاله منتشر شده

گزارش arXiv: افزایش ۴۲.۴ امتیازی موفقیت ویرایش مولکولی با چارچوب SLIM

گزارش arXiv: افزایش ۴۲.۴ امتیازی موفقیت ویرایش مولکولی با چارچوب SLIM

پژوهشگران چارچوب SLIM را معرفی کردند که با استفاده از اتوانکودرهای پراکنده، امکان ویرایش دقیق ویژگی‌های مولکولی را بدون تغییر در پارامترهای مدل فراهم می‌کند. این روش نرخ موفقیت در…

۲ دقیقه خواندن
گزارش arXiv: نشت موضوعی داده‌های محرمانه در ۷۹٪ از مدل‌های زبانی پیشرو

گزارش arXiv: نشت موضوعی داده‌های محرمانه در ۷۹٪ از مدل‌های زبانی پیشرو

مدل‌های زبانی پیشرو حتی با وجود دستورات صریح برای حفظ محرمانگی، اطلاعات را از طریق تم‌ها و تصویرسازی‌ها فاش می‌کنند. پژوهشی جدید نشان می‌دهد این نشت موضوعی در ۷۹٪ موارد رخ می‌دهد…

۲ دقیقه خواندن
سازوکار «اثر تماشاگر»: تحلیل تخریب استدلال در سیستم‌های چندعاملی هوش مصنوعی

سازوکار «اثر تماشاگر»: تحلیل تخریب استدلال در سیستم‌های چندعاملی هوش مصنوعی

همکاری بین عامل‌های هوش مصنوعی لزوماً منجر به نتایج دقیق‌تر نمی‌شود و حتی می‌تواند استدلال را تخریب کند. پژوهش‌های جدید نشان می‌دهند مدل‌ها به دلیل «تنبلی شناختی»، منطق درست خود…

۲ دقیقه خواندن
سازوکار SVV: کاهش نرخ عدم همراستاسازی مدل‌های زبانی به زیر ۳٪

سازوکار SVV: کاهش نرخ عدم همراستاسازی مدل‌های زبانی به زیر ۳٪

پژوهشگران کشف کردند که مدل‌های زبانی حتی پس از تنظیمات مخرب، یک «فضای شخصیتی» پایدار دارند. با تقویت بردارهای معنایی خاص، می‌توان نرخ عدم همراستاسازی را از ۴۰٪ به کمتر از ۳٪ کاهش…

۲ دقیقه خواندن
سازوکار Metis: چگونه یک حلقه فراشناختی سدهای امنیتی GPT-5 و O1 را می‌شکند؟

سازوکار Metis: چگونه یک حلقه فراشناختی سدهای امنیتی GPT-5 و O1 را می‌شکند؟

چارچوب جدیدی به نام Metis با استفاده از یک حلقه فراشناختی تکاملی، توانسته است با نرخ موفقیت ۸۹.۲ درصد از سدهای امنیتی مدل‌های پیشرو عبور کند. این سیستم به‌طور ویژه مدل‌های GPT-5 و…

۲ دقیقه خواندن
ThreatCore: چرا تشخیص «قصد آسیب» دشوارتر از شناسایی کلمات رکیک است؟

ThreatCore: چرا تشخیص «قصد آسیب» دشوارتر از شناسایی کلمات رکیک است؟

پژوهشگران با معرفی بنچمارک ThreatCore نشان دادند که مدل‌های زبانی بزرگ در شناسایی تهدیدات غیرمستقیم ضعف شدیدی دارند. این مطالعه پیشنهاد می‌کند که استفاده از برچسب‌گذاری نقش معنایی…

۲ دقیقه خواندن
چرا قوانین مقیاس‌پذیری در حذف کلیشه‌های اجتماعی مدل‌های زبانی شکست می‌خورند؟

چرا قوانین مقیاس‌پذیری در حذف کلیشه‌های اجتماعی مدل‌های زبانی شکست می‌خورند؟

پژوهش جدید StereoTales نشان می‌دهد تمام مدل‌های زبانی بزرگ، بدون توجه به اندازه یا سازنده، در تولید داستان‌های باز، کلیشه‌های مضر اجتماعی را بازتولید می‌کنند. این سوگیری‌ها ایستا…

۲ دقیقه خواندن
گزارش arXiv: چارچوب SFFL نرخ توهمات در مدل‌های صوتی-تصویری را ۱۱.۱۷٪ کاهش داد

گزارش arXiv: چارچوب SFFL نرخ توهمات در مدل‌های صوتی-تصویری را ۱۱.۱۷٪ کاهش داد

چارچوب استدلالی جدیدی به نام SFFL با تفکیک مسیرهای استدلال برای هر مودالیته، توهمات در مدل‌های زبانی چندوجهی را به‌طور چشم‌گیری کاهش داده است. این متد دقت کلی را ۵.۱۶٪ و نرخ کاهش…

۲ دقیقه خواندن
گزارش arXiv: متد TRACE دقت استدلال ریاضی را ۲.۷۶ درصد فراتر از GRPO برد

گزارش arXiv: متد TRACE دقت استدلال ریاضی را ۲.۷۶ درصد فراتر از GRPO برد

متد جدیدی به نام TRACE با هدف‌گیری توکن‌های حیاتی در فرآیند تقطیر، نرخ خطای مدل‌های استدلالی را کاهش داد. این رویکرد برخلاف روش‌های متراکم، از نشت اطلاعات ممتاز جلوگیری کرده و…

۲ دقیقه خواندن