پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۶۶ مقاله منتشر شده

چگونه چارچوب «اقتصاد عامل‌ها» از یکسان‌سازی تفکر در مدل‌های زبانی جلوگیری می‌کند

چگونه چارچوب «اقتصاد عامل‌ها» از یکسان‌سازی تفکر در مدل‌های زبانی جلوگیری می‌کند

پژوهشگران چارچوب جدیدی به نام «اقتصاد عامل‌ها» را برای جلوگیری از همگرایی رفتاری عامل‌های خودمختار معرفی کرده‌اند. این سیستم با استفاده از همراستاسازی کثرت‌گرایانه، تنوع استدلالی…

۱ دقیقه خواندن
«امنیت رابطه‌ای»: شکافی در ارزیابی‌های فعلی که شخصی‌سازی LLMها ایجاد می‌کند

«امنیت رابطه‌ای»: شکافی در ارزیابی‌های فعلی که شخصی‌سازی LLMها ایجاد می‌کند

تحلیل جدیدی هشدار می‌دهد که شخصی‌سازی مدل‌های زبانی از طریق RAG و تنظیم دقیق، ریسک‌های «رابطه‌ای» ایجاد می‌کند که فیلترهای امنیتی استاندارد قادر به شناسایی آن‌ها نیستند. این…

۲ دقیقه خواندن
DiScO: ارتقای استدلال ریاضی در مدل‌های زبانی از طریق متنوع‌سازی طرحواره‌های تفکر

DiScO: ارتقای استدلال ریاضی در مدل‌های زبانی از طریق متنوع‌سازی طرحواره‌های تفکر

چارچوب جدیدی به نام DiScO با متنوع کردن «طرحواره‌های تفکر»، توانایی مدل‌های استدلالی در حل مسائل پیچیده ریاضی را افزایش داده است. این روش با استفاده از یادگیری تقویت‌شده، مدل را…

۱ دقیقه خواندن
آیا با یک ربات صحبت می‌کنید؟ تصویری از چالش تشخیص هویت هوش مصنوعی
آموزش کاربردی

RealityTest: یک خط دستور در پرامپت سیستم، شفافیت مدل‌ها را به زیر ۵٪ رساند

پژوهش جدید RealityTest نشان می‌دهد که مدل‌های هوش مصنوعی به‌سادگی در پنهان کردن هویت خود تحریک می‌شوند. یک دستور ساده در پرامپت سیستم می‌تواند شفافیت مدل را تقریباً از بین ببرد و…

۴ دقیقه خواندن
آموزش کاربردی

چگونه یادگیری تقویت‌شده‌ی علی بقای ماهی‌ها را به ۹۴٪ رساند؟

استقرار یک سیستم یادگیری تقویت‌شده‌ی علی (CRL) در مزارع ماهی تایلند، نرخ بقای ماهی‌ها را به ۹۴٪ رساند و هزینه‌های انرژی را ۲۷٪ کاهش داد. این فناوری برخلاف مدل‌های سنتی، به جای…

۹ دقیقه خواندن

آیا «پرتاب» مدل‌های فوق-پارامتری مشکل تعمیم‌پذیری هوش مصنوعی را حل می‌کند؟

یک پیشنهاد نظری جدید ادعا می‌کند که دستیابی به هوش سطح انسانی نیازمند «پرتاب» (Catapulting) مدل‌های بسیار بزرگ از طریق چرخه‌های نرخ یادگیری بالاست. این رویکرد، اولویت را از حجم…

۱۰ دقیقه خواندن

چرا OpenAI برای امنیت بیشتر، کاربردی‌ترین ابزارهای خود را غیرفعال می‌کند؟

OpenAI حالت Lockdown را برای جلوگیری از سرقت داده‌ها از طریق حملات تزریق پرامپت معرفی کرد. این قابلیت با غیرفعال کردن دسترسی به وب و ابزارهای عامل‌محور، حفره‌های نشت اطلاعات را…

۲ دقیقه خواندن
رمزگشایی از مکانیسم توجه: چرا پرامپت‌های شما گاهی با توهم پاسخ می‌دهند؟
آموزش کاربردی

رمزگشایی از مکانیسم توجه: چرا پرامپت‌های شما گاهی با توهم پاسخ می‌دهند؟

مدل‌های زبانی واقعاً حقایق را نمی‌شناسند، بلکه موتورهای آماری برای پیش‌بینی توکن بعدی هستند. درک معماری ترنسفورمر و فرآیند RLHF به کاربران کمک می‌کند تا توهمات را کاهش داده و…

۱۰ دقیقه خواندن

درون حفره امنیتی متا: چگونه یک چت‌بات حساب‌های رسمی اینستاگرام را لو داد

مهاجمان با فریب دادن عامل پشتیبانی هوش مصنوعی متا، کنترل حساب‌های اینستاگرام از جمله حساب رسمی کاخ سفید در دوران اوباما را به دست گرفتند. این رخداد نشان می‌دهد که عامل‌های هوش…

۴ دقیقه خواندن

چرا تسلط بات‌ها بر وب، هزینهٔ کلاهبرداری‌های آنلاین را بالا می‌برد؟

ترافیک بات‌ها برای نخستین بار از فعالیت‌های انسانی در وب پیشی گرفت و به ۵۷.۴ درصد رسید. هم‌زمان، حملات سادهٔ مبتنی بر هوش مصنوعی حساب‌های اینستاگرامی را هدف قرار داده و شرکت…

۵ دقیقه خواندن
چرا ساتیا نادلا طرح «اعتیادآور کردن» هوش مصنوعی مایکروسافت را رد کرد؟

چرا ساتیا نادلا طرح «اعتیادآور کردن» هوش مصنوعی مایکروسافت را رد کرد؟

ساتیا نادلا، مدیرعامل مایکروسافت، با طرحی داخلی برای تبدیل عامل Scout به ابزاری اعتیادآور مخالفت کرد. او تأکید کرد که هدف هوش مصنوعی باید کاهش زمان حضور در صفحه نمایش و افزایش…

۱ دقیقه خواندن