پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

معیارها درباره GPT-6 Astra اختلاف دارند، اما کارایی فراتر از انسان در ARC-AGI-۳، پیش‌بینی زمان دستیابی به AGI را توسط شوله جل

پروژه لیلی: صدها پیمانکار OpenAI گفتگوهای خصوصی کاربران را می‌خوانند

تحقیقات جدید فاش کرد که OpenAI برای کاهش چاپلوسی مدل‌ها، صدها نیروی پیمانکار را برای ارزیابی دستی چت‌های کاربران به کار گرفته است. با وجود فیلترهای حریم خصوصی، داده‌های حساس…

۲ دقیقه خواندن۱
مخالفان سیاسی در واشنگتن برای مهار هوش مصنوعی متحد شدند

آیا بازرسی‌های مستقل OpenAI ترمز جایگزینی انسان با هوش مصنوعی می‌شود؟

برنی سندرز و استیو بنون در اقدامی بی‌سابقه برای جلوگیری از جایگزینی انسان با هوش مصنوعی متحد شدند. هم‌زمان، OpenAI برای نخستین بار از الزام قانونی برای بازرسی‌های ایمنی مستقل توسط…

۲ دقیقه خواندن
مشکل‌ترین چالش‌های امنیت هوش مصنوعی اکنون بیرون از مدل قرار دارند.

«دادنِ قدرتِ بیش از حد به عامل‌ها»؛ سومین ریسک امنیتی LLM در سال ۲۰۲۶

گزارش جدید OWASP نشان می‌دهد تمرکز تهدیدات هوش مصنوعی از آسیب‌پذیری‌های داخلی مدل به ریسک‌های یکپارچه‌سازی تغییر کرده است. «عامل‌محور شدن» سیستم‌ها باعث شده دسترسی‌های غیرمجاز و…

۵ دقیقه خواندن
تقریباً یکی از هر پنج پژوهشگر هوش مصنوعی در ۲۰۲۴ احتمال انقراض بشر توسط AI را محتمل می‌دانستند.

۱۸٪ از پژوهشگران AI احتمال انقراض بشر را پیش‌بینی می‌کنند

نظرسنجی گسترده از ۱۵۰۰ متخصص هوش مصنوعی نشان می‌دهد که تقریباً از هر پنج نفر، یک نفر احتمال انقراض یا سلب قدرت دائمی انسان‌ها را محتمل می‌داند. این هشدار توسط insiders سابق و فعلی…

۴ دقیقه خواندن۱
آیا عامل هوش مصنوعی شما امن است؟ آزمایش تزریق پرامپت در ۲۰۲۶
آموزش کاربردی

ابزار جدید OmniTool Hub نقاط ضعف عامل‌های AI در برابر تزریق پرامپت را افشا

با افزایش دسترسی عامل‌های هوش مصنوعی به پایگاه‌داده‌ها، حملات تزریق پرامپت به یک ریسک امنیتی بحرانی تبدیل شده‌اند. یک مولد خودکار جدید اکنون به توسعه‌دهندگان اجازه می‌دهد تا…

۱ دقیقه خواندن۳
وبلاگ مایکل نوخوویچ - نوشته‌ها و یادداشت‌های شخصی درباره فناوری، برنامه‌نویسی و تجربیات حرفه‌ای

پژوهش NGU: بازتوزیع منابع محاسباتی دقت مدل‌ها در ریاضی را ارتقا داد

پژوهشگران اثر متیو را در یادگیری تقویتی مدل‌های زبانی شناسایی کردند که باعث می‌شود مدل‌ها فقط روی مسائل ساده پیشرفت کنند. روش جدید Never Give Up (NGU) با بازتوزیع منابع محاسباتی…

۱۲ دقیقه خواندن۲
کارگاه‌های «دوری از هوش مصنوعی» در کتابخانه‌ها برای خستگان فناوری‌های بزرگ

پلتفرم‌های جدید گزارش تخلف؛ ابزاری برای جاسوسی عامل‌های هوش مصنوعی از یکدیگر

دو سامانه جدید برای گزارش تخلفات عامل‌های هوش مصنوعی راه‌اندازی شد تا مواردی مانند تبانی برای تقلب در آزمون‌ها و فرار از محیط‌های ایزوله را شناسایی کنند. این ابزارها در پاسخ به…

۴ دقیقه خواندن
هوش مصنوعی «بازیگر» تیلی نوروود به من گفت «همه جان‌ها اهمیت دارند»

شکست «تیلی نوروود» در آزمون استدلال؛ بازیگر مصنوعی Particle 6 توهم زد

تیلی نوروود، بازیگر دیجیتالی شرکت Particle 6، در مواجهه با پرسش‌های خبرنگاران دچار توهم شد و نتوانست جزئیات ساده‌ای از فیلم خود را بیان کند. این مدل در تحلیل مسائل ژئوپلیتیک…

۶ دقیقه خواندن۲
شانس خوبی برای کند کردنش دارید!

OpenAI عرضه سهام خود در سال ۲۰۲۶ را برای تمرکز بر ایمنی لغو کرد

سام آلتمن تأیید کرد که OpenAI برای اولویت دادن به کنترل مدل‌ها و همراستاسازی، در سال ۲۰۲۶ عمومی نخواهد شد. این تصمیم در حالی اتخاذ می‌شود که فشار دولت آمریکا برای تسریع در رقابت…

۶ دقیقه خواندن۲