پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۵ مقاله منتشر شده

دستم هدفم را تعیین می‌کند: پرتابی که مسیر زندگی‌ام را رقم می‌زند.

برنامه‌ریزی پیش‌دستانه در برابر توجیه‌های لحظه‌ای در مدل‌های زبانی

تحلیل رفتار مدل‌های زبانی نشان می‌دهد که تفاوت عمیقی میان فرآیند تصمیم‌گیری داخلی و توضیحات بیرونی آن‌ها وجود دارد. در حالی که مدل‌هایی مثل Claude قادر به برنامه‌ریزی پیش‌دستانه…

۹ دقیقه خواندن۱
ارزیابی مدل‌های زبانی برای ابزارهای توسعه‌دهندگان: مفید، درست، ایمن
آموزش کاربردی

۵۹٪ از سخت‌ترین آزمون‌های SWE-bench Verified به‌دلیل خطاهای فنی شکست خوردند

تحلیل‌های جدید نشان می‌دهد بنچمارک‌های کدنویسی به‌جای سنجش مهارت مهندسی، حافظه مدل‌ها را اندازه می‌گیرند. تیم‌های توسعه برای ارزیابی واقعی باید سه محور مستقلِ صحت، کاربردی بودن و…

۱۹ دقیقه خواندن
چرا گوگل دیپ‌مایند را ترک کردم: داستان یک پژوهشگر از بحران اخلاقی هوش مصنوعی

چرا گوگل DeepMind محدودیت‌های اخلاقی Gemini را پیش پنتاگون کنار گذاشت؟

افشای جزئیات قرارداد جدید گوگل با پنتاگون نشان می‌دهد این شرکت حفاظ‌های اخلاقی علیه سلاح‌های خودمختار را کنار گذاشته است. این توافق به ارتش آمریکا اجازه می‌دهد فیلترهای ایمنی مدل…

۵۴ دقیقه خواندن۱
هکر هوش مصنوعی GPT-Red شرکت OpenAI برای افزایش امنیت مدل‌ها ساخته شد.

«اتوماسیون Red-Teaming»؛ راهکار جدید OpenAI برای شناسایی حفره‌های امنیتی

اوپن‌ای‌آی مدل تخصصی GPT-Red را برای شناسایی و رفع خودکار حفره‌های امنیتی مدل‌های دیگر توسعه داده است. این سیستم با استفاده از یک حلقه «بازی با خود»، استواری GPT-5.6 را به‌طوری…

۵ دقیقه خواندن۱
فضای J، مدل‌های متن‌باز — نسخه ۲

بردار‌های هدایت مفاهیم در مدل‌های مختلف هوش مصنوعی با چرخش خطی منتقل می‌شوند

پژوهش‌های جدید نشان می‌دهد بردار‌های هدایت (Steering Vectors) یک مدل زبانی را می‌توان با یک چرخش ریاضی ساده به مدل دیگری از خانواده‌ای متفاوت منتقل کرد. این یافته ثابت می‌کند…

۲۰ دقیقه خواندن
مقیاس‌سنجی کیفیت انسانی صدای هوش مصنوعی در دنیای واقعی با VoiceEQ

شکاف عمیق میان نمرات فنی و کیفیت انسانی در مدل‌های صوتی هوش مصنوعی

پلتفرم Hume با معرفی محک Real World VoiceEQ نشان داد که مدل‌های صوتی علیرغم نمرات بالای فنی، در درک احساسات و بافت‌های صوتی شکست می‌خورند. داده‌ها حاکی از آن است که هیچ مدل واحدی…

۵ دقیقه خواندن
کارکنان اوپن‌ای‌آی از یک کمیته اقدام سیاسی رقیب برای مقابله با مدیرعامل خود حمایت مالی می‌کنند

۸ сотруд OpenAI بیش از ۲۱۵ هزار دلار برای محدود کردن نفوذ مدیران خود پرداخت

تعدادی از کارکنان فعلی و سابق OpenAI با حمایت مالی از یک کمیته اقدام سیاسی (Super PAC)، مستقیماً با استراتژی‌های گرگ بروکمن برای جلوگیری از قانون‌گذاری هوش مصنوعی مقابله می‌کنند.…

۶ دقیقه خواندن۲
نقشه راه کنترل هوش مصنوعی دیپ‌مایند گوگل: پنج آزمون امنیتی عامل هوشمند
آموزش کاربردی

۵ آزمون امنیتی برای اعتبارسنجی نقشه راه کنترل هوش مصنوعی گوگل

یک چارچوب فنی جدید، نقشه راه کنترل هوش مصنوعی گوگل دیپ‌مایند را به پنج آزمون امنیتی تکرارپذیر برای عامل‌های کدنویسی تبدیل کرده است. این رویکرد تمرکز را از همراستاسازی مدل به تعیین…

۲ دقیقه خواندن