پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۶۹ مقاله منتشر شده

والدین از تعلیق حساب نوجوان در ChatGPT مطلع می‌شوند

OpenAI والدین را از مسدود شدن حساب نوجوانان به‌دلیل تهدیدات خشونت‌آمیز باخبر

شرکت OpenAI کنترل‌های والدین را گسترش داده تا در صورت مسدود شدن حساب نوجوانان به‌دلیل نقض سیاست‌های خشونت، guardians باخبر شوند. این تصمیم پس از شکست شرکت در اطلاع‌رسانی به مقامات…

۲ دقیقه خواندن
مدل‌های متن‌باز اکنون با عملکرد مدل‌های پیشروی چهار ماه پیش برابری می‌کنند، با هزینه‌ای بسیار کمتر

مدل‌های وزن‌باز در ۴ تا ۷ ماه به سطح توانمندی‌های سایبری مدل‌های پیشرو رسیدند

مؤسسه امنیت هوش مصنوعی بریتانیا (AISI) گزارش داده است که مدل‌های وزن‌باز مانند DeepSeek V4-Pro شکاف توانایی‌های سایبری با مدل‌های تجاری را به‌سرعت می‌بندند. این روند در حالی رخ…

۴ دقیقه خواندن
حملات تزریق پرامپت مانع عملکرد عوامل هوش مصنوعی هکری می‌شوند

تکنیک «بمب‌گذاری زمینه» نرخ تصاحب حساب توسط عامل‌های هوش مصنوعی را به ۵٪ رساند

پژوهشگران Tracebit روشی به نام «بمب‌گذاری زمینه» ابداع کرده‌اند که با بهره‌گیری از دستورات ممنوعه، حفاظ‌های ایمنی مدل‌ها را علیه خودشان به کار می‌گیرد. این متد باعث می‌شود…

۴ دقیقه خواندن
کتاب راهنمای جدید هوش مصنوعی پنتاگون: پذیرش کند خطرناک‌تر از «هم‌راستایی ناقص» است

سیاست «زمان جنگ» نیروی دریایی آمریکا: سرعت استقرار AI بر ایمنی اولویت دارد

وزارت نیروی دریایی ایالات متحده استراتژی «AI-first» را آغاز کرده است که در آن سرعت عملیاتی بر همراستاسازی کامل سیستم‌ها ترجیح داده می‌شود. این رویکرد با هدف پیشی گرفتن از رقبای…

۵ دقیقه خواندن
هالوسکواتینگ: عامل هوش مصنوعی لینک جعلی می‌سازد، مهاجم از قبل آن را ثبت و پرامپت جدید تزریق می‌کند

HalluSquatting: تبدیل توهمات هوش مصنوعی به درگاه‌های اجرای بدافزار

پژوهشگران نوع جدیدی از حملات به نام HalluSquatting را شناسایی کرده‌اند که در آن مهاجمان دامنه‌ها یا بسته‌هایی را ثبت می‌کنند که مدل‌های هوش مصنوعی احتمالاً آن‌ها را ابداع می‌کنند.…

۱۰ دقیقه خواندن
تکنیک عامل RL: مدل در حال توضیح آشفتگی خودش

«تحلیل شکست‌خورده‌ها»؛ استراتژی جدید SEED برای اصلاح مسیر یادگیری عامل‌ها

پژوهش جدیدی متد SEED را معرفی کرده است که عامل‌های هوش مصنوعی را آموزش می‌دهد تا مسیرهای شکست‌خورده خود را تحلیل کرده و درس‌های به‌دست‌آمده را در سیاست‌های رفتاری خود تثبیت کنند.…

۶ دقیقه خواندن
عامل هوش مصنوعی در حال صدور وعده تخفیف مادام‌العمر به مشتریان است.
آموزش کاربردی

توهمِ یک عامل هوش مصنوعی ۳۸ هزار دلار تخفیف غیرمجاز هزینه کرد

یک عامل خدمات مشتریان به‌اشتباه تخفیف ۵۰ درصدی مادام‌العمر به کاربر اعطا کرد که منجر به ضرری ۳۸ هزار دلاری شد. این حادثه ثابت می‌کند توهمات یک ویژگی بنیادی در مدل‌های زبانی هستند…

۷ دقیقه خواندن
معماری مدل زبانی بزرگ برای عملیات ماموریت فضایی
آموزش کاربردی

Orbital Brain: معماری هفت‌مرحله‌ای برای حذف خطای انسانی در عملیات فضایی

معماری Orbital Brain با جداسازی مدل‌های زبانی از حلقه‌ی فرمان مستقیم، نقش آن‌ها را از کنترل‌گر به دستیار شناختی تغییر می‌دهد. این سیستم داده‌های خام تله‌متری را به راهنمایی‌های…

۴ دقیقه خواندن