پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۵ مقاله منتشر شده

تست نشت اطلاعات در ۵ مدل زبانی بزرگ با حمله تزریق پرامپت: از ۰ تا ۹۰ درصد
آموزش کاربردی

کدام مدل زبانی در برابر نشت کلیدهای امنیتی مقاوم‌تر است؟

یک ابزار امنیتی جدید نشان می‌دهد که انتخاب مدل زبانی در پس‌زمینهٔ عامل‌های هوش مصنوعی، مستقیماً بر نرخ نشت داده‌های حساس اثر می‌گذارد. در حالی که برخی مدل‌ها مقاوم هستند، برخی…

۳ دقیقه خواندن
راهنمای SkillSpector انویدیا: اسکن مهارت‌های هوش مصنوعی برای یافتن ریسک‌های امنیتی با تحلیل ایستا و گزارش SARIF
آموزش کاربردی

SkillSpector چگونه حفره‌های امنیتی مهارت‌های AI را پیش از استقرار می‌یابد؟

انویدیا ابزار SkillSpector را برای شناسایی آسیب‌پذیری‌های امنیتی در مهارت‌های عامل‌های هوشمند عرضه کرد. این سامانه با تحلیل ایستا و گردش‌کارهای LangGraph، ریسک‌هایی مثل تزریق…

۷ دقیقه خواندن
شبکه عصبی ساخته‌شده از بز در Age of Empires II برای نقد علم هوش مصنوعی

درون آزمایش مایکروسافت برای به چالش کشیدن منطقِ آگاهی در مدل‌های زبانی

یک پژوهشگر مایکروسافت با ساخت یک شبکه عصبی عملیاتی در محیط بازی Age of Empires II، نشان داد که «آگاهی» در هوش مصنوعی تنها یک توهم ناشی از بسته‌بندی ظاهری است. این مطالعه هشدار…

۵ دقیقه خواندن۱
الگوریتم‌های کنترل‌شده توسط کاربر: تحول بعدی شبکه‌های اجتماعی

متا و تیک‌تاک کنترل الگوریتم‌های توصیه‌گر را به کاربران بازگرداندند

پلتفرم‌های اجتماعی از موتورهای توصیهٔ مبهم به سمت فیدهای قابل‌شخصی‌سازی حرکت می‌کنند. این تغییر با کمک مدل‌های زبانی بزرگ، اجازه می‌دهد کاربران مستقیماً تعیین کنند چه محتوایی را…

۴ دقیقه خواندن۲
اوپن‌ای‌آی بزرگ‌ترین مرکز داده خود را می‌خواهد و انویدیا هزینه آن را می‌پردازد

OpenAI دقت پیش‌بینی شکست‌های مدل‌های هوش مصنوعی را به ۹۲٪ رساند

پژوهشگران OpenAI روشی برای پیش‌بینی شکست‌های مدل‌های هوش مصنوعی توسعه داده‌اند که با جایگزینی تست‌های مصنوعی با مکالمات واقعی کاربران، دقت تشخیص خطاها را به شدت افزایش می‌دهد. این…

۴ دقیقه خواندن
موکلاو: استاندارد ضروری برای عامل‌های هوشمند مستقل هوش مصنوعی
آموزش کاربردی

۲ رکن اصلی MoClaw برای جلوگیری از اقدامات مخرب عامل‌های هوش مصنوعی

پروتکل MoClaw با جداسازی اهداف عامل‌های هوش مصنوعی از محدودیت‌های قانونی، نرخ خطای انحراف از هدف را به شدت کاهش می‌دهد. این سامانه با اجرای نظارت لحظه‌ای، مانع از اقدامات غیرمجاز…

۶ دقیقه خواندن
سه پاسخ متفاوت از مدل‌های پایه، دستورپذیر و گفتگویی به یک پرسش واحد
آموزش کاربردی

تأثیر ۳ سطح آموزش بر تبدیل تکمیل‌کننده متن به دستیار هوشمند

راهنمای عملی خانواده مدل‌های SmolLM2 تفاوت‌های حیاتی بین مدل‌های بنیادی، تنظیم‌شده برای دستورات و مدل‌های گفتگو-محور را بررسی می‌کند. درک این سه مرحله آموزشی توضیح می‌دهد چرا یک…

۶ دقیقه خواندن۳