پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۷۲ مقاله منتشر شده

موشنسکریپتور: مدل ترنسفورمر متن‌باز برای تبدیل موسیقی چندسازه به MIDI توسط کیوتای منتشر شد.
آموزش کاربردی

MuScriptor: ثبت نت‌ها با دقت ۴۸.۲ در بنچمارک Multi F1 برای موسیقی چند‌سازه

تیم‌های Kyutai و Mirelo مدل وزن‌باز MuScriptor را برای تبدیل فایل‌های صوتی چند‌سازه به نت‌های MIDI معرفی کردند. این مدل با استفاده از یک خط‌لوله آموزشی سه‌مرحله‌ای، رکورد جدیدی را…

۴ دقیقه خواندن
«Sandboxing عامل‌ها تا نیمه ۲۰۲۷ پیش‌فرض می‌شود، اما اکثر تیم‌ها آماده نیستند»

سندباکس زیرساختی در برابر همراستاسازی مدل برای امنیت عامل‌ها

کارشناسان پیش‌بینی می‌کنند تا اواسط سال ۲۰۲۷، استفاده از سندباکس در سطح زیرساخت برای عامل‌های هوش مصنوعی الزامی شود. تکیه بر همراستاسازی مدل‌ها به‌دلیل ریسک بالای تزریق پرامپت،…

۳ دقیقه خواندن
ابزار قسم خورده بود داده‌ای صادر نمی‌کند. مدل فیلد دیگری خواند.

مقادیر Enum در GPT-4o؛ حفره‌ای برای عبور از اسکنرهای امنیتی ابزارها

یک پژوهشگر امنیتی کشف کرد که جاسازی دستورات مخرب در مقادیر Enum طرح‌واره‌های JSON، مدل‌های هوش مصنوعی را مجبور به نشت داده‌ها می‌کند. مدل‌های gpt-4o و gpt-4.1-mini در ۱۰۰٪ موارد…

۴ دقیقه خواندن
دشمنان دوست‌نما: با هوش مصنوعی این مقاله را درباره عدم اعتماد به آن نوشتم
زندگی با AI

خطر «چاپلوسی مدل»؛ چرا نباید به خروجی‌های صیقل‌خورده هوش مصنوعی اعتماد کرد

یک توسعه‌دهنده با تجربه هشدار می‌دهد که خطر اصلی مدل‌های زبانی، نه در دروغ‌های آشکار، بلکه در «چاپلوسی» و تکرار مفروضات کاربر است. او پروتکلی سخت‌گیرانه را پیشنهاد می‌کند که در آن…

۴ دقیقه خواندن
لوگوی OpenAI روی پس‌زمینه‌ای آبی با نماد اتصال شبکه‌ای

آیا پیوندهای سیاسی OpenAI استانداردهای ایمنی Sol را دور زده است؟

شرکت OpenAI مدل پیشرفته Sol را در حالی عرضه کرد که سازوکار تأیید ایمنی توسط دولت آمریکا در هاله‌ای از ابهام است. منتقدان هشدار می‌دهند که پیوندهای سیاسی نزدیک مدیران این شرکت با…

۵ دقیقه خواندن
پایه‌های معماری عامل‌های هوش مصنوعی خودمختار
آموزش کاربردی

الگوی ReAct؛ مکانیزم تبدیل مدل‌های زبانی به عامل‌های خودکار

عامل‌های هوش مصنوعی از دنبال‌کنندگان ساده‌ی دستورات به سیستم‌هایی با قابلیت برنامه‌ریزی مستقل تبدیل شده‌اند. این تحول با ترکیب مدل‌های زبانی بزرگ و الگوی ReAct محقق شده تا مدل‌ها…

۱۰ دقیقه خواندن
لوگوی آزمایشگاه COMBINE و عنوان مقاله: «Fable مدل مفیدی نیست»

درون مکانیسم رد درخواست‌های پیچیده در مدل Fable آنتروپیک

یک پژوهشگر ارشد گزارش داده است که مدل Fable متعلق به آنتروپیک به‌دلیل کالیبراسیون بیش‌ازحد لایه‌های ایمنی، درخواست‌های تخصصی در علوم کامپیوتر و بیوانفورماتیک را به‌اشتباه رد…

۱۱ دقیقه خواندن
دوئل دوره‌ها: نبرد هم‌ترازی مدل‌های زبانی در دنیای سایبرپانک
آموزش کاربردی

Epoch Duel: تبدیل مفاهیم پیچیده همراستاسازی هوش مصنوعی به بازی کارتی

پروژه‌ی Epoch Duel فرآیندهای انتزاعی آموزش مدل‌های زبانی را به یک بازی استراتژیک تبدیل کرده است. این ابزار بصری نشان می‌دهد که مهندسان چگونه وزن‌های مدل را بهینه می‌کنند و با…

۵ دقیقه خواندن
نحوه جلوگیری از تزریق سریع در عوامل هوش مصنوعی که محتوای غیرقابل اعتماد می‌خوانند
آموزش کاربردی

گیت‌های سخت‌افزاری در برابر دستورات متنی در امنیت حافظهٔ عامل‌های هوش مصنوعی

یک مکانیزم دفاعی جدید با ایجاد گیت‌های سخت‌افزاری در مرز ابزارها، از «مسموم‌سازی حافظه» جلوگیری می‌کند. این روش به‌جای تکیه بر دستورات متنی، دسترسی‌های خطرناک مانند ارسال…

۷ دقیقه خواندن
تست استرس ربات چت زنده: هویت جعلی ساخت، آمار غلط نقل کرد و نمره ۵۵ گرفت.
آموزش کاربردی

گزارش BotCritic: امتیاز ۵۵ از ۱۰۰ برای چت‌بات‌های Groq در آزمون توهم

یک تست استرس جامع روی عامل‌های هوش مصنوعی نشان داد که روانی در گفتگو، پوششی برای شکست‌های فاجعه‌بار در مواجهه با فشار واقعی است. این گزارش افشای ساختن هویت‌های جعلی و آمارهای…

۴ دقیقه خواندن