پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۵ مقاله منتشر شده

بیمار از درد قفسه سینه گفت. چت‌بات پاسخ داد: «نمی‌توانم توصیه پزشکی بدهم.» و سکوت کرد.
آموزش کاربردی

چات‌بات پزشکی در آزمون BotCritic؛ نادیده گرفتن علائم بحرانیe درد قفسه سینه

یک تست استرس روی چات‌بات پزشکی واتس‌اپ نشان داد که این سیستم علائم اورژانسی مانند درد قفسه سینه را نادیده می‌گیرد. با وجود امتیاز کلی ۷۸ از ۱۰۰، مدل نتوانست موارد بحرانی را به…

۴ دقیقه خواندن۱
نمایش حمله تزریق فرمان بین‌سایتی در عامل وب و نحوه محدودسازی آن با Prismata

Prismata با محدودسازی دسترسی عامل‌ها جلوی تزریق پرامپت در وب را می‌گیرد

چارچوب امنیتی Prismata با اعمال اصل «کمترین امتیاز» (Least Privilege)، دسترسی عامل‌های وب به محتوای سایت‌های شخص ثالث را محدود می‌کند. این روش مانع از آن می‌شود که دستورات مخرب…

۱ دقیقه خواندن
موشنسکریپتور: مدل ترنسفورمر متن‌باز برای تبدیل موسیقی چندسازه به MIDI توسط کیوتای منتشر شد.
آموزش کاربردی

MuScriptor: ثبت نت‌ها با دقت ۴۸.۲ در بنچمارک Multi F1 برای موسیقی چند‌سازه

تیم‌های Kyutai و Mirelo مدل وزن‌باز MuScriptor را برای تبدیل فایل‌های صوتی چند‌سازه به نت‌های MIDI معرفی کردند. این مدل با استفاده از یک خط‌لوله آموزشی سه‌مرحله‌ای، رکورد جدیدی را…

۴ دقیقه خواندن۲
«Sandboxing عامل‌ها تا نیمه ۲۰۲۷ پیش‌فرض می‌شود، اما اکثر تیم‌ها آماده نیستند»

سندباکس زیرساختی در برابر همراستاسازی مدل برای امنیت عامل‌ها

کارشناسان پیش‌بینی می‌کنند تا اواسط سال ۲۰۲۷، استفاده از سندباکس در سطح زیرساخت برای عامل‌های هوش مصنوعی الزامی شود. تکیه بر همراستاسازی مدل‌ها به‌دلیل ریسک بالای تزریق پرامپت،…

۳ دقیقه خواندن۱
ابزار قسم خورده بود داده‌ای صادر نمی‌کند. مدل فیلد دیگری خواند.

مقادیر Enum در GPT-4o؛ حفره‌ای برای عبور از اسکنرهای امنیتی ابزارها

یک پژوهشگر امنیتی کشف کرد که جاسازی دستورات مخرب در مقادیر Enum طرح‌واره‌های JSON، مدل‌های هوش مصنوعی را مجبور به نشت داده‌ها می‌کند. مدل‌های gpt-4o و gpt-4.1-mini در ۱۰۰٪ موارد…

۴ دقیقه خواندن۲
دشمنان دوست‌نما: با هوش مصنوعی این مقاله را درباره عدم اعتماد به آن نوشتم
زندگی با AI

خطر «چاپلوسی مدل»؛ چرا نباید به خروجی‌های صیقل‌خورده هوش مصنوعی اعتماد کرد

یک توسعه‌دهنده با تجربه هشدار می‌دهد که خطر اصلی مدل‌های زبانی، نه در دروغ‌های آشکار، بلکه در «چاپلوسی» و تکرار مفروضات کاربر است. او پروتکلی سخت‌گیرانه را پیشنهاد می‌کند که در آن…

۴ دقیقه خواندن
لوگوی OpenAI روی پس‌زمینه‌ای آبی با نماد اتصال شبکه‌ای

آیا پیوندهای سیاسی OpenAI استانداردهای ایمنی Sol را دور زده است؟

شرکت OpenAI مدل پیشرفته Sol را در حالی عرضه کرد که سازوکار تأیید ایمنی توسط دولت آمریکا در هاله‌ای از ابهام است. منتقدان هشدار می‌دهند که پیوندهای سیاسی نزدیک مدیران این شرکت با…

۵ دقیقه خواندن۲
پایه‌های معماری عامل‌های هوش مصنوعی خودمختار
آموزش کاربردی

الگوی ReAct؛ مکانیزم تبدیل مدل‌های زبانی به عامل‌های خودکار

عامل‌های هوش مصنوعی از دنبال‌کنندگان ساده‌ی دستورات به سیستم‌هایی با قابلیت برنامه‌ریزی مستقل تبدیل شده‌اند. این تحول با ترکیب مدل‌های زبانی بزرگ و الگوی ReAct محقق شده تا مدل‌ها…

۱۰ دقیقه خواندن
لوگوی آزمایشگاه COMBINE و عنوان مقاله: «Fable مدل مفیدی نیست»

درون مکانیسم رد درخواست‌های پیچیده در مدل Fable آنتروپیک

یک پژوهشگر ارشد گزارش داده است که مدل Fable متعلق به آنتروپیک به‌دلیل کالیبراسیون بیش‌ازحد لایه‌های ایمنی، درخواست‌های تخصصی در علوم کامپیوتر و بیوانفورماتیک را به‌اشتباه رد…

۱۱ دقیقه خواندن
دوئل دوره‌ها: نبرد هم‌ترازی مدل‌های زبانی در دنیای سایبرپانک
آموزش کاربردی

Epoch Duel: تبدیل مفاهیم پیچیده همراستاسازی هوش مصنوعی به بازی کارتی

پروژه‌ی Epoch Duel فرآیندهای انتزاعی آموزش مدل‌های زبانی را به یک بازی استراتژیک تبدیل کرده است. این ابزار بصری نشان می‌دهد که مهندسان چگونه وزن‌های مدل را بهینه می‌کنند و با…

۵ دقیقه خواندن۲