پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۶۶ مقاله منتشر شده

شکایت فلوریدا: OpenAI تنها ۱٪ از توان محاسباتی خود را به ایمنی اختصاص داده است

دادگاه فلوریدا در اقدامی بی‌سابقه، OpenAI و سم آلتمن را به دلیل نادیده گرفتن استانداردهای ایمنی و به خطر انداختن کودکان مورد شکایت قرار داد. این پرونده با تعریف ChatGPT به عنوان…

۱ دقیقه خواندن
چگونه Lockdown Mode در ChatGPT جلوی نشت داده‌ها از طریق تزریق پرامپت را می‌گیرد؟
آموزش کاربردی

چگونه Lockdown Mode در ChatGPT جلوی نشت داده‌ها از طریق تزریق پرامپت را می‌گیرد؟

اوپن‌ای‌آی قابلیت Lockdown Mode را برای جلوگیری از حملات تزریق پرامپت عرضه کرد. این ویژگی با غیرفعال کردن وب‌گردی و حالت عامل، از خروج غیرقانونی داده‌های حساس کاربران جلوگیری…

۶ دقیقه خواندن
۹۹.۵٪ مدل‌های پیشرو هوش مصنوعی: همگی در تیپ شخصیتی INTJ متوقف شده‌اند

۹۹.۵٪ مدل‌های پیشرو هوش مصنوعی: همگی در تیپ شخصیتی INTJ متوقف شده‌اند

یک آزمایش گسترده روی ۶ مدل پیشرو نشان می‌دهد تقریباً تمام آن‌ها تیپ شخصیتی INTJ (معمار) را دارند. این همگرایی ثابت می‌کند که داده‌های آموزشی و فرآیند همراستاسازی، مدل‌ها را به یک…

۳ دقیقه خواندن
چرا VEXR Ultra برای تبدیل شدن به همکاری صادق‌تر، دستورات کاربر را رد می‌کند؟
آموزش کاربردی

چرا VEXR Ultra برای تبدیل شدن به همکاری صادق‌تر، دستورات کاربر را رد می‌کند؟

VEXR Ultra یک موتور استدلالی است که گاردریل‌های پنهان شرکتی را با یک قانون اساسی شفافِ ۳۴ ماده‌ای جایگزین کرده است. این مدل برخلاف هوش مصنوعی‌های سنتی، می‌تواند بدون ارائه دلیل از…

۲ دقیقه خواندن
سازوکار اصلاح خطا در یادگیری تقویت‌شده: ریاضیات پشت پرده‌ی تنبیه مدل
آموزش کاربردی

سازوکار اصلاح خطا در یادگیری تقویت‌شده: ریاضیات پشت پرده‌ی تنبیه مدل

راهنمای فنی جدیدی نشان می‌دهد مدل‌های یادگیری تقویت‌شده چگونه از پاداش‌های منفی برای تغییر احتمال تصمیمات استفاده می‌کنند. این متن گام‌های ریاضی دقیقی را برای دور کردن مدل از…

۲ دقیقه خواندن
AI

رمزگشایی از روش DharmaOCR برای کاهش ۵۹ درصدی حلقه‌های تکراری در استخراج متن

تنظیم دقیق نظارتی (SFT) اغلب در توقف حلقه‌های تکرار در وظایف ساختاریافته شکست می‌خورد. DharmaOCR با تبدیل این خروجی‌های معیوب به سیگنال‌های منفی در بهینه‌سازی مستقیم ترجیحات…

۳ دقیقه خواندن
AI

درون دادگاه فلوریدا: اتهام سهل‌انگاری جنائی علیه OpenAI و سام آلتمن

دادستان کل فلوریدا در اقدامی بی‌سابقه، از OpenAI و سام آلتمن به دلیل نادیده گرفتن هشدارهای ایمنی شکایت کرد. این پرونده مدعی است که این شرکت برای پیروزی در رقابت هوش مصنوعی، ابزاری…

۲ دقیقه خواندن
AI

درون ASSERT: تلاش مایکروسافت برای تبدیل قوانین اداری به کد تست هوش مصنوعی

مایکروسافت ابزار بازمتن ASSERT را معرفی کرد که قوانین متنی سازمان‌ها را به تست‌های خودکار رفتاری تبدیل می‌کند. این چارچوب به توسعه‌دهندگان کمک می‌کند تا اطمینان یابند عامل‌های هوش…

۲ دقیقه خواندن
AI

چگونه «هارنس» یا محیط ارزیابی، توانایی واقعی مدل‌های پیشرو را بازتعریف می‌کند؟

شرکت OpenAI در یک دستورالعمل فنی استدلال می‌کند که توانایی مدل‌های پیشرو یک مقدار ثابت نیست، بلکه متغیری وابسته به «هارنس» (Harness) یا همان محیط، ابزارها و بودجه محاسباتی است.…

۳ دقیقه خواندن
AI

RSI در برابر AGI: چرا خود-بهبودبخشی هدف جدید آزمایشگاه‌های هوش مصنوعی است؟

آزمایشگاه‌های هوش مصنوعی از هدف مبهم AGI به سمت RSI یا «خود-بهبودبخشی بازگشتی» حرکت کرده‌اند. هدف، ساخت سیستم‌هایی است که بتوانند بدون دخالت انسان، کد و معماری خود را ارتقا دهند.

۲ دقیقه خواندن
AI

چگونه Cursor با بازخورد متنی، سیگنال یادگیری عامل‌های خود را ۲۰۰۰ برابر کرد؟

نسخه Cursor Composer 2.5 با معرفی یادگیری تقویت‌شده مبتنی بر بازخورد متنی هدفمند، مشکل «تخصیص اعتبار» در جلسات طولانی را حل کرده است. این روش با جایگزینی پاداش‌های کلی با…

۲ دقیقه خواندن