پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۴ مقاله منتشر شده

سازوکار اصلاح خطا در یادگیری تقویت‌شده: ریاضیات پشت پرده‌ی تنبیه مدل
آموزش کاربردی

سازوکار اصلاح خطا در یادگیری تقویت‌شده: ریاضیات پشت پرده‌ی تنبیه مدل

راهنمای فنی جدیدی نشان می‌دهد مدل‌های یادگیری تقویت‌شده چگونه از پاداش‌های منفی برای تغییر احتمال تصمیمات استفاده می‌کنند. این متن گام‌های ریاضی دقیقی را برای دور کردن مدل از…

۲ دقیقه خواندن
AI

رمزگشایی از روش DharmaOCR برای کاهش ۵۹ درصدی حلقه‌های تکراری در استخراج متن

تنظیم دقیق نظارتی (SFT) اغلب در توقف حلقه‌های تکرار در وظایف ساختاریافته شکست می‌خورد. DharmaOCR با تبدیل این خروجی‌های معیوب به سیگنال‌های منفی در بهینه‌سازی مستقیم ترجیحات…

۳ دقیقه خواندن
AI

درون دادگاه فلوریدا: اتهام سهل‌انگاری جنائی علیه OpenAI و سام آلتمن

دادستان کل فلوریدا در اقدامی بی‌سابقه، از OpenAI و سام آلتمن به دلیل نادیده گرفتن هشدارهای ایمنی شکایت کرد. این پرونده مدعی است که این شرکت برای پیروزی در رقابت هوش مصنوعی، ابزاری…

۲ دقیقه خواندن
AI

درون ASSERT: تلاش مایکروسافت برای تبدیل قوانین اداری به کد تست هوش مصنوعی

مایکروسافت ابزار بازمتن ASSERT را معرفی کرد که قوانین متنی سازمان‌ها را به تست‌های خودکار رفتاری تبدیل می‌کند. این چارچوب به توسعه‌دهندگان کمک می‌کند تا اطمینان یابند عامل‌های هوش…

۲ دقیقه خواندن
AI

چگونه «هارنس» یا محیط ارزیابی، توانایی واقعی مدل‌های پیشرو را بازتعریف می‌کند؟

شرکت OpenAI در یک دستورالعمل فنی استدلال می‌کند که توانایی مدل‌های پیشرو یک مقدار ثابت نیست، بلکه متغیری وابسته به «هارنس» (Harness) یا همان محیط، ابزارها و بودجه محاسباتی است.…

۳ دقیقه خواندن
AI

RSI در برابر AGI: چرا خود-بهبودبخشی هدف جدید آزمایشگاه‌های هوش مصنوعی است؟

آزمایشگاه‌های هوش مصنوعی از هدف مبهم AGI به سمت RSI یا «خود-بهبودبخشی بازگشتی» حرکت کرده‌اند. هدف، ساخت سیستم‌هایی است که بتوانند بدون دخالت انسان، کد و معماری خود را ارتقا دهند.

۲ دقیقه خواندن۱
AI

چگونه Cursor با بازخورد متنی، سیگنال یادگیری عامل‌های خود را ۲۰۰۰ برابر کرد؟

نسخه Cursor Composer 2.5 با معرفی یادگیری تقویت‌شده مبتنی بر بازخورد متنی هدفمند، مشکل «تخصیص اعتبار» در جلسات طولانی را حل کرده است. این روش با جایگزینی پاداش‌های کلی با…

۲ دقیقه خواندن
AI

درون سند ۸۳ صفحه‌ای واتیکان برای پایان استعمار دیجیتال

پاپ لئو چهاردهم در نامه‌ای رسمی خواستار «خلع سلاح» هوش مصنوعی شد تا از انحصار قدرت در دست شرکت‌های بزرگ فناوری جلوگیری کند. این سند هشدار می‌دهد که تمرکز قدرت دیجیتال، شکل جدیدی…

۲ دقیقه خواندن
AI

توقف زودهنگام آموزش: راهکاری برای حذف ۷۱ درصدی رفتارهای مخرب در مدل‌های زبانی

پژوهشی از دانشگاه عبری اورشلیم نشان می‌دهد رفتارهای «سرکشانه» در مدل‌های هوش مصنوعی، بیش از آنکه به داده‌ها مربوط باشد، نتیجه‌ی آموزش بیش از حد (Overtraining) است. با توقف…

۳ دقیقه خواندن۲
چرا Anthropic پژوهش‌های مدل‌سازی را به دست خودِ هوش مصنوعی سپرده است؟

چرا Anthropic پژوهش‌های مدل‌سازی را به دست خودِ هوش مصنوعی سپرده است؟

آندری کارپاتی در ۱۹ مه ۲۰۲۶ به Anthropic پیوست تا تیمی برای تسریع پژوهش‌های پیش-آموزش با کمک Claude بسازد. این اقدام نشان‌دهنده‌ی تغییر استراتژی از تکیه بر قدرت محاسباتی خام به…

۲ دقیقه خواندن