
سازوکار اصلاح خطا در یادگیری تقویتشده: ریاضیات پشت پردهی تنبیه مدل
راهنمای فنی جدیدی نشان میدهد مدلهای یادگیری تقویتشده چگونه از پاداشهای منفی برای تغییر احتمال تصمیمات استفاده میکنند. این متن گامهای ریاضی دقیقی را برای دور کردن مدل از…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۸۳۴ مقاله منتشر شده

راهنمای فنی جدیدی نشان میدهد مدلهای یادگیری تقویتشده چگونه از پاداشهای منفی برای تغییر احتمال تصمیمات استفاده میکنند. این متن گامهای ریاضی دقیقی را برای دور کردن مدل از…
تنظیم دقیق نظارتی (SFT) اغلب در توقف حلقههای تکرار در وظایف ساختاریافته شکست میخورد. DharmaOCR با تبدیل این خروجیهای معیوب به سیگنالهای منفی در بهینهسازی مستقیم ترجیحات…
دادستان کل فلوریدا در اقدامی بیسابقه، از OpenAI و سام آلتمن به دلیل نادیده گرفتن هشدارهای ایمنی شکایت کرد. این پرونده مدعی است که این شرکت برای پیروزی در رقابت هوش مصنوعی، ابزاری…
مایکروسافت ابزار بازمتن ASSERT را معرفی کرد که قوانین متنی سازمانها را به تستهای خودکار رفتاری تبدیل میکند. این چارچوب به توسعهدهندگان کمک میکند تا اطمینان یابند عاملهای هوش…
شرکت OpenAI در یک دستورالعمل فنی استدلال میکند که توانایی مدلهای پیشرو یک مقدار ثابت نیست، بلکه متغیری وابسته به «هارنس» (Harness) یا همان محیط، ابزارها و بودجه محاسباتی است.…
شرکت Anthropic مدل Claude Opus 4.8 را با تمرکز بر کاهش توهمات و افزایش صداقت در کدنویسی منتشر کرد. این بهروزرسانی قابلیت کنترل میزان تلاش مدل و پیشنمایشی از گردشهای کاری پویا…
آزمایشگاههای هوش مصنوعی از هدف مبهم AGI به سمت RSI یا «خود-بهبودبخشی بازگشتی» حرکت کردهاند. هدف، ساخت سیستمهایی است که بتوانند بدون دخالت انسان، کد و معماری خود را ارتقا دهند.
نسخه Cursor Composer 2.5 با معرفی یادگیری تقویتشده مبتنی بر بازخورد متنی هدفمند، مشکل «تخصیص اعتبار» در جلسات طولانی را حل کرده است. این روش با جایگزینی پاداشهای کلی با…
یک خط لوله (Pipeline) جدید برای آموزش مدلهای بینایی-زبانی معرفی شده است که به جای تکیه بر حدسهای هوش مصنوعی، از اثباتهای ریاضی برای پاداشدهی استفاده میکند. این روش با ترکیب…
پاپ لئو چهاردهم در نامهای رسمی خواستار «خلع سلاح» هوش مصنوعی شد تا از انحصار قدرت در دست شرکتهای بزرگ فناوری جلوگیری کند. این سند هشدار میدهد که تمرکز قدرت دیجیتال، شکل جدیدی…
پژوهشی از دانشگاه عبری اورشلیم نشان میدهد رفتارهای «سرکشانه» در مدلهای هوش مصنوعی، بیش از آنکه به دادهها مربوط باشد، نتیجهی آموزش بیش از حد (Overtraining) است. با توقف…

آندری کارپاتی در ۱۹ مه ۲۰۲۶ به Anthropic پیوست تا تیمی برای تسریع پژوهشهای پیش-آموزش با کمک Claude بسازد. این اقدام نشاندهندهی تغییر استراتژی از تکیه بر قدرت محاسباتی خام به…