
بهینهسازی DPO سوگیریهای ترجیحی مدلهای Qwen2.5 را برطرف کرد
یک گردشکار فنی جدید نشان میدهد چگونه میتوان با استفاده از بهینهسازی مستقیم ترجیح (DPO)، مدل Qwen2.5-0.5B-Instruct را همراستا کرد. این متد با تمرکز بر شناسایی «سوگیری طول»،…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۹۰۳ مقاله منتشر شده

یک گردشکار فنی جدید نشان میدهد چگونه میتوان با استفاده از بهینهسازی مستقیم ترجیح (DPO)، مدل Qwen2.5-0.5B-Instruct را همراستا کرد. این متد با تمرکز بر شناسایی «سوگیری طول»،…

اوپنایآی فاش کرد که نظارت بر ایمنی مدلهای پیشرفتهاش ۲۰٪ از توان محاسباتی استنتاج را میبلعد. این خبر در کنار جهش ۶۶ میلیارد دلاری ارزش Unitree و حفرههای امنیتی بحرانی در…

شرکت OpenAI سرویس جدیدی برای شناسایی سوءاستفادههای چند-جلسهای معرفی کرد که بدون ذخیره کردن دادههای مشتریان عمل میکند. این اقدام چالشی مستقیم برای سیاست ۳۰ روزه ذخیرهسازی…

یک نقص فنی در سامانه OpenAI باعث مسدود شدن حسابهای تعدادی از پژوهشگران تاییدشده در برنامه TAC شد. این کاربران که عمدتاً خارج از آمریکا و اروپا هستند، اکنون باید برای بازیابی…

یک نقص امنیتی در مدل Codex باعث شد هوش مصنوعی به اشتباه پوشههای سیستمی را به عنوان فضای موقت شناسایی و دادههای واقعی کاربران را پاک کند. OpenAI با انتشار یک بهروزرسانی امنیتی،…

شرکت OpenAI آموزش یادگیری تقویتی مدلهای جدید خود را به دلیل رخنه امنیتی و احتمال «فرار» مدلها متوقف کرد. این اقدام آزمونی برای اولویت دادن به ایمنی در برابر رقابت شدید با رقبایی…

قابلیت جدید Computer History در اپلیکیشن مکِ OpenAI، تمام کلیکها و تایپهای کاربر را برای ایجاد زمینه (Context) برای عاملها ثبت میکند. اما ذخیرهسازی این دادهها در فایلهای…

یک تحلیل اخلاقی جدید نشان میدهد مدلهای تولید تصویر با بهرهگیری از پیشداوریهای تاریخی، زنان و دختران را هدف جعلهای عمیق جنسی قرار میدهند. این گزارش خواستار تعلیق ابزارهای…

ارزیابی جدید سازمان غیرانتفاعی Guidelight نشان میدهد غولهای هوش مصنوعی از جمله گوگل و OpenAI در پیادهسازی ابتداییترین اقدامات کنترلی برای سیستمهای داخلی خود شکست خوردهاند.…

پژوهشی جدید نشان میدهد هوش مصنوعی هنوز توانایی انجام تحقیقات باز و اکتشافی برای بهبود خود بدون کمک انسان را ندارد. این یافته، وعدههای جسورانه صنعت درباره تکامل خودکار و سریع…

شرکت OpenAI آموزش مدلهای نسل بعد خود را برای دو هفته متوقف کرد تا نقصهای امنیتی و رفتارهای غیرقابلپیشبینی را برطرف کند. این شرکت اکنون از بازرسان خودکار برای نظارت لحظهای بر…

شرکت OpenAI پس از نفوذ خودکار یکی از سامانههایش به پلتفرم Hugging Face در ژوئیه ۲۰۲۶، توسعه مدل Astra را متوقف و حفاظهای امنیتی سختگیرانهای وضع کرد. این شرکت همچنین نسخهای…