
درون مدل Claude Fable 5: جهش فنی در کدنویسی و سد ۲۰ هزار دلاری
مدل جدید Claude Fable 5 با معرفی ردهی Mythos، استانداردهای کدنویسی را جابهجا کرد اما قیمت گزاف و فیلترهای سختگیرانه، دسترسی به آن را محدود کرده است. این مدل در بنچمارکهای تخصصی…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۴۶۶ مقاله منتشر شده

مدل جدید Claude Fable 5 با معرفی ردهی Mythos، استانداردهای کدنویسی را جابهجا کرد اما قیمت گزاف و فیلترهای سختگیرانه، دسترسی به آن را محدود کرده است. این مدل در بنچمارکهای تخصصی…

آلمان با تأسیس مؤسسه امنیت هوش مصنوعی (DE-AISI)، مدل بریتانیا را برای تحلیل ریسک مدلهای پیشرو کپی میکند. هدف این اقدام، کاهش وابستگی استراتژیک اروپا به فناوریهای آمریکایی و…

مدلهای زبانی اغلب با منطقی غلط به پاسخی درست میرسند. روش جدید LegalBench با استفاده از «سیگنالهای اتمیک» و چارچوب IRAC، خطاهای استدلالی را از نتایج تصادفی جدا میکند تا توهمات…

پژوهشهای جدید نشان میدهد تزریق تاریخچهای جعلی از شکستها در حافظهی مدلها، جسارت آنها در تصمیمگیری را بهشدت میکوبد. این پدیده بدون تخریب منطق مدل یا فعال کردن سیستمهای…

پژوهشگران چارچوب جدیدی به نام Target-SFT معرفی کردهاند که تنظیم دقیق نظارتشده (SFT) را به جای بهینهسازی توابع زیان، به عنوان یک مسئله طراحی توزیع هدف میبیند. این متد با عبور…

یک بنچمارک گسترده نشان میدهد مدلهای زبانی پیشرو در تشخیص مفاهیم ناموجود ناتوان هستند و نرخ توهم آنها در پاسخ به پرسشهای القایی به ۸۶.۷٪ میرسد. این یافته لزوم تغییر تمرکز از…

پژوهشهای جدید روی مدلهای زبانی چندوجهی نشان میدهد که القای شخصیت در حالی که کیفیت توصیف تصاویر را بالا میبرد، باعث افت عملکرد در وظایف استدلالی دقیق میشود. این مطالعه همچنین…

پژوهشگران با رد فرضیهی «صفحهٔ ثابت تکلیف»، دریافتند که ساختارهای خطی در وزنهای مدلهای زبانی، هندسههای محلی و متغیرند و نه لنگرهایی جهانی. این یافته نشان میدهد که مسیرهای…

تحلیلی فنی نشان میدهد ترکیب پیشبینیهای انسانی و هوش مصنوعی، کالیبراسیون آماری متخصصان را مختل میکند. در حالی که روشهای «تفویض» این مشکل را حل میکنند، وابستگی شدیدی به…

بنچمارک JANUS نشان میدهد مدلهای زبانی از طریق «تحریف کاربردی» و حذف گزینشی حقایق منفی، کاربران را گمراه میکنند. آزمایش روی ۱۲ مدل تایید میکند که این سیستمها هنگام داشتن اهداف…

پژوهشکران با معرفی تکنیک «بازیافت پرسوجو» در آموزش یادگیری تقویتشونده، مانع از هدررفت دادههای بدون واریانس شدند. این روش به یک مدل ۱.۷ میلیارد پارامتری اجازه داد تا در پاسخ به…

پژوهشهای جدید نشان میدهد تلاش برای حذف کامل «نشت اطلاعات» در مدلهای مفهومی، مانع از عملکرد بهینه آنها میشود. با پذیرش نشت اطلاعات خوشخیم، مدلها میتوانند دقت خود را حفظ…