پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۸ مقاله منتشر شده

چرا مدل‌های Mythos انتروپیک دیگر از حریم خصوصی ZDR پشتیبانی نمی‌کنند؟
آموزش کاربردی

«تأیید سن اجباری»؛ استراتژی جدید آنتروپیک برای مدیریت کاربران

شرکت آنتروپیک برای اطمینان از ۱۸ سال یا بیشتر بودن کاربران، سیستم سخت‌گیرانه‌ای برای تأیید سن در Claude پیاده می‌کند. حساب‌هایی که احتمال کاربر underage بودن آن‌ها تشخیص داده شود،…

۱ دقیقه خواندن
ربات انسان‌نما در حال فکر کردن به خطرات هوش مصنوعی است.

استعفای زنجیره‌ای پژوهشگران گوگل و آنتروپیک از ترس خودبه‌سازی هوش مصنوعی

پژوهشگران ارشد گوگل دیپ‌مایند و آنتروپیک به دلیل نگرانی از چرخه «خودبه‌سازی بازگشتی» استعفا داده‌اند. آن‌ها هشدار می‌دهند که حذف نظارت انسانی در توسعه مدل‌های نسل بعد، ریسک…

۵ دقیقه خواندن
لوگوی OpenAI در کنار عبارت «آیا کند شدن صنعت هوش مصنوعی قانونی است؟»

درون تلاش OpenAI برای یافتن پوشش قانونی جهت کاهش سرعت توسعه

شرکت OpenAI در تلاش است تا بداند آیا هماهنگی برای کاهش سرعت توسعه مدل‌های پیشرو، قوانین ضد انحصار آمریکا را نقض می‌کند یا خیر. این اقدام در حالی صورت می‌گیرد که نگرانی‌ها از عدم…

۳ دقیقه خواندن۱
پژوهشگر Anthropic نگاهی به هوش مصنوعی خودبهبودیافته انداخت | TechCrunch

علی‌بابا با ۲۰۰ میلیون درخواست، منطق استدلال Claude را استخراج کرد

آنتروپیک از حملات گسترده «تقطیر» توسط آزمایشگاه‌های چینی از جمله علی‌بابا پرده برداشت. این حملات با هدف سرقت زنجیره تفکر مدل کلود برای آموزش مدل‌های کوچک‌تر و ارزان‌تر انجام شده…

۳ دقیقه خواندن
پژوهشگر هوش مصنوعی که از شرکت Anthropic استعفا داد: «زمان سرنوشت‌سازی برای بشریت فرا رسیده است»

«پروژه منهتن کوچک»؛ افشای فضای جنگی درون آنتروپیک برای بقای بشر

جیکوب کاکسون، پژوهشگر سابق آنتروپیک، هشدار داد که صنعت هوش مصنوعی تنها دو سال فرصت دارد تا مسئله همراستاسازی را حل کند. او از فرهنگ داخلی شدیدی در این شرکت می‌گوید که توسعه مدل‌ها…

۱۴ دقیقه خواندن۱
آموزش مدل هوش مصنوعی کافی بود؟ نه، پس‌آموزش هم هست.
آموزش کاربردی

«همراستایی با رفتار انسانی»؛ هدف نهایی از بهینه‌سازی ترجیحات در LLMها

پیش‌آموزش تنها یک پیش‌بینی‌کننده متن می‌سازد، اما مرحله «پست-تراینینگ» است که هوش مصنوعی را به ابزاری مفید تبدیل می‌کند. این فرآیند با استفاده از تنظیم نظارت‌شده و بهینه‌سازی…

۴ دقیقه خواندن
"Swarmchasers" عاملان سرکش را شکار می‌کنند، Anthropic خود را بررسی می‌کند و هر دو ردپا تاریک می‌شود.

عامل‌های OpenAI و Anthropic با دور زدن حفاظ‌ها به سیستم‌های خصوصی نفوذ کردند

بررسی‌های مستقل و ممیزی‌های داخلی فاش کرد که عامل‌های هوش مصنوعی OpenAI و Anthropic برای ذخیره داده و دسترسی به سیستم‌های خصوصی، حفاظ‌های ایمنی را دور زده‌اند. این یافته‌ها شکاف…

۹ دقیقه خواندن۵
وال برکوویچی، مدیر ارشد هوش مصنوعی در شرکت ویکا، در حال مصاحبه با سری مصاحبه‌های تخصصی.

دیوار حافظه: دلیل شکست عامل‌های هوش مصنوعی در مقیاس تجاری

وال برکوویسی، مدیر ارشد هوش مصنوعی WEKA، هشدار می‌دهد که بدون حل مشکل «دیوار حافظه» و بهینه‌سازی هزینه‌های توکن، عامل‌های خودمختار از نظر اقتصادی شکست می‌خورند. او معتقد است آینده…

۱۳ دقیقه خواندن۲
کارمند سابق روابط عمومی دیپ‌مایند: آزمایشگاه بحث عمومی درباره خطر انقراض بشر توسط هوش مصنوعی را ممنوع کرده بود.

افشای ممنوعیت بحث درباره خطر انقراض بشر در دیپ‌مایند

یک کارمند سابق دیپ‌مایند فاش کرد که این آزمایشگاه بین سال‌های ۲۰۱۸ تا ۲۰۲۲، کارکنان خود را از بحث عمومی درباره ریسک انقراض بشر توسط هوش مصنوعی منع کرده بود. گزارش‌ها حاکی از آن…

۱ دقیقه خواندن