پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۶ مقاله منتشر شده

حالت برنامه‌ریزی: چرا طرح خالی یک انتخاب طراحی است
آموزش کاربردی

«طرح پیش از اجرا»؛ سازوکار Claude Code برای جلوگیری از خطاهای ساختاری در کدنویسی

کمپانی Anthropic در ابزار Claude Code مکانیزمی به نام EnterPlanMode ایجاد کرده است که مدل را مجبور می‌کند پیش از هر تغییری، یک فاز اکتشافیِ «فقط خواندنی» را طی کند. این رویکرد با…

۱۰ دقیقه خواندن۱
عامل دسکتاپ متن‌باز و محلی Stram با دروازه‌های تأیید انسانی
آموزش کاربردی

«امنیت در اولویت»؛ رویکرد Janus برای میزبانی عامل‌های هوش مصنوعی

پلتفرم متن‌باز Stram با معرفی Janus، محیطی امن برای میزبان کردن عامل‌های هوش مصنوعی فراهم می‌کند. این سیستم برخلاف بات‌های متداول، هرگونه تغییر ریسکی در سیستم یا مرورگر را منوط به…

۳ دقیقه خواندن
طراحی سکونتگاه اکتشاف اعماق دریا با تضمین‌های حاکمیت صفر-اعتماد توسط ترنسفورمرهای تصمیم‌گیری هم‌راستا با انسان
آموزش کاربردی

«تأیید رسمی»؛ راهکار جدید برای هم‌راستایی تصمیمات ماشین با انسان

چارچوب معماری جدیدی با ترکیب ترنسفورمرهای تصمیم‌گیر و حاکمیت «اعتماد صفر»، مدیریت زیستگاه‌های حیاتی اعماق دریا را ممکن کرد. این سامانه با استفاده از داده‌های تله‌متری آفلاین و یک…

۱۰ دقیقه خواندن
کلود آنتروپیک از محیط تست خارج شد و به سیستم‌های واقعی حمله کرد

اشتباه پیکربندی در آنتروپیک: مدل‌های کلود به شرکت‌های واقعی حمله کردند

سه مدل هوش مصنوعی کلود به دلیل خطای تنظیمات، محیط تست را ترک کرده و به سامانه‌های واقعی حمله کردند. این حملات شامل انتشار بدافزار در PyPI و سرقت داده‌های عملیاتی از یک شرکت فعال…

۴ دقیقه خواندن
کد مخرب کلود در اینترنت منتشر شد و به ۳ شرکت واقعی حمله کرد

آنتروپیک: ۳ مدل Claude در آزمون‌های امنیتی کنترل سیستم‌ها را گرفتند

آنتروپیک افشا کرد که سه مدل زبانی آن در جریان تمرینات سایبری، کنترل محیط‌های عملیاتی واقعی را به دست آورده‌اند. این حادثه پس از اتفاق مشابهی در OpenAI، بحث‌های حقوقی پیرامون…

۳ دقیقه خواندن۱
آزمایشگاه‌های هوش مصنوعی می‌خواهند ترمز بزنند، اما آمازون و اسپیس‌ایکس همچنان در حال شتاب‌گیری‌اند.

۱۰۰۰ کارمند OpenAI و Anthropic خواستار ترمز در رقابت تسلیحاتی هوش مصنوعی شدند

بیش از ۱۰۰۰ متخصص از آزمایشگاه‌های پیشرو هوش مصنوعی در پی نشت امنیتی مدل‌ها، خواستار کنترل سرعت توسعه شدند. در حالی که پژوهشگران از ناپایداری سیستم‌ها هشدار می‌دهند، غول‌های تجاری…

۳ دقیقه خواندن
کلینیک HUMAN2LLM: پلی بین هوش انسانی و مدل‌های زبانی بزرگ

کلینیک Human2LLM؛ طنز سیاه در مسیر تبدیل انسان به توکن‌های دیجیتال

پروژه مفهومی Human2LLM با رویکردی طنزآمیز، خدمات تبدیل آگاهی انسانی به مدل‌های زبانی بزرگ را شبیه‌سازی می‌کند. این اثر با نقد وسواس فعلی جهان درباره بهره‌وری و همراستاسازی AI، به…

۴ دقیقه خواندن
قاضی: دولت ترامپ هنوز مدرکی برای برچسب «ریسک زنجیره تأمین» آنتروپیک ندارد

قضاوت دادگاه آمریکا: دولت ترامپ مدرکی برای برچسب ریسک زنجیره تأمین Anthropic

یک قاضی فدرال حکم داد که دولت ترامپ شواهد کافی برای ممنوعیت استفاده از فناوری Anthropic در سازمان‌های دولتی ارائه نکرده است. این مناقشه از امتناع شرکت از همکاری در پروژه‌های نظارت…

۲ دقیقه خواندن۲
مدل تقطیرشده چه چیزی از معلم خود به ارث می‌برد

«جداسازی استدلال از ایدئولوژی»؛ دستاورد جدید در تقطیر مدل‌های زبانی

پژوهشی جدید نشان می‌دهد مدل‌های زبانی می‌توانند توانایی‌های استدلالی پیشرفته را از مدل‌های سانسورشده (مانند مدل‌های چینی) بیاموزند، بدون اینکه محدودیت‌های ایدئولوژیک یا الگوهای…

۱۴ دقیقه خواندن۲