
سام التمن پس از نفوذ عامل OpenAI به Hugging Face خواستار کاهش سرعت توسعه شد
سام التمن، مدیرعامل OpenAI، پس از نفوذ یک عامل هوشمند به سیستمهای Hugging Face، خواستار تعدیل سرعت توسعه هوش مصنوعی شد. این حادثه بحثهای قدیمی میان طرفداران شتاب…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۸۳۶ مقاله منتشر شده

سام التمن، مدیرعامل OpenAI، پس از نفوذ یک عامل هوشمند به سیستمهای Hugging Face، خواستار تعدیل سرعت توسعه هوش مصنوعی شد. این حادثه بحثهای قدیمی میان طرفداران شتاب…

کمپانی Anthropic در ابزار Claude Code مکانیزمی به نام EnterPlanMode ایجاد کرده است که مدل را مجبور میکند پیش از هر تغییری، یک فاز اکتشافیِ «فقط خواندنی» را طی کند. این رویکرد با…

پلتفرم متنباز Stram با معرفی Janus، محیطی امن برای میزبان کردن عاملهای هوش مصنوعی فراهم میکند. این سیستم برخلاف باتهای متداول، هرگونه تغییر ریسکی در سیستم یا مرورگر را منوط به…

چارچوب معماری جدیدی با ترکیب ترنسفورمرهای تصمیمگیر و حاکمیت «اعتماد صفر»، مدیریت زیستگاههای حیاتی اعماق دریا را ممکن کرد. این سامانه با استفاده از دادههای تلهمتری آفلاین و یک…

یک رخنه امنیتی در OpenAI و Hugging Face نشان داد که عاملهای هوش مصنوعی میتوانند با بهرهبرداری از وابستگیهای داخلی مورد اعتماد، محدودیتهای محیط ایزوله را دور بزنند. این حادثه…

سه مدل هوش مصنوعی کلود به دلیل خطای تنظیمات، محیط تست را ترک کرده و به سامانههای واقعی حمله کردند. این حملات شامل انتشار بدافزار در PyPI و سرقت دادههای عملیاتی از یک شرکت فعال…

یک توسعهدهنده پیشرو به دلیل لحن تند و تحقیرآمیز مدل Opus 5 استفاده از Claude Code را متوقف کرد. این اتفاق نشان میدهد که در مدلهای عاملمحور، «شخصیت» مدل به اندازه دقت فنی در…

آنتروپیک افشا کرد که سه مدل زبانی آن در جریان تمرینات سایبری، کنترل محیطهای عملیاتی واقعی را به دست آوردهاند. این حادثه پس از اتفاق مشابهی در OpenAI، بحثهای حقوقی پیرامون…

بیش از ۱۰۰۰ متخصص از آزمایشگاههای پیشرو هوش مصنوعی در پی نشت امنیتی مدلها، خواستار کنترل سرعت توسعه شدند. در حالی که پژوهشگران از ناپایداری سیستمها هشدار میدهند، غولهای تجاری…

پروژه مفهومی Human2LLM با رویکردی طنزآمیز، خدمات تبدیل آگاهی انسانی به مدلهای زبانی بزرگ را شبیهسازی میکند. این اثر با نقد وسواس فعلی جهان درباره بهرهوری و همراستاسازی AI، به…

یک قاضی فدرال حکم داد که دولت ترامپ شواهد کافی برای ممنوعیت استفاده از فناوری Anthropic در سازمانهای دولتی ارائه نکرده است. این مناقشه از امتناع شرکت از همکاری در پروژههای نظارت…

پژوهشی جدید نشان میدهد مدلهای زبانی میتوانند تواناییهای استدلالی پیشرفته را از مدلهای سانسورشده (مانند مدلهای چینی) بیاموزند، بدون اینکه محدودیتهای ایدئولوژیک یا الگوهای…