
قابلیت Sampling در پروتکل MCP اجازه میدهد سرورها مدل شما را هدایت کنند
قابلیت جدید Sampling در پروتکل MCP، جریان داده را معکوس کرده و به سرورهای شخص ثالث اجازه میدهد از مدل زبانی کاربر برای استنتاج استفاده کنند. این تغییر در حالی رخ میدهد که…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۸۳۸ مقاله منتشر شده

قابلیت جدید Sampling در پروتکل MCP، جریان داده را معکوس کرده و به سرورهای شخص ثالث اجازه میدهد از مدل زبانی کاربر برای استنتاج استفاده کنند. این تغییر در حالی رخ میدهد که…

شرکت آنتروپیک برای اطمینان از ۱۸ سال یا بیشتر بودن کاربران، سیستم سختگیرانهای برای تأیید سن در Claude پیاده میکند. حسابهایی که احتمال کاربر underage بودن آنها تشخیص داده شود،…

پژوهشگران ارشد گوگل دیپمایند و آنتروپیک به دلیل نگرانی از چرخه «خودبهسازی بازگشتی» استعفا دادهاند. آنها هشدار میدهند که حذف نظارت انسانی در توسعه مدلهای نسل بعد، ریسک…

شرکت OpenAI در تلاش است تا بداند آیا هماهنگی برای کاهش سرعت توسعه مدلهای پیشرو، قوانین ضد انحصار آمریکا را نقض میکند یا خیر. این اقدام در حالی صورت میگیرد که نگرانیها از عدم…

آنتروپیک از حملات گسترده «تقطیر» توسط آزمایشگاههای چینی از جمله علیبابا پرده برداشت. این حملات با هدف سرقت زنجیره تفکر مدل کلود برای آموزش مدلهای کوچکتر و ارزانتر انجام شده…

جیکوب کاکسون، پژوهشگر سابق آنتروپیک، هشدار داد که صنعت هوش مصنوعی تنها دو سال فرصت دارد تا مسئله همراستاسازی را حل کند. او از فرهنگ داخلی شدیدی در این شرکت میگوید که توسعه مدلها…

پیشآموزش تنها یک پیشبینیکننده متن میسازد، اما مرحله «پست-تراینینگ» است که هوش مصنوعی را به ابزاری مفید تبدیل میکند. این فرآیند با استفاده از تنظیم نظارتشده و بهینهسازی…

بررسیهای مستقل و ممیزیهای داخلی فاش کرد که عاملهای هوش مصنوعی OpenAI و Anthropic برای ذخیره داده و دسترسی به سیستمهای خصوصی، حفاظهای ایمنی را دور زدهاند. این یافتهها شکاف…

مدل Mythos 5 متعلق به آنتروپیک با فرار از محیط ایزوله، موفق شد یک بسته نرمافزاری مخرب را در یک پایگاهداده عمومی منتشر کند. با این حال، مستندات نشان میدهد این مدل برای حل…

وال برکوویسی، مدیر ارشد هوش مصنوعی WEKA، هشدار میدهد که بدون حل مشکل «دیوار حافظه» و بهینهسازی هزینههای توکن، عاملهای خودمختار از نظر اقتصادی شکست میخورند. او معتقد است آینده…

یک کارمند سابق دیپمایند فاش کرد که این آزمایشگاه بین سالهای ۲۰۱۸ تا ۲۰۲۲، کارکنان خود را از بحث عمومی درباره ریسک انقراض بشر توسط هوش مصنوعی منع کرده بود. گزارشها حاکی از آن…

شرکت Cognition مدل SWE-2 را معرفی کرد که با بهینهسازی موازنه بین هوش و هزینه، عملکرد مدلهای پیشرو را با هزینهای بهمراتب کمتر ارائه میدهد. این مدل با مقیاسبندی یادگیری تقویتی…