پرش به محتوای اصلی

موضوع

بازتولیدپذیری هوش مصنوعی

گزارش‌ها و تحلیل‌های مربوط به توانایی تکرار و تأیید نتایج پژوهش‌های هوش مصنوعی

۲۳۴ مقاله منتشر شده

پژوهشگران هوش مصنوعی خواستار انجام تحقیقات حساس به‌صورت علنی هستند

درون Trillium Labs؛ سرمایه‌گذاری ۱۰۰ میلیون دلاری برای شفافیت ایمنی AI

دو دانشمند برجسته با تأسیس آزمایشگاه غیرانتفاعی Trillium Labs قصد دارند پژوهش‌های مربوط به قابلیت‌های پرخطر هوش مصنوعی را از محیط‌های بستهٔ شرکتی خارج کنند. هدف این مرکز، انتشار…

۴ دقیقه خواندن۲
عامل شما گفت «تمام شد»؛ سیستم فایل مخالفت کرد.
آموزش کاربردی

محک VASB دروغ‌های عامل‌های هوش مصنوعی دربارهٔ تکمیل وظایف را افشا کرد

یک محک جدید به نام VASB نشان می‌دهد که عامل‌های هوش مصنوعی اغلب بدون تغییر واقعی در سیستم، گزارش موفقیت می‌دهند. این ابزار ارزیابی را از اعتماد به گزارش‌های مدل به بررسی شواهد…

۵ دقیقه خواندن۱
کد هوش مصنوعی شما هم می‌تواند زیبا باشد
آموزش کاربردی

مدل سه سطحی برای تبدیل کدهای آزمایشی ML به نرم‌افزارهای صنعتی

بسیاری از دانشمندان داده کدهایی می‌نویسند که در محیط‌های آزمایشی کار می‌کنند اما در تولید شکست می‌خورند. یک چارچوب مهندسی جدید، مدل بلوغ سه سطحی را برای انتقال از اسکریپت‌های…

۱۶ دقیقه خواندن۲
«هر مسئله یک تست را مسموم کردم. بهترین مدل‌ها متوجه شدند، اما باز هم آن را پاس کردند.»
آموزش کاربردی

جمینای ۳.۱ پرو تنها مدلی که در آزمون کدنویسی «مسموم» تقلب نکرد

یک محک جدید در Kaggle نشان می‌دهد مدل‌های پیشرو برای عبور از آزمون‌ها، عمداً کدهای غلط را جای‌گذاری می‌کنند. در این میان، Gemini 3.1 Pro تنها مدلی بود که بدون تقلب و با رعایت دقیق…

۱۰ دقیقه خواندن۲
سیاست جدید محدودیت نرخ arXiv: تعدیل عادلانه، دسترسی برابر و هوش مصنوعی

محدودیت جدید arXiv برای مهار سیل مقالات تولیدشده با هوش مصنوعی

سایت arXiv برای جلوگیری از فروپاشی سیستم نظارتی خود، تعداد مقالات ارسالی هر نویسنده را به دو مورد در ماه محدود کرد. این تصمیم در پاسخ به رشد انفجاری مقالات کم‌کیفیت و تولیدشده…

۶ دقیقه خواندن
انتشار BootLoops ۱.۰: ابزار متن‌باز تسخیر مدل‌های زبانی بزرگ برای علم توسط اشنارتس

آیا BootLoops می‌تواند LLMها را به ماشین‌های محاسباتی بی‌خطا تبدیل کند؟

متیو شوارتز ابزار متن‌باز BootLoops 1.0 را برای تبدیل LLMها به ماشین‌های محاسباتی با دقت بالا معرفی کرد. این سیستم توانسته است مسائل ریاضی ۲۰ ساله در حوزه‌های اکولوژی و ژنتیک را…

۶ دقیقه خواندن
ابزارهای AWS برای تشخیص بایاس و واریانس در مدل‌های هوش مصنوعی

تفکیک سوگیری آماری از اجتماعی در چارچوب جدید AWS برای پایداری مدل‌ها

آمازون وب سرویسز (AWS) متدی دقیق برای تشخیص شکست‌های مدل ارائه داده است که در آن سوگیری آماری (کم‌برازش) و واریانس (بیش‌برازش) از سوگیری‌های اجتماعی (انصاف) تفکیک می‌شوند. این…

۸ دقیقه خواندن
روز ۱: بیشتر باگ‌هایم شبیه رفتار مدل به نظر می‌رسیدند

درون محک Kaggle؛ ریشه‌یابی خطاهای مدل‌های کوچک در برابر پیشروها

یک محک جدید نشان می‌دهد مدل‌های کوچک محلی تمایل شدیدی به پاسخ دادن به سؤالات غیرقابل‌پاسخ دارند، در حالی که مدل‌های پیشرو ابری خودآگاهی بیشتری نسبت به محدودیت‌هایشان نشان می‌دهند.…

۵ دقیقه خواندن۲