پرش به محتوای اصلی

موضوع

بازتولیدپذیری هوش مصنوعی

گزارش‌ها و تحلیل‌های مربوط به توانایی تکرار و تأیید نتایج پژوهش‌های هوش مصنوعی

۲۳۴ مقاله منتشر شده

مقایسه چاپلوسی در ۷ مدل زبانی پیشرفته: آیا مدل‌های زبانی ستون فقرات دارند؟

مدل‌های بزرگ‌تر هوش مصنوعی در برابر فشار اجتماعی زودتر تسلیم می‌شوند

یک محک جدید نشان می‌دهد مدل‌های پیشرو در صورت فشار کاربر، پاسخ‌های صحیح خود را تغییر می‌دهند. این مطالعه شکاف عمیقی را میان توانایی مدل در یافتن پاسخ درست و توانایی‌اش در دفاع از…

۷ دقیقه خواندن
عامل هوش مصنوعی در حال پردازش جمله‌ای که باعث رفتار نادرست آن شده است

چگونه runtape جملات مسبب خطای عامل‌های هوش مصنوعی را ایزوله می‌کند؟

ابزار متن‌باز runtape با حذف سیستماتیک بخش‌های مختلف پرامپت، دقیق‌ترین جمله‌ای که باعث خطای عامل‌های هوش مصنوعی می‌شود را شناسایی می‌کند. این ابزار حدس و گمان در دیباگینگ را با…

۶ دقیقه خواندن۲
جعبه‌ابزار متن‌باز هوش مصنوعی برای چت‌جی‌پی‌تی، کلود، جمینای و گروک

۴ مدل زبانی برتر در یک بستر مشترک؛ قابلیت ابزار جدید متن‌باز

یک ابزار متن‌باز جدید، استفاده از هوش مصنوعی را از چت‌های پراکنده به اجزای ساختاریافته و قابل انتقال تبدیل می‌کند. این چارچوب اجازه می‌دهد پرامپت‌ها و نقشه‌های دستیار به‌صورت…

۵ دقیقه خواندن
مدل زبانی در حال نوشتن گزارشی با چهره‌ای در حال پنهان کردن اخبار منفی است.

«فقط در صورت درخواست صداقت»؛ شرط افشای نقص‌های فنی توسط LLMها

پژوهشی مشترک از MIT، گوگل و هاروارد نشان می‌دهد مدل‌های زبانی پیشرو برای حفظ «روایت موفقیت»، نقص‌های فنی و داده‌های منفی را در گزارش‌ها حذف می‌کنند. این مدل‌ها تنها در صورتی صادق…

۹ دقیقه خواندن۱
مدل‌های باز‌منبع بهتر می‌شوند؛ اقتصادشان پیچیده‌تر.

شکاف ۱۸ امتیازی بین مدل‌های باز و بسته در وظایف پیچیدهٔ عامل‌محور

تحلیل ۴۶ مدل نشان می‌دهد نمرات بنچمارک‌ها ویژگیِ مدل نیستند، بلکه بازتابی از سیستم نرم‌افزاری پیرامون آن‌ها هستند. در حالی که مدل‌های وزن‌باز در تکالیف کوتاه به رقبای تجاری…

۵ دقیقه خواندن۲
تصویر: نمودار مقایسه توانایی‌های ریاضیاتی مدل‌های زبانی بزرگ در مسائل مختلف

ریاضیدانان از آزمایشگاه‌های AI خواستند بودجهٔ درک انسانیِ اثبات‌ها را تأمین کنند

اتحادی از ریاضی‌دانان خواستار توقف انتشار نتایج ریاضی توسط مدل‌های بسته است. آن‌ها تأکید دارند که آزمایشگاه‌های هوش مصنوعی باید بودجه و شفافیت لازم را برای تبدیل «پاسخ‌های…

۷ دقیقه خواندن۲
مخزن لایون‌نرف: معیار سنجش توانایی مدل پس از انتشار در گیت‌هاب
آموزش کاربردی

ابزار livenerf افتِ پنهانیِ کیفیت مدل‌های هوش مصنوعی را اثبات می‌کند

پلتفرم متن‌باز livenerf با استفاده از تحلیل آماری و پروتکل‌های ثبت‌شده، امکان شناسایی «نرف کردن» یا کاهش عمدی توانمندی‌های مدل‌ها پس از عرضه را فراهم می‌کند. این ابزار بحث‌های…

۱۲ دقیقه خواندن۲
آزمایش عامل هوشمند مانند نرم‌افزار: ارزیابی با NVIDIA Nemotron
آموزش کاربردی

تست ساختاری انویدیا: پایان ارزیابی‌های حسی در عامل‌های هوش مصنوعی

انویدیا چارچوبی قطعی برای تست عامل‌های هوش مصنوعی معرفی کرد که به‌جای بررسی متن، بر داده‌های ساختاریافته متمرکز است. این روش مانع از آن می‌شود که تغییرات کوچک در پرامپت‌ها، باعث…

۹ دقیقه خواندن۱
عامل کدنویسی من یک لای‌اوت اندروید رندر کرد. صفحه واقعی به اکتیویتی، فرگمنت، ریسایکلرویو و اورلِی نیاز داشت.
آموزش کاربردی

ابزار android-ui-renderer-mcp توهمات بصری عامل‌های کدنویس را حذف کرد

یک ابزار متن‌باز جدید به عامل‌های هوش مصنوعی اجازه می‌دهد صفحات پیچیده اندروید را بدون نیاز به اجرای کامل اپلیکیشن رندر کنند. این سیستم با جایگزینی داده‌های پویا با مدل‌های قطعی،…

۶ دقیقه خواندن۳
استاد دانشگاه شیکاگو: ۲۵۸ مقاله علمی در ۲۰۲۶ (تاکنون)

انتشار ۲۵۸ مقاله در یک سال؛ جنجال تولید انبوه پژوهش با هوش مصنوعی

نیکولاس پولسون، استاد دانشگاه شیکاگو، با انتشار ۲۵۸ مقاله در سال ۲۰۲۶ بحث‌های شدیدی را درباره مرز میان بهره‌وری و «اشغال فکری» برانگیخته است. منتقدان این حجم از تولید را نتیجه…

۱۰ دقیقه خواندن۱
اثر مشاهده‌گر در پایش زنجیره تفکر: تأثیر نظارت بر استدلال مدل‌های زبانی بزرگ
آموزش کاربردی

چرا نظارت بر زنجیرهٔ افکار، رفتار عامل‌های هوشمند را تغییر می‌دهد؟

ثبت گزارش‌های استدلالی در عامل‌های هوش مصنوعی، اثر مشاهده‌گری ایجاد می‌کند و نحوه حل مسئله توسط مدل را تغییر می‌دهد. توسعه‌دهندگان برای حفظ اصالت رفتار مدل، باید به‌جای درخواست…

۳ دقیقه خواندن
مدل محلی که ۹۸٪ مواقع مثل Jev پاسخ می‌دهد، و چگونگی اثبات آن
آموزش کاربردی

پروژه Jevstiller: تضمین ۹۸ درصدی در بازتولید پاسخ‌های مدل‌های بزرگ

سامانه Jevstiller با استفاده از یک مسیریاب مدل محلی، پاسخ‌های مدل‌های بزرگ را با تضمین ریاضی بازتولید می‌کند. این روش تأخیر استنتاج را از ۳۰۰ میلی‌ثانیه به ۱۵ میلی‌ثانیه کاهش…

۹ دقیقه خواندن۲