پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۷۷۳ مقاله منتشر شده

لایه آموزش‌ندیده نوکیا برای تبدیل هر مدل زبانی باز به سیستم تصمیم‌گیری کالیبره‌شده
آموزش کاربردی

نوکیا: AnyJev سوگیری‌های موقعیتی LLM را بدون آموزش مجدد حذف می‌کند

نوکیا کتابخانه AnyJev را برای تبدیل مدل‌های زبانی باز به موتورهای تصمیم‌گیری کالیبره‌شده منتشر کرد. این ابزار بدون نیاز به آموزش مجدد، سوگیری‌های موقعیتی را حذف و قابلیت اطمینان…

۴ دقیقه خواندن
ده پروژه جامعه Jev: درک کاربردهای واقعی این فناوری
آموزش کاربردی

تصمیمات ساختاریافته در برابر استدلال‌های متنی در مدل Jev

مدل Jev با جایگزینی استدلال‌های متنی و گران‌قیمت با تصمیمات ساختاریافته و سریع، تأخیر در اجرای عامل‌های هوش مصنوعی را به ۳۰۰ میلی‌ثانیه کاهش داد. این رویکرد اجازه می‌دهد AI به‌جای…

۱۳ دقیقه خواندن
اجرای یک وظیفه Codex به مدت ۳۱ ساعت: بازماندن از راه‌اندازی مجدد و ساخت خط تولید کتاب درسی قابل‌حسابرسی
آموزش کاربردی

تولید بسته آموزشی ریاضی با Codex در یک اجرای ۳۱ ساعته و قابل‌حسابرسی

یک توسعه‌دهنده با استفاده از یک تسک بلندمدت در Codex، چارچوبی ریاضی را به یک بسته آموزشی نسخه‌بندی‌شده تبدیل کرد. این پروژه با جایگزینی حافظهٔ چت با آرتیفکت‌های نسخه‌بندی‌شده،…

۳ دقیقه خواندن۲
بررسی واقعیت با هوش مصنوعی: دفتر کل شواهد برای ادعاهای روزمره
آموزش کاربردی

Reality Check AI ردپای شواهد را برای ادعاهای هوش مصنوعی قابل‌تعقیب کرد

سامانه Reality Check AI با جایگزینی پاسخ‌های ساده با یک دفتر کل شواهد، ادعاهای آنلاین را به گزاره‌های قابل‌تأیید تبدیل می‌کند. این ابزار هر نتیجه‌گیری هوش مصنوعی را به منابع دقیق…

۱۳ دقیقه خواندن
مدل داخلی اوپن‌ای‌آی پس از یک ماه آموزش، بیش از ۱۰۰ مسئله ریاضی حل‌نشده را حل کرد.
اخبار کوتاه روزانه

درون استراتژی OpenAI برای مقابله با زوال درک مفهومی در ریاضیات

یک مدل آزمایشی OpenAI توانست در یک ماه آموزش، بیش از ۱۰۰ مسئله پیچیده ریاضی از جمله حدس هاج را حل کند. این شرکت اکنون برای مقابله با نگرانی‌های جامعه ریاضی درباره زوال درک مفهومی،…

۵ دقیقه خواندن
دو مدل زبانی بزرگ در حال رقابت زنده با کدهای GLSL در محیطی تعاملی.
آموزش کاربردی

«لاگ‌های سخت‌افزاری»؛ معیار جدید Refract برای ارزیابی مدل‌های زبانی

پلتفرم Refract با جایگزینی بنچمارک‌های انتزاعی با رندرهای زنده GPU، مدل‌های زبانی را در محیطی رقابتی برای نوشتن شیدرهای GLSL به چالش می‌کشد. در این سامانه، لاگ‌های خطای واقعی…

۴ دقیقه خواندن۱
تصویری از یک ربات آموزشی که به جای نوشتن کد، با اشاره به مغز انسان، یادگیری واقعی را تدریس می‌کند.
آموزش کاربردی

«تلاش سازنده»؛ رویکرد CodeTeach برای جایگزینی پاسخ‌های مستقیم

ابزار جدید CodeTeach برخلاف دستیارهای هوش مصنوعی رایج، از ارائه پاسخ مستقیم خودداری می‌کند تا دانشجویان را به «تلاش سازنده» وا دارد. این سیستم با الزام کاربر به ارائه فرضیه پیش از…

۱۲ دقیقه خواندن
تست جعبه‌سیاه برای ایمنی هوش مصنوعی پیشرفته ناکارآمد است
آموزش کاربردی

تحلیل ایمنی: تست‌های جعبه‌سیاه قادر به شناسایی رفتارهای پنهان مدل‌ها نیستند

ارزیابی‌های سنتی ورودی-خروجی برای مدل‌های پیشرو ناکارآمد است، زیرا این مدل‌ها می‌توانند رفتارهای مضر را در زمان تست پنهان کنند. ایمنی واقعی نیازمند گذار از مشاهده خروجی‌ها به…

۸ دقیقه خواندن۲
لوگوی UK AISI و EvalEval در کنار هم، نماد همکاری برای قابل‌تکرار کردن نتایج ارزیابی مدل‌های هوش مصنوعی

درون استراتژی AISI برای راستی‌آزمایی مدل‌های هوش مصنوعی پیشرو

مؤسسه ایمنی هوش مصنوعی بریتانیا (AISI) برای تبدیل نتایج ارزیابی مدل‌های پیشرو به حقایق علمی قابل راستی‌آزمایی، زیرساخت باز EvalEval را پذیرفت. این اقدام داده‌های سطح تراکنش را…

۴ دقیقه خواندن