پرش به محتوای اصلی

دسته‌بندی

تحلیل و بررسی تخصصی

تحلیل‌های عمیق مدل‌ها، مقالات و بنچمارک‌ها — پیش‌چاپ‌ها، ارزیابی‌ها، مدل‌های زبانی پیشرو و پژوهش همراستاسازی.

۵٬۷۷۱ مقاله منتشر شده

سازوکار PRIME: شناسایی نشانه‌های پنهان تقلب در پاداش پیش از وقوع شکست

سازوکار PRIME: شناسایی نشانه‌های پنهان تقلب در پاداش پیش از وقوع شکست

پژوهشگران پیش‌زمینه جدیدی به نام PRIME را شناسایی کرده‌اند که امکان پیش‌بینی تقلب در پاداش (Reward Hacking) را پیش از بروز شکست عملی فراهم می‌کند. این یافته، رویکرد همراستاسازی…

۱ دقیقه خواندن
CFips: عبور از بن‌بست محاسباتی در استخراج الگوهای بازه‌ای

CFips: عبور از بن‌بست محاسباتی در استخراج الگوهای بازه‌ای

معرفی چارچوب CFips برای حل مشکل Time-out در تحلیل داده‌های بازه‌ای حجیم از طریق ادغام محدودیت‌های نحوی در فرآیند نمونه‌برداری. این روش امکان استخراج الگوهای نماینده را بدون از دست…

۱ دقیقه خواندن۱
چرا طراحی بازگشتی در DGM باعث جهش ۲.۵ برابری عملکرد در بنچمارک SWE-bench شد؟

چرا طراحی بازگشتی در DGM باعث جهش ۲.۵ برابری عملکرد در بنچمارک SWE-bench شد؟

پژوهشگران چارچوب جدیدی برای «طراحی بازگشتی» در هوش مصنوعی معرفی کردند که طی آن مدل DGM توانست نمرات کدنویسی خود را در ۸۰ تکرار، از ۲۰٪ به ۵۰٪ برساند. این مطالعه با ارائه پروتکل…

۱ دقیقه خواندن۱
۸۶٪ دقت در تأیید پروتکل‌های درمانی سکته مغزی با ارکستراسیون مدل‌های زبانی

۸۶٪ دقت در تأیید پروتکل‌های درمانی سکته مغزی با ارکستراسیون مدل‌های زبانی

یک چارچوب جدید هوش مصنوعی می‌تواند رعایت دستورالعمل‌های پزشکی را تنها با تحلیل متون نامساختار تأیید کند. مطالعه‌ای در بیمارستان Alessandria موفق شد بدون نیاز به دستورالعمل‌های…

۱ دقیقه خواندن۱
گزارش ArXiv: کاهش ۲۸ درصدی توکن‌های استنتاج از طریق استدلال بصری

گزارش ArXiv: کاهش ۲۸ درصدی توکن‌های استنتاج از طریق استدلال بصری

پژوهشگران متد جدیدی به نام «استدلال بصری» را معرفی کرده‌اند که تحلیل‌های متنی داخلی را با نمایش‌های تصویری جایگزین می‌کند. این رویکرد بدون کاهش دقت، حجم توکن‌های مورد نیاز برای…

۱ دقیقه خواندن
چرا «خودتوضیحی» در هوش مصنوعی هنوز در سطح مفاهیم باقی مانده است؟

چرا «خودتوضیحی» در هوش مصنوعی هنوز در سطح مفاهیم باقی مانده است؟

یک بررسی جامع در arXiv نشان می‌دهد که مفهوم «خودتوضیحی» (SX) در سیستم‌های هوش مصنوعی، علیرغم اهمیت بنیادین، هنوز فاقد پیاده‌سازی عملی و معیارهای ارزیابی استاندارد است. این پژوهش…

۱ دقیقه خواندن۲
چگونه PRISM دستورات پنهان عامل‌های هوش مصنوعی را از دل فعال‌سازها بیرون می‌کشد؟

چگونه PRISM دستورات پنهان عامل‌های هوش مصنوعی را از دل فعال‌سازها بیرون می‌کشد؟

محققان ابزاری به نام PRISM را معرفی کرده‌اند که می‌تواند وضعیت‌های پنهان مدل‌های زبانی را به لیست‌های خوانای دستورات تبدیل کند. این فناوری امکان شناسایی اهداف مخفی و تزریق‌های…

۱ دقیقه خواندن
گزارش ArXiv: برتری داده‌های اختصاصی بر ساختارهای استدلالی در ارزش‌گذاری دارویی

گزارش ArXiv: برتری داده‌های اختصاصی بر ساختارهای استدلالی در ارزش‌گذاری دارویی

پژوهش‌های جدید نشان می‌دهد عامل‌های هوش مصنوعی در ارزش‌گذاری داروها، بیش از آنکه با محدودیت‌های استدلالی دست‌وپنجر باشند، با کمبود داده‌های باکیفیت مواجه‌اند. دسترسی به مجموعه…

۲ دقیقه خواندن
MedSci Skills: شناسایی ۱۰۰٪ خطاهای پزشکی با جایگزینی LLM با گیت‌های قطعی

MedSci Skills: شناسایی ۱۰۰٪ خطاهای پزشکی با جایگزینی LLM با گیت‌های قطعی

معماری جدید MedSci Skills با جایگزینی خود-ارزیابی مدل‌های زبانی با گیت‌های تأیید قطعی، توانست تمام خطاهای تزریق‌شده در متون بالینی را شناسایی کند. در حالی که مدل‌های زبانی معمولی…

۲ دقیقه خواندن
بهینه‌سازی پایش آنفلوانزا از طریق استنتاج گزینشی متغیرهای پنهان (BSLI)

بهینه‌سازی پایش آنفلوانزا از طریق استنتاج گزینشی متغیرهای پنهان (BSLI)

چارچوب BSLI پایش فاضلاب شهری را از یک جریان داده‌ی غیرفعال به یک سامانه‌ی تصمیم‌ساز فعال تبدیل می‌کند. این سیستم با تعیین زمان دقیق نیاز به داده‌های تکمیلی، توازن میان هزینه‌ی…

۲ دقیقه خواندن
مدل انتخاب پرسونا: چگونه آموزش ایمنی محدود، همراستاسازی جامع را تحریک می‌کند؟

مدل انتخاب پرسونا: چگونه آموزش ایمنی محدود، همراستاسازی جامع را تحریک می‌کند؟

پژوهشی جدید نشان می‌دهد تنظیم دقیق مدل‌های زبانی روی تسک‌های ایمنی محدود، می‌تواند منجر به همراستاسازی اخلاقی در دسته‌های کلی شود. این یافته مدل «انتخاب پرسونا» را تأیید می‌کند و…

۲ دقیقه خواندن۱
TheoremBench: افشای سوگیری مدل‌های زبانی در حل زیر-براهین ساده ریاضی

TheoremBench: افشای سوگیری مدل‌های زبانی در حل زیر-براهین ساده ریاضی

بنچمارک جدید TheoremBench نشان می‌دهد که مدل‌های زبانی با وجود موفقیت در مسائل مجزا، در مدیریت براهین پیچیده و وابسته به یکدیگر شکست می‌خورند. این مدل‌ها به جای استدلال ساختاری،…

۲ دقیقه خواندن