پرش به محتوای اصلی

موضوع

عامل‌محور

Autonomous agents, tool use, planning, multi-step workflows

۵٬۹۳۹ مقاله منتشر شده

۸۶٪ دقت در تأیید پروتکل‌های درمانی سکته مغزی با ارکستراسیون مدل‌های زبانی

۸۶٪ دقت در تأیید پروتکل‌های درمانی سکته مغزی با ارکستراسیون مدل‌های زبانی

یک چارچوب جدید هوش مصنوعی می‌تواند رعایت دستورالعمل‌های پزشکی را تنها با تحلیل متون نامساختار تأیید کند. مطالعه‌ای در بیمارستان Alessandria موفق شد بدون نیاز به دستورالعمل‌های…

۱ دقیقه خواندن۱
چرا «خودتوضیحی» در هوش مصنوعی هنوز در سطح مفاهیم باقی مانده است؟

چرا «خودتوضیحی» در هوش مصنوعی هنوز در سطح مفاهیم باقی مانده است؟

یک بررسی جامع در arXiv نشان می‌دهد که مفهوم «خودتوضیحی» (SX) در سیستم‌های هوش مصنوعی، علیرغم اهمیت بنیادین، هنوز فاقد پیاده‌سازی عملی و معیارهای ارزیابی استاندارد است. این پژوهش…

۱ دقیقه خواندن۲
چگونه PRISM دستورات پنهان عامل‌های هوش مصنوعی را از دل فعال‌سازها بیرون می‌کشد؟

چگونه PRISM دستورات پنهان عامل‌های هوش مصنوعی را از دل فعال‌سازها بیرون می‌کشد؟

محققان ابزاری به نام PRISM را معرفی کرده‌اند که می‌تواند وضعیت‌های پنهان مدل‌های زبانی را به لیست‌های خوانای دستورات تبدیل کند. این فناوری امکان شناسایی اهداف مخفی و تزریق‌های…

۱ دقیقه خواندن
گزارش ArXiv: برتری داده‌های اختصاصی بر ساختارهای استدلالی در ارزش‌گذاری دارویی

گزارش ArXiv: برتری داده‌های اختصاصی بر ساختارهای استدلالی در ارزش‌گذاری دارویی

پژوهش‌های جدید نشان می‌دهد عامل‌های هوش مصنوعی در ارزش‌گذاری داروها، بیش از آنکه با محدودیت‌های استدلالی دست‌وپنجر باشند، با کمبود داده‌های باکیفیت مواجه‌اند. دسترسی به مجموعه…

۲ دقیقه خواندن
MedSci Skills: شناسایی ۱۰۰٪ خطاهای پزشکی با جایگزینی LLM با گیت‌های قطعی

MedSci Skills: شناسایی ۱۰۰٪ خطاهای پزشکی با جایگزینی LLM با گیت‌های قطعی

معماری جدید MedSci Skills با جایگزینی خود-ارزیابی مدل‌های زبانی با گیت‌های تأیید قطعی، توانست تمام خطاهای تزریق‌شده در متون بالینی را شناسایی کند. در حالی که مدل‌های زبانی معمولی…

۲ دقیقه خواندن
AliyunConsoleAgent: دستیابی به عملکرد مدل‌های پیشرو با ۹۲٪ هزینه کمتر

AliyunConsoleAgent: دستیابی به عملکرد مدل‌های پیشرو با ۹۲٪ هزینه کمتر

یک چارچوب آموزشی جدید با بهره‌گیری از تقطیر دانش و بهینه‌سازی GRPO، مدلی با ۳۲ میلیارد پارامتر را به سطح مدل‌های تجاری پیشرو در اتوماسیون کنسول‌های ابری رسانده است. این سیستم ضمن…

۲ دقیقه خواندن
رمزگشایی از «قرارداد شناختی» در SuperBrowser: عبور از بن‌بست پردازش DOM در وب

رمزگشایی از «قرارداد شناختی» در SuperBrowser: عبور از بن‌بست پردازش DOM در وب

عامل جدید SuperBrowser با دستیابی به نرخ موفقیت ۸۹.۴۷ درصدی در بنچمارک Mind2Web Hard، استانداردهای ناوبری وب را جابه‌جا کرد. این سیستم به جای پردازش جامع داده‌های صفحه، از مکانیزم…

۲ دقیقه خواندن۱
چرا عامل‌های هوش مصنوعی در مدیریت هم‌زمان محیط‌های گرافیکی و متنی شکست می‌خورند؟

چرا عامل‌های هوش مصنوعی در مدیریت هم‌زمان محیط‌های گرافیکی و متنی شکست می‌خورند؟

بنچمارک جدید WeaveBench نشان می‌دهد که مدل‌های پیشرو در وظایف ترکیبی GUI و CLI تنها به نرخ موفقیت ۴۱.۲ درصدی رسیده‌اند. این نتایج فاش می‌کند که عامل‌ها در مدیریت گردش‌کارهای…

۱ دقیقه خواندن۲
«مالیات استدلال»: کاهش ۲۸ درصدی دقت مدل‌های متوسط در خروجی‌های JSON

«مالیات استدلال»: کاهش ۲۸ درصدی دقت مدل‌های متوسط در خروجی‌های JSON

پژوهشی جدید نشان می‌دهد اجبار مدل‌های زبانی متوسط به تولید خروجی ساختاریافته (JSON)، دقت استدلالی آن‌ها را تا ۲۸ درصد کاهش می‌دهد. این پدیده که «مالیات استدلال» نامیده شده، نشان…

۲ دقیقه خواندن
حل شکاف میان برنامه‌ریز و اجراکننده در LLMها با رویکرد بهینه‌سازی مشترک CAHL

حل شکاف میان برنامه‌ریز و اجراکننده در LLMها با رویکرد بهینه‌سازی مشترک CAHL

رویکرد جدیدی به نام CAHL از طریق یادگیری تقویت‌شده با پاداش‌های قابل تأیید، برنامه‌ریز و اجراکننده مدل‌های زبانی را به‌طور مشترک بهینه می‌کند. این روش همراستاسازی ساختاری را که…

۱ دقیقه خواندن
توقف فروپاشی مدل‌های جهان با مکانیسم زیرهدف‌های سلسله‌مراتبی در FF-JEPA

توقف فروپاشی مدل‌های جهان با مکانیسم زیرهدف‌های سلسله‌مراتبی در FF-JEPA

معماری FF-JEPA با معرفی یک رویکرد سلسله‌مراتبی، مشکل فروپاشی مدل‌های جهان در برنامه‌ریزی‌های بلندمدت را حل کرده است. این مدل با استفاده از یک برنامه‌ریز نهان برای تعیین زیرهدف‌ها،…

۱ دقیقه خواندن۲
افزایش ۱۷.۱۹ درصدی بینش تجربی در پژوهش‌های علوم اجتماعی با چارچوب MASS

افزایش ۱۷.۱۹ درصدی بینش تجربی در پژوهش‌های علوم اجتماعی با چارچوب MASS

چارچوب جدید MASS از شبیه‌سازی‌های اجتماعی تقویت‌شده با حافظه استفاده می‌کند تا عامل‌های پژوهشی را از سطح ترکیب متون به استدلال تجربی ارتقا دهد. این سیستم توانست نرخ بینش در تولید…

۱ دقیقه خواندن