پرش به محتوای اصلی

دسته‌بندی

تحلیل و بررسی تخصصی

تحلیل‌های عمیق مدل‌ها، مقالات و بنچمارک‌ها — پیش‌چاپ‌ها، ارزیابی‌ها، مدل‌های زبانی پیشرو و پژوهش همراستاسازی.

۵٬۷۷۵ مقاله منتشر شده

گزارش arXiv: سیستم PRISM نرخ نشت اسرار در خط‌لوله‌های چند-عاملی را به ۰٪ رساند

گزارش arXiv: سیستم PRISM نرخ نشت اسرار در خط‌لوله‌های چند-عاملی را به ۰٪ رساند

سیستم دفاعی PRISM با رصد لحظه‌ای دینامیک‌های تولید متن، نشت داده‌های حساس در خط‌لوله‌های چند-عاملی را به‌طور کامل متوقف کرده است. این ابزار بدون کاهش کیفیت خروجی، نرخ نشت در سطح…

۲ دقیقه خواندن۱
درون LLARS: سیستمی برای تبدیل شهود متخصصان به بنچمارک‌های دقیق هوش مصنوعی

درون LLARS: سیستمی برای تبدیل شهود متخصصان به بنچمارک‌های دقیق هوش مصنوعی

پلتفرم بازمتن LLARS با یکپارچه‌سازی مهندسی پرامپت و ارزیابی، شکاف ارتباطی میان متخصصان دامنه و توسعه‌دهندگان را پر می‌کند. این سیستم یک گردش‌کار سرتاسری برای ساخت مدل‌های زبانی…

۲ دقیقه خواندن۱
سازوکار Deep Arguing: تبدیل پیش‌بینی‌های جعبه‌سیاه به استدلال‌های منطقی و شفاف

سازوکار Deep Arguing: تبدیل پیش‌بینی‌های جعبه‌سیاه به استدلال‌های منطقی و شفاف

چارچوب جدیدی به نام Deep Arguing با ادغام یادگیری عمیق و منطق استدلالی، پیش‌بینی‌های هوش مصنوعی را تفسیرپذیر می‌کند. این مدل بدون کاهش دقت، داده‌ها را به عنوان استدلال‌هایی برای…

۲ دقیقه خواندن۲
چرا گلوگاه عامل‌های هوش مصنوعی در استدلال نیست، بلکه در طراحی APIهاست؟

چرا گلوگاه عامل‌های هوش مصنوعی در استدلال نیست، بلکه در طراحی APIهاست؟

یک پارادایم جدید در طراحی APIهای معنایی، رابط‌های سنتی CRUD را با پروتکلی شش‌فعل برای عامل‌های هوش مصنوعی جایگزین کرده است. این رویکرد در محیط‌های عملیاتی SaaS، نرخ موفقیت در…

۲ دقیقه خواندن۲
استخراج استدلال؛ سازوکاری برای کاهش توهمات مدل‌های زبانی در روایت‌های سلامت

استخراج استدلال؛ سازوکاری برای کاهش توهمات مدل‌های زبانی در روایت‌های سلامت

پژوهشگران با ترکیب استخراج استدلال و گراف‌های دانش، سیستمی برای کاهش توهمات مدل‌های زبانی در روایت‌های سلامت سالمندان طراحی کرده‌اند. این معماری بازتابی تضمین می‌کند که داستان‌های…

۲ دقیقه خواندن۱
رمزگشایی از شکاف دانش و اجرا در عامل‌های هوش مصنوعی با معیارهای سطح-مسیر

رمزگشایی از شکاف دانش و اجرا در عامل‌های هوش مصنوعی با معیارهای سطح-مسیر

یک چارچوب آماری جدید، ارزیابی عامل‌های هوش مصنوعی را از نرخ‌های ساده‌ی موفقیت/شکست به سنجش ثبات در سطح مسیر تغییر می‌دهد. این متد به توسعه‌دهندگان اجازه می‌دهد تفاوت میان دانش مدل…

۲ دقیقه خواندن۱
چرا برای درک توپولوژی گراف‌ها نیازی به تنظیم دقیق یا آداپتورهای خارجی نیست؟

چرا برای درک توپولوژی گراف‌ها نیازی به تنظیم دقیق یا آداپتورهای خارجی نیست؟

روش جدیدی به نام Slash نشان می‌دهد که مدل‌های زبانی بزرگ درک ساختاری گراف‌ها را در وزن‌های خود دارند، اما «چاه‌های توجه» مانع دسترسی به آن می‌شوند. این متد بدون نیاز به آموزش…

۲ دقیقه خواندن
SkillEvolver: ارتقای دقت مهارت‌های عامل‌های هوش مصنوعی به ۵۶.۸٪ در SkillsBench

SkillEvolver: ارتقای دقت مهارت‌های عامل‌های هوش مصنوعی به ۵۶.۸٪ در SkillsBench

چارچوب SkillEvolver با معرفی یک «متا-مهارت»، یادگیری عامل‌ها را از تغییر وزن‌های مدل به اصلاح متنی و کد منتقل کرد. این روش در ۱۵ حوزه مختلف، دقتی بالاتر از مهارت‌های طراحی‌شده…

۲ دقیقه خواندن۲
از تخصص انسانی به عامل‌های کدنویس: سازوکار ASIA در خودکارسازی شناسایی سیستم‌ها

از تخصص انسانی به عامل‌های کدنویس: سازوکار ASIA در خودکارسازی شناسایی سیستم‌ها

چارچوب ASIA با بهره‌گیری از مدل‌های زبانی بزرگ، فرآیند انتخاب مدل و تنظیم ابرپارامترها در سیستم‌های دینامیکی را به‌طور کامل خودکار می‌کند. این سیستم با بستن چرخه بین فرضیه و…

۲ دقیقه خواندن
چرا موفقیت‌های ادعایی عامل‌های هوش مصنوعی در بنچمارک‌ها اغلب کاذب هستند؟

چرا موفقیت‌های ادعایی عامل‌های هوش مصنوعی در بنچمارک‌ها اغلب کاذب هستند؟

پژوهشگران لایه‌ای برای گزارش شواهد معرفی کرده‌اند تا از ثبت «موفقیت‌های کاذب» در بنچمارک‌های عامل‌های هوش مصنوعی جلوگیری کنند. این چارچوب با الزام به ارائه مستندات قابل…

۲ دقیقه خواندن۱
چگونه LLM4Branch اتوماسیون سیاست‌های شاخه‌بندی را در MILP به سطح SOTA رساند؟

چگونه LLM4Branch اتوماسیون سیاست‌های شاخه‌بندی را در MILP به سطح SOTA رساند؟

چارچوب LLM4Branch با استفاده از مدل‌های زبانی بزرگ، کشف سیاست‌های شاخه‌بندی در برنامه‌ریزی خطی عدد-صحیح (MILP) را خودکار کرده است. این روش با بهینه‌سازی اسکلت‌های برنامه‌نویسی…

۲ دقیقه خواندن۲