پرش به محتوای اصلی

دسته‌بندی

تحلیل و بررسی تخصصی

تحلیل‌های عمیق مدل‌ها، مقالات و بنچمارک‌ها — پیش‌چاپ‌ها، ارزیابی‌ها، مدل‌های زبانی پیشرو و پژوهش همراستاسازی.

۵٬۷۳۹ مقاله منتشر شده

ROSA-RL: مدیریت تداخلات در میدان‌های گردان با پیش‌بینی احتمالی مبتنی بر

ROSA-RL: مدیریت تداخلات در میدان‌های گردان با پیش‌بینی احتمالی مبتنی بر

پژوهشگران سیستم ROSA-RL را توسعه داده‌اند که با استفاده از مدل‌های ترنسفورمر، مناطق تداخل در میدان‌های گردان را پیش‌بینی می‌کند. این رویکرد با مدل‌سازی عدم‌قطعیت در تصمیمات…

۱ دقیقه خواندن۲
چرا چک‌کردن نوع برای تضمین صحت ترجمه‌های ریاضی کافی نیست؟

چرا چک‌کردن نوع برای تضمین صحت ترجمه‌های ریاضی کافی نیست؟

چارچوب جدید BPF با شناسایی ۸۹.۶ درصد از انحرافات معنایی، شکاف وفاداری در تبدیل ریاضیات زبان طبیعی به کد فرمال را می‌پوشاند. این متد به‌طور قابل‌توجهی دقیق‌تر از روش‌های رایج…

۲ دقیقه خواندن۱
کاهش خطای انتخاب ابزار در عامل‌های AI به ۲.۵ درصد با GIST-CMTF

کاهش خطای انتخاب ابزار در عامل‌های AI به ۲.۵ درصد با GIST-CMTF

چارچوب GIST-CMTF با معرفی لایه‌ی استنتاج وضعیت هدف، مانع از اجرای وظایف بر اساس درخواست‌های مبهم کاربران می‌شود. این سیستم با اعتبارسنجی هدف پیش از معرفی ابزارها، نرخ موفقیت در…

۱ دقیقه خواندن۳
گزارش arXiv: کاهش ۳۶ درصدی موفقیت جیل‌بریک در مدل‌های استدلالی با متد Safe

گزارش arXiv: کاهش ۳۶ درصدی موفقیت جیل‌بریک در مدل‌های استدلالی با متد Safe

پژوهشگران روشی به نام Safe Trigger ابداع کرده‌اند که به مدل‌های استدلالی اجازه می‌دهد با تحلیل مسیر تفکر خود، درخواست‌های مضر را شناسایی و مسدود کنند. این رویکرد نیاز به داده‌های…

۱ دقیقه خواندن۱
OpenClaw-Skill: حل چالش برنامه‌ریزی بلندمدت عامل‌ها با جست‌وجوی جمعی در درخت

OpenClaw-Skill: حل چالش برنامه‌ریزی بلندمدت عامل‌ها با جست‌وجوی جمعی در درخت

پژوهشگران چارچوب OpenClaw-Skill را معرفی کردند که با استفاده از جست‌وجوی جمعی در درخت مهارت‌ها (CSTS)، کتابخانه‌ای از مهارت‌های بازیافت‌پذیر برای عامل‌های هوش مصنوعی می‌سازد. این…

۲ دقیقه خواندن
چگونه تبدیل دستورالعمل‌های متنی به وزن‌های رفتاری، هزینه‌ی استنتاج را می‌کاهد؟

چگونه تبدیل دستورالعمل‌های متنی به وزن‌های رفتاری، هزینه‌ی استنتاج را می‌کاهد؟

پژوهشگران چارچوب **Skill-to-LoRA** (S2L) را معرفی کرده‌اند که دستورالعمل‌های متنی حجیم در پرامپت‌ها را با آداپتورهای سبک **LoRA** جایگزین می‌کند. این رویکرد باعث کاهش ۶.۶ درصدی…

۲ دقیقه خواندن
چرا اصلاح تابع پاداش برای حل خطاهای پیچیده در مدل‌های زبانی کافی نیست؟

چرا اصلاح تابع پاداش برای حل خطاهای پیچیده در مدل‌های زبانی کافی نیست؟

پژوهشی جدید با معرفی یک سیستم مختصاتی ریاضی، بهینه‌سازی سیاست‌های مدل‌های زبانی را به جای ترفندهای تجربی به یک علم تشخیصی تبدیل کرده است. این چارچوب نشان می‌دهد که بسیاری از…

۲ دقیقه خواندن
AgentFairBench: خطای ۲.۴ برابری در روش‌های فعلی اندازه‌گیری سوگیری هوش مصنوعی

AgentFairBench: خطای ۲.۴ برابری در روش‌های فعلی اندازه‌گیری سوگیری هوش مصنوعی

پژوهشگران با معرفی بنچمارک **AgentFairBench** نشان دادند که روش‌های رایج، سوگیری‌های دموگرافیک در عامل‌های AI را تا ۲.۴ برابر بیشتر از واقعیت تخمین می‌زنند. این مطالعه تأیید…

۲ دقیقه خواندن
چرا دقت AUROC دیگر معیار موفقیت در هوش مصنوعی پزشکی نیست؟

چرا دقت AUROC دیگر معیار موفقیت در هوش مصنوعی پزشکی نیست؟

پژوهشگران پیشنهاد کرده‌اند که هوش مصنوعی پزشکی از مدل‌های تشخیص ایستا به «مدل‌های جهانی» تغییر مسیر دهد. هدف این رویکرد، تبدیل سیستم‌ها از امتیازدهی ریسک به شبیه‌سازی پویا از مسیر…

۱ دقیقه خواندن
جایگزینی حافظه متنی با کد پایتون؛ رسیدن به دقت ۹۹ درصدی در حافظه عامل‌های AI

جایگزینی حافظه متنی با کد پایتون؛ رسیدن به دقت ۹۹ درصدی در حافظه عامل‌های AI

پژوهشگران چارچوب User as Code (UaC) را معرفی کردند که حافظه متنی هوش مصنوعی را با اشیاء و توابع قابل‌اجرای پایتون جایگزین می‌کند. این تغییر پارادایم، دقت پاسخ‌دهی عامل‌ها به…

۲ دقیقه خواندن
چرا تحلیل معنایی متن در پیش‌بینی تغییرات خلقی آینده شکست می‌خورد؟

چرا تحلیل معنایی متن در پیش‌بینی تغییرات خلقی آینده شکست می‌خورد؟

پژوهش‌های جدید نشان می‌دهد که در حالی که تحلیل متن برای تشخیص وضعیت عاطفی فعلی کاربر دقیق است، اما در پیش‌بینی تغییرات آتی ناکارآمد است. در مقابل، تحلیل دینامیک‌های عددیِ…

۱ دقیقه خواندن
مدل خودمختاری کنترل‌شده: چارچوب جدید کریستوفر کُک برای کاهش ریسک عامل‌های AI

مدل خودمختاری کنترل‌شده: چارچوب جدید کریستوفر کُک برای کاهش ریسک عامل‌های AI

تحلیل جدیدی نشان می‌دهد شرکت‌های متوسط باید به جای تعقیب خودمختاری کامل، به سراغ «خودمختاری جزئی کنترل‌شده» بروند. این رویکرد با تمرکز بر یکپارچه‌سازی انسان‌محور، بار اداری را…

۱ دقیقه خواندن