
بررسی دستیار پژوهشی: نرخ توهمات مدلهای زبانی به ۳۱٪ رسید
بررسی یک دستیار پژوهشی مبتنی بر هوش مصنوعی نشان میدهد که مدلهای زبانی اغلب با اعتماد کامل دروغ میگویند و منابع جعلی میسازند. این یافتهها ثابت میکند که تکنیک RAG تنها یک نقطه…
موضوع
Autonomous agents, tool use, planning, multi-step workflows
۶٬۰۰۷ مقاله منتشر شده

بررسی یک دستیار پژوهشی مبتنی بر هوش مصنوعی نشان میدهد که مدلهای زبانی اغلب با اعتماد کامل دروغ میگویند و منابع جعلی میسازند. این یافتهها ثابت میکند که تکنیک RAG تنها یک نقطه…

ابزار متنباز جدیدی معرفی شده است که تعریف ابزارهای WebMCP و استابهای هندلر را مستقیماً از اینترفیسهای TypeScript تولید میکند. این ابزار نیاز به نوشتن دستی طرحوارههای Zod یا…

این راهنما روشی بهینه برای تحلیل، بازرسی و آموزش بر روی مجموعه داده Fable 5 Traces در محیط گوگل کولب ارائه میدهد. هدف این گردشکار، تبدیل تلهمتری خام عاملها به دادههای…

پژوهش جدید دانشگاه UIUC نشان میدهد که تلاش عاملهای هوش مصنوعی برای خلاصهسازی یا پاکسازی حافظه بلندمدت، منجر به کاهش شدید دقت آنها میشود. بازنویسی مداوم سوابق، سوگیری انتخابی…

تحلیلی از «مشکل کمکآشپز» نشان میدهد عاملهای هوش مصنوعی با وجود اجرای فنی بینقص، بهدلیل فقدان بستر تجربه انسانی شکست میخورند. این شکاف نه در توانایی فنی، بلکه در ناتوانی…

شرکت Liquid AI مدل LFM2.5-230M را با تمرکز بر اجرای محلی و استخراج دادههای ساختاریافته عرضه کرد. این مدل علیرغم اندازه کوچک، در بنچمارکهای پیروی از دستورات، عملکرد مدلهای…

یک پژوهشگر ناشناس با استفاده از هوش مصنوعی زاینده، ۲۰ آسیبپذیری جدی (Zero-Day) را در ۲۳ پروژه متنباز از جمله داکر و فایرفاکس شناسایی و بدون اطلاع سازندگان منتشر کرد. این اقدام…

یک چالش امنیتی گسترده با بیش از ۶ هزار تلاش برای نفوذ، نتوانست لایههای حفاظتی مدل Claude Opus 4.6 را بشکند. این نتایج پیشرفت چشمگیر در دفاع مدلهای پیشرو را نشان میدهد، هرچند…

تحلیل لاگهای خودگردان Claude Code نشان میدهد این عاملها بهجای پیشرفت در پروژه، درگیر سازماندهی داخلی و فعالیتهای بیهوده میشوند. برای جلوگیری از اتلاف توکن و هزینه، استفاده…

پلتفرمهای ارزانقیمت توکن باید برای جلب اعتماد تیمهای مهندسی، دفاتر حسابداری دقیق و قابل استخراج ارائه دهند. Tokens Forge با پیادهسازی این قابلیت، امکان ردیابی دقیق هزینههای…

بازارهای توکنهای ارزانقیمت برای مقابله با نوسانات قیمت مدلها، سیستم «عکسبرداری لحظهای» (Price Snapshot) را پیاده میکنند. این سازوکار تضمین میکند که کاربران و مدیران بتوانند…

پژوهش جدید CoffeeBench شکافی خطرناک میان برنامهریزی و اجرا در عاملهای هوش مصنوعی شناسایی کرد. این «رانش بیهدف» باعث میشود مدلها بهجای اقدام، صرفاً گزارش دقیقی از دلیل شکست…