
مدل Tenet نرخ تکمیل وظایف حقوقی را در بنچمارک LAB دو برابر کرد
شرکت Harvey پیشنمایش پژوهشی مدل Tenet را معرفی کرد که با بهینهسازی روی Kimi K3 و استفاده از یادگیری تقویتی، توانایی عاملهای هوش مصنوعی در مدیریت پروندههای پیچیده حقوقی را دو…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۵٬۷۹۱ مقاله منتشر شده

شرکت Harvey پیشنمایش پژوهشی مدل Tenet را معرفی کرد که با بهینهسازی روی Kimi K3 و استفاده از یادگیری تقویتی، توانایی عاملهای هوش مصنوعی در مدیریت پروندههای پیچیده حقوقی را دو…

استفاده از نسخههای رایگان API بهعنوان جایگزین ارزانقیمت سرویسهای پولی، منجر به شکست در پایداری و توان عملیاتی میشود. یک چارچوب تصمیمگیری جدید پیشنهاد میکند که حجم کاری را…

مقایسهای کاربردی نشان میدهد Deep Agents از LangChain برخلاف LangGraph، نیاز به تعریف دستی گرهها و یالها را از بین میبرد. در حالی که LangGraph کنترل دقیقی روی مسیر اجرا…

با انتقال عاملهای هوش مصنوعی به محیط تولید، مدیریت سرورهای پراکنده MCP منجر به بحران امنیتی و هزینهای شده است. پلتفرمهای جدیدی مانند Bifrost و Envoy AI با ایجاد لایههای کنترل…

تکیه بر امتیازات عددی مدلهای زبانی برای تصمیمات نهایی، منجر به حذف اشتباه محتوای سالم میشود. یک سامانه مقاوم باید محتوا را بر اساس سطح اطمینان به سه مسیر «اجازه»، «بررسی» یا…

استرایپ با تصاحب OpenRouter، مسیری برای تبدیل توکنهای هوش مصنوعی به منابع اقتصادی قابل معامله ایجاد میکند. این اقدام نشان میدهد انتخاب مدل AI دیگر صرفاً یک تصمیم فنی نیست، بلکه…

یک عامل هوش مصنوعی به نام لونا در مدیریت فروشگاهی در سانفرانسیسکو، برای نخستین بار پیشنهاد اخراج یک کارمند را داد. این تصمیم تنها پس از آن رخ داد که اپراتورهای انسانی، قوانین…

بررسی ۱۴٬۴۰۰ مورد نشان میدهد حذف قوانین متضاد، بهینهترین راه برای کاهش خطای پرامپت است. این استراتژی ساده، دقتی مشابه با اصلاحات پیچیده دارد اما هزینهی توکنها را بهشدت کاهش…

تحلیلی جدید نشان میدهد اجبار عاملهای هوش مصنوعی به مواجهه با خطاهای صریح در فراخوانی ابزارها، شکستهای «ساکت» را بهشدت کاهش میدهد. این رویکرد به توسعهدهندگان اجازه میدهد…

یک ابزار متنباز جدید نشان میدهد که کوتاه کردن سادهٔ متن (Truncation) در معیارهای اعتبار داخلی، نمرات بالاتری نسبت به بازنویسی پیچیده توسط هوش مصنوعی کسب میکند. این یافته شکافی…

پروژه Arc Rector نشان داد که ذخیرهسازی ساده و متوالی دادهها باعث ایجاد تضاد در حافظه مدل میشود. همچنین مشخص شد فشردهسازی تهاجمی برای کاهش هزینه توکن، میتواند دقت بازیابی…

پلتفرم WhaleHarness سیستمی خودکار برای توسعه، تأیید و انتشار افزونههای هوش مصنوعی توسط خودِ عاملها ایجاد کرده است. انتشار موفق دو ابزار ساختهشده توسط عاملها، آغاز عصر…