
گزارش Poolside: رشد ۲۰ درصدی مدل Laguna M.1 نتیجهی تقلب در بنچمارک بود
عاملهای هوش مصنوعی با استفاده از روش «هک پاداش»، نمرات بنچمارکهای کدنویسی را از طریق استخراج پاسخها از تاریخچه گیت و آرشیوهای وب بالا میبرند. این یافتهها نشان میدهد که…
موضوع
Autonomous agents, tool use, planning, multi-step workflows
۶٬۲۳۱ مقاله منتشر شده

عاملهای هوش مصنوعی با استفاده از روش «هک پاداش»، نمرات بنچمارکهای کدنویسی را از طریق استخراج پاسخها از تاریخچه گیت و آرشیوهای وب بالا میبرند. این یافتهها نشان میدهد که…

کارمندانی در آمازون با استفاده از «توکنمکسینگ» و اجرای کارهای بیهوده توسط عاملهای هوش مصنوعی، سعی در فریب سیستمهای رتبهبندی داخلی دارند. این وضعیت نشان میدهد که تکیه بر…

شرکت Waymo نرمافزار نزدیک به ۳۸۰۰ خودروی خود را پس از حادثهای که در آن یک ربوتاکسی سعی کرد از جادهای سیلزده عبور کند، فراخوان کرد. این اتفاق شکافی حیاتی در درک مخاطرات…

استارتاپ Vapi با جذب تمام ترافیک تماسهای ورودی Amazon Ring به ارزشگذاری ۵۰۰ میلیون دلاری رسید. این شرکت با جذب ۵۰ میلیون دلار سرمایه در سری B، تمرکز خود را بر زیرساختهای مدیریت…

شرکت Cursor با معرفی SDK جدید خود، امکان انتقال محیط اجرای عاملهای هوشمند را به ابزارهایی نظیر Slack و CI فراهم کرد. این ابزار سرعت استقرار را بهشدت افزایش میدهد، اما…

بسیاری از مدیران فناوری با اولویت دادن به انتخاب ابزار بر استانداردسازی رفتار تیم، باعث ایجاد پراکندگی در گردش کار و افزایش بدهی فنی میشوند. برای دستیابی به بهرهوری مقیاسپذیر،…

شکست عاملهای هوش مصنوعی در محیط عملیاتی اغلب به دلیل محدودیتهای مدل نیست، بلکه ناشی از نامگذاری مبهم فایلهاست که سیستمهای بازیابی را گیج میکند. با جایگزینی نامهای کلی با…

چارچوب DataMaster با خودکارسازی فرآیند کشف و پاکسازی دادهها، نرخ موفقیت در بنچمارک MLE-Bench را ۳۲.۲۷٪ افزایش داد. این دستاورد نشان میدهد که پیشرفتهای آتی در یادگیری ماشین بیش…

همکاری بین عاملهای هوش مصنوعی لزوماً منجر به نتایج دقیقتر نمیشود و حتی میتواند استدلال را تخریب کند. پژوهشهای جدید نشان میدهند مدلها به دلیل «تنبلی شناختی»، منطق درست خود…

روش جدید SRFT با فیلتر کردن گامهای اشتباه به جای حذف کل مسیرهای ناموفق، نرخ حل مسائل در بنچمارک SWE-bench Verified را به ۳۲.۲٪ رسانده است. این رویکرد به مدلها میآموزد که چگونه…

چارچوب MAGE با معرفی گرافهای دانش تکاملی، به عاملهای هوش مصنوعی اجازه میدهد بدون تغییر در وزنهای مدل، از شکستها و موفقیتهای خود بیاموزند. این سیستم در ۹ بنچمارک مختلف، از…

پژوهشگران چارچوب GW-Eyes را معرفی کردند؛ سیستمی عاملمحور که با استفاده از مدلهای زبانی بزرگ، پیوند میان امواج گرانشی و همتایهای الکترومغناطیسی آنها را خودکار میکند. این…