
چرا مدل Ornith-1.0-35b در سناریوهای سخت مهندسی شکست میخورد؟
یک آزمون استرس روی مدل محلی Ornith-1.0-35b نشان داد که عملکرد این مدل در مواجهه با پیچیدگیهای دنیای واقعی بهطور کامل فرو میپاشد. در حالی که مدل در وظایف ساده موفق بود، در تمامی…
موضوع
Autonomous agents, tool use, planning, multi-step workflows
۶٬۰۲۰ مقاله منتشر شده

یک آزمون استرس روی مدل محلی Ornith-1.0-35b نشان داد که عملکرد این مدل در مواجهه با پیچیدگیهای دنیای واقعی بهطور کامل فرو میپاشد. در حالی که مدل در وظایف ساده موفق بود، در تمامی…

سازندگان مستقل از تولید پراکنده موسیقی به سمت ایجاد «اکوسیستمهای صوتی» حرکت میکنند. با تبدیل پرامپتها به APIهای پایدار، آنها اکنون برند صوتی یکسانی را در تمام کانالهای…

تیمهای مهندسی بهجای ثبت دقیق تاریخچه جلسات، مهارتهای عاملهای هوش مصنوعی را بر اساس حدس و گمان بازنویسی میکنند. این رویکرد منجر به حذف لبههای حیاتی و جزئیات فنی میشود که در…

عاملهای خودگردان در صورت ورود به حلقههای تکرار، میتوانند در دقایقی موجودی حسابهای API را تخلیه کنند. توسعهدهندگان باید با فعالسازی «سقف سخت» (Hard Limit)، از صورتحسابهای…

ابزار Slopo با بهرهگیری از مدلهای بردار معنایی بهجای تطبیق متنی ساده، قطعات کد مشابه را در سراسر ماژولهای مختلف شناسایی میکند. این ابزار به توسعهدهندگان و عاملهای هوش…

شاخص جدید RLI نشان میدهد نرخ خودکارسازی کارهای تخصصی در ۸ ماه گذشته بیش از ۴ برابر شده است. مدل Fable 5 با پیشتازی در این بنچمارک، استانداردهای جدیدی را برای اجرای پروژههای…

پروژهی Nivroo نشان میدهد که چالش اصلی تجارت الکترونیک نه ساخت فروشگاه، بلکه مدیریت خستهکنندهی عملیات روزمره است. این ابزار با اتوماسیون زنجیرهی تأمین و جذب مشتری، تلاش میکند…

مخزن Hermes Skills با حذف شناسههای شخصی سختافزاری از مستندات و فایلهای تنظیمات، امنیت عاملهای هوش مصنوعی را ارتقا داد. این اقدام باعث میشود ادغامهای مربوط به شبیهسازی صدا و…

پژوهشهای جدید نشان میدهد دستاوردهای یادگیری تقویتی در مدلهای زبانی بزرگ بهجای توزیع در کل مدل، در چند لایه میانی متمرکز شدهاند. آموزش تنها یک لایه مجزا میتواند بخش بزرگی از…

سرویسهای حل کپچا مبتنی بر هوش مصنوعی، موانع تأیید دستی را برای توسعهدهندگان حذف کردهاند. این ابزارها با استفاده از یادگیری ماشین در تشخیص تصاویر، امکان مقیاسپذیری جریانهای…

ممنوعیت دسترسی به مدل Mythos توسط دولت آمریکا بهجای محافظت از امنیت ملی، به رقبای آسیایی کمک کرد تا اهداف فنی خود را دقیقاً شناسایی کنند. شرکتهای 360 چین و Sakana AI ژاپن…

ابزار متنباز ghealth با ایجاد یک رابط خط فرمان (CLI) برای API نسخه ۴ گوگل، استخراج دادههای سلامت را تسهیل میکند. این ابزار به گونهای طراحی شده تا معیارهای زیستی را بهطور…