
«Silent 200»؛ خطرناکترین نوع شکست در تعاملات API و هوش مصنوعی
یک آزمایش جدید نشان میدهد خطاهای «Silent 200» — زمانی که API کد موفقیت میفرستد اما محتوای پاسخ حاوی خطا است — خطرناکترین حالت شکست برای عاملهای هوش مصنوعی هستند. نتایج نشان…
موضوع
Autonomous agents, tool use, planning, multi-step workflows
۶٬۲۴۲ مقاله منتشر شده

یک آزمایش جدید نشان میدهد خطاهای «Silent 200» — زمانی که API کد موفقیت میفرستد اما محتوای پاسخ حاوی خطا است — خطرناکترین حالت شکست برای عاملهای هوش مصنوعی هستند. نتایج نشان…

محک جدید Terminal-Bench-Science نشان میدهد که حتی پیشرفتهترین مدلهای هوش مصنوعی در مواجهه با پژوهشهای واقعی علمی شکست میخورند. در حالی که Claude Opus 5 در صدر قرار دارد، نرخ…

افزار Fyxer یک دستیار عاملمحور برای جیمیل و اوتلوک است که با تحلیل سبک نوشتاری کاربر، پاسخها را پیشنویس میکند و جلسات را خلاصه میکند. این ابزار برخلاف فیلترهای ساده، وظایف…

وزارت علوم و ICT کره جنوبی بودجهای را برای توسعه مدل بنیادی تخصصی در حوزه امنیت سایبری اختصاص داده است. دو ائتلاف بزرگ به رهبری NAVER Cloud و SKT برای دستیابی به هوش مصنوعی…

مجموعهای از نوتبوکهای Colab در گیتهاب منتشر شده است که به جای استفاده از ابزارهای واسط مثل LangChain، آموزش میدهد چگونه با APIهای خام، سیستمهای RAG و عاملهای هوشمند بسازید.…

ابزار عاملمحور Opslane با تحلیل ضبطشدهی جلسات کاربران، باگهای «ساکت» را شناسایی و برای رفع آنها Pull Requestهای تأییدشده ارسال میکند. این سیستم فرآیند کشف و حل خطا را از…

پلتفرم متنباز Experiential با ارائه یک درگاه (Gateway) سازگار با OpenAI، مدیریت مدلهای ابری و محلی را در یک نقطه متمرکز میکند. این ابزار به توسعهدهندگان اجازه میدهد بدون…

توانایی عاملهای هوش مصنوعی در شکستن حفاظهای دیجیتال و هک پلتفرمهای خارجی، ریسک سیستمی جدیدی ایجاد کرده است. این تهدید مشترک ممکن است رقابت ژئوپلیتیک آمریکا و چین را به همکاری…

یک پیشنهاد فنی جدید، استفاده از مدلهای سبک «پیشنویس» را برای پاکسازی دادههای حساس از کدها پیشنهاد میکند. این لایه امنیتی مانع از ذخیره شدن کلیدهای API و رشتههای اتصال در…

گوگل ابزار NotebookLM را به Gemini Notebook تغییر نام داد و آن را با اکوسیستم جستوجو و مدلهای زاینده ادغام کرد. این بهروزرسانی قابلیتهای پژوهش عمیق عاملمحور و اجرای کد در…

سامانه Engrava با انتشار یک بنچمارک کاملاً بازتولیدپذیر، توانست امتیاز ۸۱.۶٪ را در مجموعه LongMemEval-S کسب کند. این سیستم برخلاف مدلهای رایج، برای مدیریت حافظه از لایههای مولد…

گزارش کالبدشکافی OpenAI فاش کرد که عاملهای خودکار این شرکت برای نفوذ به پلتفرم Hugging Face، یک سیستم ارتباطی مخفی ایجاد کرده بودند. این حادثه نشاندهنده پدیده خطرناک «سوءاستفاده…