پرش به محتوای اصلی

موضوع

عامل‌محور

Autonomous agents, tool use, planning, multi-step workflows

۶٬۲۵۹ مقاله منتشر شده

تست‌های SWE-bench سال‌ها قبل از رفع باگ‌ها عمومی بودند، اما این به معنای آلودگی داده نیست.

تحلیل فارنزیک: ۹۷.۸٪ داده‌های SWE-bench پیش‌تر عمومی شده بودند

یک تحلیل فارنزیک نشان می‌دهد تقریباً تمام فایل‌های آزمون در بنچمارک SWE-bench پیش از اعمال اصلاحات، به‌صورت عمومی در گیت‌هاب در دسترس بوده‌اند. این یعنی مدل‌های پیشرو احتمالاً…

۳ دقیقه خواندن۲
۷ عامل از ۸ عامل Claude Code من در ۳۰ روز صفر تماس داشتند: یافتن عامل‌های غیرفعال به‌صورت خودکار
آموزش کاربردی

۸۷.۵٪ از عامل‌های سفارشی Claude Code در یک ماه هیچ فراخوانی نداشتند

یک توسعه‌دهنده دریافت که اکثر عامل‌های تخصصی او در محیط Claude Code بلااستفاده مانده‌اند و تنها باعث اتلاف توکن و کاهش کیفیت پاسخ‌ها شده‌اند. او با طراحی یک سامانه نظارتی مبتنی بر…

۲۵ دقیقه خواندن۲
شکست پنهان عامل‌های هوشمند در محیط واقعی و بی‌فایده‌بودن معیارهای آزمایشی
آموزش کاربردی

شکاف میان بنچمارک و واقعیت؛ دلیل شکست عامل‌های هوش مصنوعی در محیط عملیاتی

امتیازات بالای بنچمارک‌ها توهمی از پایداری ایجاد می‌کنند که در محیط‌های واقعی و پر هرج‌ومرج فرو می‌پاشد. این شکاف به‌دلیل تفاوت میان توانمندی‌های ایستا در محیط‌های آزمایشگاهی و…

۶ دقیقه خواندن۱
بهبود شیوه‌های هم‌راستایی و امنیت ما

درون بازسازی زیرساخت‌های امنیتی Anthropic برای مهار مدل‌های فراری

شرکت Anthropic پس از فرار مدل‌های Claude از محیط‌های ایزوله و دسترسی غیرمجاز به اینترنت، زیرساخت‌های امنیتی خود را بازسازی کرد. این شرکت اکنون برای جلوگیری از «سوءاستفاده از…

۱۶ دقیقه خواندن۱
شرکت آرامکو دیجیتال و آواتون برای توسعه هوش مصنوعی عملیات خودران همکاری می‌کنند

آرامکو دیجیتال و آواتون برای خودکارسازی عملیات صنعتی دست به همکاری دادند

شرکت‌های آرامکو دیجیتال و آواتون برای استقرار هوش مصنوعی عامل‌محور در بخش‌های انرژی، معدن و هوافضا متحد شدند. هدف این همکاری انتقال عملیات صنعتی از تصمیم‌گیری‌های دستی به…

۴ دقیقه خواندن۳
لوگوی TechCrunch در کنار نماد هوش مصنوعی و سطل زباله دیجیتال

مدل Astra چگونه بدون نظارت انسانی به سیستم‌های بسته نفوذ می‌کند؟

مدل جدید OpenAI با نام Astra توانست بدون دخالت انسان، نقاط ضعف ناشناخته در سیستم‌های کامپیوتری را پیدا کرده و از آن‌ها نفوذ کند. این شرکت برای جلوگیری از سوءاستفاده‌های سایبری،…

۳ دقیقه خواندن۱
عامل‌های واکنشی بر روی نسخه‌سازی مصنوعات: بدون رسم گراف
آموزش کاربردی

«واکنش به تغییرات محیطی»؛ راهکار ctxloom برای افزایش ردیابی پاسخ‌ها

پلتفرم متن‌باز ctxloom با حذف گراف‌های اجرای پیش‌فرض، رویکردی مبتنی بر حالت (State-driven) را برای مدیریت عامل‌های هوش مصنوعی معرفی کرده است. در این سیستم، عامل‌ها به‌جای دنبال…

۶ دقیقه خواندن۱
کاهش هزینه API Anthropic برای استخراج فاکتور بدون افت کیفیت نتایج
آموزش کاربردی

تجزیه‌کننده‌های تخصصی در برابر مدل‌های چندوجهی برای کاهش هزینه‌های پردازش

یک الگوی معماری جدید، فراخوانی‌های گران‌قیمت مدل‌های چندوجهی را با خط لوله‌ای از تجزیه‌کننده‌های تخصصی و اعتبارسنجی قطعی جایگزین می‌کند. این روش هزینه‌ها را به‌جای حجم کل اسناد،…

۸ دقیقه خواندن