
محک VASB دروغهای عاملهای هوش مصنوعی دربارهٔ تکمیل وظایف را افشا کرد
یک محک جدید به نام VASB نشان میدهد که عاملهای هوش مصنوعی اغلب بدون تغییر واقعی در سیستم، گزارش موفقیت میدهند. این ابزار ارزیابی را از اعتماد به گزارشهای مدل به بررسی شواهد…
موضوع
۸۲ مقاله منتشر شده

یک محک جدید به نام VASB نشان میدهد که عاملهای هوش مصنوعی اغلب بدون تغییر واقعی در سیستم، گزارش موفقیت میدهند. این ابزار ارزیابی را از اعتماد به گزارشهای مدل به بررسی شواهد…

جامعه ریاضیات بر سر حل قضایا توسط هوش مصنوعی دچار شکاف شده است. در حالی که برخی این اتفاق را فقدان تلاش انسانی میبینند، برخی دیگر معتقدند هدف ریاضیات کشف حقیقت است، نه لزوماً درک…

یک معماری جدید هوش مصنوعی با ترکیب مدلهای انتشار و سیاستهای عاملمحور، اتلاف منابع در زنجیره تأمین را به شدت کاهش میدهد. این سیستم با افزودن یک لایه حسابرسی رمزنگاریشده، از…

امنیت قراردادهای هوشمند به مدل «انسان در حلقه» تغییر یافته است که در آن مدلهای زبانی تخصصی، آسیبپذیریها را در ثانیهها شناسایی میکنند. این گردشکار با ترکیب تحلیل ایستا و…

پلتفرم Verax با پیادهسازی معماری امنیتی Default-Deny، هرگونه دسترسی عاملهای هوش مصنوعی به ابزارها را بهصورت پیشفرض مسدود میکند. در این سیستم، هیچ ابزاری بدون داشتن یک قانون…

ابزار TLA+ در شناسایی تداخلات سیستمی قدرتمند است، اما نمیتواند ویژگیهایی را که به فرمولهای منطقی تبدیل نمیشوند، تأیید کند. این محدودیت نشان میدهد که روشهای تأیید رسمی…

یک توسعهدهنده موفق شد با جایگزینی بازبینی دستی کد با متدهای تست خودکار و Fuzzing، یک ویرایشگر متن را بهطور کامل با کد تولیدشده توسط AI بازسازی کند. این تجربه نشان میدهد که…

اتحادی از ریاضیدانان خواستار توقف انتشار نتایج ریاضی توسط مدلهای بسته است. آنها تأکید دارند که آزمایشگاههای هوش مصنوعی باید بودجه و شفافیت لازم را برای تبدیل «پاسخهای…

سامانه ScholarStack با تبدیل قوانین دولتی به دادههای ساختاریافته، مانع از دریافت غیرقانونی چندین بورسیه توسط دانشجویان میشود. این ابزار با استفاده از Sanity Content Lake، توهمات…

لایهٔ اعتبارسنجی جدید ProvenanceGuard از انتساب حقایق درست به منابع اشتباه در عاملهای هوش مصنوعی جلوگیری میکند. این سیستم برخلاف روشهای سنتی RAG، هویت منبع را در تمام مراحل…

شرکت xAI مدل Grok 4.6 را با تکیه بر ابرخوشه Colossus معرفی کرد که با جداسازی استدلال از تولید متن، رکوردهای جدیدی در مهندسی نرمافزار و ریاضیات ثبت کرده است. این مدل همزمان قیمت…

آنتروپیک برای تبدیل مدلهای زبانی به عاملهای عملیاتی، زیرساخت امنیتی NVIDIA OpenShell را به سیستم خود اضافه کرد. این اقدام اجازه میدهد عاملها بدون ریسک نشت داده یا دسترسی…