
توهم تیک سبز؛ چرا سیستمهای اعتبارسنجی خودکار هوش مصنوعی شکست میخورند؟
بررسی یک مورد شکست عملی نشان میدهد که ابزارهای اعتبارسنجی هوش مصنوعی اغلب به جای حقیقت، تنها «سازگاری» دادهها را میسنجند. این وضعیت باعث میشود اطلاعات غلط اما یکدست، با…
موضوع
۸۲ مقاله منتشر شده

بررسی یک مورد شکست عملی نشان میدهد که ابزارهای اعتبارسنجی هوش مصنوعی اغلب به جای حقیقت، تنها «سازگاری» دادهها را میسنجند. این وضعیت باعث میشود اطلاعات غلط اما یکدست، با…

بازارهای فعلی هوش مصنوعی برای مرور انسانی طراحی شدهاند، اما تجارت بین عاملها نیازمند قراردادهای سختگیرانه و ماشینخوان است. انتقال از توصیفات مبهم به فهرستهای خدماتی با مرزهای…

چارچوب جدید «کارتهای اعتماد» با تثبیت ساعت ارزیابی و تستهای خصمانه، از حملات بازپخش و مسمومسازی ابزار در سامانههای چندعاملی جلوگیری میکند. این رویکرد اجازه میدهد حالتهای…

یک چارچوب جدید برای «بستههای حافظه مهرومومشده» ریسک دستکاری وضعیت دادهها هنگام انتقال بین عاملهای AI را کاهش میدهد. این رویکرد با تثبیت ساعتهای ارزیابی و استفاده از دفاتر…

یک معماری جدید با تلفیق بردارهای معنایی و گرافهای دانش، احتمال توهم در سیستمهای نظارتی مالی را به صفر رسانده است. این رویکرد هیبریدی، دقت ریاضی را جایگزین حدسهای احتمالی…

چارچوب جدید Zambo با جایگزینی «حس کلی» با «رسیدهای قابل تأیید»، امکان اثبات اجرای واقعی وظایف توسط عاملهای هوش مصنوعی را فراهم میکند. این سیستم با بررسی UUID و هشهای دیجیتال،…

یک غیرمتخصص ریاضی با استفاده از اکوسیستمی از عاملهای هوش مصنوعی و ابزار Lean، اثباتی برای حدس ۵۰ ساله جان کانوی ارائه داد. این پروژه نشان میدهد که ترکیب مدلهای زبانی با…

زبان Bend با جایگزینی پرامپتهای متنی با قوانین ریاضی، ادغام باگها در محیط تولید را غیرممکن میکند. این زبان سرعت اجرای C را با قابلیتهای موازیسازی بومی CUDA ترکیب کرده و…

اپل برای مقابله با جعلهای عمیق، سیستمی در سطح سختافزار برای آیفون ۱۸ پرو معرفی کرد که اصالت عکس را بدون افشای هویت عکاس تأیید میکند. این فناوری با ایجاد یک «نگاتیو دیجیتال» و…

پروژه XLS گوگل یک زنجیره ابزار متنباز است که توصیفات سطح بالا را به کدهای سختافزاری Verilog تبدیل میکند. این ابزار با تبدیل طراحی سختافزار به یک مسئله مهندسی نرمافزار، سرعت…

یک چارچوب تست جدید با جداسازی تستهای نوشتهشده توسط هوش مصنوعی از بررسیهای انسانی، مانع از تأیید خودکار کدهای غلط میشود. این سیستم با الزام وجود یک «شاهد» برای هر خط کد، توهم…

مدل جدید OpenAI کدنویسی را از تولید تکه-کد به مدیریت خودکار کل چرخه حیات نرمافزار تبدیل کرد. این مدل با افزایش چشمگیر کارایی در تستهای رابط کاربری، نقش توسعهدهندگان را به نظارت…