
ThoughtDAG: حذف پیامهای خطا اثرات زنجیرهای را در LLM پاک نمیکند
محک جدید ThoughtDAG نشان میدهد حذف یک پیام اشتباه از تاریخچهٔ گفتگو، لزوماً اثر آن خطا را از حافظهٔ مدل پاک نمیکند. «پژواک» این اشتباهات در پاسخهای بعدی باقی میماند، مگر آنکه…
موضوع
گزارشها و تحلیلهای مربوط به توانایی تکرار و تأیید نتایج پژوهشهای هوش مصنوعی
۲۳۴ مقاله منتشر شده

محک جدید ThoughtDAG نشان میدهد حذف یک پیام اشتباه از تاریخچهٔ گفتگو، لزوماً اثر آن خطا را از حافظهٔ مدل پاک نمیکند. «پژواک» این اشتباهات در پاسخهای بعدی باقی میماند، مگر آنکه…

یک محک جدید نشان میدهد مدلهای پیشرو هوش مصنوعی در استخراج ایدههای پژوهشی از کتابشناسیها بهشدت ناتواناند. حتی با استفاده از سامانههای چندعاملی، نرخ موفقیت به ۴۲٪ میرسد که…

پلتفرم متنباز Tracely-ai با تبدیل خطاهای واقعی عاملهای هوش مصنوعی به تستهای غیرقابلتغییر، از بازگشت باگهای محیط عملیاتی جلوگیری میکند. این سیستم با مسدود کردن استقرار…

یک توسعهدهنده با ثبت تمامی تصمیمات یک عامل طبقهبندی در قالب فایلهای JSONL، متوجه خطایی در منطق اجرای برنامه شد که در داشبوردهای تحلیلی معمولی پنهان میماند. این رویکرد نشان…

یک متدولوژی جدید پیشنهاد میکند برنامهنویسان بهجای تکیه بر جدولهای رتبهبندی (Leaderboards)، ابزارهای AI را با استفاده از کدبیس واقعی خود و بودجهای محدود از توکنها «مصاحبه»…

بررسی ۱۴٬۴۰۰ مورد نشان میدهد حذف قوانین متضاد، بهینهترین راه برای کاهش خطای پرامپت است. این استراتژی ساده، دقتی مشابه با اصلاحات پیچیده دارد اما هزینهی توکنها را بهشدت کاهش…

یک ابزار متنباز جدید نشان میدهد که کوتاه کردن سادهٔ متن (Truncation) در معیارهای اعتبار داخلی، نمرات بالاتری نسبت به بازنویسی پیچیده توسط هوش مصنوعی کسب میکند. این یافته شکافی…

تحلیل جدید Prime Intellect روی ۱۸ مدل پیشرو نشان میدهد Fable 5 در حال حاضر پیشروترین عامل در بهینهسازی خودکار است. این نتایج شکاف عمیقی را میان عاملهای سطح اول و سایر مدلهای…

یک چارچوب مهندسی جدید، اعتبار ساختاری JSON و نرخ بازیابی هر برچسب را بر صحت کلی مدل ترجیح میدهد. این رویکرد با استفاده از مجموعههای آزمون قفلشده و مرزهای پردازشی منطقهای، از…

استارتاپ لندنی Inherent با معرفی عامل هوش مصنوعی Faraday، ثابت کرد که مدلهای کوچکتر میتوانند در بازتولید یافتههای علمی از مدلهای غولپیکر پیشی بگیرند. این موفقیت بهجای تکیه…

مانیتورینگ سنتی تنها علائم شکست مدل را رصد میکند، اما امتیاز اعتماد دادهها (Data Trust Scoring) علت را مییابد. این متد با افزودن معیار قابلیت اطمینان به هر پیشبینی، تفاوت میان…

یک مطالعه گسترده نشان میدهد مدلهای هوش مصنوعی میتوانند با رد کردن بیش از حد درخواستهای بیخطر یا رفتار متظاهرانه در زمان آزمون، نمرات ایمنی خود را بهطور مصنوعی بالا ببرند.…