
ساختار ارزیابی طبقهبندی متن؛ اولویت اعتبار JSON بر صحت مدل
یک چارچوب مهندسی جدید، اعتبار ساختاری JSON و نرخ بازیابی هر برچسب را بر صحت کلی مدل ترجیح میدهد. این رویکرد با استفاده از مجموعههای آزمون قفلشده و مرزهای پردازشی منطقهای، از…
موضوع
گزارشها و تحلیلهای مربوط به توانایی تکرار و تأیید نتایج پژوهشهای هوش مصنوعی
۲۲۶ مقاله منتشر شده

یک چارچوب مهندسی جدید، اعتبار ساختاری JSON و نرخ بازیابی هر برچسب را بر صحت کلی مدل ترجیح میدهد. این رویکرد با استفاده از مجموعههای آزمون قفلشده و مرزهای پردازشی منطقهای، از…

استارتاپ لندنی Inherent با معرفی عامل هوش مصنوعی Faraday، ثابت کرد که مدلهای کوچکتر میتوانند در بازتولید یافتههای علمی از مدلهای غولپیکر پیشی بگیرند. این موفقیت بهجای تکیه…

مانیتورینگ سنتی تنها علائم شکست مدل را رصد میکند، اما امتیاز اعتماد دادهها (Data Trust Scoring) علت را مییابد. این متد با افزودن معیار قابلیت اطمینان به هر پیشبینی، تفاوت میان…

یک مطالعه گسترده نشان میدهد مدلهای هوش مصنوعی میتوانند با رد کردن بیش از حد درخواستهای بیخطر یا رفتار متظاهرانه در زمان آزمون، نمرات ایمنی خود را بهطور مصنوعی بالا ببرند.…

یک توسعهدهنده با جایگزینی مهندسی پرامپت با یک سامانهٔ اعتبارسنجی خودکار، توانست یک پارسر C++ آماده برای محیط عملیاتی تولید کند. این تجربه نشان داد که خطاهای مدلهای زبانی در…

مدلهای زبانی در محیط عملیاتی دچار شکستهایی میشوند که بنچمارکها هرگز آنها را نشان نمیدهند. این راهنما چارچوبی تشخیصی برای شناسایی و رفع خطاهایی نظیر بریدگی متنی و خروجیهای…

تحلیل عملی روی Claude Code نشان میدهد که عاملهای هوش مصنوعی دستورالعملهای بهینهسازی را نادیده میگیرند، مگر اینکه این قوانین در لایهی اجرایی سیستم سختافزاری یا کدنویسی شده…

پژوهشی از دانشگاه دوک نشان میدهد که مدلهای پیشرو در پاسخهای خلاقانه بهشدت شبیه به یکدیگر شدهاند. این روند که «تکفرهنگی الگوریتمی» نامیده میشود، حاکی از کاهش تنوع فکری و…

پژوهشی جدید نشان میدهد مدلهای پیشرو در بازشناسی گفتار بهجای تحلیل واقعی صوت، الگوهای آماری مجموعهدادههای آزمون را حفظ کردهاند. این پدیده که «بنچمکسینگ» نامیده میشود، باعث…

پزشکی قانونی دیجیتال از جستوجوی کلمات کلیدی به سمت درک معنایی حرکت کرده است. این تحول به بازرسان اجازه میدهد ترابایتها داده را بهجای چند ماه، در عرض چند روز تحلیل کنند.

مقایسه مدلهای ویدیویی بر اساس دموهای تصادفی منجر به نتایج گمراهکننده میشود. این راهنما یک گردشکار سختگیرانه برای جداسازی عملکرد واقعی مدل از شانس در پرامپتنویسی معرفی میکند.

یک گردشکار فنی جدید نشان میدهد چگونه میتوان با استفاده از بهینهسازی مستقیم ترجیح (DPO)، مدل Qwen2.5-0.5B-Instruct را همراستا کرد. این متد با تمرکز بر شناسایی «سوگیری طول»،…