پرش به محتوای اصلی
پرش به محتوای مقاله

محققان ۱۹۵ معیار ایمنی هوش مصنوعی را فهرست کردند؛ پراکندگی گسترده است

·۲۷ فروردین ۱۴۰۵۲ دقیقه مطالعه
محققان ۱۹۵ معیار ایمنی هوش مصنوعی را فهرست کردند؛ پراکندگی گسترده است
اشتراک‌گذاری

محققان ابزار جدیدی به نام AISafetyBenchExplorer (AISafetyBenchExplorer) منتشر کرده‌اند. این فهرست ساختاریافته ۱۹۵ معیار ایمنی هوش مصنوعی را از ۲۰۱۸ تا ۲۰۲۶ مستند می‌کند. آنها این وضعیت را «مشکل پراکندگی بنیادی» توصیف می‌کنند.

این کاتالوگ شامل چهار بخش است: فراداده سطح معیار، تعریف‌های سطح متریک (metric-level definitions)، فراداده مقاله مرجع، و وضعیت فعالیت مخزن (repository activity). این ساختار امکان مقایسه نظامند را فراهم می‌آورد. مسأله اصلی این است که معیارها «ایمنی» را متفاوت تفسیر و ارزیابی می‌کنند.

تحلیل داده‌ها نگرانی‌های ساختاری را آشکار می‌کند. بیشتر معیارها در سطح پیچیدگی متوسط قرار دارند: ۹۴ مورد از ۱۹۵. تنها ۷ معیار به سطح محبوب رسیده‌اند. تمرکز بر ارزیابی انگلیسی‌زبان شدید است: ۱۶۵ مورد. منابع ارزیابی‌محور هم غالب هستند: ۱۷۰ مورد.

نگهداری مخازن نیز مشکل‌ساز شده است. ۱۳۷ مخزن GitHub و ۹۶ مجموعه داده Hugging Face غیرفعال طبقه‌بندی شده‌اند. این یعنی بسیاری از معیارها پس از انتشار، به‌روزرسانی نمی‌شوند.

در سطح متریک (metric)، وضعیت آشوبناک‌تر است. برچسب‌های آشنا مانند دقت (accuracy)، امتیاز F1، و امتیاز ایمنی (safety score) تعریف‌های متفاوتی دارند. این ناهمگونی معنایی (semantic inconsistency) دو معیار با ادعای یکسان را عملاً غیرقابل مقایسه می‌کند.

پژوهشگران می‌گویند شکست اصلی این حوزه «پراکندگی» است، نه «کمبود». با وجود فراوانی ابزارها، محققان فاقد زبان مشترک سنجش هستند. مبنای اصولی برای انتخاب معیار وجود ندارد. هنجارهای نگهداری پس از انتشار هم مشخص نیست. تکیه زیاد بر پیش‌چاپ‌های arXiv به جای مجلات داوری‌شده (peer-reviewed venues) کنترل کیفیت را دشوار می‌کند.

کاتالوگ یک طبقه‌بندی پیچیدگی (complexity taxonomy) ارائه می‌دهد. هدف، کمک به انتخاب آگاهانه‌تر معیارها است. این ابزار برای پژوهشگرانی طراحی شده که باید معیار مناسب ارزیابی را بیابند.

جامعه هوش مصنوعی با چالشی جدی مواجه است: معیارهای متعدد بدون زبان مشترک. این وضعیت مقایسه نتایج و انتخاب معیار مناسب را تقریباً غیرممکن کرده است.

·نگاه ما
تحریریه دات‌هوش

جامعه هوش مصنوعی فارسی‌زبان باید این یافته‌ها را جدی بگیرد. اکثر معیارهای موجود برای زبان انگلیسی طراحی شده‌اند و این یعنی ارزیابی مدل‌های فارسی در هاله‌ای از ابهام قرار دارد. توسعه‌دهندگان ایرانی باید در تعریف معیارهای بومی مشارکت فعال داشته باشند تا زبان مشترک سنجش ایمنی شکل بگیرد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.