پرش به محتوای اصلی
پرش به محتوای مقاله

۳ گام برای حذف سوگیری موقعیتی در آزمون‌های ساخته‌شده با هوش مصنوعی

·۱۷ مهر ۱۴۰۵۴ دقیقه مطالعه
راهنما
آزمون چندگزینه‌ای هوش مصنوعی: تعصب در جایگاه پاسخ‌ها (و روش بررسی قبل از انتشار)
آزمون چندگزینه‌ای هوش مصنوعی: تعصب در جایگاه پاسخ‌ها (و روش بررسی قبل از انتشار)
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کشف یک سوگیری موقعیتی (Positional Bias) خاص در آزمون‌های چهارگزینه‌ای که در آن پاسخ‌ها به‌صورت متوالی (۱، ۲، ۳، ۴) جابه‌جا می‌شوند و باعث می‌شود آزمون بدون دانش، قابل حل باشد.

اگر امروز برای تولید محتوای آموزشی از هوش مصنوعی استفاده می‌کنید، احتمالاً آزمون‌های شما حفره‌ای امنیتی دارند که دانش‌آموزان بدون دانستن مطلب، پاسخ‌ها را حدس می‌زنند. یک توسعه‌دهنده که آزمون‌های تمرینی را در پلتفرم Udemy منتشر می‌کرد، متوجه شد که هوش مصنوعی اغلب گزینه‌های صحیح را به‌صورت متوالی تکرار می‌کند (۱ ← ۲ ← ۳ ← ۴). این سوگیری موقعیتی پیش‌بینی‌پذیر در ارزیابی‌های تولید شده توسط AI یک نقص بحرانی ایجاد کرد: در حالی که سوالات طبیعی به نظر می‌رسیدند، کاربران می‌توانستند بدون درک واقعی محتوا، پاسخ‌های صحیح را حدس بزنند.

این چالش در حالی رخ می‌دهد که مدرسان و تولیدکنندگان محتوا برای تولید انبوه متریال‌های گواهینامه به مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — متکی شده‌اند. برای کسانی که راهنمای مطالعه یا ارزیابی‌های داخلی می‌سازند، تکیه بر خروجی خام هوش مصنوعی یک «مثبت کاذب» از کیفیت ایجاد می‌کند؛ یعنی محتوا حرفه‌ای به نظر می‌رسد اما ساختار زیرین آن به شدت آسیب دیده است.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی توهمات مدل‌های زبانی اشاره کردیم، ظاهر متقاعدکننده لزوماً به معنای صحت ساختاری نیست. این مسئله یادآور تلاش‌های اخیر گوگل است که با متد RRSI سعی کرد جلوی حفظ طوطی‌وار بنچمارک‌ها توسط عامل‌های AI را بگیرد تا ارزیابی‌ها واقعی‌تر شوند. به گزارش وب‌سایت dev.to در ۸ اکتبر ۲۰۲۶، این تولیدکننده محتوا دریافت که در برخی بخش‌های یک مجموعه ۳۰۰ سوالی، موقعیت پاسخ صحیح در ۸۳٪ موارد «یک واحد» جلو رفته است. در یک توزیع واقعاً تصادفی، این اتفاق باید تنها در حدود ۲۵٪ موارد رخ دهد.

جزئیات آزمایش و کشف سوگیری

نویسنده برای تست این موضوع، از یک هوش مصنوعی خواست تا ۳۰۰ سوال تمرینی برای یک آزمون گواهینامه تخصصی در حوزه AI تولید کند. هر سوال دارای چهار گزینه و یک توضیح مفصل بود. هدف نهایی، انتشار این سوالات به عنوان «تست‌های تمرینی» (Practice Tests) در پلتفرم Udemy بود.

در ابتدا، نویسنده پس از یک تست اولیه احساس اطمینان کرد؛ زیرا یک مدل هوش مصنوعی دوم توانست ۳۰۰ سوال از ۳۰۰ سوال را به‌طور کامل درست پاسخ دهد. اما این تطابق کامل گمراه‌کننده بود. احتمال زیاد این بود که مدل حل‌کننده، به‌جای درک موضوع علمی، صرفاً الگوهای موقعیتی پاسخ‌ها را شناسایی کرده و بر اساس همان نظم پیش‌بینی‌پذیر، گزینه‌ها را انتخاب کرده بود.

آزمون‌های چندگزینه‌ای هوش مصنوعی: تعصب در جایگاه پاسخ‌ها (و روش بررسی قبل از انتشار)

برای حل این مشکل و اطمینان از کیفیت، نویسنده سه گام اعتبارسنجی مشخص را پیشنهاد می‌کند:

۱. اعتبارسنجی متقاطع با مدل‌های مختلف

سوالات را (بدون ارائه پاسخ‌ها یا توضیحات) به مدلی متفاوت از مدل تولیدکننده بدهید. هدف اصلی در اینجا شناسایی خطاهای واقعی، اطلاعات نادرست یا داده‌های قدیمی است. این رویکرد مشابه استراتژی‌های پیشرفته‌ای است که در چارچوب‌های جدید DevOps برای پیش‌بینی شکست تست‌ها به کار می‌رود تا هزینه‌ها و زمان بررسی کاهش یابد.

  • پرامپت: از مدل بخواهید سوالات را حل کند و به‌طور خاص مواردی را که «سخت یا گیج‌کننده» هستند یا «اطلاعاتشان قدیمی یا مشکوک به نظر می‌رسد» علامت بزند.
  • نتیجه: در این تست، ۲۳ سوال از ۳۰۰ مورد به‌دلیل ارجاعات مبهم یا توصیفات منسوخ درباره محصولات شناسایی و متعاقباً از مجموعه حذف شدند.

۲. تحلیل الگوی موقعیتی

موقعیت هر پاسخ صحیح (اول، دوم، سوم یا چهارم) را در یک صفحه گسترده (Spreadsheet) لیست کنید. اگر پیشروی از یک سوال به سوال بعدی به‌طور مکرر «+۱» باشد (به‌طوری که بعد از گزینه ۴ دوباره به ۱ برگردد)، مجموعه شما دچار سوگیری ساختاری است.

  • داده‌ها: نویسنده دریافت که برای سوالات مجاور، موقعیت پاسخ در ۵۸٪ کل موارد و در برخی بخش‌های خاص تا ۸۳٪، یک واحد جلو رفته است.
  • راهکار: ترتیب گزینه‌ها را به‌صورت دستی به‌هم بریزید در حالی که جفت بودن سوال و توضیح مربوط به آن حفظ شود. همچنین نویسنده تنظیم «تصادفی کردن ترتیب گزینه‌ها» (randomize option order) را در پلتفرم فعال کرد.
  • خروجی: برای ۱۲۰ سوالی که در نهایت منتشر شدند، این الگوی متوالی از ۸۳٪ به ۳۲٪ کاهش یافت.

۳. بازرسی سطح فیلدها

تمام فیلدهای صفحه نهایی انتشار، از جمله مواردی که توسط سیستم یا هوش مصنوعی به‌صورت خودکار پر شده‌اند را بررسی کنید. هرگز صرفاً به تعداد کاراکترها اعتماد نکنید.

  • خطا: پس از انتشار دوره در ۲۸ سپتامبر، نویسنده متوجه شد که زیرعنوان (Subtitle) دوره در وسط جمله قطع شده است. کاراکترهای انگلیسی با عرض کم مانند «AI» به‌دلیل محدودیت ۱۲۰ کاراکتری حذف شده بودند.
  • علت: یک قابلیت پر کردن خودکار (Auto-fill)، متنی را که برای فیلد دیگری در نظر گرفته شده بود، در بخش زیرعنوان قرار داده بود. چون نویسنده فقط توضیحات اصلی را چک کرده بود، این خطا تا زمان آنلاین شدن صفحه شناسایی نشد.
  • راهکار: نویسنده اکنون از سیستمی استفاده می‌کند که متن صفحه منتشرشده را به‌صورت هفتگی می‌خواند و اگر با نسخه تأییدشده تفاوت داشته باشد، هشدار می‌دهد.

این یافته، این فرض رایج را که «متن متقاعدکننده» برابر با «ارزیابی باکیفیت» است، تغییر می‌دهد. برای شما به این معناست که هر آزمونی که با هوش مصنوعی ساخته شده باشد — چه آن را بگذرانید و چه بسازید — اگر این بررسی‌ها انجام نشده باشد، احتمالاً از طریق شناسایی الگو و نه شایستگی علمی، قابل حل است.

همچنین این موضوع ریسک تعلیق حساب در پلتفرم‌هایی مثل Udemy را افزایش می‌دهد؛ جایی که محتوای پیش‌نویس شده با هوش مصنوعی تنها در صورتی مجاز است که بازبینی انسانی شده و در توضیحات دوره به آن اشاره شود. تولید انبوه دوره‌های کم‌کیفیت و تاییدنشده اکنون برای تولیدکنندگان یک ریسک (Liability) محسوب می‌شود.

نتایج فعلی

پس از انتشار «آزمون تمرینی پاسپورت هوش مصنوعی زاینده» (Generative AI Passport) که شامل ۲ تست ۶۰ سوالی بود، نویسنده گزارش داد که در ۱۰ روز اول هیچ ثبت‌نامی صورت نگرفت. او گمان می‌کند که دوره در رتبه‌های بالای نتایج جست‌وجو ظاهر نمی‌شود، زیرا قطع شدن فیلد زیرعنوان بر توصیفات نتایج جست‌وجو نیز تأثیر گذاشته است. به‌روزرسانی بعدی در اوایل نوامبر منتشر خواهد شد.

برای اینکه مطمئن شوید محتوای تولید شده توسط AI شما آماده انتشار است، ابتدا کلید پاسخ‌ها را برای یافتن الگوهای متوالی بررسی کنید. همچنین می‌توانید بررسی‌های خودکار هفتگی را برای اطمینان از عدم تغییر متن صفحات زنده نسبت به نسخه‌های تأیید شده اجرا کنید.

گام بعدی شما

  • کلید پاسخ‌های آزمون‌های خود را برای یافتن الگوهای متوالی (مثل ۱، ۲، ۳، ۴) بررسی کنید.
  • از دو مدل مختلف برای حل سوالات استفاده کنید تا نقاط کور محتوایی شناسایی شوند.
  • یک سیستم نظارت هفتگی برای بررسی متن صفحات منتشرشده ایجاد کنید تا از تغییرات ناخواسته جلوگیری شود.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این یافته بر اساس تجربه عملی یک توسعه‌دهنده، اعتبار آزمون‌های تولیدشده توسط AI را زیر سوال می‌برد. تکیه بر این ابزارها بدون لایه‌ی نظارت انسانی، منجر به تولید محتوای بی‌ارزش و ریسک حذف از پلتفرم‌های آموزشی می‌شود.

تأثیر برای ایران

برای تولیدکنندگان محتوای آموزشی ایرانی که از LLMها برای ساخت آزمون‌های استخدامی یا آموزشی استفاده می‌کنند، این یک هشدار جدی برای پیاده‌سازی لایه‌ی بازبینی انسانی است.

·نگاه ما
تحریریه دات‌هوش

این مورد نشان می‌دهد که مدل‌های زبانی حتی در ساده‌ترین توزیع‌های احتمالی (مثل جای‌گذاری گزینه‌ها) دچار سوگیری‌های سیستماتیک هستند. این یعنی «تصادفی بودن» در هوش مصنوعی یک توهم است و هر خروجی ساختاری باید با ابزارهای آماری خارجی اعتبارسنجی شود، نه با مدل‌های مشابه.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.