اگر امروز برای تولید محتوای آموزشی از هوش مصنوعی استفاده میکنید، احتمالاً آزمونهای شما حفرهای امنیتی دارند که دانشآموزان بدون دانستن مطلب، پاسخها را حدس میزنند. یک توسعهدهنده که آزمونهای تمرینی را در پلتفرم Udemy منتشر میکرد، متوجه شد که هوش مصنوعی اغلب گزینههای صحیح را بهصورت متوالی تکرار میکند (۱ ← ۲ ← ۳ ← ۴). این سوگیری موقعیتی پیشبینیپذیر در ارزیابیهای تولید شده توسط AI یک نقص بحرانی ایجاد کرد: در حالی که سوالات طبیعی به نظر میرسیدند، کاربران میتوانستند بدون درک واقعی محتوا، پاسخهای صحیح را حدس بزنند.
این چالش در حالی رخ میدهد که مدرسان و تولیدکنندگان محتوا برای تولید انبوه متریالهای گواهینامه به مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن کتابها جواب میدهد — متکی شدهاند. برای کسانی که راهنمای مطالعه یا ارزیابیهای داخلی میسازند، تکیه بر خروجی خام هوش مصنوعی یک «مثبت کاذب» از کیفیت ایجاد میکند؛ یعنی محتوا حرفهای به نظر میرسد اما ساختار زیرین آن به شدت آسیب دیده است.
همانطور که در تحلیلهای قبلی ما دربارهی توهمات مدلهای زبانی اشاره کردیم، ظاهر متقاعدکننده لزوماً به معنای صحت ساختاری نیست. این مسئله یادآور تلاشهای اخیر گوگل است که با متد RRSI سعی کرد جلوی حفظ طوطیوار بنچمارکها توسط عاملهای AI را بگیرد تا ارزیابیها واقعیتر شوند. به گزارش وبسایت dev.to در ۸ اکتبر ۲۰۲۶، این تولیدکننده محتوا دریافت که در برخی بخشهای یک مجموعه ۳۰۰ سوالی، موقعیت پاسخ صحیح در ۸۳٪ موارد «یک واحد» جلو رفته است. در یک توزیع واقعاً تصادفی، این اتفاق باید تنها در حدود ۲۵٪ موارد رخ دهد.
جزئیات آزمایش و کشف سوگیری
نویسنده برای تست این موضوع، از یک هوش مصنوعی خواست تا ۳۰۰ سوال تمرینی برای یک آزمون گواهینامه تخصصی در حوزه AI تولید کند. هر سوال دارای چهار گزینه و یک توضیح مفصل بود. هدف نهایی، انتشار این سوالات به عنوان «تستهای تمرینی» (Practice Tests) در پلتفرم Udemy بود.
در ابتدا، نویسنده پس از یک تست اولیه احساس اطمینان کرد؛ زیرا یک مدل هوش مصنوعی دوم توانست ۳۰۰ سوال از ۳۰۰ سوال را بهطور کامل درست پاسخ دهد. اما این تطابق کامل گمراهکننده بود. احتمال زیاد این بود که مدل حلکننده، بهجای درک موضوع علمی، صرفاً الگوهای موقعیتی پاسخها را شناسایی کرده و بر اساس همان نظم پیشبینیپذیر، گزینهها را انتخاب کرده بود.

برای حل این مشکل و اطمینان از کیفیت، نویسنده سه گام اعتبارسنجی مشخص را پیشنهاد میکند:
۱. اعتبارسنجی متقاطع با مدلهای مختلف
سوالات را (بدون ارائه پاسخها یا توضیحات) به مدلی متفاوت از مدل تولیدکننده بدهید. هدف اصلی در اینجا شناسایی خطاهای واقعی، اطلاعات نادرست یا دادههای قدیمی است. این رویکرد مشابه استراتژیهای پیشرفتهای است که در چارچوبهای جدید DevOps برای پیشبینی شکست تستها به کار میرود تا هزینهها و زمان بررسی کاهش یابد.
- پرامپت: از مدل بخواهید سوالات را حل کند و بهطور خاص مواردی را که «سخت یا گیجکننده» هستند یا «اطلاعاتشان قدیمی یا مشکوک به نظر میرسد» علامت بزند.
- نتیجه: در این تست، ۲۳ سوال از ۳۰۰ مورد بهدلیل ارجاعات مبهم یا توصیفات منسوخ درباره محصولات شناسایی و متعاقباً از مجموعه حذف شدند.
۲. تحلیل الگوی موقعیتی
موقعیت هر پاسخ صحیح (اول، دوم، سوم یا چهارم) را در یک صفحه گسترده (Spreadsheet) لیست کنید. اگر پیشروی از یک سوال به سوال بعدی بهطور مکرر «+۱» باشد (بهطوری که بعد از گزینه ۴ دوباره به ۱ برگردد)، مجموعه شما دچار سوگیری ساختاری است.
- دادهها: نویسنده دریافت که برای سوالات مجاور، موقعیت پاسخ در ۵۸٪ کل موارد و در برخی بخشهای خاص تا ۸۳٪، یک واحد جلو رفته است.
- راهکار: ترتیب گزینهها را بهصورت دستی بههم بریزید در حالی که جفت بودن سوال و توضیح مربوط به آن حفظ شود. همچنین نویسنده تنظیم «تصادفی کردن ترتیب گزینهها» (randomize option order) را در پلتفرم فعال کرد.
- خروجی: برای ۱۲۰ سوالی که در نهایت منتشر شدند، این الگوی متوالی از ۸۳٪ به ۳۲٪ کاهش یافت.
۳. بازرسی سطح فیلدها
تمام فیلدهای صفحه نهایی انتشار، از جمله مواردی که توسط سیستم یا هوش مصنوعی بهصورت خودکار پر شدهاند را بررسی کنید. هرگز صرفاً به تعداد کاراکترها اعتماد نکنید.
- خطا: پس از انتشار دوره در ۲۸ سپتامبر، نویسنده متوجه شد که زیرعنوان (Subtitle) دوره در وسط جمله قطع شده است. کاراکترهای انگلیسی با عرض کم مانند «AI» بهدلیل محدودیت ۱۲۰ کاراکتری حذف شده بودند.
- علت: یک قابلیت پر کردن خودکار (Auto-fill)، متنی را که برای فیلد دیگری در نظر گرفته شده بود، در بخش زیرعنوان قرار داده بود. چون نویسنده فقط توضیحات اصلی را چک کرده بود، این خطا تا زمان آنلاین شدن صفحه شناسایی نشد.
- راهکار: نویسنده اکنون از سیستمی استفاده میکند که متن صفحه منتشرشده را بهصورت هفتگی میخواند و اگر با نسخه تأییدشده تفاوت داشته باشد، هشدار میدهد.
این یافته، این فرض رایج را که «متن متقاعدکننده» برابر با «ارزیابی باکیفیت» است، تغییر میدهد. برای شما به این معناست که هر آزمونی که با هوش مصنوعی ساخته شده باشد — چه آن را بگذرانید و چه بسازید — اگر این بررسیها انجام نشده باشد، احتمالاً از طریق شناسایی الگو و نه شایستگی علمی، قابل حل است.
همچنین این موضوع ریسک تعلیق حساب در پلتفرمهایی مثل Udemy را افزایش میدهد؛ جایی که محتوای پیشنویس شده با هوش مصنوعی تنها در صورتی مجاز است که بازبینی انسانی شده و در توضیحات دوره به آن اشاره شود. تولید انبوه دورههای کمکیفیت و تاییدنشده اکنون برای تولیدکنندگان یک ریسک (Liability) محسوب میشود.
نتایج فعلی
پس از انتشار «آزمون تمرینی پاسپورت هوش مصنوعی زاینده» (Generative AI Passport) که شامل ۲ تست ۶۰ سوالی بود، نویسنده گزارش داد که در ۱۰ روز اول هیچ ثبتنامی صورت نگرفت. او گمان میکند که دوره در رتبههای بالای نتایج جستوجو ظاهر نمیشود، زیرا قطع شدن فیلد زیرعنوان بر توصیفات نتایج جستوجو نیز تأثیر گذاشته است. بهروزرسانی بعدی در اوایل نوامبر منتشر خواهد شد.
برای اینکه مطمئن شوید محتوای تولید شده توسط AI شما آماده انتشار است، ابتدا کلید پاسخها را برای یافتن الگوهای متوالی بررسی کنید. همچنین میتوانید بررسیهای خودکار هفتگی را برای اطمینان از عدم تغییر متن صفحات زنده نسبت به نسخههای تأیید شده اجرا کنید.
گام بعدی شما
- کلید پاسخهای آزمونهای خود را برای یافتن الگوهای متوالی (مثل ۱، ۲، ۳، ۴) بررسی کنید.
- از دو مدل مختلف برای حل سوالات استفاده کنید تا نقاط کور محتوایی شناسایی شوند.
- یک سیستم نظارت هفتگی برای بررسی متن صفحات منتشرشده ایجاد کنید تا از تغییرات ناخواسته جلوگیری شود.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو