پرش به محتوای اصلی
پرش به محتوای مقاله

مطالعهٔ دانشگاه بوکونی: GPT-4o نمرات دانشجویان را بالا برد اما یادگیری را نه

·۸ شهریور ۱۴۰۵۴ دقیقه مطالعه
مهارتی که نمرات بالا می‌آورد، همان است که هوش مصنوعی بهتر جعل می‌کند.
مهارتی که نمرات بالا می‌آورد، همان است که هوش مصنوعی بهتر جعل می‌کند.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تأیید تجربی این واقعیت که افزایش نمرات در عصر AI لزوماً با افزایش دانش همراه نیست و حتی می‌تواند با افت نمرات آزمون‌های استاندارد بلندمدت (تا ۲۴٪) همبستگی داشته باشد.

اگر امروز برای تکالیف دانشگاهی از هوش مصنوعی استفاده می‌کنید، احتمالاً نمرات شما بالا می‌رود، اما ممکن است هیچ چیز جدیدی یاد نگیرید. این شکاف خطرناک بین «ظاهرِ حرفه‌ای» و «درک عمیق»، هستهٔ مرکزی یک پژوهش جدید است. در این آزمایش، ۱۰۵۳ دانشجوی سال اول دانشگاه بوکونی شرکت کردند که نتایج آن نشان‌دهنده تفاوتی آشکار بین عملکرد نمره‌گذاری شده و رشد شناختی بود. در حالی که دانشجویانی که از GPT-4o استفاده کردند، در تکالیف مدیریت نمرات به‌طور قابل‌توجهی بالاتری نسبت به دانشجویان بدون AI کسب کردند، اما این جهش نمرات بیشتر بازتاب‌دهنده صیقل‌یافتگی خروجی بود تا یادگیری واقعی.

این تنش در حالی رخ می‌دهد که مدرسان برای تشخیص تفاوت بین «تقلب با AI» و «پشتیبانی تحصیلی» در تکاپو هستند. در بسیاری از کلاس‌های امروز، ابزارهایی که یک مقاله را حرفه‌ای جلوه می‌دهند — دقیقاً همان‌هایی هستند که می‌توانند جایگزین فرآیند تفکر دانشجو شوند. برخی مؤسسات آموزشی برای مقابله با این چالش، روش‌های نظارتی جدیدی را آزموده‌اند؛ برای مثال، بررسی سیستم چراغ راهنما در آکادمی چشایر نشان می‌دهد که چگونه می‌توان مرز بین کمک AI و تقلب را مدیریت کرد. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی توهمات مدل‌های زبانی اشاره کردیم، تکیه بر خروجی‌های صیقل‌خورده می‌تواند منجر به پذیرش پاسخ‌های غلط اما متقاعدکننده شود.

در نوامبر ۲۰۲۵، پژوهشگران ۱۳ گروه از دانشجویان سال اول درس مدیریت را به چهار دسته تقسیم کردند: گروه کنترل، گروه آموزش استدلال علی، گروه دارای دسترسی به GPT-4o و گروه ترکیبی. دانشجویان مأموریت داشتند توصیه‌های بازاریابی برای فروشگاه کالاهای دانشگاه را در کمتر از ۱۸۰ کلمه بنویسند. آموزش استدلال علی — که شبیه به یاد دادنِ «چگونه قطعات یک پازل را برای رسیدن به نتیجه درست کنار هم بگذاریم» است — به‌طور خاص بر منطق علی منسجم، ابطال‌پذیری (falsifiability) و نحوه رسیدن یک اقدام پیشنهادی به نتیجهٔ مطلوب تمرکز داشت.

به نقل از وب‌سایت the-decoder.com، نتایج این آزمایش تفاوت‌های تکان‌دهنده‌ای را نشان داد:

  • کاربران GPT-4o در مقیاس ۱ تا ۵، تقریباً یک نمره کامل بیشتر گرفتند.
  • پاسخ‌های کمک‌گرفته از AI به‌طور متوسط حدود دو ایده بیشتر داشتند، از نظر منطقی منسجم‌تر بودند و شباهت بیشتری به توصیه‌های خبرگان داشتند.
  • حتی پس از کنترل ویژگی‌های متنی، تنوع ایده‌ها و کیفیت استدلال، برتری قابل‌اندازه‌گیری GPT-4o باقی ماند؛ نویسندگان این برتری را به کیفیت محتوا نسبت دادند، نه به دانش واقعی دانشجو.
  • آموزش استدلال علی نمرات سنتی را بالا نبرد؛ در واقع، نمرات این دانشجویان به‌طور متوسط کمی پایین‌تر بود.
  • با این حال، گروه آموزش استدلال علی ایده‌های متنوع‌تری تولید کردند که با ایده‌های هم‌کلاسی‌هایشان متفاوت بود و بهتر توضیح دادند که چرا یک پیشنهاد باید جواب دهد و در چه شرایطی ممکن است شکست بخورد.

مهارتی که نمرات بالا می‌آورد، همان است که هوش مصنوعی بهتر جعل می‌کند.

سیستم نمره‌دهی به‌شدت به پاسخ‌های متداول و خوش‌ساخت علاقه داشت. هرچه ایده‌ها بیشتر و انسجام متن بالاتر بود، نمره بیشتر می‌شد؛ اما ابطال‌پذیری قوی‌تر و تفاوت بیشتر ایده‌ها با دیگر دانشجویان، در واقع با نمرات پایین‌تر همبستگی داشت. در واقع، هوش مصنوعی زاینده (Generative AI) — مثل دستیاری که متن شما را بازنویسی می‌کند تا شبیه به یک مدیر ارشد به نظر برسد — صیقل و انسجام لازم برای نمره عالی را فراهم کرد، اما «ابطال‌پذیری» یا منطق عمیق علی را که مداخلات آموزشی تشویق می‌کردند، ارائه نداد. نکته حیاتی این بود که پژوهشگران دریافتند ترکیب آموزش استدلال با AI، نمرات سنتی را بیشتر افزایش نداد، هرچند این دو رویکرد در شاخص‌های تنوع ایده‌ها مکمل یکدیگر بودند.

این وضعیت نشان‌دهنده یک شکست سیستمی در نحوه اندازه‌گیری هوش در عصر AI است. سیستم‌های فعلی «فضای پاسخ» یا همان جواب مورد انتظار را پاداش می‌دهند، نه فرآیند استدلال یا شجاعت در ارائه ایده‌های بدیع. نویسندگان نتیجه می‌گیرند که اگر قرار است تنوع و اصالت ارزشمند باشد، باید صراحتاً در معیارهای نمره‌دهی گنجانده شود.

برای یک دانشجوی معمولی، این یک انگیزه خطرناک ایجاد می‌کند. اگر پاداش نمره باشد و نه درک مطلب، راحت‌ترین مسیر این است که اجازه دهد AI به‌طور کامل جایگزین تفکر شود. این مسئله با این واقعیت مرتبط است که بسیاری از ابزارهای آموزشی AI هنوز در تشخیص نقاط ضعف و دشواری‌های واقعی دانش‌آموزان ناتوان‌اند و صرفاً خروجی نهایی را بهینه می‌کنند. مطالعه اشاره کرد که یک شکاف بحرانی وجود دارد: هیچ آزمون تکمیلی برای بررسی اینکه دانشجویان بدون ChatGPT چه مقدار از مطالب را به خاطر سپرده‌اند، انجام نشد.

بر اساس بررسی منابع متعدد، داده‌های خارجی این نگرانی را تأیید می‌کنند. مطالعه‌ای روی ۵۰۰ هزار نمره دانشگاهی در آمریکا نشان داد نمرات در دوره‌های برنامه‌نویسی و نویسندگی که دارای بخش‌های بزرگ تکالیف خانگی بودند، پس از عرضه ChatGPT افزایش یافت. با این حال، آزمایش‌های کنترل‌شده نشان دادند که وقتی AI حذف شد، شرکت‌کنندگان عملکرد بدتری نسبت به گروه کنترل داشتند؛ به‌ویژه کسانی که از GPT برای دریافت پاسخ‌های مستقیم استفاده کرده بودند.

به همین ترتیب، مطالعه‌ای ۳۰ ماهه روی ۲۶ هزار دانشجو در چین نشان داد که اگرچه AI تکالیف را سریع‌تر و بهتر کرد، اما نمرات آزمون‌های ورودی بلندمدت بین ۱۸ تا ۲۴ درصد افت کرد. تنها دانشجویانی که تلاش خود را در تکالیف در سطح کاربران غیر-AI نگه داشتند، از این افت در امان ماندند. این یعنی AI تنها زمانی ابزار یادگیری است که از تفکر پشتیبانی کند، نه اینکه جایگزین آن شود.

شرکت OpenAI که تکنولوژی این پژوهش را فراهم کرده و چندین نفر از نویسندگان مطالعه را در استخدام دارد، این موضوع را چالشی برای سیستم‌های نمره‌دهی می‌داند. آن‌ها استدلال می‌کنند که مدرسان باید به‌جای صیقل‌خورده بودن متنی، به اصالت، استدلال و بررسی رویکردهای مختلف پاداش دهند. اما تغییر این ساختار پاداش، نیازمند چیزی بیش از یک جدول نمره‌دهی جدید است؛ این امر مستلزم یک بازنگری بنیادین در سیستم آموزشی است تا فرآیند یادگیری بر محصول نهایی اولویت یابد.

گام بعدی شما

  • اگر از AI برای یادگیری استفاده می‌کنید، از آن بخواهید به‌جای دادن پاسخ، شما را با پرسش‌های سقراطی به جواب برساند.
  • در تکالیف خود، بخش «منطق استدلال» را جدا کنید و توضیح دهید چرا این پاسخ را انتخاب کردید تا از اتکای صرف به خروجی مدل جلوگیری کنید.
  • مدرسان باید معیارهای نمره‌دهی را از «صحت پاسخ» به «تنوع رویکردها» تغییر دهند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مطالعه با تکیه بر داده‌های تجربی دانشگاهی، اعتبار ادعای «کاهش توان تفکر در اثر استفاده از AI» را تأیید می‌کند. این موضوع لزوم بازنگری در متدهای آموزشی جهانی را برای جلوگیری از سقوط کیفیت نیروی متخصص آینده ضروری می‌سازد.

تأثیر برای ایران

برای دانشجویان و برنامه‌نویسان ایرانی که به‌شدت به ابزارهای AI برای جبران کمبود منابع آموزشی متکی‌اند، این هشدار جدی است که اتکای صرف به خروجی مدل‌ها می‌تواند منجر به ایجاد «تخصص‌های توخالی» شود.

·نگاه ما
تحریریه دات‌هوش

این پژوهش ثابت می‌کند که مدل‌های زبانی بزرگ در حال تبدیل شدن به «ماشین‌های بهینه‌ساز نمره» هستند، نه ابزارهای آموزشی. وقتی سیستم‌های ارزیابی بر اساس خروجی (Output) باشند، AI به‌راحتی مسیر یادگیری را میان‌بر می‌زند و دانشجو را در توهمِ تسلط قرار می‌دهد. برای خروج از این بن‌بست، باید ارزیابی‌ها از «چه پاسخی دادید» به «چگونه فکر کردید» تغییر کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.