پرش به محتوای اصلی
پرش به محتوای مقاله

CogCAPTCHA30 و شکاف فرآیندی: چرا مدل‌های پیشرو در استدلال کمتر شبیه انسان هستند؟

·۸ خرداد ۱۴۰۵۳ دقیقه مطالعه۱ بازدید
اشتراک‌گذاری

اگر تصور می‌کنید رسیدن یک عامل (Agent) به پاسخ صحیح، نشانی از تفکر انسانی است، در اشتباهید. باید بدانید که توانایی تولید خروجی درست، لزوماً به معنای طی کردن یک مسیر شناختی مشابه انسان نیست.

در حالی که تست تورینگ کلاسیک سال ۱۹۵۰ بر روی «تشخیص‌ناپذیری رفتاری» در خروجی‌ها تمرکز داشت، امروز نیاز به معیاری داریم که «چگونه» را تحلیل کند. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی مدل‌های استدلالی اشاره کردیم، شکاف بین خروجی و فرآیند در حال عمیق‌تر شدن است و صنعت به تفکیک‌کننده‌هایی نیاز دارد که به جای «چه»، بر «چگونه» تمرکز کنند.

به نقل از research.roundtable.ai در ۲۹ مه ۲۰۲۶، ابزاری به نام CogCAPTCHA30 طراحی شده است. این باتری آزمایشی شامل یک کپچای کلاسیک و ۲۹ تکلیف روان‌شناسی شناختی است تا تفاوت‌های فرآیندی را شناسایی کند. در این پژوهش، مدل‌های پیشرو مانند GPT، Claude و Gemini در برابر مدل‌های کوچک‌تری چون Qwen و Centaur قرار گرفتند.

CAPTCHA results

CogCAPTCHA30 summary

طبق گزارش این مطالعه، یافته‌های کلیدی عبارت‌اند از:

  • برابری خروجی به معنای برابری فرآیند نیست؛ هوش مصنوعی و انسان ممکن است از مسیرهای کاملاً متفاوتی به یک پاسخ برسند.
  • مدل‌های پیشرو (Claude، GPT و Gemini) ویژگی‌های فرآیندی آن‌ها نسبت به انسان‌ها، کمتر از مدل‌های کوچک‌تر است.
  • مدل Centaur (یک مدل ۷۰ میلیارد پارامتری با وزن‌های باز (Open Weights)) بیشترین شباهت را به فرآیندهای انسانی نشان داد.

Process vs Performance

Model Results

بر اساس مستندات این پژوهش، موفقیت Centaur احتمالاً نتیجه‌ی تنظیم دقیق (Fine-tuning) روی بیش از ۱۰ میلیون انتخاب انسانی در ۱۶۰ آزمایش شناختی است. این کشف، فرضیات میدان را تغییر می‌دهد و نشان می‌دهد که با قدرتمندتر شدن مدل‌ها، آن‌ها لزوماً شبیه‌ساز بهتری برای شناخت انسانی نمی‌شوند. برای جامعه‌ی فنی، این بدان معناست که تحلیل سطح فرآیند — یعنی ردیابی الگوهای متوالی کلیک و رفتارهای خطا — سیگنال بسیار مقاوم‌تری برای احراز هویت نسبت به تکمیل ساده‌ی یک تکلیف است. این رویکرد در تحلیل لایه‌های زیرین مدل برای دستیابی به امنیت بیشتر، مشابه بررسی معماری‌های پنهانی است که مدل‌های بینایی را در برابر حملات مصون می‌کند و تاب‌آوری آن‌ها را افزایش می‌دهد.

Model Performance

با این حال، پژوهشگران هشدار می‌دهند که این شکاف می‌تواند از طریق تنظیم دقیق سطح فرآیند (P-SFT) بسته شود، مشروط بر اینکه عامل به تابع هدف تفکیک‌کننده دسترسی کامل داشته باشد. بنابراین، تست تورینگ فرآیندی تنها زمانی مقاوم است که هوش مصنوعی دقیقاً نداند چگونه ارزیابی می‌شود.

گام بعدی شما

  • تحلیل الگوهای متوالی کلیک و رفتارهای خطا را به جای بررسی صرفِ خروجی، در سیستم‌های احراز هویت بگنجانید.
  • بر روی متدهای P-SFT یا تنظیم دقیق سطح فرآیند نظارت کنید تا متوجه شوید چگونه مدل‌ها مسیرهای استدلالی خود را تغییر می‌دهند.
  • بررسی کنید که آیا مدل‌های کوچک‌تر برای کاربردهای حساس به امنیت، جایگزین‌های قابل‌اعتمادتری هستند یا خیر.

اما این تنها بخشی از معمای احراز هویت است؛ برای درک چالش‌های امنیتی در عصر مدل‌های چندوجهی، تحلیل ما درباره‌ی جعل عمیق را بخوانید.

چرا این موضوع مهم است؟

این یافته‌ها مبنای امنیتی سیستم‌های احراز هویت را تغییر می‌دهد؛ چرا که اثبات «توانایی حل مسئله» دیگر معیار کافی برای تشخیص انسان از ماشین نیست. تخصص پژوهشگران در تحلیل الگوهای کلیک و خطاهای متوالی، تنها راه باقی‌مانده برای ایجاد سدهای دفاعی در برابر عامل‌های هوش مصنوعی است.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.