پرش به محتوای اصلی
پرش به محتوای مقاله

پژوهش برکلی: نرخ موفقیت عامل‌های هوش مصنوعی در وظایف تخصصی زیر ۲۵٪ است

·۴ شهریور ۱۴۰۵۴ دقیقه مطالعه
هوش مصنوعی هنوز برای کار واقعی آماده نیست: چرا مدل‌ها در وظایف پیچیده مردود می‌شوند
هوش مصنوعی هنوز برای کار واقعی آماده نیست: چرا مدل‌ها در وظایف پیچیده مردود می‌شوند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تأیید آماری شکست کامل مدل‌های پیشرو در وظایف سطح ارشد (امتیاز صفر) و شناسایی «اثر هم‌سطح‌سازی» که در آن هوش مصنوعی کیفیت کارهای عالی را به سطح متوسط می‌کشاند.

تصور کنید یک وکیل ارشد یا تحلیل‌گر مالی خبره را جایگزین کنید؛ اما متوجه شوید خروجی مدل، حتی در ساده‌ترین استدلال‌های تخصصی هم لنگ می‌زند. این واقعیت تلخی است که اکنون داده‌های آماری پیش روی ما قرار داده‌اند.

طبق گزارش دانشگاه کالیفرنیا، برکلی (UC Berkeley)، عامل‌های هوش مصنوعی (AI Agents) در سخت‌ترین آزمون‌های تخصص حرفه‌ای شکست خورده‌اند. پژوهشگران این مدل‌ها را در ۵۵ صنعت مختلف، از جمله حقوق، مالی و بهداشت و درمان مورد آزمایش قرار دادند و دریافتند که عملکرد کلی آن‌ها زیر ۲۵ درصد باقی مانده است. این محدودیت‌ها با یافته‌های اخیر همسو است؛ چنان‌که پژوهشی از دانشگاه پرینستون نشان داد عامل‌های هوش مصنوعی فاقد خلاقیت لازم برای خودبهبودی هستند و همین امر مانع از عبور آن‌ها از سد وظایف پیچیده می‌شود.

شکاف توانمندی زمانی مطلق می‌شود که سخت‌ترین وظایف هر حوزه — همان کارهایی که یک متخصص ارشد را از یک تازه‌کار متمایز می‌کند — جداسازی شوند. در این سناریوهای با پیچیدگی بالا، تک‌تک مدل‌های مورد آزمایش امتیاز صفر کسب کردند. این یافته نشان می‌دهد روایت‌های رایج درباره جایگزینی قضاوت‌های سطح بالای انسانی توسط هوش مصنوعی، بیشتر یک افسانه شرکتی است تا واقعیت فنی.

این شکست در حالی رخ می‌دهد که سرمایه‌گذاران، متخصصان یقه سفید را تحت فشار می‌گذارند تا تحلیل‌های پیچیده و تصمیمات حساس را به مدل‌ها بسپارند. وعده صنعت این است که هوش مصنوعی سال‌ها تجربه کاری را جذب کرده و انسان را برای کارهای سطح بالاتر آزاد کند؛ اما داده‌ها می‌گویند مدل‌ها هنوز قادر به انجام همان کارهای سطح بالا نیستند. در واقع، سرمایه‌گذاران از متخصصان می‌خواهند سخت‌ترین مسائل خود را در ازای بازپس‌گیری وقت آزادشان، به مدل‌ها بسپارند و در مقابل، حجم بیشتری از داده‌های تخصصی خود را واگذار کنند.

این گسست به این دلیل است که سرمایه‌گذاران روی این ایده شرط بسته‌اند که مدل‌ها پیشرفته‌تر از وضعیت فعلی هستند. همان‌طور که در بحث‌های گذشته ما درباره امنیت مدل‌های بازمتن اشاره کردیم، تفاوت میان «شبیه‌سازی توانایی» و «داشتن توانایی» در محیط‌های عملیاتی بسیار حیاتی است. اکنون پرسش این نیست که آیا هوش مصنوعی می‌تواند سخت‌ترین بخش‌های یک شغل را انجام دهد یا خیر؛ داده‌های برکلی با یک «نه» قاطع به این پرسش پاسخ داده‌اند.

نگرانی جدی‌تر این است که وقتی یک متخصص جوان پیش از شکل‌گیری کامل قدرت استدلال خود، به این ابزارها تکیه می‌کند، چه اتفاقی برای قضاوت او می‌افتد؟ در همین راستا، مطالعه‌ای از دانشکده حقوق دانشگاه مینه‌سوتا (University of Minnesota Law School) اثر هوش مصنوعی بر توسعه استدلال حرفه‌ای را بررسی کرد. پژوهشگران حدود ۱۰۰ دانشجوی سال آخر حقوق را در زنجیره‌ای از وظایف دنبال کردند: ترکیب قوانین از منابع خام، پاسخ به سوالات کتاب‌بسته، تطبیق قانون با واقعیات و بازبینی نهایی اثر.

یافته‌های مینه‌سوتا رابطه ظریفی را میان هوش مصنوعی و شناخت انسانی آشکار کرد:

  • شتاب‌دهی در مرحله آغازین: دانشجویانی که از هوش مصنوعی برای ترکیب اولیه داده‌ها استفاده کردند، پیش‌نویس‌های قوی‌تری را سریع‌تر تولید کردند. نکته غافلگیرکننده این بود که این کار باعث ایجاد شکاف در درک مطلب نشد؛ این دانشجویان حتی در آزمون‌های بدون ابزار، قانون را بهتر فهمیده بودند. استدلال مستقل آن‌ها تخریب نشد، بلکه پابرجا ماند و در برخی موارد حتی بهبود یافت.
  • اثر هم‌سطح‌سازی (Flattening Effect): اما وقتی هوش مصنوعی برای بازبینی نهایی به کار رفت، پس‌رفت رخ داد. دانشجویانی که یادداشت‌های اولیه ضعیفی داشتند، پیشرفت کردند، اما کسانی که یادداشت‌های قوی نوشته بودند، شاهد افت کیفیت کار خود بودند.

وقتی کاربر بدون ساختاری مشخص با یک ابزار قدرتمند تنها می‌ماند، مهارت او رشد نمی‌کند، بلکه به سمت یک سطح متوسط هم‌گرا می‌شود. این یعنی هوش مصنوعی نیرویی خورنده نیست که استدلال را در لحظه نابود کند، بلکه اثر آن کاملاً به جایگاهش در فرآیند کار بستگی دارد. این پدیده می‌تواند منجر به تراژدی مشترکات شناختی شود، جایی که حذف مسیرهای رشد سنتی در سازمان‌های هوشمند، تخصص عمیق انسانی را به مخاطره می‌اندازد.

برای جامعه فنی، این یافته معیار موفقیت را از «جایگزینی» به «ترتیب اجرا» (Sequencing) تغییر می‌دهد. شواهد نشان می‌دهد هوش مصنوعی متعلق به فاز «کارهای تکراری و خسته‌کننده» است — یعنی کاهش اصطکاک و ترکیب اولیه داده‌ها — نه در مرکز تصمیمات حساسی که مشتری برای آن‌ها هزینه پرداخت می‌کند.

این منطق در تمام مشاغل دانشی صادق است. این موضوع بر پزشکی که باید تصمیم بگیرد آیا مدل باید پیش‌نویس یک تشخیص تفریقی (Differential Diagnosis) را بنویسد یا خیر، اثر می‌گذارد. همچنین بر تحلیل‌گری که در حال ساخت اولین مدل مالی (First-pass model) است، یا دستیاری که پیش از کار روی استدلال‌های خود، در حال ساختاردهی به یک استدلال حقوقی است، تاثیرگذار است.

آستین ورل (Austin Worrell)، مدیرعامل Dialogica و عضو کانون وکلای کالیفرنیا، استدلال می‌کند شرکت‌هایی که وعده جایگزینی کامل را می‌دهند، محصولی را می‌فروشند که وجود ندارد. ورل که یک بنیان‌گذار شش‌باره در حوزه فناوری است و پیش از این در شرکت Gunderson Dettmer در معاملات ادغام و تملک (M&A) به ارزش بیش از ۱.۲ میلیارد دلار مشاوره داده است، معتقد است آینده اعتماد حرفه‌ای در «هوش تقویت‌شده» (Amplified Intelligence) است که قضاوت انسانی را حفظ می‌کند، نه جایگزینی آن.

متخصصان باید ادغام هوش مصنوعی در کار خود را نه بر اساس میزان «تحویل دادن کار به مدل»، بلکه بر اساس «محل قرارگیری مدل در گردش کار» ارزیابی کنند. هدف باید پاکسازی شلوغی‌های روزمره باشد، در حالی که هسته استدلال تحت هدایت انسان باقی بماند.

در آینده، باید منتظر بنچمارک‌های جدیدی باشیم که به‌طور خاص وظایف «سطح ارشد» حرفه‌ای را هدف می‌دهند، نه بنچمارک‌های عمومی و کلی. تنها این معیارها خواهند بود که سنجش واقعی آمادگی هوش مصنوعی برای اقتصاد واقعی را ارائه می‌دهند.

گام بعدی شما

  • در گردش کار خود، هوش مصنوعی را فقط در مرحله «تولید پیش‌نویس اولیه» قرار دهید و هرگز اجازه ندهید بازبینی نهایی را انجام دهد.
  • برای ارزیابی ابزارهای جدید، به جای بنچمارک‌های عمومی، روی وظایفی تمرکز کنید که نیاز به قضاوت سطح ارشد (Senior-level) دارند.
  • اگر در حال آموزش هستید، ابتدا استدلال را بدون ابزار یاد بگیرید و سپس از مدل برای شتاب‌دهی به اجرا استفاده کنید.

اما داستان سخت‌افزاری این تحول و محدودیت‌های محاسباتی در استدلال‌های پیچیده حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پژوهش با تکیه بر اعتبار دانشگاه برکلی، توهم جایگزینی کامل متخصصان توسط AI را می‌شکند و نشان می‌دهد که تخصص سطح ارشد همچنان یک قلعه تسخیرناپذیر است. این موضوع باعث تغییر استراتژی شرکت‌ها از جایگزینی نیروی انسانی به سمت تقویت بهره‌وری می‌شود.

تأثیر برای ایران

برای برنامه‌نویسان و متخصصان ایرانی، این خبر تأییدی است بر اینکه یادگیری عمیق مفاهیم بنیادی (Fundamental) بیش از هر زمان دیگری اهمیت دارد تا در تله‌ی خروجی‌های متوسط مدل‌ها نیفتند.

·نگاه ما
تحریریه دات‌هوش

بزرگ‌ترین ریسک فعلی، ایجاد یک نسل از متخصصان «متوسط» است که هرگز یاد نمی‌گیرند چگونه به سطح ارشد برسند چون در مرحله بازبینی، تکیه بر مدل باعث حذف لایه‌های عمیق تفکر شده است. موفقیت در عصر عامل‌ها نه در قدرت مدل، بلکه در طراحی دقیق «ترتیب دخالت» انسان و ماشین نهفته است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.