پرش به محتوای اصلی
پرش به محتوای مقاله

شکاف اعتبارسنجی: دلیل شکست عامل‌های هوش مصنوعی در دنیای واقعی

·۱۹ شهریور ۱۴۰۵۴۱ دقیقه مطالعه۲ بازدید
تحلیل
تصویر: دست‌هایی که گوشی هوشمند را در حال مرور نگه داشته‌اند، با نمادهای فناوری در پس‌زمینه.
تصویر: دست‌هایی که گوشی هوشمند را در حال مرور نگه داشته‌اند، با نمادهای فناوری در پس‌زمینه.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

طرح مفهوم «شکاف اعتبارسنجی» (Verifiability Gap) به عنوان عامل اصلی شکست عامل‌های AI در حوزه‌های غیرنرم‌افزاری؛ تفکیک دقیق بین محیط‌های قطعی (کدنویسی) و غیرقطعی (دنیای واقعی).

تصور کنید ابزاری دارید که ادعا می‌کند تمام کارهای اداری شما را انجام می‌دهد، اما برای اینکه بفهمید آیا اشتباه کرده یا نه، باید هر خروجی را شخصاً بازبینی کنید. این دقیقاً همان نقطه‌ای است که وعده‌های بزرگ درباره‌ی عامل‌های هوش مصنوعی (AI Agents) — سیستم‌هایی که می‌توانند به‌طور مستقل هدف را به نتیجه برسانند — با واقعیت برخورد می‌کند.

به گزارش The Verge، نیلای پاتل، سردبیر این رسانه، معتقد است هایپ فعلی حول محور یک «مغز نرم‌افزاری» شکل گرفته است. در این چرخه، تصور می‌شود که جهان صرفاً یک پایگاه‌داده غول‌پیکر است که برای اتوماسیون توسط عامل‌های هوشمند آماده شده است. اما پاتل یک محدودیت حیاتی را مطرح می‌کند: او استدلال می‌کند که این چارچوب «مغز نرم‌افزاری» تنها در محیط‌هایی جواب می‌دهد که نتایج آن‌ها «تأییدپذیر» (Verifiable) باشد. برای مثال در مهندسی نرم‌افزار، یک کامپایلر می‌تواند به‌طور قطعی ثابت کند که آیا کد کار می‌کند یا خیر؛ اما در دنیای واقعی، ما چنین ابزار اندازه‌گیری دقیقی نداریم.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی توهمات مدل‌های زبانی اشاره کردیم، مشکل اصلی این است که مدل‌ها در محیط‌های غیرقطعی، مرز بین حقیقت و تخیل را گم می‌کنند. این تنش در حالی رخ می‌دهد که آزمایشگاه‌های AI بر اساس توانایی مدل‌ها در نوشتن کد، ادعای نزدیکی به هوش مصنوعی عمومی (AGI) را دارند. اما طبق گفته‌ی پاتل در یک اپیزود از پادکست Decoder در سپتامبر ۲۰۲۴، این منطق به محض ورود به حوزه‌هایی مثل کشف دارو یا تعاملات انسانی فرو می‌پاشد؛ چرا که در این زمینه‌ها، اعتبارسنجی یا بسیار گران است، یا زمان‌بر است و یا اصلاً وجود ندارد.

شکاف اعتبارسنجی

پاتل بین وظایف «قطعی» (Deterministic) و «غیرقطعی» (Non-deterministic) تمایز قائل می‌شود. در نرم‌افزار، شما می‌توانید یک تست اجرا کنید و یک پاسخ باینری (بله/خیر) دریافت کنید. اما در اکثر فعالیت‌های انسانی، فرآیند «تلفاتی» (Lossy) است؛ یعنی بخشی از قصد کاربر یا دقت داده‌ها در مسیر تبدیل به عمل گم می‌شود.

  • مهندسی نرم‌افزار: اعتبارسنجی بالا. مدل AI می‌تواند تا زمانی که کد کامپایل شود و تست‌ها را پاس کند، فرآیند را تکرار کند. به همین دلیل است که AI در دستکاری پایگاه‌داده‌ها و نوشتن نرم‌افزار بسیار موفق شده است.
  • ریاضیات: اعتبارسنجی متوسط. همان‌طور که در گفتگو با رابرت هارت، خبرنگار Verge بحث شد، شما می‌توانید مقدار عظیمی توکن (Token) — تکه‌های کوچکی از متن، شبیه برش‌های یک کیک که مدل تکه‌تکه می‌خورد — را برای حل مسائل ریاضی حل‌نشده هزینه کنید، زیرا نتیجه نهایی قابل تأیید است.
  • کشف دارو: اعتبارسنجی پایین. شما نمی‌توانید یک داروی جدید را صرفاً «کامپایل» کنید؛ بلکه باید آزمایشات فیزیکی روی انسان و حیوان انجام دهید. به قول پاتل، در این حوزه شما مجبورید «تعدادی از مردم را با داروهای جدید تزریق کنید» تا بفهمید نتیجه چیست.

شکست رابط‌های زبانی

این باور رو به رشد است که زبان طبیعی جایگزین رابط‌های کاربری (UI) سنتی خواهد شد. برخی استدلال می‌کنند که منوهای سلسله‌مراتبی «بسیار بد» هستند و هدف نهایی این است که کاربر بتواند خواسته‌های خود را با کلمات به کامپیوتر بگوید. برای مثال، جاش واندربرگ، یکی از شنوندگان پادکست، به مدیرعامل Canva اشاره کرد؛ کسی که معتقد است AI می‌تواند رابطی باشد که کاربران سال‌ها در انتظارش بودند تا به‌جای یادگیری یک UI «وحشتناک» در ابزاری مثل Photoshop، دستورات خود را با کلمات بیان کنند.

اما پاتل با این دیدگاه مخالف است و به ماهیت «تلفاتی» عامل‌های متنی و صوتی اشاره می‌کند. او با ذکر مثال ابزار Wispr Flow می‌گوید که اگرچه این ابزار برای انتقال افکار به روی کاغذ قدرتمند است، اما اغلب ایده‌ها را به روش‌هایی «کاملاً عجیب» فرمت می‌کند؛ مثلاً زمانی که کاربر صرفاً بین جملات مکث کرده است، مدل اصرار دارد که کاربر می‌خواهد افکارش را به صورت لیست‌های گلوله‌ای (Bullet points) بنویسد.

این وضعیت با یک کلیک ساده در اپلیکیشنی مثل Grubhub کاملاً متفاوت است. کلیک کردن روی یک دکمه ۱۰۰٪ دقیق است. اما صحبت با یک عامل برای انجام یک کار، لایه‌ای از عدم قطعیت (Non-determinism) را وارد می‌کند. پاتل اشاره می‌کند که ابزارهای حرفه‌ای مثل Pro Tools یا Riverside (که تیم Decoder هر هفته از آن‌ها استفاده می‌کند) شاید به‌خاطر نقص‌های خاصی مورد تنفر کاربران باشند، اما همچنان ضروری هستند چون کار را به روش‌های قطعی انجام می‌دهند. تبدیل این ابزارها به سیستم‌های غیرقطعی، متخصصان را ناکارآمدتر می‌کند.

«مغز نرم‌افزاری» در دنیای کسب‌وکار

این میل به مجازی‌سازی مطلق، اکنون به دنیای شرکت‌ها رسیده است. پاتل به تصمیم اخیر مدیرعامل Cloudflare اشاره می‌کند که پس از این باور که AI می‌تواند نقش‌های شغلی را مدیریت کند، کارکنانی را اخراج کرد.

استراتژی این مدیرعامل شامل تبدیل هر اقدام کارمند به یک ورودی در پایگاه‌داده است تا AI بتواند آن‌ها را بررسی کرده و «ستاره‌ها» را شناسایی کند. سپس مدیرعامل می‌تواند با یک کارمند جوان تماس بگیرد و بر اساس تحلیل AI به او بگوید که یک ستاره است. این اوج تفکر «مغز نرم‌افزاری» است: این باور که استعداد و ارزش انسانی را می‌توان به‌طور کامل در یک پایگاه‌داده ثبت، تحلیل و مدیریت کرد. این رویکرد در تضاد با دیدگاه‌هایی است که معتقدند برتری انسان در عصر AI به ارکانی چون زمینه، خلاقیت و ارتباطات وابسته است و نمی‌توان آن را صرفاً با داده‌های کمی جایگزین کرد.

واکنش‌های متقابل به نظارت AI

ما شاهد تغییری در واکنش عمومی به تحمیل فناوری هستیم. برخلاف دوران قانون وطن‌پرستی (Patriot Act)، جنگ عراق و افشاگری‌های اسنودن — که در آن نظارت‌ها اغلب پذیرفته می‌شدند یا نادیده گرفته می‌شدند — اکنون یک مقاومت دوحزبی علیه نظارت‌های آشکار مبتنی بر AI شکل گرفته است:

  • دوربین‌های Flock: در ایالت‌های «قرمز» (جمهوری‌خواه) و «آبی» (دموکرات) آمریکا، خشم نسبت به شبکه‌های دوربین مجهز به AI در حال افزایش است. در برخی جوامع جمهوری‌خواه، جنبش‌های فعالی برای کندن دوربین‌ها یا پوشاندن آن‌ها با کف پاشیده (Spray foam) شکل گرفته است. مدیرعامل Flock در ابتدا سعی کرد از پیام‌های «MAGA-coded» استفاده کند و منتقدان را «تروریست» بنامد، اما این استراتژی شکست خورد. رسانه 404 Media جلسات شهرستانی را مستند کرده است که در آن‌ها شهروندانی که درباره دوربین‌های Flock فریاد می‌زدند، توسط مقامات منتخب خودشان ساکت شدند.
  • مراکز داده: دولت‌های محلی به‌طور فزاینده‌ای در برابر تحمیل مراکز داده‌ی عظیم AI مقاومت می‌کنند. این موضوع به یک نقطه اشتعال سیاسی در رقابت‌های فرمانداری فلوریدا تبدیل شده است؛ جایی که دونالد ترامپ مراکز داده را «غاز طلایی» و «کارخانه‌های چاپ پول» توصیف کرده و پرسیده است: «آیا همه می‌خواهند فقیر باشند؟»
  • AI اجباری: کاربران واکنش بدی به ویژگی‌های «اجباری» AI نشان می‌دهند؛ مانند فشار مداوم برای استفاده از Gemini در Google Meet. پاتل استدلال می‌کند که این تحمیل از فیدهای الگوریتمی فراتر می‌رود، زیرا آمریکایی‌ها اساساً از اینکه به آن‌ها گفته شود چه کار کنند، بیزارند.
  • نظارت پوشیدنی: پذیرش عینک‌های Meta با عرضه اولیه Google Glass متفاوت است. اینفلوئنسرهای مشهوری مانند اولیویا دان از اینکه در فرودگاه‌ها توسط افرادی که عینک متا دارند تعقیب و فیلم‌برداری می‌شوند شکایت کرده‌اند و برخی این عینک‌ها را «عینک‌های منحرفان» نامیده‌اند. این تلاش برای ادغام سخت‌افزار در زندگی روزمره، بخشی از استراتژی گسترده‌تری است که زاکربرگ در مانیفست خود برای بازتعریف متا در عصر مدل‌های هوش مصنوعی به آن پرداخته است.

پارادوکس پلتفرم‌ها

پاتل همچنین به تضاد بین جست‌وجوی AI و وب باز می‌پردازد. در گفتگو با ساندار پیچای، مدیرعامل Google، تنش‌ها بر سر «AI Overviews» و کاهش نرخ کلیک (CTR) برای ناشرانی مانند Conde Nast همچنان پابرجاست.

در حالی که برخی ناشران، از جمله آن‌ها که زیرمجموعه PMC (شرکت رسانه‌ای پنسکه) هستند، در حال بررسی خارج کردن سایت‌های خود از فهرست گوگل (De-indexing) هستند تا جلوی «دزدی» محتوا توسط AI را بگیرند، پاتل معتقد است بسیاری از ناشران بیش از حد به ترافیک گوگل وابسته شده‌اند و مدل کسب‌وکار خود را متنوع نکرده‌اند. او اشاره می‌کند که در حالی که برخی بخش‌های وب در حال کوچک شدن هستند، بخش‌های دیگر رشد می‌کنند؛ برای مثال امی لانزی، مدیرعامل Digitas، گزارش داده است که درخواست‌ها برای صفحات فرود (Landing pages) بیش از هر زمان دیگری افزایش یافته است.

پاتل به یک وضعیت پیچیده شرکتی اشاره می‌کند: The Verge اکنون بخشی از PMX Global (زیرمجموعه PMC) است که درگیر دعاوی حقوقی فعال و پرونده‌های ضد انحصار در حوزه فناوری تبلیغاتی علیه گوگل است. با این حال، او معتقد است مکانیسم پاسخگویی برای ناشران، همین انتخاب برای متوقف کردن ایندکس شدن سایت‌هایشان توسط گوگل است.

چشم‌انداز جهانی و شبکه‌های حمایتی

در پاسخ به این سؤال که آیا بدبینی به AI فقط یک موضوع غربی است، پاتل به پذیرش سریع‌تر آن در چین اشاره می‌کند و دو فرضیه ارائه می‌دهد:

۱. کنترل اطلاعات: به دلیل کنترل شدید رسانه‌های دولتی و آزادی بیان در چین، نارضایتی‌های داخلی ممکن است برای غرب قابل مشاهده نباشد. ما فقط آنچه را که دولت چین می‌خواهد بدانیم، می‌دانیم.
۲. شبکه‌های حمایتی اجتماعی: چین ممکن است شبکه‌های حمایتی اجتماعی قوی‌تری داشته باشد که تهدید وجودی برای معیشت یا بیمه سلامت را (که AI برای کارگران آمریکایی ایجاد می‌کند) کاهش دهد. پاتل اشاره می‌کند که در آمریکا، ترس از دست دادن بیمه سلامت دلیل اصلی است که بسیاری از والدین از شروع کسب‌وکار شخصی خود اجتناب می‌کنند.

تقاضا برای کنترل (Agency)

در نهایت، بازار در حال ارسال یک سیگنال است. بازگشت دکمه‌های فیزیکی به داشبورد خودروها — پس از دوره‌ای که کنترل‌ها روی نمایشگرها مجازی شده بودند — نمونه بارزی از تقاضای مردم برای کنترل قطعی است. انسان‌ها خواهان عاملیت (Agency) و معنا هستند، و هر دو زمانی تخریب می‌شوند که AI صرفاً «کار را برای آن‌ها انجام دهد».

این تغییر نشان می‌دهد که مسیر پیروزی در «دل‌ها و ذهن‌ها»، نه از طریق عامل‌های قدرتمندتر، بلکه از طریق ارائه ارزش‌های ملموس است. حتی سم آلتمن پذیرفته است که راه جذب مردم، ارائه ارزش است؛ چیزی که پاتل آن را به عنوان اعترافی تفسیر می‌کند که ChatGPT هنوز ارزش کافی برای مصرف‌کنندگان ایجاد نکرده است تا بتواند توهمات و کلافگی‌های کاربران را جبران کند.

گام بعدی شما

  • در انتخاب ابزارهای AI، به‌جای تمرکز بر «قابلیت‌ها»، روی «قابلیت اعتبارسنجی» خروجی تمرکز کنید.
  • برای کارهای حساس، از مدل‌های استدلالی که زنجیره تفکر دارند استفاده کنید تا مسیر رسیدید به جواب را ردیابی کنید.
  • در طراحی محصول، به‌جای حذف کامل رابط‌های کاربری (UI)، از ترکیب کنترل‌های قطعی و پیشنهادات AI استفاده کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تحلیل نشان می‌دهد که پیش‌بینی‌های مربوط به جایگزینی کامل مشاغل توسط عامل‌های AI، بر پایه یک پیش‌فرض غلط (قابلیت اعتبارسنجی همگانی) بنا شده است. اعتبار این ادعا از تجربه عملی نیلای پاتل در تحلیل ترندهای تکنولوژی و بررسی شکست‌های عملی ابزارهای Agentic می‌آید.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی، این تحلیل هشدار می‌دهد که تمرکز بر ساخت عامل‌های AI در حوزه‌هایی با خروجی‌های غیرقطعی (مثل مشاوره یا مدیریت) بدون داشتن سیستم نظارت انسانی شدید، منجر به شکست محصول می‌شود.

·نگاه ما
تحریریه دات‌هوش

بحران فعلی عامل‌های هوش مصنوعی، یک مشکل فنی در معماری مدل‌ها نیست، بلکه یک تضاد فلسفی میان «احتمال» و «قطعیت» است. تا زمانی که AI نتواند در محیط‌های غیرقطعی (مانند مدیریت پروژه یا روابط انسانی) یک مکانیسم بازخورد سریع و ارزان برای اصلاح خطاها پیدا کند، هرگز از یک «دستیار» به یک «عامل مستقل» تبدیل نخواهد شد. در واقع، ما به جای مدل‌های بزرگ‌تر، به محیط‌های قابل‌سنجش‌تر نیاز داریم.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.