پرش به محتوای اصلی
پرش به محتوای مقاله

مطالعه ورک‌دی: ۴۰٪ از زمانِ ذخیره‌شده توسط هوش مصنوعی صرف بازبینی می‌شود

·۲۲ مرداد ۱۴۰۵۷ دقیقه مطالعه
هوش مصنوعی در ده ثانیه نوشت؛ بررسی آن یک ساعت طول کشید.
هوش مصنوعی در ده ثانیه نوشت؛ بررسی آن یک ساعت طول کشید.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی مفهوم «ورک‌اسلاپ» (Workslop) و اثبات آماری این موضوع که تقریباً نیمی از زمان ذخیره‌شده توسط AI، به‌دلیل ماهیت «صیقل‌خورده اما غلط» خروجی‌ها، در مرحله بازبینی تلف می‌شود.

تصور کنید متنی که پیش‌تر نوشتن آن ۴۰ دقیقه زمان می‌برد، حالا در ۱۰ ثانیه آماده است، اما شما باید ساعت‌ها وقت بگذارید تا مطمئن شوید هیچ خطای فاحشی در آن نیست. این است پارادوکس بهره‌وری در عصر جدید؛ جایی که سرعت تولید، کیفیتِ تایید را به شدت کاهش داده است.

طبق مطالعه‌ای که در ژانویه ۲۰۲۶ توسط شرکت ورک‌دی (Workday) منتشر شد، نزدیک به ۴۰٪ از زمان ذخیره‌شده توسط هوش مصنوعی، صرف بازبینی و اصلاح مجدد (Rework) می‌شود. این زمان شامل تصحیح خطاها، بازنویسی محتوا و تایید خروجی‌هاست. در واقع، زمان لازم برای اطمینان از صحت یک پیش‌نویس، نه تنها کم نشده، بلکه در بسیاری از موارد افزایش یافته است.

این وضعیت درست زمانی رخ می‌دهد که سازمان‌ها از مرحله‌ی «ماه عسل» با هوش مصنوعی زاینده (Generative AI) — که شبیه به دستیاری است که با سرعت برق‌آسا هر چه بخواهید می‌نویسد اما گاهی با اطمینان کامل دروغ می‌گوید — عبور کرده‌اند. همان‌طور که در تحلیل قبلی ما درباره‌ی اهمیت سلیقه‌ی انسانی در عصر مدل‌های زبانی اشاره کردیم، تمرکز اکنون از «توانایی تولید» به «توانایی حسابرسی» تغییر یافته است. برای بسیاری از کسب‌وکارها، مرحله‌ی ساخت ارزان شده، اما مرحله‌ی بررسی به یک گلوگاه گران‌قیمت و دستی تبدیل شده است.

ظهور «زباله‌های اداری» یا Workslop

پژوهشگران بترآپ لبز (BetterUp Labs) و آزمایشگاه رسانه‌های اجتماعی استنفورد (Stanford) پدیده‌ای را شناسایی کرده‌اند که آن را «ورک‌اسلاپ» (Workslop) می‌نامند. در نظرسنجی سپتامبر ۲۰۲۵ از کارکنان تمام‌وقت اداری در ایالات متحده، ۴۰٪ گزارش دادند که در ماه گذشته خروجی‌هایی از هوش مصنوعی دریافت کرده‌اند که ظاهر بسیار حرفه‌ای و نهایی داشت، اما در واقع فاقد هرگونه محتوای substantive یا کاربردی بود.

مرتب کردن و اصلاح این موارد یک راهکار سریع و ساده نیست. به گزارش مجله هاروارد بیزنس ریویو (Harvard Business Review)، رفع یک مورد از این «زباله‌های اداری» به‌طور متوسط ۲ ساعت زمان می‌برد. این موضوع نشان می‌دهد ساعتی که در مرحله تولید ذخیره شده، صرفاً به میز شخص دیگری — یعنی بازبین — منتقل شده است. در واقع، هر ساعتی که هوش مصنوعی در مرحله ساخت ذخیره می‌کند، روی دوش کسی در مرحله بررسی می‌افتد. این همان ساعت کاری است؛ فقط میزش تغییر کرده است.

هوش مصنوعی در ده ثانیه نوشت. بررسی آن یک ساعت طول کشید.

خطر صیقل‌خوردگی یکنواخت

مشکل اصلی این است که خروجی‌های هوش مصنوعی به‌طور یکنواخت «مطمئن» به نظر می‌رسند. وقتی یک همکار انسانی گزارشی می‌نویسد، شما نقاط قوت و ضعف او را می‌شناسید. مثلاً می‌دانید یک همکار در تحلیل اعداد عالی است اما در زمان‌بندی مبهم عمل می‌کند؛ بنابراین می‌توانید در یک بخش سخت‌گیرانه بخوانید و از بقیه بخش‌ها سریع عبور کنید. این میان‌بر است که بازبینی را برای انسان قابل تحمل می‌کند.

اما هوش مصنوعی این میان‌بر را حذف می‌کند، چون جمله‌ی غلط دقیقاً شبیه جمله‌ی درست است. خروجی‌ها به‌طور یکنواخت صیقل‌خورده‌اند و خطاها به‌جای اینکه در نقاط خاصی (جایی که یک انسان خسته دچار اشتباه می‌شود) متمرکز باشند، به‌طور равномер در کل متن پخش شده‌اند.

به عنوان مثال، گزارشی را در نظر بگیرید که برای شرکت نی‌وی بیز سلوشنز (NuWay Biz Solutions) تولید شد. این گزارش دارای جداول تمیز، خلاصه‌ای مرتب در ابتدا و اعدادی بود که تا دو رقم اعشار محاسبه شده بودند. اما گزارش اساساً غلط بود. مدل داده‌ها را از وب‌سایتی قدیمی استخراج کرده بود که سال‌ها پیش در همان دامنه فعال بود و به‌طور بی‌صدا داده‌ها را به همان حساب تحلیلی می‌فرستاد. از میان ۱۱۰۶ نشست گزارش‌شده، ۹۶۳ مورد مربوط به سایت قدیمی بود، نه سایت فعلی.

در این گزارش هیچ‌چیز «نامرتب» نبود؛ هر عدد به‌درستی استخراج و جمع شده بود. مشکل این بود که گزارش داشت وب‌سایت اشتباهی را توصیف می‌کرد. سه بار بازبینی لازم بود تا این خطا کشف شود. در بار دوم، نسخه اصلاح‌شده دوباره همان اشتباه را در جای دیگری تکرار کرد و این مورد تنها به این دلیل پیدا شد که کسی به‌طور خاص به دنبال آن گشت.

هزینه‌ی تایید و اعتبارسنجی

اعتبارسنجی زمانی شکست می‌خورد که هیچ «خط قرمز» یا مرجعی برای اندازه‌گیری وجود نداشته باشد. اکثر کسب‌وکارها نه تعریف مکتوبی از اینکه «پاسخ درست» چه شکلی است دارند و نه منبعی قابل اعتماد برای تطبیق خروجی با آن. در نتیجه، بررسی تبدیل می‌شود به خواندن متن برای اینکه ببینیم «آیا درست به نظر می‌رسد یا نه»؛ که در واقع همان غلط‌گیری است، اما با اضطرابی بیشتر.

تحقیقات ورک‌دی شکاف عمیقی را در نرخ موفقیت نشان می‌دهد:

  • تنها ۱۴٪ از کارکنان به‌طور مستمر نتیجه‌ای مثبت و شفاف از هوش مصنوعی می‌گیرند.
  • در شرکت‌های بزرگ (با درآمد سالانه بیش از ۱۰۰ میلیون دلار)، هزینه‌ی بازبینی اغلب توسط «لایه های اضافی سازمان» (Organizational Slack) جذب می‌شود. بعدازظهر یک نفر صرف اصلاح خطا می‌شود و این هرگز به عنوان یک هزینه مجزا در دفاتر ثبت نمی‌شود.
  • در کسب‌وکارهای کوچک، مانند یک تیم شش نفره، بار بررسی معمولاً بر دوش مالک می‌افتد که شب‌ها و در کنار تمام کارهای دیگر، خروجی‌ها را چک می‌کند.

این وضعیت، «همزاد عملیاتی» همان مشکلی است که تیم‌های خلاق هنگام تولید محتوای بی‌کیفیت (Slop) با آن روبرو هستند. در حالی که اسلاپِ خلاق مربوط به کاری است که شما می‌سازید، این مشکل مربوط به کارهایی است که از طرف دیگران به اینباکس شما می‌رسد.

سه قانون برای بازبینی سریع‌تر

برای اینکه هوش مصنوعی به «نسخه‌ی کندترِ شغل شما» تبدیل نشود، نی‌وی بیز سلوشنز سه قانون عملیاتی پیشنهاد می‌کند تا مطمئن شوید صورت‌حساب زمانی را به کسی که در پایین‌دست شماست پاس نمی‌دهید:

  • ابتدا «درست» را تعریف کنید: قبل از تولید خروجی، در یک جمله بنویسید که خروجی دقیقاً چه چیزی را پوشش دهد و نسخه درست باید شامل چه باشد. برای گزارش ترافیک، این جمله می‌توانست این باشد: «این گزارش ترافیک سایت فعلی را از روزی که ردیابی نصب شده پوشش می‌دهد و هیچ داده‌ای قبل از آن را شامل نمی‌شود.» این کار ۳۰ ثانیه زمان می‌برد اما ساعت‌ها حدس زدنِ قصد مدل را حذف می‌کند.
  • تایید بر اساس اعداد، نه احساسات: از یک عدد شناخته‌شده و قابل اعتماد از ماه قبل برای تایید خلاصه استفاده کنید. اگر تایید یک خلاصه نیاز به بازسازی آن از چهار فایل خروجی (Export) مختلف دارد، هر بررسی تبدیل به یک پروژه کوچک می‌شود که در واقعیت هیچ‌کس آن را انجام نخواهد داد.
  • محدود کردن دامنه: هوش مصنوعی را فقط برای کارهایی به کار ببرید که سریع به‌صورت دستی قابل تایید هستند. اگر بررسی خروجی بیشتر از انجام دستیِ کار زمان ببرد، شما چیزی را خودکار نکرده‌اید؛ بلکه فقط یک نسخه کندتر از شغل را خریده‌اید و مرحله‌ای را اضافه کرده‌اید که خطاها می‌توانند در آن پنهان شوند.

اندازه‌گیری بدهی هوش مصنوعی

برای درک اینکه زمان شما واقعاً کجا می‌رود، یکی از خروجی‌های دو هفته اخیر تیمتان را انتخاب کنید و از بازبین دو سوال بپرسید: «چقدر زمان برد؟» و «از کجا فهمیدی درست است؟»

اگر پاسخ «خوب به نظر می‌رسید» یا «یک بار خواندمش» بود، شما در حال «خواندن» هستید، نه «بررسی». خواندن، غلط‌های املایی را می‌گیرد، اما از کنار عددی که ماه اشتباهی را توصیف می‌کند، به‌سادگی عبور می‌کند.

اگر دو یا چند مورد از نشانه‌های زیر را دارید، یعنی زمان شما در مرحله بازبینی تلف می‌شود:

  • کسی در تیم هست که مرتباً کارهای AI را دریافت می‌کند و باید آن‌ها را به‌طور اساسی بازنویسی کند.
  • هیچ‌کس قبل از تولید، محتوای مورد نیاز را مکتوب نمی‌کند.
  • تایید یک عدد نیاز به بازسازی آن از فایل‌های خروجی دارد.
  • مالک کسب‌وکار، بازبینی‌ها را شب‌ها انجام می‌دهد.
  • محتوای AI بدون بررسی واقعی به دست مشتری یا تصمیم‌گیرنده رسیده است.

کسب‌وکارهایی که این موضوع را به‌خوبی مدیریت می‌کنند، می‌توانند بدون مکث به سوال «چطور بفهمیم این درست است؟» پاسخ دهند، زیرا قبل از به‌کارگیری نرم‌افزار، مشخص کرده‌اند به چه چیزی اعتماد دارند.

حتی خودِ این پژوهش‌ها نیز نوسانی هستند. در مطالعه بترآپ، صفحه اصلی ادعا می‌کند ۱۱۵۰ نفر شرکت کرده‌اند و هر مورد ۲ ساعت زمان می‌برد، اما وبلاگ همان شرکت، عدد ۱۰۰۴ نفر و زمان ۱ ساعت و ۵۱ دقیقه را ذکر کرده است. یک شرکت، یک پژوهش، اما دو پاسخ متفاوت. همین تضاد نشان می‌دهد که داده‌های متصل، تمیز و قابل اعتماد، تنها راه ارزان کردنِ بازبینی هوش مصنوعی است.

گام بعدی شما

  • برای هر تسک AI، یک «معیار پذیرش» (Acceptance Criteria) یک‌خطی بنویسید تا بازبین بداند دقیقاً دنبال چه چیزی بگردد.
  • فرآیند بازبینی را از «خواندن برای تایید» به «تطبیق با داده‌های مرجع» تغییر دهید.
  • کارهایی که زمان بازبینی آن‌ها از زمان اجرای دستی بیشتر است را از چرخه AI خارج کنید.

اما داستان سخت‌افزاری این تحول و نحوه کاهش هزینه‌های استنتاج حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این یافته‌ها نشان می‌دهد که بهره‌وری واقعی AI در گروی ایجاد زیرساخت‌های تایید (Verification) است، نه صرفاً ابزارهای تولید. بر اساس تجربه استقرار در سازمان‌ها، بدون تعریف دقیق داده‌های مرجع، AI منجر به افزایش «بدهی فنی» در مستندات شرکت‌ها می‌شود.

تأثیر برای ایران

برای تیم‌های محتوایی و برنامه‌نویسان ایرانی که به‌شدت بر ابزارهای AI متکی شده‌اند، این هشدار است که اتکای کورکورانه به خروجی‌ها بدون داشتن داده‌های مرجع فارسی، منجر به تولید محتوای بی‌کیفیت در مقیاس بالا می‌شود.

·نگاه ما
تحریریه دات‌هوش

بیشترین ریسک فعلی برای سازمان‌ها، «توهمِ بهره‌وری» است؛ جایی که سرعت تولید خروجی با کاهش هزینه عملیاتی اشتباه گرفته می‌شود. در واقع، ما شاهد انتقال هزینه از مرحله تولید به مرحله نظارت هستیم، در حالی که هزینه نظارت به‌دلیل ماهیت صیقل‌خورده‌ی خطاها در مدل‌های زبانی، صعودی است. راهکار بلندمدت، جایگزینی بازبینی انسانی با سیستم‌های خودکارِ اعتبارسنجی (Automated Verification) است، وگرنه هوش مصنوعی صرفاً یک لایه اداری جدید و خسته‌کننده ایجاد می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.