پرش به محتوای اصلی
پرش به محتوای مقاله

۸۰٪ حوادث عملیاتی نرم‌افزار ریشه در کدهای تولیدشده توسط هوش مصنوعی دارد

·۳ شهریور ۱۴۰۵۸ دقیقه مطالعه۱ بازدید
پرنس کوهلی، رئیس و مدیرعامل ساس لبز - مجموعه مصاحبه
پرنس کوهلی، رئیس و مدیرعامل ساس لبز - مجموعه مصاحبه
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ارائه عدد دقیق ۸۰٪ برای ارتباط حوادث عملیاتی با کدهای هوش مصنوعی؛ این اولین بار است که شکاف بین سرعت تولید کد و سرعت تست به‌صورت کمی و در مقیاس سازمانی افشا می‌شود.

اگر امروز بخشی از کدهای محصولتان را به هوش مصنوعی سپرده‌اید، احتمالاً با بمبی ساعتی در محیط عملیاتی رو‌به‌رو هستید. طبق اعلام پرینس کولی (Prince Kohli)، رئیس و مدیرعامل Sauce Labs، ۸۰٪ سازمان‌ها حوادث عملیاتی، قطعی‌های سیستم یا نقص‌های اثرگذار بر مشتری را مستقیماً به کدهای تولیدشده توسط هوش مصنوعی نسبت داده‌اند. این رقم تکان‌دهنده، نشان‌دهنده یک شکاف خطرناک بین سرعت کدنویسی با هوش مصنوعی و توانایی اعتبارسنجی آن است.

توسعه نرم‌افزار وارد فاز متلاطمی شده است. در حالی که ابزارهای هوش مصنوعی به برنامه‌نویسان اجازه می‌دهند با سرعتی بی‌سابقه کد بنویسند، چارچوب‌های نظارتی و تست برای اعتبارسنجی این کدها هنوز در عصر پیش از هوش مصنوعی مانده‌اند. این عدم توازن باعث ایجاد یک ریسک سیستماتیک شده است؛ جایی که باگ‌ها سریع‌تر از هر زمان دیگری به محیط عملیاتی (Production) تزریق می‌شوند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، سرعت در تولید بدون لایه‌ی نظارتی، تنها نرخ شکست را افزایش می‌دهد. این موضوع دقیقاً همان چیزی است که کولی آن را «مشکل اجرای تریلیون دلاری» می‌نامد. منطق او ساده است: صنعت هوش مصنوعی بر اساس وعده‌ی بهره‌وری، بیش از یک تریلیون دلار سرمایه خصوصی جذب کرده است، اما این بهره‌وری تنها زمانی ارزش دارد که کد خروجی امن و پایدار باشد. بدون مدرن‌سازی فرآیندهای تضمین کیفیت، هوش مصنوعی صرفاً سرعت شکست‌ها را شتاب می‌بخشد.

پیشینه مدیریتی و دیدگاه استراتژیک

پرینس کولی در فوریه ۲۰۲۵ به Sauce Labs پیوست. او سابقه‌ای طولانی در رهبری سازمان‌های مهندسی عظیم دارد و تخصصش حوزه‌هایی چون هوش مصنوعی، نرم‌افزارهای سازمانی، رایانش ابری، اتوماسیون، شبکه‌سازی و امنیت سایبری را در بر می‌گیرد.

او پیش از این بیش از ۶ سال به عنوان مدیر فناوری (CTO) در Automation Anywhere فعالیت می‌کرد و در آنجا اتوماسیون مبتنی بر هوش مصنوعی را برای سازمان‌های بزرگ پیش برد. تجربه رهبری او همچنین شامل پست معاون ارشد مهندسی در ThoughtSpot و نقش‌های ارشد در Ericsson است؛ جایی که او نظارت بر سازمان‌های تحقیق و توسعه (R&D) جهانی با بیش از ۱۰,۰۰۰ مهندس را بر عهده داشت.

علاوه بر این، کولی نزدیک به یک دهه در Citrix را به رهبری ابتکارات پلتفرم، شبکه‌سازی ابری، مهندسی و عملیات گذراند. او در ابتدای مسیر شغلی خود، شرکت امنیت اپلیکیشن Teros را هم‌بنیان‌گذاری کرد و به عنوان لید فنی در SGI فعالیت داشت.

دیدگاه کولی از مشاهده این حقیقت شکل گرفته است که یک نقص نرم‌افزاری با چه سرعتی می‌تواند در زیرساخت‌های جهانی پخش شود. او در اریکسون و سیتریکس شاهد اثرات گسترده این شکست‌ها بر امنیت، عملیات مشتریان، اعتماد و درآمدهای شرکت بود. دوران حضورش در Automation Anywhere این موضوع را روشن‌تر کرد که تست نرم‌افزار باید برای همگامی با سرعت هوش مصنوعی زاینده (Generative AI) — شبیه به تبدیل کردن یک بازرسی دستی و کند به یک خط تولید اتوماتیک و سریع — از اساس بازسازی شود.

شکاف اعتبارسنجی: سرعت در برابر دقت

بر اساس پژوهش‌های Sauce Labs، عدم توازن در چرخه حیات توسعه نرم‌افزار به شدت تکان‌دهنده است:

  • برنامه‌نویسان به لطف ابزارهای هوش مصنوعی، ۷۴۱٪ بیشتر کد تولید می‌کنند.
  • سرعت انتشار (Release Velocity) کمتر از ۲۰٪ افزایش یافته است.

این گلوگاه دقیقاً پس از مرحله کدنویسی رخ می‌دهد. اعتبارسنجی یک مسیر کاربر (User Journey) اغلب پیچیده‌تر از نوشتن خودِ کد است. این فرآیند نیازمند بررسی مسیرهای سرتاسری (End-to-End) است که توابع و اشیاء کد را در بر می‌گیرد؛ جایی که یک تغییر معنایی کوچک در یک نقطه، می‌تواند باعث شکست گسترده در نقاط پایین‌دست شود.

به‌طور سنتی، نوشتن این تست‌ها نیازمند تلاش دستی عظیمی بود تا هدف برنامه به‌درستی ثبت شود. این فرآیند در تاریخچه توسعه، تقریباً غیرممکن بود که به‌طور کامل و دقیق انجام شود. حتی وقتی تست‌ها شکست می‌خورند، مهندسان باید به‌صورت دستی تشخیص دهند که آیا محصول خراب شده یا صرفاً اسکریپت تست قدیمی شده است. این بررسی دستی که به شدت به بافت مهندسی (Engineering Context) وابسته است، نمی‌تواند با حجم خروجی‌های هوش مصنوعی رقابت کند و مقیاس‌پذیر نیست.

هزینهٔ سرعت و ریسک‌های پذیرفته‌شده

فشار برای رعایت ضرب‌الاجل‌ها، شرکت‌ها را به مصالحه و پذیرش ریسک واداشته است. طبق گزارش این شرکت، بیش از نیمی از سازمان‌های مورد بررسی اعتراف کرده‌اند که آگاهانه نرم‌افزارهایی با نقص‌های بحرانی را منتشر کرده‌اند. همچنین ۶۶٪ شرکت‌ها گزارش داده‌اند که برای رسیدن به تاریخ انتشار، استانداردهای کیفیت یا تست را نادیده گرفته‌اند.

کولی اشاره می‌کند که سازمان‌ها این ریسک را می‌پذیرند چون اهداف انتشار با درآمد فوری، تعهدات محصول و نیازهای مشتری گره خورده است. اما هزینه‌های این نقص‌ها — از جمله حفره‌های امنیتی، بازکاری‌ها (Rework) و حوادث محیط عملیاتی — معمولاً دیرتر ظاهر می‌شوند و بین تیم‌های مختلف پخش می‌شوند، که باعث می‌شود قیمت واقعی کیفیت پایین پنهان بماند. کیفیت تنها زمانی به یک اولویت تجاری تبدیل می‌شود که مدیران این اثرات را در کنار سرعت انتشار اندازه‌گیری کنند.

معرفی AURA: پاسخ به بحران کیفیت

برای حل این مشکل، Sauce Labs — شرکتی که زیرساخت تست اپلیکیشن‌های وب و موبایل را در مرورگرها، سیستم‌عامل‌ها، محیط‌های مجازی و دستگاه‌های واقعی فراهم می‌کند — پلتفرم AURA را معرفی کرده است. این پلتفرم با تکیه بر داده‌های حاصل از ۸.۷ میلیارد اجرای تست و ۳۰۰,۰۰۰ کاربر سازمانی در طول نزدیک به دو دهه، فراتر از اتوماسیون ساده عمل می‌کند و با جریان‌های کاری CI/CD (یکپارچه‌سازی و تحویل مداوم) ادغام می‌شود. این رویکرد با دیدگاه‌های مدرن در مدیریت سازمان‌های سازمانی همسو است که اولویت را به جریان‌های کاری جامع ترجیح می‌دهند تا ابزارهای تک‌منظوره.

برخلاف ابزارهای ابتدایی هوش مصنوعی که فقط یک اسکریپت می‌سازند یا یک لوکیتور خراب را اصلاح می‌کنند، AURA به عنوان یک سیستم حلقه-بسته (Closed-loop) عمل می‌کند و از عامل‌های هوش مصنوعی (AI Agents) برای تولید، اجرا و تحلیل تست‌ها استفاده می‌کند، در حالی که نظارت انسانی را در تمام مسیر حفظ می‌کند.

سازوکار AURA به شرح زیر است:

  • درک هدف (Intent Understanding): تست‌ها بر اساس «هدف تجاری» تعریف می‌شوند. این تعریف از الزامات محصول، معیارهای پذیرش، قوانین تجاری، مسیرهای کاربر و رفتارهای واقعی مشتری استخراج می‌شود. رهبران محصول نتیجه را تعریف می‌کنند و تیم‌های مهندسی آن را به رفتارهای قابل اعتبارسنجی تبدیل می‌کنند.
  • اجرای خودگردان (Autonomous Execution): تست‌ها را می‌نویسد و اجرا می‌کند و از یک ابرِ اجرای تست داخلی استفاده می‌کند تا کل این فرآیند از دوش برنامه‌نویسان و تیم‌های مهندسی کیفیت (QE) برداشته شود.
  • پایداری معنایی (Semantic Stability): تست‌های تولیدشده با تغییرات ظاهری در مرورگرها، دستگاه‌ها یا اپلیکیشن‌ها که بر معنای واقعی نرم‌افزار اثر نمی‌گذارد، نمی‌شکنند و نیازی به اصلاح ندارند.
  • حلقه بازخورد (Feedback Loop): شکست‌ها را تحلیل کرده و رفتار محیط عملیاتی را به چرخه توسعه بازمی‌گرداند تا نسخه‌های آینده بهبود یابند.

در مواردی که الزامات مبهم، ناقص یا قابل تفسیر باشند، AURA به‌جای حدس زدن نتیجه مورد انتظار، عدم قطعیت را آشکار کرده و تایید انسانی درخواست می‌کند.

نتایج ملموس و تغییر نقش‌ها

به نقل از Sauce Labs، سازمان‌هایی که AURA را مستقر کرده‌اند به نتایج زیر رسیده‌اند که به گفته شرکت، به‌طور مستقل اعتبارسنجی شده‌اند:

  • کاهش ۹۰ درصدی حوادث در محیط عملیاتی.
  • ۴۷٪ سرعت بیشتر در چرخه‌های انتشار.
  • بازپس‌گیری ۳۸٪ از ظرفیت مهندسی.

مشتریان بزرگی مانند Walmart و Keller Williams نیز دستاوردهای مشابهی در پوشش تست، دفعات انتشار و زمان چرخه (Cycle Time) گزارش کرده‌اند.

بسیاری از شرکت‌ها سعی می‌کنند این شکاف را با استخدام تسترهای بیشتر پر کنند. اما طبق داده‌های کولی، ۶۴٪ سازمان‌ها با وجود افزایش تعداد نیروی QA، همچنان شاهد افزایش حوادث بوده‌اند. او استدلال می‌کند که افزودن نیروی انسانی تنها هزینه‌های هماهنگی و انتقال تسک‌ها (Handoffs) را بالا می‌برد و نمی‌تواند با حجم کد تولیدی هوش مصنوعی رقابت کند. در واقع، جایگزینی سیستم‌های سنتی با عامل‌های هوشمند می‌تواند بهره‌وری عملیاتی را در مقیاس سازمانی تغییر دهد.

با خودکار شدن تست‌ها، نقش‌ها تغییر می‌کنند:

  • برنامه‌نویسان: باید هدف تجاری را با دقت بیشتری تعریف کنند.
  • مهندسان کیفیت: به سمت مدیریت ریسک، پوشش تست و حاکمیت (Governance) تغییر مسیر می‌دهند.
  • تیم‌های SRE: بر بازگرداندن رفتار عملیاتی به فرآیند انتشار تمرکز می‌کنند.

عامل‌های هوش مصنوعی مسئولیت اجرا و تحلیل‌های تکراری را که در این مدل توسعه جدید مورد نیاز است، بر عهده می‌گیرند.

حاکمیت انسانی در چرخه خودکار

با وجود استقلال عامل‌ها، کولی تاکید می‌کند که تصمیم نهایی انتشار باید در دست انسان باشد. بررسی انسانی در مواردی که قضاوت درباره اثر بر مشتری یا ریسک تجاری لازم است، اجباری است.

محرک‌های خاصی که باید به‌طور خودکار انتشار را متوقف کرده یا بررسی انسانی را فعال کنند عبارتند از:

  • نتایج تست‌های غیرقابل توضیح، متناقض یا غیرقابل تکرار.
  • آسیب‌پذیری‌های امنیتی احتمالی یا اجزای شخص ثالث تاییدنشده.
  • شکست‌هایی که داده‌های حساس، درآمدها یا عملیات‌های حیاتی (Mission-critical) را تحت تاثیر قرار می‌دهند.
  • موقعیت‌هایی که کد یا نتایج تست به‌طور کامل قابل توضیح نباشند.

او به خطر تست‌های «لرزان» (Flaky Tests) اشاره می‌کند؛ تست‌هایی که بدون الگوی مشخص، گاهی پاس می‌شوند و گاهی نه. در حالی که تیم‌ها اغلب این تست‌ها را نادیده می‌گیرند، AURA به برخی مشتریان کمک کرد تا این الگوها را به نقص‌های زمانی (Timing-based) بسیار حساس و پرهزینه مرتبط کنند که در صورت انتشار، فاجعه‌بار می‌بودند.

مسئولیت‌پذیری سیستماتیک

کولی با تکیه بر تجربه‌اش در گروه حاکمیت اخلاقی هوش مصنوعی و گروه کاری سیستم‌ها و فناوری‌های ایمن در مجمع جهانی اقتصاد، خواستار لایه‌ی اعتبارسنجی قوی‌تری است. او پیشنهاد می‌کند حاکمیت نباید با «سرعت تولید کد» سنجیده شود، بلکه معیار باید «پیش‌بینی‌پذیری» آنچه به دست کاربر می‌رسد باشد.

سازمان‌ها به لایه‌ای از حاکمیت نیاز دارند که مرزهای تصمیم‌گیری خودکار عامل‌ها را به‌طور دقیق مشخص کند. این امر مستلزم ردیابی کامل (Traceability) این است که عامل چه چیزی را تغییر داده، چرا تغییر داده و چه شواهدی برای تصمیم انتشار وجود دارد.

یک معیار کلیدی برای موفقیت، ردیابی این موضوع است که کدهای تولیدشده توسط هوش مصنوعی، تا چه میزان در ۹۰ روز اول پس از انتشار باعث حادثه می‌شوند. این رویکرد، تمرکز را از بهره‌وری خام به پایداری بلندمدت و مسئولیت‌پذیری تغییر می‌دهد.

گام بعدی شما

  • اگر از Copilot یا Cursor استفاده می‌کنید، نرخ شکست تست‌های خود را در ۹۰ روز اول پس از انتشار ردیابی کنید تا اثر واقعی هوش مصنوعی بر کیفیت کد را بسنجید.
  • تعریف «هدف تجاری» (Business Intent) را جایگزین نوشتن تست‌های خط‌به‌خط کنید تا تست‌ها با تغییرات ظاهری رابط کاربری نشکنند.
  • برای هر قطعه کد تولیدشده توسط هوش مصنوعی، یک لایه بررسی انسانی برای ریسک‌های امنیتی و داده‌های حساس تعریف کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این گزارش با تکیه بر تجربه عملی در مقیاس سازمانی، هشدار می‌دهد که بهره‌وری کاذب در کدنویسی می‌تواند منجر به خسارات تریلیون دلاری شود. اعتبار این ادعا از داده‌های ۸.۷ میلیارد اجرای تست در Sauce Labs نشأت می‌گیرد.

تأثیر برای ایران

برای تیم‌های توسعه در ایران که به دلیل کمبود نیروی متخصص به ابزارهای AI متکی شده‌اند، این هشدار حیاتی است. تمرکز بر ابزارهای تست خودکار به‌جای افزایش تعداد برنامه‌نویس، تنها راه جلوگیری از سقوط سیستم‌ها در مقیاس است.

·نگاه ما
تحریریه دات‌هوش

بحران فعلی نشان می‌دهد که ما در حال جابه‌جایی گلوگاه از «تولید» به «اعتبارسنجی» هستیم. وقتی هزینه تولید کد به نزدیک صفر می‌رسد، ارزش واقعی نه در نوشتن، بلکه در تضمین صحت (Correctness) است. این تغییر پارادایم باعث می‌شود نقش مهندس QA از یک «تستر» به یک «معمار ریسک» تبدیل شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.