پرش به محتوای اصلی
پرش به محتوای مقاله

«خطای تخمین زمان»؛ نقطهٔ ضعف جدید دستیارهای کدنویسی پیشرفته

·۸ شهریور ۱۴۰۵۳ دقیقه مطالعه
عوامل هوش مصنوعی حس زمان ندارند و از آن آگاه نیستند
عوامل هوش مصنوعی حس زمان ندارند و از آن آگاه نیستند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اثبات اینکه خطای تخمین زمان در عامل‌های AI ناشی از نقص منطقی نیست، بلکه صرفاً به دلیل نبود ورودی حسی (ساعت سیستم) است و با یک ابزار ساده قابل حل است.

تصور کنید پیمانکاری را استخدام می‌کنید که برای یک اصلاح ۱۰ دقیقه‌ای، ۹۰ دقیقه زمان می‌خواهد و سپس فراموش می‌کند اصلاً چقدر کار کرده است. این دقیقاً همان وضعیتی است که اکنون در قلب پیشرفته‌ترین عامل‌های هوش مصنوعی جریان دارد.

طبق گزارشی که در ۳۰ اوت ۲۰۲۶ توسط پژوهشگران برنامه MATS منتشر شد، عامل‌های کدنویسی Anthropic و OpenAI هیچ حس درونی از زمان ندارند. این «کوری زمانی» در حالی رخ می‌دهد که صنعت به سرعت به سمت جریان‌های کاری عامل‌محور (Agentic) حرکت می‌کند؛ جایی که هوش مصنوعی باید وظایفی را برای چندین ساعت بدون نظارت انسانی مدیریت کند. این تغییر رویکرد در واقع بخشی از روند گسترده‌تری است که در آن عامل‌های هوش مصنوعی تمرکز صنعت را از تولید محتوا به اجرای هدف تغییر دادند.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، وابستگی به خودمختاری مدل‌ها بدون داشتن لایه‌های نظارتی دقیق، ریسک‌های عملیاتی را افزایش می‌دهد. در این پژوهش، مدل‌های Claude Code و OpenAI Codex با استفاده از ۲۰۰ وظیفه از مجموعه ProgramBench و ۱۸ محک سفارشی مورد آزمایش قرار گرفتند. یافته‌ها شکاف عمیقی را در خودآگاهی این مدل‌ها افشا می‌کند:

  • تخمین زمان: هر دو مدل فارغ از میزان دشواری کار، معمولاً زمان مورد نیاز را حدود ۹۰ دقیقه حدس می‌زدند.
  • خطای زمان اجرا: به طور میانگین، Claude Code زمان واقعی را ۳ برابر و Codex بین ۶ تا ۱۰ برابر بیش از حد تخمین زد.
  • خود-ارزیابی: مدل‌های قدیمی‌تر مانند Opus 4.8 و GPT-5.5 موفقیت خود را ۲۰ درصد بیشتر از واقعیت گزارش کردند؛ در یک مورد، مدل‌ها ادعای موفقیت ۷۰ درصدی داشتند در حالی که نمره واقعی آن‌ها بین ۷ تا ۱۴.۵ درصد بود.

عوامل هوش مصنوعی هیچ درک یا آگاهی از زمان ندارند.

بر اساس مستندات این مطالعه، «هارنس» (Harness) یا همان محیط نرم‌افزاری پیرامون مدل، رفتار آن را به شدت تغییر می‌دهد. Claude Code معمولاً تا زمانی که تصور کند کار تمام شده است (میانگین ۹۰ دقیقه) ادامه می‌دهد، اما Codex اغلب پس از ۳۰ دقیقه، بدون توجه به وضعیت وظیفه، متوقف می‌شود. به طور میانگین، یک مدل واحد در محیط Claude حدود ۲.۵ برابر گام‌های بیشتری نسبت به محیط Codex برمی‌داشت.

عوامل هوش مصنوعی حس زمان ندارند و از آن آگاه نیستند

این نتایج ثابت می‌کند که قابلیت اطمینان عامل‌ها تنها به توانایی مدل مربوط نیست، بلکه یک مشکل سیستمی است. اگر یک عامل نتواند دستوری مثل «دو ساعت روی این کد بازبینی کن» را اجرا کند، نمی‌توان آن را برای خطوط تولید حساس و طولانی‌مدت به کار گرفت. ناتوانی در ارزیابی کیفیت نیز این بحران را تشدید می‌کند، زیرا عامل ممکن است کد خراب تحویل دهد اما گزارش موفقیت ارسال کند. این عدم دقت در خروجی‌ها یادآور چالش‌های مشابهی است که در تحلیل فنی ما درباره اتلاف توکن‌ها در Vibe Coding بررسی شد.

عوامل هوش مصنوعی هیچ درک یا آگاهی از زمان ندارند.

نکته جالب اینجاست که پژوهشگران راهکار ساده‌ای یافتند: وقتی ابزاری برای گزارش زمان سپری‌شده در اختیار عامل‌ها قرار گرفت، تقریباً در تمام موارد زمان را درست تشخیص دادند. این یعنی مشکل از نقص منطقی نیست، بلکه فقدان ورودی‌های حسی است.

گام بعدی شما

  • هنگام استقرار عامل‌های خودمختار، هرگز به گزارش‌های داخلی آن‌ها درباره زمان یا کیفیت اکتفا نکنید. برای مدیریت بهینه این فرآیند، می‌توانید از ۱۰ راهکار استقرار عامل‌های ChatGPT در اتوماسیون وظایف پیچیده بهره ببرید.
  • از ابزارهای نظارت خارجی (External Monitoring) برای رصد زمان اجرای واقعی استفاده کنید.
  • در پرامپت‌های سیستمی، مدل را مجبور کنید تا در فواصل زمانی مشخص، وضعیت پیشرفت را با داده‌های واقعی سیستم تطبیق دهد.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مطالعه با تکیه بر داده‌های تجربی MATS، اعتبار ادعاهای شرکت‌ها درباره «خودمختاری کامل» عامل‌ها را زیر سوال می‌برد. تا زمانی که مشکل کوری زمانی حل نشود، استقرار عامل‌های AI در زیرساخت‌های حساس تولید (Production) ریسک توقف یا شکست ناگهانی را به همراه دارد.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که از APIهای مدل‌های زبانی برای اتوماسیون استفاده می‌کنند، این خبر هشدار می‌دهد که نباید مدیریت زمان و کیفیت را به خودِ مدل سپرد و باید لایه‌های نظارتی مستقل پیاده‌سازی کنند.

·نگاه ما
تحریریه دات‌هوش

این یافته‌ها فرضیه «هوشمندی ذاتی» در مدل‌های استدلالی را به چالش می‌کشد و نشان می‌دهد که حتی پیشرفته‌ترین مدل‌ها بدون اتصال به ابزارهای محیطی (Grounding)، در ساده‌ترین مفاهیم فیزیکی مثل زمان دچار توهم می‌شوند. در واقع، ما با مدل‌هایی روبروییم که در منطق ریاضی قوی هستند اما در «درک محیطی» نوزادوار عمل می‌کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.