پرش به محتوای اصلی
پرش به محتوای مقاله

اشتباه در ابزار سنجش: تغییر روش تحلیل HTML نرخ موفقیت کد AI را دو برابر کرد

·۸ تیر ۱۴۰۵۲ دقیقه مطالعه۲ بازدید
تحلیل
سه بار آزمون دادم تا فهمیدم دارم روش آزمون خودم را می‌سنجم.
سه بار آزمون دادم تا فهمیدم دارم روش آزمون خودم را می‌سنجم.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

شناسایی «شکاف تأیید» (Assertion Gap) در تست‌های AI؛ جایی که متدولوژی غلطِ تست، عملکرد صحیح مدل را به‌عنوان شکست گزارش می‌کند.

اگر امروز کدهایی که عامل‌های هوش مصنوعی می‌نویسند را با ابزارهای команд‌لاین تست می‌کنید، احتمالاً دارید نمرات غلط می‌گیرید. در ۲۸ ژوئن ۲۰۲۶، یک توسعه‌دهنده متوجه شد که مشکل کدش نبود، بلکه «خط‌کش» او برای اندازه‌گیری شکست می‌خورد.

تست کردن اجزای وب که توسط عامل (Agent) — شبیه دستیاری که می‌تواند ابزارهایی را برای انجام یک وظیفه انتخاب و اجرا کند — تولید شده‌اند، به‌طرز فریبنده‌ای پیچیده است. بسیاری از برنامه‌نویسان برای تایید حضور یک المان در صفحه، به ابزارهای ساده متکی هستند که در سایت‌های استاتیک جواب می‌دهد اما در محیط‌های پویا شکست می‌خورد. همان‌طور که در تحلیل قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، تفاوت میان محیط تست و محیط واقعی می‌تواند نتایج را به‌کلی تغییر دهد.

طبق گزارش این توسعه‌دهنده، او از Next.js 14 و کتابخانه shadcn/ui برای ساخت صفحه‌ای با ۱۲ جدول رده‌بندی و ۷۸ لینک مسابقه استفاده کرده بود. او ابتدا برای تایید خروجی از ترکیب curl و grep استفاده کرد. این روش منجر به امتیاز ضعیف ۷/۱۷ شد، زیرا خروجی‌های رندرینگ سمت سرور (SSR) در حالت Streaming به‌صورت فشرده (Minified) هستند و تگ‌ها یا ویژگی‌های camelCase را که grep به دنبال آن‌هاست، حذف می‌کنند.

برای رفع این مشکل، او روش کار را تغییر داد و به‌جای استخراج مستقیم جریان داده (Stream Scraping)، از یک پارسر HTML استاتیک برای فایل‌های موجود در مسیر .next/server/app/match/*.html استفاده کرد. بر اساس مستندات این تجربه، این تغییر ساده بلافاصله امتیاز موفقیت را از ۷/۱۷ به ۱۵/۱۶ رساند. نویسنده اشاره کرد که ابزاری مثل TestSprite با استفاده از نمونه‌های واقعی مرورگر Chromium، دقتی چندین برابر بیشتر از جست‌وجوی متنی ساده دارد.

این اتفاق نشان‌دهنده یک ریسک جدی در عصر عامل‌محور است: «شکاف تأیید». وقتی یک تست شکست می‌خورد، ما سریعاً کد AI را متهم می‌کنیم، در حالی که مقصر واقعی ابزار اعتبار‌سنجی ماست. اعتماد به سامانه‌های هوش مصنوعی نه با گرفتن جواب درست، بلکه با شناخت دقیق لحظه‌ای ساخته می‌شود که ابزار اندازه‌گیری ما دارد دروغ می‌گوید.

گام بعدی شما

  • به‌جای جست‌وجوی متنی (grep)، از ابزارهایی که DOM را رندر می‌کنند مثل Playwright یا Puppeteer استفاده کنید.
  • در محیط‌های SSR، خروجی‌های فشرده شده را مستقیماً تحلیل نکنید و ابتدا آن‌ها را پارس کنید.
  • به دنبال توسعه «عامل‌های آگاه به ارزیابی» (eval-aware) باشید که می‌توانند خطاهای تست خود را در لحظه تشخیص دهند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تجربه بر اهمیت استفاده از ابزارهای رندرینگ واقعی به‌جای تحلیل متنی تأکید دارد. تکیه بر ابزارهای ساده در ارزیابی مدل‌ها منجر به تصمیمات استراتژیک غلط در مورد کیفیت کد هوش مصنوعی می‌شود.

تأثیر برای ایران

برنامه‌نویسان ایرانی که در پروژه‌های پیمانکاری از عامل‌های کدنویس برای تسریع توسعه استفاده می‌کنند، باید پروتکل‌های تست خود را از grep به Playwright تغییر دهند تا از ارزیابی غلط کیفیت مدل‌ها جلوگیری کنند.

·نگاه ما
تحریریه دات‌هوش

شکست در تست‌ها اغلب به دلیل ناتوانی مدل در کدنویسی نیست، بلکه به دلیل ناتوانی ما در تعریف یک «مرجع حقیقت» (Ground Truth) دقیق است. این مورد ثابت می‌کند که در توسعه سامانه‌های عامل‌محور، زیرساخت ارزیابی (Eval Infrastructure) به اندازه خودِ مدل اهمیت دارد. اگر ابزار سنجش شما با معماری مدرن وب (مثل SSR) هم‌راستا نباشد، مدل‌های قدرتمند را به اشتباه رد خواهید کرد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.