اگر امروز برای بهینهسازی سختافزاری روی کدهای تولیدشده توسط هوش مصنوعی حساب میکنید، احتمالاً با بمبی ساعتی در زیرساخت خود روبهرو هستید. طبق تحلیل فنی منتشرشده در arxiv.org در تاریخ ۱۴ اوت ۲۰۲۶، بیش از ۶۰٪ از کرنلهای واحد پردازش گرافیکی (GPU) که توسط مدلهای زبانی تولید شدهاند، دارای تخلفات بحرانی هستند.
این شکست در اعتبارسنجی درست در زمانی رخ میدهد که صنعت به شدت به سمت خودکارسازی شتابدهندههای سختافزاری حرکت میکند. همانطور که در تحلیل قبلی ما دربارهی گسترش مدلهای زبانی در سختافزارهای لبه اشاره کردیم، توانایی تولید کرنلهای سطح پایینِ صحیح و بهینه، همچنان گلوگاه اصلی برای مقیاسپذیری با کارایی بالا است. این چالشها در مدیریت منابع، یادآور پیچیدگیهای بهینهسازی حافظه در کتابخانههایی مانند vLLM است که برای افزایش توان عملیاتی مدلها به روشهای نوین مدیریت حافظه روی آوردهاند.
پژوهشگران برای بررسی این موضوع، یک اعتبارسنج (Verifier) در سطح قرارداد توسعه دادند که شامل ۱۲ گیت خصمانه برای بازرسی ۲,۶۳۸ کرنل تولیدشده توسط ماشین بود. بر اساس مستندات این پژوهش، تفاوت فاحشی میان صحت گزارششده و صحت واقعی وجود دارد:
- ۶۲.۱٪ از کرنلها حداقل یک تخلف فنی داشتند.
- ۳۹.۵٪ از آنها بهشدت معیوب بودند و هیچ استدلالی برای پذیرش آنها وجود نداشت.
- تستهای استاندارد صنعتی، ۱,۴۸۷ کرنلی را پذیرفتند که اعتبارسنج جدید آنها را رد کرد.
به گزارش این تیم، رایجترین خطاها شامل کرنلهایی است که در شرایطی که پاسخ واقعی باید NaN یا بینهایت باشد، اعداد معمولی برمیگردانند یا با تغییر شکل ورودیها، از کار میافتند. این نوع خطاهای پنهان، مشابه فریبهای موجود در شاخص Occupancy است که باعث میشود ابزارهای نظارتی، کارایی واقعی GPU را به اشتباه تشخیص دهند. برای اثبات کارایی این ابزار، تیم پژوهشی آن را روی ساختهی خودشان، یعنی نخستین آموزش پسرونده (backward) بومی Blackwell tcgen05 برای خانواده Gated-Linear-Recurrence (GDN) اعمال کردند.
این تغییر در معیارهای سنجش نشان میدهد پیشرفت ادعایی در تولید کرنل توسط AI، توهمی است که توسط تستهای ضعیف ایجاد شده است. برای این حوزه، معنای این یافته حرکت از بررسیهای «تقریبی» به سمت قراردادهای بدون تلورانس است تا پایداری محیط تولید تضمین شود.
گام بعدی شما
- بازبینی مجدد سیستمهای اعتبارسنجی (Validation Harnesses) در ابزارهای کدنویسی AI خود.
- جایگزینی تستهای مقایسهای ساده با گیتهای خصمانه برای کدهای سطح پایین.
- رصد ادغام این گیتهای اعتبارسنجی در حلقههای آموزش مدلهای زبانی برای حذف خطاهای منشأ.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید. در همین راستا، دستاوردهای اخیر در سرعت استنتاج مدل Qwen3.5 روی زیرساختهای DGX نشان میدهد که سختافزارهای بهینه چگونه میتوانند مرزهای سرعت را جابهجا کنند.




گفتگو