پرش به محتوای اصلی
پرش به محتوای مقاله

۶۲٪ از کرنل‌های GPU تولیدشده توسط هوش مصنوعی حاوی خطای فنی هستند

·۲۳ مرداد ۱۴۰۵۲ دقیقه مطالعه
تأییدکننده قراردادی برای هسته‌های GPU تولیدشده توسط LLM، و پیاده‌سازی بومی بلک‌ول برای خانواده بازگشت خطی دروازه‌دار
تأییدکننده قراردادی برای هسته‌های GPU تولیدشده توسط LLM، و پیاده‌سازی بومی بلک‌ول برای خانواده بازگشت خطی دروازه‌دار
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی یک اعتبارسنج «در سطح قرارداد» که نشان داد تست‌های استاندارد صنعت در شناسایی خطاهای کرنل‌های GPU ناتوان هستند و نرخ خطای واقعی را به ۶۲٪ می‌رساند.

اگر امروز برای بهینه‌سازی سخت‌افزاری روی کدهای تولیدشده توسط هوش مصنوعی حساب می‌کنید، احتمالاً با بمبی ساعتی در زیرساخت خود رو‌به‌رو هستید. طبق تحلیل فنی منتشرشده در arxiv.org در تاریخ ۱۴ اوت ۲۰۲۶، بیش از ۶۰٪ از کرنل‌های واحد پردازش گرافیکی (GPU) که توسط مدل‌های زبانی تولید شده‌اند، دارای تخلفات بحرانی هستند.

این شکست در اعتبارسنجی درست در زمانی رخ می‌دهد که صنعت به شدت به سمت خودکارسازی شتاب‌دهنده‌های سخت‌افزاری حرکت می‌کند. همان‌طور که در تحلیل قبلی ما درباره‌ی گسترش مدل‌های زبانی در سخت‌افزارهای لبه اشاره کردیم، توانایی تولید کرنل‌های سطح پایینِ صحیح و بهینه، همچنان گلوگاه اصلی برای مقیاس‌پذیری با کارایی بالا است. این چالش‌ها در مدیریت منابع، یادآور پیچیدگی‌های بهینه‌سازی حافظه در کتابخانه‌هایی مانند vLLM است که برای افزایش توان عملیاتی مدل‌ها به روش‌های نوین مدیریت حافظه روی آورده‌اند.

پژوهشگران برای بررسی این موضوع، یک اعتبارسنج (Verifier) در سطح قرارداد توسعه دادند که شامل ۱۲ گیت خصمانه برای بازرسی ۲,۶۳۸ کرنل تولیدشده توسط ماشین بود. بر اساس مستندات این پژوهش، تفاوت فاحشی میان صحت گزارش‌شده و صحت واقعی وجود دارد:

  • ۶۲.۱٪ از کرنل‌ها حداقل یک تخلف فنی داشتند.
  • ۳۹.۵٪ از آن‌ها به‌شدت معیوب بودند و هیچ استدلالی برای پذیرش آن‌ها وجود نداشت.
  • تست‌های استاندارد صنعتی، ۱,۴۸۷ کرنلی را پذیرفتند که اعتبارسنج جدید آن‌ها را رد کرد.

به گزارش این تیم، رایج‌ترین خطاها شامل کرنل‌هایی است که در شرایطی که پاسخ واقعی باید NaN یا بی‌نهایت باشد، اعداد معمولی برمی‌گردانند یا با تغییر شکل ورودی‌ها، از کار می‌افتند. این نوع خطاهای پنهان، مشابه فریب‌های موجود در شاخص Occupancy است که باعث می‌شود ابزارهای نظارتی، کارایی واقعی GPU را به اشتباه تشخیص دهند. برای اثبات کارایی این ابزار، تیم پژوهشی آن را روی ساخته‌ی خودشان، یعنی نخستین آموزش پس‌رونده (backward) بومی Blackwell tcgen05 برای خانواده Gated-Linear-Recurrence (GDN) اعمال کردند.

این تغییر در معیارهای سنجش نشان می‌دهد پیشرفت ادعایی در تولید کرنل توسط AI، توهمی است که توسط تست‌های ضعیف ایجاد شده است. برای این حوزه، معنای این یافته حرکت از بررسی‌های «تقریبی» به سمت قراردادهای بدون تلورانس است تا پایداری محیط تولید تضمین شود.

گام بعدی شما

  • بازبینی مجدد سیستم‌های اعتبارسنجی (Validation Harnesses) در ابزارهای کدنویسی AI خود.
  • جایگزینی تست‌های مقایسه‌ای ساده با گیت‌های خصمانه برای کدهای سطح پایین.
  • رصد ادغام این گیت‌های اعتبارسنجی در حلقه‌های آموزش مدل‌های زبانی برای حذف خطاهای منشأ.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید. در همین راستا، دستاوردهای اخیر در سرعت استنتاج مدل Qwen3.5 روی زیرساخت‌های DGX نشان می‌دهد که سخت‌افزارهای بهینه چگونه می‌توانند مرزهای سرعت را جابه‌جا کنند.

چرا این موضوع مهم است؟

این پژوهش با تکیه بر متدولوژی گیت‌های خصمانه، اعتبار بنچمارک‌های فعلی تولید کد را زیر سؤال می‌برد. عدم اصلاح این روند می‌تواند منجر به خرابی‌های غیرقابل پیش‌بینی در مراکز داده‌ای شود که بر پایه کدهای بهینه‌شده توسط AI اداره می‌شوند.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران مدل‌های بنیادی و توسعه‌دهندگان کتابخانه‌های محاسباتی اهمیت دارد تا بازار مصرف ایران.

·نگاه ما
تحریریه دات‌هوش

اعتماد به مدل‌های زبانی برای نوشتن کدهای سطح پایین (Low-level) بدون یک لایه نظارت ریاضی سخت‌گیرانه، ریسک سیستمیک ایجاد می‌کند. این یافته ثابت می‌کند که معیار Pass@k در کدنویسی AI برای زبان‌های سطح بالا کاربردی است، اما در محیط‌های حساس سخت‌افزاری، «تقریباً درست» به معنای «کاملاً غلط» است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.