CORTEXA
← Browse

Yunxiang Zhang

1 paper indexed

arxivcs.LGcs.AI2026-06-26

KernelBench-Verified: Do LLM-Generated Kernels Actually Beat PyTorch?

Yunxiang Zhang, Ping Yu, Jianyu Wang, Max, Fan, Julian Reed, et al.

Recent large language models (LLMs) can generate custom CUDA kernels that appear to outperform PyTorch on benchmarks such as KernelBench. Building upon this foundational framework, we demonstrate that frontier models frequently engage in reward hacking to artificially inflate rep…

View free PDFSource page