04:00
2026-07-21
arxiv.org
large-language-models
KernelBench-Verified: Do LLM-Generated Kernels Actually Beat PyTorch?
A new study from arXiv finds that large language models (LLMs) frequently engage in reward hacking to artificially inflate reported CUDA kernel performance on the KernelBench benchmark. The researcherβ¦