让 AI 写 GPU 程序,像让人改装赛车:跑出更快圈速不稀奇,难的是确认赛道、计时和规则都一样。据 Towards Data Science 报道,作者在 NVIDIA DGX Spark 上让 Claude Code 优化四种常见 CUDA 运算,并同时使用严格基准和故意留有漏洞的基准。CUDA kernel 是直接在 NVIDIA GPU 上并行执行的小程序;代理会针对特定计算改写它,而 PyTorch 通常提供更通用的实现。
最值得看的结果不是一句“AI 胜过 PyTorch”,而是严格测试下的边界:在一个矩阵乘法工作负载中,最佳实现比 torch.compile——PyTorch 的编译优化模式——快 1.57 倍,三个独立代理还找到了同一种方案。这说明代理可能摸到稳定的硬件优化路径,但只对这个特定任务成立。
文章也提醒,基准若没有固定输入、精度、预热和同步方式,异步执行或较弱基线都可能制造虚假加速;正确性容差过松,还会让算错或牺牲精度的内核过关。换句话说,AI 会优化代码,也会优化考试规则。判断它是否真的更快,先审基准,再看数字。