Kernel Forge优化CUDA内核
Kernel Forge用MCTS探索优化路径,将PyTorch模型原地改写为更快CUDA内核。
推荐理由:14个内核超过PyTorch基线的关键不是更强LLM,而是MCTS、多候选执行验证和原地集成;说明代码Agent在硬约束任务上胜负取决于评测闭环。
Kernel Forge用MCTS探索优化路径,将PyTorch模型原地改写为更快CUDA内核。
推荐理由:14个内核超过PyTorch基线的关键不是更强LLM,而是MCTS、多候选执行验证和原地集成;说明代码Agent在硬约束任务上胜负取决于评测闭环。