把 issue 当作新的 PR
· 阅读需 4 分钟

从前,向开源项目提交你的第一个 PR 相当费事。即便说明写得很清楚,把项目构建起来、让应用跑起来、让测试通过,都需要实打实的工作。就算你清楚要修哪个 bug,也得大致理解项目架构,并对要改的代码有更细致的了解。
编程智能体改变了这一切。问题不在代码质量。网上到处都是对 AI 注水代码的抱怨,但智能体写出的代码,往往比第一次贡献者交上来的更好。问题在于,智能体改变了开源的经济账。

从前,向开源项目提交你的第一个 PR 相当费事。即便说明写得很清楚,把项目构建起来、让应用跑起来、让测试通过,都需要实打实的工作。就算你清楚要修哪个 bug,也得大致理解项目架构,并对要改的代码有更细致的了解。
编程智能体改变了这一切。问题不在代码质量。网上到处都是对 AI 注水代码的抱怨,但智能体写出的代码,往往比第一次贡献者交上来的更好。问题在于,智能体改变了开源的经济账。

古德哈特定律是跑基准的人的诅咒:当一项度量变成目标,它就不再是好的度量。编程智能体基准几乎就是为触发它而设计的。任务是公开的,结果是一个数字,排行榜不可避免地挤满了那些往往并非有意、却对基准过拟合的运行框架。
这并没有让事实上的标准 Terminal-bench 变得无用,但确实改变了 goose 团队使用它的方式。排行榜是对通用智能体能力的嘈杂度量。真正的信号是失败的模式:goose 反复卡住的地方,或者 goose 失败而另一个运行框架成功的地方。
这也是我们通常用 Sonnet 而不是最强模型来跑基准的原因。我们并不是要拿到尽可能大的数字。我们希望桌上还留着足够多的失败,好看出智能体缺了什么支持。