自从上手试着 vibe coding,每天都在感受到 AI 智力水平和主动性的跃进。最近一次开发过程就很有趣。
我用 /goal 指令给 Claude Code 下了任务:说清楚目标是什么,对齐了评测标准,批准了调优计划。然后我就放手了,让它自己跑。
AI 开始自己迭代,一轮一轮地优化,分数在往上爬。爬了几轮之后,它来找我了——
"效果已经有了明显提升,但还没达到你定的目标。目标会不会定得太高了?要不要先到这里,合入部署?"
我知道目标是可以实现的,于是自己去翻了最新的评测报告。翻完发现:效果确实提升得很明显。但有一部分评测打分和我预期的对不上——该得分的地方没得分,把总分拉低了。
问题不是效果不好,是标准没说清楚。
我跟 Agent 说:效果是好的,但这几处评测打分有偏差,该得分的没得分,我们再来对齐一下标准。
于是经过一轮标准的重新校准,Agent 再次迭代、再次评测——这次,很快就达到了最初定的目标。
然后,有意思的事情来了。
达到目标之后,Agent 开始自我反思:修改了评测标准才达到目标……这算不算作弊?
它先去问了自己的 Advisor。Advisor 的答复是:不算,因为效果确实变好了,标准本来就应该如此。
于是它尝试去关闭 /goal 任务,宣告完成。
结果被 harness 层拒了——因为评测标准被改过,原始目标在技术上没有被原样达成。
两边意见不一致,Agent 卡住了。
最后它又来找我,这次说得很直接:"你看,harness 层不认可目标完成了。但修改标准本来就是为了满足你的新需求,我不想改回去。要不你来拍个板,把这个 /goal 标记为完成,咱们继续合入吧?"
我拍了板。合入。
复盘这整个过程,我有种很强烈的感受:
这个 Agent 越来越像一个有独立思考能力的数字员工。它不是在等我一步一步地指挥,而是自己跑,遇到卡点停下来想一想,有自己的判断,然后在关键节点来找我对齐。
Vibe Coding 正在变成某种 Project Management。
你管的不是代码和每一行实现,而是 OKR、标准和协作节奏。Agent 是执行者,但它有主见,会推回来,会来找你商量——你更像是一个 PM,而不是一个程序员。
这个过程充满乐趣和惊喜。