Danny Postma 用 Claude Code 搭了一套自己的 AgentOS,早上写目标,晚上回来审 PR,现在大约 95% 的编程相关任务都交给这套系统跑
一个需求进去,系统会自己写 spec、做计划、审计划、写代码、审代码、修代码、更新 wiki,最后提 PR。人不用守着终端等下一步,只在要批准、要选择、要判断的时候出现
这套系统里,每个 agent 只负责一个环节
- spec agent 写规格
- plan agent 写开发计划
- review agents 看可行性、范围、一致性
- senior developer 写代码
- code review coordinator 审代码
- code steward 更新 wiki
他展示的一个任务,下午 3 点启动,晚上 9 点跑完。第二天回来,PR 已经在那里。
权限要比 prompt 更早设计
每个 agent 都在独立容器里跑,用完就清理
客服 agent 能访问前端 MCP,但碰不到 Gmail 和 GitHub
规划 agent 只能访问计划工具。文件系统走 Cloudflare R2 + MCP,可以限制只读、只写、禁止删除
agent 会犯错,也可能被 prompt 注入影响。权限从底层收住,系统才敢让它连续跑几个小时。
人只处理判断题
AgentOS 有一个 inbox
agent 卡住、要批准、要选项时,把问题发进来
比如标题用哪段文字,Danny 在手机上点一下,流程继续跑。
成本方面
一开始他用 Anthropic 云托管 agent,效果好,但每天大概要花 500 美元
后来他把一部分 worker 搬到 Hetzner 的 10 美元 VM 上跑
规划 agent 继续用强模型,执行类 worker 放到便宜、速度快的模型上。
最后,agent、技能、模板都变成 YAML 文件,再用 AgentOS CLI 同步配置、创建项目、启动目标。