最近 SaaS 软件股又起来了。疲软了大半年,现在又开始讲软件了。
看看 Atlassian 最近的财报:FY26 Q4 总收入同比增长 28%,云收入增长 31%。财报原文:
www.atlassian.com为什么?我的判断是,年初“Agent 即员工”的叙事,终于碰到真实的企业环境了。
年初那波热潮里,从 OpenClaw 到 Claude Code,大家很容易一路外推:大模型可以完成一切任务,自己探索 workflow,tool use,生成界面,等等。那还要这些软件干什么?
跑到现在,账单来了,等待来了,重试来了,行业数据和 eval 还是得自己做,system of record 还是绕不过去。于是 workflow、上下文、judgment、行业 benchmark,又有价值了。
世间事,分分合合。从需要证明自己 AI-native,到 token 烧了一大堆,开始追问效果在哪里。资本最喜欢的,就是大家合力炒一个叙事。
4 月份我跟团队就说:
1. Token cost 到今年年底一定会成为最大的关注点之一。现在我还是这个判断。每百万 token 便宜,不代表把一件事做对的总成本便宜。Anthropic 在 2025 年 6 月的工程文章里就披露过:在他们自己的数据中,Agent 的 token 用量约为普通对话的 4 倍,多 Agent 系统约为 15 倍。这是他们当时的系统数据,不是所有 Agent 的固定倍数。原文:
www.anthropic.com2. 除了 coding,很多公司连自己业务里的 eval 怎么做都还没搞清楚。这才是瓶颈。行业 benchmark 当然已经有了,但“模型在榜单上得了多少分”和“这个决策对我们公司到底对不对”,是两回事。Coding 的反馈相对明确,但也不是测试通过就万事大吉。Anthropic 关于 Agent eval 的说明:
www.anthropic.com3. 能跑 task 的 Agent 和 Agent 员工是两回事。后者需要企业上下文,需要可信任、consistent 的判断,需要知道什么能自己决定、什么必须找人。问题是:企业过去为什么做这个决策,放弃了哪些选项,背后有什么约束,这些东西到底有没有 document?如果没有,接上 CRM 也不会凭空长出来。
还有 long-horizon loops,失败怎么恢复,状态怎么保存,结果怎么验,不能靠一句“让它一直跑”解决。METR 自己也明确提醒,任务跨度不能直接等同于真实岗位的工作能力。说明:
metr.orgHype 之后,如果你发现自己面前开了 10 个 terminal,一整天在 monitor 每个任务,那这部分监督劳动也得算进去。
4. Agent 需要更强的 observability。我们要看 traces,知道 token 烧到哪里,哪里失败了,哪里反复绕圈。哪些经过验证的路径可以固定成 workflow、skill、经验,未来不用每次重新探索?同一个流程,每次都花钱让模型重新摸索一遍,这个成本迟早有人来算。
但传统 SaaS,我认为还是没戏。继续按传统 SaaS 的逻辑做,我不看好。
未来属于 AI-native SaaS。在我看来,它应该是:
1. 业务数据默认让 Agent 在权限范围内读取和操作。
2. 人类要看的界面,每个用户可以自己和 Agent 定制,随时调整。
3. 决策、依据和结果,是数据里面最重要的一环。
4. 数据、分析、行动一体化。比传统 SaaS 更垂直,但更纵深,一个场景的上下游都做进去。
5. 最后会做自己的行业模型。我判断,模型+应用会成为标配。可以微调、蒸馏,不等于每家公司都从零训练基础模型。
所以我认为,真正做深的垂类 app,会成为新的 neo labs。真实任务、行业数据、eval、结果反馈都在手上,模型怎么改才有用,它们最清楚。
传统厂商为什么危险?Enterprise 当然还需要 copilot、界面、审批,这些需求不会突然消失。但老公司还要保护原来的产品、席位收入和交付方式。我赌它们改不过来,至少没有 AI-native 公司快。在原来的 SaaS 上加一个聊天框,这事解决不了。
最重要的两个 meta-takeaways:
1. 管他资本在炒什么,真正解决客户问题,你才能留在牌桌上。
2. 留在牌桌上,才是最重要的。