今天看到
@yusen 分享关于企业AI的思考有感,也顺着思考中提到外包分享一下最近实践下的一下感受:
AI 进入企业的第一步,就像 Yusen 讲的,可以先用 “外包” 来选择场景。
客服、数据整理、非核心研发这些工作,通常边界清楚、输入输出明确、质量容易验收,也已经在相当程度上完成了与企业核心业务和敏感数据的解耦。企业先在这些环节引入 AI,组织阻力最小,也最容易看到成果。
但 “外包” 只能帮助企业完成转型的起步。如果 AI 长期停留在低价值、标准化的执行环节,组织获得的主要还是降本。下一阶段需要沿着价值链向上走,让 AI 逐步进入那些更依赖判断、领域知识和专家经验的环节。
如果想要向上走,企业需要建设一套 “组织级 Harness”。
怎么理解组织级 Harness?
单个 Agent 的 Harness,解决的是如何驾驭 LLM 产生的智能:给模型提供上下文、调用工具、规划任务、检查结果,并在失败后重新尝试。
组织级 Harness 驾驭的对象更复杂,它需要同时协调组织内的 Agent 和人,让两者围绕同一个业务目标协作。它更像一套组织的智能操作系统,比如:
Memory 负责沉淀组织的业务背景、历史决策和长期上下文。
Skills 将专家经验和最佳实践封装成可复用的能力。
Orchestration 负责任务拆解、角色分工、流程衔接和异常处理。
权限系统决定 Agent 能看到什么、调用什么,以及哪些动作必须由人确认。
Review 机制负责检查结果、处理高风险决策,并把纠正结果送回系统,作为迭代的养分。
这几个组件连起来之后,企业得到的就不再是几个各自为战的 AI 工具,而是一套能够分配任务、调用能力、积累经验并持续进化的生产系统。
而在这套组织级 Harness 里,我认为最关键、同时也最容易被忽视的部分,是评测,尤其是来自业务专家的评测。
专家经验往往藏在人的脑子里。很多时候,专家一眼就能判断一个结果 “对不对”,却很难直接把判断过程完整地说出来。组织需要把这些隐性的经验逐步拆解成真实案例、判断标准、边界条件和失败样本,让 Agent 的工作质量能够被衡量。
每一次专家对 Agent 的纠正,都应该沉淀为新的评测数据。每一次流程失败,都应该转化为下一轮 Harness 迭代的输入。评测集记录的是组织内对“好”的品味,反馈闭环则让这套标准持续变得更准确。
我现在越来越觉得,建设 AI Native 组织,很像迭代一个 Agent 产品:先选择一个边界清晰的任务跑通,建立评测集和反馈闭环,再逐步提高任务难度、扩展上下文和权限范围,最终进入组织真正创造价值的核心环节。
如果能到这一步, 智能才真正原生地融入了企业。