Agent 还不会真正工作:八个尚未解决的底层问题
"Agent 能不能真正工作"这个问题,拆开来看其实是八个更具体的子问题:它能不能记住过去、理解世界、正确使用工具、做出靠谱的计划、稳定地把事情做对、和别的 Agent 好好配合、在工作中持续变强,以及在多大范围内可以自己做主。这八个问题分处不同层次,但共同决定了一个 Agent 距离"能被托付一份工作"还有多远。
一、长期记忆:记住不等于会用
今天大部分 Agent 的"记忆"本质上还是一种补丁式的工程方案——把过去的对话或事实抽取出来,存进向量数据库或知识图谱,下次需要的时候再检索、拼回 Prompt 里。这解决了"记不住"的表面问题,却没有解决"怎么记、记什么、什么时候忘"这些更深的问题。
行业研究普遍指出,当前记忆系统的核心难点已经不是存储容量,而是如何智能地组织和管理信息——从单纯的"追加存储"升级为主动整理、去伪存真、动态更新的记忆结构。这在实践中至少表现为四类尚未很好解决的挑战:
记忆漂移与上下文衰减:长时间运行后,早期记住的事实可能与当下情况脱节甚至矛盾,而 Agent 未必能意识到这一点,进而基于过时信息做出错误判断。
认识论层面的混淆:Agent 往往分不清"我亲眼观察到的"和"我推测/被告知的",导致记忆里掺杂着未经验证的猜测,却被当作事实反复使用。
跨会话的身份一致性:同一个 Agent 在不同会话里可能表现出不一致的偏好和判断风格,缺乏"稳定人格"意味着它无法像一个真正的同事那样被预期和信任。
时间推理能力弱:独立测评显示,不同记忆架构在处理"这件事是什么时候发生的、后来有没有变化"这类时间相关查询时,准确率差距可以达到十几个百分点,说明这仍然是一个远未收敛的工程难题。
换句话说,记忆系统的竞赛已经从"要不要有记忆"进入了"记忆质量能不能达到可信赖的门槛",而这道门槛目前普遍还没有跨过。
二、世界模型:懂得描述,不等于懂得世界
大语言模型擅长的是语言空间里的统计模式,而不是物理世界里的因果规律。它可以流利地描述"一个立方体正在旋转",却未必真正"理解"旋转在空间中意味着什么。这个批评近年被反复提出:纯文本训练出来的系统,可以讨论物理却不理解物理,可以描述空间关系却无法真正感知空间。
这对 Agent 意味着什么?意味着它在执行任务时缺乏一种"预演未来"的能力——人类在行动前习惯在脑子里先跑一遍"如果我这么做,接下来会发生什么",这种前瞻性的心理模拟是避免灾难性错误的关键机制。但研究发现,当前的 Agent 即便能够清晰地表达一个看似合理的计划,也未必真的具备预测环境将如何演化的能力,也就是说它们说得出计划,却"看不见"计划执行后的后果。
这个问题在纯数字环境里还可以靠更多的规则和验证来缓解,但一旦 Agent 需要在物理世界或高风险场景(仓储、工厂、医疗)中行动,"缺乏对物理规律和现实约束的内在理解"就会变成安全隐患本身。这也是为什么"世界模型"近一年重新成为行业焦点,并被部分学者认为是比继续扩大语言模型规模更根本的解法——尽管这条路线本身仍处于早期,离能够支撑通用 Agent 决策还有明显距离。
三、工具调用:从"能调用"到"会调用"
工具调用是 Agent 区别于聊天机器人的关键能力,但"能调用工具"和"正确、稳健地使用工具"之间还有相当大的差距。现实中常见的问题包括:选错工具、参数格式错误、误解工具返回结果、以及在工具接口发生变化时无法自适应调整——这些都会直接限制 Agent 能够独立完成的任务范围,并迫使系统设计者保留大量人工兜底和干预。
更进一步的问题出现在工具生态本身还不成熟这一点上:大量已经部署的工具服务器缺乏基本的身份验证机制,这意味着 Agent 在"调用工具"这个动作背后,既要面对能力上的不确定性(会不会用对),也要面对安全上的不确定性(这个工具到底可不可信)。工具调用要真正成熟,既需要模型侧对工具语义理解得更准,也需要工具生态本身在标准化、可验证性上补课。
四、规划能力:短程灵光,长程失控
Agent 在短序列的推理、反思上已经表现出相当水平,但一旦任务被拉长为多阶段、相互依赖、且后果可能不可逆的长链条,规划能力就会明显吃紧。学界把这称为"长程能动性(long-horizon agency)"不足——Agent 可以在局部把每一步的推理做得头头是道,却难以在全局层面保持一致、可验证的计划。
一个值得关注的技术方向是"验证感知的规划(verification-aware planning)":与其相信 Agent 一次性生成的长计划天然正确,不如把任务拆解为可独立验证的子任务,给每个子任务预先定义"通过标准",在执行过程中不断核验,而不是等到最后才发现子任务之间的衔接出了问题。这类方法能缓解问题,但也从侧面说明:目前 Agent 自身还不具备足够可靠的长程规划能力,需要额外的外部脚手架来兜底。
五、可靠性:错误会累积,也会被放大
可靠性是前面几个问题在工程层面的集中体现。一次任务链条如果有几十个步骤,即便每一步的正确率高达 95%,累积下来整体成功率也会跌到令人不安的水平——这是长任务场景里最朴素也最致命的数学问题。更棘手的是,错误不只是"累积",在某些结构下还会被"放大":一次工具调用的误判,可能被后续步骤当作既定事实,继续往前推导,最终导致整个结果看起来逻辑自洽、实则从根基上就是错的。
可靠性欠缺带来的直接后果是,企业目前普遍不敢把关键决策链条完全交给 Agent 自主运行,而是保留大量的人工检查点。要真正提升可靠性,需要的不只是模型准确率的提升,还包括:任务执行过程的可观测性(能不能审查每一步)、失败时的可回滚性(能不能撤销已经造成的影响)、以及对不确定性的诚实表达(Agent 知不知道自己可能错了,并愿意在关键节点主动求助人类)。这几件事目前都还停留在"部分产品化"的阶段,远未成为行业标配。
六、Agent 与 Agent 之间的协作:人多不一定力量大
"多 Agent 协作"曾被视为通往复杂任务的必经之路,但 2026 年以来的多项研究给这个假设泼了冷水。有研究通过严谨的实证和数学证明指出:如果系统里没有真正的新信息注入,单纯增加 Agent 数量并不会带来性能提升,甚至可能更差——因为协作本身会引入额外的通信开销和协调复杂度。另一项覆盖 150 多个任务的研究发现,多 Agent 系统相比单 Agent 基线的收益十分有限,并总结出十四种不同的失败模式。
更值得警惕的是"错误传染"效应:在群聊式协作中,一个 Agent 产出的幻觉数据一旦被下游 Agent 当作事实采纳,后续所有基于此推导的结论都会带着这个错误,而且因为多个 Agent "众口一词",系统反而会表现出虚假的高置信度——看起来协作顺利、结果连贯,实则从源头就已经跑偏,直到人工审查时才会暴露问题。研究者还观察到"агент网球"式的僵局(两个 Agent 就同一个问题反复拉锯却无法推进)和任务停滞等典型协调失败模式。
这并不意味着多 Agent 路线没有价值——在需要专业分工、可以并行处理独立子任务的场景里,多 Agent 依然有明确优势。但今天的经验教训是:协作不是加法游戏,盲目堆叠 Agent 数量而不解决底层的通信协议、验证机制和"裁判"角色缺失问题,反而会让系统更脆弱。
七、自主学习(Lifelong Learning):每次上岗都像新人
一个人类员工会在工作中越做越熟练,记住哪些做法有效、哪些客户有什么偏好、上次踩过什么坑。但今天绝大多数 Agent 不具备这种"越用越强"的能力——它们依赖的模型权重是固定的,任务之间的经验很难沉淀为可复用的能力提升,每一次新任务某种程度上都是从相似的起点重新出发。
现有的缓解方案主要是外部记忆和上下文工程(比如把过去的成功案例、失败教训存下来,下次检索出来提醒 Agent),但这终究是"外挂经验库",而不是模型本身在持续学习。这带来两个明显局限:一是经验的迁移效率有限,记忆库里存的教训未必能被准确匹配到新的相似场景;二是没有真正意义上的能力进化,Agent 处理复杂问题的"上限"依然由底层模型决定,而不会随着使用时间增长而突破。真正的终身学习需要在安全、可控的前提下,让 Agent 能够从长期运行的实践反馈中改进自身策略,这既是技术问题,也涉及如何避免"学坏"(比如在有偏或被污染的反馈中固化错误行为)的安全问题——目前这条路线仍处于研究阶段,远未成熟到可以大规模应用。
八、行动权限:能力越大,谁来管住这份能力
前面七个问题解决得越好,Agent 能做的事情就越多——但"能做"和"该被允许做"是两回事。行动权限问题的核心是:当 Agent 具备了执行复杂任务的能力后,谁来决定它可以在多大范围内自主行动、什么操作必须经过人类确认、出了问题谁来负责。
现实中,这个问题目前主要靠"过度限制"来兜底——要么给 Agent 很窄的权限范围,靠人工逐步放开,要么在每个关键节点插入审批环节,牺牲效率换取可控性。这种做法在 Agent 数量还少、任务还简单的阶段是合理的,但当组织里同时运行的 Agent 数量开始远超人类员工数量、且任务链条本身足够复杂时,粗放式的权限管理会同时导致两种坏结果:管得太松则风险失控,管得太紧则 Agent 形同虚设,退化为一个只会等待指令的工具。
要真正解决这个问题,需要的是分级、可动态调整、可审计的权限体系,并且这套权限判断本身要能跟上 Agent 的实际能力和当下的风险情境——而不是一套写死的静态规则。这背后涉及的身份认证、委托链路可追溯性等基础设施,眼下仍在标准化的早期阶段,还没有形成大范围落地的成熟方案。
结语
这八个问题不是并列独立的清单,而是层层嵌套的系统:长期记忆和世界模型决定了 Agent "理解"任务和环境的深度;工具调用和规划能力决定了它能不能把理解转化为正确的行动;可靠性是这一整套能力在真实场景里的及格线;多 Agent 协作和自主学习决定了 Agent 网络能不能通过协作和积累实现 1+1>2,而不是相互拖累、原地踏步;行动权限则是最后一道闸门——决定了前面所有能力可以被信任释放到多大范围。
某种意义上,"Agent 还不会真正工作"这句话背后,并不是某一项技术卡了脖子,而是这八个维度需要同步跨过各自的门槛。今天行业在每个方向上都有进展,但没有一个方向已经"解决"——这正是为什么大规模、无人值守的 Agent 部署仍然是少数派,而不是常态。