用 agent 做长程任务,对于大部分用户来说,可能带来更多的是麻烦。
它看似是模型的自主性递归、多步推理能力变强,能够在更少的认为干预下,完成的更复杂的任务。
但更复杂的任务同样带来了杠杆效应,当任务的方向和目标发生偏移,带来的 token 损失、时间和沉默成本更高。
除了模型自身会有【目标漂移】外,很多问题并非来自模型能力上限,而是用户如何agent的语义对齐,以及用户应该在什么时候介入任务过程并校对方向。
深层次看,长程任务如果面向更多大众群体,就需要考虑在 agent 执行任务过程,如何达到确保方向准确且不让用户频繁确认。
当下的产品形态其实更多的是 agent 让用户给出一个具体的授权,但长期来看这显然不是一种最经济的方式。
那么人与agent 之间信任体系是否可以被 Reward?
就像在一个agent team里面,随着某个子agent 与人之间交互行为的频次变久,在特定环境因素满足以及安全条件下,目标校对的频次可以由模型自主决定升频还是降频。
当然这种信任体系,应该建构在【任务+反馈+环境】的三元维度之上。
当任务分类、环境不变的情况下,正向的反馈可以为 agent 提供正向的奖励信号。一但环境改变,信任货币会随环境产生波动。
长程任务本质上对人的要求更高了,所以同样也要有match的产品。