即刻App年轻人的同好社区
下载
App内打开
Jeremy聊AI产品
17天前
agent 做长程任务,对于大部分用户来说,可能带来更多的是麻烦。

它看似是模型的自主性递归、多步推理能力变强,能够在更少的认为干预下,完成的更复杂的任务。

但更复杂的任务同样带来了杠杆效应,当任务的方向和目标发生偏移,带来的 token 损失、时间和沉默成本更高。

除了模型自身会有【目标漂移】外,很多问题并非来自模型能力上限,而是用户如何agent的语义对齐,以及用户应该在什么时候介入任务过程并校对方向。

深层次看,长程任务如果面向更多大众群体,就需要考虑在 agent 执行任务过程,如何达到确保方向准确且不让用户频繁确认。

当下的产品形态其实更多的是 agent 让用户给出一个具体的授权,但长期来看这显然不是一种最经济的方式。

那么人与agent 之间信任体系是否可以被 Reward?

就像在一个agent team里面,随着某个子agent 与人之间交互行为的频次变久,在特定环境因素满足以及安全条件下,目标校对的频次可以由模型自主决定升频还是降频。

当然这种信任体系,应该建构在【任务+反馈+环境】的三元维度之上。

当任务分类、环境不变的情况下,正向的反馈可以为 agent 提供正向的奖励信号。一但环境改变,信任货币会随环境产生波动。

长程任务本质上对人的要求更高了,所以同样也要有match的产品。
00

来自圈子

圈子图片

产品经理的日常

207075人已经加入