不知道其他人有没有类似的经历和感受,我是经常被ChatGPT碰撞的。今天和它聊产品评测,过程如下(为了节省篇幅,所以摘录主干内容)。
我:长期以来,产品评测体系实际是缺乏分层的。产品本身的客观指标体系,以及这些指标对用户意味着什么,实际是两套逻辑和价值。前者衡量产品本身的客观变化,如响应时间、崩溃率、交互步长等,后者则定义了该指标对用户的价值。需要注意的是,同一个指标的同一个数据表现,在不同场景、用户、行业、地区等环境下,对用户的价值不同,有时候甚至相反,所以具有明确的相对性。我们做产品评测时,尤其要注意第二点。
ChatGPT:你实际上是在区分“产品性能事实”与“用户价值函数”。二者不能直接画等号。
例如,“响应时间从 3 秒降到 1 秒”是产品层面的事实;但它究竟意味着“明显更好”“几乎无感”,还是“反而不重要”,取决于用户正在做什么。支付确认页从 3 秒降到 1 秒,可能显著降低焦虑;一个需要用户阅读和判断的 AI 分析页面从 3 秒降到 1 秒,价值可能很低;而自动驾驶、实时交易、游戏等场景下,几百毫秒都可能产生巨大差异。
因此,我倾向于把你说的两层进一步拆成四层:
产品客观指标:系统实际上发生了什么变化。响应时间、崩溃率、成功率、准确率、交互步数、耗电量、Token 消耗等。
任务层表现:这个变化是否改善了用户完成某项任务的过程。例如完成时间、任务成功率、返工率、认知负担、错误恢复成本。
用户价值:用户到底因此得到了什么。效率、安全感、确定性、便利、愉悦、信任、能力扩展等。
场景化效用:上述价值在“这个用户 × 这个任务 × 这个场景 × 这个时间 × 这个地区/行业”下到底值多少。第四层尤其关键。
所以你说的“相对性”不是评测中的噪声,而恰恰是产品价值本身的一部分。
甚至还要再加一个容易被忽略的问题:很多所谓“优秀产品指标”的方向都不是单调的。
例如交互步数不是越少越好。银行转账把确认步骤从 3 步变成 1 步,客观上效率提高,但用户可能觉得“不安全”;AI Agent(智能代理)自动执行任务时,多一步确认反而可能提升控制感。响应速度也不是绝对越快越好,如果以牺牲准确率、可靠性或者用户理解为代价,综合价值可能下降。
因此,一个指标本身几乎没有产品意义,必须回答:“这个指标变化,改变了谁,在什么情况下,完成什么任务的什么体验,最终产生了什么价值?”
这实际上也解释了为什么很多评测榜单会失真。它们经常停留在第一层——比较模型快了多少、准确率高了多少、步骤少了多少——然后未经证明直接推出“产品更好”。真正困难的恰恰是从第一层到第三、第四层之间的映射。
AI 产品尤其如此。比如模型 benchmark(基准测试)提高 5 分,是能力事实;但这 5 分是否让普通用户感受到产品提升,需要经过“模型能力 → 产品行为 → 任务结果 → 用户价值”的完整传导链。如果提升集中在用户几乎不会遇到的任务上,产品价值可能接近零。
所以如果以后我们建立一套产品评测框架,我认为核心不应该是简单增加更多指标,而应该强制把每一个指标写成一条“价值映射链”:
客观指标 → 行为变化 → 任务影响 → 用户感知/结果 → 适用条件 → 价值大小
这样评测的重点就从“它强不强”变成了“它对谁、在什么条件下、究竟强在哪里”。这会比目前大量横向参数对比型评测更接近真正的产品判断。
我:我说下我的理解。第一层是产品本身发生了什么样的变化,第二层是这个变化对应带来了人的行为有哪些变化,第三层是这些变化为人提供了什么好处或收益,第四层为了衡量投入是否值得而将这些收益作为基准参照。
ChatGPT:你的理解比我上一轮更准确。按你这个定义,四层其实不是并列关系,而是一条连续的因果链:产品变化 → 行为变化 → 用户收益 → 投入产出判断。
更严格地说:
第一层:产品事实层
回答“产品本身哪里发生了什么变化”。例如响应时间从 3 秒降到 1 秒、崩溃率从 2% 降到 0.5%、完成任务所需步骤从 6 步降到 4 步。这里应尽量保持客观,不讨论“好不好”。
第二层:行为影响层
回答“这个产品变化使人的行为发生了什么变化”。例如等待减少、放弃率下降、重复操作减少、用户更愿意继续下一步、人工干预次数减少。
这一层非常关键,因为它是“技术/产品指标”传导到用户价值的中间机制。没有这一层,很容易直接把“产品指标变好”等同于“用户价值变大”。
第三层:用户收益层
回答“行为变化最终给用户带来了什么收益”。例如节省时间、减少错误、降低风险、减少认知负担、提高收入、获得更强控制感或更高确定性。
这一层已经开始出现你最初强调的相对性。同样减少一次点击,对一个每月操作一次的普通消费者价值可能很小;对每天操作几百次的客服坐席,累计收益可能非常大。
第四层:价值衡量 / 投入产出层
你的定义实际上不是“再描述一种用户价值”,而是:以第三层已经确认的用户收益为参照,判断为了获得这些收益所付出的成本是否值得。
这样定义后,第四层实际上已经从“用户价值评测”进入了“产品决策”。
所以真正完整的结构应该是:
环境条件 × 产品变化 → 行为变化 → 用户收益 → 投入产出判断。
这里的“环境条件”不是第四层,而是整条价值传导链的条件变量。
我认为这已经接近一个很有实用价值的产品评测基本模型了。尤其重要的一点是,它把经常被混在一起的三个问题拆开了:
产品有没有变好?
用户有没有因此受益?
这个收益值不值得我们付出成本去获得?
这三个问题的答案完全可能分别是“是、是、否”。而传统产品评测往往在第一个“是”之后就停止了。