最近在和团队高频讨论Evals评定指标的问题,突然想到之前读过的一个故事,分享给大家:
苏联有一家钉子厂,政府按「吨」考核产量,厂长很快想明白了:做又大又重的钉子,一吨的指标轻松完成。于是仓库堆满了没人要的巨型钉子。
政府发现不对,改成按「数量」考核。厂长又想明白了:做又小又轻的钉子,数量蹭蹭涨。这回生产出来的钉子小到根本没法用。指标换了两次,但钉子始终没人要,厂长也很努力,只是每个指标一旦成为目标,就自动长出一个「应试方案」。
这个规律有个名字,叫古德哈特定律,意思是当一个指标成为目标,它就不再是个好指标。
1975 年英国经济学家古德哈特提出它时讲的是货币政策,放在Evals上其实一样成立,一套evals一旦被考核,就会被优化出形状。
也分享一下我们定evals和指标的几个维度:
1. 是用户能感知的结果
2. 不能只考模型会做的题目
3. 平均分之外要有hard fail
4. bad case要有处理环节和出口
5. 上线gate里的鲁棒和红队测试五五开