全部随想

评估

随想

评估回路中的人

为什么评估不能把判断压缩成唯一指标。

指标,是藏起来的决定

评估常被描述成工作完成之后的测量;但它其实从一开始就在塑造工作。我们选择对什么打分,系统就逐渐学会注意什么。

准确率可以统计,连贯性可以近似。然而相关性、尊严、惊喜与品味都存在于具体情境里。它们无法被一个数字完全覆盖,不是因为模糊,而是因为其中同时存在不止一种合理的价值。

人并不是神谕

把人放进回路,并不会自动解决判断。人会疲惫、会互相模仿,也会继承界面预先写下的假设。因此人的评估同样需要设计:可以比较的例子、可见的不确定性、解释理由的空间,以及保留真实分歧的方法。

目标不是守护一个神秘且永远正确的「人类答案」,而是让判断过程可以被检查,让责任仍然能够被找到。

尚未回答

一个评估系统,能否在变得更严谨的同时,仍有能力认出那些过去从未被珍视的东西?