随想
评估回路中的人
为什么评估不能把判断压缩成唯一指标。
指标,是藏起来的决定
评估常被描述成工作完成之后的测量;但它其实从一开始就在塑造工作。我们选择对什么打分,系统就逐渐学会注意什么。
准确率可以统计,连贯性可以近似。然而相关性、尊严、惊喜与品味都存在于具体情境里。它们无法被一个数字完全覆盖,不是因为模糊,而是因为其中同时存在不止一种合理的价值。
人并不是神谕
把人放进回路,并不会自动解决判断。人会疲惫、会互相模仿,也会继承界面预先写下的假设。因此人的评估同样需要设计:可以比较的例子、可见的不确定性、解释理由的空间,以及保留真实分歧的方法。
目标不是守护一个神秘且永远正确的「人类答案」,而是让判断过程可以被检查,让责任仍然能够被找到。
尚未回答
一个评估系统,能否在变得更严谨的同时,仍有能力认出那些过去从未被珍视的东西?