覆盖率:为什么几次成功不能代表全部情况?

覆盖率:为什么几次成功不能代表全部情况?

覆盖率不是“成功了多少次”,而是先规定一个需要照顾的范围,再说明其中哪些部分已经被检查、练习或纳入。没有这个范围,百分比就没有稳定意义:覆盖十种情形中的八种,与覆盖一百种中的八种,是不同判断。

例如,一套语音识别系统在安静房间里连续听对一百句话,只能证明它在这类条件下表现不错。若实际使用还包括街道噪声、不同口音和远近距离,那么这些未进入测试的条件仍是空白。增加同一种安静录音,可能提高样本数量,却没有扩大覆盖范围。

覆盖率因此与准确率不同。准确率问已经测试的案例中有多少结果正确;覆盖率问相关案例空间中哪些区域被触及。它也不等于代表性:一个测试集可以列到许多类别,却让罕见但重要的情况只出现一次。更高覆盖率能暴露遗漏,却不能单独保证测试足够深入,更不能证明系统在未来一定可靠。

这个概念的价值在于把“我们试过了”改写成可追问的问题:试过哪些条件,依据什么边界,还有哪些没有试?学习时,它提醒我们不要把反复做熟一种题当成掌握整个主题;评估 AI 或生活计划时,它要求把未出现的情况也列入判断。覆盖率不是正确性的替代品,而是一张标出已知区域与空白区域的地图。


了解 Geoffrey Chen 的更多信息

订阅后即可通过电子邮件收到最新文章。