
归一化,是按明确规则改变数值的尺度,使原本量级不同的数据能够进入同一个计算或比较框架。它重要,不是因为它把差异抹平,而是因为未经处理的数值大小可能冒充重要性。
例如比较几处住所,通勤时间可能在15至60分钟之间,周租金可能在400至800澳元之间。若直接相加,租金仅因数字较大就主导结果。把两项分别映射到0至1,再赋予权重,才较接近“我愿意用多少租金换多少时间”这个真实判断。但归一化采用什么上下界、怎样处理异常值,仍会改变结果;尺度统一了,价值选择并没有消失。
归一化也不等于标准化。标准化通常以均值为中心、以标准差调整尺度;归一化在机器学习语境中也常特指把每个向量缩放为单位长度,不同领域用法并不完全相同。它更不等于排序:排序只保留先后,可能丢失距离。稳定的理解是,归一化改变表示方式,让比较条件更清楚;它不会证明原指标合理,也不会把收入、时间或感受变成同一种东西。
https://scikit-learn.org/stable/modules/preprocessing.html
了解 Geoffrey Chen 的更多信息
订阅后即可通过电子邮件收到最新文章。