
压缩不是把内容随意删短,而是利用其中的重复和可预测关系,用较少符号表达原来的信息。比如一串连续出现一百次的同一字符,可以记录成“该字符重复一百次”;只要双方理解这条规则,就不必逐个保存。
无损压缩要求解码后恢复原数据,适合程序、账目等不能容许改动的内容。有损压缩则预先规定哪些差异可以舍弃,例如照片可减少人眼不敏感的细节,以换取更小文件。它并非天然低劣,问题在于损失是否越过用途允许的边界:普通浏览还能接受的图像,未必适合指纹鉴定。
压缩与摘要相邻,却不相同。摘要通常重新选择意义重点,不承诺恢复原文;压缩首先关心编码、解码和可接受误差。它的重要性在于提醒我们:信息量不等于符号数量。更短的形式能否可靠工作,取决于接收者掌握什么规则,以及日后究竟需要恢复什么。
https://ocw.mit.edu/courses/6-441-information-theory-spring-2016/pages/lecture-notes/
https://www.nist.gov/publications/parallel-algorithms-entropy-coding-techniques
了解 Geoffrey Chen 的更多信息
订阅后即可通过电子邮件收到最新文章。