推荐算法怎样改变“偶然读到一本书”的可能?

《一个人怎样形成自己的世界》· 第一季“阅读、记忆与判断”· 第十篇

一个人在书店寻找历史书,因为走错书架拿起了一本诗集;另一个人在图书馆等待借阅手续时,看见归还车上的陌生作者;还有一个人在阅读平台点开“为你推荐”,发现一本与过去购买记录高度相似的作品。三种情况都可能被称为偶然发现,但它们的“偶然”并不相同。

前两种来自空间中的邻近、他人的归还和分类边界;第三种来自系统根据既有行为计算出的相关性。算法也可能带来真正意外的好书,却通常需要先把“你可能喜欢什么”转成可优化目标。

推荐算法没有消灭偶然。它改变了偶然从哪里产生、由谁安排,以及什么样的意外更容易获得出现机会。

过去的发现也从来不是纯粹随机

怀念没有算法的阅读世界,很容易忽略旧机制同样选择。书店决定进哪些书、摆在什么位置;图书馆使用分类和主题词;报纸编辑选择评论对象;教师、朋友和奖项建立阅读路线。所谓“偶然走到一本书面前”,已经受到建筑、市场和文化权威安排。

旧机制并不天然更公平。入口有限、主流出版集中、少数语言难以被看见,都是长期问题。推荐系统的价值正是在巨大目录中降低寻找成本,也可能把小众作品送到原本不会遇见它的读者面前。

因此,问题不能简化成“人工推荐真实,算法推荐虚假”。两者都组织可见性。真正差别在于算法能够以个人行为为输入,快速更新,并把每次点击重新写回未来推荐。

预测喜欢,会把过去变成未来的入口

多数个性化推荐以某种形式利用相似性:与你过去看过的内容相似,与你行为相近的人也喜欢,或者某项内容在当前情境中更可能被点击。具体系统远比这一概括复杂,但共同方向是从已有信号推测下一步。

这很实用,却产生一个时间结构:过去不只被记录,还成为未来入口的主要依据。读过一本侦探小说,系统继续提供侦探小说;点击几篇某立场文章,同类内容获得更多展示机会。用户再次点击,系统获得更强证据。偏好与推荐形成反馈。

这种反馈不一定把每个人关进固定“过滤气泡”。相关研究的结论受到平台、指标和时间范围影响,系统性综述也指出证据和定义并不统一。关于推荐系统过滤气泡研究的系统综述 一项较早的纵向研究则尝试用标签语义测量推荐系统使用与内容多样性的变化,说明这一问题需要从时间过程而非单次列表观察。关于推荐系统与内容多样性的研究

更稳妥的担忧不是算法必然把人封闭,而是用户很难看见没有被展示的反事实:如果系统没有根据过去预测,这一页还可能出现什么?

意外不是越随机越好

推荐研究中的serendipity通常不仅指惊讶,还包含相关性或价值。一份完全随机的书单会很意外,却可能毫无帮助。真正的偶遇是遇见未曾主动寻找、但后来发现对自己重要的东西。

因此,好的发现机制必须在熟悉与陌生之间工作。太熟悉,只是在重复偏好;太陌生,没有进入的桥梁。一本关于城市规划的书,可能因为读者关心公共空间而与他有关,却又把他带到从未搜索的建筑史。这里既有联系,也有偏离。

一些书籍推荐研究专门尝试提高serendipity,例如利用关联数据寻找不是显而易见、但仍可解释的跨域联系。使用关联数据改进书籍意外发现的研究 这说明算法并非只能追求“更多相同”。多样性、新颖性和意外性也可以成为设计目标。

但目标一旦被量化,又会出现新问题。系统怎样知道某本书对读者产生了长期影响?点击、停留和购买容易记录,几年后的思想变化很难反馈。平台最终容易优化可测的即时行为,而不是不可测的形成过程。

阅读兴趣不应只由行为记录定义

一个人点开什么,并不等于他希望成为什么样的读者。疲倦时连续观看轻松内容,是当下选择;决定用一年理解一位困难思想家,是长期承诺。行为数据能观察前者,却未必知道后者。

如果推荐系统只从既有行为推断偏好,它会把用户描述为已经表现出来的自己。可知识生活不仅由偏好组成,还由愿望、义务和有意识的自我改变组成。读者可能希望接触不同政治立场、另一种语言或自己过去忽略的历史,即使最初点击率不高。

因此,读者需要能够向系统表达的不只是“喜欢/不喜欢”,还包括“我想扩大什么”“我暂时不想让某次行为继续影响推荐”“请给我与当前模式距离更远的内容”。用户控制研究表明,透明地呈现信息环境并增加控制,有助于人们察觉自己可能处于怎样的推荐范围。关于用户控制与新闻过滤气泡的研究

真正有意义的控制不是一个隐藏在设置深处的重置按钮,而是让用户看见推荐依据、编辑历史、调整探索幅度,并选择不被个性化的入口。

有些发现空间应当拒绝完全个性化

公共图书馆的新书架、独立书店的店员选择、课程书单和朋友推荐,并不比算法天然正确,但它们提供不同来源的判断。一个健康的阅读环境不应由单一推荐逻辑垄断。

可以为发现保留几种并列空间:

  • 连续空间:根据当前兴趣提供深入路径;
  • 邻近空间:从相关主题跨到相邻领域;
  • 异质空间:有意识展示不同语言、时代和立场;
  • 公共空间:不根据个人历史,所有人看见相同选择;
  • 随机空间:允许真正无目的的抽取。

这些空间没有一个应独自决定阅读。它们的并存使读者能够在效率、探索和公共共同经验之间移动。

特别重要的是公共空间。若每个人的首页都完全不同,我们不仅失去偶然,也失去“共同偶然”——许多人在同一书架上遇见同一本陌生书,从而形成可以讨论的公共对象。

偶然需要由读者完成

无论书怎样出现,发现都不是展示完成的。一本意外出现的书只有在读者愿意停下、容忍最初的不熟悉,并给它一定时间时,才可能成为真正偶遇。算法可以制造偏离,却不能保证读者接受偏离。

这也说明注意力是偶然发现的条件。一个不断滚动、立即判断的界面,即使提供多样内容,也可能让每一次陌生都在几秒内被划走。相反,一张有限书单、一段解释或一本可翻阅的实体书,会给陌生对象更长的存在时间。

从维成论看,阅读世界由偏好、平台目标、分类、界面、朋友、机构和读者承诺共同形成。算法不是外部入侵者,而是其中越来越强的一组关系。问题不是把它移除,而是限制它不能把可测行为变成一个人的全部未来。

推荐算法改变偶然阅读的最大方式,不是让一切都变得可预测,而是悄悄决定哪一种不可预测仍然有机会出现。一个值得信任的阅读系统,应当既能理解过去,又给读者偏离过去的权利;既能提高相关性,也保留没有被优化的空间。

真正的知识生活不能只问“接下来我最可能喜欢什么”。它还需要一个没有历史数据能够替我们回答的问题:我愿意让什么陌生事物改变自己?

主要资料

继续阅读:浏览《一个人怎样形成自己的世界》系列文章


了解 Geoffrey Chen 的更多信息

订阅后即可通过电子邮件收到最新文章。