《AI进入工作之后》· 第一季“从回答问题到参与工作”· 第四篇
一个项目团队连续几周与AI讨论产品设计。AI知道项目名称,熟悉用户群,似乎还记得团队不希望使用某种技术方案。它能继续上次的讨论,也会按照过去形成的语气整理会议材料。
某一天,AI却建议采用那种已经被否决的方案。团队提醒它:“我们不是早就决定不用了吗?”AI道歉,并重新给出符合要求的答案。
问题看起来像一次普通遗忘,但如果此前的决定只存在于聊天中,真正遗忘的并不只是AI。整个团队都没有把决定放进正式工作系统。
“AI是否有记忆”经常被当成产品功能问题:能否记得用户偏好、能否跨对话继续、上下文窗口有多长。但工作需要保存的远不只是“模型下次能否想起来”。一项决定如果会影响预算、架构、合同或公共表达,就必须有明确来源、批准者、适用时间和变更记录。即使AI每次都能准确复述,也不能用一段对话代替正式档案。
因此,AI记忆与工作记录必须分开。前者帮助系统在交互中保持连续;后者帮助人和组织证明什么已经发生、什么仍然有效,以及出现争议时以什么为准。
“记忆”这个词掩盖了不同机制
人们说AI“记得”,可能指至少四种不同情况。
第一种是当前上下文。模型在一次对话或任务中能够读取前面的消息、文件和工具结果。它并不是在需要时回忆,而是这些信息仍在当前输入范围内。
第二种是保存后的用户信息。系统可能把偏好、个人资料或过去互动的摘要存储起来,在未来对话中重新提供给模型。这是一种外部保存与重新调用机制。
第三种是知识库检索。文件存放在数据库或搜索系统中,模型根据当前问题寻找相关片段,再使用检索结果生成回答。
第四种是模型参数中的一般知识。训练使模型形成语言和事实模式,但这种知识通常不能像数据库记录那样显示确切来源、更新时间和保存理由。
四种机制都可能在界面上表现为“它知道”,可靠性和用途却不同。当前上下文会因长度和任务变化而被压缩;保存信息可能被错误概括;检索可能找不到真正相关文件;模型参数中的知识可能过时或缺少出处。
如果组织把这些机制统称为“AI记忆”,就很难设计正确的纠错方法。解决上下文过长,需要选择、摘要和检索;解决正式记录缺失,需要档案和版本管理;解决数据错误,则需要来源修正和权限控制。让AI“再记牢一点”不是同一个技术问题。
上下文很长,不等于工作记忆可靠
模型能够接收更多文字,确实扩展了可处理任务的范围。长报告、多个文件和较长对话可以同时进入一次任务。
但容量不是使用质量。一项发表于《Transactions of the Association for Computational Linguistics》的研究发现,在长上下文问答任务中,一些模型更善于利用出现在开头或结尾的信息,而相关内容位于中间时表现下降。TACL:《Lost in the Middle: How Language Models Use Long Contexts》
模型能力持续变化,具体表现不能永久套用这项研究。但它揭示的结构问题仍然重要:一条信息进入上下文,不等于系统已经正确识别其重要性,更不等于它会在需要时稳定使用。
这与现实工作很相似。把所有邮件、会议记录和草稿放进一个共享盘,并不会自动形成组织记忆。真正有用的记忆需要分类、状态、关系和检索路径。否则资料越多,错误版本与重要决定越容易混在一起。
Anthropic关于上下文工程的说明也强调,应把上下文视为有限资源,通过即时检索、压缩、结构化笔记和工具调用,把真正需要的信息放到模型当前可以有效使用的位置。Anthropic:《Effective context engineering for AI agents》
因此,“模型支持多少上下文”只是容量问题。工作系统还必须回答:哪些内容应当进入,谁决定其重要性,冲突时怎样排序,过期内容何时退出。
检索增强并不会自动建立事实来源
检索增强生成把外部资料与模型生成结合起来。系统收到问题后,先从知识库找出相关片段,再让模型根据这些片段作答。它的一个重要价值,是知识库可以更新,也可以保留模型回答所依据的材料。NeurIPS:《Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks》
但“能检索”与“有可靠记录”仍然不同。
假设知识库中同时保存三份退款政策:一份2024年版本,一份2025年草稿,一份2026年已经批准的现行版本。检索系统可能因为措辞更接近问题而返回旧文件。如果文件没有版本、有效日期和批准状态,模型无法仅凭语言确定哪一份具有权威。
又如,会议纪要写着“团队倾向于把发布日期延后一周”,后来负责人在正式计划中决定不延期。如果AI只检索到会议纪要,它可能把倾向写成决定。错误不是因为文字不存在,而是系统没有表达不同记录的制度地位。
一个工作知识库至少需要保存:
- 原始文件及其来源;
- 创建、批准和失效日期;
- 草稿、建议、证据与正式决定的区别;
- 文件之间的替代和引用关系;
- 谁能够读取、修改和批准;
- 发生变更时的历史版本。
这些元数据不是技术附属品。它们告诉AI,也告诉后来接手的人,一段文字在工作中究竟算什么。
工作需要保存的是“可追溯状态”
项目连续性不应依赖某个人或某个AI记得所有事情。它需要一个可以被共同读取、核对和更新的状态。
例如,一项软件开发任务至少可能包含:需求说明、当前分支、已知缺陷、测试结果、尚未决定的问题和发布批准。聊天可以帮助讨论这些内容,却不应成为它们唯一的保存位置。否则一旦对话被压缩、人员离开、模型更换或项目迁移,工作状态就会变得模糊。
更稳妥的结构可以分为四层:
- 对话层:保存探索、提问和临时讨论;
- 工作状态层:保存任务、负责人、进度、阻塞和下一步;
- 知识层:保存经整理的事实、规则、设计说明和来源;
- 正式记录层:保存已经批准的决定、发布版本、合同和审计记录。
AI可以参与每一层,但不能把四层压成同一段聊天。对话中的一句“好的,我们以后都这样做”,只有进入决定记录并标明批准者与适用范围,才成为组织可以依赖的事实。
美国国家标准与技术研究院的AI风险管理框架把文档记录视为透明度、人类复核与问责的重要基础,并要求组织区分人机配置中的角色和责任。NIST AI Resource Center:《AI RMF Core》
这不是因为所有AI使用都要变成复杂审计。风险很低的个人草稿可以保持轻量。但只要结果会影响他人、产生费用、改变正式系统或被公开采用,记录强度就应随之后果提高。
AI的个性化记忆还带来另一类问题
个人化AI希望通过保存用户偏好减少重复说明。这很有价值:语言、格式、兴趣和长期目标能够保持连续,系统也更容易理解省略表达。
但偏好与事实不能混为一谈。“用户喜欢简洁回答”是一项交互偏好;“用户已经批准项目预算”是一项正式状态。前者可以由个人记忆改善体验,后者必须由可核查记录证明。
个人记忆还可能发生三个问题。
一是过度概括。用户在特定任务中表达一次偏好,系统却把它当成永久习惯。
二是过时。人的目标和观点会改变,过去正确的概括可能在后来误导系统。
三是不可见影响。如果用户不知道系统保存了什么,就很难理解为什么AI持续以某种方式回答,也难以修正错误印象。
因此,个性化记忆应当允许查看、修改、删除和区分适用范围。隐私保护也不能只依靠模型“善意使用”。美国国家标准与技术研究院的隐私框架强调,组织需要识别并管理数据处理带来的隐私风险,而不只是保证系统功能可用。NIST:《Privacy Framework》
在工作环境中,还必须区分个人偏好、团队知识和机构机密。一个人有权让AI记住自己的写作风格,不代表他有权把客户资料、同事评价或未公开文件放入任何外部记忆系统。
谁负责让记忆过期
人们通常关心AI为什么忘记,却较少关心AI为什么没有忘记。
工作信息存在生命周期。临时访问权限应当结束,旧政策应当失效,离职人员的身份应当撤销,过期客户信息不应无限保存。记忆如果只会增加,不会删除,同样会造成风险。
因此,可靠的工作记忆需要两种相反能力:在适当时间保留,也在适当时间失效。
这要求系统设置保留期限、版本状态、删除规则和权限变更。AI不应自行判断一份合同是否可以删除,也不应因为某段资料经常被调用就永久保存。保存与删除都是组织的数据治理决定。
结论:连续性不能寄托在“它好像记得”上
AI记忆可以改善交互,让模型在一段任务或长期关系中减少重复说明。上下文、保存信息、检索知识库和模型一般知识,都能以不同方式支持连续工作。
但工作系统必须保存的是更严格的东西:事实来源、当前状态、批准决定、版本历史、权限和责任。它们必须能够被人独立读取和核对,不应只有在模型正确回答时才显现。
因此,一条基本原则是:
可以让AI记住偏好和工作线索,但不能让“AI记得”成为重要事实、正式决定和组织责任的唯一证明。
如果一项内容在AI忘记、更换或离线以后仍然必须成立,它就应该进入正式系统。如果一项决定会影响其他人,它就应该有批准记录。如果一条知识会过期,它就应该有版本和有效期。
AI可以帮助组织调用记忆,却不应成为组织记忆本身。真正可靠的连续性,不是每次对话都显得熟悉,而是任何有权限的人都能回答:我们依据什么工作,现在进行到哪里,谁作出了决定,什么时候可以改变。
主要资料
- NIST AI Resource Center:AI RMF Core
- NIST:Privacy Framework
- Anthropic:Effective context engineering for AI agents
- Nelson F. Liu et al.:Lost in the Middle: How Language Models Use Long Contexts
- Patrick Lewis et al.:Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
继续阅读:浏览《AI进入工作之后》系列文章
了解 Geoffrey Chen 的更多信息
订阅后即可通过电子邮件收到最新文章。