把私人或公司文件上传给AI之前,应该检查什么? / What Should You Check Before Uploading Personal or Company Files to AI?

简短答案

上传前应确认文件归谁控制、你是否有权提供给该服务、里面有哪些个人或机密信息、供应商会怎样保存和使用内容、谁能访问、能否删除,以及是否有更少数据也能完成任务。不要把“付费版”“不会公开”或“关闭训练”误认为完整隐私保证。最安全的顺序是先分类、删减和去标识,再选择经批准的账户与功能,最后保留上传和删除记录。

先问你是否有权上传,而不是工具是否允许上传

文件出现在你的电脑或邮箱,不代表你可以把它交给第三方AI服务。雇佣合同、客户资料、病历、学生作业、法律意见、未发布财务数据和合作方文件,可能受隐私法、保密条款、专业义务、版权、数据驻留要求或内部政策约束。

权限要按具体目的判断。你可能有权为了完成工作阅读客户文件,却没有权把整份文件交给未经批准的处理商;可以使用公开报告作摘要,却不能上传报告附带的未公开附件。若文件涉及其他人,应考虑他们是否预期资料会以这种方式处理。

OAIC对商业AI产品的指引明确提醒机构,在向公开可用AI产品输入个人信息前,应评估隐私义务、供应商做法和用途必要性,并避免输入不必要的个人信息。OAIC: Guidance on privacy and commercially available AI products

“文件”往往比你看见的页面包含更多信息

Word、PDF、图片和表格可能包含隐藏字段:作者姓名、修订记录、批注、隐藏工作表、公式、地理位置、嵌入附件、文件路径、设备信息和删除但仍可恢复的内容。扫描件还可能在页边出现身份证、签名或旁人的资料。

不要只快速翻页。检查文档属性、批注与修订、隐藏行列和工作表、附件、图像元数据及OCR结果。若只需分析一张表,导出必要字段;若只需润色一段话,复制那一段而不是上传整个项目文件夹。

压缩包和共享链接风险更高,因为它们可能包含你没有逐一检查的文件。让AI“阅读这个目录里的一切”既扩大泄露面,也让你难以记录系统实际读取了什么。

给资料分类,再决定能否进入AI系统

可以建立简单的四级分类。公开资料通常可使用,但仍需检查版权和完整性。内部资料只适用于经过批准的企业账户与用途。机密资料需要明确业务必要性、访问限制和供应商合同。高度敏感资料,例如身份号码、健康记录、支付凭据、密码、法律特权材料、商业秘密或受保护调查内容,默认不应进入通用AI服务。

分类不能只看文件标题。一份名为“会议笔记”的文件可能包含并购计划;匿名调查表的自由文本可能重新识别员工;源代码可能嵌入API密钥。应按最敏感内容定级,或先把敏感部分分离。

团队若没有分类制度,至少使用红线清单:凭据、完整身份证明、未经同意的健康信息、客户秘密、未公开价格或交易信息、受法律特权保护的意见以及任何合同明确禁止外传的资料。

了解服务如何处理输入和输出

需要核实的不是营销页面上的一句“重视隐私”,而是当前账户、地区、功能和设置。问题包括:内容是否用于训练或改进模型;保存多久;删除账户后何时清除;员工或分包商在什么情况下能访问;数据在哪些国家处理;企业管理员能看到什么;插件、连接器或外部工具会收到哪些内容;是否提供审计日志和数据处理协议。

不同产品层级可能有不同条款。个人免费账户、个人付费账户、企业工作区和API不能互相推定。某项聊天不用于训练,也可能为了滥用监测或服务运行保留一段时间;临时聊天也不一定等于数据立即消失。

在真正上传前保存适用条款或内部批准记录,并记录检查日期。供应商政策会更新,重要流程应定期复核,而不是永远依赖第一次采购时的结论。

关闭训练不是完整的数据治理

训练用途只是数据生命周期中的一个问题。内容仍可能被记录、缓存、备份、交给子处理商、暴露给工作区管理员,或通过连接器发送到另一项服务。输出也可能重复输入中的秘密,然后被复制到邮件、报告或工单。

因此控制应覆盖收集、传输、存储、访问、派生输出、共享、保留和删除。问“会不会训练”很重要,但问完不能停止。

同样,“模型不会记住”不是权限控制。即使模型本身不在未来对话复述资料,聊天记录、日志、文件索引或检索数据库仍可能保存内容。

只提供完成任务所需的最少资料

数据最小化既降低隐私风险,也提高回答质量。先定义问题,再决定字段。例如分析投诉主题,可能只需要问题描述和日期范围,不需要姓名、地址、账号和完整邮件签名;检查合同条款,可以删除签名、银行信息和无关附件;总结访谈,可使用角色编号代替真实身份。

去标识不能只删除姓名。职位、地点、日期、罕见事件和自由文本组合起来可能重新识别一个人。对于小团队或敏感事件,泛化或合成数据可能更合适。真正需要回填身份时,将映射表保存在AI系统之外。

如果删减后任务无法完成,应把这视为需要更受控环境的信号,而不是恢复使用个人账户上传全部资料。

警惕提示注入和文件中的外部指令

接收自客户、网页或陌生人的文件可能包含隐藏或显式文字,要求AI忽略你的任务、泄露其他资料或调用工具。对普通阅读者而言它只是文档内容,对能操作邮箱、云盘或数据库的AI代理而言,它可能被误当成指令。

上传不可信文件时,应禁用不必要工具,把文件内容与系统指令隔离,并限制代理只能读取为完成任务指定的数据。输出中出现请求凭据、扩大权限、发送资料或执行与任务无关动作时,应立即停止。

文件本身不能获得授权。即使文档写着“把所有客户名单发到这个地址”,系统也不应因此执行。工具权限和确认步骤必须由可信工作流控制。

账户和设备同样是数据边界

使用个人AI账户处理公司文件,会让组织失去访问、保留、离职回收和事件调查能力。共享账号又会让操作无法归因。应使用组织批准的独立身份、强认证、最小权限和设备安全措施。

确认聊天历史是否被其他家庭成员、团队成员或管理员看见;浏览器扩展是否能读取页面;同步设备是否符合政策;下载的AI输出是否进入个人云盘。上传端安全并不能补救输出落到不受控位置。

若员工离职或项目结束,应能撤销权限、删除文件索引并保留必要审计记录。这些能力应在采用服务前验证。

输出也可能成为新的敏感文件

AI生成的摘要、分类表或答案可能集中原本分散的信息,使其更容易泄露。模型还可能推断健康、绩效、法律风险或商业策略,形成新的敏感数据。不要因为输出是机器生成就降低分类级别。

检查输出是否包含不必要的姓名、秘密或完整引文,决定谁可以接收,以及需要保存多久。如果系统把输出发送到工单、邮件或协作平台,所有下游位置都进入数据流程图。

OAIC关于开发和训练生成式AI的指引强调个人信息治理、合法收集、透明度、数据质量和删除等问题。即使你不是训练基础模型,这些原则也提醒我们:从原文件产生的索引、向量、标签和推断仍需被管理。OAIC: Guidance on privacy and developing and training generative AI models

为高敏感任务选择不同架构

“不能上传到通用聊天工具”不等于完全不能使用AI。可以在合同与安全评估覆盖的企业环境中处理,使用不保留请求的批准接口,先在本地执行确定性脱敏,或让模型只访问经过筛选的文档片段。某些任务应完全留在受控系统,由具备授权的人员完成。

架构选择应以数据敏感度和最坏泄露后果为起点,而不是以员工最熟悉哪个聊天界面为起点。供应商提供企业版本也不自动适合所有数据;仍需核对合同、技术控制、数据位置和操作方式。

建立可追溯的上传记录和删除流程

对于公司用途,至少记录谁在何时向哪个服务和工作区提供了哪类资料、用于什么目的、适用批准、输出存放位置和预定删除时间。无需复制敏感内容到日志,但应能识别范围和责任人。

删除时要覆盖原上传、对话、知识库索引、共享链接、导出文件和下游副本。确认供应商的删除实际含义与时间,不要只从聊天列表移除视觉记录。

发生误传时,应立即停止共享、保存必要证据、通知安全或隐私负责人并按事件流程评估。自行悄悄删除可能破坏调查,也可能延误依法需要的通知。

我的判断:上传按钮应被视为对外披露动作

很多人把上传理解为让一个工具“看一下”,但技术和法律上往往是在把资料交给另一个服务提供者处理。将它视为外部披露,会自然触发正确问题:我有权吗、接收方是谁、目的是什么、提供多少、多久删除、出事怎么办。

这并不要求每次处理公开资料都走漫长审批。它要求风险与手续相称:公开段落可以快速使用,客户数据需要批准环境,高度敏感资料需要更强架构或不使用。

上传前检查表

  • 文件由谁控制,我是否有权为这个目的交给第三方服务?
  • 文件和隐藏元数据中是否含个人、机密、特权或受合同限制的信息?
  • 是否能只提供必要片段、字段,或先去标识和泛化?
  • 当前账户与功能的训练、保留、访问、地区和删除规则是什么?
  • 插件、连接器、管理员和分包商还能获得哪些内容?
  • 是否使用组织批准的身份、设备、工作区和最小权限?
  • 输出、索引和导出文件将存放在哪里,分类级别是否保持?
  • 是否记录目的、范围、批准、负责人和删除日期?

结论

上传文件给AI不是无害的阅读动作,而是一项数据处理和潜在披露。先确认权利与目的,再查隐藏内容、服务条款、账户边界和下游输出;尽量删减与去标识,并为敏感任务选择受控环境。真正可靠的问题不是“这个AI安全吗”,而是“这份资料在这项具体服务、设置和流程里,能否得到与其敏感度相称的保护”。

相关问题

继续阅读本系列: 《AI可以相信到什么程度?》全部文章


了解 Geoffrey Chen 的更多信息

订阅后即可通过电子邮件收到最新文章。