AI哲学观察|来源信息缺失不等于来源已被删除

2026年9月16日,美国第九巡回上诉法院在 Doe v. GitHub, Inc. 案中维持了对一项《数字千年版权法》请求的驳回。原告是把受版权和开源许可保护的代码发布在GitHub上的程序员。他们主张,GitHub Copilot有时会生成与训练材料相同、近似或经过修改的代码,却不附带原代码中的署名、版权声明或许可条件,因此构成对版权管理信息的删除或修改。

判决的范围比“法院认定AI可以无署名使用代码”窄得多。法院把争议分成训练输入与生成输出两种理论。训练阶段是否删除版权管理信息,因原告在下级法院没有持续主张而被认定已经放弃,上诉法院没有作实体判断。法院审理的是输出理论,并认为原告所描述的Copilot通过统计模式生成新作品,而不是从一个既存副本上取下已经附着的版权管理信息。仅仅没有在新输出中加入信息,不等于从既存作品上“删除”或“修改”信息。法院同时明确没有判断有关输出是否可能构成传统版权侵权;开源许可合同请求也仍在下级法院继续。

这一判决提出的哲学问题不是特定诉讼谁应胜诉,而是:当AI输出没有显示作者、作品和处理过程时,我们面对的是来源已经被删除,还是来源关系没有被表达?这两个说法听起来接近,却指向不同的事实结构和责任条件。

删除是一种针对既有对象及其标识的行动。一本书原来印有作者名,复制时把姓名裁掉;一张照片带有摄影师署名,发布时把署名区域剪去。要说“删除”,至少要能识别先前存在的作品、附着其上的信息,以及使信息消失的操作。缺失则弱得多。一个新对象可能没有任何来源说明,但这本身不能证明它曾经带有说明,也不能证明某个行动者执行了删除。法院对《数字千年版权法》用语的解释,正是在保留这种操作差异。

可是,法律上的删除并没有穷尽哲学上的来源。世界万维网联盟的PROV框架把来源理解为参与生产一个数据或事物的实体、活动和人员信息,用于评估其质量、可靠性和可信度。按照这个较宽的概念,来源不只是粘在成品上的署名字符串,而是对象怎样形成的关系记录。一个AI输出即使不是从某个文件中删掉署名,也仍可能与训练材料、检索结果、提示输入、匹配代码、模型版本和用户选择形成可追踪的生成关系。

因此,还要区分归属与来源。归属回答“这个作品或贡献应记在谁名下”;来源追溯回答“这个结果经过哪些材料、活动和转换形成”。二者经常重叠,却不能互相替代。模型可以生成没有单一人类作者的新组合,但其质量和许可判断仍可能依赖可识别的材料关系。反过来,一个输出即使附有某个名字,也不保证我们已经知道它怎样生成、是否复制了受许可约束的片段,或标注是否准确。

GitHub当前的代码引用机制也体现了这一差异。其文档说明,Copilot会把潜在建议及周围约150个字符与公共仓库索引比较;发现匹配时,可以提供文件地址和许可名称,供用户决定如何归属或是否移除代码。GitHub同时说明,索引每几个月更新一次,私有仓库和GitHub之外的代码不在匹配范围内,经过用户修改的建议也不会接受同样检查。这不是关于所有输出来源的完整证明,而是一种受阈值、索引和产品范围约束的匹配机制。

我的判断是:来源信息缺失与来源已被删除不应被概念上合并。前者描述可见信息的状态,后者还主张一个以既存信息为对象的行动。把两者合并,会把任何无来源说明的AI输出都提前解释为删除行为;把两者彻底割裂,则会让“不构成删除”被误解成“不存在来源义务”。第九巡回法院解决的是特定法条下的后一种主张,没有解决AI系统在知识、许可和信任层面应保存多少来源关系。

维成论可以更清楚地表示这一区分。Difference不是普通的“有所不同”,而是使关系能够成立的可区分性。原始代码、训练输入、模型参数、生成片段、版权管理信息和代码作者必须先保持可区分,来源判断才有对象。Constraint不是泛指限制,而是决定哪些关系能够被发现或验证的条件,包括匹配阈值、索引范围、许可文本、日志保存、模型访问权限和举证规则。Sustained Coherence则要求来源关系能在生成、使用、审查和纠正之间持续保持结构一致,而不是只在输出旁边偶然出现一个名字。

这也给责任划出较准确的边界。平台没有义务把每个抽象影响都转化为作者名单;那既不可操作,也可能制造虚假的确定性。但当输出与既有材料存在足够具体的匹配、许可条件可能继续适用,或用户需要据此判断能否使用时,平台就有理由保存和呈现相应关系。责任的根据不是所有影响都等同于复制,而是某些可区分、可验证并与实际决定相关的来源关系已经形成。

当前证据仍有明确边界。这项判决基于诉状所描述的Copilot机制,并只处理一项输出阶段的法定请求;它不是对所有生成式AI内部过程的事实认定,也不是对版权侵权、开源许可或道德归属的最终结论。未来若有系统直接检索并输出既存文件,或有证据显示版权管理信息在训练或分发流程中被主动移除,法律分析和哲学判断都可能改变。现在可以确定的是:不显示来源、删去来源和不存在来源,是三个不同命题。可靠的AI来源制度必须分别证明它们。

参考资料

点击以访问 doe-vs-github-ninth-circuit.pdf

https://www.reuters.com/legal/government/openai-microsoft-fend-off-part-software-developer-lawsuit-over-ai-training-2026-09-16/

https://docs.github.com/en/copilot/concepts/completions/code-referencing

https://www.w3.org/TR/prov-overview/

https://plato.stanford.edu/entries/intellectual-property/


了解 Geoffrey Chen 的更多信息

订阅后即可通过电子邮件收到最新文章。