
AI 生成一段代码、一份报告或一次资料整理以后,最危险的做法不是使用 AI,而是让同一个生成过程顺手替自己证明“结果没问题”。
更稳妥的工作流应把生成和验收分开。第一阶段追求把候选结果做出来,第二阶段重新读取要求,用测试、事实核对、文件差异或独立评价检查结果是否满足条件。必要时甚至可以让另一个模型或另一轮上下文承担检查,但最后仍要有明确的人类验收标准。
NIST 对 AI 的测试、评价、验证与确认强调的也是这一层结构。AI 能力越强,检查越不应该退化成一句“看起来不错”。生成速度可以交给机器,接受什么结果进入真实系统,仍需要独立证据。
资料:
https://www.nist.gov/ai-test-evaluation-validation-and-verification-tevv
https://www.nist.gov/publications/artificial-intelligence-risk-management-framework-generative-artificial-intelligence
了解 Geoffrey Chen 的更多信息
订阅后即可通过电子邮件收到最新文章。