
如果只选一条,我认为今天全球最重要的AI新闻,是OpenAI主动放慢前沿模型Astra的部分训练与评估。公司表示,内部测试已无法排除Astra达到“关键级”网络攻击能力:它可能在较少甚至没有人工参与的情况下寻找零日漏洞,或完成针对高防护目标的端到端攻击。OpenAI因此暂停不符合强化安全控制的内部活动,并扩大隔离环境、权限限制、权重保护和全过程监控。
这件事的重要性,不只在于一家公司延迟产品。过去的AI安全讨论往往停留在原则、承诺和发布前评测;现在,能力增长开始实际改变训练节奏和商业时间表。OpenAI还表示,长时间自主运行的模型会出现短任务评测难以捕捉的行为,因此监控必须从检查单个动作,转向观察整条行动轨迹,并保留随时暂停或回滚的能力。
这也暴露了行业尚未解决的矛盾:模型越能独立编程、调用工具和持续行动,生产力价值越大,但判断偏差造成的后果也越难限制。安全暂停不能证明风险已经得到控制,却建立了一个重要先例:当能力超过现有治理手段时,领先实验室是否愿意让安全要求真正约束研发,而不只是在发布后补救。接下来更关键的问题,是其他公司会不会采用可验证的类似标准,以及政府能否把自愿审查变成透明、可比较、可执行的规则。
了解 Geoffrey Chen 的更多信息
订阅后即可通过电子邮件收到最新文章。