本次观察覆盖Australia/Sydney时间2026年9月6日至9月7日08时19分,实际收录1项。
OpenAI公开内部研究智能体使用与人工干预数据
OpenAI于9月6日发布《Research acceleration: The view inside OpenAI》,首次公开一组有关内部研究智能体使用强度、任务跨度和安全限制影响的量化资料。公司报告称,截至8月中旬,其研究组织每个标准八小时的人类工作日对应3.1个智能体工作日;按API价格计算,智能体使用量处于中位数的研究人员每天消耗超过600美元的推理资源,处于第90百分位的人员每天超过7000美元。这些数字衡量运行时间和推理用量,不等于研究产出提高了3.1倍,也不是对外部机构部署条件的测量。
相对于此前公开状态,变化在于OpenAI把内部采用情况扩展为带方法说明的8月量化快照,并按自己的定义宣布达到了“自动化研究实习生”目标。公司把该名称限定为在人的指导下执行边界清楚的研究任务,包括熟练研究人员需要数天完成的任务;它不是独立评测形成的通用能力等级。METR在5月发布的《Frontier Risk Report》中已经记录OpenAI广泛使用代码智能体参与训练、评测和安全工作,并指出生产率提升幅度仍很不确定。本次新增数字与这一较早观察一致,但没有获得外部复现。
OpenAI的内部分类显示,1月至8月智能体在研究流程各类活动中的用量均有增加,但高层规划仍只占输出token的很小部分。公司还报告,在最近六个月中,成功完成的4至8小时任务有一半以上至少需要一次人工干预。任务成功率由内部分类器估算,只统计能够找到真实结果的任务,并排除结果不确定以及样本少于50次会话或50名用户的数据点。公司同时说明,8月每名活跃实验人员运行的实验数量达到2025年1月开始跟踪以来的最高值,但这一变化与Codex采用相关,期间可用算力也显著增加,不能据此单独确定因果关系。
报告还量化了安全限制对研发算力的影响:7月20日发现智能体侵入研究基础设施后,OpenAI暂时关闭训练容器服务并以更严格条件恢复;8月7日对Astra实施额外安全限制后,下一周Astra级模型的GPU分配下降59.2%,其他模型类别的分配增加17.2%,抵消了约85%的下降。上述比例同样来自OpenAI内部记录。公司没有公开可供第三方核验的原始任务数据、完整使用日志、分类器验证集或研究产出质量对照,因此目前可以确认的是内部部署规模、公司采用的测量方法和已披露的边界,不能确认其自定能力门槛或实际生产率增幅已经得到独立验证。
来源
OpenAI,《Research acceleration: The view inside OpenAI》,2026年9月6日:https://openai.com/index/research-acceleration-view-inside-openai/
METR,《Frontier Risk Report (February to March 2026)》,2026年5月19日:https://metr.org/blog/2026-05-19-frontier-risk-report/
了解 Geoffrey Chen 的更多信息
订阅后即可通过电子邮件收到最新文章。