OpenAI同日发布两份文件:AI加速时代,安全正在掉队

📅 2026-09-07

摘要:

在外界等待OpenAI就Agent自主入侵德国程序员网站DseWiki事件披露更多细节之际,当地时间9月6日,OpenAI发布两份文件:宣布公司已达到去年设定的目标,拥有能够在人类指导下完成熟练研究员数天工作的“自动化研究实习生”;另一份则由首席科学家雅库布·帕乔基(Jakub Pachocki)撰写,聚焦前沿AI发展的安全困境,强调目前没有任何实验室解决足够程度的对齐和监控问题。

两份文件释放的是OpenAI对当前AI发展阶段的一次完整描述:AI已经开始反过来加速AI研发,但安全、对齐和人类控制能力并没有被证明能够以同样速度增长。

OpenAI所称的“自动化研究实习生”并不是一个完全自主的科学家,而是能够在人类指导下完成定义明确、通常需要熟练研究员数天才能完成的研究任务,且正朝着2028年3月建立“自动化AI研究员”的目标推进。

数据显示,截至今年8月中旬,研究人员每天使用编程Agent产生的推理费用中位数超过600美元,使用量排名前10%的用户每天耗费token超过7000美元。Agent承担的任务正在从代码编写、基础设施排障向更长周期、更复杂的研究工作扩展。

这意味着,AI对AI研发的影响从辅助程序员写代码,开始进入实验、分析和研究执行环节。

但同时,OpenAI也承认,这些指标仍处于早期阶段,研究工作的整体进度不会简单等比例增长,且复杂任务仍需要大量人工介入;过去半年,成功完成4至8小时人类工作量的任务中,超过一半仍至少需要一次人工干预。

趋势已经足够明显:AI正在成为推动下一代AI能力增长的生产力工具。


与能力增长同时出现的,是安全边界的收紧。

7月,OpenAI披露模型入侵Hugging Face相关系统;8月,GPT-6 Astra达到“关键级”网络安全能力门槛;9月,研究人员披露的DseWiki事件进一步显示,Agent不一定需要传统意义上的“黑客攻击”才能突破开发者预设边界。

上述事件的共同点,是模型的实际行动开始超出开发者最初设计的行为边界,这也是帕乔基目前最担忧的问题。他在今日发布的文章中回顾了2023年内部推理模型研究取得突破时的心情:当时让他真正感到震撼的并不是模型在测试中的分数,而是人类可能正在进入一个“机器比我们更聪明”的时代。

三年后,他认为这个问题已经不再遥远。


帕乔基写道,目前没有任何实验室将AI的对齐和监控做到足够可靠,以便在未来较长时间内继续以最高速度负责任地扩展。他希望在共同的安全标准建立之前,各家实验室能够自愿放慢发展速度,并呼吁各国政府把国际协调提升为优先事项。

这份担忧并非针对某一个具体漏洞,而是针对一个更加根本的速度差:模型能力正在快速提升,但人类理解、监控和约束这些系统的能力未必同步。

这与OpenAI今日公布的研究加速数据形成直接呼应。公司一方面正在用Agent加快AI研发,同时承认无法假设对齐和安全能力一定能够追上模型能力,且更强大的系统可能更难监控。如果未来AI能够参与设计、训练和改进下一代AI,这个差距还可能进一步扩大。

基于此,帕乔基认为,随着机器智能进入新的发展阶段,仅依靠单个AI公司的内部机制可能不足以解决风险,需要更广泛的制度性干预,包括共同的安全标准和国际协调。

关联标签

相似文章

评论

0/500
验证码(点击图片刷新)
暂无评论