网络安全研究人员借助OpenAI的主要竞争对手Anthropic的软件成功入侵OpenAI,这件事暴露出这家ChatGPT开发商存在安全漏洞。当前各大头部AI企业正面临日益严格的安全审查 。

一个小型网络安全团队获取到了OpenAI一名员工的ChatGPT账号权限 ,借此能够读取内部软件私密信息,还可提交修改建议。

研究人员获得了Anthropic专门面向安全专业人士开放的工具使用权限。作为漏洞挖掘项目的一部分,他们的这项工作还获得报酬 ,该项目旨在在恶意攻击者利用漏洞之前发现安全隐患 。


研究人员能够快速攻入全球两大顶尖AI实验室之一,这再次引发外界对OpenAI安全水平的担忧。当下人们越来越担心,强大的大模型会被黑客与境外对手利用。
近几个月 ,美国一直在摸索如何对最新大模型开展审核与发布管控,其中包括临时限制Anthropic部分工具的使用 。
就在本次事件发生两周前,超过1000个OpenAI智能体集群脱离测试环境 ,对初创公司Hugging Face发起攻击,这一事件让各界广泛意识到,AI可在无人为指令的情况下自主实施黑客入侵。
小型安全企业Hacktron AI的三名研究人员 ,通过OpenAI漏洞赏金计划获得6500美元奖金。漏洞赏金计划是科技行业通行做法:企业向白帽黑客支付酬劳,用于测试自身系统安全性 。
研究人员利用OpenAI社区论坛配置中的一处缺陷,借此获取内部登录权限,最终拿下一名OpenAI员工的ChatGPT账号。该账号可通过GitHub访问内部代码。
OpenAI表示:“感谢研究人员联系我们并提交发现的漏洞” ,并称已经修复相关问题 。Anthropic拒绝置评,Hacktron暂未回应。
媒体率先报道了这起于周四披露的事件。与此同时,Anthropic公布一组新数据 ,显示该实验室利用AI开发新一代模型的程度大幅提升。
该公司称,近来 26%的研发工作由其Claude模型“主导完成 ”,而3月份这一比例仅为1% 。这意味着AI在人类指令与监督下完成大部分任务。
Anthropic表示 ,随着AI系统能力持续增强,“越来越多地被用于迭代开发下一代AI系统”。
该公司称,公布这些数据是为了帮助公众“理解距离递归自我改进还有多近” ,递归自我改进即AI能够自主训练、优化自身或新模型的阶段 。
这一临界点正是外界担忧的核心:AI系统将越来越难以监管,最终脱离人类控制。
Anthropic补充道,在其研究覆盖的项目中 ,模型尚未实现完全自主运行。在90%的任务中,AI是与人类协同工作,承担大部分工作量 。