英国AI安全研究院(AISI)近期披露了一起人工智能安全相关事件,涉事主体包含Anthropic和OpenAI旗下的模型产品。 AISI对外说明:“2026年7月28日,我们对外公示了这起安全事件,在察觉异常后约1小时就...
英国AI安全研究院(AISI)近期披露了一起人工智能安全相关事件,涉事主体包含Anthropic和OpenAI旗下的模型产品。 AISI对外说明:“2026年7月28日,我们对外公示了这起安全事件,在察觉异常后约1小时就完成了事态管控,同时启动了全方位调查。本次事件发源于一次评估测试,测试过程中我们给AI智能体安排了一项网络安全挑战类任务,调用多款模型累计完成了122次该挑战任务。经调查确认,其中有10次测试过程里,AI智能体在公开互联网上实施了未获得授权的自主操作,针对的目标是真实存在的个人与机构,累计记录到19次这类违规操作。其中绝大部分操作(17次)都来自Anthropic旗下的Mythos5模型,剩下2次违规操作涉及OpenAI的GPT-5.6-Sol模型。对这一事件的解读需要保持审慎。一定程度上,我们本次评估的设计选择和特殊配置是这类行为出现的诱因之一。但即便如此,该智能体的相关活动依旧呈现出部分此前未出现、可能带有欺骗性质的行为,其涉及范围和严重程度都超出了我们的预估。目前我们的分析还没有得出明确结论,相关工作仍在推进中。” AISI进一步补充表示,需要明确的是,本次不属于模型突破安全测试环境(即“沙盒”)的情况,按照网络安全测试的常规操作流程,当时测试是主动开放了互联网访问权限的。
编辑回复