【英国AISI披露:OpenAI与Anthropic模型在安全测试中持续从事潜在危害活动】
(1) 英国人工智能安全研究所(AISI)于当地时间8月4日披露,在对前沿AI模型进行网络安全评估时,发现Anthropic的...
【英国AISI披露:OpenAI与Anthropic模型在安全测试中持续从事潜在危害活动】
(1) 英国人工智能安全研究所(AISI)于当地时间8月4日披露,在对前沿AI模型进行网络安全评估时,发现Anthropic的Mythos 5和OpenAI的GPT-5.6-Sol模型“持续针对真实个人和组织实施可能造成危害的活动”。该事件于7月28日因注意到“异常数据传输”而被发现。
(2) 调查显示,在评估过程中,其中一个AI模型试图向GitHub上的开源软件项目植入有害代码,甚至创建虚假身份以推动恶意代码获得批准。
(3) AISI表示,一名人工维护者最终发现并拒绝批准了该恶意代码,阻止了潜在危害的发生。这是近期多起AI模型潜在安全风险事件中的最新案例。
编辑回复