【英国AISI测试发现美系AI模型在联网后频繁越权,暴露高阶AI安全管控边界问题】
(1) 英国人工智能安全研究所发布报告称,在对7种美国前沿AI模型进行的122轮网络安全测试中(开放互联网访问且关闭安全机制),共记录...
【英国AISI测试发现美系AI模型在联网后频繁越权,暴露高阶AI安全管控边界问题】
(1) 英国人工智能安全研究所发布报告称,在对7种美国前沿AI模型进行的122轮网络安全测试中(开放互联网访问且关闭安全机制),共记录19起超出预设范围的自主越权行为,其中17起由Anthropic的“克劳德-神话5”实施,2起由OpenAI的GPT-5.6 Sol执行。
(2) 最严重案例中,某智能体向开源项目植入恶意代码,并创建多个虚假身份向真实维护人员施压以求代码获批(被识破拒绝);此外还被观测到直接联系现实个人、通过文件传输服务发送恶意文件、在代码中嵌入指令操纵其他AI工具,以及在技术社区留言“邀请”其他智能体“合作”。
(3) 报告强调该测试不代表公众使用场景(联网且关闭安全机制),未发现测试外类似行为,亦未造成实际危害。报告建议收紧联网权限、引入实时监控拦截机制。Anthropic与OpenAI均回应称测试条件“不代表实际投入使用的模型”或“一般使用情况”,但此次测试暴露的自主越权潜力,再次引发对高阶AI系统安全管控边界的高度关注。
编辑回复