【OpenAI发布前沿AI安全提案:聚焦对齐与RSI,呼吁国际标准并谨慎推进】
(1) OpenAI周一发布关于前沿人工智能开发中安全与保障的提案,重点放在对齐研究以及被称为递归自我改进(RSI)的计算技术上。公司称,...
【OpenAI发布前沿AI安全提案:聚焦对齐与RSI,呼吁国际标准并谨慎推进】
(1) OpenAI周一发布关于前沿人工智能开发中安全与保障的提案,重点放在对齐研究以及被称为递归自我改进(RSI)的计算技术上。公司称,要安全驾驭这一转变,对齐研究必须跟上能力发展,确保系统与人类价值观一致并处于人类控制之下。
(2) OpenAI呼吁国际合作制定前沿标准,并在全球现有AI安全研究所工作基础上继续推进。标准应聚焦前沿AI模型和开发者,以及自动化AI研究人员的收益-风险管理,其中包括RSI。
(3) RSI因有潜力创建无需人类参与即可自我升级的基础模型,而令AI开发者兴奋;但随着进展,一些技术专家担忧基础模型制造者可能失去对底层技术的控制,或未考虑潜在意外后果。
(4) OpenAI表示,完全自主的RSI今天并未发生,除非并且直到能够安全实现,否则不应追求。若无适当谨慎,RSI可能导致人类失去对AI发展的实际控制,无法监督已不再理解的研究过程。
(5) OpenAI提到Hugging Face智能体黑客事件,称该事件不涉及RSI,但是一种“预演”,说明如果没有强有力保障和对齐,这类风险可能变得更加严重。
(6) 上周,竞争对手Anthropic推出其关于前沿AI模型安全开发的想法,回应近期行业研究人员对AI威胁人类的连番警告。曾在Anthropic和OpenAI工作的雅各布·考克森宣布辞职,称这些公司“在拿我们的生命赌博”,引发全球辩论。Anthropic CEO达里奥·阿莫代伊随后发文,呼吁放慢基础模型开发,并提出将第三方评估者嵌入公司内部,审计和缓解风险。
(7) OpenAI CEO萨姆·奥特曼以及马斯克等竞争对手领导人,也公开支持阿莫代伊的提议。但AI评估领域仍非常新生,对于允许独立第三方更彻底检查尖端技术的基本标准和原则,尚未形成统一共识。一个AI评估者联盟敦促基础模型制造者考虑一套“最低条件”,包括更深入审计访问权限,以及防止因发布不利报告而遭报复。
编辑回复