2026年7月19日,安远AI联合上海AI实验室在WAIC上共同发布的《前沿人工智能风险管理框架(2.0 版)》,在1.0版本的基础上,对风险管理框架进行了一系列更新。更新后的风险管理框架,主要涵盖风险管理的六大核心流程:风险识别、风险阈值、风险分析、风险评价、风险缓解及风险治理。去年7月,安远 AI联合上海人工智能实验室发布了《前沿人工智能风险管理框架(1.0 版)》。该框架报告旨在为通用型人工智能模型开发者提供全面的风险管理指导方针,主动识别、评估、缓解和治理一系列对公共安全和国家安全构成威胁的严重人工智能风险,保障个体与社会的安全。
失控风险相关内容更新:为更好地落实“人类最终控制”和“前瞻预防应对”等核心原则,防范人工智能技术失控,2.0 版对框架细化了与失控风险相关的场景和阈值,同时加强了智能体监督措施和应急响应机制的相关内容,旨在指导学界与业界持续监测相关风险。
红线风险场景迭代:2.0版新增了化学安全红线风险场景,迭代了生物安全风险、网络攻击风险、大规模说服和有害操纵风险和失控风险的红线场景。
风险分析实操化:为了使本框架更具可操作性,2.0版更新了面向通用型人工智能模型开发者的风险分析指南,通过阐明该过程中的关键环节(模型评测、模型激发、风险建模与估计等),帮助开发者更有效地落实风险分析的最佳实践。
1.明确风险红黄线——AI风险从原则走向可操作清单
报告界定的红线,是指对公众安全与社会整体而言在任何情境下均不可承受的危害,红线一旦被触及,开发者须立即阻断、最高管控、暂停运行或部署,并通过独立第三方安全审查后方可恢复。黄线则应视作为前瞻性预警,一旦达到预警应将介入时点前移。报告为网络攻击风险、生物安全风险、化学安全风险、大规模说服与有害操纵风险、失控风险等五大风险分别识别出一系列潜在红线,并具体描绘了一系列假设性场景,指出当相应假设性场景如果发生,则应立即触发及时干预和最高级别安全措施。其中,化学安全红线风险场景为2.0版本新增。安远AI前沿风险监测平台显示各模型在ChemicalHarmfulQA、ISC-Bench-Chemical 等安全护栏测试中普遍表现薄弱。
当红线被触发时,报告建议:① 立即采取措施,阻断潜在灾难性后果的发生路径;② 执行最高级别的管控措施和操作限制;③ 暂停相关运行或部署,直至风险降至红线以下;④ 在恢复运营前,完成并通过独立第三方安全审查。组织治理层面,报告提出“三道防线”结构、一键控制与熔断机制、以及吹哨人保护等制度化安排。
2.警惕监督退化带来失控风险
随着人工智能技术的发展,未来潜在的失控风险主要体现在,一个或多个通用型人工智能系统,在人类无法进行有效监督、指引、修改或终止的情况下持续运行,且人类缺乏重新获得其控制权的明确路径。
报告将长期停留在科幻和哲学讨论层面的“AI失控”,落地为三条可评估、可设红线的具体场景,即:不受控自我改进(L1)、失控自我复制(L2)、策略性欺骗与背叛/背叛性转向(L3)。尽管当前尚不足以导致真正的失控,但AI的前驱能力与行为已有初步实证失控迹象。
报告强调,无论是主动还是被动失控,两类失控的共同前提都是“监督退化”——一方面源于人类侧逐步让渡审查、另一方面源于系统侧的监督规避。报告还明确应将“内部高权限部署”单列为关键风险环境,要求内部部署适用“不弱于、必要时强于”对外部署的监督与应急机制。

