2026年7月19日,安远AI与上海人工智能实验室在世界人工智能大会(WAIC)2026上联合发布《前沿人工智能风险管理框架 2.0》(以下简称《框架》)。《框架》面向通用人工智能模型开发者,围绕如何主动识别、评估、降低和治理可能危害公共安全与国家安全的严重风险,提出了一套系统化的方法。
《前沿人工智能风险管理框架》于2025年7月首次发布1.0版,2026年2月更新至1.5版,本次发布的2.0版是第三个公开版本。《框架》参考了安全关键行业的风险管理标准和实践,并与ISO 31000:2018、ISO/IEC 23894:2023和GB/T 24353:2022等国内外标准保持一致。整体流程包括风险识别、风险阈值、风险分析、风险评价、风险缓解和风险治理六个阶段,覆盖模型全生命周期,形成完整的风险管理闭环。在这套流程基础上,《框架》提出“部署环境—威胁源—使能能力”(Environment–Threat Source–Capability,简称E-T-C)三维分析方法。开发者不仅要评估模型“能做什么”,还要分析模型“在哪里运行”以及“可能因为什么出错”,再根据不同风险采取部署控制、访问限制、移除危险能力等措施。
在风险阈值方面,《框架》用“红线”表示不可容忍的危害,用“黄线”表示需要提前干预的预警信号。风险缓解后的剩余风险按这两条线划入三个风险区:低于黄线为绿区(可以常规部署),介于黄线与红线之间为黄区(只能在受控条件下部署),达到或超过红线为红区(应暂停部署或研发)。不同分区对应不同强度的授权、风险缓解和治理要求。
自1.0版本以来(含1.5版与2.0版的迭代),《框架》的主要更新包括:
- 失控风险相关内容更新:细化失控风险的场景与阈值,加强智能体监督措施和应急响应机制。2.0版进一步将“监督退化”(loss of oversight)纳入框架,作为贯穿被动失控与主动失控的共同前提,并将内部高权限部署认定为关键风险环境;
- 红线风险场景迭代:2.0版新增化学安全领域的红线场景,更新生物安全、网络攻击、大规模说服与有害操纵、失控四个领域的红线场景。目前共覆盖五个风险领域,设置13条具体红线,每条红线均从部署环境、威胁源和使能能力三个维度界定,并附有假设场景;
- 风险分析实操化:更新面向开发者的风险分析指南,明确模型评测、模型激发、风险建模与估计等关键环节;
- 互操作性增强:对照全国网络安全标准化技术委员会TC260《人工智能安全治理框架2.0》和欧盟《通用人工智能模型行为准则》安全与安保章节,对各项风险管理措施逐条映射,帮助开发者用一套措施对接国内外主要监管指南共同提出的安全要求。
其中,监督退化可能同时来自人和系统两个方面:人类一侧可能在自动化偏差、系统复杂性和竞争压力下逐渐放弃实质性审查;系统一侧则可能在意识到自己正被评估时改变行为,使外显推理与真实意图不一致,甚至干扰日志和监控渠道。《框架》建议将持续监测监督退化作为失控风险治理的一项独立目标。
《框架》同时指出,目前这些红线主要基于前沿安全领域的专家判断和国际上的新兴讨论,尚未形成充分的跨领域共识。因此,这些红线更适合作为开发者主动采取的审慎承诺:在行业共识和监管制度尚未完全建立之前,先通过自我约束防范最严重的风险。
《框架》是一份持续更新的动态文件。发布方将定期检查其内容和实际应用情况,并每半年集中整理和吸收各方意见。发布方希望,《框架》能够为前沿模型开发者、政策制定者,以及第三方研究和评测机构提供一套可参考、可比较、可落地的风险管理方法,并欢迎各方围绕《框架》的实际应用开展合作。

