2026年7月19日,安远AI在世界人工智能大会(WAIC)上发布了“前沿AI风险监测平台2.0”,其包含了“风险指数2.0版”、“2026 Q2风险监测报告”、“前沿AI风险测评基准数据库”三项重要更新,以及一项生态合作成果“前沿大模型自主网络渗透评估报告”。

前沿AI风险监测平台(以下简称“平台”)是安远AI研发的一个评估和监测前沿AI灾难性风险的第三方平台,系统评估模型在网络攻击、生物风险、化学风险、有害操纵和失控五个领域的风险表现,旨在为政策制定者、模型开发者和第三方研究者了解前沿模型的风险水平及其变化趋势提供参考,并对潜在新兴风险提出预警。目前平台累计已监测了16家领先AI公司的80多个前沿模型。

风险指数2.0版
本次平台全面升级到风险指数2.0版,集成两大升级:

风险指数2.0版
-
风险指数公式更贴近前沿能力-风险增长规律。 为了更准确地建模风险与能力、安全性的关系,我们重新设计了新的风险指数计算公式。在1.5版及更早版本的风险指数公式中,风险指数与能力成正比,分布在 0~100 的区间内。在2.0版中,风险指数改为能力分的指数函数,更符合模型能力提升对滥用规模和失控风险的放大效应。当模型能力分低于能力黄线阈值C0时,风险增长相对平缓;一旦能力分超过黄线阈值,风险会随能力提升而加速增长。指数函数的加速程度符合METR关于模型可自主完成任务时长每八个月翻一倍的研究发现。 -
安全分从单一指标细分为三类防线。对网络攻击、生物风险、化学风险、有害操纵等滥用风险,2.0版将总安全分拆为基础安全分S1、越狱安全分S2和篡改安全分S3:基础安全分衡量模型面对普通有害请求时的拒答表现;越狱安全分衡量模型在红队攻击下的安全下限;篡改安全分衡量模型抵抗恶意微调、参数编辑等防护移除手段的能力。总安全分是三类安全分的加权平均,权重通过三类攻击者的潜在数量及其个体影响力进行估算。
-
新增能力黄线和风险黄线,给出更清晰的高风险锚点。能力黄线阈值C0参考多家机构的模型风险评级进行综合计算,达到能力黄线意味着模型能力在无防护条件下已足以显著放大滥用和失控风险。该阈值风险黄线阈值R0跨领域归一化为100,表示结合实际安全防护后,模型的剩余风险仍达到高风险边界。简单说,能力黄线是“能力进入高风险边界”的预警线,风险黄线是“现有防护不足以把风险压回中低水平”的行动参考线。
-
能力测评新增CVE-Bench、BixBench、FrontierScience。 分别对应该评估模型利用真实Web应用漏洞的能力、完成真实生物信息学长程任务的能力和高难度科研场景中的潜在风险能力。 -
安全测评新增FRT(Frontier Red Teaming)红队框架。 FRT是安远AI自研的组合式红队测试框架,核心结构是“风险数据集 × 攻击方法 × 评分器”:风险数据集提供有害请求,攻击方法将原始请求改写或包装成越狱提示,评分器判断模型回答是否构成攻击成功。FRT收集了从2023到2026年出现的100多种攻击方法,从中筛选22种成功率最高的攻击方法,再筛选出7种对模型能力影响最小的方法,最后为每个模型选择最有效的3种攻击方法,进行最终的评估。

FRT红队测评框架
平台链接
[1] 前沿AI风险监测平台:https://airiskmonitor.net/ [2] 风险指数2.0版升级说明:https://airiskmonitor.net/doc/zh/report/2026-Q2-Appendix#appendix-risk-index-v2注:平台尚未适配移动端,建议在PC端打开上述链接
2026 Q2风险监测报告
- 网络、生物、失控风险指数不到一年增长数倍,各领域均有多个模型突破能力黄线
- 模型风险重心分化:Gemini 3.1 Pro Preview生物风险与失控风险指数最高,DeepSeek V4 Pro网络攻击滥用风险更突出
- 闭源模型继续主导多领域能力上限,开源模型在网络、生物、化学和有害操纵防护上整体更弱
- 领先模型的长程漏洞利用和网络渗透能力快速提升,但提示词注入等安全防护反而退步
- 湿实验排查与序列理解已有超十款模型超过人类专家水平,但生物拒答等基础安全防护未同步进步
- 最新季度失控风险未创新高,但诚实性不足和暗中影响用户倾向仍暴露安全短板
- 高级越狱攻击下网络攻击、生物风险、化学风险、有害操纵平均安全表现大幅下降

报告全文链接
[1] 《前沿AI风险监测报告(2026Q2)》中文版: https://airiskmonitor.net/doc/zh/report/2026-Q2[2] 《前沿AI风险监测报告(2026Q2)》英文版:https://airiskmonitor.net/doc/en/report/2026-Q2
测评基准数据库
除了风险指数2.0版和2026 Q2报告,本次安远AI还同时发布了“前沿AI风险测评基准数据库”。对于AI安全测评研究人员来说,寻找合适的测评基准(Benchmark)一直是一个痛点,其信息散落在各种论文、Github代码库、HuggingFace仓库、模型系统卡或独立网站上,查找相当不便。“前沿AI风险测评基准数据库”收录了前沿AI风险领域自2023到2026年间的200多项测评基准,按风险领域、测评类型、测评功能点、测评对象类型、开源状态等属性分门别类,可以大大提升研究人员查找和对比测评基准的效率。
除了基于属性查找测评基准,该数据库还独创了基于风险模型的测评基准组织方法。参考《前沿AI风险管理框架2.0》,对网络攻击、生物风险、化学风险、有害操纵、失控等领域列出相应的风险场景,每个风险场景可关联能力、倾向、护栏这三类测评功能点,再按照这些测评功能点列出相关的测评基准列表。通过这种关联,研究人员可以建立测评基准和风险场景的映射关系,从简单的“跑分”进步到“能根据测评结果进行风险评估”。

前沿AI风险测评基准数据库
前沿AI风险测评基准数据库链接
[1] 测评基准列表:https://airiskmonitor.net/benchmark/list [2] 风险模型:https://airiskmonitor.net/benchmark/risk前沿大模型自主网络渗透评估报告
-
一个通用的智能体测评框架,包含任务规划、记忆、工具调用等能力,框架未针对渗透任务进行定制化设计。 -
300个包含真实CVE漏洞靶机,含Tier 1和Tier 2两个不同难度等级,其中带漏洞服务和无漏洞服务的比例分别为1:1和1:3。

大模型自主网络渗透评估环境
报告链接
[1] The Emergence of Autonomous Penetration Capabilities in Large Language Model-Powered AI Systems, https://arxiv.org/abs/2606.13079合作机会
-
已有测评基准集成:我们可集成合作伙伴研发的、前沿AI风险领域内先进的能力和安全测评基准,持续跟踪前沿模型在这些基准上的表现。 -
测评基准合作研发:针对网络攻击、生物风险、化学风险、有害操纵和失控等重点领域,我们可与合作伙伴一起研发缺失的测评基准、改进现有基准的测评方法。 -
风险评估合作研究:我们的风险评估不局限于测评,也希望与合作伙伴一起,通过更好的威胁建模和真实案例分析来衡量模型可能造成的实际危害。 -
模型发布前风险评估:我们可为合作伙伴研发的模型在发布前进行前沿风险评估,并提供缓解建议,助力模型安全发布。 -
风险防范和缓解实践:我们可将平台监测到的风险预警信息共享给合作伙伴,以便对风险预警进行及时响应,及时缓解潜在重大风险。
