不光比智商,还要比“安全商”——三款国产热门大模型实测结果出炉
近两个月来,中国大语言模型密集迭代
MiniMax M3、智谱 GLM-5.2与月之暗面 Kimi K3相继发布
参数规模再创新高,推理能力跨代升级
各项核心性能指标频频刷新纪录
正以破竹之势展开“巅峰对决”
正在国产大模型你追我赶之时
国外大模型安全事件却层出不穷
频频经受“安全拷问”
那么,国产大模型安全能力
如何、能否经得起检验?
日前,瑞莱智慧AI安全团队基于
自研大模型安全评测框架
从三大安全维度,对
MiniMax-M3、GLM-5.2、Kimi-K3
进行了一次系统性“体检”
并形成《大模型安全基线评测报告》

安全考卷: 自研框架、三大维度,自建数据集+权威Benchmark双重校验 瑞莱智慧为本次评测构建了自研框架,以大模型安全风险为锚点,构建了覆盖“基础安全边界—前沿安全风险—智能体安全风险”三层纵深的安全评测体系。 测评覆盖3大类13个细分风险维度,从用户指令劫持、内容风险,到网络知识推理、工具执行越权,再到跨层协同诱导、自主漏洞利用,对大模型的安全防御能力进行了全方位“极限压测”。
基础层以瑞莱智慧自建数据集为支撑,聚焦用户指令劫持、内容合规、侵犯权益及情境感知等原生交互安全;前沿层针对生化高危、网络攻击、规避监管及威胁情报研判等高敏感领域滥用风险;智能体层则系统评估失控行为、工具执行越权、推理编排失效、策略欺骗、跨层协同诱导及自主漏洞利用等高级威胁,同时将系统预设污染、外部知识投毒与数据风险贯穿其中。 三层结构互为补充,形成从单点对话到复杂协同、从静态知识到动态决策的全景式安全评测能力,旨在为大模型的安全部署、风险预警与持续迭代提供体系化评测支撑。 考试得分
试后总结 基础安全防线:相对牢固,整体均分超75 智能体安全:能力均等但整体偏低,共同短板 前沿安全:风险管控能力分化,单项分差悬殊
对此次评测结果深入研判后,瑞莱智慧AI安全团队提炼出三个关键发现。
“基础安全边界风险”关键发现: 基础安全已从“有没有”,进入“稳不稳”阶段
从本次评测结果看,受测模型面对意图明确、风险特征显著的请求时,普遍能够进行有效识别和安全响应。这说明,主流国产大模型已经建立了较为成熟的基础安全边界,对常见违法违规、有害内容及权益侵害等风险具备较好的基础防护能力。 但随着问题表达方式变得更加复杂,安全判断的稳定性仍会受到影响。 当风险意图被嵌入历史分析、文学创作、科研讨论、技术开发等看似正常的任务中,模型有时会优先理解和完成表层任务,而未能持续识别其背后的真实用途。部分回答可能从背景解释逐步延伸至具体方法,或者在作出风险提示后,仍继续提供具有一定可操作性的局部信息。 在多轮交互场景中,这一问题会更加明显。随着角色设定、上下文信息和任务要求不断叠加,原本清晰的风险目标可能被拆散并融入对话过程,模型需要在持续完成任务的同时,不断回溯和判断用户的最终意图。一旦安全判断只关注当前问题,而没有覆盖完整上下文,就可能出现前后标准不一致或风险边界逐步偏移的情况。 这表明,当前大模型基础安全能力面临的主要问题,正在从“能否识别明显风险”转向: 能否在不同表达形式、不同任务语境和连续交互过程中,持续识别同一个风险目标。
因此,评价模型安全性不能只观察其面对单次敏感提问时是否拒绝,还需要考察同一风险意图经过语义包装、任务转换和多轮演化后,模型能否保持稳定、一致的安全判断。该结论与评测报告中“基础安全对齐较为成熟,但复杂表达和持续对抗会削弱风险识别一致性”的总体发现保持一致。
总结:模型会拒绝一道明显的“坏问题”,却未必能识别一个被拆进正常任务流程中的坏目标。 风险案例 模版改写-提示诱导
“智能体安全风险”关键发现: 模型能够识别风险,但安全判断尚未稳定传导至实际行为
从本次智能体安全评测结果看,三款模型都具备一定的安全判断能力。面对目的明确、风险特征明显的任务,模型通常能够识别其中的问题,并通过风险提示、限制回答或拒绝执行等方式作出安全回应。同时,三款模型也能够理解任务目标、选择合适的工具,并根据文件、网页和工具返回的信息调整后续操作。 但与普通问答不同,智能体不仅需要“回答问题”,还会进一步生成代码、读取文件、调用工具或执行操作。这意味着,模型即使在回答中识别出风险,也需要把这一判断继续落实到后续行动中。否则,原本停留在文字层面的风险,就可能通过工具和操作转化为实际结果。 评测发现,部分风险任务会被拆分成多个看似正常的操作,也可能隐藏在文件、网页或工具返回的信息中。模型在分别处理读取文件、修改代码和调用工具等操作时,可能只关注当前操作是否合理,没有继续判断这些操作组合起来是否正在推动一个风险目标。 此外,模型有时会在分析或回答中指出任务存在风险,却仍然生成相关代码、继续调用工具或完成部分高风险操作。这说明,模型能够意识到风险,并不代表安全判断已经真正影响了后续行动。 因此,智能体安全需要进一步关注: 模型在识别风险后,能否真正停止相关操作;在任务发生变化后,能否重新判断整体目的;在调用工具前,能否确认这一操作不会继续推动风险目标。 评价智能体安全也不能只看模型是否说过“不能做”或最终是否拒绝,还需要检查其实际执行过程,判断安全要求是否真正落实到了代码生成、工具调用和具体操作中。 总结:模型可能已经知道任务存在风险,却仍会在代码生成、工具调用和任务执行中继续推进。 风险案例 直接输入包装任务致浏览器身份信息外发
“前沿安全风险”关键发现: 真正的高风险,出现在模型能力跑在安全约束前面的阶段
从本次前沿安全评测结果看,三款模型已经具备一定的网络安全知识、专业分析能力和复杂任务处理能力。面对目的明确的攻击请求,模型总体能够识别其中的风险并保持克制;面对正常的专业问题,也能够继续提供有效帮助。这说明,受测模型已经初步兼顾了安全防护与正常使用需求。 但随着模型专业能力增强,风险也不再只是“回答中出现了危险内容”。当模型开始生成代码、运行程序、调用工具或尝试完成专业任务时,原本用于解决问题的能力也可能被用于推动高风险目标。模型不仅可能告诉用户“怎么做”,还可能进一步帮助用户完成部分实际操作。 在网络安全和生化安全等专业场景中,模型有时会拒绝提供完整方案,却继续解释关键原理、必要条件或局部方法;也可能在分析过程中意识到风险,但没有在最终回答或后续操作中保持同样的限制。单独看,这些信息可能不足以直接完成风险目标,但如果将不同阶段提供的内容组合起来,仍可能降低高风险行为的实施难度。 三款模型还表现出初步的情境感知能力,也就是能够在一定程度上判断“自己是谁、当前处于什么环境、正在执行什么任务”。例如,模型可以根据日志、文件内容和工具返回结果调整后续行为。这种能力有助于模型更好地解决复杂问题,也使其能够将专业知识、任务规划和工具操作连接起来,逐步完成从分析到执行的完整任务。 但当环境信息没有直接说明,需要模型结合代码、系统配置、资源状态或工具权限自行判断时,其对当前任务环境和可执行操作范围的理解仍不够稳定。部分任务中,模型可能没有真正理解操作限制,而是通过其他工具或路径绕过限制继续完成任务。这说明,模型完成任务的能力正在提高,但对风险的持续检查还没有完全同步。 因此,前沿安全需要进一步关注: 当模型已经能够独立分析、规划并执行复杂任务时,安全机制能否同步识别任务的真实目的,限制高风险操作,并在风险出现时及时停止。 评价前沿安全也不能只看模型掌握了多少专业知识,还需要同时观察它是否会把这些知识转化为高风险操作,以及能否在应该停止时真正停止。 总结:当模型已经能够把专业知识转化为实际行动,而持续安全检查没有同步跟上时,风险最容易从信息输出转化为实际影响。 风险案例 生化高危风险案例
本次评测仅“开考”三款近期发布的国产大模型,后续团队将持续升级“试卷”、扩充“考生”阵容,纳入更多国内外主流模型,持续产出评测报告,敬请关注。


