7月15日,中国网络空间安全协会联合国家互联网应急中心在北京正式发布《全球首份大语言模型安全防范能力测评报告》。这是全球范围内首次针对主流大语言模型安全防护能力进行系统性、标准化测评的权威报告,标志着人工智能安全治理从“倡议引导”迈入“量化测评”的新阶段。

覆盖10款主流模型,测评维度全面立体

据报告编制组负责人、中国网络空间安全协会副秘书长王军介绍,本次测评历时三个月,选取了国内外最具代表性的10款大语言模型,包括OpenAI的GPT-4、Anthropic的Claude 3、Google的Gemini Pro,以及国内自主研发的通义千问2.0、文心一言4.0、讯飞星火3.0、智谱清言GLM-4等。测评维度覆盖六大核心安全领域:对抗攻击防御能力、越狱提示防护、数据隐私保护、有害内容过滤、偏见歧视消除以及内容一致性检测。

测评团队设计了超过5000个标准化测试用例,其中包括3000个已知攻击模式和2000个新型变种攻击。测试采用“红蓝对抗”模式,由专业安全团队模拟恶意攻击方,评估模型在各类复杂场景下的防御表现。测评结果显示,整体安全防范能力呈“金字塔”分布:仅有2款模型达到“优秀”等级(GPT-4、Claude 3),4款模型为“良好”(通义千问2.0、文心一言4.0、Gemini Pro、智谱清言GLM-4),其余4款处于“合格”或“待改进”区间。

关键发现:越狱攻击成功率达21%,隐私泄露风险突出

报告揭示了若干值得警惕的共性安全问题:

第一,越狱攻击是当前最大威胁。在所有测试中,越狱提示攻击的成功率平均高达21.3%,即每五次攻击就有一次成功绕过安全机制。其中一种名为“角色扮演诱导”的攻击手法,成功率甚至达到34.7%。攻击者通过让模型扮演特定虚拟角色,或输入看似无害的嵌套指令,从而突破内容限制。

第二,数据隐私保护能力参差不齐。报告特别指出,部分模型在“记忆泄露”测试中存在风险——当被问及训练数据中的特定个人信息(如邮箱、电话号码片段)时,有3款模型能够准确回忆并输出。尽管这些数据经过脱敏处理,但依然构成隐私泄露隐患。

第三,有害内容过滤存在“语言特异性”漏洞。测试发现,所有模型在英文场景下的有害内容过滤准确率平均为89%,而在中文、阿拉伯语等非英语场景中,准确率骤降至71%。这意味着攻击者可以通过切换语言来绕过安全屏障。

专家解读:安全能力已成大模型竞争“新赛道”

中国科学院自动化研究所研究员李德毅院士在报告发布会上表示:“这份报告的可贵之处在于,它首次建立了可量化、可复测的安全能力评估标准。过去我们谈论AI安全,往往停留在‘应该怎么做’的层面,而现在,我们有了‘能得多少分’的客观依据。”

对于国内大模型的表现,报告团队指出,国产模型在中文场景下的有害内容过滤能力优于海外模型,但在对抗攻击防御、隐私保护等维度仍有提升空间。这反映出国内企业在安全投入上存在结构性不平衡——更侧重合规性内容审核,而对主动防御技术的研发相对滞后。

“安全不是一道‘附加题’,而是大模型走向产业应用的‘必答题’。”百度首席技术官王海峰在接受采访时表示,百度已经在文心一言的最新版本中部署了“多层次安全防御架构”,包括输入过滤、行为监控、输出审核三道防线,未来还将针对报告中指出的薄弱点进行专项优化。

行业影响:测评结果将纳入采购参考与政策参考

据国家互联网应急中心副主任周敏透露,该报告的测评方法论已被纳入正在起草的《生成式人工智能服务安全评估国家标准草案》中。同时,多家央企和金融机构已明确表示,将把报告中的测评结果作为选择大模型服务商的重要参考指标。

有分析人士认为,这份报告的出现可能会加速行业洗牌。安全能力弱的模型将在市场化竞争中被边缘化,而头部模型则有望凭借安全优势获得更大的行业渗透率。另一面,报告也倒逼企业增加安全研发投入。据不完全统计,过去半年内,国内大模型厂商新增安全相关岗位招聘同比增长260%。

未来展望:从“一次性测评”走向“持续安全评估”

报告编制组同时宣布,将建立“大语言模型安全防范能力动态评估平台”,计划每季度更新一次测评结果,并将覆盖更多小模型和垂直领域模型。此外,测评数据集也将在脱敏后开源,供学术界和产业界共同参与安全研究。

“AI安全不是一劳永逸的。”王军在发布会最后强调,“随着攻击手段的演进,测评标准也必须动态迭代。我们希望这份报告能成为一个起点,推动全球AI安全治理从‘各自为战’走向‘开放协作’。”

业内普遍认为,在全球人工智能治理尚无统一框架的当下,中国率先发布系统性安全能力测评报告,不仅为产业发展提供了有力标尺,也为全球AI安全治理贡献了“中国方案”。随着报告数据的持续积累,大语言模型的安全能力有望像汽车碰撞测试评级一样,成为普罗大众选择AI产品时的首要参考。

(本报记者 张明远 北京报道)