随着人工智能技术加速向千行百业渗透,AI安全治理正迎来关键转折点。在近日举行的2025中国人工智能安全发展论坛上,多位院士、企业技术负责人及政策研究者围绕“AI安全护栏升级”展开深度研讨,一致认为:当前AI安全体系必须从“亡羊补牢”式的被动防御,向“未雨绸缪”式的主动防护转变,构建起动态感知、智能预警、自动响应的新型安全护栏。

被动防御之困:漏洞永远追不上攻击

“过去三年,全球公开报道的AI系统攻击事件增长了超过12倍,但大多数企业仍然停留在‘事后打补丁’的阶段。”中国工程院院士、网络安全专家沈昌祥在论坛主旨演讲中指出,传统基于规则匹配、特征库更新的安全模式,在面对大模型对抗攻击、数据投毒、模型窃取等新型威胁时显得力不从心。

以当下最受关注的大语言模型为例,短短数月间,从“提示注入攻击”到“越狱手法迭代”,攻击手段层出不穷。360集团创始人周鸿祎在圆桌讨论时坦言:“我们曾测试过,即便部署了最严格的输入输出过滤,攻击者依然能通过精心构造的多轮对话绕开限制。这说明静态的规则护栏存在天然盲区。”

业界普遍意识到,AI系统的脆弱性不仅源于代码漏洞,更来自算法本身的可解释性不足、训练数据中的偏见与后门、以及推理过程中的不确定性。这些特殊性决定了,传统的边界防御、被动响应机制远不能满足AI安全需求。

主动防护:构建“感知-研判-决策”闭环

什么是AI安全的主动防护?百度安全技术委员会主席马杰将其形象地比喻为“给AI系统装上免疫系统”——不是等病毒入侵后再杀毒,而是实时监测系统状态,主动发现异常行为,甚至在攻击发生前完成阻断。

具体而言,主动防护的升级路径包含三个核心层面:动态风险评估,通过持续监控模型输入输出、训练数据流、推理日志,利用轻量级检测模型实时识别异常分布和可疑模式;对抗性预防,在模型训练阶段引入对抗样本生成、鲁棒性增强等技术,使模型本身具备“抗攻击体质”;自适应响应机制,当系统检测到高置信度风险时,能够自动触发回滚、降级、限流等策略,而无需人工介入。

阿里云智能安全副总裁欧阳劲松在论坛上分享了实践案例。其团队开发的内生安全框架,将“行为指纹”技术应用于大模型推理链路。“每个正常的用户对话都有其模式特征,一旦出现偏离基线的行为,比如短时间内大量请求并试图诱导模型输出特定内容,系统就会自动提升监控等级,并动态调整输出策略。”据介绍,该框架已成功拦截多起针对商业智能助手的注入攻击。

路径争议:标准化与灵活性如何平衡?

尽管主动防护的理念获得广泛认同,但执行层面仍存在显著分歧。中国科学院自动化研究所研究员曾毅认为,AI安全护栏不应搞“一刀切”的标准化方案。“不同场景的风险差异极大:医疗AI误判可能危及生命,而客服机器人出错最多影响用户体验。主动防护必须与业务风险等级挂钩,既要避免过度防护扼杀创新,也要防止低风险场景漏防。”

华为昇腾计算业务CTO周斌则呼吁加快行业安全标准的制定。“目前各家企业的‘主动防护’能力参差不齐,很多只是将传统的WAF(Web应用防火墙)规则简单嫁接。业界需要形成可评测、可验证的安全能力框架,比如定义‘动态防护等级’的量化指标。”

值得关注的是,国家互联网应急中心(CNCERT)近期启动了AI安全建设试点项目,重点支持“主动探测与响应”技术研究,并计划在今年底前发布《AI安全防护能力评估指南(征求意见稿)》。这或许预示着,AI安全将从企业自选动作走向行业规范要求。

未来图景:安全与智能的共生演进

论坛最后环节,与会嘉宾描绘了AI安全护栏的远景:未来的AI系统将被设计为“安全原生”(Secure by Design),安全不再是被动对抗,而是嵌入AI生命周期的每个环节——从数据采集时的隐私计算,到模型训练中的联邦学习,再到部署后的持续监测。

“主动防护不是一套固定的解决方案,而是一种持续演进的能力。”清华大学人工智能研究院基础理论研究中心主任朱军总结道,“当AI自身的智能水平不断提升,我们也希望看到‘以AI御AI’的自适应安全体系。那时,安全不再是发展的瓶颈,而是智能向善的保障。”

从被动到主动,从修补到预防,AI安全护栏的升级路径已然清晰。但正如论坛上多位专家反复强调的那样:技术只是手段,真正的护栏,永远是开发者和使用者心中对风险的敬畏与对责任的坚守。