2025年4月15日,旧金山——人工智能安全公司Anthropic今日正式宣布,其自主研发的AI安全与合规系统MYTHOS 5已通过美国国防部、国土安全部及多家联邦研究机构的联合评估,获准向这批机构进行重新部署。这一突破性进展标志着Anthropic在“负责任AI”领域的技术成果正从实验室走向国家级关键基础设施的应用场景。
技术特性:从“静态护城河”到“动态沙盒”
MYTHOS 5是Anthropic自2023年以来持续迭代的第四代AI安全框架,核心目标是为大语言模型提供“可证明的对抗鲁棒性”。与早期版本不同,MYTHOS 5首次实现了“可重新部署”(redeployable)架构——即该安全系统能够脱离原有模型环境,作为独立模块嵌入其他机构已有的AI系统中,并自动适配本地化数据流与策略规则。
Anthropic首席技术官汤姆·布朗在发布会中解释:“过去,安全过滤器像是给模型戴上的紧箍咒,修改成本高、迁移困难。MYTHOS 5采用‘安全沙盒’架构,用一套经过形式化验证的规则引擎,加上动态策略学习层,使得部署方可以像安装软件包一样快速完成集成,同时保留对策略的完全控制权。”
据悉,MYTHOS 5在对抗攻击测试中展现出99.7%的恶意提示拦截率,且仅引入不到2%的推理延迟。这些指标在美国国家标准与技术研究院(NIST)主导的“红队”评测中得到了独立验证。
部署场景:从内容审核到指挥决策过滤
此次率先部署MYTHOS 5的机构涵盖了多个敏感领域。美国国防部先进研究计划局(DARPA)将主要将其用于辅助军事决策系统的“指令清洗”——确保AI生成的战术建议不会因语义模糊或推理跳跃而引发误判;国土安全部则计划将MYTHOS 5整合进边境智能监控系统,过滤可能引发种族、宗教偏见的分析输出;此外,能源部下属的国家核安全局(NNSA)也将利用该平台,为核设施中的人机协作系统添加一道“物理安全边界”。
“真正的挑战不在于AI模型本身有多强大,而在于我们如何安全地释放这种力量。”Anthropic首席执行官达里奥·阿莫迪在声明中强调,“MYTHOS 5的跨机构部署,证明了AI安全可以像传统的网络安全工具一样,成为可采购、可审计、可升级的标准化组件。”
行业影响:安全产业链的范式转移
此次消息发布后,多家华尔街分析机构迅速做出回应。Stifel分析师指出,MYTHOS 5的开辟性在于它首次将AI安全从“模型供应商捆绑服务”变成了“独立采购的第三方模块”。这意味着未来政府、金融、医疗等强监管行业采购AI服务时,可能不再要求模型本身必须“绝对安全”,而是允许模型具备一定灵活性,再由经过认证的外部安全系统进行兜底防护。
不过,也有批评者担忧这种“安全外包”可能带来新的攻击面。卡内基梅隆大学AI伦理中心的研究员安妮·刘表示:“将安全系统与模型解耦,理论上增加了接口攻击的可能性。如果MYTHOS 5本身的更新机制或策略部署通道被攻破,后果可能比模型直接出错更严重。”对此,Anthropic回应称,MYTHOS 5的自动更新采用硬件级信任根与端到端签名校验,且所有策略变更必须经过双人审批的“慢通道”流程。
未来展望:从“少数组件”到“基础设施”
Anthropic宣布,未来12个月内,MYTHOS 5还将向非营利科研机构、州级应急响应系统以及公立大学开放申请。同时,公司正在与美国网络司令部合作,探索MYTHOS框架向边缘计算设备(如无人机、执法记录仪)的压缩部署版本。
在全球AI监管立法加速的背景下,MYTHOS 5的“可重新部署”能力或许正在为行业树立一个隐性标准:安全性不应成为创新者的枷锁,而应成为所有参与者都能共享的公共基础设施。正如阿莫迪在活动最后所言:“安全不是一道墙,而是一扇门——它应该能灵活开关,但永远不能从外部被非法拧开。”