近日,OpenAI旗下代码生成模型Codex正式宣布了一项重要的安全更新:开始对所有子智能体(sub-agent)的提示(prompt)进行端到端加密。这一举措被业界视为应对AI代理系统中日益严重的“提示注入攻击”和数据泄露风险的关键突破。
加密背景:AI代理的安全隐忧
随着大型语言模型(LLM)的广泛应用,特别是以Codex为代表的代码生成与执行工具,AI代理系统正在从单一模型向多智能体协作架构演进。在这种架构中,一个主智能体可以分解任务,并调用多个子智能体分别执行子任务。然而,子智能体之间、以及主智能体向子智能体发送的“提示”(即任务指令和上下文信息)通常以明文形式传输,这就带来了严重的安全隐患。
安全研究人员指出,攻击者可以通过中间人攻击、提示注入等手段,窃取或篡改子智能体之间的通信内容。例如,恶意用户可能向代码生成代理发送精心构造的提示,诱导子智能体泄露敏感信息或执行危险操作。2024年以来,多起针对AI代理系统的攻击事件曝光,促使行业重新审视现有安全架构。
Codex的加密方案:从端到端保护
据OpenAI官方博客透露,Codex此次更新主要面向其多智能体协作API和服务端。具体来说,当主智能体向子智能体发送提示时,这些提示内容将首先使用子智能体的公钥进行加密,只有对应的子智能体才能使用私钥解密。同样,子智能体的响应也会被加密回传。整个过程采用了基于椭圆曲线加密(ECC)的混合加密机制,结合对称加密算法提高效率。
值得注意的是,加密范围不仅包括提示文本本身,还包括元数据、上下文历史、函数调用参数等所有在子智能体间传递的信息。这意味着即使是平台运营商也无法直接读取这些加密后的通信内容。“用户和开发者可以确信,他们的AI代理对话是私密的,除非他们自己选择分享,”OpenAI安全工程副总裁在声明中表示。
行业影响:降低提示注入风险
网络安全专家认为,此功能对于防范“提示注入攻击”具有里程碑式的意义。传统的提示注入防御手段(如输入过滤、权限限制)往往存在漏洞,而端到端加密则从根本上切断了攻击者窥探或篡改子智能体提示的通道。
“想象一下,一个金融分析代理正在调用子智能体来读取用户账户余额。如果提示是明文,攻击者可以插入恶意指令,让子智能体返回错误数据。加密后,攻击者无法得知提示内容,也就无法构造针对性注入,”网络安全公司Clutch Security的首席分析师评论道。
此外,加密机制也满足了企业级客户对于数据合规的严苛要求。许多金融机构、医疗健康公司对AI服务有数据留痕和隐私保护的规定,Codex的加密功能使这些行业的部署成为可能。
挑战与未来方向
当然,加密并非万能。加密后的提示仍然可能受到侧信道攻击,并且在子智能体内部解密后,仍需要防止内部泄露。OpenAI表示,下一步将结合可信执行环境(TEE)和硬件级隔离技术,进一步提升安全性。
同时,加密也带来了延迟增加和密钥管理的复杂度。Codex团队已经优化了加密算法,使额外延迟控制在50毫秒以内,并提供了自动化密钥轮转和分发工具。
结语
Codex此次加密子智能体提示的举措,不仅是技术层面的更新,更标志着AI代理系统从“功能优先”向“安全优先”的转变。随着多智能体协作成为AI应用的主流范式,以加密为基础的安全基础设施将不可或缺。对于开发者和企业用户而言,这无疑是值得关注的重要进展。