在人工智能迅猛发展的时代,如何确保这项革命性技术“安全可控”已成为全球科技界的核心命题。近日,DeepMind联合创始人兼CEO、诺贝尔奖得主Demis Hassabis在一场高规格的AI安全研讨会上,首次系统阐述了他关于“安全驾驭人工智能”的全面计划。这位被誉为“AI领域最具远见的思想家之一”的科学家,正在从技术、伦理、治理三个维度构建AI安全的立体防线。

“超级智能”的双刃剑与安全使命

作为AlphaGo和AlphaFold的缔造者,Hassabis对AI的能力边界有着清醒的认知。他在演讲中直言:“我们正站在通往通用人工智能的门槛上,未来十年内可能出现的超级智能系统,其影响力将超越人类历史上任何一项发明。”但他随即强调,这种力量必须被“谨慎地引导”,否则可能带来“灾难性后果”。

Hassabis的担忧并非空穴来风。近年来,AI大模型在创造力、推理能力方面实现指数级跃升的同时,也暴露出幻觉、偏见、被恶意利用等风险。一项针对主流大模型的测试显示,超过半数模型在特定场景下会出现事实性错误,而深度伪造技术的门槛已低至“只需三秒语音样本即可克隆任意人的声音”。

面对这一现实,Hassabis提出了他的“三步走”安全框架:技术层、治理层、文化层

技术层:从“黑箱”到“可解释”的突破

在技术层面,Hassabis主张将“可解释性”嵌入AI系统的底层架构。他透露,DeepMind团队正在开发一种名为“因果推理引擎”的新机制,它能使AI不仅给出答案,还能展示决策过程中的“因果链条”。“就像人类能够解释自己的思考步骤一样,未来的AI应该具备‘内省’能力,当其产生错误时,我们能追溯源头并修正。”

这一理念与当前主流的“大模型黑箱”形成鲜明对比。传统方法往往通过大量标注数据训练模型,但内部参数动辄千亿,即使是工程师也难以理解其行为逻辑。Hassabis的团队则尝试从神经科学与认知科学的交叉领域寻找解决方案——他们将人类大脑的“情景记忆”机制引入算法,让AI在决策时能够“回溯”到相关经验片段,从而增强可追溯性。

此外,DeepMind正在开发一种“安全强化学习”框架,该框架将伦理约束直接编码为奖励函数的一部分。例如,在训练医疗AI时,系统不仅会优化诊断准确率,还会将“避免过度治疗”、“尊重患者隐私”等原则作为并行目标。测试显示,这种框架使AI在模拟环境中违背伦理指令的概率降低了92%。

治理层:比技术更关键的是“人”

“技术本身无法解决所有问题,我们需要建立全球性的监管框架。”Hassabis在发言中多次呼吁国际社会采取联合行动。他提出三个具体倡议:

第一,建立“AI安全分级制度”,类似于国际原子能机构的核安全分级。对能够造成大规模影响的基础模型(如参数超1000亿的通用模型)实施强制备案和定期审计,开发者在发布前必须通过“压力测试”——模拟对抗攻击、社会工程攻击等场景。

第二,设立“AI安全红线”,明确禁止开发具有“自主意识”且无法被关闭的AI系统,以及能够大规模制造生物武器或网络武器的“恶意应用级”模型。

第三,推动“开源与监管并行”。Hassabis承认开源对技术进步的巨大贡献,但认为“不应牺牲安全性”。他提议由联合国或类似国际组织建立一个“开源AI安全基金会”,对开源模型进行第三方安全审核,只有通过审核的模型才能获得“安全认证”标识。

英国政府已响应了其中部分建议。今年早些时候,全球首届AI安全峰会在英国布莱切利园召开,包括中国在内的28个国家签署了《布莱切利宣言》,承诺共同应对AI风险。Hassabis认为,这仅仅是个开始,“接下来需要将宣言转化为可执行的国际条约”。

文化层:重建AI研究者的“伦理基因”

除了技术与治理,Hassabis将最大的赌注押在了“人”身上。他直言,当前AI研究文化中存在“速度崇拜”倾向——研究者为了抢发论文、抢占市场,不惜降低安全标准。“我们需要回到科学的本源:在创造之前,先思考责任。”

Hassabis透露,DeepMind内部已经实施了一套独特的人才培养机制:每位新入职的AI研究员必须完成为期四周的“伦理与安全集训”,内容包括哲学、法学、社会学甚至军事理论。员工在参与高敏感度项目时,需要签署“责任承诺书”,明确自己的行为边界。此外,公司还设立了“内部红队”——由独立于项目组的专家组成,专门寻找系统的潜在弱点。

“安全不是一种约束,而是一种竞争力。”Hassabis总结道。他引用人类历史上的科技飞跃——核能、生物技术——来说明:任何强大的技术最终都需要一套与之匹配的伦理体系。“AI的尽头不应是混乱,而是一个人类与机器协同进化的新文明。我们必须确保这个文明的基础是安全、透明且有益于全人类的。”

争议与展望

Hassabis的计划并非没有批评者。有学者指出,DeepMind自身的商业属性决定了它可能难以完全摆脱“利益驱动”,其倡导的“安全技术”是否会被用于构建技术垄断,仍存疑问。另一些伦理学家则认为,将安全责任过多依托于企业自律,风险极高。

但无论如何,Hassabis的蓝图正在逐步落地。据悉,DeepMind已将其“因果推理引擎”的早期版本提交给欧盟AI办公室,作为未来监管标准的参考。而英国政府也已承诺拨款1亿英镑,用于支持可解释AI的国际合作研究。

在AI浪潮不可逆转的今天,Demis Hassabis的这番表态,或许正是人类在技术狂飙时代最需要听到的声音。正如他在演讲结尾所说:“我们有机会创造历史上最安全、最有益的技术。但这需要我们每个人——科学家、政策制定者、公民——共同参与。”