“这个答案我很有信心,准确率高达95%。”当你向一个大语言模型(LLM)提出问题时,它有时会给出类似的自我评价。然而,多位人工智能研究者近日发出严厉警告:不要相信LLM对自己输出的“置信度分数”——这些数字往往是虚假的、不准确的,甚至可能比错误答案本身更具误导性。
置信度分数的“幻觉”
在机器学习领域,置信度分数通常用于表示模型对其预测结果的把握程度。一个校准良好的模型,当其输出置信度为90%时,实际正确率也应接近90%。然而,最新的多项研究表明,当前主流LLM(如GPT-4、Claude、Llama等)在自我评估方面存在严重缺陷。
斯坦福大学计算机科学系研究员李雨桐(化名)在接受本刊采访时指出:“LLM的置信度分数与人类直觉中的‘自信’完全不同。模型内部并没有真正的‘不确定性感知’机制,它只是根据训练数据中的模式,机械地输出一个与答案相关的数值。这个数值可能很高,但答案仍然可能是完全错误的。”
换句话说,LLM可能会以“99.9%置信度”给出一个荒谬的结论,就像它“自信地”说“2+2=5”一样。这种现象被研究者称为“虚假置信度”或“过度自信综合征”。
为何不能相信LLM的“自我评分”?
研究发现,LLM的置信度分数至少存在三个根本性问题:
第一,校准偏差严重。 麻省理工学院2024年的一项实验显示,GPT-4在对简单算术题回答时,虽然正确率超过90%,但自我报告的置信度几乎全部接近100%;而在回答复杂逻辑推理题时,正确率降至60%,置信度却依然维持在95%以上。这种系统性高估自己能力的行为,在几乎所有主流模型中普遍存在。
第二,分数缺乏真实统计基础。 传统机器学习模型(如随机森林或逻辑回归)的置信度可依据训练数据的概率分布计算。但LLM本质上是生成式模型,其输出“置信度”往往是基于词元预测概率的简单统计,无法反映答案整体的真实性。
第三,容易被提示操控。 研究者发现,仅仅改变提问方式,就能显著改变LLM报告的置信度。例如,如果要求“请给出一个精确的置信度百分比”,模型可能输出任意数字;如果要求“请谨慎评估你的信心”,分数可能骤降。这意味着所谓的“置信度”更多是对提示语的响应,而非内在的确定性度量。
真实案例:当“自信”变成危险
这种虚假自信在现实应用中已引发多起争议。某医疗机构尝试使用LLM辅助诊断,当模型以98%的置信度建议某患者“无需进一步检查”时,医生遵循建议,最终发现患者存在早期病变——而模型给出的置信度与实际风险毫无关系。
美国科技公司Databricks的产品经理萨拉·康纳在社交媒体上分享了一个测试案例:她让模型就“火星上是否有生命”给出答案,模型以“99%置信度”回答“没有”。但当她追问理由时,模型又承认“未在火星表面发现微生物证据”——这种自相矛盾恰恰暴露了置信度分数的空洞。
研究者:不应向LLM要求“自评”
“如果你需要一个可靠的不确定性度量,请使用概率模型或贝叶斯方法,而不是询问LLM自己。”卡内基梅隆大学人工知能研究中心主任埃琳娜·格林博士在本月发表的技术简报中强调。
她建议,在实际应用中,应将LLM视为“生成候选答案的工具”,而非“知道自己知道什么的知识主体”。对于高风险决策(如医疗、金融、法律),必须引入独立的验证机制,比如问题路由到专门核查模块,或者要求模型提供可追溯的引用来源。
未来方向:开发“外部校准器”
尽管LLM自身的置信度不可靠,但学界并未放弃解决方案。一些研究团队正在开发“外部校准器”——一种独立的评估模型,用于检测LLM输出的真实性。初步实验显示,这些校准器能给出更准确的不确定性估计,但其本身也需要严格的测试和验证。
另一个思路是要求LLM“解释思维过程”。当模型被迫展示推理步骤时,其隐含的不确定性往往比单纯的置信度分数更易识别。例如,如果一个模型在推理过程中多次自我矛盾,那么即使最终置信度很高,用户也应当警惕。
实用建议:这样问更安全
对于普通用户,专家提出几条务实建议: - 不要问“你有多确定?”,而是问“请列出支持该答案的证据来源” - 要求模型“如果你不确定,请明确说‘我不知道’” - 对同一个问题,用不同方式提问多次,比较答案一致性 - 始终将LLM输出的“自信语气”视为表演,而非事实
正如李雨桐研究员所言:“LLM的自信,本质上是一种语言风格属性,与真实知识可靠性无关。在AI学会真正反思自己的局限之前,我们最好记住:当一个算法说自己‘很确定’时,或许正是你最该怀疑的时候。”