本报讯 人工智能研究领域近日迎来一项引人瞩目的新成果——由前沿AI实验室开发的 Opus 5 模型在最新代码生成基准测试 SlopCodeBench 中取得了压倒性优势。这一成绩不仅刷新了现有大语言模型的代码能力天花板,也为AI辅助编程的落地应用提供了新的参照系。

SlopCodeBench 是由多家顶级科技企业与高校联合推出的专项测评体系,旨在衡量大语言模型在“真实场景、低质量指令、歧义需求”下的代码生成质量。与传统基准测试不同,SlopCodeBench 故意将用户输入设计为“随意、碎片甚至包含错误描述”的典型场景——例如要求“写个东西能把csv里乱七八糟的第一列去掉”,或是“做个点击按钮就弹出日历的页面,要丑一点也行反正能用”。这种贴近真实开发者的提问方式,使得纯粹依赖模板匹配或记忆能力的模型难以取巧。

本次测试的焦点 Opus 5 是继 Opus 3、Opus 4 之后的最新迭代。根据官方公布的数据,Opus 5 在 SlopCodeBench 的总体得分达到 92.7%,相较于上一代提升了 17 个百分点,更显著领先于 GPT-4o(78.4%)和 Claude 3.5 Sonnet(81.2%)。在最具挑战性的“模糊需求三元组”子项中,Opus 5 能正确解析诸如“给那堆破代码加个日志,别太啰嗦”并生成简洁的 Python 日志装饰器,而大部分对照模型会输出过度复杂的日志框架配置。

据参与测评的工程师透露,Opus 5 的核心突破在于其“意图反推与容错推理”能力。模型在面对错误语法或缺失关键信息时,会主动调用一个轻量级知识图谱进行概率填充,利用上下文中最可能的意图进行代码补全。例如当指令为“用正则把这个字符串里的所有数字去掉,不对是保留数字”,Opus 5 能结合“保留”作为最后的修正意图进行输出,而不是机械执行前半句的“去掉”。

加州大学伯克利分校的计算机科学教授 David Zheng 在评论中表示:“SlopCodeBench 的设计思路非常聪明——它测试的不是模型‘能写多好’,而是‘在别人写不清楚时能有多靠谱’。Opus 5 在这里展示的不仅仅是语言理解,更是一种对程序员常见混乱思维的包容性。这意味着未来AI编码助手可能真正改变低效沟通的痛点。”

不过,也有专家提出谨慎意见。斯坦福大学AI伦理中心主任 Leslie 指出,过度适应“低质量指令”可能带来隐患:模型在缺乏安全保障的模糊场景下,更有可能生成包含安全漏洞或不符合编码规范的代码。“我们需要确保模型在‘理解烂需求’的同时,不会盲目执行危险操作。”她补充道。

SlopCodeBench 项目发起人之一、前微软首席研究员 Alex Zhou 在发布报告中强调,该基准测试并不旨在取代其他传统指标,而是为开发者生态提供一个“接地气”的评估维度。“真正在一线写代码的人都知道,大多数任务并非来自整洁的GitHub Issue,而是同事在群里的两行文字。我们就是想看看,哪个模型最懂这种‘人话’。”

Opus 5 的开发商在官方声明中表示,下一步计划将模型能力应用于嵌入式开发与脚本编写场景,并开放部分测试集用于学术研究。从目前数据看,Opus 5 在 SlopCodeBench 上的表现已经接近人类高级工程师在相同混乱指令下的平均准确率(约94%),这标志着AI代码生成从“能写”向“能用、好用”迈出了坚实一步。

随着 SlopCodeBench 逐渐被更多开发团队采用,Opus 5 的这一成绩很可能成为下一次模型竞赛的起跑线。在代码的世界里,或许最好的AI不是写出最优雅的代码,而是最懂那个人在说什么。

(本报记者 张益达)