近日,智谱AI与清华大学联合研究团队发布最新测试报告,其大语言模型 GLM 5.2 在标准簿记任务中取得突破性进展——在账目记录与核对环节的准确率高达 98.7%,与初级人类簿记员的平均表现仅相差 0.4 个百分点。这一成果标志着 AI 在专业财务领域的应用迈入“准人类”水平,引发会计行业与科技界的广泛关注。
测试标准:模拟真实财务场景
研究团队选取了包含 5000 笔交易的标准簿记数据集,涵盖日记账分录、应收账款核对、折旧计算及试算平衡表生成等核心任务。测试由 10 名具有 1-3 年工作经验的簿记员与 GLM 5.2 分别完成,并由注册会计师担任评判员。
结果显示,GLM 5.2 在无人工干预环境下,对复杂交易(如跨期费用摊销)的识别准确率达到 97.2%,而人类簿记员的平均准确率为 98.3%;在基础数据录入环节,AI 仅出现 3 处数字错位错误,远低于人类平均的 7 处。整体偏差中,AI 的错误多源于对非标准会计分录中隐含的税务条款理解不足,而人类则更易受疲劳导致的笔误影响。
技术突破:从“理解语义”到“计算推理”
与通用大模型不同,GLM 5.2 针对财务场景进行专项优化。研究团队在基础模型中嵌入了“财务推理链”模块,使模型不仅能够识别“借”“贷”“应收账款”等术语,还能遵循复式记账法的逻辑链条进行多步推理。例如,当处理“预付租金转为费用”时,模型自动计算 12 个月摊销分摊,并生成对应借记管理费用、贷记预付账款的条目。
“过去大模型做财务常会‘一本正经地胡说八道’,比如把‘收入确认’与‘回款’混为一谈。”项目负责人、清华大学计算机系副教授黄民乐表示,“GLM 5.2 的突破在于引入了双重验证机制:先通过语言模型提取交易描述中的金额、科目,再通过专门的数值计算引擎比对借贷平衡,将语义理解与算数精度分离,大幅降低了‘串行错误’。”
行业冲击:人机协作而非替代
这一消息在会计圈掀起波澜。多位受访专家指出,尽管 GLM 5.2 在单项测试中接近人类水平,但其适用场景仍局限于标准化、规则明确的簿记工作。中国注册会计师协会理事张志华认为,AI 当前尚无法应对财务报表中需要职业判断的领域,如资产减值测试的计提比例、或有负债的认定等,这些仍依赖人类的经验与伦理判断。
“如果企业用 AI 自动生成凭证,但合规风险最终还是要人签字。GLM 5.2 更像是效率工具——它能把簿记员从 80% 的重复劳动中解放出来,让他们专注于数据分析和内控优化。”某四大会计师事务所高级经理李敏表示。据测算,采用 GLM 5.2 辅助后,中型企业每月编制管理报表的时间可从 3 天缩短至 4 小时。
商业化前景:中小企业或率先受益
目前,智谱AI已面向部分中小企业开放 GLM 5.2 的财务插件测试。一家参与内测的电商企业财务主管透露,使用模型自动处理每日订单的记账分录后,人工核对工作量下降 70%,且未出现因科目误设导致的税务复核问题。不过,模型在跨境交易中的汇率计算(涉及多币种折算规则)仍需要人工二次校准。
智谱AI副总裁林志远表示,团队正在与监管部门沟通,探索将 GLM 5.2 应用于会计代理记账机构,并计划于 2024 年第四季度推出“财务版专用硬件”,通过本地化部署解决企业数据隐私顾虑。
未来展望:从簿记到财务决策
业界普遍认为,GLM 5.2 的准确率突破具有标志性意义。一旦 AI 能够稳定处理 99% 以上的基础簿记,企业财务管理的数字化将进入“自动驾驶”初级阶段。但更大的想象空间在于,模型积累的大量交易数据可被用于现金流预测、成本异常报警等高级分析。下一步,研究团队计划训练模型理解企业会计准则(如收入准则第 14 号中的“五步法”),进一步缩小与资深会计的差距。
“当 AI 能像人一样‘盘账’,它就不再只是工具,而是财务团队的‘数字同事’。”黄民乐总结道。不过,他同时强调,GLM 5.2 目前仍存在对非结构化票据(如手写收据、多语种发票)识别率偏低的问题,完全无人工干预的财务自动化仍需时日。
(本报记者 张子涵 报道)