2025年世界人工智能大会(WAIC)现场,虎牙公司正式发布了自主研发的实时多模态数字人VAM 1.0(Virtual Avatar with Multi-modal),引发行业广泛关注。这款集语音、视觉、动作捕捉与实时渲染于一体的智能数字人产品,标志着虎牙在虚拟人技术赛道迈出了从“单向输出”到“多维交互”的关键一步。

技术突破:从“拟人”到“类人”的跃迁

在WAIC虎牙展区,VAM 1.0的实时互动演示吸引了大量观众驻足。与传统数字人依赖预设脚本或延迟响应不同,VAM 1.0实现了毫秒级的跨模态同步处理:它能通过麦克风捕捉用户语音,同时利用摄像头识别用户表情、手势乃至细微的面部肌肉运动,再结合自然语言理解(NLU)与情感计算模型,在0.3秒内生成相应的语音回复、面部微表情和肢体动作。

据虎牙技术团队介绍,VAM 1.0的核心突破在于“实时多模态融合引擎”。该引擎整合了自研的轻量化语音识别模型、基于Transformer架构的实时表情生成网络,以及高精度动作重定向算法,使得数字人能够在低算力设备上实现接近真人自然度的交互体验。例如,当用户皱眉或微笑时,VAM 1.0的瞳孔会随之放大或缩小,语气也会同步调整,这种“镜像反应”大大降低了人机对话的机械感。

应用场景:覆盖娱乐、教育与商业服务

虎牙公司副总裁在发布会上表示,VAM 1.0的研发初衷是解决当前数字人应用中的“表达孤岛”问题。“过去数字人要么只能语音对话,要么只能做固定动作,无法在复杂场景下实现多感官协同。VAM 1.0的定位是‘可定制化交互中枢’,可以快速适配直播、教育、客服、医疗问诊等多个领域。”

在直播场景下,VAM 1.0可以作为虚拟主播与观众实时连线,根据弹幕情绪调整互动话术;在教育应用中,它能够化身“AI导师”,通过观察学生的注意力分散程度实时调整讲解节奏;而在商业服务端,VAM 1.0已与某头部银行达成合作试点,作为数字柜员处理标准化业务咨询,其多模态交互能力使业务办理效率提升了40%。

行业启示:虚实融合的交互范式重构

中国信通院人工智能研究员李明博士在展会现场评价称:“VAM 1.0的发布意味着数字人技术从‘视觉欺骗’进入了‘行为可信’阶段。”他指出,此前行业过度关注数字人的外观精细度,却忽略了交互过程中的心理真实感。“人类沟通中超过70%的信息通过非语言信号传递,VAM 1.0打通了语音、表情、动作三者的实时闭环,这是人机交互范式的本质突破。”

不过,VAM 1.0的商业化仍面临挑战。目前数字人的高精度实时渲染对GPU算力要求较高,虎牙方面透露已与多家芯片厂商合作进行端侧优化,预计今年第三季度将推出轻量版移动端SDK。此外,多模态数据采集带来的隐私合规问题也是业界关注焦点,虎牙在发布会上同步公开了“数字人行为透明度框架”,承诺所有交互数据均经过脱敏处理,并支持用户一键关闭摄像头权限。

未来展望:重新定义“人机关系”

在发布会尾声,VAM 1.0与主持人进行了一场即兴相声表演,其流畅的接梗能力和自然的面部表情引发全场掌声。虎牙CTO表示,公司计划在年内开放VAM 1.0的开发者平台,允许第三方企业通过API自定义数字人的性格、声线及知识库。“我们的目标不是做出完美的‘数字演员’,而是让每个普通人都能拥有一个真正懂自己、会交流的虚拟伙伴。”

从WAIC的首发表现来看,VAM 1.0正在将数字人从“屏幕上的美丽花瓶”变为“能说会道的情感容器”。当实时多模态交互成为可能,人机之间的那堵无形之墙,或许正在悄然瓦解。