在电商与潮流文化深度融合的当下,推荐系统早已成为平台连接用户与商品的“隐形引擎”。然而,当算法迭代从“实验性涂鸦”迈向“工业化流水线”,代码的规范性、可复现性与业务目标的精确对齐,成为摆在技术团队面前的硬骨头。在近日举行的AICon全球人工智能与机器学习技术大会上,得物推荐技术团队分享了他们如何从“狂野代码”中破局,构建AI Harness工程化体系的实践历程。这一案例为行业提供了从“实验驱动”到“目标驱动”转型的鲜活样本。

从“代码沼泽”到“工程化救赎”

在得物推荐系统早期,算法工程师的“自由创作”曾是一把双刃剑。快速迭代、灵活试错固然带来短期收益,但随之而来的是“一人一套代码风格”、“离线实验与线上效果脱节”、“参数配置散落各地”等混乱景象。团队内部戏称这种状态为“狂野代码”——一个特征工程可能嵌套在多个脚本中,一个模型实验的复现需要“考古式”排查,线上AB实验的置信度也常因基础设施差异而受到质疑。

“本质上,我们缺少一个能把算法创意与工程交付连接起来的桥梁。”得物推荐工程负责人指出,问题根源在于算法研发的生命周期被割裂:离线阶段追求模型精度,忽略线上约束;线上阶段又面临性能、资源、可观测性等实时挑战。这种割裂导致推荐系统成了“黑盒子”,业务方无法明确知晓“每次代码变更到底带来了多少GMV或用户留存提升”。

AI Harness:定义“按目标生产”的标准范式

为破解困局,得物技术团队提出了“AI Harness”概念——一个覆盖模型全生命周期的工程化基座。其核心逻辑不再以“算法是否神奇”为评判标准,而是将“是否对齐业务目标”作为唯一准绳。

“按目标生产”具体体现在三个维度:实验标准化资源弹性化效果可量化。首先,所有算法实验必须基于统一的Harness框架,代码、配置、数据、环境四要素强制绑定,确保“一次编写,处处复现”。其次,系统根据实时流量与目标指标(如点击率、转化率、下单率)自动调度计算资源,摒弃人工预分配模式。最关键的第三点,则是将业务目标直接写入系统运行逻辑——不再是“模型A比模型B AUC高0.5%”,而是“模型A上线后,新客首单转化率提升2.1%”。

实战复盘:从“快糙猛”到“精细化”

在具体落地过程中,团队选择了最“痛”的特征工程作为突破口。过去,特征加工脚本散布在多个仓库,导致离线特征与实时特征存在语义不一致。Harness通过引入统一特征注册中心和血缘追踪,实现了特征的“一次定义,多处可用”,并自动检测“特征穿越”等标注性问题。仅此一项,模型迭代周期从周级缩短至天级,人工排查Bug的工时下降70%。

推荐模型的在线服务同样经历重塑。Harness将模型封装为无状态服务容器,结合动态路由与模型热加载,使得线上模型更新无需重启、流量无损。团队还构建了“目标仪表盘”,实时展示每个推荐模块对GMV、用户时长等核心指标的贡献度,将算法的“技术价值”直接翻译为“业务语言”。

当业务方提出“希望提升潮流单品曝光占比”时,Harness能够快速配置新目标权重,并在AB实验中量化该策略的边际效应。这种“算法即服务”的模式,让技术团队从“被动接需求”转变为“主动调参数”。

启示:AI工程化不是束缚,而是解放

得物推荐团队的实践揭示了一个深层逻辑:AI工程化的本质不是用“流程”捆住算法工程师的手脚,而是用“规范”换取更高阶的自由。当代码脱离“狂野”,当实验紧贴目标,算法团队反而能更专注于模型创新与业务理解,而非在基础设施的泥潭中挣扎。

目前,得物AI Harness已承载每日百亿级推荐请求,覆盖搜索、首页推荐、直播等多个场景。团队透露,下一步将探索“自适应目标生产”——由系统根据市场变化自动调整推荐策略权重,逐步向“无人值守”的智能推荐运营演进。

从“以模型为中心”到“以业务目标为中心”,得物的AI工程化转型,或许正是推荐系统走向成熟的一个关键注脚。在流量红利见顶的存量竞争时代,谁能让算法更聪明地“按需生产”,谁就能赢得用户的每一次点击。