3月28日,小鹏集团在广州举办的技术分享会上正式发布了自主研发的TuringViT高效视觉编码器。这一专为边缘计算场景设计的视觉Transformer架构,在保持高精度识别能力的同时,将模型推理效率提升至行业领先水平,标志着小鹏在AI底层技术自主化道路上迈出关键一步。

突破“精度-效率”悖论

视觉Transformer(ViT)近年来在图像分类、目标检测等任务中表现优异,但其计算量大、推理延迟高的痛点严重制约了在车端、机器人等资源受限场景的落地。TuringViT正是小鹏针对这一行业难题给出的答案。

据小鹏集团AI技术负责人介绍,TuringViT通过三项核心技术实现突破:其一,动态稀疏注意力机制,在推理过程中根据图像内容自动屏蔽无关区域的计算,将自注意力计算量降低40%以上;其二,分层渐进式特征蒸馏,在保证多尺度特征表达能力的前提下,将编码器参数量压缩至传统ViT-base模型的1/3;其三,硬件感知的量化感知训练,通过端到端的算子融合与INT8量化优化,在Jetson Orin等主流车规级芯片上实现实时推理。

实测数据显示,TuringViT在ImageNet-1K分类任务上达到83.1%的Top-1准确率,与同尺寸ViT模型持平,但在Jetson Orin NX平台上的推理帧率提升至120FPS,功耗降低55%,延迟控制在8毫秒以内——“这在以往是不可想象的平衡。”该技术负责人表示。

从自动驾驶到具身智能:TuringViT的多元应用

小鹏集团并非传统意义上的AI软件公司,其技术布局始终围绕“智能出行”这一核心场景。TuringViT的发布,首要目标是为小鹏汽车的XNGP智能辅助驾驶系统提供更高效的感知前端。

在XNGP 2025版本中,TuringViT已替代原有的卷积神经网络(CNN)与ViT混合方案,成为视觉感知的主干网络。通过替换视觉编码器,车辆对道路上不规则障碍物、异形车辆及复杂交通标志的识别准确率提升了12%,而计算资源占用下降了约三分之一,这为后续引入更复杂的轨迹预测模型腾出了宝贵的算力空间。

更值得关注的是,小鹏明确将TuringViT定位为“面向具身智能时代的通用视觉编码器”。集团董事长何小鹏在发布会后的问答环节中透露:“TuringViT不仅服务于汽车。我们正在人形机器人Iron项目上测试该编码器,它在低光照、动态遮挡环境下的表现超出预期。未来,任何需要‘看懂世界’的小鹏硬件设备,都将受益于这一底层视觉能力。”

行业评价:打开端侧大模型落地新窗口

“TuringViT的亮点不在于带来了多么惊艳的精度,而是它找到了一个极具工程价值的‘甜点’。”知名AI芯片公司地平线的一位资深架构师在社交媒体上评价,“在车端这种功耗、散热严格受限的环境里,能用8毫秒完成过去20毫秒才能完成的任务,意味着系统可以提前预判、更安全地决策。小鹏从自动驾驶的实际跑题需求倒推出这样的编码器,思路值得借鉴。”

不过也有分析人士指出,TuringViT目前主要针对驾驶场景下的典型目标(车辆、行人、道路标志)进行优化,在面对极端长尾场景(如野生动物、罕见建筑结构)时,其泛化能力仍需进一步验证。对此,小鹏技术团队回应称,正在与合作伙伴共建多模态补偿数据集,TuringViT的下一个版本将引入训练时域外数据增强策略。

开放生态:小鹏的技术野心

此次发布会更释放出一个信号:小鹏集团将逐步开放TuringViT的核心模块,计划于第三季度通过小鹏AI开源框架“星灵”提供预训练模型和端侧部署工具链。这意味着,不仅是小鹏生态内的供应商,任何拥有边缘计算设备的开发者都可以免费使用这一高效编码器进行二次开发。

“我们相信,视觉AI的下一轮爆发一定发生在终端,而不是云端。”小鹏集团副总裁、AI研究院院长在总结时强调,“TuringViT要让每一个摄像头都拥有一个‘聪明的大脑’,而且这个大脑足够小、足够快、足够省电。这是小鹏从造车企业向智能出行科技公司转型的根基。”

随着TuringViT的落地,小鹏集团在AI自研方面的技术版图已覆盖芯片(图灵芯片)、算法(XNet感知网络)与编码器三大关键节点。在行业普遍追求大模型、大算力的喧嚣中,这家中国车企选择了一条“做小、做快、做实用”的差异化路线,其成效值得长期观察。