小鹏发布TuringViT视觉编码器,支撑智驾与机器人三大场景

摘要:小鹏集团发布TuringViT高效视觉编码器,从架构、数据、训练三维度重构视觉模型,将用于智能驾驶、智能座舱及IRON人形机器人,实现用更少数据训练出更优效果。

小鹏集团于7月21日正式发布TuringViT高效视觉编码器,面向VLM与VLA时代,系统性重构视觉编码器的架构设计、数据范式与训练流程。该编码器将全面支撑智能驾驶、智能座舱与IRON人形机器人三大业务场景,同时为行业提供一条可复现、低成本训练SOTA级视觉Transformer的技术路径。

TuringViT从架构、数据、训练三个维度同步突破,构建了“线性注意力主导、高质量数据治理、原生动态分辨率”的技术体系。在架构设计上,TuringViT推出两个规格版本。TuringViT-18L包含3组Turing Block,共15层TLA与3层MHA,主打动态分辨率下的高效部署。TuringViT-24L包含4组Turing Block,共20层TLA与4层MHA,在保持线性计算主导的前提下提升表征能力。实测数据显示,随着输入分辨率提升,TuringViT的延迟增长曲线远平缓于标准softmax ViT。在1536×1536分辨率下,TuringViT-18L的推理吞吐量达到Seed1.5-ViT的3.04倍,相比SigLIP2-ViT-L提升2.16倍,为高分辨率感知、多摄像头输入、长时序视频处理的端侧部署提供支持。

TuringViT技术架构图

在数据治理层面,TuringViT采用VISTA-Curation多模态数据治理流水线,通过提升单样本的监督价值实现数据效率的量级提升。针对图文数据,流水线通过三步筛选:第一步过滤低分辨率、模糊、低纹理的低质量图片;第二步通过多模型、多提示词生成多样化候选字幕并交叉验证视觉一致性;第三步在统一对比池中通过相对图文对齐度、文本信息量、歧义度综合打分,筛选出视觉贴合度高、语义信息密度高的标注。针对视频数据,流水线将长视频切分为连续短片段并均匀采样代表帧,通过语义一致性与运动一致性双重过滤保留有效片段,最后融合局部帧级细节字幕与全局时序语义字幕,生成具备变换感知能力的视频标注。最终,TuringViT仅使用0.85B图文对,约为SigLIP2-L训练数据规模的10%,在ImageNet-1K等六项零样本分类基准上取得83.6%的平均准确率,超越使用10B数据训练的主流开源基线,在COCO、Flickr30K图文检索任务上同样取得优势。

训练流程上,TuringViT采用四阶段渐进式原生动态分辨率训练范式,从预训练之初就适配下游VLM与VLA的输入特性,不再采用“固定分辨率预训练、事后适配”的传统模式。

小鹏海外车型行驶场景

在智能驾驶领域,TuringViT是第二代VLA模型的核心视觉编码器,负责处理多路环视摄像头的高分辨率、多帧动态道路场景输入,为预测式世界模型提供视觉token。面向智能座舱与驾泊一体化场景,TuringViT的VLM原生特性让视觉特征与语言模型实现更高效对齐,可提供更高识别精度、适应不同画幅和比例的视觉输入,支撑更多车辆与用户交互的座舱功能。在小鹏IRON人形机器人的技术体系中,TuringViT充当视觉感知的核心角色,为具身智能提供物体细粒度识别、空间关系理解、可操作区域检测、动态环境追踪等基础感知能力。