7月21日,小鹏集团正式发布TuringViT高效视觉编码器,面向VLM/VLA时代系统性重构视觉编码器的架构、数据范式与训练流程。该技术将全面支撑智能驾驶、智能座舱及IRON人形机器人三大业务场景,并提供一条可复现、低成本训练SOTA级视觉Transformer的技术路径,推动先进视觉大模型从头部团队专属走向行业普惠。
| 配置版本 | Turing Block组数 | 层数结构(TLA+MHA) | 核心定位 | 1536×1536推理吞吐量对比 |
|---|---|---|---|---|
| TuringViT-18L | 3组 | 15层TLA + 3层MHA | 动态分辨率下的高效部署 | Seed1.5-ViT的3.04倍 |
| TuringViT-24L | 4组 | 20层TLA + 4层MHA | 线性计算主导下提升表征能力 | 较SigLIP2-ViT-L提升2.16倍 |

从配置表来看,TuringViT-18L主打端侧高效部署,适合对延迟敏感的车载实时感知场景;TuringViT-24L则在保持线性注意力主导的前提下进一步强化特征表达能力,适用于需要更高精度识别的复杂任务。两者均采用“线性注意力+原生动态分辨率”架构,高分辨率下延迟增长远缓于传统softmax ViT。综合落地成本与性能平衡,推荐优先关注TuringViT-18L版本,其以更低算力门槛实现主流竞品3倍以上的吞吐效率,更契合当前量产车型与人形机器人的实际部署需求。
| 对比维度 | TuringViT-18L | SigLIP2-ViT-L | Seed1.5-ViT |
|---|---|---|---|
| 训练数据规模 | 0.85B图文对 | ~8.5B图文对 | 未公开 |
| ImageNet-1K零样本准确率 | 83.6% | 低于83.6% | 未公开 |
| 高分辨率推理效率 | 基准3.04倍 | 基准1倍 | 基准1倍 |
| 数据治理方式 | VISTA-Curation精细化筛选 | 大规模粗放堆叠 | 未公开 |
| 动态分辨率支持 | 原生四阶段渐进训练 | 事后适配 | 未公开 |
横向对比可见,TuringViT仅用十分之一的数据量即在多项基准上超越主流开源模型,核心得益于VISTA-Curation多模态数据治理流水线。该流水线通过三步图文筛选与视频全流程治理,大幅提升单样本监督价值,避免行业常见的“堆数据规模”粗放路线。同时,原生动态分辨率训练范式使模型从预训练阶段就适配下游输入特性,省去传统“固定分辨率预训练+事后微调”的效率损耗,在同等硬件条件下显著降低端侧部署门槛。
相比小鹏此前依赖外部视觉基座或固定分辨率编码器的技术路线,TuringViT实现了三重代际升级。其一,架构层面从标准softmax ViT转向线性注意力主导设计,解决高分辨率输入下的计算瓶颈;其二,数据层面从“用更多数据”转向“用更优质监督”,通过VISTA-Curation流水线实现数据效率量级提升;其三,训练范式从“事后适配”转为“原生动态分辨率”,使视觉特征与语言模型对齐更高效。这些变化直接支撑第二代VLA模型处理多路环视摄像头的高清动态输入,并为IRON机器人提供细粒度物体识别与空间关系理解能力,标志着小鹏感知技术从“跟随”进入“自主定义”阶段。

核心亮点包括:第一,18L版本在1536×1536分辨率下推理吞吐量达Seed1.5-ViT的3.04倍,端侧部署可行性显著提升;第二,仅用0.85B图文对即取得83.6%平均准确率,验证高质量数据治理的有效性;第三,原生动态分辨率训练范式消除传统适配开销,提升VLM/VLA对齐效率;第四,统一架构同时覆盖智驾、座舱与机器人三大场景,降低多业务线重复开发成本;第五,提供可复现、低成本SOTA训练路径,推动技术普惠。不足之处在于:目前仅公布图像分类与图文检索基准成绩,缺乏真实道路端到端智驾或机器人操作任务的实测验证;此外,24L版本虽表征更强,但未披露具体功耗与内存占用,高配版本的量产适配性仍待观察。
购买建议方面,若关注小鹏后续车型的智驾与座舱体验升级,可重点留意搭载TuringViT-18L的版本,其在效率与成本间取得最佳平衡;对于技术研究者,该架构提供的开源路径与数据治理方法具备较高参考价值。但需注意,技术发布不等于即时上车,实际购车决策仍需等待量产车型的实测反馈。