小鹏TuringViT发布全梳理:各方怎么说?

摘要:小鹏集团发布TuringViT视觉编码器,重构训练范式,赋能智驾、座舱及机器人三大场景。

7月21日,小鹏集团正式发布自研TuringViT高效视觉编码器。该技术面向VLM/VLA时代重构视觉大模型训练范式,旨在通过架构、数据与训练流程的系统性创新,为智能驾驶、智能座舱及IRON人形机器人提供统一感知底座,并推动行业实现低成本、可复现的SOTA级视觉模型训练。

据官方及技术报告显示,TuringViT的研发与发布遵循明确的技术演进路线。在架构层面,其创新性提出Turing线性注意力(TLA)机制,构建混合Turing Block架构,将计算复杂度从二次方降至近线性,解决了高分辨率场景下的算力瓶颈。在数据治理方面,小鹏推出VISTA-Curation多模态数据治理流水线,摒弃“堆数据”粗放路线,转向提升单样本监督价值。实测数据显示,该模型仅用0.85B图文对(约为主流基线10%的数据量),便在ImageNet-1K等六项零样本分类基准上取得83.6%平均准确率,超越使用10B数据训练的开源基线。在训练范式上,采用四阶段渐进式原生动态分辨率训练,从预训练之初即适配下游任务输入特性,告别传统“固定分辨率预训练+事后适配”模式。目前,TuringViT已推出18L与24L两个规格版本,在1536×1536分辨率下推理吞吐量达Seed1.5-ViT的3.04倍。

针对此次发布,各方表态聚焦于技术普惠与业务落地。小鹏集团官方表示,TuringViT不仅是内部业务的技术支撑,更为行业提供了一条不依赖特定硬件、可复现的低成本训练路径,意在推动先进视觉大模型从“头部专属”走向“行业普惠”。财经媒体分析指出,该技术有效突破了当前视觉编码器面临的算力成本高、数据效率低及场景适配难三大行业瓶颈,标志着物理AI感知底座的进一步完善。汽车行业媒体则关注其在端侧部署的实际表现,认为近线性延迟特性为车端高分辨率感知扫清了核心障碍,有助于加速第二代VLA模型及具身智能的商业化进程。

据报道,TuringViT的落地将对小鹏三大核心业务产生直接影响。在智能驾驶领域,作为第二代VLA模型的核心视觉编码器,其将支撑多路环视摄像头的高分辨率动态输入,助力窄路通行、无导航辅助驾驶等功能体验升级。在智能座舱方面,VLM原生特性使视觉特征与语言模型对齐更高效,可支持更丰富的交互功能。在人形机器人领域,TuringViT充当IRON机器人的“视觉视网膜”,提供物体识别与空间理解能力,且统一的基座架构可使智驾积累的视觉经验快速迁移至机器人场景,大幅降低跨场景研发成本。此外,开放的技术路径有望降低行业定制门槛,促进生态共建。

模型性能对比数据

截至发稿,TuringViT项目主页及相关论文已对外公开,技术细节可供业界复现验证。小鹏集团透露,未来将持续扩大高质量图文视频数据规模,深化时序建模与具身视觉方向探索,推动视觉基座与VLM/VLA系统深度融合。目前,搭载该技术的第二代VLA模型及IRON机器人相关应用正处于测试验证阶段,具体量产上车时间表有待官方进一步确认。业内普遍认为,该技术的实际效能仍需经过大规模真实路况与复杂场景的长期检验。

信息截至2026年7月21日,后续进展请以官方披露为准。