香港大学联合华为等机构发布的World Engine论文显示,通过后训练技术可使自动驾驶碰撞率降低45.5%,并在上海实车测试中实现200km零接管。这一成果标志着行业研发范式的关键转折:自动驾驶的竞争焦点,正从单纯比拼预训练数据规模,转向以强化学习和世界模型为核心的“后训练”闭环能力构建。
过去十年,自动驾驶主流路线是模仿学习,即通过海量人类驾驶数据让AI学会“怎么开”。但随着基础模型能力提升,行业遭遇了结构性瓶颈:常规场景数据边际效用递减,而决定安全上限的长尾高风险场景在真实数据中天然稀缺。World Engine的核心价值在于打通了“失败样本挖掘-可交互世界重建-受约束强化学习”的完整链路。其SimEngine模块利用3DGS技术将真实日志重建为可实时渲染的仿真世界,Behaviour World Model则基于扩散模型生成多样化的难例交互,最后通过行为正则化强化学习更新策略,既提升了长尾场景表现,又避免了灾难性遗忘。这种范式与大语言模型领域的DeepSeek R1异曲同工,证明了在稀疏高价值区域进行精细化对齐,比盲目扩大预训练规模更具性价比。在华为ADS的工业级验证中,该系统在rare cut-in等6类安全指标上均显著降低失败事件,验证了后训练作为量产研发闭环技术路线的可行性。

这一技术转向发生在全球汽车AI竞赛进入物理世界理解的关键节点。2026未来汽车AI技术展上,蔚来NWM世界模型、华为城区NOA以及Stellantis与Wayve的L2++合作,均显示出头部玩家对“预测下一帧”能力的集体押注。米其林轮胎数字孪生、法雷奥单摄像头NOA方案等供应链创新,也在为更精细的物理感知提供基础设施支撑。行业共识正在形成:预训练负责获得通用驾驶能力,后训练负责对齐安全边界。这意味着自动驾驶正从“数据驱动”迈向“认知驱动”的新阶段,类似于大模型从Scaling Law向推理能力跃迁的过程。

产业链各方利益格局将因此重塑。对车企而言,后训练降低了对外部海量路测数据的依赖,研发成本结构将从数据采集存储转向算力与算法迭代效率的竞争,拥有高质量私有数据和闭环工具链的企业将获得更高毛利率。对Tier 1供应商,提供仿真引擎、世界模型及强化学习框架将成为新的增值点,如rFpro推出的1毫米精度数字孪生已获日系OEM采用。对消费者,安全体验的提升不再线性依赖于车辆售价,入门级车型也有望通过软件迭代获得高阶安全保障。监管层则面临新挑战:当系统能力来自合成数据与强化学习而非人类示范时,现有的基于里程和事故率的准入标准可能需要引入对“后训练覆盖率”和“安全边界对齐度”的评估维度。

短期内,后训练技术将率先在高端智驾系统中规模化应用,关键变量在于仿真环境的保真度与强化学习的收敛效率。中期看,随着英伟达开源AutoResearch等自动化工具,以及LG单SoC多屏方案摊薄座舱算力成本,后训练能力有望下沉至20万元以下主流市场。但需警惕的是,合成数据的质量天花板和强化学习的奖励函数设计仍是未解难题,若对齐目标偏离真实物理规律,可能导致系统在边缘场景出现不可预期的行为。此外,该技术对高性能算力和专业人才的密集需求,可能进一步加剧头部企业与中小玩家的分化。
自动驾驶的下半场,胜负手不再是数据量的绝对大小,而是谁能更高效地将稀缺的安全经验转化为可泛化的系统能力。