详解Xiaomi XLA,新一代SU7开启辅助驾驶新范式
小米汽车
2026年04月09日 19:32

小米XLA和行业主流的VLA技术是什么关系?

VLA和世界模型两大技术路线,小米似乎选择了前者?

小米XLA新增了什么功能?

2000+字解密小米辅助驾驶最新进展,你想知道的都在这篇。

辅助驾驶,究竟如何才能抵达自动驾驶的终局?

伴随着新一代SU7上市,其搭载的Xiaomi HAD小米辅助驾驶软硬件同步升级,给出了一条来自小米汽车的解题新思路。

硬件不分高低配,新一代SU7全系「满配」高规格辅助驾驶硬件:700TOPS算力 Thor 芯片,激光雷达、4D 毫米波雷达、11 个高清摄像头以及 12 个超声波雷达,标准版的配置就堪比行业Max,甚至Ultra版,为辅助驾驶体验提供坚实的基础。

软件升级新架构,新一代SU7全系升级小米XLA认知大模型:具备更多模态、更高效、更可控三大特点,通过让系统开始具备理解世界的能力,从而持续扩展系统的能力边界,标志着小米辅助驾驶正式从「数据驱动」迈入「认知驱动」的新范式。

一句话概括:小米汽车认为,辅助驾驶技术迭代的关键就是让机器具备「认知」。

01 为什么要升级到「认知驱动」?

相信用过辅助驾驶的朋友可能都有一种微妙的感受:即便「端到端」系统在很多常见路况下都表现得挺不错了,但跟人类老司机相比,机器开车的整体体验还是差一截火候。我们认为,老司机和机器的核心区别就在于「是否具备对真实世界的认知」。

传统的端到端技术高度依赖模仿学习,通过输入海量视频Clips让机器模仿人类的开车行为,这也就是所谓的「数据驱动」。「数据驱动」类似「背诵题库」,学习过的场景系统就能快速掌握,但遇到陌生场景就很难「举一反三」。

而真实路况复杂多变,施工改道、临停占道、行人横穿……每天都有无数个“系统从未见过的”长尾场景在发生。我们无法穷尽物理世界的所有情况来让系统充分学习,因此传统的端到端也注定无法解决所有问题。

辅助驾驶要想继续进步,就必须跨越「死记硬背」的阶段,学会像人类一样认知世界,并基于认知做出思考与推理。

02 如何让辅助驾驶具备「认知」能力?

在回答这个问题之前,先来聊聊时下最热门的具身机器人。

前不久,我们发布了一段小米机器人在汽车工厂「实习」的视频。视频中,机器人代替工人,连续从自动送钉设备中精准抓取自攻螺母,并准确放置在定位工装上。这种高精度的物理交互,体现的正是机器的「认知与空间推理能力」。

我们很早就察觉到了这一点,并把「室内机器人精细操作」和「室外辅助驾驶任务」进行混合训练,得到了一个统一的物理AI基座模型——Xiaomi Mimo-Embodied 具身基座大模型。这种创新性的训练方式产生了强大的跨域协同效应,大幅提升模型整体的空间感知与逻辑推理能力。

实验数据证明,在涵盖辅助驾驶与具身机器人感知、决策、规划等 29 项核心基准测试中,Xiaomi MiMo-Embodied 取得了领先的成绩,打造了开源具身基座模型的新标杆。

基于这一基座模型,小米辅助驾驶升级了全新的车端架构:Xiaomi XLA认知大模型。

03 为什么是XLA,而不是VLA?

人类驾驶,实际上是一个多模态感知与复杂推理的过程。除了视觉,我们还会依靠听觉去捕捉环境音,依靠身体的体感去感知加减速的惯性,更会调动大脑中海量的记忆与经验。

参考这一理念,我们将行业主流的VLA技术扩展成为了XLA架构。

X代表着原生支持多模态的数据输入。XLA架构可以将激光雷达的精准测距、视觉的丰富语义、导航的全局视野、声音的动态反馈、乃至机器人物理AI交互数据进行有机融合。

借助多模态输入能力,在新一代SU7上,现在动动嘴就能用语音指令控制辅助驾驶的行车、泊车功能。可以说 “小爱同学,向左变道”来切换车道,也可以说 “小爱同学,离前车远点” ,不用抬手、不用分心,大幅提升了辅助驾驶的操作便利性。

从某种意义上说,Xiaomi XLA 让新一代SU7具备更丰富的感官输入和更广阔的全局知识,从而更全面地感知复杂的交通环境,更深刻地理解真实的物理世界。

04 为什么XLA不显示CoT思维链?

如果说「X」赋予了车辆更全面的认知,那么 Xiaomi XLA 的「L」 语言,则是开启深度逻辑推理的那把钥匙。

传统 VLA 模型在处理 CoT思维链时面临着一个两难的困境:要么输出大段自然语言文本,严重拖延系统的反应时间;要么干脆去掉语言,无法进行复杂的逻辑推演。

但显然,高效和推理都是下一阶段辅助驾驶必须的能力。为了打破这个瓶颈,我们在 Xiaomi XLA 中引入了突破性的潜空间推理(Latent CoT)模式,兼顾了系统低时延和推理能力。简单来说,系统不再需要把思考过程翻译成人类语言,而是在潜空间中直接使用高维机器语言进行推演,从而极大提升了思考速度。

但不显示人类语言,不代表不能了解模型的思考过程。为了避免「端到端」时代的黑盒问题,Xiaomi XLA依然保留了整个推理过程的可解释性与可追溯性。在需要分析模型思考过程的时候,我们可以把「潜空间推理」解码成人类能看懂的语言。这也是我们平时复盘路测常用的方法,借助这一方法,研发工程师可以清晰了解系统的决策路径,及时发现问题并进行有效修正。

05 小米还会使用世界模型吗?

去年 11 月,我们在发布 Xiaomi HAD 增强版时曾向大家深入介绍过「强化学习+世界模型」这套机制。当时行业里有很多探讨:未来的辅助驾驶,到底应该选 VLA 路线,还是选世界模型路线?

针对这一问题,我们始终认为,VLA技术与世界模型技术并非非此即彼,而是可以相辅相成。

在Xiaomi XLA架构中,我们也无缝接入了「强化学习+世界模型」技术。世界模型就像是一个高保真的模拟器,它负责在虚拟世界中源源不断地生成海量、复杂的驾驶场景;再结合强化学习,在这个模拟器中进行无数试错与策略优化,走错了就扣分,对了就加分,在奖励机制下不断尝试,寻找最好的开车思路,从而让算法实现更高的上限。

借助这套闭环训练机制,我们让系统拥有了持续进化的能力,真正做到越开越稳、越开越像老司机。

06 结语

通过向机器注入「认知」能力,Xiaomi XLA持续扩展能力边界,小米辅助驾驶由此开启了一个全新的发展阶段。

如今新一代SU7交付即搭载Xiaomi XLA认知大模型,并且在第一个版本就实现了例如「语音控车」、「商场地库车位级领航」等行业新功能。后续我们将持续迭代体验,同时也会陆续为第一代SU7 Pro/Max、SU7 Ultra、YU7全系提供OTA升级,敬请期待。

最后,我们也再次呼吁,辅助驾驶不是自动驾驶,驾驶仍需保持专注,始终确保在紧急必要时控制车辆。小米汽车也将不断和大家分享辅助驾驶的使用经验与技巧。