阿里云,接得住中国智驾吗?

网易专栏9小时前发布 nxnqh
1 0 0

🤖 AI总结

主题

阿里云构建智驾大模型时代的数据-模型-算力一体化基础设施。

摘要

阿里云通过芯云模一体的全栈AI产线,为车企提供数据、模型、算力支持,以应对智驾大模型时代的工业化竞争。

关键信息

  • 1 阿里云提出芯云模一体,打通数据产线、模型基座与算力集群。
  • 2 小鹏等车企已采用阿里云方案,PPU使用规模向数十万卡迈进。
  • 3 阿里云定位为智驾基础设施的“地基”,不替车企选择算法路线。

阿里云,接得住中国智驾吗?

智驾团队还在吵路线,产线已经开始交卷

作者|李苏

编辑|靖宇

8 月,乌兰察布。

近 30 位来自核心车企和方案商的智驾关键力量,被请进了阿里巴巴数据中心。

这里承载着中国智能驾驶研发 60% 的算力。数据中心昼夜不停,像一颗强健搏动的心脏;而道路上智能驾驶的车辆每一次从容的转弯、精准的刹停、安稳的跟车,背后都可能是这里彻夜的计算。几乎所有参会者正在训练的模型,就跑在脚下这片机房里。

把论坛开在数据中心所在地,本身就是一个信号:智驾的竞争,已经从算法下沉到工程。

阿里云智能集团资深副总裁、公共云事业部总裁刘伟光的开场白很简短——模型、芯片、云,这三样东西过去由三类供应商分别提供,在三种不同的会上讨论。这一次,它们被放在同一张桌上,由同一批决策者一起追问。

没有人再争论车企要不要上云,问题变成了:当智驾进入大模型时代,中国车企需要什么样的基础设施?谁能把芯片、云、模型三层都做通,而不是只卖其中一层?

阿里云给出的答案,是一条产线——从数据到模型再到算力,完整打通。

阿里云,接得住中国智驾吗?

阿里巴巴在乌兰察布的数据中心之一|图片来源:阿里云

01

问题在下沉

如今,智驾的路线正在分化。

端到端已成共识,但再往上,有人押注 VLA,有人赌世界模型,也有公司选择继续深耕端到端本身。

但不管是哪条路,范式一旦切换到「训模型」,瓶颈就变成了三件事的困境——数据供得上吗?模型底子够好吗?算力扛得住吗?任何一项是短板,另两项的投入都会被浪费。

过去一年,行业里出现了一个怪现象。

各家车企和方案商都在抢卡,但买了卡之后,很多人发现模型迭代速度并没有明显提升。

不少车企有过类似的经历:集群建起来了,算法团队反而更焦虑——数据清洗和标注的周期仍以周计,多模态数据从车端回流到进入训练,中间要经过大量人工和半自动化工序,可用的训练样本迟迟供不上来。

算力卡只是入场券,而数据产线才是瓶颈。

在这轮技术切换里,特斯拉始终是被反复研究的样本。它的数据飞轮不是秘密,行业里人人都在谈,但很多人只看到了模型架构的切换,没看到背后的工程化。

对此,阿里云智能集团副总裁、计算平台事业部负责人汪军华的判断很直接:特斯拉的真正壁垒,不仅是算法,更是其极度高效的数据到模型产线闭环能力;而数据到模型产线的闭环效率,往往是模型迭代速度中最短的那块木板。

阿里云,接得住中国智驾吗?

车企和智驾公司关键力量齐聚智驾论坛|图片来源:阿里云

阿里云的解法是重构整条产线——简单来说,阿里云提供的不是一个标注工具或一个存储方案,而是从多模态数据接入、自动化清洗、向量化、大模型自动标注,到基于历史训练分布的混合样本检索的全链路支持。通过分布式计算引擎与千万级任务调度,数据包处理效率相比传统自建方案提升一个数量级。

按照汪军华的说法,阿里云日处理能力达到百万级 clips,支撑模型以天为单位迭代。

这个数字背后是一个工程现实。过去,车企的数据团队要先把车端回流的原始数据拷到本地服务器,再分批上传到云,然后进行格式转换、去重、清洗,最后交给标注团队,每一个环节都是断点。阿里云的产线把这些断点接了起来:数据从车端回流后,不再需要人工搬运,而是顺着管道一路走下去,自动完成转换、清洗和标注,最后直接拿去训练。

会场上,有人抛出一个尖锐的问题:过去积累的数据,到底还算不算护城河?一个没有历史包袱、从零直接做 VLA 的新玩家,有没有可能弯道超车?

这个问题没有得到一致的答案。VLA 对数据的要求,与上一代端到端不尽相同,历史数据的价值确实需要重新评估;但自动驾驶的长尾问题,又离不开海量真实场景的持续积累。

阿里云的回应给出了另一个视角:真正的护城河,可能不是硬盘里存了多少数据,而是那条能把海量、杂乱的非结构化数据,持续炼成高质量训练样本的数据闭环产线。数据会随着技术路线切换而贬值,产线不会——路线换了,产线还在高速运转。这恰恰是从零起步的新玩家最缺的东西:数据可以补采,产线的工程能力和迭代节奏,却需要时间一米一米地修出来。

争论难有结论,但共识是清晰的——只解决数据层是不够的。当智驾进入大模型时代,车企缺的不是更多的卡,也不是一个更聪明的模型,而是一条从数据、到模型、到算力被完整打通的产线。

02

芯、云、模一体

芯片对应算力,云对应数据产线,模型对应基座与世界模型——所谓芯云模一体,就是把三层串成一条产线。

这要从产线的上下游关系理解。数据产线把 clips 准备好,模型训练才能启动;模型一旦进入训练,算力层必须跟得上。三者是上下游关系,缺了哪一环,另外两环的投入都会打折。

模型层是阿里云区别于任何一家纯算力或纯芯片供应商的地方。刘伟光在论坛上表示:「千问模型,正在成为智驾 VLA 的一种基座选择;万相,可以作为世界模型的生成引擎,去出题、去评价。让中国的大模型,真正开进现实世界。」

这两句话,对应车企在模型层最现实的两个问题:基座从哪里来,考题由谁来出。

先看基座。VLA 模型需要理解物理世界的因果——前车为什么刹车、行人会不会突然横穿,也需要大量常识——识别临时路牌、判断潮汐车道、给救护车让行。这些能力并非来自驾驶数据本身,而是语言大模型经过海量数据训练才具备的。

对车企而言,从零自研基座意味着重复这笔投入,更可行的路径是在云上对大参数量基座模型做后训练,再蒸馏成小模型,以适配不同的车端算力平台。千问成为「一种基座选择」,指向的正是这一需求。

再看考题。模型学会了开车,不等于经得起所有路况。训练必须覆盖那些现实中很少遇到、却决定安全上限的场景——极端天气、罕见路况、突发状况。靠路测去等这些场景出现,成本和周期都不可接受;世界模型的价值,是把它们生成出来,给模型出考卷,再给答卷打分。万相承担的正是这个角色。

这条路径,就是刘伟光概括的方向——「从模仿,到强化;从会开车,到懂世界」。

这已经不是概念阶段了。小鹏汽车自动驾驶产品高级总监、Robotaxi 事业部负责人袁婷婷在会上提到,小鹏的第二代 VLA 让视觉原始数据更快进入模型、直接产生动作,带来断代式的安全与体验提升。

小鹏与阿里云的合作也不止于一层:四年前,双方共建乌兰察布智算中心「扶摇」,那是当时中国规模最大的自动驾驶专用智算中心;如今,小鹏也开始用阿里云的国产芯片做训练。

阿里云,接得住中国智驾吗?

注:2022 年 8 月,小鹏汽车与阿里云合作,在乌兰察布建成中国最大的自动驾驶智算中心「扶摇」。

基座与考题就位之后,压力顺产线传导到算力层。

第一个问题,是卡怎么管。头部车企与智驾公司都在推进多元算力战略,国产芯片占比显著提升,但不同国产芯片的软件栈、算子库差异较大,迁移适配成本很高。

阿里云用人工智能平台 PAI 统一调度训练卡和推理卡,不管是何种芯片,都纳进同一个资源池,深度适配主流的国产 AI 芯片;通过统一的软件栈和编译优化技术屏蔽底层异构差异,平台可支持万卡可扩展的国产资源集群,有效算力利用率稳定在 97%以上,工程上对齐前沿卡的使用体验,包括镜像组件、工具链、部署、调优等细节。同时,基于人工智能平台 PAI 构建的端到端世界模型训练平台,覆盖大规模驾驶场景数据的模型训练、仿真验证与迭代优化。

面对台下的算力采购决策者,阿里云智能集团加速计算产品和技术负责人王超把问题挑明了。他说,今天到场的人心里其实只有三个问题:「算力稳不稳、值不值和够不够。」这三问的答案不在调度层,在卡本身。

当模型越来越大,数据吞吐越来越高,芯片层就成了这条产线的最后一道闸门。

平头哥半导体副总裁高慧在演讲中说,市面上「超节点」众多,但很多标榜超节点的产品本质上仍是基于以太网等传统网络协议的服务器堆叠。真正的判据只有一个:是否实现了支持同步内存语义的统一编址。只有做到这一点,节点内的算力才能真正跳出通信瓶颈,作为一个完整的巨型 GPU 被统一调度,从而让总有效算力最大极限地逼近单卡的线性叠加。

在这个标准下,平头哥做出了国内首个 64 卡单层、全对称超节点架构:卡间带宽一致,64 卡单跳时延一致,统一内存语义并无缝兼容 NCCL 底层通信原语。

阿里云,接得住中国智驾吗?

注:图为平头哥 M890 芯片。

在智驾的世界里,有时候数字是最硬的。2024 年 12 月,首台 PPU 服务器在车企上线;如今汽车行业 PPU 使用规模正向数十万卡迈进,30 多家车企与智驾方案商在使用,50 余个自动驾驶主流模型已验证兼容。

如今看来,三层同时在场的真正意义,不在于每一层有多强,而在于它们能被拼成一件事。

阿里云表态,硬件厂商继续提升单卡算力与互联带宽、完善基础生态,而阿里云会做好算力底座的兜底,用软件定义的优势,弥补硬件生态初期的碎片化。

这句话只有在同时拥有芯片和云的公司口中才成立。

三层协同还有一笔经济账。训练需求天然是波动的:模型迭代的关键期算力需求陡增,平日回落。统一调度让车企可以在业务波峰时瞬间拉起大规模集群,既满足突发计算需求,又避免算力在闲置中贬值。

03

不确定中的确定性

路线分化带来的不是选择的自由,而是焦虑。每一条路都需要重资产投入,而车企的预算和耐心都是有限的。

从 2026 阿里云智驾论坛参会者的口中能听出,很多人担心基础设施选错,这种焦虑在行业里很普遍。去年下半年以来,不少车企的智驾团队经历了组织架构调整,有的从自研转向与方案商合作,有的从方案商手中收回自研权。摇摆的背后,是对投入产出比的重新计算。

但把几条路线摆到一起看会发现,分歧集中在算法层,对地基的要求却出奇一致:数据都要以天为单位供上来,算力都要以万卡为单位管起来,基座模型与世界模型的能力,按各家的路线各取所需。

这决定了地基不存在「押错」的问题。无论 VLA、世界模型还是端到端最终跑通,赢家都要跑在同一条产线上。阿里云把投入放在地基而不是路线上:数据产线兼容不同架构的模型输入,基座模型支持多种下游任务,算力集群适配不同的训练框架和推理需求。

阿里云 AI 汽车行业总经理李强把这个定位说得更直白:「阿里云不替各位选路线,我们想把这块地基修得够厚。」

在刘伟光看来,算力全栈自研,是这条路走得远、走得稳的底气。而地基的终点,是他在致辞结尾给出的定位:「云之于 AI,绝不仅仅是算力供应。我们要做的,是一朵全栈AI 的云,是为中国建一座 AI 工厂。让每一家车企都能在这座工厂里,造出自己的智能。」

这句话的分量,在会后得到了验证。

8 月 10 日,灵骏·真武 M890 超节点实例正式开售,订单成功后 1 小时内交付。几天前,它还只是闭门会上的技术参数;从公布到商用,中间只隔了不到一周。这种节奏在国产芯片领域并不常见——它说明这块地基不是实验室产品,而是已经进入规模化部署和持续迭代的商业轨道。

从扶摇到乌兰察布,阿里云在汽车行业的角色已经变了。2022 年,小鹏携手阿里云共建自动驾驶专用智算中心「扶摇」,那时阿里云回答的问题是「要不要上云」;今天它回答的是「云要提供什么」——从芯片到软件栈,从数据平台到模型基座,全部自研。

当车企与方案商的核心决策者在乌兰察布数据中心走廊里擦肩而过时,中国智驾正在完成一次身份转换:从算法竞赛,走向工业化竞争。

算法竞赛里可以有黑马,工业化竞争里没有奇迹。路线之争还会继续,会有人押对,也会有人调头,但无论哪条路先跑通,它都会跑在一条被完整打通的产线上。

这就是不确定中的确定性。

*头图来源:AI 生成

本文为极客公园原创文章,转载请联系极客君微信 geekparkGO

极客一问

你认为目前智驾发展

最大的障碍是什么?

© 版权声明

相关文章