0
  • 聊天消息
  • 系统消息
  • 评论与回复
登录后你可以
  • 下载海量资料
  • 学习在线课程
  • 观看技术视频
  • 写文章/发帖/加入社区
会员中心
创作中心

完善资料让更多小伙伴认识你,还能领取20积分哦,立即完善>

3天内不再提示

华为智能驾驶芯片深度分析

佐思汽车研究 来源:佐思汽车研究 2023-10-20 16:57 次阅读

华为智能汽车部门IntelligentAutomotive Solutions(IAS)下设包括提供应用算法的AutonomousDriving Solution (ADS)部门、提供域控制器的Mobile Data Center(MDC)和提供传感器系统的集成感知事业部。其中,ADS负责算法研究,下分很多小组,分得特别精细,比如有Obstacle Detection Team障碍物探测、Prediction and Decision预测与决策;MDC类似于Tier1,前身为中央计算部门,主要为华为ARM服务器业务提供硬件。华为智能驾驶使用的芯片海思提供,华为ARM服务器芯片也由海思提供,智能驾驶和ARM服务器芯片共用大部分研发成果。

华为海思AI产品线规划路线图

e78496b8-6f12-11ee-939d-92fbcf53809c.png

图片来源:https://ggim.un.org/meetings/2019/Deqing/documents/1-3%20Huawei%20slides.pdf

海思AI产品线规划有四条,分别为鲲鹏、昇腾、麒麟和鸿鹄。其中,鲲鹏系列主要是CPU,昇腾是AI加速器,麒麟主要是针对手机,鸿鹄针对电视。智能驾驶是昇腾产品线的延伸。此外基于麒麟990的麒麟990A则是华为汽车座舱芯片。

华为智能驾驶芯片主要有昇腾310、昇腾610和昇腾620,这三款芯片还可以级联增加性能。https://www-file.huawei.com/-/media/corp2020/pdf/publications/huawei-research/2022/huawei-research-issue1-en.pdf,这个文档里有华为昇腾系列芯片的详细解释,本文主要资料来源就是这个文档。

昇腾610的内部框架图

e790035e-6f12-11ee-939d-92fbcf53809c.png

图片来源:华为

昇腾910内部框架图

e79cd5f2-6f12-11ee-939d-92fbcf53809c.png

图片来源:华为

华为设计芯片是模块形式,尽量复用研发成果,昇腾系列芯片的CPU和AI核心基本是相同的,只是核心数量不同。

华为昇腾核心特性一览表

e7ae5f5c-6f12-11ee-939d-92fbcf53809c.jpg

图片来源:华为

昇腾核心即AI核,分原始、Max、Mini、Lite、Tiny几个版本,针对不同的应用使用不同的核心和数量配置,如针对手机领域的麒麟990,是两个Lite和一个Tiny核心,三个加起来是6.88TOPS@INT8算力。昇腾310则是两个Mini核心,昇腾610则是10个原始核心,昇腾910是32个Max核心。昇腾620可能是10个Max核心。每个核心基本是相同的,主要是缓存配置和频率配置不同。

不同的核心对应不同的算法网络

e7bb1e54-6f12-11ee-939d-92fbcf53809c.jpg

图片来源:华为

昇腾Max核心内部框架

e7c698ce-6f12-11ee-939d-92fbcf53809c.png

图片来源:华为

上图为Max核心内部框架,主要包括标量Scalar、矢量Vector和张量Tensor三个运算单元。标量单元负责任务调度,矢量单元负责深度学习最后的激活阶段,张量负责卷积矩阵乘法。

三种运算单元的计算模式

e7d87c38-6f12-11ee-939d-92fbcf53809c.png

图片来源:华为

标量基本近似CPU,灵活性最高,但针对AI运算力最低。1D矢量近似于GPU,灵活性居中,AI算力中等,CUBE针对2D矩阵,也就是一般意义上的张量。

e7edbff8-6f12-11ee-939d-92fbcf53809c.png

如果按照严格数学的定义,那么矢量是一阶张量,矩阵是二阶张量,CUBE核跟英伟达的所谓张量核Tensor基本一致。

e7f53fc6-6f12-11ee-939d-92fbcf53809c.png

英伟达自Turing架构开始用的张量核架构和华为的CUBE基本一致,都是三维架构。

三种运算核心的对比

e800ed80-6f12-11ee-939d-92fbcf53809c.png

图片来源:华为

一个CUBE核是8TOPS@FP16的算力,注意是FP16不是常见的INT8,车载领域一般是INT8。一个CUBE内部包含4096个FP16 MACs,8192个INT8 MACs,而一个MAC是包含两个Ops,因此如果运行频率是1GHz,那FP16算力就是1G*2*4096=8T。

同样,谷歌的TPU V1是65000个FP16 MAC,运行频率0.7GHz,那么算力就是65000*0.7G*2=91T。特斯拉第一代FSD两个NPU,每个NPU是9216个INT8 MAC,运行频率是2GHz,算力就是2*2*2G*9216=73TOPS。所谓算力基本就是MAC数量的堆砌,堆的越多,算力越高,面积也越大,成本就越高。

算力这个数字不用较真。

几个手机芯片的AI算力对比

e814b176-6f12-11ee-939d-92fbcf53809c.jpg

来源:华为

高通骁龙865标称最高,有8TOPS,但AI得分很低,远低于4.5TOPS的联发科天玑1000,更低于华为的麒麟990,显然高通的水分很大,联发科则太老实了,标称比实际低了至少1TOPS。

华为在2019年在IEEE上发表论文《Kunpeng 920: The First 7-nm Chiplet-Based 64-Core ARM SoC for CloudServices》,链接为https://ieeexplore.ieee.org/document/9444893,这可是要付费浏览的论文,不是ARXIV那种只要你投就发表的论文,IEEE的论文是要严格审核的。

华为的论文主要说了LLC,即最后一级缓存。鲲鹏920的设计中,将SoC的全局LLC切片到各个CPU Cluster中,使LLC与CPU Cluster形成NUMA关系。因此,需要仔细考虑如何选择每个集群的适当大小,以最大限度地发挥其效益。综合考虑多种因素,选择每个集群4个CPU核心,以获得当前进程节点的最佳PPA分数。

LLC采用私有模式或共享模式:私有模式通常用于每个CPU核心承载相对独立的任务数据时;当SoC内的任务共享大量数据时,通常使用共享模式。

在私有模式下,每个CPU集群和对应的LLC切片组成一个私有组,可以避免集群访问高延迟的缓存切片。

在共享模式下,所有 LLC切片组合在一起充当一个块,以提高 SoC 内部数据的重用率。

再来看CPU部分,昇腾610里是16核心的CPU,按照惯例这里的CPU核心很可能就是鲲鹏里的CPU核心,即《Kunpeng 920: The First 7-nm Chiplet-Based 64-Core ARM SoC for CloudServices》里所说的TAISHAN V110,众所周知,泰山也是华为服务器的产品线名称。TAISHAN V110是ARM系列的魔改,因为TAISHAN V120内核是基于ARM Cortex-A76的魔改,https://www.huaweicentral.com/kirin-990a-huaweis-first-auto-chipset-installed-in-arcfox-alpha-s-smart-car/,这里提到了麒麟990A的CPU是TAISHAN V120的lite版,而https://www.hisilicon.com/en/products/Kirin/Kirin-flagship-chips/Kirin-990-5G,则直接承认麒麟990的CPU就是ARM Cortex-A76,因此TAISHANV110很可能是ARM Cortex-A75或A73或者是ARM服务器系列的N1。和英伟达的Orin使用的ARM Cortex-A78AE差距很大,但华为用数量弥补了这一差距,基本与英伟达旗鼓相当。

NoC方面是2D的4*6 MESH网格,节点间工作频率2GHz,带宽1024位即256GB/s,这个在2019年是比较高端的配置,但现在是2023年了,只能是中等配置。

华为与其他智能驾驶芯片的对比

e81f39ac-6f12-11ee-939d-92fbcf53809c.png

图片来源:华为

华为最后也做了与其他智能驾驶芯片的对比,从中也可以看出昇腾610的die size尺寸很大,有401平方毫米。根据TechanaLye的分析,英伟达Orin的die size是455平方毫米,不过英伟达是三星的8纳米工艺,如果用和昇腾一样的台积电7纳米工艺,那么面积应该与昇腾610差不多,也就是说昇腾610的硬件成本和英伟达Orin是基本一致的。依照昇腾610的功率,水冷散热是少不了的。

算力实际上很难对比,英伟达的一般都是稀疏算力,而华为据说是稠密,通常两者会差一倍。英伟达Orin有多个版本,最顶级版本的275TOPS@稀疏INT8,算力实际上是两部分:一部分由2048个CUDA贡献,最高频率1.3GHz,贡献170TOPS@稀疏INT8算力;另一部分是64个张量核贡献,最高频率1.6GHz,贡献105TOPS@INT8稀疏算力,如果是FP32稠密格式那么算力仅为5.3TOPS(此时只有CUDA能处理FP32数据),并且CUDA核和张量核很难同时达到最大化性能。张量核主要做矩阵乘法,CUDA主要做矩阵与矢量乘法,矢量与矢量之间乘法,CPU会根据数据和任务的不同安排谁来工作。

此外稀疏和稠密有三种不同的定义,一种稀疏是计算稀疏,稀疏指计算密度低,谷歌第四代TPU就特设稀疏核,就是针对稀疏计算部分如transformer的嵌入部分。另一种是输入数据本身就是稀疏矩阵,还有一种是密集权重模型经过剪枝后的稀疏模型。天然稀疏矩阵指原始数据就包含很多0的矩阵,激光雷达的信息矩阵就是典型的稀疏矩阵,RGB摄像头一般是稠密矩阵。

在汽车这种嵌入式领域,算力和存储带宽限制需要尽可能地降低权重规模,对模型进行剪枝或者说蒸馏,这种属于主动将模型稀疏化,通常有四级,分别是Fine-grained、Vector、Kernel和Filter,分别对应单个权重、行或列、通道和卷积核。

英伟达对于最高级的fine grained做了特别优化,相对稠密模型,计算速度提高一倍,也就是算力数值高了一倍,英伟达公布的算力数值,一般默认是稀疏。如果没有针对fine grained优化,那么计算速度还是与稠密模型时一致。顺便说一句,对于激光雷达这种稀疏矩阵,人类目前没有找到好的优化加速的方法。

算力数值实际和算法高度捆绑。若算法不匹配,最糟糕的情况下,算力只能发挥1%不到,也就是如果是100TOPS的算力,那么实际只发挥了不到1TOPS,这种情况不算罕见。

昇腾的软件开发栈

e829f2e8-6f12-11ee-939d-92fbcf53809c.png

图片来源:华为

上图是昇腾的软件开发栈,CUDA还是必须使用,算子库还是常见的cuBLAS,英伟达的GPU此时会更占优势。

Transformer时代,存储带宽比算力数值更有价值。CNN时代,卷积之类的稠密算子占了90%以上的计算,而Transformer时代稠密算子所占的部分大幅下降,对存储带宽要求高的存储密集型算子大幅增加数倍,80-90%的计算延迟都是由这些算子造成的。

存储带宽方面,昇腾910不计成本使用了HBM,不过2019年只有HBM一代,昇腾910的存储带宽是1TB/s,和目前主流AI加速器比差距较大;昇腾610自然无法用昂贵的HBM,只能是LPDDR4/5,估计是100-200GB/s之间;昇腾310考虑成本,存储带宽只有47.8GB/s。特斯拉二代FSD用了GDDR6做存储,可轻易超过400GB/s。

考虑到华为的智能驾驶芯片是2019年确定设计框架的,这在2019年毫无疑问是全球最先进的,没有之一,即便到了2023年,这个设计仍然不算落伍,但与英伟达和高通的下一代相比,难免出现差距。特别是Transformer对AI运算有非常大的改变,必须做出对应的修改。

声明:本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人,不代表电子发烧友网立场。文章及其配图仅供工程师学习之用,如有内容侵权或者其他违规问题,请联系本站处理。 举报投诉
  • 华为
    +关注

    关注

    215

    文章

    34282

    浏览量

    251097
  • 智能驾驶
    +关注

    关注

    3

    文章

    2443

    浏览量

    48620
  • cnn
    cnn
    +关注

    关注

    3

    文章

    351

    浏览量

    22154

原文标题:华为智能驾驶芯片深度分析

文章出处:【微信号:zuosiqiche,微信公众号:佐思汽车研究】欢迎添加关注!文章转载请注明出处。

收藏 人收藏

    评论

    相关推荐

    智能驾驶的市场前景分析

    智能驾驶的市场前景广阔,以下是对其市场前景的分析: 一、市场需求持续增长 随着消费者对智能驾驶技术的认知度和接受度不断提高,市场需求也在持续
    的头像 发表于 10-23 15:44 361次阅读

    比亚迪方程豹与华为签订智能驾驶合作协议

    比亚迪与华为在深圳携手,正式签署智能驾驶领域的深度合作协议,标志着双方合作迈入全新阶段。此次合作聚焦于比亚迪旗下方程豹品牌,特别是即将震撼登场的方程豹豹8车型,旨在为全球消费者带来前所
    的头像 发表于 09-29 18:25 599次阅读

    华为智能驾驶发展路径探讨

    随着全球科技的迅速发展,汽车产业正经历着从机械化向智能化的发展转型,而智能驾驶技术则是这一变革的核心推动力。全球各大汽车制造商和科技公司纷纷布局智能
    的头像 发表于 09-19 10:09 1311次阅读
    <b class='flag-5'>华为</b><b class='flag-5'>智能</b><b class='flag-5'>驾驶</b>发展路径探讨

    比亚迪与华为合作,加快智能驾驶领域深度融合

    8月27日,比亚迪旗下的方程豹品牌与华为乾崑智驾在深圳正式达成战略合作,标志着中国两大科技巨头在智能驾驶领域的深度融合。双方携手共创,旨在推出全球首个专为硬派车型设计的专属
    的头像 发表于 08-27 14:30 1226次阅读

    深度学习在自动驾驶中的关键技术

    随着人工智能技术的飞速发展,自动驾驶技术作为其中的重要分支,正逐渐走向成熟。在自动驾驶系统中,深度学习技术发挥着至关重要的作用。它通过模拟人脑的学习过程,实现对车辆周围环境的感知、理解
    的头像 发表于 07-01 11:40 655次阅读

    HDC2024华为发布鸿蒙原生智能:AI与OS深度融合,开启全新的AI时代

    6月21日,华为开发者大会2024(HDC.2024)召开。 HarmonyOS NEXT将AI与OS深度融合,构筑全新鸿蒙原生智能框架。大会现场,华为常务董事、终端BG董事长、
    的头像 发表于 06-24 09:28 583次阅读
    HDC2024<b class='flag-5'>华为</b>发布鸿蒙原生<b class='flag-5'>智能</b>:AI与OS<b class='flag-5'>深度</b>融合,开启全新的AI时代

    华为智能驾驶:领跑全球的智能驾驶新纪元

    ,与这些科技巨头不同,华为却坚定地跨界进入智能驾驶领域,并最终成为全球领先的智能驾驶操作系统供应商。这背后,是
    的头像 发表于 06-21 16:35 1838次阅读

    易控智驾获华为MDC 2023年智能驾驶杰出合作伙伴的称号

    4月24日下午,在“智在·必行”2024华为智能汽车解决方案MDC生态论坛上,易控智驾凭借在矿山无人驾驶领域规模化落地应用实践的突出成就,获得华为MDC 2023年
    的头像 发表于 04-25 18:27 1904次阅读
    易控智驾获<b class='flag-5'>华为</b>MDC 2023年<b class='flag-5'>智能</b><b class='flag-5'>驾驶</b>杰出合作伙伴的称号

    智能驾驶基本概念定义 中国智能驾驶格局分析

    在行车领域,产品迭代路线包括低级辅助驾驶到高级驾驶辅助,涵盖了诸如LKA、AEB、ACC、LCC、ALC、HWA等功能。城市NOA和高速NOA则实现了在城市和高速场景下的智能驾驶
    发表于 04-12 11:36 1205次阅读
    <b class='flag-5'>智能</b><b class='flag-5'>驾驶</b>基本概念定义 中国<b class='flag-5'>智能</b><b class='flag-5'>驾驶</b>格局<b class='flag-5'>分析</b>

    平线与黑芝麻智驾芯片发展路径的深度复盘

    智能驾驶芯片市场正处于白热化的竞争之中,各大企业争相寻求突围和领先优势。 从现有数据和分析可以看出,智能
    发表于 04-01 11:47 678次阅读
    平线与黑芝麻智驾<b class='flag-5'>芯片</b>发展路径的<b class='flag-5'>深度</b>复盘

    华为公开智能驾驶新专利:可识别唇语并报警

    华为技术有限公司最近公开了一项关于“报警方法、装置以及智能驾驶设备”的新专利,这项创新技术为智能驾驶领域注入了新的活力。
    的头像 发表于 03-26 09:26 600次阅读

    华为自动驾驶技术怎么样?

    强大,主要体现在以下几个方面: 强大的研发团队:华为拥有一支专业的研发团队,专注于自动驾驶技术的研发和创新。这支团队汇聚了众多顶尖的技术专家和工程师,具备丰富的研发经验和技术积累。 领先的技术储备:华为在通信、
    的头像 发表于 02-02 16:58 1648次阅读

    长安华为合资公司将涉足智能驾驶等领域

    据了解,今年的11月25日,长安汽车与华为在深圳签署了一份《投资合作备忘录》,约定华为将设立一个专注智能网联汽车智能驾驶系统及增量部件研发、
    的头像 发表于 01-16 11:20 502次阅读

    智能驾驶芯片TOP20排名

    智能驾驶芯片排名并不简单只看AI算力,CPU、存储带宽、功耗和AI算力数值一样重要,这个下文会详细分析
    的头像 发表于 12-28 10:29 2552次阅读
    <b class='flag-5'>智能</b><b class='flag-5'>驾驶</b><b class='flag-5'>芯片</b>TOP20排名

    华为与哈工大联合推出新型芯片技术

    芯片华为
    深圳市浮思特科技有限公司
    发布于 :2023年12月07日 17:58:10