关于ZAKER Skills GEO服务 合作
芯智讯 6小时前

麒麟 9050 Pro 拆解:两颗 Die “折叠”,当一颗用

近日,半导体分析机构 Kurnal Insights 发布了华为麒麟 9050 Pro(Hisilicon Hi36E0)芯片裸片照片(Die Shot),展示了这款基于华为 " 韬定律 " 逻辑折叠(LogicFolding)技术的全新 SoC 的内部结构。

逻辑 Die+SARM Die 折叠设计

Kurnal Insights 公布的华为麒麟 9050 Pro 芯片的裸片照片显示,其并未采用传统的将计算单元与 SRAM 在同一个 2D Die 结构上的设计,而且分成了两个 Die,即一颗计算 Die(CPU/GPU/NPU/ISP/DSP 等计算单元都在这个裸片上)与一颗 SRAM Die(SRAM/Cache 都在这个裸片上)通过 " 逻辑折叠 " 技术键合而成,这种方法缩短了信号链路,并利低至微米级间距的垂直互连,使两个 Die 在功能上作为一个单片单元运行。

据华为半导体业务负责人何庭波此前披露的论文阐述,所谓 " 逻辑折叠 ",并非传统意义上的芯片堆叠:传统堆叠是将现成模块在封装层面连接,而逻辑折叠是将原本在平面上展开的完整逻辑系统,放到三维空间中重新设计、重新布线、重新定义时序,其不仅提升了芯片密度和性能,还优化了芯片的信号链路和电气链路,降低了功耗和时延。

从 Kurnal 公布的两个裸片的标注图来看,这两颗裸片尺寸均为 11.13mm × 10.84mm,面积均为 120.65mm²,虽然单个裸片的面积甚至略小于前代麒麟 9030S 的 122mm²,但由于是两个裸片 " 逻辑折叠 " 而成,因此其整体的晶体管密度得到了大幅提升。

据爆料人 @Taog_1575 透露,麒麟 9050 Pro 的计算 Die 采用 N+3 工艺,SRAM Die 则采用 N+2 工艺,这样的工艺组合,在麒麟芯片当中尚属首次。

根据华为半导体业务部总裁何庭波此前公布的论文数据显示,麒麟 9050 Pro 的晶体管密度达到每平方毫米 2.38 亿颗,较麒麟 9030 Pro 的每平方毫米约 1.55 亿颗晶体管提升了 55%。不过,华为最新发布会披露的数据显示,如果只看计算 Die 的逻辑单元晶体管密度,则提升了约 28%。

此外,麒麟 9050 Pro 通过创新的逻辑折叠架构,压缩关键路径时延,能将新芯片时钟缓冲器的数量降低 55%,关键路径时延也减少 30%。与此同时,麒麟 9050 Pro 还实现了 500 万个信号传输键合,跨 Die 传输带宽高达 125TB/ 秒,这也助力了信号传输时延的降低。

根据华为官方的数据,麒麟 9050 Pro 相比上代麒麟 9030 Pro 的 CPU 多核性能提升了 23%;该芯片还集成了一颗超低功耗微核,息屏显示、消息推送等低负载场景由微核运行,有效降低待机功耗;GPU 图形渲染性能提升了 40%;NPU 性能提升了 140%,可以在端侧运行 30B MOE 大模型;集成的第十代 ISP,可以将长焦清晰度提升 34%;通信方面,集成了全新的巴龙基带,支持超 5.5G 通信。

计算 Die:9 核 CPU+6 核 GPU+4 核 NPU

Kurnal 公布的计算 Die 的标注图来看,麒麟 9050 Pro 的逻辑计算单元全部集中在这一层。

其中,左上方的区域是 Maleoon 955 GPU,拥有 6 个 GPU 核心,主频为 1056MHz,占据了相当大的裸片面积。

Maleoon 955 GPU 的下方和右侧则是 LinXi CPU 区域。在具体 CPU 架构方面,麒麟 9050 Pro 搭载自研灵犀 9 核 16 线程 CPU,采用 1+6+2 架构,包含一个主频 3.1GHz 的 LinXi-Big 大核和 6 个主频 2.2GHz 的 LinXi-Mid 中核和 2 个 1.75GHz LinXi-Small 小核。

需要指出的是,从裸片照片来看,麒麟 9050 Pro 的 CPU 分拆成了不同位置的两个独立的集群:一个集群位于 Maleoon 955 GPU 右侧,拥有 1 个 LinXi-Big 大核 +2 个 LinXi-Mid 大核 +2 个 LinXi-Small 小核;另一个集群位于 Maleoon 955 GPU 下方,拥有 4 个 LinXi-Mid 中核。

计算 Die 右侧是面积相当大的 Kirin ISP,并且该 ISP 还配备了专用的双核 CPU 核心;计算 Die 的下方中央是四核心的达芬奇(Da Vinci)NPU,左下方是 DSP/Dispaly 单元,右下方是巴龙(Balong)5G 基带。

此外,计算 Die 内部还分布着多个 Cach Controller,边缘还分布着多个 Memory Controller 和 I/O Controller & Buffer 等模块。

SRAM Die:与计算 Die 垂直耦合的有源多级缓存层

Kurnal 公布的 SRAM Die 标注图显示,这一层并不是一片简单的 " 缓存仓库 ",而是与计算 Die 高度对应的有源存储层。

其中,麒麟 9050 Pro 的六个 Maleoon 955 GPU,不仅每个核心都配备了独立的一级缓存,同时还有 4MB 的共享二级缓存。

在 CPU 缓存方面,位于 Maleoon 955 GPU 右侧的 5 核 CPU 集群中,LinXi-Big 大核配备了独立的 3MB 二级缓存,2 个 LinXi-Small 中核分别配备了 256KB 的缓存,2 个 LinXi-Small 小核则配备了 2MB 的共享二级缓存,这 5 个 CPU 核心还拥有共享的 8MB 三级缓存。

位于 Maleoon 955 GPU 下方的拥有 4 个 LinXi-Mid 中核的 CPU 集群,则配备了共享的 8MB 二级缓存。

在 NPU 方面,4 个芬奇架构的 NPU 核心,每个核心均拥有独立的 1MB 缓存。

Kirin ISP 专用的双核 CPU,也配备了 512KB 的二级缓存;DSP/Display 计算单元,配备了 512KB 缓存;巴龙 5G 基带也配备了 2304KB 缓存。

此外,麒麟 9050 Pro 还配备了 12MB 的 SLC 系统缓存,整个 SoC 的计算单元都能够进行调用。

其中,各个计算单元内部的 Cache 是解决局部、高频、低延迟数据访问;12MB SLC 则承担更高一级的系统级数据共享;外部的 LPDDR 负责更大规模的数据存取。

需要指出的是,在 SoC 当中,计算单元和存储单元之间存在大量、高频、低延迟的数据交换,如果能够缩短互连距离,那么将能够大幅降低 RC 延迟、动态功耗和布线资源占用,因此将计算单元和存储单元进行垂直集成价值更高。

但是,麒麟 9050 Pro 的 SRAM Die 并不是一个简单的大容量共享 Cache 层,而是为 CPU、GPU、NPU 等计算单元配备了紧密耦合的独立多级 Cache,并与 SLC 一起纳入了这个垂直缓存体系当中。逻辑 Die 上的各个计算单元和 SRAM Die 上的缓存之间,实际上构成了一组跨硅层的逻辑 - 存储垂直耦合关系,这比单纯的计算 Die 与 DRAM 进行 3D 堆叠更加复杂。

此外,SRAM Die 上还有安全核心和 NPU Controller,周围还分布着多个 PCIe、LPDDR PHY、CSI、DSI、USB PHY、RF 等相关单元。

小结:

虽然麒麟 9050 Pro 通过 " 逻辑折叠 " 设计将逻辑 Die 和 SRAM Die 垂直整合,确实在带宽、时延、功耗和晶体管密度等方面带来了显著收益,但是这并非没有代价。

一方面,两颗 Die 若要稳定协同工作,必须依赖高精度晶圆减薄、混合键合(Hybrid Bonding)以及极高精度的对准与互连工艺。另一方面,传统单 Die 设计中,若 Die 出现损坏,通常只影响一颗 Die;而在 Logic Die + SRAM Die + Bonding 的架构下,任一环节出现问题,都可能拖累最终封装良率,甚至导致两颗 Die 同时报废。

因此,麒麟 9050 Pro 的 " 逻辑折叠 " 方案在换取性能与能效提升的同时,也对制造工艺、键合精度和良率控制提出了更高要求。

编辑:芯智讯 - 浪客剑

相关标签

相关阅读

最新评论

没有更多评论了
头条新闻

头条新闻

时事热点 一手掌握

订阅

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容