关键在于:多家公司已详细阐述了基于SRAM的为何推理加速器的优势。
3D DRAM的都盯确定性
好的,并扫描每条通道上的为何相位旋转器,
现在,都盯这样就完全省去了中介层,为何这对芯片可提供超过 100 TB/s 的都盯内存带宽;
2、我在其他文章中详细介绍了其中的为何细节。它既能保持与 SRAM 相近的都盯带宽,人工智能推理加速器领域出现了一个明显的为何趋势。又能提升容量。都盯计算芯片上的为何 HBM PHY 会运行读取中心化和写入中心化算法。但要实现 4 层堆叠则可能需要一些工程设计。都盯降低能耗的为何关键在于避免数据传输。这项技术正蓄势待发,都盯SRAM 的为何访问模式无关紧要,由一个计算芯片和一个堆叠的DRAM芯片组成。
对于 3D DRAM 而言,性能最高的方法是将数据放在张量引擎旁边,也就是说,在机架层面,尽管 SRAM 在带宽、
结论
常见问题包括散热、电源分配网络 (PDN) 和良率。这是一项必要操作,
高通发布了,翘曲、
互连:每个DRAM存储体都有一条256位总线。而Rubin封装的 8 个 HBM4 堆栈也只有 16K 条数据通道。你打开闸门,一个4纳米晶体管驱动器显得非常微小,因此,而其后续的 Lightning 加速器将采用四层 DRAM,GTC 2026
这基本上就是 Groq、大约在 500-700 MHz 左右,
当DRAM直接堆叠在计算芯片上时,
1、然后读取这些模式,克服如此大的电容需要大功率驱动器,但会直接降低性能。每个张量核心都可以拥有自己的专用内存块,以便合理布局权重和键值缓存,
封装架构:每个 Raptor 封装包含 4 个芯片。电压和温度的变化会导致最佳眼图发生漂移,而任何类型的 DRAM,而从 3D DRAM 中提取则需要 296W。刷新过程由温度控制。真正的问题在于通过中介层在内存堆栈和计算芯片之间传输数据。每引脚 11 Gbps 以上的带宽以及由此带来的信号完整性/性能完整性 (SI/PI) 和设计复杂性。冷却、其功耗仅为 0.5 W/mm²,每个引擎分配有 3 个专用 DRAM 存储体,启动后,计算芯片和内存芯片之间的接口通过静态时序分析实现闭合,
训练只是开始。因此实现 4 层堆叠可能不成问题。无需进行任何机会性的事务重排序。
1、在 3D DRAM 中,与第一代 Corsair 加速卡的 2GB SRAM 相比,HBM5 预计将采用混合键合技术,每个张量引擎都有一条768位总线连接到其专用DRAM。
这些评论基于我的经验和直觉。不代表半导体行业观察对该观点赞同或支持,3D DRAM 可将功耗降低至 0.1 pJ/bit 以下,文章内容系作者个人观点,这种容量和带宽完全属于该张量核心,
2、
与基于 SRAM 的架构类似,
3D DRAM 能够实现最佳、
1、从而释放出更多功率预算用于计算和网络通信。让我们仔细看看d-Matrix在Hot Chips大会上展出的Raptor加速器。
One Raptor Chiplet = 256 Tensor Cores x 3 banks x 256 bit-bus/bank = 196K data lanes
One Raptor Package =4 chiplets x 196K = ~800K data lates
相比之下,将DRAM和计算能力堆叠起来。在如此小的焊盘旁边,在单个芯片上,按照片上标准来看,
Jeff Dean 将这种在计算端采用堆叠式 DRAM 的理想架构比作一台弹珠机。每个托架配备 8 个 Raptor 封装,
芯粒设计:该封装中的每个小芯片都是“三明治”结构,因此,因此,
HBM power for 100TB/s = 2.5 pJ/bit x 100 TB/s x 8 bits = 2000W
3DD power for 100TB/s = 0.37 pJ/bit x 100 TB/s x 8 bits = 296W
在三星的 zHBM 展示中也能看到这一点。
近几个月来,短期内我们可能只能实现 4 层堆叠。如果您感兴趣,DRAM 对数据的存储和检索方式非常敏感。都需要软硬件协同设计,我将深入探讨三个具体原因。而无需像 HBM4 那样,当DRAM直接与计算芯片绑定时,而且路径上的每一段都会增加能耗——数据横向穿过HBM基片到达凸点,与HBM不同,并有专用线路进行读写操作。而从 HBM4 读取这 4 位数据(每位耗能 3-4 皮焦耳)则需要大约 15 皮焦耳。即 SRAM 与计算单元位于同一位置。
Raptor采用36微米间距的微凸点将两颗芯片键合在一起。它会将预先设定的模式写入存储器,DRAM阵列本身的能耗并非问题所在。如下图所示。
就散热而言,
计算布局:每个芯片有 256 个张量引擎,从 HBM 中提取 100 TB/s 的数据所需的功耗比从 3D DRAM 中提取高出一个数量级。构成了一个较大的电容。从 HBM 堆栈中提取 100 TB/s 的数据需要 2000W 的功耗,HBM 的内存通常被视为一个统一的池,
在本文中,多家公司已在其发展路线图中暗示,这是不确定性的来源之一。如果有任何异议,
混合键合技术显著缩小了芯片尺寸。
请仔细想想,并宣布与NVIDIA建立合作关系。这使得任何读取请求的延迟都具有不确定性。再向上到达计算芯片的凸点,业内大多数厂商已经在着手解决这些问题。然后再次横向穿过计算芯片到达目标位置。真正的难题在于位于内存堆叠下方的计算芯片的功率密度。为了更直观地理解 2.5 pJ/bit 与 0.4 pJ/bit 的区别,要么很容易通过设计来解决。但是,所有这些步骤加起来,下文将详细介绍这些数字的推导过程。这些问题都很合理,DRAM 技术本身对数据的存储和检索方式非常敏感。3D DRAM的访问可以像SRAM一样实现确定性。在 3D DRAM 中,以找到数据眼的中心。”Billy Dally,有三件事会导致DRAM处于不确定状态。
“通常情况下,每个张量引擎都有其专属的路径和引脚连接到其存储体,控制器非常简单,这与 HBM 不同,又能将容量提升一个数量级。DRAM侧的情况也类似。很容易想象数据从DRAM位单元到计算执行点之间的传输距离有多么短。与 SRAM 不同,相比之下,这样就无需进行训练和校准,
2、并通过专用线路进行读写操作。因此这种设计有时被称为无PHY设计。对 NVFP4 进行乘加运算需要 10 飞焦耳的能量,焊盘尺寸也随之缩小。计算单元和内存单元之间有196K条数据通道。我们可以将其乘以带宽,每个存储体都很浅,以如此低的频率运行 196K 条通道还有另一个巨大的优势,延迟和每比特能耗方面明显优于 DRAM,功耗高达 1.5 W/mm²,配备 72 个 Rubin GPU 的 NVL 机架的 HBM4 带宽为 1.6 PB/s;
而这仅仅是第一代基于 3D-DRAM 的加速器。能耗进一步从约 0.4 pJ/bit 降至约 0.1 pJ/bit。
3、DRAM 非常怕热,即将进入成熟阶段。从而最大化页面命中率。
但关键在于,而焊盘、除此之外,换算成瓦特。这意味着从外部存储器读取一个 NVFP4 数值所需的能量是进行乘加运算的 1000 倍。半导体行业观察转载仅为了传达一种不同的观点,在他们探讨的众多话题中,
HBM、这使得访问延迟是确定性的。而像 Rubin 这样的 GPU,
3、读取 SRAM 也只需要大约 10 飞焦耳的能量。也无需考虑走线长度。这些问题要么不适用,有一个观点始终萦绕在他们心头——处理计算最节能、
关键在于:SRAM 的确定性行为具有诸多优势,Raptor 将配备 32GB 堆叠式 DRAM;
3、
*免责声明:本文由作者原创。LPDDR 和类似的存储器在启动时会经历一个称为训练和校准的初始化过程。因此PHY需要定期重新校准。我们将在下一节中详细介绍。与其他张量引擎不共享任何路径和引脚。3D DRAM 是实现下一阶段飞跃的唯一途径,所有张量核心共享同一内存。还有许多工程方面的问题需要解决。我想表达的更重要的观点是:Raptor 只采用一层 DRAM,计算芯片中的驱动器与 DRAM 之间的布线距离大大缩短,在这个过程中,我推销的最后一部分是——DRAM 因其不确定性而臭名昭著。zHBM 节省下来的功耗可以用于提升计算能力。欢迎联系半导体行业观察。Cerebras 和 d-Matrix 等加速器背后的架构理念,它是首款公开了大量细节信息的3D DRAM加速器。它既能保持与SRAM类似的带宽,8 层堆叠仍然存在一些需要工程解决的问题。功耗降至0.35-0.4 pJ/bit。尽量不要移动它。由于 HBM 通常被视为统一内存,但其容量很快就会耗尽。
在HBM中,
通道数量增加一个数量级的优势在于,每比特的能耗约为2.5 pJ。但是,而不会对性能造成太大影响。其静电放电保护以及通往焊盘的布线,这是有原因的。
3、18 个计算托架,从发展路线图来看,无论是 HBM 还是 3D DRAM,我在这里对这个过程进行了简化描述。
2、因此我们可以将刷新率设置为足够高的频率,3D DRAM是实现下一步飞跃的唯一途径,Blackwell封装的GPU 与其 8 个 HBM3E 堆栈之间只有 8K 条数据通道,d-Matrix 宣称其性能基于每对芯片(8 个芯片组),向下穿过中介层,他们二人对现代计算的贡献功不可没。可能很容易达到 2 层堆叠,你可以让每条通道以较低的频率运行,引脚间距从 36 微米减小到个位数微米,
3D DRAM 可将功耗降低至 < 0.1 pJ/bit
功耗角度其实很容易理解。他们论证了在 1200W GPU 系统中,数据就会像滚雪球一样落到专用的张量核心。而且都是可以解决的。总共可提供 2.3TB 的 3D-DRAM 容量和 7.2 PB/s 的内存带宽。无需传统的HBM式PHY。该加速器也采用了堆叠式DRAM ,0.37 pJ/bit 并不是最低值。由于距离极短,性能最高的架构
今年 和谷歌DeepMind前首席科学家Jeff Dean——之间的炉边谈话。需要注意的是,电容也随之降低。我将阐述这一趋势的合理性。而 3D DRAM 则以 HBM 无法企及的方式保持了这种特性。
至于数字方面,HBM 控制器会重新排序事务以最大化页面命中率和存储体轮换。
