图形处理器“数据供给战”升温:小米、苹果与英伟达竞逐万亿字节级内存带宽

随着生成式人工智能和大模型加速进入个人电脑、边缘设备及高性能计算平台,芯片行业的竞争焦点正在发生变化。相比单纯增加计算核心数量,如何以更高速度将模型数据送入图形处理器、神经网络处理器等计算单元,正成为决定人工智能硬件实际性能的关键因素。

近期,小米玄戒O100人工智能加速芯片以及苹果新款小型台式电脑和专业台式电脑相继亮相,相关高端配置均将内存带宽推向每秒万亿字节级别。与此同时,英伟达新一代高性能显卡也显著提高数据传输能力,一场围绕人工智能计算“数据供给速度”的竞争正在形成。

大模型运行面临内存带宽瓶颈

内存带宽可以理解为计算核心与数据之间的高速通道,其大小直接影响计算单元能够以多快速度获得需要处理的数据。

在大型语言模型的自回归生成阶段,每生成一个新的文本单位,都需要从内存中读取大量模型权重。对于拥有数百亿甚至上千亿参数的模型而言,这意味着庞大的数据需要持续在内存和计算单元之间传输。

即使芯片本身拥有强大的计算能力,如果数据无法及时送达,计算单元仍可能处于等待状态。这种由内存访问速度限制整体性能的现象,已经成为人工智能硬件面临的重要瓶颈。

因此,在大模型推理场景下,传统意义上的峰值算力已经不能完全代表实际性能。内存容量、内存带宽以及数据访问效率的重要性正在快速上升。

苹果M6系列最高内存带宽达到每秒1.2万亿字节

苹果正在通过统一内存架构进一步强化人工智能计算能力。

苹果电脑产品营销总监劳拉·梅茨表示,M6系列大幅提高内存带宽,是因为在运行人工智能智能体时,模型需要驻留在统一内存中,并随时能够被调用。

从不同配置来看,M6系列也体现出人工智能硬件在内存带宽方面的性能分层:标准版本达到每秒1700亿字节,专业版本提高至每秒3070亿字节,而定位最高端的超高性能版本则达到每秒1.2万亿字节。

统一内存成为本地人工智能的重要基础

对于需要直接在设备端运行的大型模型而言,统一内存可以减少不同计算单元之间频繁复制数据产生的额外开销。

随着模型规模不断扩大,仅拥有足够大的内存容量已经不够,芯片还必须能够快速读取其中的数据。因此,高内存带宽正在成为本地人工智能、智能体以及专业计算设备的重要硬件基础。

小米玄戒O100采用晶圆级垂直堆叠

小米则选择了另一条技术路线。

玄戒O100采用晶圆级垂直堆叠技术,将动态随机存取存储器晶圆直接置于神经网络处理器上方,使数据能够通过更短的路径进入人工智能计算单元,其内存带宽达到每秒1.22万亿字节。

这种设计的核心思路,是缩短存储单元与计算单元之间的数据传输距离,从而提高数据吞吐效率。

对于边缘人工智能设备而言,这一方向具有现实意义。随着越来越多生成式人工智能功能从云端转向终端,本地设备不仅需要较强的计算性能,还必须在功耗、空间和数据传输效率之间取得平衡。

英伟达新一代显卡带宽接近每秒1.8万亿字节

在独立图形处理器领域,英伟达新一代高性能显卡进一步将内存带宽提升至接近每秒1.8万亿字节。

该产品通过512位显存总线与新一代图形存储器实现高速数据传输,为大规模图形计算、生成式人工智能以及模型推理提供更高的数据吞吐能力。

与苹果的统一内存以及小米的垂直堆叠方案相比,英伟达采用的是独立图形处理器架构升级路线,但三者最终解决的都是同一个问题:如何让计算核心更快获得所需数据。

人工智能芯片竞争从算力走向数据效率

苹果、小米和英伟达采用不同的技术架构,却不约而同地将高端产品的内存带宽推入每秒万亿字节级别。这表明人工智能硬件竞争正在从单纯追求计算核心数量和峰值算力,进一步转向整个数据传输体系的效率。

随着模型参数规模扩大以及人工智能智能体等应用逐渐普及,内存带宽的重要性预计还将继续提升。未来评价一款人工智能芯片的性能,核心数量和理论算力仍然重要,但数据能够以多快速度进入计算核心,同样可能决定最终的实际表现。

从这一趋势来看,下一阶段人工智能硬件竞争不仅是一场“算力竞赛”,也是一场“数据供给竞赛”。谁能率先突破内存带宽和数据传输瓶颈,谁就更有机会在新一轮计算平台竞争中占据优势。

Leave a Reply

Your email address will not be published. Required fields are marked *