Imagination推出多精度矩阵乘加速器,AI算术性能提升33%

近日,图形处理器制造商 Imagination Technologies 宣布推出其新一代 E-Series GPU 中的一项关键技术突破:一种能够高效支持多种数字格式的多精度点积单元(Multipr...

半导体/芯片

近日,图形处理器制造商 Imagination Technologies 宣布推出其新一代 E-Series GPU 中的一项关键技术突破:一种能够高效支持多种数字格式的多精度点积单元(Multiprecision Dot Product Unit)。这项技术旨在解决人工智能工作负载中矩阵乘法运算面临的性能与效率挑战。

在 AI 计算领域,矩阵乘法是核心操作之一,通常需要处理从 INT8 到 FP16 等多种数值格式。研究表明,降低数值精度可以显著提升计算性能,但同时也会带来新的设计难题。Imagination 的解决方案通过融合计算方法,跳过中间的归一化和舍入步骤,直接在特定精度组合和操作深度上实现优化。这种设计使得在保持高精度输出(如 FP16 或 FP32)的同时,电路面积减少了约 33%,相较于传统采用独立管道处理每种格式的方法具有明显优势。

该技术的核心在于对矩阵乘法基本操作的重新定义。以一个典型的 16 项累加点积为例(a0b0 + a1b1 + + a15b15 + c = d),其中输入向量 a 和 b 使用低精度格式,而中间结果 c 和最终输出 d 则使用更高精度格式。通过针对特定精度组合和操作深度进行专门化设计,该单元能够在不同精度之间实现更高的效率和准确性。

然而,随着现代浮点格式的多样化发展,这一解决方案也面临新的挑战。研究显示,如果要支持所有可能的数值格式,矩阵乘法加速器可能需要不断增加硬件操作单元,这将导致电路面积超出现有硅片尺寸限制。为应对这一问题,Imagination 提出了格式转换策略,例如将 FP16 和 BF16 等相同宽度的格式共享同一处理路径,从而在一定程度上缓解了硬件复杂性问题。

值得注意的是,这种多精度支持的概念并非全新。在传统的 SIMD 向量单元实现中,类似的功能已经存在。但在当前 AI 工作负载日益复杂的背景下,Imagination 的创新在于将这一概念进一步扩展到更广泛的数值格式,并通过专用硬件设计实现了更高的性能密度。

图片

图1展示了该多精度点积单元的基本架构。左侧部分处理整数和尾数(mantissa)运算,包括乘法、移位和求和等操作;右侧部分则负责指数(exponent)运算,包括加法、最大值选择和减法等。通过这种分离的设计,系统可以在不同精度之间灵活切换,同时保持高效的计算性能。

这项技术的发布标志着 AI 硬件设计的一个重要进展。它不仅解决了当前 AI 工作负载中的性能瓶颈问题,还为未来更复杂的 AI 应用提供了硬件基础。随着更多厂商跟进类似的多精度支持方案,预计将在 AI 芯片市场上引发新一轮的技术竞争。