AI手机新突破,高带宽计算技术如何解决内存墙难题

随着大模型在手机端的普及,传统计算架构面临数据传输瓶颈。高通推出的高带宽计算(HBC)技术通过近内存计算架构,显著提升AI推理效率,为AI手机发展提供新路径。

人工智能

近年来,人工智能技术快速发展,尤其是大型语言模型在智能手机上的应用日益普及。然而,在实际运行中,AI计算性能的提升却遭遇了"内存墙"问题——即数据传输速度跟不上计算需求,导致大量时间浪费在数据搬运上。这种现象尤其在需要频繁读取模型参数和上下文信息的生成式AI任务中表现明显。

文章配图

以米其林三星餐厅潮上潮的"潮1/2"就餐模式为例,将餐桌设在厨房旁的做法,直观地揭示了数据与计算距离过远的问题。同样,在AI计算领域,当CPU、GPU或NPU等待数据从内存中调用时,计算单元往往处于闲置状态,造成资源浪费。这种"传菜员"不足的情况,成为制约AI手机性能的关键因素。

针对这一挑战,高通推出了高带宽计算(High Bandwidth Compute,HBC)技术。该技术的核心理念是将计算单元尽可能靠近内存,类似于将餐桌直接搬到厨房旁边。通过减少数据传输距离,HBC不仅能够显著降低数据搬运过程中的能耗,还能大幅提升AI推理速度。例如,在生成式AI任务中,预填充阶段仍需依赖强大的计算单元,而解码阶段则更适合采用HBC架构,因为此时计算强度相对较低,但对数据访问频率要求较高。

HBC技术并非完全取代现有计算架构,而是作为一种异构分工方案,与传统的CPU、GPU和NPU形成互补。具体而言,HBC更适合处理矩阵乘、向量运算、Embedding查询以及部分Attention/KV Cache相关操作等数据密集型任务。而对于Prefill阶段的高计算强度任务,以及游戏、视频编辑等复杂计算场景,则依然依赖传统的计算单元。

值得注意的是,HBC技术的应用场景并不仅限于AI手机。在其他需要高效处理大规模数据的领域,如自动驾驶、边缘计算等,HBC同样具有广阔的应用前景。例如,在自动驾驶系统中,实时感知和决策需要快速处理海量传感器数据,HBC架构可以有效提升数据处理效率,降低延迟。

尽管HBC技术尚处于商用初期,但其带来的性能提升和能效优化已经引起了业界广泛关注。未来,随着AI手机功能的不断扩展,用户对个性化服务的需求日益增长,HBC技术有望成为推动AI手机发展的关键驱动力之一。同时,这也为半导体厂商提供了新的技术创新方向,促使他们在芯片设计和架构优化方面进行更多探索。

总的来说,高带宽计算技术的出现,标志着AI计算架构的一次重要革新。它不仅解决了当前AI手机面临的内存墙问题,也为未来的AI应用提供了更高效的计算平台。随着技术的成熟和普及,我们有理由相信,HBC将在推动人工智能技术落地和商业化进程中发挥越来越重要的作用。