13TOPS算力不足Copilot+门槛下英特尔桌面NPU性能存疑

英特尔在酷睿Ultra 200S系列中首次将神经网络处理单元(NPU)集成到桌面处理器,但其13 TOPS的算力远低于微软Copilot+ PC要求的40 TOPS门槛。文章分析了NPU的技术定位、实...

人工智能

9月21日,英特尔推出了全新的酷睿Ultra 200S系列处理器,标志着传统桌面PC正式迈入AI硬件加速时代。作为该系列的旗舰产品,酷睿Ultra 9 285K首次在桌面端集成了神经网络处理单元(NPU),这一突破性设计旨在为AI应用提供专用硬件加速能力。

从技术规格来看,酷睿Ultra 9 285K的NPU模块包含4096个乘加单元和4MB本地内存,支持INT8和FP16精度推理,单体算力达到13 TOPS。若结合CPU和核显的算力,整机平台的AI总算力最高可达36 TOPS。然而,这一性能水平与微软对Copilot+ PC的定义存在显著差距——后者要求NPU算力必须超过40 TOPS。这意味着尽管Arrow Lake-S架构拥有了专用AI单元,但在满足主流本地AI功能需求方面仍显不足。

NPU的设计初衷并非与高性能GPU正面竞争,而是专注于高能效的小型AI任务。例如视频会议中的实时降噪、背景特效生成,以及图像和音频处理中的本地滤镜应用等场景。这些任务通常由小型模型反复执行矩阵运算,非常适合卸载至NPU以实现更高效的并行处理。然而,对于游戏PC而言,目前能够从中受益的应用场景仍然有限,因为大多数应用程序尚未显式支持NPU加速,缺乏相应的后端支持时,工作负载依然会落在CPU和GPU上。

从技术实现层面看,英特尔为NPU配备了独立的驱动栈,使其作为深度学习加速器以独立计算设备的身份呈现给操作系统。NPU内部的调度器会将任务分配到两个NCE Tile上,OpenVINO则可通过专属插件将NPU设为推理目标。这种设计使得不同任务可以同时分发到各自最合适的计算单元,理论上能够提升整体效率。然而,实际效果如何还取决于软件生态的支持程度。

当前,NPU在桌面端的应用仍处于起步阶段。开发者需要显式支持相应的后端或运行时环境,例如通过OpenVINO及英特尔提供的NPU插件完成模型的编译与执行。这种依赖性限制了NPU的普及速度,也导致其在市场上的存在感较为稀薄。相比之下,配备Tensor核心的GeForce显卡在多数情况下能够更快地处理合适的模型,尽管功耗更高。

图3:Intel品牌标识

展望未来,随着AI应用的不断普及和技术生态的逐步完善,NPU有望在更多场景中发挥作用。但短期内,要实现其设计初衷,还需要软硬件生态的共同进步。英特尔需要与开发者社区紧密合作,推动更多应用程序支持NPU加速,同时优化相关工具链,降低开发门槛。只有这样,才能真正释放NPU的潜力,使其成为桌面AI加速的重要组成部分。