AMDRDNA4架构算力暴增4倍,RadeonRX9000显卡本地AI推理更流畅

AMD近日发布RDNA 4架构,其AI算力相比上一代提升4倍以上,最高可达1557 TOPS。该架构搭载于Radeon RX 9000系列显卡,支持FP8、INT8等新数据类型及稀疏性加速,显著改善本...

消费电子

9月28日,AMD正式公布了其最新RDNA 4架构的核心技术参数,这一突破性的架构在AI计算能力上实现了质的飞跃,相比上一代RDNA 3架构,AI算力提升超过4倍,单个计算单元配备2个AI加速器,支持FP8、INT8等新型数据格式及稀疏性加速技术。这意味着搭载RDNA 4架构的Radeon RX 9000系列显卡,最高可实现1557 TOPS的AI算力,为本地大模型推理提供了强大的硬件基础。

在产品层面,Radeon RX 9000系列显卡针对不同应用场景进行了差异化设计。其中,RX 9070显卡配备16GB GDDR6显存,定位AI加速入门级市场;而面向专业工作站的Radeon AI PRO R9700则配备了32GB显存,能够容纳更大规模的模型权重,满足高级AI工作流的需求。这些显卡不仅在硬件层面实现了算力跃升,还通过软件生态的完善,为AI应用落地提供了全面支持。

AMD在软件生态建设方面也取得了显著进展。Radeon显卡可通过编程支持Microsoft DirectML等主流机器学习框架,部分型号还兼容AMD ROCm开放式软件平台。AMD已发布ROCm 6.0版本,进一步扩大了对客户端机器学习开发的支持范围。此前的ROCm 5.7版本已与PyTorch配合,为Radeon RX 7900 XT、RX 7900 XTX和Radeon PRO W7900 GPU提供支持,这些软件栈让本地推理有了现成路径。

除了硬件和软件的双重升级,AMD还在用户体验层面进行了创新。借助锐龙AI PC或Radeon 7000系列显卡,用户可以在本地运行基于GPT LLM的专属AI聊天机器人实例。AMD Software中还集成了AMD Chat等AI功能,并提供AMD噪音抑制技术,用于智能背景噪音消除,进一步提升了本地AI应用的实用性。

在内容创作和生成式AI领域,Radeon RX 9000系列显卡同样表现出色。它兼容Adobe Photoshop、DaVinci Resolve、Blender等专业创作软件,同时支持Automatic1111和Stable Diffusion WebUI-DirectML等生成式视觉应用。文本生成方面,LM Studio和OLLAMA等工具也为用户提供了便捷的离线应用选择,其中OLLAMA经过优化,可高效运行Llama 2模型。

值得注意的是,开源社区也在推动AMD显卡性能的进一步提升。近日,可以让AMD显卡运行英伟达DLSS 5神经渲染的第三方工具DLSS-NR-on-AMD迎来密集更新。开发者Daniel在一天之内连续发布了Alpha 0.3.3和Alpha 0.4.0两个重要版本,累计带来约74%的性能提升。实测显示,在3440×1440分辨率下的《赛博朋克2077》中,开启DLSS 5后的运行帧率从之前的30帧左右直接提升至50帧,显著改善了游戏体验。

AMD Radeon RX 9000系列显卡

AMD表示,随着优化工作的持续推进,DLSS-NR-on-AMD有望在不久后追平英伟达官方实现的性能水平,同时在画面保真度方面取得进一步改进。这一进展不仅提升了AMD显卡的游戏性能,也为创作者提供了更强大的工具支持。

总体来看,AMD通过RDNA 4架构的发布,实现了AI算力的跨越式提升,并通过软硬件协同创新,为本地AI应用和内容创作提供了全面支持。随着开源社区的持续贡献,AMD显卡在性能和生态上的优势将进一步巩固,为用户带来更优质的使用体验。