TokensPerWatt成AI推理新焦点,中科类脑提出Token工厂解决方案

随着大模型进入规模化推理阶段,AI基础设施的评价标准从传统算力指标转向产出端效率。本文聚焦Tokens Per Watt这一新兴指标,分析其对AI硬件设计和企业决策的影响,并以中科类脑提出的“Toke...

人工智能

在人工智能技术快速发展的今天,AI基础设施的建设正经历一场深刻的变革。与过去单纯追求峰值计算性能不同,当前业界越来越关注AI系统的实际产出效率,尤其是"Tokens Per Watt"这一关键指标。该指标直观地反映了单位能耗下系统生成有效Token的能力,成为衡量AI推理能效的核心标准。

Tokens Per Watt的重要性源于AI应用从实验到生产的本质转变。在早期阶段,开发者更关注模型能否运行、回答是否准确;而当AI服务进入生产环境后,企业需要考虑的是每一度电能产生多少满足质量、时延和稳定性要求的Token。这种转变不仅影响硬件设计方向,也深刻改变了企业的采购决策逻辑。

以中科类脑提出的"Token工厂"解决方案为例,该公司通过构建算电协同型系统,实现了从资源到智能产出的高效转化。该方案的核心在于将异构芯片、模型、用户任务和电力纳入统一调度体系,通过优化电力使用效率来提升整体能效。具体而言,中科类脑的"Token工厂"系统能够实现以下目标:

  • 通过精细化的任务调度,确保每颗芯片、每度电都能发挥最大效能
  • 构建跨域生产组织能力,整合分散的算力与模型资源
  • 提供持续高质量的Token交付服务
  • 在保障安全、时延和稳定性的前提下,最大化应用价值

文章配图

为验证这一理念的实际效果,我们可以参考一张图表(图1),它清晰展示了Tokens Per Watt随生成代际增长的趋势。与传统的峰值TOPS指标相比,Tokens Per Watt呈现出更快的增长速度,这表明新一代AI硬件在能效方面的提升空间远超预期。

在实际应用层面,中科类脑的BitaHub平台提供了完整的解决方案。该平台能够统一纳管不同架构的算力资源,聚合模型API和Token服务,并连接企业私有算力池与公共资源池。以一个典型应用场景为例,某企业日常负载需要30张芯片,但在高峰期可能需要100张。通过BitaHub平台,企业可以按需弹性扩展算力,相当于获得了一条可以动态调整的Token生产线。

此外,中科类脑还开发了专门的决策大脑系统,负责电、算、Token三个子系统的闭环运转。这个系统能够实时监控、预测并调度资源,确保整个Token生产过程的高效运行。通过这种方式,中科类脑成功实现了从资源到智能产出的无缝衔接,为企业提供了更加经济高效的AI推理解决方案。

随着AI技术的不断发展,Tokens Per Watt这一指标的重要性将持续提升。未来,我们有望看到更多专注于提升能效的AI硬件和解决方案出现,推动整个行业向更加绿色、高效的可持续发展道路迈进。