线性光学革新AI互连,功率与延迟双降50%

随着人工智能(AI)技术的快速发展,AI模型的规模和复杂度呈指数级增长。训练一个拥有万亿参数的超大规模模型需要数千个加速器协同工作,这对数据中心的互连网络提出了前所未有的挑战。在这样的背景下,传统的光...

互联网/IT

随着人工智能(AI)技术的快速发展,AI模型的规模和复杂度呈指数级增长。训练一个拥有万亿参数的超大规模模型需要数千个加速器协同工作,这对数据中心的互连网络提出了前所未有的挑战。在这样的背景下,传统的光互连技术逐渐显现出其局限性,尤其是在功耗、延迟和成本方面。

传统光互连技术依赖于光学模块内部的重定时器(Retimers)和数字信号处理器(DSPs)来处理信号,这些组件虽然能够保证信号质量,但同时也带来了额外的功耗、延迟、热量以及成本问题。特别是在数据传输速率从400G向800G甚至1.6T演进的过程中,这些问题变得更加突出。根据Rambus的研究员Steven Woo的观点,随着机架内部数据速率的提升,铜缆在损耗、传输距离和功耗方面的物理极限已经接近,这使得铜缆在大型AI集群中的应用面临严峻挑战。

在这种背景下,线性光学技术应运而生,成为解决上述问题的关键方案。线性光学的核心思想是将信号处理功能从光学模块中移回主机端的SerDes(串行器/解串器),仅保留模块内的基本元件,如线性驱动器、调制器、光电探测器和跨阻放大器。这种设计不仅大幅降低了模块的功耗和延迟,还减少了系统的整体成本。Omnitron首席执行官Eric Aguilar指出,降低延迟对于GPU等计算单元的性能发挥至关重要,因为等待数据的时间会显著影响其利用率。

线性光学技术的应用前景广阔。随着更多厂商加入这一技术阵营,相关标准和规范也将逐步完善。可以预见,在不久的将来,线性光学将成为构建高效、节能AI集群的核心技术之一,为人工智能的持续发展提供坚实的基础设施保障。

图片

此外,线性光学技术的推广还将推动数据中心网络架构的进一步优化。例如,谷歌已经成功实现了环形结构的光路交换(OCS)网络,并计划将其应用于其他网络架构中。这种架构转变不仅提高了网络的扩展性和灵活性,还为未来的AI集群提供了更高的可靠性和更低的运营成本。

总的来说,线性光学技术的出现标志着AI互连领域的一次重大突破。它不仅解决了当前AI集群面临的功耗和延迟问题,还为未来更大规模、更高性能的AI系统奠定了基础。随着技术的不断成熟和普及,线性光学有望成为下一代数据中心网络的主流解决方案。