XeonAMX助力LanceDB,数据湖向量检索性能提升1.5倍

在AI数据处理领域,英特尔Xeon处理器的AMX技术与LanceDB数据库结合,显著提升了多模态数据湖的向量检索效率。通过AMX加速的精确分区计算,LanceDB在保持高召回率的同时,将建索引耗时降低...

人工智能

在AI应用日益复杂的今天,数据处理效率成为决定系统性能的关键因素之一。9月12日,在上海举办的Lance开发者沙龙上,英特尔高级AI架构师桂晟分享了Xeon 6处理器及其AMX(Advanced Matrix Extensions)技术如何与LanceDB数据库协同工作,特别是在多模态数据湖场景下的表现。

图中展示了AMX技术在主流AI场景中的应用,包括文本生成、会议摘要、专业问答等。核心算子Attention、MLP和GEMM(矩阵乘法)始终是模型的基础结构,而矩阵乘法和卷积运算则是最大的算力瓶颈。AMX技术通过提高硬件算力和更大缓存,有效解决了这一问题。

在传统的向量检索过程中,为了缩短建索引时间,通常采用HNSW(Hierarchical Navigable Small World)算法进行近似分配,只比较部分质心。这种方法虽然提高了速度,但可能导致向量被错误分区,从而影响查询召回率。而AMX技术通过一次批量计算最多16×16个距离,使精确定分区的计算成本降至与近似方案接近的水平。

实际测试显示,在LAION 1亿行、768维FP16向量、质心数1万的场景下,使用64 vCPU Xeon 6云实例,AMX精确分区方案的定分区耗时为942.1秒,建索引总耗时为1678秒,召回率上限达到0.9814;而近似HNSW方案的定分区耗时为905.8秒,建索引总耗时为1641秒,召回率上限为0.9721。相比之下,传统AVX-512方案的定分区耗时高达3663.5秒,建索引总耗时为4489秒。

更高的分区准确度不仅改善了建索引效率,还反向提升了查询效率。在相同召回率要求下,AMX精确方案的P50查询延迟比近似方案快1.5-2.0倍。这意味着在需要高精度的应用场景中,如金融风控、医疗影像分析等,LanceDB可以提供更快的响应速度和更高的准确性。

文章配图

此外,AMX技术还在HNSW查询优化中发挥了重要作用。通过将单条距离计算改为批量内核,一次处理最多16个候选向量,并让数据搬运与矩阵计算重叠,最终将查询吞吐从1840 QPS提升到2543 QPS。

这种性能提升不仅限于理论测试。在实际应用中,随着AI工厂规模的扩大,数据孤岛问题日益突出。戴尔AI数据平台提供的智能数据编排能力,结合Xeon AMX与LanceDB的高效数据处理能力,可以更好地满足企业对数据准备、发现、治理和工作的需求。

总的来说,Xeon AMX技术与LanceDB的结合,为AI数据湖提供了更强大的计算能力和更高的效率,特别是在需要高精度和快速响应的场景中,展现了其独特的优势。