ExcelAI辅助工作流横评,WPSAI领跑,国产模型表现亮眼
近日,国际表格AI评测SpreadsheetBench V2榜单发布,国产软件WPS AI以50.86%的综合成绩位居榜首,超过Claude Opus 4.6、GPT-5.2等国际主流模型。本文通过实...
随着AI技术的快速发展,将自然语言转化为具体操作的能力成为办公软件智能化的重要方向。近期,国际表格AI评测SpreadsheetBench更新V2榜单显示,国产软件WPS AI以50.86%的综合成绩排名第一,不仅超越了Claude Opus 4.6、GPT-5.2等国际主流AI模型,更通过官方Verified验证,展现了其在复杂表格处理上的卓越能力。
这项评测关注AI对复杂表格的整体处理能力,包括理解、计算、排错、做图和最终交付。官方数据显示,V2共有321项任务,平均每项任务涉及11.8个工作表、593.5个单元格修改,最终考察的是AI能否把一份复杂工作簿完整处理并交付。从这类表格任务的执行链路看,通常至少涉及三个环节:先识别表头、数据区域、公式引用和跨表关系;再对单元格、公式、格式、图表等进行实际操作;最后重新计算、检查引用和文件状态,确认结果可以继续使用。也就是说,复杂表格任务拼的不只是一次模型推理,还包括对文件结构的理解、对软件能力的调用和对结果的校验。
本次测试选取了包括GPT-5.6 Terra、Claude Opus 5、Gemini Flash、DeepSeek v4 Flash、GLM 5.2、Kimi K3、Hy3在内的多款主流AI模型,并分别测试了它们在不同载体下的表现。其中,ChatGPT for Excel、Claude for Excel等第一方Excel Add-in,以及Pi for Excel、Codex等开源第三方Add-in和独立工作台,构成了本次测试的主要载体。
测试结果显示,虽然大多数AI模型在编写公式等基础任务上表现成熟,但在处理复杂工作流时仍存在明显差异。例如,部分模型在处理跨表引用时容易出现错误,或在格式调整时破坏原始数据结构。值得注意的是,载体的选择对最终交付质量有着显著影响。其中,Office侧边栏加载项(如Pi for Excel)因其灵活的工具集和良好的兼容性,被认为是目前最佳的载体选择。
在实际测试中,还发现了一些共性问题。首先,AI在处理复杂逻辑时容易产生黑箱决策,导致用户难以理解其操作逻辑。其次,不同模型对提示词的敏感度差异较大,过于模糊或冗长的提示词可能导致结果偏差。此外,AI在处理大量数据时可能出现性能瓶颈,需要人工干预以确保计算效率。
基于以上测试结果,作者提出了几点使用建议:
总的来说,尽管AI在Excel辅助工作流方面取得了显著进展,但仍需在多个维度进行优化。未来,随着模型能力的进一步提升和载体生态的完善,AI在办公自动化领域的应用前景将更加广阔。