百度文心助手登顶全球智能体榜单,94.6%高分超越Claude/GPT

近日,百度文心助手任务Agent在全球AI智能体评测领域取得历史性突破。根据Kilo AI推出的PinchBench v2榜单显示,该系统以94.6%的最高分和94.4%的平均分,成功登顶全球工程向A...

人工智能

近日,百度文心助手任务Agent在全球AI智能体评测领域取得历史性突破。根据Kilo AI推出的PinchBench v2榜单显示,该系统以94.6%的最高分和94.4%的平均分,成功登顶全球工程向AI智能体排行榜,成为首个以正式产品身份获得此殊荣的国产智能体系统。

在包含59个参评模型的激烈竞争中,文心助手任务Agent不仅领先于Anthropic Claude Opus 4.8-fast(93.5%)、阿里通义千问Qwen3.7-max(92.5%),更是在OpenAI GPT-5.6-luna(88.7%)等国际顶尖模型中脱颖而出。这一成绩充分展现了百度在AI智能体领域的深厚积累与技术创新能力。

图片

PinchBench v2评测体系的独特之处在于,它着重考察智能体完成复杂任务并交付可验证结果的能力,而非单纯测试模型的知识储备。该榜单覆盖了数据分析、研究写作、代码开发、办公自动化、文档处理、网页操作、多媒体处理等七大类别,共执行617次测试运行,采用自动化校验与LLM评审双轨机制,确保全程零人工干预。

更值得关注的是,PinchBench v2特别强调模型与Agent框架的综合能力评估。即使使用同一底座模型,不同Agent框架的最终得分也可能存在显著差异。文心助手任务Agent的夺冠,实际上代表了百度在模型能力与系统工程协同创新方面的综合实力位居全球第一。

图片

为了提升透明度与可信度,百度AI搜索团队已在GitHub上开源了完整的PinchBench评测流程(github.com/Baidu-AI-Search/PinchBench-Evaluation)。所有147个任务的执行快照、交付物以及LLM Judge的打分理由均公开可查,任何研究人员都可以逐条复现验证。

在具体应用场景中,文心助手任务Agent的表现堪称惊艳。例如,在一个复杂的财务分析任务中,要求计算GitLab Q3 2025财季的实际利润率与指引之间的差值。Agent不仅自主检索了相关财报信息,还精准定位指引数据,计算出非GAAP运营利润率约18%,超出指引约500个基点,并将结论完整记录在指定文件中。五个自动化评分维度——文件创建、指标定位、实际值与指引值提取、基点计算结论——全部获得满分1.0。

图片

另一个典型任务是安全工程漏洞分析。面对Node.js应用的多个CVE漏洞,Agent能够准确识别express RCE和JWT bypass两个CRITICAL级漏洞为P0级别,其中JWT bypass因存在活跃利用记录需要特别标注;将PostgreSQL SQL注入定为P1级并结合PCI DSS支付路径给出上下文说明;将仅影响构建阶段的依赖漏洞降级为P2/P3级;并制定详细的五批次修复计划,包括具体的部署窗口(4月12日紧急热修、4月14日P1批次)。LLM评审的最终结论为「所有维度表现卓越」,得分同样为满分1.0。

此外,在合同法律分析方面,文心助手任务Agent也展现了强大的能力。针对一份软件服务协议,Agent能够快速提取关键日期、梳理双方义务、识别风险点,并生成全面的财务摘要。最终输出结果包括客户方12项风险、供应商10项风险、5项共享风险,以及付款结构六期分期的现金流前置问题、IP转让条件的产权间隙等细节,四个维度评分均为满分1.0。

这些复杂任务的完美解决,充分证明了文心助手任务Agent在处理真实世界工作场景中的强大能力。无论是职业数据分析、行程规划,还是重复性脑力劳动的自动化处理,文心助手都能高效完成。例如,用户只需提供一份职业数据表,指示「统一表头格式,新建汇总sheet,按职业大类做汇总表和Top10/Bottom10榜单,生成图表对比各职业大类就业人数」,Agent就能自主拆解任务链,一次性完成所有步骤。

对于希望实现智能化办公的用户来说,文心助手任务Agent无疑是一个革命性的工具。它不仅能够处理常规的日常办公需求,还能胜任需要深度思考和复杂决策的任务,真正实现了从「动动嘴」到「迈开腿」的转变,为中国企业在智能化转型道路上提供了强有力的技术支撑。