中国智能体登顶OSWorld,90.2%成功率刷新全球纪录
在人工智能领域,一个重要的里程碑已经到来。2026年7月27日,浙江实在智能科技有限公司(以下简称“实在智能”)推出的桌面操作智能体“实在Agent”,以90.2%的成功率在OSWorld基准测试中同...
在人工智能领域,一个重要的里程碑已经到来。2026年7月27日,浙江实在智能科技有限公司(以下简称“实在智能”)推出的桌面操作智能体“实在Agent”,以90.2%的成功率在OSWorld基准测试中同时拿下总榜与Agentic Framework分榜双冠军,成为首个突破90%成功率的智能体,刷新了此前由海外巨头保持的83.6%最高纪录。
OSWorld是由香港大学、卡内基梅隆大学等机构于2024年在NeurIPS发表的权威基准,旨在评估AI智能体在真实操作系统中的表现。与传统仅限网页或API调用的基准不同,OSWorld提供完整的桌面沙盒环境,要求智能体通过鼠标、键盘等接口完成跨应用的复杂任务,并由机器自动判定是否成功,确保评测结果客观可靠。
回顾OSWorld的发展历程,其评分曲线见证了整个行业的快速进步:从2024年的GPT-4o等模型仅能取得12.2%的成功率,到2025年底Simular Agent S2首次超过人类基线(72.36%),再到2026年Pointer达到83.6%,直至实在Agent以90.2%的成绩实现历史性突破。这一跨越不仅展示了技术的飞速发展,更标志着Computer-Use Agent正式迈入“超高可靠性”时代。
实在Agent的成功并非单纯依赖强大的模型能力,而是Harness工程化能力的全面胜利。在OSWorld榜单中,有6个选择了框架路线,且整体成绩普遍高于纯通用模型方案。这表明,在当前阶段,模型只是基础,而如何将模型能力转化为稳定可靠的执行能力,才是决定技术能否落地的关键。
实在智能的 Harness 工程体系包含六大核心闭环能力:上下文管理、工具系统、执行编排、记忆与状态管理、评估与观测、约束验证与失败恢复。这些能力让智能体能够在复杂的实际任务中保持高成功率,避免因界面理解偏差或操作失误导致任务失败。
“我们的 Harness 工程是在真实的业务场景中‘啃’出来的。”实在智能创始人表示,“过去三年,实在Agent已经在数千家企业的真实业务系统中运行,处理了权限校验、异常弹窗、界面变动等无数具体问题。这些行业知识不是靠算力堆出来的,而是通过一个个交付现场积累起来的。”
在细分领域得分上,实在Agent展现出多点领先的优势。在常用办公与编程场景中,LibreOffice Calc、Writer、VS Code等应用的表现均处于领先地位;而在跨应用协同、UI设计等最难的任务中,实在Agent更是大幅领先其他参赛者,充分证明了其在复杂任务处理上的强大能力。
这一突破对AI行业具有深远影响。它不仅验证了 Harness 工程化能力的重要性,也为AI技术从实验室走向规模化应用提供了重要参考。业内人士认为,90%以上的成功率已经成为企业级场景中衡量技术成熟度的重要指标,实在Agent的成功为AI技术的商业化落地树立了新的标杆。
随着 Harness 工程化能力的不断发展,未来AI智能体将在更多实际应用场景中发挥重要作用,推动各行各业的数字化转型进程。