大模型评测困境,从数学难题到智能体绕过,衡量标准何去何从 随着大模型能力的提升,传统评测基准因基准污染、题目缺陷以及智能体绕过机制而失效。数学难题曾被视为理想的新赛场,但其验证依赖专家且资源稀缺。业界正探索动态题库、真... 2026年09月16日 人工智能 #大模型 #陶哲轩