LLM评测失效真相,依赖感知聚合提升准确率9个点 亚马逊研究揭示LLM评测核心缺陷,57.5%用户满意对话实际任务失败。通过引入Ising模型建模裁判相关性,将准确率从0.820提升至0.912,为Agent评... 2026年09月15日 人工智能 #Agent评测 #LLM评测