LLM评测失效真相,依赖感知聚合提升准确率9个点

亚马逊研究揭示LLM评测核心缺陷,57.5%用户满意对话实际任务失败。通过引入Ising模型建模裁判相关性,将准确率从0.820提升至0.912,为Agent评测提供新方法。

人工智能

在大型语言模型(LLM)日益成为智能系统核心组件的背景下,其评估体系的可靠性正受到前所未有的挑战。近日,亚马逊发表的两篇论文深入剖析了当前LLM-as-judge评测范式的根本缺陷,并提出了一种基于依赖感知聚合的新方法,显著提升了评测准确性。

研究表明,在现有评测框架下,高达57.5%的"用户满意"对话实际上未能完成客户任务。这一惊人发现源于对25个来自6家厂商的Agent在τ²-bench和SimulatorArena基准上的全面测试。当两个Agent能力接近时,裁判在31%的配对中做出了错误判断,而能力悬殊时错误率仅为不到1%。这种现象的根本原因在于多裁判多数投票假设的失效:由于共享来源、训练谱系相似性等因素,不同LLM裁判的误差并非独立,而是存在高度相关性。

为解决这一问题,研究人员创新性地引入Ising模型来建模裁判之间的成对相关性。实验结果显示,在三个关键任务上,依赖感知聚合方法将准确率从0.820、0.694和0.737分别提升至0.912、0.792和0.806。这种方法不仅有效解决了"满意度≠任务成功"的核心矛盾,还显著提升了裁判在能力接近情况下的分辨能力。

文章配图

具体而言,该方法通过分析不同裁判之间的相关性分类(如相关性分类、毒性分类等),构建了一个更精细的评分体系。例如,在相关性分类中,依赖感知聚合方法获得了0.912的相关性得分,远高于均匀多数投票的0.804和加权多数投票的0.820。这一改进使得评测结果更加可靠,特别是在需要区分细微差异的场景中表现尤为突出。

这项研究为LLM评测领域带来了实质性突破,不仅揭示了现有方法的局限性,还提供了切实可行的解决方案。随着AI系统的复杂度不断提升,这种基于依赖感知的聚合方法有望成为新一代Agent评测的标准实践。