B站AI无限竞技场测评榜发布,GPT-6Astra登顶,国产模型占三席
9月20日,B站上线“AI无限竞技场”大模型测评榜单,GPT-6 Astra以12次榜首成绩位居第一,击败GLM-5.3等多款主流模型。该榜单由UP主对上百个AI大模型进行真实场景测试,涵盖代码、推理...
近日,视频平台B站宣布推出“AI无限竞技场”大模型测评榜单,标志着其在AI内容生态建设上的又一重要进展。根据最新发布的首轮排行榜,OpenAI的GPT-6 Astra以12次榜首成绩稳居第一,击败了包括GLM-5.3、Claude Fable 5.1在内的多款国内外知名大模型。
与传统跑分评测不同,“AI无限竞技场”采用开放式命题方式,由B站各领域UP主根据自身专业背景,自主设计测试题目,在真实工作流中对大模型进行全方位评估。测评主题涵盖代码生成、逻辑推理、团队协作、知识问答等多个方面,充分展现了各模型在实际应用场景中的表现差异。
值得关注的是,在本次排名前十的模型中,国产大模型占据三席:GLM-5.3位列第三,Kimi K3排名第六,DeepSeek-V4-Flash位列第八。这一结果不仅反映了中国AI技术的快速发展,也表明国产大模型在国际竞争中已具备相当的实力。
B站相关负责人表示,“AI无限竞技场”旨在打造一个开放、透明的AI模型测评平台,通过UP主的真实使用体验,为用户选择合适的AI工具提供参考。目前榜单已面向全站UP主开放报名,预计未来将吸引更多优质内容创作者参与。
与此同时,GPT-6 Astra在学术界也取得了重大突破这款AI模型与三位人类研究员合作,成功解决了困扰数学界近十年的“批准式委员会选举”难题,首次证明了“核”(核心概念)在任何情况下都不会为空。这一成果不仅展示了AI在数学领域的强大能力,也为AI与人类研究人员的合作模式提供了新的范例。
分析人士指出,B站此次推出的AI测评榜单具有多重意义。首先,它为AI模型的性能评估提供了一个全新的视角,避免了单一跑分指标可能带来的误导;其次,通过UP主的真实使用反馈,可以更全面地了解各模型在实际应用中的优劣势;最后,榜单的开放性也为AI技术的普及和应用推广创造了有利条件。
随着AI技术的快速发展,如何客观公正地评估AI模型的性能已成为业界关注的焦点。B站的“AI无限竞技场”通过引入UP主群体的力量,为这一难题提供了一个创新的解决方案。未来,随着更多优质内容创作者的加入,该榜单有望成为衡量AI模型性能的重要参考标准之一。