StartLux开源决策模型超越Jev,38项基准31项领先
9月30日,上海人工智能公司StartLux发布开源决策模型StartLux-Decision,该模型在38项基准测试中31项表现优于Jev 1.13,综合得分63.88分,领先近6分。模型提供0.8...
9月30日,上海人工智能公司StartLux(原点星辉)推出开源决策模型StartLux-Decision,迅速引发业界关注。这款模型在多项权威评测中表现优异,特别是在Decision Index 0.2.1基准测试中,27B版本以63.88分的综合得分,超过当前最热门的Jev 1.13(57.91分),领先近6分。此外,在七套测试中,StartLux-Decision-27B平均准确率达到91.82%,同样高于Jev的88.74%。
与传统生成式AI不同,StartLux-Decision专注于快速、精准的决策判断。例如,在客服工单处理场景中,系统仅需一次请求即可同时完成团队分流、紧急程度判断和严重等级评估三项任务,耗时仅26毫秒。这种能力源于StartLux团队自建的Auto Research研发管线,通过让AI深度参与数据构造、训练、评测与失败分析,实现了模型的快速迭代。
在实战对比中,StartLux-Decision-27B与Jev 1.13进行了36局国际象棋对弈,最终以35胜1负的成绩完胜。数据显示,StartLux-Decision在平均损失、最佳着法命中率和失误次数等指标上均表现更优。这一成绩不仅展示了模型在复杂决策场景中的优势,也证明了其在实际应用中的可靠性。
StartLux-Decision提供0.8B、2B、4B、9B和27B五档版本,覆盖从轻量级到高性能的各种需求。所有版本均支持本地部署,并提供原始权重及Q8_0、Q4_K_M、BF16三种GGUF量化版本。在Decision Index 0.2.1基准测试中,各尺寸版本均显著领先同尺寸公开榜单最高分,其中27B版本更是全面超越Jev 1.13。
随着Agent技术的发展,专门负责「判断」的决策模型变得越来越重要。StartLux-Decision的出现,为智能体在复杂业务流程中的决策能力提供了新的解决方案,特别是在需要同时处理多个判断任务的场景下,如网页操作、商品筛选和团队协作等。
