APUS开源Jev跨平台复现,国产模型实现秒级决策
中国人工智能企业APUS于9月19日宣布成功完成全球首批Jev模型的独立开源复现,并将其封装为开箱即用的Agent Skill 'fast-browser-use'。该项目支持macOS、Linux、...
在人工智能领域,一个名为Jev的新型决策模型正在引发广泛关注。近日,中国人工智能企业APUS(麒麟合盛网络技术股份有限公司)旗下AI实验室宣布,成功完成了全球首批针对Jev模型的独立开源复现工作,并将其封装为开箱即用的Agent Skill 'fast-browser-use'。这一成果标志着国产AI技术在特定场景下的又一次突破性进展。
Jev模型源自19世纪经济学家杰文斯(Jevons),其核心理念是通过轻量级决策模型完成高频、原子化的快速判断任务。与传统大模型逐字生成文本的方式不同,Jev直接返回类型化答案与置信概率,适用于分类、选择、评分、真伪判断等场景。这种设计不仅大幅降低了计算成本,还显著提升了决策效率。APUS此次复现的fast-browser-use项目,正是将Jev模型应用于最具代表性的浏览器自动化场景,通过单次前向计算完成页面元素的选择与操作决策。
据APUS官方实测数据显示,在一台Apple M2 Pro消费级笔记本上,智能体依靠本地模型推理,全程离线完成真实维基百科检索任务的中位耗时约18秒,表单填报、站内导航等任务耗时仅3秒左右,单任务模型打分次数仅4次,全程零云端调用、零API费用,用户数据不出本机。这一表现不仅验证了Jev模型在实际应用中的可行性,也为行业提供了一份数据透明、代码可复核的独立验证参考。
Jev模型的设计理念源于19世纪经济学家杰文斯提出的“杰文斯悖论”,即智能使用成本的暴跌将带来智能用量的暴涨。该模型面向智能体(Agent)运行中最高频的一类需求,如分类、选择、评分、真伪判断等,直接返回类型化答案与置信概率,而非逐字生成文本。业内认为,这一路线验证了Agent架构的“快慢分工”:昂贵的大模型负责规划等“慢思考”,高频、原子化的“快判断”交给轻量决策模型完成。负责组装与调度这套分工的工程层,在业界被称为Harness。
APUS此次复现的fast-browser-use项目,完整实现了Jev底层决策范式,并将其落地于浏览器自动化场景。团队基于Jev公开文档展示的输入范式与评估逻辑,分析出了其“跳过自回归解码、隐状态直接打分”的核心逻辑。在开源项目中,APUS复现了单Token Logits快速决策,跳过自回归解码的过程,实现了Jev KV-Cache广播与并发批量评估的工作机制。在浏览器自动化场景中,fast-browser-use将页面上真实可见、可交互的元素整理为带编号的候选动作集合,由本地运行的Qwen3.5-9B模型通过单次前向计算直接完成“点哪里、选哪个”的决策,从机制上消除了模型生成错误选择器或格式幻觉的可能。
尽管Jev模型在速度和成本上具有显著优势,但其准确率仍处于行业中游水平。根据网的测试数据,Jev在50道中文客服判断题中的准确率约为64%-65%,在便宜小模型组中排名第二。然而,每题响应仅需0.73秒,50题总成本仅为0.002美元,均为测试最低。相比之下,MiniMax M3多做对约5.4题,但每题耗时1.8秒,总成本为0.0035美元。这表明Jev在准确率与成本之间取得了良好的平衡,适合对实时性要求较高的业务场景。
值得注意的是,Jev模型的阈值附近的数值波动可能影响业务规则的可靠性。例如,某些判断结果仅差0.01的概率值,可能导致关键业务规则的误判。此外,模型返回精确概率并不能自动保证规则可靠,概率校准是否真实成立仍需长期验证。因此,在实际应用中,开发者需要结合具体业务场景对模型输出进行二次校验和调整。
Jev模型的热度不仅源于其技术特性,还与其创始团队的背景密切相关。TypeSafe AI的CEO Diogo Almeida曾参与InstructGPT研究,如今在发布文章中质疑“聊天模型超越人类却未见自动化落地”。TypeSafe押注未来99%的AI交互发生在机器之间,Jev提供判断接口供程序调用,是对通用大模型聊天化交付模式的直接反叛。上线Vercel AI Gateway后,Jev在24小时内吸引了近13%的付费团队试用,创平台历史纪录。讨论度虽高,但源于团队前OpenAI/Facebook履历,以及AI圈对“更高分数、更长上下文”发布模式的新鲜感,而非单纯的性能碾压。