AI地基移动,从GUI到CLI,Agent接口选择能力成新焦点

随着AI模型能力持续提升,传统依赖“智能不足”的中间工程层(如复杂prompt、硬编码workflow)加速贬值。文章探讨了Agent如何动态选择GUI、CLI或MCP/API接口与软件交互,以及这一...

人工智能

在AI技术快速演进的当下,一个核心议题正在浮现:AI世界的"地基"正在不断向上移动。这种"移动"不仅体现在模型能力的跃升,更反映在AI系统架构和工程实践的根本性变革上。

Agent接口选择能力成为关键

过去几年,AI工程师构建了大量中间层结构来弥补模型能力的不足,包括复杂的prompt设计、硬编码的工作流(workflow)、路由(router)、检索增强生成(RAG)系统、API封装、MCP设计、专用策略训练等。然而,随着大模型能力的持续突破,这些精心搭建的"脚手架"正面临被重新评估的命运。

以Agent与软件交互为例,传统的路径是将软件封装成API、CLI或MCP,再通过工具链传递给Agent。但现在,一种新的模式正在形成:Agent可以直接操作软件的图形用户界面(GUI),通过观察屏幕、点击按钮、处理异常等方式完成任务。这种"闭环本身就是接口"的理念,让一些人认为中间的"翻译工程"可以被绕过。

但现实情况更为复杂。虽然GUI为人类设计,但在机器视角下,某些任务更适合通过命令行接口(CLI)或应用程序编程接口(API)完成。例如,在无界面的服务器环境中处理批量任务时,CLI仍然是最高效的选择。更重要的是,许多Agent运行在容器、沙箱或云端工作区中,它们需要处理代码仓库、日志、数据库等非交互式任务,此时CLI不仅是效率考量,更是必要约束。

真正可能被淘汰的,不是某一种接口,而是"世界必须先包装成固定接口模型才能使用"的默认前提。未来的Agent很可能具备"接口选择能力":它自己判断何时看屏幕、何时调用API、何时使用Shell。这种动态自选接口的能力,标志着AI系统架构的一次深刻变革。

AI投资逻辑的分层与重构

基石资本合伙人陶涛在2026金融机构年会上指出,AI投资赛道可分为三层:基础设施层、模型层和应用层。其中,基础设施层的投资确定性最高,因为算力短缺至少将持续到2029年。无论是大算力芯片、先进制程制造、存储芯片还是光互联系统,都存在供给瓶颈,扩产周期通常为2-3年。

在模型层,中美AI竞赛路径分化明显。美国追求通用人工智能(AGI)的突破和单客收入最大化,而中国则走向AI普惠。中国大模型的调用成本已接近水电水平,实际上把AI推向了"准公共产品"的地位。在这种范式下,评估大模型企业的关键在于两点:高投入产出比(用更小的算力训练出更好的模型)和明确的商业变现通道(用户从哪里用到模型,模型产出的价值在哪里实现)。

文章配图

应用层则是弹性最大的方向。陶涛认为,AI已进入靠应用场景取胜的阶段,特别是在具身智能领域。一家具身机器人企业能否在特定场景拿到订单并实现复购,有无盈利能力,能否持续发展,已成为一级市场投资机构的重要衡量标准。

复杂度迁移与工程哲学转变

随着模型能力的提升,AI系统的复杂度正在发生迁移。补偿复杂度(因模型能力不足而建的工程)迅速折旧,可称为"智能不足税"。相反,治理复杂度(审计、沙箱、身份管理等)因模型能造成更大影响而持续增加。

文章配图

这种变化不仅影响技术架构,也深刻改变了工程实践的哲学。过去是"先把世界整理成模型能理解的样子,再让模型做事";现在正在变成"先把世界暴露给模型,只有它处理不好的部分再加结构"。这意味着,解决真实世界约束的工程层不会消失,但其地位从必要降为条件优化。

未来展望:从"屏幕里的智能"到"物理世界里的生产力"

AI最终一定会从"屏幕里的智能"走向"物理世界里的生产力"。这种转变要求AI系统不仅要理解虚拟界面,还要能够与物理世界交互。这将推动AI技术向更深层次的应用发展,特别是在智能制造、具身智能等领域。

对于投资者和从业者来说,理解这种"地基移动"的本质至关重要。那些能够准确把握模型能力提升带来的结构性变化,并有效应对真实世界约束的企业,将在未来的AI浪潮中占据有利位置。