三模型控制云台实测,GPT-6Astra、Fable5.1、Sol谁更胜一筹

本文对比了GPT-6 Astra、Claude Fable 5.1和GPT-5.6 Sol三大顶级模型控制云台机械臂的实测表现。在无明确指令的情况下,三个模型均完成任务,但执行路径、验证标准和成本差异...

人工智能

在人工智能与机器人技术深度融合的当下,大模型如何将数字指令转化为物理世界的精准动作,成为行业关注的焦点。近日,笔者对GPT-6 Astra、Claude Fable 5.1和GPT-5.6 Sol三款顶级AI模型进行了云台机械臂控制测试,通过同一模糊指令"让它满行程转一遍",观察它们在真实物理环境中的表现差异。

测试结果显示,三个模型虽然都完成了任务,但在执行方式上呈现出截然不同的特点。GPT-5.6 Sol采取了最全面的覆盖策略,优先确保活动空间的完整扫描;GPT-6 Astra则以验证优先,通过严格的反馈机制证明边界,尽管动作次数较少但耗时较长;Claude Fable 5.1追求效率与可复用性,在保证速度的同时也兼顾了结果的确定性。

从测试数据来看,GPT-6 Astra在验证环节投入了最高成本($23.43),而Claude Fable 5.1以最快的速度(5分22秒)完成任务,GPT-5.6 Sol则因需要更多动作而耗时最长。这反映出不同模型在资源分配上的哲学差异:Astra注重确定性,Fable强调效率,Sol追求完整性。

值得注意的是,本次测试不仅展示了模型在单一任务上的表现,更揭示了它们在处理不确定性时的决策逻辑。例如,Astra在遇到异常情况时会主动停止并进行验证,而Fable则倾向于快速完成任务并留下可复用的脚本。这些差异为理解大模型在物理世界中的应用提供了重要参考。

文章配图

此外,测试还发现模型的表现与其底层硬件支持密切相关。例如,GPT-6 Astra在Sharpa Wave灵巧手上的出色表现,就离不开该设备高分辨率触觉反馈和机电丝滑度的支持。这也印证了当前机器人领域的一个重要趋势:优秀的物理基础设施正在成为大模型发挥潜力的关键载体。

总的来说,这次测试为评估大模型在物理世界中的实际能力提供了一个有价值的参考框架。不同模型的选择反映了它们在覆盖、验证和执行感之间的权衡,也为未来优化模型与硬件协同提供了方向。