AI画不好骑自行车的鹈鹕,一场代码生成的艺术挑战

2024年,英国程序员Simon Willison发起了一项趣味测试,要求16个大模型生成鹈鹕骑自行车的SVG图像。一年间,各模型表现从混乱色块到逐渐清晰,反映出AI在理解复杂指令和生成特定视觉内容上...

人工智能

在人工智能领域,一个看似简单的任务却暴露了当前大模型的诸多盲点。2024年10月,英国程序员Simon Willison在其博客上发布了一项特别的测试:让16个主流大语言模型生成一张鹈鹕骑自行车的SVG图像。这项测试不仅成为检验AI视觉生成能力的独特实验,更揭示了当前AI系统在理解复杂指令和生成特定视觉内容时面临的挑战。

Willison选择这个主题有其深意。他住在加州半月湾,对当地的鹈鹕充满感情,更重要的是,互联网上尚未存在这样的SVG文件,这意味着模型无法通过训练数据中的现成例子来完成任务。这项测试的核心在于,要求一个看不见东西的系统仅凭坐标和半径等抽象参数,拼凑出一个完整的图形,而自行车本身对于人类来说都是一项复杂的几何构造,更不用说鹈鹕这种体型独特的鸟类了。

测试结果呈现出显著的差异性。早期版本如Claude 3.5 Sonnet生成的图像仅包含两个圆和一个三角形,Llama 3.3 70B则画出了一个简单的竖线和水槽状物体。Qwen2.5-Coder的输出更像是几块棕色形状堆叠而成的拖拉机。随着技术的进步,到2025年5月,Gemini 2.5 Pro的预览版已经能够生成较为清晰的自行车和鹈鹕轮廓,尽管仍有不自然之处。最终,在2025年6月的旧金山AI工程师大会上,通过Elo积分排名,Gemini 2.5 Pro以微弱优势胜出,而Llama 3.3 70B则垫底。

值得注意的是,这项测试不仅展示了AI在视觉生成方面的进步,也反映了模型在理解上下文和执行复杂指令时的能力差异。例如,2025年8月,一个小型模型Qwen3-4B-Thinking直接给出了"这是艺术,鹈鹕不骑车!"的回应,显示了模型对任务设定的自主判断能力。而在2026年4月,阿里Qwen3.6-35B-A3B在笔记本上运行的表现甚至超过了Anthropic的Claude Opus 4.7,证明了即使是轻量级模型在特定任务上也能表现出色。

文章配图

这项测试的意义超越了单纯的娱乐性质。它为评估AI系统的视觉生成能力和指令理解水平提供了一个有趣的基准,同时也揭示了当前AI技术在处理复杂、多维度任务时仍存在的局限性。随着技术的不断演进,类似的测试将继续推动AI在视觉理解和生成领域的进步。