网通社科技快报

RTX 3080 Ti训练AI玩宝可梦 成功自主选初始宝可梦

近日,一位网名stmonty的开发者展示了一项技术突破:他使用RTX 3080 Ti显卡训练了一个1250万参数的小型AI模型,使其能够在经典游戏《宝可梦 红》中自主操作角色并完成初始宝可梦的选择。该模型属于“世界模型”范畴,核心思路是让AI通过直接观察游戏屏幕画面的变化来学习每个按键的实际效果,而非依赖预设规则或大量文字描述。AI专注于预测“如果我按某个键,画面会发生什么变化”,并通过猜测结果进行修正和记忆。

训练过程完全依赖RTX 3080 Ti显卡的计算能力,模型虽仅有1250万参数,但优势在于只需消费级显卡即可运行,降低了硬件门槛。学会基本按键后,AI开始尝试规划更复杂的行动方案:每次生成14个可能的按键组合,先在模型内部模拟筛选最优解,再发送到游戏中执行。首次尝试失败,开发者推测原因是小误差逐层放大。经过微调后,第二次尝试成功选出了杰尼龟。在100次同存档测试中,AI成功拿到初始宝可梦的比例达到52%,而随机按键的成功率为0%,未训练模型仅能成功1次。

项目的主要目标并非实现简单操作,而是验证AI是否能够自主发现解决方案。开发者表示,下一步计划挑战更复杂的任务,例如从实验室出发走到博士面前完成对话后再选择宝可梦。然而,随着任务规划长度增加,难度将呈指数级增长,单纯增大模型规模也无法确保通关游戏。这项研究展示了世界模型在强化学习领域的潜力,为开发更智能、更自主的AI系统提供了新思路。