RTX3080Ti训练AI玩宝可梦,1250万参数模型自主学会按键操作
一位开发者利用RTX 3080 Ti显卡,训练了一个1250万参数的小型AI模型,在《宝可梦 红》中自主学习按键操作并成功选择初始宝可梦。该模型通过观察屏幕画面预测按键效果,无需预设游戏规则,展示了世...
近日,一位网名stmonty的开发者展示了一项令人瞩目的技术突破:他使用一张RTX 3080 Ti游戏显卡,成功训练了一个1250万参数的小型AI模型,使其能够在经典游戏《宝可梦 红》中自主操作角色并完成初始宝可梦的选择。
与传统的基于海量文本训练的大语言模型(如ChatGPT)不同,这个AI模型属于“世界模型”范畴。其核心思路是让AI通过直接观察游戏屏幕画面的变化来学习每个按键的实际效果,而非依赖于预设的游戏规则或大量文字描述。换句话说,这个AI并不知道A键代表确认、B键代表取消,也不知道游戏的目标是什么,它只专注于一件事:盯着屏幕看,然后猜测"如果我按某个键,画面会发生什么变化",根据猜测结果进行修正和记忆。
这一训练过程完全依赖于RTX 3080 Ti显卡的计算能力。尽管模型仅有1250万参数,在动辄数百亿参数的大型语言模型面前显得微不足道,但它的优势在于只需一张消费级显卡即可运行,大大降低了硬件门槛。
在学会基本按键操作后,AI开始尝试规划更复杂的行动方案。每次生成14个可能的按键组合,但不是直接在游戏中测试,而是先在模型内部进行模拟。每轮模拟会生成512个方案,筛选出64个最优解,再进一步优化,最终选出最佳方案才发送到游戏中执行。
首次尝试并未成功,AI未能拿到初始宝可梦。开发者推测失败原因在于模型基于自身预测进行进一步预测时,小误差会逐层放大。经过微调后,第二次尝试成功选出了杰尼龟。在100次同存档测试中,AI成功拿到初始宝可梦的比例达到52%,而随机按键的成功率为0%,未训练模型仅能成功1次。
值得注意的是,从游戏存档点直接按A键本就能选到宝可梦,但项目的主要目标并非实现这一点,而是验证AI是否能够自主发现解决方案。开发者表示,下一步计划将挑战更复杂的任务,例如从实验室出发,走到博士面前完成对话后再选择宝可梦。然而,他指出随着任务规划长度的增加,难度将呈指数级增长,单纯增大模型规模也无法确保通关游戏。
这项研究展示了世界模型在强化学习领域的潜力,为开发更智能、更自主的AI系统提供了新的思路。
