2026年10月2日,一名化名为stmonty的开发者利用一块RTX 3080 Ti显卡,成功训练出一个仅含1250万参数的轻量级人工智能模型。该模型在宝可梦 红中实现了自主操作:观察屏幕画面,理解按键与画面变化之间的因果关系,并最终完成初始宝可梦的选择。
这一模型属于世界模型范畴,其设计逻辑并非依赖预设规则或文本知识,而是通过持续观察游戏界面的动态变化,自行推断每个按键操作可能引发的视觉反馈。它并不知晓A键代表确认、B键代表取消,也不了解游戏目标为何,仅以“画面如何响应按键”为唯一学习依据——按下一个键后画面若如预期变化,则强化该行为;若偏差较大,则调整内部预测机制。
与当前主流大语言模型不同,这类世界模型不依赖大规模文本语料进行训练,而是以环境交互数据为根基构建对世界的认知。尽管1250万参数在动辄数百亿参数的语言模型面前微不足道,却足以在单张消费级显卡上完成训练与推理。
掌握基础按键映射关系后,模型进一步发展出分层规划能力。它每次生成14组按键序列作为候选方案,并不在真实游戏中直接执行,而是在内部模型中展开多轮模拟:首轮模拟512种可能性,筛选保留其中表现最优的64种;再以此为基础继续迭代优化,直至收敛出最有可能达成目标的操作路径,方才将最终方案输入游戏运行。
首次测试未能成功获取初始宝可梦。分析表明,问题源于模型在多步预测过程中累积误差——每一步基于前序预测的结果进行下一轮推演,微小偏差经逐层叠加后显著放大。经过针对性微调,第二次运行即成功选定杰尼龟。在相同存档点开展的100次重复测试中,该模型成功率达52%,而完全随机按键的成功率为零,未经训练的基线模型仅成功1次。
开发者强调,项目并非追求“一键通关”的捷径——事实上,从初始存档点连续按A键即可完成选择。真正目标在于验证模型能否在无先验知识、无外部指令的前提下,仅凭视觉输入与试错反馈,自主发现并执行有效策略。
后续工作将拓展任务复杂度:从起始房间出发,沿固定路线抵达大木博士所在位置,完成对话交互,最终完成初始宝可梦选择。开发者指出,随着任务链条延长,所需规划深度呈指数级上升,单纯扩大模型参数规模难以突破瓶颈,关键在于提升世界建模精度与长程因果推理能力。

评论
更多评论