MIRA:在《火箭联盟》上训练的多人可交互世界模型
文章摘要
(说明:原网站是纯前端 SPA,抓取时只返回加载动画,以下内容主要基于官方在 HN 的说明与讨论还原。)
MIRA 是一个”可交互世界模型”(interactive world model)。它的颠覆之处在于:它不是一个”会玩《火箭联盟》的 AI”,而是一个”用神经网络把《火箭联盟》本身模拟出来”的 AI。换句话说,你玩的不是游戏引擎渲染的画面,而是直接在一个神经网络内部游玩——画面、物理、碰撞、进球全部由模型实时生成。很多人第一次玩都会惊讶:它”感觉就跟真游戏一模一样”。
据团队成员在 HN 的介绍,MIRA 是 General Intuition、Kyutai 与 Epic Games 三方合作的成果,在 10,000 小时的《火箭联盟》对局数据上训练而成。模型有 50 亿参数,能在单张 B200 GPU 上以 20fps 跑起 4 人对战。它本质上是一个扩散(diffusion)世界模型;据讨论,把同一帧的 4 个高度相关(都围绕着球)的视角一起喂进去,是它能保持如此连贯的关键。团队同时开源发布了:可在线试玩的 demo、一份详尽的技术报告,以及一份 1,000 小时的 4 人对战数据集。
最令团队自己惊讶的一点是”自动纠偏”(auto-recovery)行为:一般的世界模型一旦跑偏进入训练分布之外(out-of-distribution)就会一路崩坏、再也回不来,但 MIRA “非常不喜欢待在分布之外”,会自己把画面拉回正常轨道。反过来说,它也确实”讨厌”没见过的情况——有玩家发现只要倒着开车,模型就明显表现变差、经常无视输入。团队坦言,这个项目的目标不是取代游戏本身,而是推动世界模型的研究,并希望未来能应用到机器人等”数据受限”的场景中。
HN 评论精华
-
MasterScrat(General Intuition 团队):给出了最完整的技术底牌——三方合作、10k 小时数据、5B 参数、单 GPU 20fps 跑 4 人对战,并已放出在线 demo、技术报告和 1k 小时数据集。他还打趣说,模型 checkpoint 的体积居然比游戏本体安装包还小一半。
-
vvolhejn(团队成员 Václav):认为最出人意料的就是”自动纠偏”能力——他见过的其他模型一旦跑偏就永远回不来,而 MIRA 会主动回到正常分布。他还解释了多视角输入的好处:因为四个视角已经把全部信息都给了模型,它就不必去”揣摩”其他玩家的状态、也不用维持长时间的一致性。
-
danking00:分享了很多人共同的顿悟时刻——本以为会看到”AI 打《火箭联盟》”,结果很快意识到这其实是”AI 在模拟《火箭联盟》”,直呼疯狂、”手感和真游戏没差”。
-
superkuh:给出了有价值的负面测试。他倒着开车后发现模型表现大幅下降、经常不执行他的输入、一直在自我”矫正”。MasterScrat 回应说,倒着开车确实是测试模型泛化能力的好点子。
-
avaer 与 sliding-penguin:提出了最主要的质疑——既然数据和代码都放出来了,为什么不干脆开源那 5B 的模型权重?后者还表示很想用人类真人对局数据去做微调。
-
in-silico 与 amarant:从玩家体验角度提出批评。in-silico 觉得训练数据应该来自”更不可预测”的策略,因为模型常常无视你的输入、径直去做”机器人会做的事”;amarant 则指出物理表现不错,但缺少高手才会的花式操作(三段 flip reset、double-tap、musty 等),一玩就露馅。