WorldClaw:智能体驱动的大规模 3D 开放世界生成
文章摘要
WorldClaw 是腾讯混元 3D(Tencent Hunyuan3D)团队发布的一套全智能体化(fully agentic)、由粗到细(coarse-to-fine)的开放世界 3D 场景生成框架。它要解决的问题一句话概括就是:给一段开放式的自然语言描述,直接产出一个可以自由漫游、逐个物体可编辑、能直接交付给渲染/动画/游戏引擎流水线的显式 3D 世界。项目主页是一个交互式展示站(React SPA),正文内容全部由前端脚本渲染,本文的技术描述来自站点打包资源中提取的文案。
整体架构分三大阶段。
第一阶段是意图理解与场景规划。一个「意图分析智能体」只抽取并归一化提示词中明确写出的约束,刻意不编造、不填补空白;随后一个「场景规划智能体」按照预定义的 specification schema,消解模糊描述并补全下游模块需要的属性。这份 specification 是整条流水线的共享语义接口——区域(regions)、地形约束、物体约束在后续每一级都以完全相同的方式被读取。它包含三类信息:主要区域及其属性与空间关系;地形类型、地貌特征、表面外观与地形资产;物体类别、外观、密度与空间关系。
第二阶段是全局地形构建。地形规划先把高层约束转成可执行的地形规格,资产生成阶段产出一张语义布局图(layout map)、一批可复用的 3D 原型(岩石、植被簇、地貌附着物)以及表面材质(生成式贴图 + 程序化节点材质);再由一个「区域感知高度场」把这些合成为连续但不规则的地貌。具体做法是在基础高程上叠加多频噪声与地貌算子——山峰、沙丘、阶地、侵蚀——使不同地貌沿着不规则却连续的边界相接,同一套权重随后也用于混合表面材质。整个地形阶段还有一个「渲染—检查」闭环,用于修正区域过渡、材质尺度和散布(scatter),同时保持语义布局不被破坏。
第三阶段是局部实例内容生成,这也是全文最有意思的设计。一个「区域规划智能体」只挑选那些局部地形能够支撑所需功能的区域;每个被选中的区域从一台记录过参数的相机渲染出来,转成一张「以地形为条件的构图图像」,然后做实例分割,再重建成带贴图的网格。通过重建相机与地形相机之间的对应射线,系统可以反解出每个物体的摆放位置;最后一个精修智能体检查姿态、网格质量、缩放以及物体与地形的接触关系。产出是实例级的内容:几何、外观属性、以及对齐地形的放置变换,每个资产都保持独立可编辑、可复用。
官方给出的展示 prompt 涵盖面很广:带雪山/平原/水域/沙漠的中世纪村落、沿河两岸分布的雪村、被巨龙盘踞的沙漠冒险营地、《海贼王》风格的热带海盗岛、峡谷部落聚落、日式小镇群岛、熔岩恶魔巢穴般的火山地貌、适合大规模 PvP 的沙漠地图、正在开采的宝石矿场,以及霍比特风格的山谷村落。每个世界都会输出等距全景图、空中环绕与地面行走的截图,以及一段四通道渲染的相机环绕(外观、实例掩码、法线、深度)。
作者在结论里的观点值得单独摘出来:当智能体接管了资产搜索、材质图与着色器工作后,3D 内容创作的核心问题就不再是「如何构造每一个底层组件」,而变成了「创作者究竟想表达一个什么样的世界」。他们也讨论了与 Blender 的关系——Blender 提供可脚本化的几何、材质与渲染访问,但大型游戏世界还需要运行时程序化生成、导航、物理和交互,因此 WorldClaw 更适合与引擎侧配对使用。「把全局世界组织与局部实例级内容解耦」被明确点名为让生成场景在规模扩大时仍保持连贯的关键。
需要注意:该项目当前只有论文与展示页,GitHub 仓库是空的,代码未开源。
HN 评论精华
这条帖子拿到 276 分、82 条评论,但讨论走向和技术细节关系不大——绝大部分火力集中在「AI 生成的世界/叙事到底算不算内容」这个老问题上,技术层面的高质量评论反而只有寥寥几条。
关于技术本身
- avaer(本帖最有信息量的一条)直接点破定位:「说清楚一点,这不是一个模型,而是一堆调用各种模型的 Python 脚本(而且代码不可用)。」他认为大部分内容就是「你知道吗,LLM 是可以接到 PCG(程序化内容生成)系统上的」,但有一个点确实少见:让图像模型来完成构图(这正是图像模型最擅长的事),再通过 SAM3D 之类把物体从图中抽出来变成 3D 并放进世界。他还补充说「大多数人没意识到现在的 LLM 在 3D 上有多强」。
- torginus 贡献了另一条硬核视角。他做过多年程序化生成约束系统的业余项目,带一套 DSL,可以写「红钥匙必须在红门之前可达,且不存在绕过红门的路径」这类约束。他之所以把项目搁置,是因为几年前他用大白话把同样一组约束交给 LLM 生成地牢房间图,LLM 干得完美无缺。他的结论是:「LLM 是极其灵活的约束求解器,在这类场景中被严重低估了。」
- Marazan 立刻反驳这个乐观判断:问题在于 LLM 的非确定性,以及那种「你说得完全对,我把红钥匙放到红门后面了,这个点承载了整个地牢的设计,而我搞砸了」的时刻。手写约束系统出错时你有一个可以确定性修复的 bug;LLM 出错时你只能重新掷骰子并付出昂贵的验证成本。torginus 回应说他确实在后台跑了校验脚本——而基于约束的 PCG 本来就经常进入不可满足状态,需要(部分)重试。
- deterministic 从实用角度泼冷水:LLM 生成静态 3D 模型确实还行,但通常三角面数过多,而且除非是人形,否则没有骨骼。
关于视觉质量与真实性
- cobertos 是少数认真看图的人:在秋季和冬季的展示图中,算法把建筑放到了前景的水面上;夏季那张的建筑摆放加上左侧零碎的水塘看起来「像是一个不上心的人用散布笔刷刷出来的」。他追问示例到底 cherry-pick 了多少,还是真的一次生成。dozerly 回答得很干脆:「肯定挑过。没人会不挑最好的结果就拿出来发布。」
- Reubend 觉得资产不错但地形太卡通。gosolozero 追问能否做「MMO 卡通风」之外的风格,比如巫师式中世纪或赛博朋克写实建筑。avaer 的解释很到位:这类实验性项目倾向卡通风格,是因为错误和低质量可以用「哈哈这就是风格」糊弄过去,而写实风格对美术不匹配和着色错误毫不宽容;现代精品游戏里美术团队要花大量时间调校一致性,「没什么人愿意让 agent 跑一个月来干这活」。
最激烈的一条主线:程序化生成 vs 手工放置
- cautiouscat 开了这条主线:开放世界最精彩的部分在于手工放置的细节与环境叙事,对比一下《上古卷轴 5》《赛博朋克 2077》和以程序化生成为主的《星空》就知道了。生成出来的村庄「就是不有趣」。他承认这对腾讯量产抽卡手游的市场可能很好用,但这种方式做出的世界挠不到真正开放世界的痒处。
- avaer 回击:「你知道还有什么擅长叙事吗?AI。不然也不会出现文学奖因为发现是 AI 写的而被撤销的事。」这句话引爆了一条极长的支线。FeteCommuniste 举出 Granta 短篇小说奖疑似 AI 作品的例子,letmevoteplease 贴出获奖作品原文并说「用过 ChatGPT 写故事的人一眼就能认出这个腔调,我觉得腻得慌,但它确实骗过了一群古板的文学评委」。
- svachalek 给出了这条支线里最专业的分析:AI 偏爱断续短句,也偏爱那种「勉强够到、擦边而过」的比喻——文中「像被热气绷得太紧的鼓皮一样呻吟」听着很酷,但细想鼓皮会「呻吟」吗?热气跟这有什么关系?他形容这种阅读体验是「一开始觉得读到了非常精妙、字字推敲的文字,随后开始觉得自己被耍了」。
- Forgeties79 是反方最执着的发言者,他的核心论点不在质量而在发布伦理:人写完初稿通常不会直接甩出去求表扬,而是打磨或放弃;可一旦是 LLM 花 30 分钟吐出来的东西,这条规矩就突然作废了。他还给出了本帖被顶得很高的一句:「一幅好画从来不只是一幅好画。语境、作者本身都是艺术的一部分。把这些拿掉,它就不再是艺术,因为它不再是任何个人化表达。假日酒店墙上也挂着不少漂亮的风景画,但没人愿意花钱把它们挂进自己家。」
- ido 给出了折中立场:AI「辅助」创作他能接受,只要有一个有技艺的人在驾驶座上;他自己用 AI 做游戏原型时发现,一旦把游戏设计的缰绳交给 AI,产出就会退化成「有意义设计的剪影」式的废料。
- 9dev 从另一个角度反驳「AI 写得比游戏编剧好」:这不是因为游戏编剧不行,而是因为绝大多数目标受众根本不在乎好故事,他们只想射爆坏人当酷英雄——某个工作室在续作里让前作主角被复仇者折磨致死时,粉丝反应就是最好的证明。
关于命名的吐槽
- ex-aws-dude 问了一句「我不想当 HN 上纠结琐事的人,但为什么最近什么东西都叫 Claw?」consumer451 引用 OpenClaw 作者 Peter Steinberger 在 YC Startup School 的演讲:目前有 33000 个带 “claw” 的仓库。virgildotcodes 补充了完整来龙去脉:项目最初叫 clawdbot(源自 Claude),Anthropic 施压后改名 Moltbot,大家嫌这名字恶心,于是最终改成 openclaw 配一只龙虾吉祥物。bonoboTP 的分析更刻薄:「world」加「claw」是双倍 buzzword,「人们就是想聊世界模型,输入输出是什么根本不重要,重要的是它是个世界模型,不是区区语言模型,它建模了整个世界」。Cordiali 一句话收尾:「这只是 AI 向螃蟹演化的自然过程。」
- atum47 说想晚上看看代码,tjohns 回复:「没有代码,GitHub 仓库是空的。」rrr_oh_man 补刀:「LGTM - approve」。