世界模型基础:概念、架构与核心能力
世界模型是智能体内部用于表示和预测环境的系统:它根据历史观测、当前状态与智能体采取的动作,预测环境未来的演化结果,从而支持决策、规划和行动。
需要强调的是,世界模型不是要复刻整个现实世界,而是模拟智能体(Agent)所处的特定动态环境——只建模智能体完成任务所需要的那部分环境状态。
世界模型的训练遵循一个清晰的数据闭环:
- 智能体与环境交互,采集状态转移数据与奖励数据;
- 基于采集到的数据构建训练数据集;
- 训练世界模型学习环境的状态转移动力学,核心是学习一个映射:输入当前状态 (s) 与动作 (a),输出下一状态 (s’) 与即时奖励 (r) 的概率分布(因为未来本身具有随机性);
- 优化目标是最小化预测状态与实际状态之间的误差。
训练结果不是一组静态知识,而是一个可在动作条件下持续推演状态转移的环境动力学模型。
面向决策的世界模型主要有两种训练来源:
- 直接来源:根据真实环境的交互数据,直接训练得到世界模型。这类模型本质上是环境动力学模型,也是最贴合理想定义的世界模型形态。
- 间接来源:以大语言模型(LLM)为骨干,再参照真实环境数据对 LLM 及其构建的世界模型进行微调。LLM 在语言训练过程中能够形成一定的世界知识和隐式世界表征,但这些知识通常缺乏明确的状态转移结构、物理约束和稳定的因果链条,因此需要额外的环境交互数据进行校正。
世界模型可以概括为三大核心功能:理解世界、预测世界、规划世界,分别对应 V(表征)、M(预测)、C(决策)三个核心模块。
世界模型通过学习,将外部环境转化为抽象的状态或潜变量,形成对世界的内部表示。其状态表示方式主要包括:
- 显式物理表征:直接表示物体、空间、位置、速度等环境状态;
- 隐式数据表征:将原始观测压缩为潜在状态,只保留与预测和决策有关的信息。
好的表征需要满足四个条件:预测充分性(能够预测未来)、控制充分性(能够选择正确动作)、紧凑性(不过度保存无关细节)、稳定性(面对噪声和环境变化仍然有效)。
此外,世界模型的表征方向还包含两个延伸领域:
- 视频生成式世界模型:通过生成未来视频来模拟环境变化。但目前通常存在物理规律不够严格、难以实时交互、因果推理能力不足、长时间生成容易出现状态不一致等限制。
- 具身环境世界模型:为机器人、自动驾驶系统或其他「具身智能」提供可交互的虚拟 3D 环境,使智能体能够在其中预测、规划和训练。
预测层(也称记忆模型)是世界模型的核心,负责学习环境随时间变化的规律,并预测下一潜在状态。
具体而言,它根据当前状态、当前观察、历史记忆和候选动作,预测:
- 下一时刻的状态;
- 行动可能获得的奖励;
- 行动可能产生的风险;
- 多步执行后的长期结果。
一种典型的预测结构是 RNN 与 MDN(混合密度网络)的组合:RNN 根据历史状态保存时序记忆,MDN 载入潜在变量并输出下一潜在状态的概率分布(而非唯一确定结果)。通过从概率分布中采样,可以生成多个可能的未来场景。
其他常用的动力学建模技术还包括:自回归模型、GAN、扩散模型等。
世界模型可用于智能体的训练与推理阶段,为策略学习与在线决策提供可靠支撑。
在训练阶段,世界模型可构建出安全、高效、包括极端场景且可重复的虚拟交互环境,使智能体能够在其中进行大量试错式训练,加速策略学习,无需承担真实物理世界的风险与成本。
在推理阶段,世界模型能够对候选动作序列进行模拟,预测其引发的未来状态、即时奖励及长期后果,从而帮助智能体在行动前评估不同选择的优劣。
决策层的核心任务是:比较不同动作或动作序列的预测结果,选择目标收益较高的行动方案,然后智能体执行选定动作并从真实环境获得新观察。
一种实用的部署方式是:先用世界模型生成大量想象轨迹,再利用这些轨迹训练一个策略网络;实际部署时策略网络直接输出动作。优点是执行速度快、适合边缘设备;缺点是策略可能无法处理训练阶段没有想象到的情况。
世界模型本体一般指表征层、预测层、解码层,但它往往与 Agent 框架(感知层、推理层、执行层)一同使用。在实践中,可以将感知层与表征层合并为统一的视觉模块(V),并弱化或删除解码层,以提高执行效率。
信息流的整体过程如下:
| 模块 | 职责 | 输入 | 输出 |
|---|---|---|---|
| V(感知 + 表征) | 整理并压缩外部观测 | 图像、视频、传感器信息、动作记录 | 统一的潜在状态 |
| M(预测) | 学习时序动力学 | 当前潜在状态、观察、历史记忆、候选动作 | 下一状态、奖励、风险、长期结果 |
| C(决策) | 比较候选并输出动作 | 当前潜在状态、记忆隐藏状态、不确定性变量 | 具体行动指令 |
模拟环境在未来扩展时域内的演化轨迹,使智能体能提前规划多步动作序列,避免短视的贪心决策,从而优化长期累积收益。
通过在内部「想象」中生成虚拟轨迹并推演结果,在有限真实数据下完成策略训练,提高了样本效率,加快了训练过程,降低了资源开销。
学习得到的隐模型让系统能够适应非平稳环境:在感知信息缺失或不完备的条件下,模型可补全缺失数据、估计预测置信度,并在高风险场景中支持不确定性感知的保守决策。
通过合成多样的虚拟极端场景(如罕见事件或突发状况),扩充训练分布,减少真实环境中的交互次数与试错成本,提升策略对复杂和不确定场景的处理能力。
世界模型的应用范围广泛,主要包括:
- 生成式游戏中的环境模拟;
- 具身智能的虚拟训练场、机器人决策与规划;
- 自动驾驶与智能车载网络;
- 低空无线网络中的动态调度;
- 物联网场景中的预测性维护与资源管理;
- 城市环境分析与社会智能模拟。
世界模型在执行时具有以下六大特性,它们围绕着「状态的持续变化」展开:
世界模型根据历史状态、当前状态和候选动作,持续维护一个内部世界状态,对同一环境进行连续、稳定且合乎规律的推演。它不是每次重新生成一段彼此独立的描述,而是让新的观测、动作与历史记忆共同更新同一潜在状态。
动态推演需要保持物体身份、空间位置、运动轨迹、因果映射及环境规律在时空上的连续一致。同一个动作在相同状态下应产生可解释、可验证的后果,不能只追求局部画面或语义上的合理。
世界模型能够进行时间序列预测和长视野规划,比较多个动作序列的长期结果,再选择下一单步行动方案。智能体不只根据即时反馈行动,而是围绕长期目标,在不同时间尺度上组织预测与决策。
在随机且部分可观测的环境中,下一状态不一定唯一。世界模型通过概率分布和潜在变量生成多个可能未来,不仅预测「最可能发生什么」,还比较不同未来下行动的稳定性和风险。
世界模型的预测不是一次性结果。动作执行后,智能体还要接收真实观测,修正内部状态和后续预测。预测、行动与反馈构成持续循环,真实观测用于降低多步推演中的误差积累。
在受限场景或新场景中,世界模型能够根据少量真实环境反馈,在执行过程中持续更新和校正自身,从而形成符合当前环境动态的内部模型。智能体随后可利用该模型进行模拟交互与想象推演,以较少的真实环境交互学习新能力,并快速适应不断变化的场景。
当前世界模型的理论基础尚不完整,缺乏统一的评测基准与标准化评估体系。因果推理能力薄弱,物理规则建模不够严格,难以保证预测结果在真实环境中的有效性。同时,长时记忆与复杂规划能力受限,对突发情况的预测精度不足。
尽管世界模型旨在学习普适规律,但现实环境因地理、气候等条件而高度多样,许多地方性细微特征难以被统一模型充分识别。加之训练数据和虚拟环境覆盖有限,世界模型在跨场景、跨任务迁移时容易性能下降。
世界级数据来源分散、格式多样且难以统一,部分数据缺乏标注,监督信号稀疏,制约了模型对环境动态的有效学习。此外,数据获取还涉及隐私保护、授权许可和版权争议等合规性挑战。
模型训练与推理需要极高的算力支持,多步未来模拟带来显著的计算开销,而实时交互场景又要求较低的推理延迟。高精度预测与高运行效率之间存在根本性矛盾,在资源受限或响应敏感的部署环境中尤为突出。
策略可能在学习过程中发现世界模型中的漏洞,在模拟环境中获得较高奖励,却无法在真实环境中成功。这意味着策略优化的可能不是现实中的正确行为,而是对世界模型预测偏差的利用。
现有世界模型主要关注物体、空间和动力学等物理环境,对人类意图、行为变化、群体互动以及社会规范的建模仍较为有限,难以准确预测复杂社会场景中的行为演化。

.webp)
.webp)
.webp)