4DWorldBench 如何实现3D/4D世界生成模型的全面可信评价?
我爱计算机视觉
2025年12月25日 11:11
收录于文集
共499篇

  • 论文标题:4DWorldBench:A Comprehensive Evaluation Framework for 3D/4D World Generation Models

  • Arxiv链接:https://arxiv.org/pdf/2511.19836

  • 项目主页:https://yeppp27.github.io/4DWorldBench.github.io/

  • 所属单位:中国科学技术大学,北京中关村学院,浙江大学

现状与挑战:从视频生成到“世界模拟”的评估断层

目前,世界生成模型(World Generation Models)已成为多模态智能的核心研究方向。与侧重像素真实度的传统 2D 视频生成不同,世界模型更强调生成内容的物理一致性、4D 空间时序连贯性以及对多模态指令的精准响应。

然而,现有的评估基准面临以下挑战:

  • 评估维度失衡:现有基准往往在单一框架下难以平衡感知质量、物理真实感与4D一致性,无法满足世界模型全维度的评估需求。

  • 物理规律评估的局限性:物理评估通常依赖手工定义的模板,缺乏语义灵活性。

  • 跨模态评估困难:缺乏一个统一的框架来比较文本、图像、视频驱动的生成模型。

为了解决这些问题,4DWorldBench应运而生,提供了一个通用的、具备物理感知的3D/4D世界生成评估框架。

图1 4DWorldBench 框架概览

评估方法详析:自适应混合评估机制

4DWorldBench 的核心竞争力在于其自适应混合评估管道(Adaptive Hybrid Pipeline),它巧妙地平衡了底层视觉特征与高层逻辑推理:

1. 物理真实性(Physical Realism)

主要基于两个核心原则:

  1. 基于字幕推理进行评估:我们将输入条件(如图像、视频)和生成的视频转化为文字描述,利用大语言模型(LLM)通过基于字幕的推理来评估物理一致性,而不是直接通过视频进行观察。这种方法能够更精确地理解物理过程。

  2. 自适应选择评估维度:根据每个生成场景的语义,系统会自适应选择与物理一致性相关的评估维度,确保评估符合场景的实际需求。

在物理真实性评估中,我们首先将输入条件和生成的视频转化为文本描述,为后续的物理推理提供统一基础。接着,基于输入条件和物理法则,生成一系列诊断性问题,以评估视频的物理合理性。最后,将生成的视频描述和问题输入大语言模型,模型通过与预期物理结果的对比,得出物理一致性的评分。

2. 条件-4D 对齐(Condition Alignment)

条件-4D对齐评估框架旨在衡量生成视频与指定条件的一致性,确保其符合预定的故事情节(事件)、角色运动(运动)、属性和场景,具体我们分为Event Control, Scene Control, Attribute Control, Relationship Control以及Motion Control。该评估框架基于大语言模型(MLLM),通过三步流程进行量化:首先将输入多模态条件转化为文本描述;接着,生成一系列诊断性问题,涵盖物体属性、空间关系、场景细节、运动模式等方面;最后,通过大语言模型对问题进行回答,并将其与预期答案进行比较,得出最终的对齐评分。与物理评测不同,这一评估关注的是语义和场景一致性,而非物理现实的约束。评分越高,表示生成的视频与输入条件的符合度越强。

3. 4D 一致性 (4D Consistency)和感知质量(Perceptual Quality)

4D一致性评估框架关注生成视频在多个视角、运动状态和时间维度上的稳定性与一致性。通过引入时间平滑方法,减少FPS变化对几何一致性的影响,确保长时间序列或不同帧率下的稳定性。MLLM-as-Judge被用来评估运动一致性,避免微小位移导致不合理的基于光流相似度的评分,从而提高运动的合理性。同时,Gram矩阵特征用于衡量生成视频的风格一致性,确保视觉风格的连贯性。

感知质量方面,4DWorldBench使用CLIPIQA+评估每帧视频的清晰度和视觉细节,保证空间质量;FastVQA用于检测视频的时序稳定性,确保时间维度上的一致性。对于3D纹理质量,使用mPLUG-Owl3对渲染细节进行评分,确保纹理效果与真实世界一致。

实验结果

我们在 4DWorldBench 上评估了当前主流的生成模型,包括 Image-to-4D (如 DiffusionAsShader)、Video-to-4D (如 ReCamMaster)、Text-to-4D (如 4Dfy) 等。

1. 主流模型全维度评测

图2 不同世界生成模型在五大维度的性能雷达图

2. 模型性能排行榜

表1 4D生成模型在各个维度上的评估结果(摘录)

表2 3D生成模型在各个维度上的评估结果(摘录)

实验观察 1:风格一致性与场景控制已取得显著进展

大多数模型在风格一致性(Style Consistency)、场景控制(Scene Control)和属性控制(Attribute Control)方面已经取得了较高的分数 。在 3D 生成和Video- 4D任务中,视角一致性(Viewpoint Consistency)也得到了较好的处理 。

实验观察 2:时序推理、运动控制与物理真实性仍是共同瓶颈

  • 运动相关指标的差距:包括运动对齐(Motion Control)、动力学(Dynamics)和运动一致性(Motion Consistency)在内的指标,与理想水平之间存在明显差距 。

  • 物理定律理解不足:对于 4D 生成而言,光学(Optics)和热力学(Thermal)上表现平平 。这暗示当前架构在复杂的视角和光照变化下,难以真正理解物理定律 。

  • 文本驱动的局限性:在Text- 4D任务中,事件控制(Event Control)和关系控制(Relationship Control)能力较弱 。这反映出将丰富的文本描述转化为连贯的时间交互仍然是一个悬而未决的问题 。

结语

在这项工作中,我们推出了 4DWorldBench,旨在填补当前世界模型评估中的空白。通过整合 LLM 的逻辑推理能力和 MLLM 的视觉感知能力,我们实现了一个对物理规律敏感、对条件模态自适应的综合评估框架。

我们的实验揭示了当前模型在理解复杂物理交互方面的局限性,并证明了视频条件输入在保持物理一致性方面的优势。我们希望 4DWorldBench 能成为社区的标准化工具,加速从“视觉生成”向真正的“世界生成”过渡,推动更连贯、可控且符合物理规律的虚拟世界构建。

更多实验细节与排行榜信息,请访问:

  • Arxiv: https://arxiv.org/abs/2511.19836

  • Project: https://yeppp27.github.io/4DWorldBench.github.io/

本文为粉丝投稿。