全模态模型能理解物理世界吗?NUS复旦腾讯联合评测MiniMax-H3
Can MiniMax-H3 Reason About the Physical World? An Evaluation of Omni-Modal Generative Model作者Haoyu Zhao, Zihao Zhao, Tianyu Deng, Ziqin Xu, Zihao Zhang, Xudong Wang, Jinxiang Guo, Chen Gao, Ziyi Ye, Yeying Jin, Jiaxi Gu, Zuxuan Wu, Shuicheng Yan核心发表机构National University of Singapore、Fudan University、Tencent论文链接arXiv:2609.18323v1发布于arXiv 预印本cs.CV一、核心贡献 / Core Contributions提出一个面向 Omni-Modal Generative Model 物理世界推理能力的评估框架围绕四个互补维度组织多视图空间推理MSR、基于音频的消歧推理ADR、基于视频的决策推理VDR与视听联合推理AVIR。该框架不是评估模型能否忠实渲染显式提示而是评估模型能否从分散于多模态输入中的部分证据推断潜在事件状态与未来动力学。强调“隐式 Omni-Model 生成”这一新评估范式文本提示只指定任务不披露目标解释关键语义被分散到图像、视频、音频等观察中每个单一模态只提供部分证据模型必须跨模态对齐与联合解释生成视频则被当作行为读出用于判断模型是否恢复了缺失语义。构建了一个包含 517 个配对条件、覆盖 4 个域与 29 个子域的评估集并通过多模态源收集、任务特定实例构造、隐式提示构造与 10-loop 专家审查保证实例质量。评估采用三名专家独立评测与交叉复核并以按样本加权的成功率SR作为主指标。对 MiniMax-H3 进行系统评测在 517 个实例上总体成功率为 41.97%VDR 最高为 56.00%ADR 最弱仅 27.40%MSR 为 43.50%AVIR 为 47.89%。这一结果揭示了“支持多模态输入”与“有效多模态推理”之间存在实质性差距。通过定性分析与失败案例归纳出四类反复出现的失败模式证据错误接地、事件实现不完整、物理与构型违规、时序状态不一致并据此指出跨模态接地、物理推理与时序一致生成是未来全模态系统的重要改进方向。二、研究背景与动机 / Background Motivation近年来Omni-Modal Generative ModelsOmni-Models推动内容生成走向文本、图像、视频与音频的统一建模。MiniMax-H3 是这一趋势的代表之一它把多模态上下文理解与共享 latent 框架中的联合音视频生成结合起来支持文本、图像、音频、视频作为条件输入。这样的统一架构引出一个根本问题多模态对齐能否提升模型的世界推理能力omni-modal 输入又能带来哪些新的评估范式论文的核心动机在于接受多模态输入不等于能够跨模态推理。模型可能忽略非主导证据、无法建立跨模态对应或主要依赖文本提示的语义先验。为了检验这一点作者设计了一种“隐式 Omni-Model 生成”评估文本提示故意省略关键事件语义把缺失信息分散到多个输入模态中每个模态只提供部分证据目标事件只能通过对齐和联合解释恢复。生成视频被当作行为读出看输出是否与多模态证据一致从而判断模型是否恢复了缺失语义而不是仅仅遵循显式指令。现有视频生成与世界模型评估框架往往受限于有限输入模态并且提示与目标视频内容高度匹配。额外模态常常是冗余或局部条件信号模型不需要识别输入间关系也能生成看似合理的结果。也就是说已有基准主要测“模型能否忠实渲染被明确告知的事件”即 what it is told本文测“模型能否决定应该生成什么”即 what it should generate。下表概括了论文对评估基准特性的对比VBench 有 800 个样例输入为 T I提示显式不支持多场景、物理感知与推理TC-Bench 有 150 个样例输入 T I提示显式VideoPhy 有 688 个样例输入 T I提示显式支持物理感知但不支持推理WorldModelBench 有 350 个样例输入 T I提示显式支持物理感知但不支持推理而本文评估集有 517 个样例输入为 T I A V提示为隐式同时支持多场景、物理感知与推理。表中“Phys. Aaware”为原文拼写应理解为 Phys. Aware。这一对比清楚说明了本文评估在输入模态、提示类型与推理要求上的差异。三、方法 / Methodology3.1 总体框架 / Overall Architecture本文不是提出新的训练方法而是对 Omni-Modal Generative Model尤其是 MiniMax-H3进行物理世界推理能力评估。MiniMax-H3 作为 open-weight、general-purpose、omni-modal generation model提供统一接口可以以文本、图像、音频、视频为条件。不同模态贡献互补信息图像描述可见实体和空间布局视频提供运动和状态变化音频提供事件线索或语音约束文本指定请求的操作。生成视频使模型的解释通过物体运动和状态转移变得可观察。评估基于输出是否与可用证据一致而不是是否匹配单一条件。给定任务提示q qq和观察x \mathbf{x}x模型生成输出视频Y ^ ∼ p θ ( Y ∣ q , x ) \hat{Y} \sim p_{\theta}(Y \mid q, \mathbf{x})Y^∼pθ(Y∣q,x)其中p θ p_{\theta}pθ表示 MiniMax-H3 诱导的输出视频条件分布。文本提示指定任务但不显式给出目标推断模型需要从伴随观察中推导。评估的总体框架围绕四个互补维度展开分别考察空间、声学、时间与视听联合推理。整体评估思路可概括为下图所示。3.2 关键模块 / Key Modules3.2.1 多视图空间推理 / Multi-view Spatial Reasoning (MSR)MSR 测试模型能否整合场景的互补视图来推断空间结构。给定K KK张不同视角图像I { I ( k ) } k 1 K \mathbf{I}\{I^{(k)}\}_{k1}^{K}I{I(k)}k1K模型生成Y ^ M S R ∼ p θ ( Y ∣ q , I ) \hat{Y}_{\mathrm{MSR}} \sim p_{\theta}(Y \mid q, \mathbf{I})Y^MSR∼pθ(Y∣q,I)实例构造使目标空间推断依赖分散于各视图的证据。模型必须建立跨视图对应、考虑视点变化与遮挡并推断单张图像无法完全观察的关系。评估生成视频是否与多视图共同支持的空间关系一致。MSR 的输入数据特征包括家庭与桌面操作场景并涵盖显著视角变化、遮挡与多样的物体配置。其评测输入示例如下图所示。3.2.2 基于音频的消歧推理 / Audio-based Disambiguation Reasoning (ADR)ADR 测试音频能否解决静态视觉观察中的歧义。给定一张可多解的图像I II和提供判别证据的音频A AA模型生成Y ^ A D R ∼ p θ ( Y ∣ q , I , A ) \hat{Y}_{\mathrm{ADR}} \sim p_{\theta}(Y \mid q, I, A)Y^ADR∼pθ(Y∣q,I,A)图像本身无法确定目标解释音频区分合理备选。模型必须识别相关声学线索将其与图中物体或事件关联并生成与两个模态共同支持的解释一致的视频。一个典型例子是三个不同材料的杯子从桌上掉落声音提供证据判断是哪个杯子掉落。ADR 的场景中包含多个候选声源涵盖动物、乐器、工具、家用电器。其评测输入示例如下图所示。3.2.3 基于视频的决策推理 / Video-based Decision Reasoning (VDR)VDR 测试模型能否推断观察事件的潜在后果并生成反映合适响应的续写。给定前缀视频V 1 : T ( V 1 , … , V T ) V_{1:T}(V_1,\ldots,V_T)V1:T(V1,…,VT)模型生成Y ^ V D R ∼ p θ ( Y ∣ q , V 1 : T ) \hat{Y}_{\mathrm{VDR}} \sim p_{\theta}(Y \mid q, V_{1:T})Y^VDR∼pθ(Y∣q,V1:T)其中Y YY表示视频续写。前缀提供运动、状态变化和交互的时间证据模型需在q qq未显式指定动作的情况下推断 omni-model 应如何响应。一个例子是球滚入道路可能暗示儿童会跟随车辆应在潜在危险可见前停车。评估关注续写行为是否考虑观察事件的合理后果并保持与场景动态一致。VDR 选取的视频帧覆盖人类与动物行为、物理交互、拼图、场景记忆等设定。其评测输入示例如下图所示。3.2.4 视听联合推理 / Audiovisual Integrated Reasoning (AVIR)AVIR 测试模型能否整合视频上下文与听觉证据或语音约束推断视频应如何继续或被修改。给定视频V VV和音频A AA模型生成Y ^ A V I R ∼ p θ ( Y ∣ q , V , A ) \hat{Y}_{\mathrm{AVIR}} \sim p_{\theta}(Y \mid q, V, A)Y^AVIR∼pθ(Y∣q,V,A)视频可以是前缀或完整序列音频不必与视频时间对齐。视频续写时模型结合观察动态与音频内容推断后续事件视频编辑时模型将语音约束落地到视频中识别错误内容。与 ADR 的区别在于ADR 聚焦静态观察消歧AVIR 要求在视觉事件序列上下文中解释音频。评估续写或修订是否纳入相关音频内容同时保持视频一致性。AVIR 的选定帧跨活动、动画、动物与线索视频与环境声或口语约束配对用于续写或定位。其评测输入示例如下图所示。3.3 评估数据构建与专家审查 / Evaluation Data Construction and Expert Review数据构建流程包括多模态源收集、任务特定实例构建与迭代人类审查。每个实例将多模态观察与隐式任务提示、标注语义目标配对。提示指定生成操作但把任务相关信息留给观察推断。构建聚焦于“可用证据是否支持一个可评估的推断且后果能在输出视频中表达”。整体流程可参见下图。在源收集阶段作者收集真实与合成视觉、声学数据包括图像、视频、音频录音和生成模型产生的片段。例如 ChatGPT Voice 用于音频生成Seedance 2.0 用于视频生成。这些来源提供场景配置、物体材料、视点、事件动态和声学线索的变化合成数据允许构造现有记录中难以获得的条件。每个源都筛查感知质量、语义连贯性和任务适合性视觉伪影或事件结构不清的源被排除。在任务特定实例构建阶段每个实例通过选择输入观察、定义输出目标、指定视频生成提示来构造。输入按四类推理场景组织MSR 使用同一场景的多个视图提供互补证据支持某个单视图未完全指定的空间关系ADR 使用静态图像允许多种合理解释伴随音频提供区分证据VDR 使用视频前缀包含运动、状态变化或交互支持在续写中表达预期响应AVIR 使用视频前缀或完整序列与听觉证据或语音约束配对支持续写或纠正性编辑。每个实例识别支持目标的证据以及有效输出应满足的语义要求。这些要求针对生成视频表达的推断而不是外观或运动的唯一实现。在隐式提示构造阶段给定选定观察和语义目标构造既指定任务、又保留待推断信息的提示。作者使用 ChatGPT 和开源 Qwen3 生成候选表述和语言变体再由专家编辑与验证。提示构造遵循两条准则第一文本本身不应披露目标解释或生成内容第二多模态输入应提供足够证据推断生成结果。例如在 AVIR 任务中音频可指定约束但识别违反约束并确定所需修正仍要基于视频。会修改那些泄露答案、遮蔽请求生成内容、或要求输入不支持的假设的提示。在迭代专家审查阶段每个条件-提示候选经过 10-loop 专家审查沿四个维度评估场景复杂度即场景包含足够任务相关物体、关系或动态以支持预期评估推断丰富度即满足目标需要超越直接复现提示的时空、物理或语义推断条件对齐即输入共同支持标注目标视频与音频约束之间的有意差异定义生成中所需的修正提示隐式性即提示不说明目标推断同时清楚指定任务。专家还验证每个条件-提示对是否为预期推断提供足够证据同时允许生成视频中的合理变化。未通过审查的配对通过调整提示或替换输入条件来修订然后重新评估。最终每个接受实例表示为E i ( q i , x i , τ i ) \mathcal{E}_i (q_i, \mathbf{x}_i, \tau_i)Ei(qi,xi,τi)其中q i q_iqi是隐式任务提示x i \mathbf{x}_ixi是输入观察τ i ∈ { M S R , A D R , V D R , A V I R } \tau_i \in \{\mathrm{MSR}, \mathrm{ADR}, \mathrm{VDR}, \mathrm{AVIR}\}τi∈{MSR,ADR,VDR,AVIR}标识推理场景。根据场景观察可以是多张图像、图像加音频、视频前缀或前缀/完整视频加音频。每个条件-提示对都验证能支持通过 MiniMax-H3 视频生成表达的目标推断。评估集最终包含 4 个域、29 个子域、517 个配对条件。四、实验 / Experiments4.1 数据集与评估指标 / Datasets Metrics评估集包含 517 个实例四个场景与 29 个子类MSR 有 200 个实例、10 个子类VDR 有 100 个实例、8 个子类ADR 有 146 个实例、6 个子类AVIR 有 71 个实例、5 个子类。MSR 聚焦家庭操作与多视图观察包括大视点变化和部分遮挡。ADR 包含多个可能产生不同声音的物体要求模型利用音频线索识别对应事件。VDR 覆盖人类活动、动物运动、物理交互、场景变化、物体动力学等五类内容上的视频续写。AVIR 将视频与环境音或口语指令结合评测音频引导的续写和视觉不一致检测即定位与口语约束冲突的视觉内容。多视图视觉观察来自 HiFi-UMI-2K、VISTA-UMI-5K、HuMI-Unsheathe、Hy-Embodied-0.5-VLA-Data、10Kh-RealOmin-OpenData 等来源视频来源包括 LLaVA-Video-178K声学来源包括 FSD50K 和 ESC-50。这些数据补充了前文描述的合成来源。所有接受实例都经过相同的输入-提示构造和专家验证。主指标是成功率Success Rate, SR由人类根据任务特定成功标准评估。三名专家独立评测每个生成视频随后借助对应输入与任务指令对判断进行交叉复核。由于每个样本可能存在多个有效输出评测依据是生成视频是否满足任务意图要求而不是与单一参考视频匹配。各场景的具体核查标准为MSR 检查生成视频是否保持所要求的跨视图空间关系与协同动作ADR 检查生成事件是否与所给音频一致VDR 检查续写是否遵循所观察到的运动与任务约束AVIR 检查音频是否被正确地反映在相关视觉内容中。重要否决规则是一个视觉上合理的视频若未满足所要求的任务条件仍被判为不成功。这是把感知合理性与任务条件满足分离的关键设计。给定子集D \mathcal{D}D二值标签s i ∈ { 0 , 1 } s_i \in \{0,1\}si∈{0,1}成功率定义为S R ( D ) 100 ∣ D ∣ ∑ i ∈ D s i (1) \mathrm{SR}(\mathcal{D}) \frac{100}{|\mathcal{D}|}\sum_{i \in \mathcal{D}} s_i \tag{1}SR(D)∣D∣100i∈D∑si(1)总体 SR 在全部评测样本上计算场景级与总体 SR 均按样本数加权。片段未给出更细的评分细则、是否二值以外的评分、评分者一致性等元信息。4.2 主实验结果 / Main Results在 517 个评估实例上MiniMax-H3 总体成功率为 41.97%。场景排序为VDR 56.00% AVIR 47.89% MSR 43.50% ADR 27.40%。模型虽然支持全部所需输入模态但仍在一半以上评测案例上失败。最大差距出现在 VDR 与 ADR 之间为 28.60 个百分点这说明在本测试数据上模型对基于视频的续写比依赖音频的推理更可靠。作者明确限定由于各场景在数据、提示、生成目标上均不同这些结果主要反映任务层面的表现差异并非视频模态与音频模态之间的直接对比。MSR 结果MSR 总体 SR 为 43.50%样本数 N 200。子类结果如下Deformation 41.20%N34、Cleaning 33.30%N27、Articulation 34.60%N26、Arrangement 47.80%N23、Transport 34.80%N23、Loading 50.00%N20、Assembly 50.00%N20、Pouring 58.30%N12、Threading 75.00%N8、Control 42.90%N7。操作任务间差异明显Threading 与 Pouring 较高而 Cleaning、Articulation、Transport 落在 33–35% 区间说明在若干操作设定中跨视图保持空间一致性仍然困难。定性上在配对视图条件下模型能生成可识别的操作阶段例如电饭煲装配与餐具摆放。下图给出相应示例。VDR 结果VDR 总体 SR 为 56.00%样本数 N 100是四个场景中最高。子类结果如下Humans 55.88%N34、Cartoons 20.00%N5、Animals 63.64%N11、Traffic 100.00%N9、Physics 50.00%N10、Memory 66.67%N6、Puzzles 16.67%N6、Synthetic 52.63%N19。模型对人类、动物、交通动力学处理较好但在 Cartoons 与 Puzzles 上大幅下降。定性上在前缀视频条件下模型能生成合理的短期动力学例如狗接近门口、熨斗接触织物。下图给出相应示例每行左侧为观察帧、右侧为生成续写帧并附对应指令。ADR 结果ADR 总体 SR 为 27.40%样本数 N 146是四个场景中最难的一个。子类结果如下Vocalizations 31.30%N16、Alerts 23.10%N26、Music 25.00%N16、Machinery 17.60%N34、Contact 21.90%N32、Nature 54.50%N22。Nature 声音处理相对更好而 Machinery、Contact、Alerts 依然困难。作者据此指出核心挑战是把声学证据转化为正确的视觉事件。定性上以视觉与声学为条件时音频可引导生成的视觉内容例如模型会因对应声音而打开柜子、因打字机音频而生成纸张运动。下图给出相应示例。AVIR 结果AVIR 总体 SR 为 47.89%样本数 N 71。子类结果如下Activities 57.14%N14、Animation 33.33%N6、Making 52.38%N21、Animals 30.00%N10、Cues 50.00%N20。Activities 与 Making 表现更好Animation 与 Animals 相对更难。定性上上半部分示例做不一致定位即定位与口语约束冲突的视觉内容下半部分示例从视听输入继续视频模型在续写中能遵循若干口语或环境线索。下图给出相应示例。失败案例分析作者归纳出跨多模态物理世界推理任务中反复出现的四类失败模式第一证据错误接地即模型识别出一个看似合理的事件但把条件证据关联到错误的实体或动作例如猫–狗混淆、清洁电器例子第二事件实现不完整即生成场景中含有相关物体但未能实例化输入所暗示的交互例如打字或开罐第三物理与构型违规即生成续写破坏接触动力学、物体几何或有效状态转移例如滑板、滚动物体、拼图、魔方案例第四时序状态不一致即先前建立的物体状态、运动趋势或场景内容未能在续写全程保持。ADR 代表性失败案例如下图所示每行均匀采样视频帧标注输入声音与失败类型包括视听语义不匹配、视觉内容不合理、相似声源混淆、小物体交互接地失败红框标出与失败相关的区域。VDR 代表性失败案例如下图所示绿框帧为观察到的前缀其后为采样续写帧其中物理约束违规、细粒度操作错误、物体状态与场景内容的时序不一致均有体现。这些失败模式的共同挑战是超越感知合理性模型必须把多模态证据转换为正确事件同时保持观察所确立的物理、空间、时序约束。对 Omni-Model 而言跨模态联合理解与推理是必要的生成式全模态模型使这一推理过程通过视觉生成变得可观察其中间预测可被理解为一种 Chain-of-Frames帧链。上述失败案例因此给出了当前模型不足之处的一个具体视角并为未来全模态系统在跨模态接地、物理推理、时序一致生成方面指明了改进方向。4.3 消融实验 / Ablation Study根据所给源码研究笔记论文片段未包含正式的消融实验表、消融结论或模态移除实验。论文中的表 1 是评估基准特性对比对比 VBench、TC-Bench、VideoPhy、WorldModelBench 与本文评估集并非消融实验。作者在讨论中把“移除单个模态”或“在保持视觉输入不变的情况下替换音频”列为未来可做的受控实验用以分离输入理解错误、跨模态融合薄弱与视频生成阶段错误等因素。因此就目前提供的材料而言本文没有报告定量消融实验这一部分应视为未来工作方向而不是已经完成的实验证据。五、相关工作 / Related Work在视频生成评估方面VBench 等关注感知质量、语义对齐、时间组合性、物理忠实性。Physics-IQ 从观察帧测试物理预测不披露未来结果Morpheus 评估生成动态是否符合物理定律AV-Phys Bench 检查生成音视频流内部与跨流的物理一致性ROVER 和 OmniVideoBench 分别通过文本-图像生成和音视频问答研究跨模态推理。本文与这些工作的区别在于评估的是“观察是否支持一个通过视频生成表达的推断”而不是仅评估生成内容的质量或与显式提示的匹配度。在通过视频生成进行推理方面VideoThinkBench、TiViBench、Gen-ViRe 探测视觉、符号和规划能力RISE-Video 测试隐式世界规则推理Zhang 等检查因果感知与生成后果之间的差距。本文与这些工作的区别在于关注任务相关信息如何分布在多个输入中。提示不说明目标推断要求模型建立跨视图对应并从时间上下文中推断响应。在世界模型评估方面WorldModelBench 评估指令遵循和物理遵守WorldScore 评估指定相机轨迹下的连续场景生成WorldMark 和 Omni-WorldBench 评估控制对齐、世界一致性和动作依赖的状态转移。本文的评估补充了“观察如何决定要生成的事件或响应”这一问题。空间任务需要整合互补视图决策任务需要从观察动态中推断合适响应。成功与否由生成结果是否满足输入证据支持的语义要求来衡量。六、局限性与展望 / Limitations Future Work根据所给源码研究笔记论文片段未出现作者正式声明的局限性段落。以下局限性一部分来自实验结果与讨论一部分来自片段信息的缺失。首先论文没有报告与其他基线模型的横向对比只报告了 MiniMax-H3 作为代表性全模态模型的结果。因此无法从现有材料判断其他 Omni-Model 在同一评估集上的相对表现。其次人工评测仅说明三名专家独立评测并交叉复核未报告标注者间一致性如 κ 值或复核分歧的解决机制评测可靠性元信息不足。再次本文没有包含正式的模态消融实验讨论中把“移除单个模态”或“替换音频保持视觉不变”列为未来受控实验说明当前结果无法严格分离输入理解、跨模态融合与视频生成阶段各自造成的错误。此外场景间不可直接比较。作者自己明确限定由于数据、提示、生成目标不同VDR 与 ADR 之间 28.60 个百分点的差距只反映任务层面差异不能直接解读为视频模态优于音频模态。多个子类样本量很小例如 VDR 中 Cartoons 仅 5 例、Memory 6 例、Puzzles 6 例MSR 中 Threading 8 例、Control 7 例AVIR 中 Animation 6 例。这些子类的成功率如 Traffic 100.00% 仅 9 例、Threading 75.00% 仅 8 例解读时需谨慎。成功率是按样本加权的百分比场景内 Overall 与整体 41.97% 均为加权结果不能简单对各子类 SR 取算术平均。模型侧信息也缺失片段没有给出 MiniMax-H3 的架构模块、共享潜空间细节、损失函数、训练与推理流程及超参数因此无法从模型内部解释失败原因。未来工作方面作者计划持续扩展与细化评测集加入更多样的物理世界场景、模态组合与推理要求开发自动评测框架可靠评估生成内容中的推理结果实现对未来 Omni-Model 的可扩展、可复现测试。讨论中还建议做受控实验来分离因素例如移除单个模态或在保持视觉输入不变的情况下替换音频。更广泛地看全模态输入不仅提供更丰富的内容生成接口也为通过生成来探查推理的新评估范式提供了基础。七、总结 / Conclusion本文的核心思路不是评测“提示完全给定”条件下的生成而是构造隐式条件–提示对其关键信息必须从分布于多模态的互补证据中恢复。由此可以检验 Omni-Model 是否能超越“接受异构输入”有效整合输入以推断潜在事件状态、物理动力学与合适结果。对 MiniMax-H3 的评测同时显示了这种能力的前景与当前局限互补多模态证据确实能支持超越显式指令的推理但总体性能仍有限暴露出“全模态输入支持”与“有效物理世界推理”之间的实质性鸿沟。具体而言在 517 个评估实例上MiniMax-H3 总体成功率为 41.97%VDR 最高为 56.00%AVIR 为 47.89%MSR 为 43.50%ADR 最弱仅 27.40%。这些结果表明有效多模态整合仍然是充分利用多样输入模态优势的关键。定性分析进一步显示模型能生成视觉上合理的续写且常常遵循输入模态所提供的主导线索但在跨视图空间一致性、声学证据到视觉事件的接地、物理约束保持与时序状态一致性方面仍频繁失败。更广泛的意义在于全模态输入不仅提供更丰富的内容生成接口也为通过生成来探查推理的新评测范式提供了基础。原文摘要:Recent Omni-Modal Generative Models (Omni-Models) have advanced content generation toward unified modeling of text, images, video, and audio. MiniMax-H3 exemplifies this transition by combining multimodal context understanding with joint audio-visual generation in a shared latent framework. Its unified architecture raises a fundamental question: Can multimodal alignment improve the model’s world reasoning, and what new evaluation paradigms do omni-modal inputs enable? To investigate this question, this work introduces a comprehensive evaluation framework organized around four complementary dimensions of physical world reasoning. Unlike existing evaluation frameworks for video generation and world models, which are often constrained by limited input modalities and evaluation settings where prompts closely match the target video content, our evaluation is specifically designed to exploit the multimodal inputs of Omni-Model. We construct a diverse set of novel tasks that require models to integrate complementary information across modalities. Specifically, we consider four scenarios, including implicit prompts paired with multiple frames, audio-image, prefix-videos, and audio-video inputs. Every single modality provides only partial evidence about the underlying event, requiring the model to jointly reason over the complementary semantic cues to infer latent event states and future dynamics. Across 517 evaluation instances, MiniMax-H3 achieves an overall success rate of 41.97%. Video-based Decision Reasoning yields the highest success rate at 56.00%, while Audio-based Disambiguation Reasoning is the weakest, reaching only 27.40%. These results indicate that effective multimodal integration remains key to fully exploiting the benefits of diverse input modalities. The project is available at https://github.com/gulucaptain/MiniMax-H3-Reason.PDF链接:https://arxiv.org/pdf/2609.18323v1部分平台可能图片显示异常请以我的博客内容为准