视频生成模型复现艾姆斯错觉:几何一致性挑战与本地部署测试方案

📅 发布时间:2026/9/2 16:32:59
视频生成模型复现艾姆斯错觉:几何一致性挑战与本地部署测试方案
这次我们聊一个反直觉的测试题目让视频生成模型去复现“艾姆斯错觉”。艾姆斯房间是很经典的视错觉它看起来是一个普通矩形房间但人在里面走动时身材会诡异地从房间一端走到另一端而“变大”或“缩小”。这类错觉依赖精确的透视结构、固定的观察点和稳定的相机参数。把这样的视觉测试抛给视频生成模型正好能暴露当前这类模型在几何认知、相机控制和时空一致性上的短板。本文不会停在“模型还不行”这个结论上。我会先拆解艾姆斯错觉的几何约束再结合本地部署视频生成模型的通用流程给出一个可执行的复现测试方案怎么准备输入素材、怎么设置提示词、怎么判断生成结果是否真的复现了错觉以及失败时应该检查哪些环节。适合正在研究视频生成质量、想测试开源视频模型上限或者在做视觉错觉相关内容的读者。核心结论先说从当前开源视频生成模型普遍依赖文本加潜在空间生成的方式来看纯提示词驱动的模型很难稳定复现艾姆斯错觉问题主要出在几何先验缺失、相机参数不可控和时间一致性不足。如果只是生成一段短的“房间有人走动”画面有概率碰对但要让整个视频保持错觉成立需要额外引入几何控制手段。1. 核心能力速览先把话题放到视频生成模型的大语境下给一个能力速览。以下都是通用判断具体到某个模型版本时需要以官方发布页和本机测试为准。维度说明项目类型AI 视频生成模型 视觉错觉复现能力测试常见开源模型方向Wan、CogVideoX、Mochi、LTX-Video、HunyuanVideo 等实际可用版本以官方仓库为准核心难点梯形透视保持、固定相机视点、人物尺寸连续变化、生成过程不“修正”房间本地部署工具ComfyUI 工作流、模型自带推理脚本、部分项目提供 WebUI 或 API 服务推荐硬件NVIDIA GPU显存需求随模型参数量与分辨率变化较大显存占用不确定需按模型版本和推理参数实测启动方式命令行 / ComfyUI 工作流 / 整合包批量任务可通过脚本或 ComfyUI API 批量提交但需要构建稳定的输入目录与输出目录适合场景视频生成质量评测、视觉错觉研究、3D 几何与生成模型交叉验证、内容创作测试这张表的核心信息是不要把“视频生成模型”当成一个能自动理解物理空间的渲染器。它本质上是一个基于海量训练数据的概率生成器艾姆斯错觉这种依赖精确几何结构的极端场景会明显暴露出模型对真实世界物理规则理解的不足。从当前社区围绕“视频生成模型本地部署”的热度来看已经有很多人开始把开源视频模型跑在本地。本地部署的好处是可以反复跑实验、控制参数、观察中间结果这正好适合做艾姆斯错觉这类“失败分析”型测试。你不需要依赖云服务可以自己构造测试集把生成结果一帧帧查看找出模型在哪个环节丢失了几何约束。2. 艾姆斯错觉的几何原理要理解为什么视频模型难复现先要把艾姆斯错觉的几何约束讲清楚。2.1 梯形房间与固定观察点艾姆斯房间通常不是真正意义上的矩形房间它的后墙一面很近、另一面很远天花板和地板都做了对应倾斜整体呈梯形或是不规则四边形。观察者通过房间上的窥视孔单目观察由于单目视觉丢失了一部分深度信息梯形房间在视网膜上形成的影响恰好和一个矩形房间的透视投影几乎一致。于是大脑会把房间“脑补”成普通矩形房间当一个人沿着倾斜地板从房间一端走到另一端时大脑仍然认为他是沿着水平地板走的因此他的高度变化就被解释成“这个人变大了或者变小了”。这里有一个很关键的条件观察点必须被固定在特定位置。窥视孔的作用相当于把相机放在一个确定的视点上一旦视点移动梯形房间的真实形状就会被识别出来错觉立刻消失。所以艾姆斯错觉是强绑定相机位置的。2.2 单目视觉下的透视欺骗单目视觉意味着我们只有一幅二维图像来判断三维空间。大脑判断房间是否方正主要依赖直线边缘、墙角接缝、地板纹理走向等线索。艾姆斯房间在构造时把天花板、地板、墙面的倾斜角度设计成让这些二维线索恰好指向“这是一个矩形房间”的解释。也就是说错觉成立的核心是二维画面中的几何线索必须自洽并且指向一个矩形房间的三维解释。哪怕有一条墙脚线画歪了大脑立刻会意识到“这个房间不太对”。视频生成模型要复现这种效果就必须让每一帧画面里的几何线索都保持同样精度的一致。2.3 错觉成立的三要素把上面内容整理下来艾姆斯错觉成立需要三个条件房间的墙角线、地板线、天花板线必须被精确绘制哪条线延伸到哪、角度多少都决定透视投影是否成立。观察点固定相机不能出现任何明显移动。单目深度线索也就是相机看到的二维画面必须与大脑预期的矩形房间解释完全兼容。用这样的标准去判断视频生成模型你会发现难度极高。视频模型需要在几十帧甚至几百帧画面里同时保持房间墙面的梯形结构不被悄悄修正成矩形相机不能出现大幅推拉或旋转人物在画面中的尺度变化要与梯形房间的透视关系一致不同帧之间亮度、边缘、纹理还要保持连续。这三条约束里第一条最反模型直觉。视频生成模型见过大量真实房间训练数据里绝大多数房间是矩形的所以生成模型有很强的先验倾向输出“正常房间”。艾姆斯房间恰好是“看起来正常但实际不正常”的对抗样本这就导致模型在采样时往往会把它拉回常见形态。从另一个角度看艾姆斯错觉也可以被理解成一种“相机内参和外参高度耦合”的场景。模型如果能显式控制相机参数才有机会精确复现而当前大多数文生视频模型实际上是通过文本和潜在特征去间接控制相机运动控制粒度远不够细。3. 视频生成模型为什么难复现视频生成模型难以复现艾姆斯错觉不是某一家开源模型的个别现象而是这类模型在架构目标和训练数据分布上共同导致的。下面拆成几个角度来看。3.1 几何先验缺失视频生成模型的训练目标是让生成画面在像素分布上接近真实视频。这个目标并不要求模型显式理解“这是一间梯形房间”“相机光轴与后墙夹角是多少度”。模型只是在大量自然视频中学习到了“什么样的画面序列更像真实世界”。对艾姆斯房间这种低频、特殊、需要精确计算的场景训练数据覆盖非常少模型很难形成可靠的先验。你可以在提示词里写“a trapezoidal room with slanted floor and ceiling camera fixed at a peephole”模型可能理解一部分语义但无法把它转成精确的 3D 几何参数。结果就是生成画面里房间被正常化人物尺度变化只是看起来有一点奇怪而不是严格符合梯形透视。更直接地说模型并不知道房间后墙的左边比右边远多少厘米它只是在“猜一个看起来合理的空间”。3.2 相机运动控制粒度不足视频生成模型对相机运动的控制通常依赖文本描述或一些运动相关的潜在空间操作。例如提示词里写“fixed camera static shot”模型可能会尝试保持画面静止但具体相机位置和朝向并没有真正的参数约束。艾姆斯错觉要求观察点严格固定相机位置哪怕偏移几厘米房间的真实形状就会暴露。更进一步图生视频模型虽然能参考输入首帧的构图但首帧依然是一个没有深度标签的二维图像。模型可以把人物生成得“变大变小”却不一定符合房间的透视投影规则。也就是说模型可能在画面中生成一个巨大的人物但房间的墙角线已经悄悄发生了透视错误导致整体画面看起来像是“人物被后期缩放”而不是“人物在错觉房间里走动”。3.3 时间一致性与“校正”问题视频模型在生成多帧时通常采用时空注意力机制来保持时间一致性。艾姆斯错觉是一个需要逐帧保持精确尺度的场景人物从远角走到近角其高度变化应当是连续且单调的。模型生成时可能在前几帧表现正确到了中后段出现矩形房间的“记忆扰动”把墙壁拉直导致错觉失效。这种“校正”通常表现为房间从梯形被拉成矩形人物边缘出现扭曲墙面纹理出现流动和闪烁相机发生意料之外的轻微推拉。从现有视频生成模型的常见失败案例来看越需要精确几何的空间关系越容易触发模型的“修复先验”。这本质上不是因为模型笨而是因为概率采样偏向常见分布。模型对自己见过的“普通房间”太有把握反而无法保留一个真实但少见的梯形结构。3.4 训练数据本身缺少“视错觉”样本即使某个开源视频生成模型参数量很大如果训练集中没有足够多的艾姆斯房间、透视房间、舞台布景类视频模型就相当于在被问到一道几乎没有见过的题。大数据集里真实梯形房间的比例极低而类似“人在普通矩形房间走动”的视频则数以百万计。因此模型优先输出正常矩形房间完全符合统计规律。这也解释了为什么图生视频比文生视频更容易接近目标如果首帧已经是一张标准的艾姆斯房间照片模型有了明确的构图约束生成后续帧时更有可能保持梯形结构。但首帧仍然会把模型“拉向矩形”的风险带到后续帧尤其是当人物运动幅度较大时。一旦模型决定“修正”房间后续帧的墙角和地板线就会开始漂移。4. 适用场景与使用边界这个测试适合谁正在做视频生成质量评测的技术人员可以把艾姆斯错觉作为几何保持能力的基准测试研究计算机视觉、视错觉、3D 重建交叉方向的学生想用开源视频模型做数字内容创作的作者需要理解模型的几何局限对 ComfyUI 工作流已经熟悉的用户想知道上手视频模型后第一个应该验证什么。但它不适合谁想“一句话生成完美艾姆斯房间视频”的用户。至少在当前开源视频模型水平下纯提示词很难稳定得到结果没有 NVIDIA GPU只想用 CPU 跑大型视频模型做实时实验的用户。CPU 推理不是不行但速度和体验会差很多需要严格物理正确的工业渲染。这种情况下应该用 Blender、Unity 或传统光线追踪而不是生成模型。使用边界也需要明确。测试时如果需要人物素材请确认肖像授权如果用网络下载的艾姆斯房间图片确认版权允许二次创作如果生成结果用于商业展示需要做效果复核。涉及人脸、声音、版权视频素材时始终遵循授权合规原则。错觉测试本身没有安全风险但生成模型可能在一些场景中产生意外内容建议把测试放在本地环境内完成不要用未经过滤的素材直接对外发布。这类几何测试还有一个容易被忽略的价值它可以帮助你判断一个视频模型是“真的理解空间”还是“只是把画面拼得好看”。如果一个模型在艾姆斯错觉上完全失控那它在普通场景中的空间一致性也可能存在隐患只是普通场景更容易被训练数据掩盖。5. 本地部署视频生成模型的环境准备要具体做艾姆斯错觉复现测试第一步是本地部署一个可用的视频生成模型。下面给出一套通用环境准备清单具体版本号以你选择的模型官方仓库为准不在这里写死。5.1 操作系统与驱动推荐在 Windows 11 或 LinuxUbuntu 22.04 是常见选择下进行。NVIDIA 显卡需要安装对应驱动驱动版本尽量选近期版本。是否需要额外安装 CUDA Toolkit取决于你选择的推理后端很多项目在安装 PyTorch 的 CUDA 版本时就已经解决了不需要手动安装整套 CUDA。检查 GPU 驱动是否可用在终端执行nvidia-smi如果能正常显示显卡型号和显存说明驱动已安装。接下来根据模型仓库的 requirements 安装对应 PyTorch。如果显示命令找不到就需要重新安装 NVIDIA 驱动。5.2 Python 与虚拟环境建议使用 Python 3.10 或 3.11。创建虚拟环境时不要把 Python 和依赖装到系统全局否则后续切换模型或卸载依赖会非常麻烦。python -m venv venv source venv/bin/activate # Linux/macOS # Windows 下使用 venv\Scripts\activate激活虚拟环境后后续所有pip install都只影响这个环境。5.3 磁盘与显存规划视频模型权重占用较大从几个 GB 到几十 GB 不等。推理过程还会产生中间缓存建议预留至少 50GB 到 100GB 可用磁盘空间。显存方面不同模型的体积差别很大必须按实际模型发布页确认。如果显存不足可以降低分辨率、减少帧数、改用序列化推理等方式缓解。在下载模型权重前先在官方仓库看两个地方README 里的 System Requirements以及示例命令里的默认分辨率。这两处信息基本能告诉你你的显卡大概能跑什么规格。5.4 推理框架选择常见的开源推理路线有三种模型官方仓库自带的推理脚本例如python scripts/inference.pyComfyUI 工作流通过自定义节点加载视频模型Gradio 或 WebUI 方便交互但可控性不如工作流。从复现艾姆斯错觉测试的角度看更推荐 ComfyUI 工作流或官方推理脚本因为你需要精确控制输入的首帧、提示词和采样参数。WebUI 适合随手玩玩但批量控制不如脚本直接。6. 安装部署与启动方式6.1 官方仓库命令行启动下面是通用模板实际目录和命令以模型官方仓库为准# 克隆项目仓库 git clone https://github.com/example/video-generation-model.git cd video-generation-model # 创建并激活虚拟环境 python -m venv venv source venv/bin/activate # 安装依赖 pip install -r requirements.txt # 下载模型权重放到指定目录 # 具体下载方式看仓库 README一般用 huggingface-cli 或 wget # 启动推理脚本 python scripts/inference.py --prompt ... --input_image ./inputs/ames_room.png如果模型提供 API 服务通常会有类似--port的参数。启动后本地会监听某个端口例如127.0.0.1:8080可以通过 HTTP 请求调用。需要注意不同项目的参数名可能不同有的是--input_image有的是--image_path先看官方示例再改。6.2 ComfyUI 启动方式ComfyUI 是本地部署视频模型常用的工作流工具。先启动 ComfyUI 本体git clone https://github.com/comfyanonymous/ComfyUI.git cd ComfyUI pip install -r requirements.txt python main.py启动后访问http://127.0.0.1:8188在页面里导入已经配置好的视频生成工作流。模型权重通常放到models/checkpoints、models/diffusion_models或models/vae目录具体名称要看工作流节点期望的路径。如果工作流提示找不到模型就检查文件是否放对目录以及文件名是否与节点配置完全一致。6.3 先跑通示例再替换输入很多初学者上来就用自己的图片和提示词结果工作流报错分不清是模型问题还是用法问题。正确的做法是先用模型自带的示例图片、示例 prompt把整套流程跑通确认视频能够生成再换成艾姆斯房间测试素材。跑通示例的过程也能确认模型权重、 VAE、文字编码器这些组件是否完整。6.4 端口冲突处理如果启动时提示端口被占用可以换端口python main.py --port 8189然后访问http://127.0.0.1:8189。如果是通过 API 提交任务记得把请求地址里的端口也改成新端口。7. 艾姆斯错觉复现测试判断标准与验证流程这里给出一个可重复的测试流程。你可以用自己拍摄或手工搭建的艾姆斯房间模型作为首帧素材注意不要使用未授权的人脸或商业视频片段。7.1 输入素材准备标准测试输入是一张从“窥视孔”视角拍摄的艾姆斯房间照片画面中最好没有人或者只有一个人站在固定位置。这样首帧的几何结构是明确的后面模型生成的是人物走动和尺寸变化。如果自己搭艾姆斯房间可以用纸板裁出梯形地板、天花板和墙壁从侧面切一个观察孔用手机固定在这个孔的位置拍摄。素材越规范越容易判断模型是否理解错觉结构。如果直接用网上下载的艾姆斯房间图片尽量选择高清、正视角、画面中心没有多余物体的图片避免透视角度被裁切。7.2 提示词设计推荐用偏描述性的提示词而不是抽象概念。例如A person walking across a strange room, the room appears rectangular but is actually trapezoidal, the person seems to grow larger as they walk from left to right, fixed camera at a peephole, realistic indoor lighting, continuous shot如果模型支持图生视频第一帧放艾姆斯房间照片prompt 强调“人员从左走到右尺寸明显变化房间结构保持不变相机固定”。词里最好同时出现“fixed camera”“trapezoidal room”“person grows larger”。注意提示词不要太长重点信息放在前面因为部分模型对长提示词的尾段关注度不高。7.3 采样参数建议分辨率先低后高例如 480p 或 720p 测试帧数5 到 8 秒短视频太多帧会增加显存压力采样步数先从模型推荐的默认步数开始批次一次生成 4 组对比成功率。这些参数不是为了最终效果而是为了判断模型是否具备基本复现能力。跑通后再逐步提高分辨率。如果低分辨率下模型都无法保持房间的梯形结构高分辨率通常只会让问题更明显。7.4 评估维度判断是否成功可以按下面几个维度打分评估维度成功表现失败表现房间形状保持整个视频中房间都保持梯形透视墙壁被拉直成矩形房间人物尺寸变化从一端走到另一端时身高连续变化身高变化突然或发生形变相机稳定性画面无明显推拉、旋转相机自动靠近或旋转背景纹理稳定地板、天花板接缝不发生漂移背景线框出现流动或闪烁人体自然度人物动作自然可辨认肢体扭曲明显脸部变形如果五次生成里至少有三次的“房间形状保持”达到可用水平说明这个模型有潜力如果所有结果都把房间拉成矩形那基本可以判定该模型缺少复现艾姆斯错觉的几何先验。这里建议把每次生成视频都保存下来截取关键帧按评估维度做一次人工打分。7.5 常见失败的成因与前几步排查失败不一定都怪模型。先确认输入首帧是否清晰、是否真的是标准的艾姆斯房间视角。如果首帧本身就是普通矩形房间的截图那模型没有任何机会生成错觉。再确认提示词里是否写入了“fixed camera”“trapezoidal”等关键约束。最后再看采样步数和分辨率过低的分辨率可能导致边缘信息丢失。如果以上都没问题而结果仍然失败那可以认为这是模型自身的几何理解上限与测试者操作无关。这时候可以换一个参数量更大的模型或者引入深度图控制去验证是否能有改善。8. 批量测试与 API 集成思路艾姆斯错觉测试不应该只做一组建议做成批量任务用多样化输入提升结论的可信度。8.1 批量输入组织把输入图片按目录组织每种参数组合放一个子目录inputs/ ames_01_left_enter/ ames_02_right_enter/ ames_03_sitting/ ames_04_high_contrast/输出目录也对应创建方便后期评估。批量任务的核心不是“跑得多”而是“失败案例可以回溯”。因此每个任务的日志都应该包含 prompt、模型版本、采样步数、分辨率、随机种子和帧数。后期复盘时可以快速定位到“这个失败是因为分辨率太高还是因为 prompt 里少了 fixed camera”。8.2 ComfyUI API 方式ComfyUI 支持通过 API 提交工作流。先通过/prompt接口提交 JSON再轮询/history获取结果。下面是一个通用示例具体节点 ID 和参数需要按你的工作流修改import requests import json server http://127.0.0.1:8188 workflow { prompt: { 1: { class_type: CheckpointLoaderSimple, inputs: {ckpt_name: your_model.safetensors} } } } resp requests.post(f{server}/prompt, jsonworkflow) print(resp.json())实际使用时需要先在工作流里通过“导出 API 格式”获取节点结构再改输入图片路径和 prompt 文本。这样批量任务就变成脚本化任务可以写一个 Python 脚本循环读取inputs目录下的图片逐个提交任务并记录返回的任务 ID。8.3 失败重试与参数扫描批量测试时可以固定 prompt只扫描随机种子也可以固定种子扫描不同的 prompt 长度和帧数。失败任务建议记录失败原因例如显存不足、生成结果为空、人物扭曲等。重试时先降低分辨率减少帧数等跑通后再逐渐增加。如果模型本身支持不同的采样器也可以用固定参数扫描多个采样器观察哪种采样器对几何保持更友好。这类实验跑完后你会对模型的“性格”有比较清楚的认识而不只是看过几个示例视频。9. 资源占用与推理优化观察视频模型的推理资源占用通常比图像模型高一个量级。不建议在拿到模型前先把显存预期“填满”更合理的做法是先用小分辨率测试得出基准。9.1 显存观察方法在 Windows 上可以用任务管理器在 Linux 上用watch -n 1 nvidia-smi。更准确的做法是看推理终端输出很多框架会打印峰值显存。如果模型在加载权重后就接近显存上限那么生成过程大概率会 OOM。watch -n 1 nvidia-smi观察时要区分三个阶段的显存占用模型加载阶段、文本编码阶段、视频去噪采样阶段。后者的显存占用往往最高也是 OOM 最容易出现的阶段。9.2 影响资源消耗的因素分辨率分辨率越高显存和耗时增长越明显帧数帧数增加对显存影响小于分辨率但会显著增加推理时间采样步数步数越大耗时越长批次大小增大 batch 会线性增加显存压力文本编码器分支较长的 prompt 也会略微增加显存消耗。在做艾姆斯错觉测试时先用单人、5 秒、480p 的参数跑出一组基准数据再根据显存使用情况决定是否提升到 720p。9.3 降低显存占用的通用手段使用模型支持的 split 或 offload 推理模式在 ComfyUI 里开启低显存优化选项降低分辨率到 480p减少视频帧数例如先用 3 到 4 秒测试关闭无关的后台程序释放系统内存。这些操作的具体效果因模型而异建议每次只调整一个变量否则无法判断是哪个改动起了作用。如果你发现某个模型在 480p 下能跑但在 720p 下爆显存那说明该模型的高分辨率推理需要更激进的 offload 策略或者你的显卡不适合跑这个分辨率。10. 常见问题与排查方法问题现象可能原因排查方式解决方案启动时提示 CUDA 不可用PyTorch 版本与 CUDA 驱动不匹配终端执行python -c import torch; print(torch.cuda.is_available())重新安装对应 CUDA 版本的 PyTorch加载模型时 OOM显存不足查看 nvidia-smi 和推理日志降低分辨率、帧数、步数使用 offload生成视频画面剧烈闪烁时间一致性差常见于长视频减少帧数增加帧间重叠改用更稳定的采样器或降低运动幅度房间被拉成矩形模型几何先验过强提示词约束不足检查 prompt 是否包含“trapezoidal room”“fixed camera”换用图生视频首帧输入标准艾姆斯房间图片人物尺寸没有变化模型没有理解尺度变化检查 prompt 是否指定“grow larger/smaller”增加“person grows larger as walking”等说明换更强控制插件权重下载失败网络或代理问题查看下载工具日志使用镜像或离线导入具体方式参考模型仓库端口被占用本地服务冲突使用netstat -ano或ss -lntp查看更换启动端口批量任务跑到一半卡死显存不足或资源竞争查看日志最后一条记录减小 batch增加重试机制这里的排查思路不仅适用于艾姆斯错觉测试也适用于大多数本地视频生成模型。凡是遇到“生成结果很怪”的情况先检查输入素材、prompt 和参数再怀疑模型本身。很多时候问题出在模型权重文件损坏或版本不匹配。11. 最佳实践与改进方向11.1 先建立最小可运行配置每个模型第一次部署成功后立刻保存一套最小可运行配置一张测试图、一个 prompt、一组采样参数、一份工作流 JSON。后面做任何修改都基于这个基线出现问题可以马上回退。这样可以避免把不同模型的参数混在一起。11.2 把艾姆斯错觉当成“几何压力测试”建议后续把艾姆斯错觉测试纳入视频生成模型的本地评测清单。它可以快速暴露模型在空间关系上的弱点比笼统看“视频流畅度”更有判断价值。做法很轻只需要一张艾姆斯房间图片、一个固定 prompt、一组 batch。多测几个模型后你就能横向对比出不同模型在空间理解上的差距。11.3 引入外部控制方式如果纯文本控制不足以复现错觉可以考虑引入 ControlNet、多视图扩散或者深度图条件输入。原理是通过深度图或边缘图把房间的梯形结构显式传给模型降低模型自由发挥的空间。这类方案需要额外节点和模型权重但代价是可控性提升明显。在艾姆斯错觉场景里深度图控制尤其有价值。因为模型真正缺失的是对“墙面远离观察者”这一空间关系的理解把深度图作为一个输入通道相当于直接告诉模型每个像素的远近关系。11.4 合规与隐私习惯测试素材尽量使用自己搭建的场景或已经授权可再创作的图片。人物素材要获得肖像授权不要直接拿他人照片做生成测试。批量生成结果建议先在本地筛选再发布避免不经复核就对外输出。这个习惯不仅适用于艾姆斯错觉测试做任何生成类实验都建议遵守。12. 总结与后续验证艾姆斯错觉对视频生成模型的挑战本质上不是“模型不会生成人物”而是“模型不会精确保持几何结构”。梯形房间的透视约束、固定相机、连续尺寸变化这三个条件叠加起来会让大多数概率生成模型暴露先验不足的问题。如果你准备做这个测试第一步先用图生视频输入标准艾姆斯房间照片关注房间是否会被拉直。第二步再尝试提示词控制看能否在不换输入图片的前提下保持错觉。第三步引入深度图控制或更细的相机控制工作流对比效果差异。最容易踩的坑是首帧没选好模型就算有能力也救不回来提示词只写“Ames room”而不写几何结构模型大概率生成一个带名字标签的普通房间直接上高分辨率长视频显存爆掉后误判模型不能跑。这个测试的价值并不仅仅在于“判断模型行不行”它也是一套很好的视频生成模型评测方法。后面如果再出现新的开源视频模型先跑一遍艾姆斯错觉测试你就能快速判断它在几何感知上有没有实质进步。建议把测试素材和评估表格保存好下次评估模型时可以直接复用。