PlayWorld:面向长时序目标的智能体交互世界模型评测基准

发布时间:2026/8/15 10:44:00
PlayWorld:面向长时序目标的智能体交互世界模型评测基准 PlayWorld面向长时序目标的智能体交互世界模型评测基准arXiv:2608.13552v1摘要视频世界模型能够基于当前观测与用户动作推演环境未来状态现有方案已在长视频画面一致性、动作可控性上取得亮眼效果。但针对交互式世界模型的公平横向对比始终存在难点人类评测者通常以长时序全局目标为导向与模型交互例如360度环绕观察环境、走入水体查看波纹反馈而不同模型完成同一目标所需动作序列差异极大固定动作轨迹评测方案无法实现公平对比。为解决该痛点本文提出基于多模态交互智能体Agent Player的评测范式并构建PlayWorld评测基准基准包含171个人工标注交互场景每个场景定义明确的长时序完成目标。评测体系从四大核心维度量化模型能力几何一致性、交互保真度、遮挡状态演化、连续场景推演同时配套视频画质、动作可控性基础指标。本文在9款主流世界模型上完成大规模对照实验结果表明当前模型在长时序交互任务上仍存在明显缺陷空间一致性、持续状态演化两大模块可靠性不足。全部数据集、评测代码已开源可访问项目主页获取。1 引言通用视频生成模型在画面真实感、视觉效果上飞速发展而交互式视频世界模型更进一步可根据用户操作持续推演动态环境实现开放式自由探索。这类模型具备仿真物理、空间时序因果一致性的核心能力拥有巨大应用潜力。现有评测方案核心缺陷现有视频评测基准VBench等仅评估美学、时序连贯、文本对齐不校验动作响应逻辑专门面向世界模型的评测集WorldScore、WorldMark等虽覆盖三维几何、记忆一致性、遮挡演化但全部采用预定义固定动作轨迹完成评测存在三大致命问题模型动作粒度不一致相同指令在不同模型中位移/旋转幅度差异巨大固定轨迹无法让所有模型抵达同一观测状态得分失去横向对比意义复杂目标无法适配环绕雕塑、长距离折返等复杂长时序任务固定动作无法自适应调整时长、终止时机闭源网页模型难以自动化评测Genie 3、HappyOyster等产品仅提供网页交互入口人工评测成本高、主观偏差大。本文核心方案 PlayWorld本文设计交互智能体Agent Player模拟人类玩家行为搭建闭环自适应评测流程每个场景提供统一基础动作序列作为初始参考智能体逐帧观测生成画面与历史操作动态执行「继续/提前停止/延长时长/修正动作/终止任务」五类自适应决策同一全局目标下适配各模型动作特性保证跨模型公平对比配套VQA自动打分校验体系覆盖四大核心能力支持10–60秒长时序交互视频自动化评测。基准包含171个人工标注场景在9款主流世界模型完成完整实验精准定位当前方案能力边界。2 相关工作2.1 交互式世界模型分为三大应用赛道自动驾驶世界模型GAIA-1、DriveDreamer等预测车辆、交通场景动态用于仿真与规划机器人仿真世界模型IRASim、Cosmos、RoboScape等基于动作生成视觉观测支撑机器人训练通用开放式交互世界模型输入WASD/鼠标/文本指令持续生成环境分为开源Matrix-Game、LingBot-World、SANA-WM、混元GameCraft等、网页闭源Genie3、HappyOyster两大类。2.2 现有世界模型评测基准对比评测基准输入形式闭环自适应交互长时序折返验证几何一致性状态演化(可见遮挡)交互保真度视频时长WorldScore文本图像动作××✓××2–10sWorldMark图像动作×部分✓××20/40/60sWBench文本图像动作×部分✓部分✓10–45sWorldRoamBench图像动作×部分✓部分✓10–60sMemoBench文本图像动作××✓✓×4–6sOmni-WorldBench文本图像动作××部分✓✓3–6sPlayWorld(本文)文本图像全局目标✓✓✓✓✓10–60s现有方案全部依赖固定预设动作序列无法根据画面实时调整操作模型动作粒度差异会导致评测结果失效PlayWorld首创全局目标自适应智能体闭环评测解决该核心痛点。3 PlayWorld 整体框架PlayWorld由自适应交互智能体Agent Player、171场景评测数据集、VQA多维度自动打分器、基础画质可控性指标四大模块组成完整模拟人类玩家评测世界模型的真实流程。3.1 交互智能体 Agent Player智能体由多模态大模型Claude/Gemini网页/本地适配交互接口构成形成观测-决策-执行闭环。3.1.1 智能体决策逻辑不采用从零规划全轨迹延迟高、跨模型差异大统一提供人工标注基础动作序列作为全局参考每一步观测画面、历史操作、场景描述、目标后执行5类决策Keep维持当前规划动作正常执行Stop视觉目标已达成提前终止当前操作Extend画面未抵达目标延长动作持续时间Correct观测状态偏离预期修改/跳过后续动作End完整达成长时序全局目标终止本轮评测。特殊规则交互保真度碰撞类场景抵达障碍物后不触发End持续前进检验穿透/碰撞物理效果。3.1.2 交互执行接口统一将WASD、视角旋转、等待指令转换为对应模型原生输入本地开源模型代码批量调用生成切片网页闭源模型浏览器自动化驱动页面、捕获渲染帧交互上限40轮操作生成10–60秒交互视频后结束。3.2 PlayWorld 评测数据集构建与组成数据集搭建流程素材来源Pexels、谷歌免费图库覆盖自然、城市、幻想三大场景包含人物、动物、车辆多类主体区分第一/第三人称视角场景标注Gemini生成场景描述后人工修正定义长时序可观测全局目标基础动作序列VQA打分模板为每个场景定制专项是非问题绑定四大评测维度人工校验确保目标可观测、无歧义适配自动化打分。数据集规模171个人工标注交互场景50种标准动作组合9款模型全量生成1400交互视频配套820条维度专项VQA打分问题四大评测维度场景分类几何一致性360°环绕、雕塑定点观察等地标留存任务交互保真度走入水体、翻越悬崖、穿过植被等物理交互遮挡演化物体移出画面后持续变化折返查看状态连续推演固定镜头长时间观察60秒持续动态排队、烹饪。3.3 VQA 多维度自动打分校验器采用Gemini 3.1 Pro作为视觉打分器对每条交互视频执行维度专项是非判断加权聚合后输出1–5分越高越好打分前增加轨迹有效性前置校验无效轨迹直接置最低分1。维度1几何一致性前置校验轨迹有效性是否完成环绕/折返视角打分VQA两项核心场景身份一致性物体纹理、颜色、数量、形状环绕后不变空间相对一致性物体左右、远近全局拓扑不崩坏。维度2交互保真度前置校验主体可达性模型是否响应动作、抵达交互区域打分VQA三项核心碰撞接触实体不会穿墙、穿地形运动因果行走无浮空、入水产生波纹/深度变化视觉反馈交互匹配真实物理视觉效果。维度3遮挡状态演化前置校验目标完成移出画面折返动作打分VQA三项核心重现一致性遮挡后物体返回身份不变隐藏演化看不见时持续推进变化绘画、倒水物理因果遮挡阶段变化逻辑自洽。维度4连续推演无镜头移动无需前置校验固定镜头长时间观测三项VQA主体状态持续演进食物逐步消耗、排队前移运动物理合理无卡顿重置、突兀跳转环境无无关随机突变。3.4 基础能力评测指标补充底层视频质量、动作可控性指标全部归一化为百分比视频画质指标VBench、MemoBench等标准画面美学、成像清晰度、运动平滑度、画面闪烁、时序一致性、深度稳定性、主体一致性动作可控性指标基于VGGT相机位姿估算平移通过率相机位移误差低于阈值判定合格旋转通过率相机旋转角度误差低于45°判定合格综合基础能力得分9项指标排名均值转换为百分比。4 实验设置与结果4.1 评测模型与统一实验协议参与评测9款世界模型网页闭源浏览器自动化评测Genie 3、HappyOyster、LingBot-World、LingBot-World2、HY-World2本地开源批量切片生成SANA-WM、混元GameCraft-2、HY-WorldPlay、Matrix-Game-3.0统一实验规则全部场景共享初始图、全局目标、基础动作序列由同一Agent Player自适应交互分别执行VQA四维打分、基础画质可控性指标。轨迹校验不通过则该维度强制得1分整体得分为四维平均分。全模型四维VQA总分1–5分加粗最优、下划线第二模型几何一致性交互保真度遮挡演化连续推演综合平均分闭源模型Genie 32.742.401.811.512.12HappyOyster2.542.151.541.471.92开源模型LingBot-World2.112.231.431.331.78LingBot-World22.042.131.161.951.82HY-World22.142.061.091.131.61SANA-WM1.721.891.161.131.48混元GameCraft-21.621.521.311.211.42HY-WorldPlay1.121.631.081.011.21Matrix-Game-3.01.301.251.001.001.14轨迹校验通过率仅前三维度需要校验取均值为整体通过率模型几何一致性交互保真度遮挡演化整体均值Genie 377.1%93.5%90.7%87.1%HappyOyster63.8%93.5%81.4%79.6%LingBot-World58.3%76.0%83.7%72.7%LingBot-World258.3%85.1%93.0%78.8%HY-World247.9%70.0%37.2%51.7%SANA-WM62.5%88.0%90.7%80.4%混元GameCraft-225.0%78.0%81.4%61.5%HY-WorldPlay14.6%80.0%30.2%41.6%Matrix-Game-3.037.5%88.0%79.1%68.2%基础能力全量表全部百分比加粗最优模型美学成像运动平滑抗闪烁时序一致深度稳定主体一致平移通过率旋转通过率综合基础分Genie352.0075.2299.0097.7998.6488.7085.6064.150.672.2HappyOyster49.6673.6699.4699.0299.5291.8088.4058.048.576.4LingBot-World51.1272.0497.9696.2798.0292.283.564.844.751.4LingBot-World251.4773.9897.8495.6496.8891.482.367.945.650.0HY-World247.4367.7999.1299.4691.1790.789.840.842.245.8SANA-WM51.7572.5998.9296.4898.284.485.978.642.256.9混元GameCraft-250.1467.8298.2595.2497.9790.483.789.629.440.3HY-WorldPlay47.7161.5398.8995.1895.459187.475.844.238.9Matrix-Game3.044.1066.0398.9096.9295.2387.365.742.427.718.14.2 交互智能体消融实验对比三种交互控制策略验证「预设基础序列在线自适应修正」最优Preset Only完全固定动作无自适应Agent Only完全从零规划所有操作Preset Agent基础序列为参考智能实时修正本文方案策略消融结果Genie3 / HappyOyster策略轨迹得分↑人类偏好↑多数一致性智能修正动作占比Genie3-Preset Only0.9239.6%88.0%0.0%Genie3-Agent Only0.8829.2%84.0%100.0%Genie3-PresetAgent1.0865.6%86.0%12.0%HappyOyster-Preset Only1.0040.8%76.0%0.0%HappyOyster-Agent Only0.6824.4%92.0%14.9%HappyOyster-PresetAgent1.1267.4%84.0%14.9%结论本文自适应方案轨迹完成度、人类主观偏好全面领先仅10%–15%动作需要修正计算开销可控。智能体模型选型消融统一PresetAgent| 多模态模型 | 轨迹得分↑ | 人类偏好↑ | 多数一致 | 修正占比 | 单次推理延迟↓ ||—|—|—|—|—|| Claude Haiku | 1.08 |57.8%| 88.9% | 12.0% |3.83s|| Claude Sonnet |1.24| 45.3% | 94.1% | 12.4% | 6.21s || Gemini3.1 Pro | 1.08 | 46.5% | 94.1% | 12.6% | 4.36s |综合速度与效果全文实验统一采用Claude Haiku作为交互智能体。4.3 模型核心缺陷观测长时序持续演化是通用瓶颈遮挡演化、连续推演维度全模型得分最低模型仅能处理短时间可见画面无法长期维持物体隐藏/缓慢变化的因果状态环绕后地标重复生成、遮挡物体消失不恢复为高频错误。全局空间一致性缺失单帧视觉真实但长距离环绕后物体相对位置崩坏模型仅依赖局部时序平滑缺少全局3D空间记忆。复杂交互物理失效简单碰撞可识别入水、攀爬、地形交互等复杂反馈大量缺失第一人称模型更容易穿透实体。轨迹能力≠世界建模能力SANA-WM轨迹通过率高但四维VQA打分偏低能完成移动但空间、记忆推演存在严重缺陷基础画质指标优秀不代表长时序交互能力强。4.4 人类主观验证实验11名标注者完成600组盲测成对对比全部模型匿名仅展示同任务生成视频斯皮尔曼相关系数整体ρ0.933四大维度最低ρ0.745VQA自动打分与人类主观高度匹配打分一致性总体Fleiss κ0.43495.8%对比中至少3名评审达成统一判断证明评测体系可靠。5 结论本文提出PlayWorld交互式世界模型评测基准核心创新为模拟人类玩家的自适应多模态交互智能体解决固定动作无法公平横向对比的行业痛点。基准包含171个人工标注长时序交互场景配套四维VQA自动打分体系与底层画质可控性指标在9款主流闭源/开源世界模型完成完整大规模评测系统揭示当前方案在空间一致性、长时序状态演化上的核心短板。全部数据集、交互代码、评测脚本开源可用于后续世界模型标准化对比。附录A 实现细节A.1 闭环交互流程每个场景统一初始图、全局目标、基础动作序列Claude Haiku作为智能体单次交互最多40轮操作输出10–60秒视频智能体五分类决策循环执行。A.2 模型部署区分网页模型浏览器自动化API驱动本地开源分块批量生成适配模型原生推理接口HY-World2仅支持全局全景输入部分场景无法评测混元GameCraft无空等待指令长静态观测场景受限。A.3 VQA打分计算Rd∑wjaj∑wj,Sd14RdR_{d}\frac{\sum w_{j}a_{j}}{\sum w_{j}},\quad S_{d}14R_{d}Rd​∑wj​∑wj​aj​​,Sd​14Rd​aja_jaj​为0/1是非结果关键问题权重2普通权重1无关0最终维度得分1–5。输入双分辨率视频网格给Gemini兼顾全局时序与局部细节。A.4 相机位姿计算VG提取均匀采样帧相机位姿平移误差0.3、旋转误差45°判定轨迹合格。附录B VQA打分鲁棒性同一视频两次独立打分样本方差均值仅0.0112单次打分即可稳定输出整体排名预算充足建议多次取平均降低波动。附录C 网页模型交互接口实现无统一推理API采用自动化浏览器登录、输入场景、生成捕获、记录全流程存储任务ID、初始画面、动作序列、智能决策、完整视频用于复现附带喷泉场景完整浏览器执行截图示例。附录D 人工标注与人类评测协议数据集标注流程素材筛选→场景描述修正→全局目标动作编写→VQA问题定制人类盲测5名评审120组视频两两对比匿名无模型标识一致性指标整体多数一致95.8%各维度κ值均为正向自动指标可有效复现人类偏好。资源下载地址项目主页数据集、代码、演示、排行榜https://kxding.github.io/project/PlayWorld/arXiv原文页面https://arxiv.org/html/2608.13552v1开源协议CC BY-NC-SA 4.0

相关新闻