← 首页|学术|GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents
GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents
arXiv ↗
cs.CV / cs.AI / cs.HC 2604.07429

GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents

Mingyu Ouyang*, Siyuan Hu*, Kevin Qinghong Lin, Hwee Tou Ng, Mike Zheng Shou (NUS Show Lab + Oxford)
arXiv 2604.07429 · 8 Apr 2026 · ECCV 2026
💬  34 个浏览器游戏、170 任务的游戏 agent 基准:gameAPI 状态直接判分(零感知噪声)+ CUA/Generalist 双接口统一运行时;最好 agent PG 41.9 远低于人类熟手 82.6;暂停/RT 双模式把时延单独隔离成一个测量维度。

🎯 问题

游戏 agent 评测被三件事卡住:动作接口异构、推理时延与决策质量耦合、判分靠 OCR/VLM-as-judge 有噪声不可复现。

同一个屏幕点击在不同模型 API 里是不同的 tool call 形态,抽象层级也不同(有的输出原始键鼠、有的输出高层语义动作),导致跨模型不可比。实时游戏里暂停两秒角色已坠落,分数混入响应速度。现有基准(LMGame-Bench、BALROG、VideoGameBench、Orak 等)大多依赖启发式或 VLM 判分,结果难验证、难诊断。

GameWorld 的回应:(i) 统一控制空间——一切动作归一化为原子人机交互事件(mouse_move/mouse_down/mouse_up/key_down/key_up/scroll/wait);(ii) 沙箱默认在推理期间冻结游戏,把时延从测量中剥离,另设 GameWorld-RT 变体单独测时延耦合;(iii) 判分完全来自序列化 gameAPI 状态(34 游戏共 233 个状态字段),progress = clip[(q_max−b)/(τ−b)] 确定性计算。与同期 GameVerse 共享双动作空间思路,但 GameVerse 仍用 VLM 量化进度,GameWorld 的差异化正是判分确定性。

🔧 方法

CUA 输出低层键鼠、Generalist 输出语义动作经确定性 Semantic Action Parsing 落到同一原子事件空间;每步强制恰好一个动作,同一运行时同一验证器。

CUA 接口:模型直接给 left_click(x,y)、press_key(key) 等,自己负责像素级 grounding,最接近人类玩法、对时延最敏感。Generalist 接口:逐游戏定义语义动作(move_forward()、action_jump() 等),确定性解析器映射为固定低层指令,消除解析侧随机性。两接口都执行 Action Atomicity:每步一个交互指令,禁止把多个语义决策打包成宏。18 个模型-接口对(10 Generalist + 8 CUA),各家用原生 function calling 接入。

Agent harness 四组件全模型统一:结构化 prompt(#Game Rules/#Role and Controls/#Task Instruction/#Output Format 四段固定模板)、rolling memory(近 N 轮 user_prompt→screenshot→reasoning→action 作为 Action History)、推理(允许模型自带 thinking,但注意 4.5.1 显示长推理时延在 RT 下有代价)、定制 function calling(各 provider 原生接口注册工具)。评分:SR∈{0,1} 按任务目标 τ 判定;Progress 归一化最佳进度,reset-on-fail 时清 episode 局部分数但保留 run 级最佳。人类对照同样限 100 个原子动作预算。

📊 结果

最好 agent Gemini-3-Flash(Generalist)SR 21.2 / PG 41.9;人类新手 55.3/64.1、熟手 77.1/82.6——最强模型不及新手一半。

Generalist 前三:Gemini-3-Flash-Preview 41.9、GPT-5.2 40.6、Claude-Sonnet-4.6 39.3(PG)。CUA 最好 Seed-1.8 39.8。SR 全体只有 12.4–21.2%,但 PG 30–42%:模型普遍能推进但不能完成。类型层面 Runner 进度最高,Simulation 全线低迷。10 次全基准重跑(Qwen3-VL 30B/235B × 双接口)PG 标准差 0.5–1.1、SR 0.7–1.4,聚合结论可复现;方差集中在 Hextris/Cubefield/Wordle 等控制敏感游戏。

五级能力课程:L1 基础控制与时机接地、L2 System-1 反应控制、L3 System-2 空间导航、L4 符号推理策略、L5 开放世界协调。双接口画像一致:L4/L2 强、L1/L5 塌——MLLM 会下棋但掐不准发球时机,长程协调是另一深谷。记忆轮数消融(235B):Generalist 0→2 轮 PG 30.0→30.6 微升,CUA 30.3→28.7 下降且 7.2→12.8 s/step——低层动作历史无语义、越长越干扰,记忆是选择性收益不是通用增益。动作有效率:IAR 全体均值 0.8%(NTC 0.8 + OOS 0.0),语义解析层把格式失败从测量里剥离得很干净;GLM-4.6V 例外 8.3%。

⏱️ GameWorld-RT

RT 变体推理期间游戏照跑,时延成为任务一部分;只测了 Qwen3-VL 两个底座,作者明确警告 RT 与暂停分数不可直接比。

Table 8:235B CUA 6.2 s/step、SR 17.1 / PG 33.2;30B CUA 2.4 s/step、SR 15.6 / PG 33.0(Generalist 类似)。小模型快 2.6 倍没换来更高分——单纯更快的反应解不了这个基准。作者定位:暂停模式隔离决策质量,RT 模式贴近部署现实(推理速度、正确性、动作时机耦合),两者互补。

关键引用纪律:235B CUA 的 RT SR 17.1 高于同模型暂停模式 14.1,这不是'实时更容易'——RT 下同样 100 动作预算的有效游戏时长更长(推理时间也计入游戏时间),属于动作预算混淆,作者原文明确 'results on GameWorld-RT should not be compared directly with those on the default paused benchmark'。任何拿 GameWorld 数字论证'实时更差/更好'都不成立;它提供的是双端点而非阶梯,时延-成败关系本身没有被扫描。Flappy Bird 案例:连续帧几乎一样而正确动作在 wait/flap 间交替,视觉上微小的时机误差机制上是决定性的。

💡 对主线的启示

duplex-omni-actor 的主实验载体:暂停/RT 是额定速度协议的两个端点,我们的调速阶梯把二值对照拉成受控扫描。

三点直接用途:① 34 游戏×170 任务的游戏阶梯 + state-verifiable 判分是现成实验底座;② RT/暂停对照存在但作者自认不可比,'把动作预算混淆做成受控变量'正是我们的空白;③ 语义接口 0.8% 无效动作率证明确定性解析层能保证动作通道纯度,可直接用于流式模型接入契约。

局限即机会:RT 只有 2 个开源底座、没有 API 模型、没有时延-性能曲线;语义动作集逐游戏手工设计(作者自己列为 future work);人类对照仅 2 人。对照阅读:VideoGameBench(商业游戏实时全线≈0%,难度地板压扁对照——GameWorld 游戏更轻量所以暂停可过关、对照有分辨率)、RealtimeGym(token 计价时钟 vs 这里的墙钟)、TickingCollabBench(Minecraft 多智能体的 Sync/Async 二值对照)。

🏷 关键词

game agentsbenchmarkstate-verifiable evaluationcomputer-use agentssemantic action parsingreal-time interactionGameWorld-RTbrowser games