🕹️ 设置
10 款 GB/DOS 商业游戏(7 公开+3 保密),VG-Agent 只拿原始帧+高层目标;实时模式下思考期间模拟器照常跑。
严格反 scaffold 规则:禁止读游戏状态、禁止视觉覆盖层(如已访问位置地图)、禁止人工干预——与 Gemini Plays Pokemon 的游戏专用工具+多次人工调 prompt 形成对照(作者把游戏专用 scaffold 定位为上界)。GB 每步最新帧,DOS 给 5 帧(0.1s 间隔)。另有 13 款 dev 游戏与练习小游戏(鼠标移动/导航)。
进度追踪机制:从带章节时间戳的 YouTube 攻略抓关键帧 → perceptual hash + Hamming 距离阈值实时比对每一帧 → 按最远到达 checkpoint 的攻略时间戳折算完成百分比。类似 speedrun 社区的帧匹配。作者手工复核:agent 确实没走出每个游戏的最开头。反泄漏:保密测试游戏 + dev/test 划分,但作者承认攻略信息可能已进语料。
📊 结果
实时最好 0.48%(Gemini 2.5 Pro / Claude 3.7 并列),Lite(推理时暂停)1.6%;全部模型困在游戏最开头。
失败机制的教科书描述:VLM 响应太慢,动作返回时游戏状态已大变,选好的动作已经过期(stale);带多帧历史+思考历史的 agent 处理更慢、问题更重。Lite 把模拟器在推理期间暂停(退化成 Gym 式回合制)后所有模型定性定量都明显变好——但仍近零(Doom II 连第一个 checkpoint 都到不了)。
评测模型:GPT-4o、Claude 3.7 Sonnet、Gemini 2.5 Pro、Gemini 2.0 Flash、Llama 4 Maverick、Qwen2.5-VL 7B/32B,温度 0.7。预算限制每游戏一次 run,方差研究(3 游戏×Gemini 2.5 Pro)显示设置内方差小。'0%'的解释:checkpoint 粒度粗,0% 不代表完全没动——作者手工补了细粒度分析(附录),结论不变。
💡 对主线的启示
回合制 VLM 的实时地板线;引用必须带'难度地板压扁对照'的 nuance——0.48% vs 1.6% 分辨不出时延的真实代价。
商业游戏太难,实时/暂停对照被地板压扁——反衬 GameWorld 用轻量浏览器游戏让暂停模式可过关(PG 30-42%),对照才有分辨率。可引的定性观察:stale action 描述是'世界不等模型'失败模式的原型;'inference latency is a major limitation' 是来自回合制阵营的时延证词。
可复用工程件:YouTube 攻略 hash 判分(零 instrument 的进度度量,适合无法读内部状态的商业游戏载体);保密测试集+严格 scaffold 规则的反泄漏设计。对照阅读:GameWorld(状态判分+可分辨对照)、RealtimeGym(token 计价的干净二维扫描)、Win Fast or Lose Slow(同为真实时延但用可分辨的对战/交易载体)。