🎯 问题
现有评测几乎全同步:agent 思考时环境暂停。ARE/Gaia2 把'世界不等模型'做进平台层,时间敏感/事件适应/噪声/协作同框可测。
ARE 的设计信条是 'everything is an event':环境由 apps(有状态 API 集合)组成,一切状态变化按仿真时间戳进入 EventQueue(DAG 依赖管理,支持绝对/相对/条件计时),EventLoop 执行并落 EventLog。Notifications 是可配置的选择性可观测通道。与 τ-bench / SWE-bench 式回合制评测正面相对。
时间语义三条(对'时钟主权'问题的 API 侧标杆回答):① turn 内仿真钟随真实生成时延推进——'model generations directly consume simulated time',慢推理会让外部事件发生在思考期间;② turn 间暂停等用户输入;③ agent 调 wait / wait_for_next_notification 时仿真切换为事件到事件的队列快进,几小时场景几分钟跑完。instant 模式=生成不耗仿真时间,作为时延上界对照。Mobile 实例:12 app、101 工具、每 universe 400K–800K token 合成一致内容(PersonaHub 种子 + 依赖图跨 app 传播)。
🔧 Gaia2 与验证器
1,120 场景 = 5 核心 split(Execution/Search/Ambiguity/Adaptability/Time)+ 2 增强(Noise/A2A);write-action 级验证器 0.98 agreement,可直接 RLVR。
800 个人工场景各配唯一事件 DAG 与初始状态;Noise 注入工具异常/垃圾事件、A2A 把 app 换成 app-agent(主 agent 失去直接工具权限、必须消息协调)——两个增强不需要新标注,因为验证器只看状态变化。Time 任务三类:主动定时('每 30 秒发一次')、响应独立事件('上架立即买')、响应依赖事件('等 1 分钟后立刻汇总')。
ARE Verifier(独立贡献):对照最小 oracle 序列验证每个写动作——读动作无限免费(探索不计分),目标无关顺序。四维:一致性(刚性字段精确匹配 + 柔性字段 LLM rubric + 反 hacking 检查)、因果(DAG 先后)、时间(容差窗)、完备性(所有 oracle 写动作须匹配)。450 条人工标注轨迹上 agreement 0.98 / precision 0.99,胜过纯 LLM judge。判定模型 Llama-3.3-70B t=0。终止条件:200 步 / 上下文溢出 / 验证完成 / 超时。
📊 结果
GPT-5(high) 42.1 领跑但 Time 0.0;仅 Sonnet (8.1/8.5) 与 Gemini-2.5-Pro (7.3) 在 Time 上有意义分数;开源最好 Kimi-K2 20.1。
Execution/Search 最容易(与既有基准饱和一致),Ambiguity/Adaptability 只有 Sonnet 与 GPT-5(high) 稳健,Noise 大多 <20。Time split 全线崩溃:GPT-5(high)/Qwen3-235B-Thinking/Grok-4 全部 0.0,Kimi-K2 0.8。A2A 反而对弱模型帮助更大——强模型加层级引入协调开销与级联错误。
instant 消融(Fig 8):去掉生成时延后全员提升、推理型提升最大——Sonnet 8.1→26.7,GPT-5(high) 0.0→34.4。反向缩放:GPT-5 家族 Time 分 minimal 5.2 → low 2.3 → high 0.0,模型在用 Time 换 Execution——作者由此主张 adaptive compute(浅模型打底、必要时才深推理)。并行编排(PTC)实验仍远低于 instant 上界,证明瓶颈在模型能力(顺序推理+时间规划)而非 scaffold。成本维度:Sonnet 价格约 3× GPT-5(low) 但快得多;作者主张'每美元成功率'。人类可解全部任务但比所有模型慢(用 GUI)。
💡 对主线的启示
'时延吃掉能力'最强第三方数字来源 + '时钟主权在环境'的 API 侧标杆实现;缺视觉闭环、时间汇率未扫——三轴交集空白的佐证。
引用三件套:① 42.1 总分 vs Time 0.0 vs instant 34.4(能力都在、时延吃掉);② GPT-5 家族反向缩放 5.2→2.3→0.0(推理越深时间越败,支撑推理深度×环境速度扫描的动机);③ wait=事件快进 + 生成耗仿真时间的平台设计。注意:其 temporal 任务在 prompt 里给出时间约束且有通知队列(SentinelBench 划界点),载体是 API 宇宙无视觉。
遗留 spike 已解答:推理期间仿真时间确实流动(turn 内),turn 间暂停,wait 时事件级快进。汇率问题(真实生成墙钟如何折算成仿真时间的比率扫描)论文未做——团队计划的 ≤1 天 spike 仍有价值。工程细节可抄:code agent 沙箱里 Python time 库必须与仿真时钟同步;验证器读写分离让 RL 探索免费。对照:SentinelBench(网页侧、条件要自己推断、浏览器不可快进)、RealtimeGym(token 时钟)、TickingCollabBench(真墙钟二值对照)。