← 首页|学术|Real-Time Reasoning Agents in Evolving Environments (RealtimeGym / AgileThinker)
Real-Time Reasoning Agents in Evolving Environments (RealtimeGym / AgileThinker)
arXiv ↗
cs.AI / cs.CL 2511.04898

Real-Time Reasoning Agents in Evolving Environments (RealtimeGym / AgileThinker)

Stanford SALT-NLP (Wu et al.)
ICLR 2026 · arXiv 2511.04898 · 7 Nov 2025
💬  环境按 token 计价的固定节奏推进、不等 agent 想完:Planning 0.92→0.05 崩、Reactive 平庸不崩、双线程 AgileThinker 0.90→0.58——推理深度×时间压力最干净的受控二维扫描;token 时钟以 R²=0.9986 的墙钟线性拟合背书,但作者自认跨模型不公平。

🎯 问题与形式化

现有设定假设'agent 推理期间世界暂停、算力无限';RealtimeGym 让环境每 N_TE 个生成 token 强制走一步,超时执行默认动作。

三个自建文本游戏对应三种动态:Freeway=动态危险(车流)、Snake=动态机会(限时食物)、Overcooked=动态协作(非平稳脚本队友)。每个游戏有认知负荷旋钮(车道数/障碍密度/台面长度),与四档时间压力(32k/16k/8k/4k token/步)构成二维网格。默认动作:Freeway/Snake 沿原方向,Overcooked 原地。

token 时钟的合法性验证:DeepSeek 官方 API 全轨迹最小二乘 T=0.0473N+334.55s,R²=0.9986——解码墙钟对 token 数近乎完美线性。但作者同时自声明:跨模型比较不公平(tokenizer/架构不同),gym 用于固定模型族下比较 agent 设计。这句自我划界正是墙钟评测(模型无关时间轴)的让位声明。指标按游戏最高分归一化到 [0,1]。

🔧 AgileThinker

双线程:Planning 线程流式产出长程推理(不追环境节奏),Reactive 线程在时限内基于最新观察+Planning 的部分推理轨迹出动作。

两个基线范式:Reactive=每环境步一个动作(非思考模型或思考模型 budget forcing 截断到预算 N_i≤N_TE);Planning=跨多步推理出计划、执行到下次推理——计划生成期间世界已变,执行过期计划是其失败模式。AgileThinker 的关键设计是 Reactive 读 Planning 的 partial 输出(流式),不等它想完。

实验用 DeepSeek V3(reactive)+R1(planning)——开源+推理轨迹透明是选型原因。Gemini 复现拿不到推理流,只能弱化为'引用完成后的计划',方向性结论不变。Code-as-policy 试过且有根本局限:生成代码难表达对动态实体的条件反应(附录)。

📊 结果

压力 32k→4k:Planning 0.92→0.05 崩溃,AgileThinker 0.90→0.58,Reactive 平庸但稳;优势随负荷与压力增大而统计显著。

深推理在时间压力下的崩溃是全文最锋利的数字:0.92→0.05。快答不崩但上限低。混合范式把崩溃拉缓到 0.58。墙钟实验(TPOT=0.047s/token 换算)确认结论迁移到物理时间。

p 值热图显示 AgileThinker 对两个单范式的优势在高负荷×高压力象限统计显著(p<0.05),低压力下不显著——'快慢分离只在时间紧时值钱'。future work 原文点名:扩展到更真实场景、改进双线程协调、'train urgency-aware LLM agents'——训练侧完全留白。

💡 对主线的启示

协议范式直接搬(二维网格+默认动作+归一化);token 时钟的自我划界是墙钟评测的让位声明;发表 9 个月引用≈0,G2/G4 缺口敞开。

四点:① 调速阶梯=同构协议换轴(token→环境侧墙钟、文本→视觉);② 作者自认跨模型不公平——'用墙钟'的理由由它自己供给;③ AgileThinker 在我们框架里是被测系统设计而非贡献(快慢分离 harness 实证最强版);④ 'train urgency-aware agents' 列在 future work 无人接——微调臂的定位佐证。

注意 token 时钟测不到的东西:TPOT 差异、批处理、网络抖动、prefill——真实时延来源全部被抽象掉,这既是它干净的原因也是它与部署脱节的原因。Planning 的失败模式(执行过期计划)与 VideoGameBench 的 stale action 同型,可合并引用为'世界不等模型'的两级证据(文本/视觉)。对照阅读:Gaia2/ARE(仿真时间版)、Win Fast or Lose Slow(真实系统时延版)、TickingCollabBench(真墙钟 Minecraft 版)。

🏷 关键词

real-time reasoningtoken-priced timeAgileThinkerplanning vs reactivetime pressurecognitive loaddual-threadRealtimeGymICLR 2026