← 首页|学术|Learning to Act While Waiting: Latency-Aware Policies for Real-Time Embodied Agents
cs.RO · 2608.23831 · 24 Aug 2026

Learning to Act While Waiting: Latency-Aware Policies for Real-Time Embodied Agents

Real-time Embodied AI Lab et al.
💬 推理本身也要花时间——与其假装策略前向传播是瞬时的,不如让agent学会在"快而糙"和"慢而准"之间按实时状态动态抉择,随延迟增大优雅降级而非崩溃。

🎯 问题

标准策略学习忽略了推理延迟本身的代价
实时具身agent必须在严格的延迟预算下动作,但传统策略学习假设推理是瞬时完成的,完全忽略了"等待策略前向传播完成"期间环境仍在持续演变这一事实。论文将这一现实形式化为一个延迟感知的马尔可夫决策过程(latency-aware MDP):agent必须在"立即采用快而不准的策略头动作"与"等待更慢更准的策略头、但要承受环境漂移代价"之间做出选择。

🔬 方法

双策略头 + 轻量门控函数联合训练
方法联合训练两个策略头——一个快速低精度头、一个慢速高精度头——以及一个轻量级门控函数,该门控函数根据实时状态不确定性和预测的环境漂移代价,动态决定在每个时刻该采用哪一个头的输出。这种设计让延迟处理本身成为可学习的决策,而不是靠固定超参数或硬编码的延迟补偿规则。

📊 结果

在注入了推理延迟的仿真与真实机器人操作、导航任务上,延迟感知策略显著优于"对延迟无感知"的纯快速策略和纯慢速策略两个基线。随着注入延迟增大,优势愈发明显:在严格实时约束下,该方法表现为性能的优雅降级,而非基线策略常见的灾难性失败。
具身智能实时控制推理延迟策略门控机器人