← 首页|学术|HiRT: Enhancing Robotic Control with Hierarchical Robot Transformers
HiRT: Enhancing Robotic Control with Hierarchical Robot Transformers
arXiv ↗
cs.RO 2410.05273

HiRT: Enhancing Robotic Control with Hierarchical Robot Transformers

清华系团队 (Zhang et al.)
CoRL 2024 · arXiv 2410.05273 · Oct 2024
💬  VLA 拆两层异步跑:慢环 VLM 低频刷新语义 latent buffer、快环轻量策略每步取最新 latent 出动作不等 VLM——4.1→9.8Hz,真实动态任务 48%→75%,同步慢推理代价的量化证据。

🔧 机制

InstructBLIP-7B 慢环压 latent 入 buffer;EfficientNet/ViT 快环(35M–150M)以 FiLM/prefix 条件于最新 latent 每步出动作;异步并行不等 VLM。

'最新值信箱'模式:VLM 按自己节奏刷新、策略永远取最新——staleness 处理只有'取最新'一招,无时效标注无有效期。VLM 间隔可调:间隔 1→1.97Hz、间隔 6→13.42Hz,构成频率-性能旋钮。

训练期 staleness 增强(关键细节):异步部署时策略会吃到几步前的 latent、与训练错配——HiRT 训练时随机选过去观察中的一帧作 VLM 输入,显式让策略容忍时间不一致的 latent。这是'训练期模拟部署时序错配'的又一实例,与 Training-Time Action Conditioning 的延迟采样、Helix 的时间偏移标定同族。

📊 结果

整机 4.1→9.8Hz;静态任务频率翻倍成功率持平;真实动态任务(移动目标)48%→75%。

实验:Metaworld/Franka-Kitchen 仿真 + 真实 Panda(2000 轨迹,腕部+第三视角双相机),动态任务=目标物体匀速移动时执行操作,每任务 20 次。静态测试含干扰物与全新物体的语义 grounding 验证。

局限:2024 年工作底座较老;动态=匀速移动(可预测动态);latent 无时效语义;只扫了 VLM 间隔一个旋钮。

💡 对主线的启示

'异步慢环+最新值信箱'机制①的原型实现;48%→75% 引作异步化在动态任务的既证收益;训练期随机历史帧=时序错配增强的可推广样板。

staleness 只有'取最新'一招、无 validity-time 语义——正是我们时效标注方向的空白佐证。频率-性能旋钮(VLM 间隔)与我们的调速阶梯是对偶:它调模型侧节奏、我们调环境侧时钟。

对照:Figure Helix(双系统+按实测延迟标定时间偏移——staleness 的显式校准版)、OneTwoVLA(单模型事件触发,同步)、RTC(动作侧补偿)。三者加 HiRT 构成双系统设计空间的四个角:同步单模型/异步双模型/延迟标定/动作补偿。

🏷 关键词

hierarchicalslow-fastlatent bufferasynchronous VLMFiLMdynamic manipulationstalenessCoRL 2024InstructBLIP