← 首页|学术|Robotic Control via Embodied Chain-of-Thought Reasoning (ECoT)
Robotic Control via Embodied Chain-of-Thought Reasoning (ECoT)
arXiv ↗
cs.RO / cs.LG 2407.08693

Robotic Control via Embodied Chain-of-Thought Reasoning (ECoT)

Zawalski, Chen, Pertsch, Mees, Finn, Levine (Berkeley/Stanford)
CoRL 2024 · arXiv 2407.08693 · Jul 2024
💬  VLA 出动作前先生成固定结构的具身推理链(计划+子任务+移动原语+末端位置+全场景框):标注全自动合成,泛化任务绝对 +28%、反超 7 倍大的 RT-2-X;代价是每步 token 7→350——'显式推理提准但阻塞'矛盾的起点。

🔧 机制

六段固定推理链:TASK→PLAN→SUBTASK→MOVE(729 种模板化移动原语)→GRIPPER(末端像素位)→OBJECTS(全场景 bounding box);接地步骤强迫模型'仔细看'。

纯语义 CoT 不够:Naïve CoT(只有语义层)差 ECoT 16–18pp——增益主体在具身接地步骤。底座 OpenVLA(SigLIP+DinoV2 融合视觉 + Llama2-7B),Bridge V2 六万条演示 250 万 transition。

数据合成管线(零人工,7 天跑完):Prismatic-7B 场景描述 → Grounding DINO 开放词表检测框(box/text 置信度 0.3/0.2 过滤)→ 本体状态模板化 MOVE 原语(未来 4 步方向)→ OWLv2+SAM+RANSAC 拟合投影矩阵得 2D 末端位置(逐轨迹独立,不假设固定相机参数)→ Gemini 1.0 组装高层计划与逐步子任务。可在任意机器人数据集重跑——微调数据管线的参照系。

📊 结果

挑战性泛化任务绝对 +28%(同底座同数据、唯一差异是 CoT);反超 RT-2-X(55B、多 10 个数据集);失败可解释+自然语言可纠错+推理链可迁移到未见 embodiment。

分视角:in-distribution 超 Octo/OpenVLA/RT-2-X/Naïve-CoT 各 +45/22/19/18pp;OOD 视角 +48/34/16/16pp。人类可以读推理链定位失败在哪一段,并通过改推理链文本交互式纠正策略行为。

阻塞代价与两个缓解(原文 5.5):每步生成 token 7→350,控制频率大降。缓解一=高层推理每 N 步重算(同步跳步);缓解二=异步双实例——一个实例持续更新高层推理链、另一个用最新链出低层推理+动作(编码已有 token 远快于生成)。作者注明这些与算子优化/投机解码正交。

💡 对主线的启示

矛盾的两半在同一篇里:+28% 证明推理值得要、7→350 token/步证明实时付不起——后续整条线都在解这道题,引用时两个数字一起给。

异步双实例缓解已是'边动边想'雏形(一实例想、一实例动),但无时效语义、无世界演化代价测量——机制②推理摊销的最早本能形态。自动合成接地推理链的管线与 VST 的视频版同族,是微调数据管线的直接参照。

谱系位置:ECoT(每步全量阻塞)→ Fast ECoT(缓存+异步调度)→ π0.5(高低频两遍)→ OneTwoVLA(事件触发+摊销)→ Fast-ThinkAct/LaST0(隐空间化)——'显式推理的时间成本'这条线的完整演化。局限:推理链结构固定六段、单平台(WidowX/Bridge)、MOVE 原语假设固定相机。

🏷 关键词

embodied CoTgrounded reasoningVLAOpenVLABridge V2synthetic annotationblocking inferenceCoRL 2024interpretability