← 首页 | 学术 | In-Context VLA:用上下文后训练与Agentic工具调用赋予VLA语言能力 ◐
cs.RO · 2608.05738 · 提交于 2026年8月6日
In-Context VLA:通过上下文后训练与Agentic工具调用赋予视觉-语言-动作模型语言能力In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use Jiarui Yang, Wen Huang, Jiale Zhang, Maowei Hu, Hang Guo
💬 论文用实证与分析指出,给VLA模型加文本思维链(CoT)会伤害底层控制:推理内容不接地、延迟破坏闭环时序、推理token和动作token的优化目标互相冲突,导致策略学会"复述"而非"行动"。作者主张VLA真正需要的不是生成语言的能力,而是消费接地语言的能力,为此提出让策略主动调用开放词汇检测器、单目深度、VLM等工具去获取任务相关信息,而非自己生成CoT。
🎯 问题
行为克隆的局限与"文本CoT万能药"的失效
当前VLA模型几乎清一色用行为克隆训练:策略在静态图像和固定指令条件下模仿专家动作片段。一个自然的改进思路是像LLM推理那样注入显式的文本链式思维(CoT)。但作者通过实证和分析证明,这条路对底层控制是有害的——CoT生成的推理内容往往缺乏视觉接地、其生成延迟会打破闭环控制所需的实时性、更关键的是推理token与动作token在训练时被优化向相互冲突的目标,最终策略学会的是"叙述"任务而不是真正"执行"任务。
🔬 方法
上下文后训练 + Agentic工具调用接口
论文提出的框架包含两部分:(i) 上下文后训练(in-context post-training) ——将感知证据作为结构化上下文注入模型输入,而模型的监督信号只施加在动作输出上,不再要求模型自己生成语言推理;(ii) Agentic工具调用接口 ——策略可以主动查询开放词汇目标检测器、单目深度估计器和一个视觉-语言模型,来获取当前任务相关的信息,而不是被动地在一次性前向传播里"想明白"一切。
配套的数据引擎不再产出单一模板化的描述文本,而是生成多样化、经过改写、并且与视觉证据一致的空间描述,使策略学会理解它从未见过的语言表达方式,而非死记硬背固定的标注句式。
📊 结果
在多个基准与真实机器人任务上均达到SOTA
在 RoboCasa-GR1、SimplerEnv、LIBERO 三个仿真基准,以及8个真实世界机器人操作任务上,该方法在与基于CoT的方法进行同等配置对比时,在性能和效率两方面都取得了一致的SOTA结果。摘要未给出具体数值。
💡 我的看法
虽然这篇论文的应用场景是机器人操作而非对话交互,但它提出的核心论点——"生成语言"和"消费语言"是两种不同的能力,前者可能与低层控制目标冲突,后者才是真正有用的——对你关注的 duplex agent 架构其实有旁敲侧击的启发。全双工交互系统同样存在类似张力:Thinking Layer 生成的深度推理如果直接以自然语言形式插入到 Interaction Layer 的实时响应流中,也会面临"叙述 vs 行动"的目标冲突和延迟问题(这与 DuplexOmni 用控制 token 而非自然语言在两层间传递决策的设计动机是同一类问题的不同表现)。这篇论文选择的解法是"别让模型自己生成CoT,而是用工具调用去主动拉取接地信息",本质上是把"推理"外化成确定性的工具查询而非自由文本生成,这与duplex系统里用离散控制token而非自由文本做层间通信的思路有相通之处:都是为了避免自由格式语言生成拖慢或污染实时决策通道。不过这篇论文的对比对象仅限于"文本CoT",没有涉及非语言的层级化控制信号设计,所以能否直接迁移到duplex场景还需要打个问号。整体上这是一篇方法论证据扎实(实证+分析双重支撑)、对"何时不该用CoT"给出了有价值反例的论文。
VLA Agentic Tool Use Chain-of-Thought Grounding Embodied AI
来源: arXiv:2608.05738