← 首页|学术|OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning
OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning
arXiv ↗
cs.RO 2505.11917

OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning

清华 Yang Gao 组 (Lin et al.)
ICLR 2026 · arXiv 2505.11917 · 17 May 2025
💬  单一 VLA(π0 底座)用 [BOR]/[BOA] 决策 token 自适应切换推理/行动:只在关键时刻(子任务完成/出错/需人类输入)显式推理,其余摊销最近推理;长程任务 87% 超 π0 +30%——事件触发+推理摊销的单模型实现。

🔧 机制

每步先采样 decision token:[BOR]→自回归生成推理文本+存参考帧;[BOA]→以最近推理+参考帧为条件出 action chunk。推理时机是训练出来的模型输出。

决策监督的关键设计:推理区间内若当前推理内容已过期(stale)真值为 [BOR],更新后变 [BOA];行动区间恒 [BOA]——'推理有时间冗余、只在失效时更新'直接编码进监督。推理内容四件套:场景描述+高层计划+历史摘要+下一步指令;另收失败恢复数据与人机交互标注。

VL 合成管线(16,000 样本):Gemini 2.5 Pro 生成桌面布局文本 → FLUX.1-dev 出图(鱼眼畸变/合成夹爪贴真实观测)→ Gemini 生成指令+推理内容;与机器人数据共训带来开放世界 grounding 与泛化规划('帮我提神'→煮咖啡)。

📊 结果

三个长程灵巧任务(火锅/调酒等)平均 87%:超 π0 +30%、超双系统 +24%;四能力:长程规划/错误恢复/人机交互/可泛化 grounding。

双系统基线的失败模式有诊断价值:交互中丢上下文、推理过程不连贯(例:只捡起柠檬伏特加就不继续调酒)——单模型统一上下文是它的核心优势来源。Cocktail 任务要求区分近十种视觉相似原料并精确倾倒。

与机制清单的对应:③事件触发(关键时刻才 [BOR])+ ②推理摊销(其余时间用最近推理)。隐含假设=推理内容有时间冗余:摊销的合法性依赖环境变化速度低于推理失效速度。

💡 对主线的启示

when-to-reason 作为可训练的模型输出(decision token)——微调臂'推理时机作为学习决策'的直接同构;stale-reasoning 监督格式可用于流式 CoT 标注。

关键划界:推理仍是阻塞式([BOR] 期间不出动作),事件触发解决了'何时想'、没解决'想的时候世界在跑'——在调速阶梯上'摊销假设'本身可被扫描(快端摊销应崩溃)。与 HiRT 对照:OneTwoVLA 单模型同步、HiRT 双模型异步。

局限:关键时刻类型由数据标注定义(三类)非开放学习;真实实验限桌面操作;synthetic 数据依赖闭源模型。对照阅读:ECoT(固定阻塞推理起点)、VST(视频侧推理摊销+异步)、AnytimeReasoner(推理预算的 RL 训练目标)。

🏷 关键词

adaptive reasoningdecision tokensBOR/BOAevent-triggeredreasoning amortizationVLAπ0dual-systemICLR 2026