← 首页 | 学术 | Logic-VLA: A Temporal Logic Conditioned Vision-Language-Action Model ◐
cs.RO · cs.LO · eess.SY · 2608.20556 · 20 Aug 2026
Logic-VLA: A Temporal Logic Conditioned Vision-Language-Action Model
Celina Shiyu Wang, Yiqi Zhao, Junjie Ye, Yue Wang, Jyotirmoy V. Deshmukh
💬 自然语言指令说不清"安全边界"和"时序约束"。Logic-VLA 让 VLA 模型在推理时直接吃一条 Signal Temporal Logic (STL) 规约,用同一个策略网络就能按需切换不同的形式化安全要求,而不必为每条规约单独训一个模型。
🎯 问题
自然语言指令无法精确表达安全关键的时空约束
VLA 模型擅长听懂"飞到窗户那边"这类自然语言任务指令,但现实部署中往往还有更硬的约束——比如"任何时候都不能进入某禁飞区"、"必须在T秒内到达检查点后才能继续"——这类时序、安全性质用自然语言表述天然模糊,而且不同任务场景下约束会变,为每一种组合单独训练策略不现实。作者的思路是把这些约束用 Signal Temporal Logic(STL,形式化方法里描述连续信号时序性质的规约语言)显式表达出来,并让模型在推理时就能"读懂"并遵守它,同时不能明显破坏原本的自然语言任务完成度。
🔬 方法
STL 语法图编码器
Logic-VLA 引入一个基于语法图(syntax-graph)的 STL 编码器,预训练用于捕捉时序逻辑语义——即把一条 STL 公式的抽象语法树/图结构编码成策略网络可用的条件向量,使模型能像理解语言指令一样"理解"形式化规约,并将其作为额外条件输入注入到 VLA 主干中。
两阶段策略适配
第一阶段是 STL 条件监督微调(SFT):在满足给定 STL 规约的演示数据上训练,让策略学会"看规约做事"。第二阶段是轨迹级偏好优化:构造满足/违反 STL 的成对 rollout(matched satisfying-violating pairs),用一种基于 flow-matching 的替代方法实现 Identity Preference Optimization(IPO),在轨迹层面强化"满足规约"相对于"违反规约"的偏好,而不是仅在单步动作上做偏好对齐。
▶ 关键设计动机 两阶段设计对应两个不同目标:SFT 阶段解决"策略能不能听懂规约"的冷启动问题;偏好优化阶段解决"听懂了但执行时仍可能违反"的精细化对齐问题——通过对比同一场景下满足/违反规约的轨迹对,直接在轨迹级别塑造行为分布,而非依赖规约满足与否的稀疏奖励。flow-matching surrogate 用于让 IPO 这种偏好优化目标能在连续动作/轨迹空间里可微分地传播梯度。
📊 结果
STL 满足率提升
+24.8~40.7pp
相对 STL-blind 基线策略
评测在闭环四旋翼导航仿真中进行,环境为随机化的照片级真实感场景,并专门测试了对训练时未见过的 STL 公式的泛化能力。核心结论是:单个 Logic-VLA 策略就能根据推理时传入的不同 STL 规约调整行为,STL 满足率相比"看不懂规约"的基线策略大幅提升(24.8–40.7个百分点),而原本的自然语言任务完成率几乎没有受损(最多降 1.8pp)——不需要为每条规约单独训练一个专用策略。
亮点:条件化推理(inference-time conditioning)而非规约特定训练,是这篇工作能落地到多变安全约束场景的关键。
💡 关注点关联
这篇工作把形式化方法(STL/时序逻辑)和具身智能策略学习结合起来,属于"给 VLA/Agent 加可验证安全约束"这条路线,与具身 AI(closed-loop 机器人控制)和形式化方法两个关注方向都相关。其"同一策略、推理时切换规约"的思路,和 duplex/多约束场景下"策略需要按需响应不同实时约束"的问题在方法论上有一定共鸣,但本文聚焦静态安全规约而非实时交互协同,是相邻但不同的问题设定。
具身AI VLA 时序逻辑 形式化方法 安全约束
来源:arXiv:2608.20556(摘要页信息,未解析PDF全文)