← 首页 | 学术 | 视觉工具使用的幻觉:对"用图像思考"的因果审计 ◐
cs.AI · 2608.06270 · 提交于 2026年8月6日
视觉工具使用的幻觉:对"用图像思考"的因果审计The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images Zhiheng Wang, Bo Peng, Lai Wei, Chaochao Lu
💬 多模态LLM的"裁剪放大再看"式视觉工具调用往往只带来微弱甚至负向增益,却要付出高得多的token开销。作者用因果图把"观察介导路径"和"动作诱导捷径"分离开,逐步审计后发现:视觉工具调用大多是"看了但没起作用"或"有信息但调度混乱",聚合准确率的提升其实集中在一小撮"校准良好"的样本上——这就是所谓"视觉工具使用的幻觉"。
🎯 问题
裁剪放大操作真的在起作用吗?
"用图像思考"范式为多模态LLM配备了裁剪放大等主动视觉操作能力,期望模型能像人一样主动获取更清晰的视觉证据来辅助推理。但作者观察到,使用这些操作的模型相对于直接推理往往只取得微弱甚至负向的增益,代价却是高得多的token消耗;模型还常常反复裁剪不相关区域,甚至在直接推理本可以答对的问题上失败。这引出一个根本性问题:返回的视觉证据是否真的因果性地影响了最终答案?
🔬 方法
因果图 + 三层级干预审计
作者将视觉工具使用建模为一个因果图,把"观察介导路径"(返回的视觉证据真正影响答案)与"动作诱导捷径"(工具调用行为本身而非其内容影响答案)区分开。审计分三个层级进行:策略层级(比较工具使用与直接推理)、轨迹层级(在rollout过程中扰乱全部观察)、步骤层级(在固定前缀下反事实地替换单个观察)。步骤层级的核心估计量"视觉证据增益"(Visual Evidence Gain)专门用来分离出每一次返回观察各自的贡献。实验覆盖六个代表性模型和五个细粒度感知基准。
📊 结果
两种策略失配模式:看了没用 / 有用但乱调度
作者发现了策略层面的两种系统性失配:一是"Calling Without Looking"(调用了工具但没真正在看)——返回的观察对答案没有因果效应;二是"Looking Without Planning"(看了但没规划)——观察本身是有信息量的,但调用时机/调度是不连贯的。轨迹层级的诊断进一步将策略层面的准确率增益进行分解,显示增益集中在一个"校准良好"的少数子集上,而非广泛地分布在所有使用工具的样本中。
"视觉工具使用的幻觉"
作者将这一整体现象命名为"视觉工具使用的幻觉":尽管聚合层面的准确率数字显示出增益,但在大范围的rollout中,视觉工具使用并不具备真正的因果有效性——表面的性能提升掩盖了工具调用机制本身缺乏因果驱动力的事实。
💡 我的看法
这篇论文与duplex/实时agent交互没有直接关联,但其方法论对整个agent工具调用研究有普适价值:它提出的"策略-轨迹-步骤"三层因果审计框架,本质上是在回答一个所有工具增强型agent都该被追问的问题——"模型是真的在用工具的返回结果做决策,还是仅仅因为调用了工具这个动作本身(或者调用工具带来的额外推理token)而蒙对了答案?"这个诊断范式完全可以迁移到文本工具调用(检索、代码执行)甚至duplex agent的多模态感知模块上,用来检验"deep reasoning模块是否真的在因果性地利用实时感知信号",而不只是通过更长的思考时间碰运气提高准确率。论文的局限在于结论目前局限于图像裁剪这一类特定的视觉操作和五个感知基准,是否能推广到更复杂的多步视觉推理任务(如图表理解、多图对比)还有待验证;但其揭示的"聚合指标掩盖因果无效性"这一现象,是所有做agent评测的研究者都应该警惕的方法论陷阱。
Multimodal LLM Causal Analysis Tool Use Visual Reasoning Evaluation Methodology
来源: arXiv:2608.06270