← 首页|学术|Recon: Reconstruction-Guided Reasoning Synthesis
cs.CL cs.AI cs.LG · 2605.26969 · May 2026
Recon: Reconstruction-Guided Reasoning Synthesis for User Modeling
Alan Zhu, Mihran Miroyan, Carolyn Wang, Andrew Zhou, Lisa Dunlap, Narges Norouzi, Joseph E. Gonzalez — UC Berkeley
Reasoning Synthesis
Agent Training
RL Reward Design
User Modeling
核心结论:推理 trace 的质量不应该用"是否与 ground truth 答案吻合"来衡量,而应该用重建保真度——好的推理应该让一个看不到正确答案的模型,仅凭这条推理就能"猜到"正确答案是什么。直接用任务准确率做 RL reward(E2E-GRPO)比 baseline 还差,而 Recon-GRPO 的 win rate 高达 70%。
🎯 问题:推理合成的根本缺陷
后验合理化 vs. 真正因果推理
现有推理合成方法的范式:给模型 (context, action) 作为条件,让它生成一条"解释为什么选择这个 action 的推理 trace"。但这个设定从根本上有问题——模型看到了答案才生成推理,所以生成的是事后合理化,而不是驱动决策的真正因果推理。
具体场景:用户建模任务中,模型需要根据用户的历史行为和上下文预测"用户接下来会说什么"(action)。标准方法条件化在 (历史, 下一句话) 上生成推理,但这保证了推理 trace 必然"支持"那句话,无论这个推理是否真的揭示了用户的决策逻辑。
为什么 E2E-GRPO 失败
直接用"action 预测准确率"作为 RL reward 会产生 outcome hacking:模型学会了在 trace 中偷看或强行与 action 对齐,而不是学习真正的因果推理。结果比 baseline 还差(38.4% win rate vs. baseline),因为 hack 出来的推理无法迁移到新的用户和新的场景。
🔬 方法:重建保真度作为质量信号
核心思想
如果一条推理 trace 真的捕捉到了"用户为什么这样做",那么这条 trace 应该足以让另一个看不到 ground-truth action 的模型(action model M_a)推断出正确的 action。这就是重建保真度的定义:
好的 trace r̂ = 只看 (context, r̂) 就能重建出 action 的 trace
Recon-Select(无训练版本)
- 用推理模型 M_r 对 (context, action) 采样 N=4 条候选 trace {r̂₁, r̂₂, r̂₃, r̂₄}
- 对每条 r̂ᵢ,让 action model M_a 仅凭 (context, r̂ᵢ) 重建 action
- 用 LM judge(Gemini-3.1-Flash-Lite)从三个维度评分:风格一致性、意图表达、价值观对齐
- 选评分最高的 r̂ 作为最终输出
不需要训练,直接部署。适合已有推理模型的场景。
Recon-GRPO(RL 训练版本)
把重建对齐分作为 GRPO 的 reward 信号,训练 M_r 生成重建保真度高的 trace:
reward = 1 × avg_alignment_score − 2 × verbatim_repeat_penalty
惩罚项防止模型直接把 action 文本复制进 trace 来"骗过"重建(这是一个明显的 hack 方式)。
训练配置:LoRA rank=128,1 epoch,LR=1e-5。
重建的不对称性:M_r 看到了 action(生成 trace 时),但 M_a 看不到 action(重建时)。这个信息不对称是整个框架的关键——它强制 M_r 把 action 信息编码进 trace 的语义内容,而不是直接引用。
📊 实验设置与结果
实验设置
8 个角色,覆盖 4 个不同领域:
- SCOTUS 最高法院口头辩论(法律推理)
- 英国议会首相问答(政治辩论)
- 播客对话(非正式交流)
- Reddit 讨论(社区互动)
每个角色:512 条测试 context-action 对,~4,096 条目标 turn 用于训练。评测用 pairwise LM judge,与人工标注 77% 一致(Cohen's κ=0.623)。
Recon-GRPO (4B)
70.0%
win rate vs baseline
E2E-GRPO (对照)
38.4%
比 baseline 还差
Recon-Select (8B)
54.7%
无训练版本
| 方法 | 模型 | Win Rate vs Baseline | 备注 |
| Recon-GRPO | Qwen3-4B | 70.0% | 最强 |
| Recon-GRPO | Llama-3.1-8B | 56.4% | 较强 |
| Recon-Select | Qwen3-8B | 54.7% | 无训练 |
| Recon-Select | GPT-5-mini | 53.5% | 闭源 |
| E2E-GRPO (outcome RL) | Qwen3-4B | 38.4% | 比 baseline 差 |
▶ 模型迁移方向的关键发现
强→弱迁移有效:用大模型训练得到的 Recon reward 可以用来训练小模型。
弱→强迁移无效:用小模型的 Recon reward 训练大模型时,大模型反而变差。
这意味着 Recon 框架在 action model M_a 的能力上设有一个隐性下限——M_a 需要足够强才能作为可信的重建信号来源。
💡 方法论意义:超出用户建模场景
重建保真度作为通用推理质量信号
Recon 的论点本质上是一个关于推理质量评估的新框架,与具体任务(用户建模)相对解耦。核心主张:如果我们希望模型生成"真正说明决策原因"的推理,那么这个推理应该让一个独立观察者"凭这条推理就能重建出决策"——而不仅仅是"与决策不矛盾"。
与 agent 训练的类比:在 agentic 场景中,同样的问题存在——agent 的推理 trace 是事后合理化还是真正的行动理由?如果用 Recon 的逻辑,高质量的 agent 推理应该是:仅凭推理 trace(不看工具调用序列),观察者应该能推断出 agent 会选择哪些工具、执行哪些步骤。这是一个未被探索但有潜力的方向。
局限:目前 Recon 的重建打分依赖 LM judge,且 judge 本身的质量上限制约了整个框架。在更开放的任务中(agent 规划)action space 远比"用户下一句话"复杂,重建保真度的可信度可能下降。
arXiv:2605.26969 · UC Berkeley · May 2026 · 精读:2026-07-14