← 首页|学术|Recon: Reconstruction-Guided Reasoning Synthesis
cs.CL cs.AI cs.LG · 2605.26969 · May 2026

Recon: Reconstruction-Guided Reasoning Synthesis for User Modeling

Alan Zhu, Mihran Miroyan, Carolyn Wang, Andrew Zhou, Lisa Dunlap, Narges Norouzi, Joseph E. Gonzalez — UC Berkeley
Reasoning Synthesis Agent Training RL Reward Design User Modeling
核心结论:推理 trace 的质量不应该用"是否与 ground truth 答案吻合"来衡量,而应该用重建保真度——好的推理应该让一个看不到正确答案的模型,仅凭这条推理就能"猜到"正确答案是什么。直接用任务准确率做 RL reward(E2E-GRPO)比 baseline 还差,而 Recon-GRPO 的 win rate 高达 70%。

🎯 问题:推理合成的根本缺陷

后验合理化 vs. 真正因果推理
现有推理合成方法的范式:给模型 (context, action) 作为条件,让它生成一条"解释为什么选择这个 action 的推理 trace"。但这个设定从根本上有问题——模型看到了答案才生成推理,所以生成的是事后合理化,而不是驱动决策的真正因果推理
具体场景:用户建模任务中,模型需要根据用户的历史行为和上下文预测"用户接下来会说什么"(action)。标准方法条件化在 (历史, 下一句话) 上生成推理,但这保证了推理 trace 必然"支持"那句话,无论这个推理是否真的揭示了用户的决策逻辑。
为什么 E2E-GRPO 失败
直接用"action 预测准确率"作为 RL reward 会产生 outcome hacking:模型学会了在 trace 中偷看或强行与 action 对齐,而不是学习真正的因果推理。结果比 baseline 还差(38.4% win rate vs. baseline),因为 hack 出来的推理无法迁移到新的用户和新的场景。

🔬 方法:重建保真度作为质量信号

核心思想
如果一条推理 trace 真的捕捉到了"用户为什么这样做",那么这条 trace 应该足以让另一个看不到 ground-truth action 的模型(action model M_a)推断出正确的 action。这就是重建保真度的定义:

好的 trace r̂ = 只看 (context, r̂) 就能重建出 action 的 trace
Recon-Select(无训练版本)
  1. 用推理模型 M_r 对 (context, action) 采样 N=4 条候选 trace {r̂₁, r̂₂, r̂₃, r̂₄}
  2. 对每条 r̂ᵢ,让 action model M_a 仅凭 (context, r̂ᵢ) 重建 action
  3. 用 LM judge(Gemini-3.1-Flash-Lite)从三个维度评分:风格一致性、意图表达、价值观对齐
  4. 选评分最高的 r̂ 作为最终输出

不需要训练,直接部署。适合已有推理模型的场景。
Recon-GRPO(RL 训练版本)
把重建对齐分作为 GRPO 的 reward 信号,训练 M_r 生成重建保真度高的 trace:

reward = 1 × avg_alignment_score − 2 × verbatim_repeat_penalty

惩罚项防止模型直接把 action 文本复制进 trace 来"骗过"重建(这是一个明显的 hack 方式)。

训练配置:LoRA rank=128,1 epoch,LR=1e-5。
重建的不对称性:M_r 看到了 action(生成 trace 时),但 M_a 看不到 action(重建时)。这个信息不对称是整个框架的关键——它强制 M_r 把 action 信息编码进 trace 的语义内容,而不是直接引用。

📊 实验设置与结果

实验设置
8 个角色,覆盖 4 个不同领域: 每个角色:512 条测试 context-action 对,~4,096 条目标 turn 用于训练。评测用 pairwise LM judge,与人工标注 77% 一致(Cohen's κ=0.623)。
Recon-GRPO (4B)
70.0%
win rate vs baseline
E2E-GRPO (对照)
38.4%
比 baseline 还差
Recon-Select (8B)
54.7%
无训练版本
方法模型Win Rate vs Baseline备注
Recon-GRPOQwen3-4B70.0%最强
Recon-GRPOLlama-3.1-8B56.4%较强
Recon-SelectQwen3-8B54.7%无训练
Recon-SelectGPT-5-mini53.5%闭源
E2E-GRPO (outcome RL)Qwen3-4B38.4%比 baseline 差
▶ 模型迁移方向的关键发现
强→弱迁移有效:用大模型训练得到的 Recon reward 可以用来训练小模型。

弱→强迁移无效:用小模型的 Recon reward 训练大模型时,大模型反而变差。

这意味着 Recon 框架在 action model M_a 的能力上设有一个隐性下限——M_a 需要足够强才能作为可信的重建信号来源。

💡 方法论意义:超出用户建模场景

重建保真度作为通用推理质量信号
Recon 的论点本质上是一个关于推理质量评估的新框架,与具体任务(用户建模)相对解耦。核心主张:如果我们希望模型生成"真正说明决策原因"的推理,那么这个推理应该让一个独立观察者"凭这条推理就能重建出决策"——而不仅仅是"与决策不矛盾"。
与 agent 训练的类比:在 agentic 场景中,同样的问题存在——agent 的推理 trace 是事后合理化还是真正的行动理由?如果用 Recon 的逻辑,高质量的 agent 推理应该是:仅凭推理 trace(不看工具调用序列),观察者应该能推断出 agent 会选择哪些工具、执行哪些步骤。这是一个未被探索但有潜力的方向。
局限:目前 Recon 的重建打分依赖 LM judge,且 judge 本身的质量上限制约了整个框架。在更开放的任务中(agent 规划)action space 远比"用户下一句话"复杂,重建保真度的可信度可能下降。
arXiv:2605.26969 · UC Berkeley · May 2026 · 精读:2026-07-14