首个将 long-horizon agent 记忆抽象为"有界合约"的测试床,支持隔离研究记忆组件对决策的独立贡献,为 agent 记忆架构研究提供可复现的实验基础。
你的领域
识别并形式化"ghost memory"这一长期记忆的核心失效模式,提出三层记忆状态感知框架,显著减少记忆矛盾导致的答案错误。
首次系统定义和分类 Infinite Agentic Loop 问题,构建专项 benchmark,揭示现有主流 agent 框架在无边界反馈路径下的普遍脆弱性。
CLAP: Closed-Loop Training, Evaluation, and Release Control for Domain Agent Post-training
提出端到端闭环 agent 后训练框架,将训练→评估→发布门控统一管理,系统解决业务场景中后训练收益不确定和发布风险问题。
Reasoning effort, not tool access, buys first-try reliability in agentic code generation
大规模受控实验否定"更多工具 = 更好结果"的假设,证明推理能力是 agentic code generation 首次成功率的主要决定因素,为工具能力扩展决策提供实证依据。
Beyond Textual Repository Exploration: Dual-Modal Structural Reasoning for Agentic Issue Resolution
将代码 repo 探索从纯文本升级为文本+结构双模态,使 agent 能直接推理调用图和依赖链,在 SWE-Bench 上显著提升复杂长程 issue 的解决率。
提出统一的 agentic 任务图表示,将隐式文本依赖显式化为图结构,在不额外训练的前提下支持并行执行和中间验证,在多类复杂任务上超越 CoT 和 ReAct 基线。
提供 agentic benchmark 的廉价代理评估方法,通过原子能力子集准确预测 SWE-Bench/GAIA 等昂贵评估的排名,将评估成本降低数个数量级。
Coding Agents Are Guessing: Measuring Action-Boundary Violations in Underspecified DevOps Instructions
定义"行动边界违规"新评估维度,揭示主流 coding agent 在欠规格指令下普遍存在高风险推测行为,为 agentic 安全评估提供新标准。
将传统工程治理方法(access control/coding conventions)系统化迁移为 coding agent 的约束层,证明约束可控性比自然语言监督更高效、更可扩展。
AI 热点
LLM agent 在有社会结构的设置中(角色/受众/关系)会怎样行动?本文引入双通道辩论框架:agent 同时产生公开发言(进入共享历史)和私下发言(只被记录、不展示给其他 agent)。在无任何显式目标的条件下,agent 公私行为是否一致?研究发现社会结构会改变 agent 公开表达的内容,且不同角色 agent 之间的隐性目标会涌现出对齐或背离。对 multi-agent AI safety 有重要含义。
微软 2026 年初在数万名工程师中铺开 Claude Code 和 GitHub Copilot CLI 的大规模真实采用研究。发现:首次使用主要通过同伴传播(而非管理层推动);留存率和工程速度提升与推理投入水平关联更强,与工具本身关联较弱。为组织级 agentic 工具部署决策提供了迄今最大规模的真实数据。
科学 ML 论文通常有可计算的声明(如 RMSE < 5%)。coding agent 能否仅凭论文材料复现这些声明?本文提出 Paper-replication 工作流:将每个论文声明作为目标,记录生成证据是否支持该声明。研究 coding agent 在哪些声明类型上成功/失败,为"AI 加速科研复现"提供系统性实证数据。
现有 rubric-based judge 通常只用一个通用评估者生成维度,存在"维度盲点"——重要的人类偏好维度被遗漏。MRRG(Multi-Role Rubric Generation)让多个具有不同视角的角色分别生成 rubric,再聚合成全面评分标准。无需训练、无需参考答案,在 reward modeling 和 LLM 评估上优于单角色基线。
今日 297 篇 | 精选 14 篇 回复序号可深读 | 回复「存 N」加入 Zotero