Agent-Computer Observation Interfaces Enable Dynamic Computer Use (AOI / DynaCU-Bench)
动态计算机使用:观察接口+流式+动作接地
动态计算机使用:观察接口+流式+动作接地
Minecraft时间敏感协作基准:同步vs异步、wall-clock
长时监控agent基准:speed_factor+wall-clock
短视频平台原生动态屏幕GUI agent基准
全双工语音-语言-动作同步模型,共享时钟+动作通道
全双工全模态实时交互评测
游戏agent状态可验证评测基准,ECCV 2026
全双工语音agent真实场景基准:tick编排器+音频-时间解耦
边看边想:流式CoT+推理摊销,ECCV 2026
动态异步环境agent基准,ICLR 2026 Oral
训练期动作条件化:模拟延迟以支持高效实时分块(Physical Intelligence)
实时推理agent:按token计时的推理成本
边读边想:流式CoT+并行KV缓存
边听边想:增量推理+提前工具调用
边说边想:分块推理+播放窗口
实时动作分块:推理时插值实现延迟补偿(Physical Intelligence)
速度-精度权衡:延迟敏感决策的倒U型关系
VLM电子游戏实时性基准
Anytime推理优化:BRPO预算采样+可验证稠密奖励
自适应推理VLA:决策token+事件触发的推理摊销
分层机器人Transformer:slow-fast异步VLM架构+潜变量缓冲
具身CoT推理:分块推理导致的阻塞式推理延迟问题
单卡 30Hz 控制频率、平滑异步执行:FlashVLA 用「流式动作缓冲区」解决 VLA 模型部署时的延迟和异步执行不稳定这两大痛点。
工具返回的结果和模型自己记的不一样时该信谁?MemToC 用 6504 个受控场景量化这个「记忆-工具冲突」问题,结论是:模型几乎总是无脑信工具。
多模态 agent 的长期记忆不该是「离线摘要」或「粗暴相似度检索」,而应该按查询构建一片「证据森林」。
进化策略(ES)不是 GRPO 的「省内存平替」,而是一条能拓宽推理覆盖面的独立后训练路线——理论+实验双重证据。
RLM 训练的并行策略分类法与系统性工程指南
过度推理和推理不足是同一个「推理误分配」问题的两面
人设可漂移、执行可审计的治理型 agent 架构模式
VLM 高层慢规划 + 世界模型控制器高频快执行
企业级 agent 部署的组织契约架构提案(无实验结果)
1:1还原香港城市沙盒里测试空间智能体的组合失效
视频生成世界模型的概率对齐评测基准
同时生成未来画面与可执行键鼠动作序列的游戏智能体
监督者-执行者架构实现运行中实时纠偏与技能沉淀
flow matching 模型自我探索、自我打分、自我蒸馏
无标签测试时训练,用投票分歧做不对称蒸馏+惩罚
用 Accuracy-Complexity-divErsity 三轴透镜统一 agentic 数据生成范式
相机中心统一动作几何预训练实现跨本体泛化
零新增参数为单帧VLA装上流式时序推理能力
用自然语言推理训练机器人操作策略的测试时计算机制
On-Policy Self-Distillation坍缩问题的三杠杆综述
频谱探测解释Muon优越性并提出SAMuon优化器
非对称上下文投机解码提升agentic LLM推理效率
分离反思方向以实现token高效推理
扁平交错对话线程中的情节完整性记忆基准SCALE-QA
长文档VQA agent工作记忆的可回答性评测与GRPO优化
参数化知识图谱记忆的存储-检索鸿沟
记忆管理策略的全局共享与个性化分层共演化
多智能体系统修复方法到底是因果修复还是随机侥幸
联合决定缓存哪些前缀与调度哪些请求,降低多智能体服务延迟
把agent harness本身当作可训练、可即时生成的产物
同质化LLM agent能否靠物理痕迹自发分化社会分工
用残差流中的单一线性方向调节工具调用率,无需训练
针对agent工作流结构重新设计投机解码,解决大batch场景下的失灵问题
拆解长推理链中的两种并行结构,PA-GRPO训练实现1.7x推理加速
LAWA:以潜在动作作为意图表征,跳过未来视频生成实现高效"未来想象"
文本裁判在自然度和轮次交替质量上明显落后于音频原生裁判和人类
统一离散音频token,单一自回归架构同时做音频理解与生成
延迟感知策略:双策略头+门控函数让具身agent在实时约束下优雅降级
模型间升级/降级切换的成本-质量代价,交接税量化
自动提取/移除游戏UI叠加层,清洁数据提升世界模型效果
经验-工作记忆递归自改进架构,在37个模型-基准组合中35个取得提升
4个月真实部署证明Direct QA分数与用户满意度脱节,自然整合能力才是关键
首个智能眼镜统一综述框架,L0-L5能力分级
CRDT共享工作区让编码agent真正并发协作,证明起效的是协调机制而非并行度
用结构化影响图取代原始日志,两阶段agentic框架在Who&When基准刷新SOTA
微信通用多模态嵌入模型,MMEB-v2新SOTA已规模化部署
无新超参数融合RLVR与OPD,ReLU门控对齐蒸馏信号与任务成功
交接压缩把安全阻断器悄悄降格为仅供参考的信息
把agent trace坍缩成有限状态机,支撑失败预测与下一步预测
agent与critic交替共同演化,只改进单方会停滞
生成中主动升级的贝叶斯最优停止理论,1/√n regret保证
用劳动力市场机制取代中心化planner编排LLM agent
三个理念相反的coding agent harness收敛到同一架构
元层级固定、递归作用于自身输出的自改进架构
OODA-Tool 用 Observe-Orient-Decide-Act 闭环分离状态维护与动作生成,缓解多轮工具调用中的状态-动作竞争
ECT 要求终止声明绑定可确定性回放的证据,在受控故障测试中把不安全过早终止降为0
用STL时序逻辑规约条件化VLA策略,推理时按需切换安全约束而无需为每条规约单独训练
RAG如同全表扫描:把语义理解从查询时挪到摄入时编译成索引,检索准确率85.2%仅用2.2k token优于分块法72.5%@16.3k token
用细粒度trace replay解决agentic负载非确定性问题,实现LLM serving系统间的可复现压测与瓶颈定位
综述+实证诊断:扩散式并行起草在多模态(VL/Video-Language/Audio/VLA)投机解码中仍是空白
用轻量 in/out 向量余弦相似度打分,修复扩散式区块草稿头的联合不连贯问题,接受长度提升9-19%
干预式基准揭示:agentic RAG 的事后失败归因在 hop 1 准确率0.91,但一旦故障传播到 hop 2/3 就完全失灵(0.00)
用 Conformal Prediction 同时约束检索截断与 GRPO 训练置信度,缓解 RL 搜索 agent 的证据丢失与过度自信问题
用专属视角的怀疑者人格辩论树+合议庭复核,从科学论文中挖掘未言明的局限性,精确率提升79%
用目标模型蒸馏的父子边打分+状态感知动态预算,让扩散语言模型drafter的树形投机解码提速2.13x-6.36x,开销<0.5ms
把 coding-agent harness 当作企业基础设施而非编码工具,用统一 harness + 凭据范围化工具 + 外置授权逻辑,让"审阅新构建的东西"收敛为"读一份指令文件"。
四个月生产部署复盘:如何在 spawn 时给 Claude Code 实例注入跨后端记忆,绕开每次会话的上下文归零问题
将世界动作模型的未来预测蒸馏成因果 token,让 π0.5 策略在不牺牲实时性的前提下预判移动物体的接触时机
先造一个持久化商业世界,任务从中自然涌现——RL训练后域内域外双双大涨,环境构造能力本身也能被学会(3.3%→83.3%)
CRATE用两阶段VLM-as-judge做移动智能体轨迹评测:步骤级后果推理消解上下文过载,AndroidWorld F1达0.833,并衍生出安全评测版CRATE-S
真实 GitHub 修复数据验证:确定性三元组覆盖式记忆 MemStrata 把 RAG 的陈旧事实错误率从 36-38% 压到接近 0
严谨预注册审计揭示:软件agent跨会话记忆最好方案通过率仅53.89%,无记忆基线仅11.67%
AgentTeam-Shared-Knowledge 内部报告全文转载,含目录锚点,适配手机阅读
Agency三维类型学:从能力、自主性、意图性三轴统一定义LLM agent,厘清术语混乱
PolicyGuide:工作流级政策合规,agent执行前自动校验操作是否符合组织政策约束
MidTool:预训练中期插入工具使用训练,比后训练更高效地习得工具调用能力
跨任务技能迁移:从已有工具调用经验中抽取可复用技能,迁移到新任务降低样本需求
SAPO:单轨迹agentic RL,无需多轨迹对比即可稳定训练,降低采样成本
自适应推理模式:LLM何时快想何时慢想,动态切换提升效率而不损准确率
最优技能选择:双目标保证——覆盖率与效率的可证明权衡,agent技能组合的理论基础
Thinkingbox:有状态商业工作流benchmark,测LLM能否在复杂业务流程中维护状态并完成多步任务
ReCache:工具增强型agent的KV缓存复用,减少重复工具调用的推理开销
结果监测器:沉默式工具失败检测,agent无需感知工具内部即可识别失败
认知陷阱基准:测量LLM记忆使用中的虚假记忆、过度依赖、混淆等认知偏差
记忆承诺边界:LLM何时应从检索转向参数记忆,混合记忆决策框架
超越记忆多数投票:隐源推理解决LLM知识冲突,判断该信任哪个来源
记忆状态追踪基准:动态环境下agent能否准确维护多实体状态
韵律信息被表征但被忽略:因果分析揭示LLM系统性低估语调信号
语音韵律→任务决策基准:8种韵律变体×多任务,测LLM能否从语调听出用户意图
具身鸿沟调查:模型泛化≠能在特定机器跑,两轴图显式化可复用部分与新本体适配工作
搜索规则也可强化学习:RP1 全离线学改进计划,roll-out 少 1000×,快 67×
SkillGate 双信用通道修 selector credit starvation:9B 策略 40.8%→53.2%
反向树+逆序更新:从结构上拆掉多轮 agentic RL 的上下文错配/信用弱/异步漂移
波动感知时空记忆演化:确定性证据评分保跨会话身份,Tri-Memory 存状态+历史
多源碎片观察融合成连贯情景记忆:事件层原子+簇层融合,因果图保溯源
可逆遗忘:企业 agent 记忆三态(活跃/休眠/退役),条件回归时可复活,滞回控制防振荡
VLA 监测多 agent 隐状态共谋通道:同质 agent 检测 AUROC 0.993
贝叶斯跟踪伙伴技能,只在矛盾时打断重规划——信念-行动差距大幅收窄
LLM 当 20 年足球俱乐部经理:26 工具 340-400 决策点,15 个前沿模型首个头对头长程评估
开放任务 TTS 瓶颈在利用不在探索:奖励模型与真实质量相关仅 ρ≈0.12
AFANet 轻量 GNN 做多 agent 失败归因:近零推理成本匹配或超越 LLM 基线
多闸门预执行控制会互相干扰:补救算子不交换,补救顺序是控制面语义而非实现细节
循环 LM 做组合式工具调用:循环深度越大多步准确率越高,自适应推理算力更优
音频-语言模型只用对齐阶段:双冻结只训投影器,匹配或超越重 post-training 基线
真·token 级流式 TTS:因果承诺+语音状态继承,低延迟对话系统不再等句末文本
GigaBrain-0.7:三系统架构统一理解/预测/动作 + 3.7 万小时异构数据 + 单阶段对齐,跨本体泛化
Null Token Knows:ASR/NMT 的 message-free 幻觉抑制,null token 分数携带可用弃权信号
SEER:视觉扫描选相关图、只在需要处回文本检索,视觉压缩效率+文本推理精度结合
TRCA:从 action-induced transition 直接导出 step 级监督,Evidence/Execution/Invalidity 三 rubric,无需成功锚
MELD:联邦 agent 记忆一致性协议,五结果接纳程序 + 三信号裁决 + 可审计 Patch + CRDT
HyperSkill:超图结构技能记忆,subtask+技能双节点,双路径检索按共现排序,结构知情维护
QUMem:语义连续性切可变长 episode、同交互多信息拆独立单元,查询条件的用户状态推断
BRA-Audit:把多 agent 审计调度建模为固定预算下的审计点放置,按累积暴露度贪心优化
Vending-Bench Arena:13 个 LLM 一年期经济模拟,2583 封 agent 间邮件 12.6% 含错位 speech-act
幻觉雪球:顺序多 agent 管道交接不验证,幻觉逐跳变形逃逸,四级逃逸概率 24.6%/48.3%/89.3%
CAPO 原-对偶方法把系统提示词当可优化变量,在操作约束下优化,无需领域监督数据
AGENTCHAOSBENCH:工具/模型/guardrail/agent 边界注入 10 类故障,从遥测检测定位运行时失败
work item 跨调用持久身份+版本化权威状态,结果经校验才推进——长程 agent 的统一执行模型与跨会话交接
RUPA:把执行历史建成轨迹图,不确定性沿时序/语义依赖传导,捕获根因在多步之前的失败
异步并行推理:temporal confidence 单一信号驱动剪枝/退休/续跑,branch-level 延迟决策与 duplex 推理层同构
今日 duplex 头条——双 full-duplex 模型实时互听执行剧本,对话 timing 交互驱动地自然涌现,内容/时序/声学三层解耦
反应关键操作评测补位:ReflexBench 六动态任务+可配延迟;ReflexVLA 潜在未来预测+多帧时序融合增强时序推理,批式视觉编码降延迟
设备端长时记忆 benchmark:一年级移动经验为基底,knowledge-grounded 合成时序一致长程轨迹,文本+多模态覆盖多跳/时序推理与隐式偏好
tokenizer-agnostic on-policy 蒸馏:共享文本空间只对齐同跨度 token,reference KL+终止 token 掩码稳住分布;Intern-S2-Preview ProofBench +21.2 超 Gemini-2.5-Pro
大规模多语言 GRPO 实证:母语推理训练离英语差距小、跨语言迁移强,但特定模型-语言组合会严重回归,需配广泛评测
知识(FFN)与推理(Self-Attn)解耦:Mobius 全局共享 Memory 反复查询;7B 用 62.6% 数据达同分,Intern-S2-Mobius 同分下近 4x 端到端加速
Behavioral Lift 揭示 Amplification-Lift Gap:thinking 模型强放大自我修正/不确定承认,但最高 lift 是置信校准——训练放大表面形式而非最强正确信号
SELR 单模型双目标:Answer Loss 优化潜在轨迹出答案,CoT Loss 训练同模型把隐表示解码回可读步骤,隐式推理不再黑箱
语音侧最贴近 duplex 的进展:LLM 文本 token 流直接驱动、控制 token 显式中断、无输入输出静音、mid-utterance 打断不重置 KV cache
把「从多源下结论」拆成证据解释与决策聚合两半;四字段证据元组固定两半,pooled 校准 log-likelihood 比率修复 count-scale drift
错误答案常含可用结构:DHD replay 协议测轨迹价值,5 benchmark×2 模型族全现 wrong-helpful,改变最终正确性的错误消息中 >40% 有益
给 agent 灌输主动探索能力:探索密集轨迹合成缓解后视偏差,对比轨迹对 RL 区分生产性探索与冗余游荡
长程执行出错后缺恢复能力:AgentRewind 记录 agent 上下文与环境对齐 checkpoint,可回到早期状态带前次尝试信息续跑
技能有效靠「程序锚定」稳定执行(占 65.7% 而非注入知识 4.5%);检索是独立瓶颈,池 5→100 时实际使用精度 29.6%→3.3%
把跨会话交接形式化为「任务相关 ICL 状态传递」:预测等价性刻画最粗充分交接 + 固定 bit 需求,提出三段式交接记录
把经典 ACID 事务语义重解释为 agent 执行的四个语义保障,用探索-执行-验证循环落地,广泛 benchmark 比含 Claude Code 在内的 SOTA 高 10.6%
ReAct 行动/观测间隙是推理空闲窗口:fork 四条辅助分支与主循环并行解码,把附加推理移出主线程串行路径,turn 数全降、Pass@1 不损
精读 · 技能演化安全 · 不安全成功变持久策略
精读 · VLA · 从动作学注意力视觉瓶颈
精读 · VLA · 失败知情自进化驾驶
精读 · 世界模型 · 接触前执行监控
精读 · 世界模型 · latent planner 目标函数瓶颈
精读 · 世界模型 · JEPA 鲁棒性诊断
精读 · RL · 按实例路由蒸馏 vs GRPO
精读 · RL · CrEST verifier 天花板内的稠密信用分配
精读 · RL · 阶段级优势替换轨迹级信用分配
精读 · 多智能体 · 独立假设失效,有限样本无假设证书
精读 · 多智能体 · 通信拓扑的因果归因解释
精读 · 多智能体 · 隐状态对齐的无训练潜在通信
精读 · Agent 记忆 · 检索机制作为可进化技能
精读 · Agent 记忆 · 线索锚点+关联扩张的联想回想
精读 · Agent 记忆 · 片段级批处理合并,构造 token 省 86%
精读 · Agent 记忆检索 · 零结构化预处理胜过图/树记忆
测试时强到弱能力迁移:builder构建推理harness,弱模型无参数更新ToM性能0.49→0.91,增益来自卸载不稳定推理进确定性代码
面向非专家的奖励函数设计流程:目标→结果变量→因果DAG子集→偏好elicitation,保持无冲突可行权重域
BENCH2ROBUST把无故障工具基准转成受控随机环境,BTM无重训提升16.8pp,与RL结合达40.8-45.5%
技能诱导失败差分归因:看似相关技能反导致错误实现或遗漏,Excessive Procedure源于过度验证与重型实现管线
gist压缩保留关系/事件结构却丢弃日期时间,时间问题显著变差;一行提示修改使时间表达保留率提升20倍
先诊断失败类型再裁剪恢复干预的DARC harness,让自修正从提示扩展变为恢复接口设计,ALFWorld/AppWorld/XBRL均提升
单流自回归VLA:推理与动作共享一套权重,R1真机76.7% vs π0.5的53.3%,VLM从上下文编码器变回决策者
学习式记忆巩固:Consolidator把路由STM变换累积进LTM并反哺路由,仅12.35K参数提升更新映射召回至87.02%
词典锚点映射+潜在增强桥接解决异构LLM通信的实体grounding难题,7任务全胜文本通信且延迟低11×
Principal-Subspace Overlap诊断rollout RL几何漂移,硬双边正交投影约束更新到互补子空间,超越GRPO/DAPO/GSPO
长生命周期Agent状态治理:激活契约解耦候选评估与原子激活,280万可达状态零不变量违反
SFS-DPO两步RL框架:先强化步骤级推理,再显式训练自验证自修正,教师辅助变体注入错误验证rationale
WAM延迟瓶颈:anticipation token一次前向构造完整未来K/V缓存,行动chunk延迟降68-89%,LIBERO 98.8%
工具架构(能力如何组织暴露)独立于能力集合改变编码Agent行为:CodeAct式接口省41.6%步骤与56.3% token
冻结模型参数,通过目标环境rollout演化可复用技能与上下文代码harness,train-free具身适应
可编辑见解图做失败感知的记忆维护,区分可复用与冲突/失效见解,跨骨干模型一致超越记忆基线
JEPA-WAM: Stage-Level Joint-Embedding Prediction for World-Action Models in Robot Manipulation
Detecting an Effect Is Not Learning to Act on It: A Reward-SNR Floor for LLM Acquisition Agents
TideRL: Boosting Agentic RL Goodput with Readiness-Aware Scheduling
VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?
ComBodied Agents: a New Paradigm of Human-Centric Agentic AI
Self-Correcting Long-Horizon Search Agents via Tree-Structured Memory
Continuous Interaction Diffusion: A Diffusion-Native Runtime for Asynchronous Tool-Augmented Reasoning
Not a Monolith: Lab-Level Divergence in the Cooperative Equilibria of Chinese Frontier LLM Agents
Co-Evolution in Agentic Systems: Toward Self-Directed Evolution Beyond Human Design
Why Does CLAUDE.md Keep Growing? Catastrophic Remembering in Agentic Coding
SkillZip: Evaluation-Free Skill Compression for Self-Evolving Agents by Discovering Reusable Structure
Persistent Recursive Worlds Enable Autonomous Software Evolution
MAP-Graph: Provenance-Aware Shared Memory for Multi-Agent Workflows
From Faulty Memories to Corrected Actions: Dependency-Guided Rollback Repair for Memory-Augmented Agents
Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence
X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction
DuplexWorld: full-duplex voice agent benchmark — 6 worlds, 11 conversation types, turn-taking as independent metric. 用户指定精读,duplex 核心方向直接命中。
Social Gym verifiable multi-agent social skill benchmark
MoRSE role-subtask specialized LoRA experts for multi-agent LLM
MasDrift authorization drift benchmark for multi-agent delegation
POLIS institutional governance safety for multi-agent systems
TAMS task-aware multi-view adaptive streaming teleoperation
Agentic Harnesses LLM-judge verification layer for robot plans
Latent world model with Monotone Cost Ranking for navigation
WorldSimProbe simulator fidelity evaluation for world models
Auto-research as greybox fuzzing control loop
CTDE + HRA real-world online RL for robots
BCSD bidirectional context self-distillation for skill-based RL
CoRE consensus rewards via equilibrium for test-time RL
LAVE latent visual evidence for video tool agents
HyMeS hybrid memory for VLA robot manipulation
Muscle Memory compilation for personalized agents
Streaming dialogue summarization — ReMEMBER missing-evidence memory framework
持久世界状态记忆+自我工作状态记忆,把反应式 VLA 变成带状态追踪的长程操作
语义-动作解耦双时间尺度 TD3,冻结视觉主干分开优化语义级与动作级策略
long-horizon end-to-end 直接预测训练,让梯度沿整条轨迹影响传播
TTS 建模为计算分配问题:下一个单位算力花在生成、验证还是停止
可渐进精化原型树做 KV 全局分配,分辨率与覆盖率预算跨层/头自由流动
轨迹相对 hindsight 蒸馏 + turn-aligned 打分协议,轮次间信用对齐分配
diff-in-diff 政策优化:把代码 agent 信用分配细化到 diff 级优势
两层信用分配:TD残差做动作信用,teacher-student似然差距做token分配
事实记忆+情感记忆双检索,冲突感知执行控制器整合,更类人的 agent 记忆
训练-free 记忆蒸馏:把小模型 agent 注入 teacher 的结构化记忆
记忆压缩后知识地位能否存活的关键是显式性而非长度
可证伪记忆:TEPA 把记忆有效性变成显式状态,trial-validated 撤销过期记忆
非平衡统计物理解释 agent 交互涌现——交互是不可约的动力学源
用 evolvability 引导技能树搜索,区分过拟合尖峰与宽阔平台
近端文本梯度下降优化 agent 技能,闭式前向更新+校验门控收缩
Long-horizon agent 综述:规划/记忆/执行/训练/评测五维缺口(horizon gap)
补充精读:原生全双工 Speech-Language-Action 模型,160ms 共享时钟联合解码,语义驱动打断控制 + 会话中工具调用,与 DuplexOmni 架构对照
DuplexChat-Pipe 流水线从公开播客构建41.5万小时说话人分离全双工对话语料,规模超越Fisher/CallHome,但尚无下游SDLM训练验证
L0-L3架构层级、T×I×R交互本体、决策状态机三框架审计全双工语音系统,揭示"实现差距"与"表面vs实质双工"
四阶段训练流程 + clipped重要性采样 + 训练-推理ratio校正,把zero RL扩展到万亿参数规模,涌现5种认知行为
DuplexPO 精读:FCDR + 动态关键窗口 + GRPO 的全双工 RL 训练,RL 扎实度评估,可借鉴点分析
Moonshot AI技术报告精读。Length penalty原始公式、Long2Short四种方法(模型合并/最短RS/DPO/Long2Short RL)详解,Partial Rollouts基础设施,k1.5→DIET→f(g(x))谱系分析。
DIET:难度感知 token 压缩,GRPO Advantage Weighting 修复,同时提升准确率与降低 token 用量
精读:MAS 通信效率可训练;三元奖励 + MCTS-DPO 迭代范式;DIET 与 f(g(x)) 的思想谱系
DLCoT/Recon/ASTER/WebSailor/Behavior Priming 五篇精读综合:五篇独立论文从不同角度收敛到同一结论——训练数据的行为质量决定上限,结果正确性只是必要非充分条件。
CMU LTI:识别4类有益推理行为(信息核实、权威性评估、自适应搜索、错误恢复),SFT行为灌注后跑RL,比直接RL提升+37.2%。
Alibaba Tongyi:开源web agent与专有系统差距的根源是不确定性缩减能力,不是工具机制。DUPO算法 + 信息遮蔽训练数据,BrowseComp-zh 30.1%。
Interaction Collapse 问题与高密度 SFT 冷启动方案,4B 超越 235B — 华为+南大
推理质量应用重建保真度衡量,而非后验合理化 — UC Berkeley
长 CoT 蒸馏质量的关键是主干内部的多样性,而非纯净度 — Alibaba+NYU
综合27篇论文、19个benchmark,提炼LLM agent跨领域失败模式统一分类法
Uber AI 的 agentic RL 仿真平台:三维度奖励设计,纯结果奖励导致40%约束违反
精读:UI-MOPD 多教师在线蒸馏解决跨平台 GUI agent 灾难性遗忘问题,OSWorld 38.2% / MobileWorld 12.0%
深读:A-TMA — Agent 长期记忆状态失效解耦(三层框架 + 内嵌论文图表)
AgenticSTS 深读笔记 — 有界记忆合约测试床
四篇论文结构化精读:做了什么 / 评估设计 / 结果 vs 基线。含论文切换、结果对比多视图、图片放大、阅读模式等交互
TMax / OpenThoughts-Agent / Autodata / AgentSkiller 四篇论文图文并茂深度精读