← 首页|学术|2027 上半年智能体方向判断(全文)
项目研究 · agent-kernel/design · 2026-08-20

2027 上半年智能体方向判断:可能出现大动作的研究与产品主题

luyaxi · AgentTeam-Shared-Knowledge(内部知识库全文转载)
duplex-omni-agentagent-kernel2027-h1趋势判断
说明:本页是知识库原文 projects/agent-kernel/design/agent-direction-2027-h1.md 的全文转载(未删减、未摘要),仅做排版适配以便手机阅读。文内相对链接已转换为可跳转的 GitHub 链接(私有仓库,需登录查看)。查看 GitHub 原文
目录
  1. 综合判断
  2. 支撑能力与延伸机会
  3. 三条主线的基础能力成熟度
  4. 方向地图:当前基础、下一阶变化与证据
  5. 我们的具体做法与合理性
  6. 为什么这组组合值得押注
  7. 1. Life-long Agent:长期记忆、长程运行与能力积累
  8. 2. Omni / Realtime Agent:从“轮次对话”到“持续在场”
  9. 3. Autonomous Research Agent:从搜索工具到“发现式工作流”
  10. 4. Self-evolving Agent:从“完成任务”到“持续变强”
  11. 5. Multi-agent Organization:商业产品已经进入“agent 组织”阶段
  12. 6. Computer-use Generalist:从演示操作到真实工作流
  13. 7. Proactive Agent:从等待指令到理解何时该行动
  14. 8. Meeting / Ambient / Artifact UX:从摘要到承诺与可接管行动
  15. 9. Self-supervised / Open-ended Agent Learning:从任务奖励到能力发现
  16. 10. Software Factory / Coding Agent:从写代码到软件交付
  17. 11. Skills / Capability Store:经验成为可安装能力
  18. 12. MCP / Tool Ecosystem Agent:工具网络成为平台层
  19. 13. Enterprise Workflow 与 Vertical Professional Agent:从聊天到业务交付
  20. 14. Agent Reliability / QA / Observability:能做还要能证明做对
  21. 15. Trustworthy Autonomy / Security:代理权成为上线门槛
  22. 16. Agentic Commerce:从推荐到代表用户产生经济行为
  23. 17. Artifact-native Workspace / Creative Agent:交付物成为界面
  24. 18. Agent Experience / Data Flywheel:经验数据成为护城河
  25. 19. Environment / World Model:可生成、可验证的工作世界
  26. 20. Agent Protocol、Identity 与 Marketplace:从内部组织走向开放委托
  27. 21. Personal Event-driven / Meeting Agent:维护时间线并适时介入
  28. 22. Robotics / Embodied Agent 与 World Model:物理世界的高关注观察位
  29. 23. Companion、Education 与 Multi-agent Economy:值得观察但不主押
  30. 这些方向之间会怎样合流
  31. 我们的建议:关注顺序
  32. 网络恢复后的增量判断(2026-08-20)
  33. 最后的判断
  34. 证据入口
  35. 证据边界与后续观察

2027 上半年智能体方向判断:可能出现大动作的研究与产品主题

先读半页版2027 H1 Agent 方向半页摘要。本文件保留完整证据、方向地图和专项底稿索引。

本文是趋势判断,不是技术路线图,也不是对单篇论文结果的确认。我们主要看了四类公开信息:论文和预印本,公司的产品发布和官方说明,开源项目与公开测试,以及团队对 DSH/Cordis 和商业编码智能体的专项调研。对每个方向,我们都问四个问题:现在已经能做什么?真实使用时会卡在哪里?有没有人在解决这个问题?明年上半年有没有可能出现产品、开源项目或重要研究进展?只有会议热度、单篇论文、单次演示或厂商自报结果的方向,不直接写成高概率主线。

判断顺序是“今天能做什么 → 用得更多后会遇到什么麻烦 → 哪些新方法正在补这个短板 → 明年上半年是否可能形成产品或研究突破”。因此,长程任务、多智能体、研究和实时交互在本文中首先是出发点;方向地图重点写它们结合后可能产生的跨会话状态、多会话组织、多模态记忆、环境预测和故障后继续工作的能力。“高概率”只表示证据较多且有落地机会,不表示问题已经解决或一定会按时发布。报告无法覆盖公司内部项目、突发的模型 / 价格 / 监管变化,以及可能突然升温的机器人、陪伴、消费交互和开放式自我演化;这些方向保留观察位,并与“现在应当投入”的主线分开。

证据分级

等级 公开材料 可以支持什么 不能支持什么
A 正式 conference paper / proceedings / 已核验 benchmark card 研究问题和受控结果存在 不等于生产采用或开放世界可靠
B Findings、正式 workshop/challenge、开源技术报告、官方产品/文档 方向扩散、产品形态和早期需求 不等于跨供应商互操作或真实成功率
C arXiv、OpenReview submission、匿名 workshop、厂商自报结果 研究假设、弱信号和待核方向 不能写成已解决结论
D 会议议题、征稿、新闻、融资或单次 demo 注意力和潜在资源流向 不能证明方法有效或市场规模

主报告的“高概率”表示至少有两类信号交叉,且存在清晰的产品/采用路径;具体材料仍以各波次底稿为准。

综合判断

证据如何支持这个判断

这次调研最有说服力的不是某一篇论文,而是四组材料指向了同一个变化。第一,CodexClaude Code Agent TeamsCursor Cloud Agents 都开始把“后台任务、并行工作、隔离环境和人工合并”做成产品功能,说明用户需要的已经不是一次回答,而是一个可以交付结果的工作单元。第二,OneDayAgentSynthetic ComputersSWE Marathon 等工作把任务时间拉到数小时、数天甚至更长,说明“任务能否持续运行”正在成为新的能力边界,但它们还没有证明开放环境下已经可靠。第三,GPT-LiveSeed 全双工MemLens 等材料把实时交互和多模态历史带到前台,说明系统必须理解连续的语音、屏幕、文件和工具过程,而不只是处理一段文本。第四,DeepSeek Harness 持久子智能体Agent Teams 开始解决持久会话、消息邮箱、任务依赖和恢复问题,说明真正的瓶颈正在从“模型会不会调用工具”转向“系统能不能在中断、协作和故障后继续工作”。

这些证据不能推出“通用自治已经实现”,也不能证明某一家产品内部一定采用某种多智能体架构;它们能支持的较强结论是:产品形态、研究任务和底层运行时正在围绕同一个问题收敛,即如何把模型变成可持续交付的工作系统。

三条近场主线

近场主线 现在已经看得见什么 当前卡点 2027 H1 可能出现的升级 我们如何验证
长期智能体 OpenClaw 等个人 harness 可以通过对话派发后台子任务;OneDayAgentSynthetic Computers 把任务拉到小时和天级;DSH/Codex 已公开持久线程和恢复机制 状态仍常绑定当前会话;任务拆分、唤醒、失败处理和模型更换缺少稳定规则 消除“会话边界”,形成有稳定身份、检查点、工作记忆和可恢复执行的长期 worker 同一任务跨天暂停、换模型、重启后,能否继续完成且不重复副作用
全双工智能体 豆包 Seed 全双工GPT-Live 已展示持续倾听、自然停顿、打断和实时响应 目前仍以语音体验为主;情感支持、生活服务、屏幕和后台任务的结合尚未稳定 从“语音功能”变成更像电话的日常入口,扩展到低风险陪伴、提醒、查询和生活安排 在噪声、犹豫、抢话和改口时,能否自然接话、及时取消动作,并把后台结果带回当前交流
多智能体并行 Codex MultiAgent V2、Claude Code Agent Teams、Cursor Cloud Agents 已支持并行或后台工作;NL2Repo-Bench 将完整代码仓库生成作为长程任务 并行是否真的提效取决于拆分、合并、冲突处理和验证;“64 个 agent”在 CDC 中只是公开 prompt 要求,非已核验运行事实 从固定 fan-out 变成按难度动态增减 worker,并引入角色分工、任务图、独立 verifier 和关键节点审批 与单 worker 对比总耗时、返工率、错误率、验证覆盖和人工合并时间,而不是只统计 agent 数量

1. Life-long Agent:从记忆概念走向真正的长期工作

OpenClaw 类个人智能体已经展示了通过对话派发子智能体、让系统在后台继续做事的产品形态,但任务拆分、唤醒和失败处理仍主要由模型临时决定。DeepSeek HarnessCodex MultiAgent V2 已公开持久会话、线程图、消息和恢复机制,OneDayAgentSynthetic Computers 则把任务时间推向小时和天级。由此判断,明年最容易出现的升级是:session 不再是系统边界,智能体变成有稳定身份、任务状态和工作记忆的长期 worker。用户今天交代目标,明天回来仍能继续;中间可以暂停、换模型、增加专业 worker、修改目标或人工接管。关键验收不是记住多少,而是恢复后能否继续做对。

2. 全双工智能体:从语音功能走向拟人化的日常入口

Seed 全双工 已把豆包语音从轮流说话推进到持续倾听、自然停顿和快速响应,GPT-LivePersonaPlex 则把持续对话、声音和角色控制推到产品与研究前台。下一步用户最容易感知的变化,是更像电话的交互:能听懂犹豫和打断,知道何时接话,并在通话中完成查询、提醒、安排和简单操作,逐渐进入情感支持和生活便利场景。随后语音会和屏幕、摄像头、文件及后台任务合流。关于通信厂商围绕“豆包电话”讨论上行带宽扩容的说法,目前尚未找到稳定可核验的原始公开链接,暂不作为结论依据。

3. 多智能体并行:先解决效率,再形成新的组织能力

OpenAI 的 CDC 研究 prompt 公开提出动态分配研究路线和最多 64 个并发 agent,但公开材料没有证明这次任务实际运行了 64 个 agent 或持续了 8 小时。更可靠的信号来自 Codex MultiAgent V2Claude Code Agent TeamsCursor Cloud AgentsNL2Repo-Bench:多个 worker 已经可以并行搜索、编码、测试和验证。下一步不会只是“多开几个模型”,而是根据任务难度动态增加或裁撤 worker,让 planner、执行者、测试者和 verifier 使用不同上下文和权限,并通过任务图、消息和版本化产物协作。第一阶段是并行提效,第二阶段是形成可恢复、可审阅的工作组织。

这三条主线共同指向一个更具体的产品愿景:智能体的产品单位从一次对话变成一个可持续交付的工作过程。 用户给出目标后,系统建立跨天保存的任务;按需组织多个 worker;用语音、屏幕、文件和工具推进;留下产物、证据和责任记录;允许暂停、改目标、接管和审批;失败后从检查点继续,而不是重新开始。软件交付、研究分析和企业流程最可能首先出现这种“可暂停、可恢复、可审阅”的半自治系统。

组织记忆、多模态记忆、Agent World Model、自主研究、受控自我演化和可逆运行时仍然重要,但更适合作为三条主线的升级能力,而不是九个平行赛道。机器人、陪伴和开放式智能体经济可能带来新闻级发布,但目前不应与上述主线投入等量齐观。

三层优先级

  1. 近期主线:三类用户能直接感知的产品变化。长期智能体先解决跨会话、跨天运行;全双工智能体先进入电话式交互、情感支持和生活服务;多智能体先用并行 worker 缩短复杂任务的等待时间,再发展为带分工、验证和交付的工作组织。
  2. 主线的支撑能力。多模态记忆、组织记忆、任务图、可逆运行时、权限、安全、评测和可回放环境,决定上述三类产品能否稳定工作;它们是必须建设的底座,不是与三条主线平行的独立产品机会。
  3. 中期扩展和观察项。自主研究、Agent World Model、受控自我演化、交易、机器人、陪伴和开放式智能体经济会继续出现论文、开源项目或新闻级发布,但当前验收标准和落地路径更弱,暂不与三条主线等量下注。

支撑能力与延伸机会

当前被广泛讨论的长任务、记忆、多智能体、研究和实时交互,已经是三条近场主线的基础变量。下面的表格不再把这些内容当成彼此独立的赛道,而是列出它们规模化后会需要的支撑能力和可能出现的延伸机会:

下一阶方向 为什么可能在 2027 H1 升温 当前证据与不确定性 外部来源
智能体组织管理层 企业从少量试验走向多智能体部署后,需要统一登记、分派、授权、成本、绩效和撤销 企业平台、MCP/A2A 和编码智能体已提供早期接口;绩效与责任模型仍未统一 CodexClaude Code teamsCursor Cloud Agents
组织记忆与工作关系图 多天任务和多个 worker 会产生项目、目标、任务、负责人、产物、证据、决定、权限、依赖和失败记录;普通聊天记忆无法回答“谁负责、为何决定、从哪里继续” 长期记忆、工作空间和跨 worker handoff 研究密集;下一步应从静态知识图升级为可查询、可更新、可撤销的工作关系,支持交接、依赖追踪、冲突解释、过期判断、责任回溯和权限传播;关系抽取、状态一致性和隐私边界仍未充分验证 MemLensSynthetic Computers at ScaleWorkSpaceBench
可演化能力的生产与分发 技能、检查器、工作流和评价标准会成为可测试、可版本化、可回滚的能力资产 SkillsBench、奖励/工具演化和注册表已出现;质量、安全和收益分配仍是空白 SkillsBenchAnthropic skillsMCP Registry
受控的智能体交易网络 购物、采购和服务调用需要身份、预算、期限、结算和争议处理,智能体将从“调用工具”转向“代表主体谈判” Agentic Commerce Protocol、支付网络和智能体身份有产业信号;真实交易量和责任闭环尚未证明 Agentic Commerce ProtocolVisa Intelligent CommerceMastercard Agent Pay
可持续工作环境与训练世界 长期能力增长需要可生成、可重置、可验证的电脑、代码库、企业流程和研究环境 合成电脑、工作空间基准和环境生成研究提供弱到中等信号;迁移到真实业务仍不确定 Synthetic Computers at ScaleGUI-GENESISCUA-Gym
研究组织与知识生产闭环 研究智能体会从写报告转向维护问题、安排实验、反驳结论、更新知识图和决定停止 Deep Research、AI Scientist、研究型多智能体已有模块;开放世界新发现能力仍未证实 QuestApodexGoogle AI co-scientist

这张表中的方向比“再做一个更长上下文模型”更可能代表下一轮竞争,因为它们对应的是规模化使用之后才会出现的组织、经济和基础设施需求,而不是当前单个模型的能力展示。

三条主线的基础能力成熟度

下表描述三条近场主线目前所依赖的能力和场景成熟度,不等同于九个平行赛道,也不等同于 2027 H1 一定会出现的新增产品。

方向 2027 H1 延续概率 近期信号强度 作为基础的判断
Life-long Agent / Long-horizon Execution 不只是个性化;核心是记住工作、持续跑任务、跨任务积累能力
Omni / Realtime Agent 产品化最快,语音只是入口,核心是连续交互与主动行动
Autonomous Research Agent 研究和知识工作场景最容易率先出现高价值闭环
Self-evolving Agent 会从论文里的 reward / verifier 演化,走向持续改进产品
Multi-agent Organization 商业 coding agent 已进入并行任务、subagent/team、后台 agent 和隔离工作区阶段
Computer-use Generalist GUI、CLI、API、browser 和企业软件进入同一真实工作流
Robotics / Embodied Agent 中高 中高 新闻和研究信号密集,但真实部署仍受硬件和安全约束
Proactive Agent 中高 价值很大,但打扰、信任和责任边界仍是主要障碍
Self-supervised / Open-ended Agent Learning 中高 可能是研究突破点,短期不一定成为完整产品主题

下面逐条说明:为什么现在可能爆发、哪些公开信号支撑、可能出现什么“大动作”,以及我们应该如何理解自己的位置。

方向地图:当前基础、下一阶变化与证据

下面的表格不把 35 个名词当成 35 条赛道,而是将它们归并为 20 个可观察方向。前三列描述“现在已经具备的基础”和“明年可能发生的变化”,第四列给出判断理由,最后一列给出可追溯来源。概率含义是:高 = 至少有产品/产业与论文/benchmark 两类信号;中高 = 有明确先导信号但仍受部署条件约束;中 = 主要是研究或平台试点;观察 = 尚缺少可验证的规模化路径。

方向 当前基础 2027 H1 可能变化 判断理由 主要来源
智能体组织管理层 Codex、Claude Code、Cursor 已提供并行任务、后台执行、隔离工作区或子智能体入口 从“创建一个智能体”升级为登记、分派、授权、计费、绩效和撤销一组智能体 智能体数量增加后,组织管理和责任归因会成为企业控制面;单纯增加 worker 数量不能解决协调成本 CodexClaude Code teamsCursor Cloud Agents
多会话通信与协作 前台对话、后台任务、子智能体和设备端已经分别出现,但会话之间通常缺少统一状态和事件语义 用事件总线连接用户会话、后台 worker、验证 worker 和设备端,支持顺序、取消、交接、权限继承和冲突处理;重启后还能按消息编号去重恢复 多智能体真正扩展后,瓶颈会从“能否调用多个模型”转向“多个会话能否组成可恢复系统”;DeepSeek Harness 的持久邮箱和任务图把这一问题具体化 A2AA2A samples/TCKClaude Code teamsDeepSeek Harness Agent Teams
Life-long Agent:跨会话持续工作 长程任务、合成电脑和后台编码任务已经把运行时间从单轮扩展到小时级 任务跨会话、跨设备、跨模型和跨 worker 恢复,并把成功经验转为可复用能力 Life-long 的关键不是偏好记忆,而是任务、状态和能力连续;恢复后能继续做对才是核心验收 OneDayAgentSynthetic Computers at ScaleSWE Marathon
软件交付工厂 编码智能体已经能处理部分需求、修改代码、运行测试并返回变更 从单个编码任务扩展为需求分派、并行实现、测试、审查、发布和长期维护 代码和测试提供相对确定的验收条件,最容易形成可计量的后台工作单元 SWE MarathonPaperBenchAgents' Last ExamCodex
研究组织与知识生产 Deep Research、研究型多智能体和自动实验系统已覆盖检索、写作、核验等局部环节 维护长期问题,提出假设,安排实验,寻找反例,更新知识图,并决定何时停止 研究交付物可由来源、实验和专业人员复核;但开放世界的新发现能力仍未被证明,因此是中高概率而非确定主线 QuestApodexGoogle AI co-scientistSakana AI Scientist
企业与专业工作流 CRM、ITSM、财务、法律、医疗和科研产品已把智能体连接到业务数据和审批流程 以可安装的工作流包提供任务状态、领域工具、证据、审核和责任收据 企业更容易购买有明确输入、输出、审批和成本的半自治流程,而不是通用员工替代品 Microsoft Copilot StudioSalesforce AgentforceServiceNow AI Agents
全双工多模态智能体 实时语音、视觉输入、流式输出和可取消工具调用分别出现 同时处理语音、屏幕、图像和工具事件;用户可打断,后台任务不中断,系统能处理多路输入输出冲突 全双工的难点是事件调度、打断后的恢复和工具副作用,不是单纯降低语音延迟 GPT-LiveSeed full-duplexSpeculative Interaction Agents
能力包与技能供应链 SkillsBench、技能仓库、插件和工具注册表已出现 技能、检查器、工作流和评价标准具备来源、权限、测试、版本、回滚和分发机制 技能数量增长后,选择质量、依赖风险和版本漂移会比“有没有技能”更重要 SkillsBenchAnthropic skillsMCP Registry
工具与智能体协议 MCP 连接工具和资源,A2A 提供能力发现、异步任务和交付物交换 出现企业私有注册表、协议兼容测试、版本锁定和跨平台回放 协议本身不会解决身份、责任和任务验收;下一步竞争在可治理的互操作,而不是消息格式 MCP specificationA2AA2A TCK/ITK
受控的智能体交易 Agentic Commerce Protocol、支付网络和商户平台开始描述智能体购物和结账 先在预算、期限、商户白名单和人工确认下形成封闭采购/服务网络 交易需要身份、支付、争议和退款机制;因此受控交易比无限额自动购物更可能先落地 Agentic Commerce ProtocolVisa Intelligent CommerceMastercard Agent Pay
可持续工作环境与训练世界 合成电脑、工作空间基准、GUI 环境生成和研究模拟器开始出现 工作环境成为可生成、可重置、可验证、可注入失败并可回放的训练与部署资产 长期能力无法只靠模型和提示词获得,必须有稳定的环境、反馈和反事实样本 Synthetic Computers at ScaleGUI-GENESISCUA-Gym
Agent World Model 环境生成和工作空间模拟器可以提供任务与终态,但多数系统仍依赖即时观察和脚本验证 建立对电脑、代码库、业务流程或物理环境的可预测状态模型,支持动作后果预测、反事实规划和回放 没有环境状态模型,长期任务只能反复试错;世界模型是从“能操作环境”走向“理解环境如何变化”的关键一步 WorldMemArenaGUI-GENESISNVIDIA CosmosGemini Robotics
可靠性、评测与持续集成 过程核验、失败定位、轨迹回放和长程 benchmark 正在增加 版本发布前检查恢复、权限、注入、副作用、成本、人工接管和交付物,而不只看最终答案 生产采购需要可解释的质量和损失边界;评测会从排行榜转向带运行条件的完整记录 OS-ThemisVAGENCUADebug
身份、权限与责任 企业平台已有连接器、凭证、审批和审计入口,安全研究集中于注入和越权 形成可委托、限时、限额、可撤销的智能体权限,以及行动收据和补偿机制 智能体能执行外部动作后,责任边界会成为上线和保险的前置条件 OWASP Agentic AI threatsNIST AI RMF
受控的能力演化 奖励演化、检查器生成、技能迁移和长期记忆研究分别发展 失败轨迹产生候选技能、检查器和评价标准,经回放、未见任务和人工审核后进入能力库 自我改进只有在可验证、可回滚和能避免旧任务退化时才有产品价值 DR Tulu/RLEROS-ThemisLaMer
实时与主动交互 全双工语音、视觉交互和会议总结已经进入产品与研究 实时入口连接后台任务,智能体主动汇报进展、提出候选行动并等待授权 低延迟对话本身差异有限,真正的新价值是把持续交互接回长期任务和交付物 GPT-LiveSpeculative Interaction AgentsPROEVENT
多模态长期状态 截图、视频、语音、文件和工具结果逐渐进入记忆研究 形成带时间、来源、权限和新鲜度的多模态项目状态,而不是简单摘要 多模态证据会直接影响电脑操作和研究判断,但压缩、删除和权限治理仍是难点 MemLensFocusMem
可组合、可逆的 Agent Runtime 事件流、插件、异步调度和组件替换已有框架先例,但通常要求重启或重新建立会话;DeepSeek Harness 已公开持久会话、激活恢复、先进先出邮箱和团队任务图 运行时组件在线插拔,异常时保护现场、局部回退和现场调试,支持异构智能体协作;同时明确会话、循环和工具副作用的恢复边界 DSH/Cordis 讨论把全双工、具身和长周期任务中的动态组合问题提到前台;但会话状态回退、事件顺序、循环依赖和协议遵守仍未充分验证,不能把框架讨论当成效果证明 DeepSeek Harness subagentDeepSeek Harness Agent TeamsCordis paper repositoryA2A
具身任务平台 视觉语言动作模型、仿真和机器人开发平台信号密集 先出现技能注册、仿真回放、远程接管和受控行业试点,而非通用家庭机器人 硬件、数据和安全使通用产品周期更长;软件侧应先做任务契约和验证接口 Gemini RoboticsGemini Robotics on-deviceNVIDIA GR00TPhysical Intelligence π0
陪伴、教育与开放式社会智能 实时人格、长期辅导和多智能体社会模拟已有论文与消费产品信号 可能出现课程状态、关系记忆和社会协作的受控产品 责任、未成年人保护、心理安全和评价标准尚未稳定,暂列观察位 PersonaPlexGPT-LiveCharacter.AI Safety

完整扩展调研底稿见:论文与 benchmark商业产品与生态开放式 horizon scan会议/workshop 波次市场采用波次产品新闻波次安全与协议波次Life-long 波次Multi-agent Organization 波次Research/Evolving 波次Commerce/Vertical 波次Robotics/Embodied 波次UX/Companion 波次Benchmark/Reliability 波次Open-source Protocol 波次

我们的具体做法与合理性

先做一个“长期工作的 agent”样板

把长期任务作为主线产品叙事,选择研究项目或软件交付作为第一批场景:用户给出目标后,agent 可以连续工作数小时到数天;中途留下可读的进展、产物、未决问题和下一步;用户回来后可以继续、改目标、接管或验收。第一阶段不追求覆盖所有个人事务,而要把“任务能否持续做完”做成清楚的样板。

合理性:它同时检验 Life-long 的三种连续性,也天然需要 multi-agent、research、omni 和 computer-use;相比单纯展示记忆召回,更容易证明真实生产力价值。Synthetic Computers at Scale、Kimi K3 和 Agents' Last Exam 已把小时到周级任务带进公开讨论,市场也开始把后台 coding task 当作产品单位。

把多智能体做成“组织工作流”,而不是多开几个模型

围绕 coding 和 research 各做一套可复用组织模板:任务负责人负责拆解和汇总,专业 worker 负责独立产出,verifier 负责找冲突和检查完成度,用户在授权、方向变化和最终交付处做 checkpoint。每个 worker 都有清楚的任务边界,结果以代码、证据表、报告、测试结果或待办状态交付;需要时可以后台运行、暂停、恢复和交接。

合理性:Codex、Claude Code 和 Cursor 已从不同侧面验证了“并行任务 + 隔离工作区 + 异步运行 + 人类 review / merge”的产品需求。真正可迁移的能力是组织和交付,而不是 agent 数量;这也与 Apodex、Quest、DR Tulu 等研究中“执行者与验证者分工”的共同趋势一致。

用 DSH/Cordis 做局部运行时实验,不直接迁移整套框架

DSH/Cordis 更接近面向智能体开发者和长程轨迹生产的底层运行时,而不是开箱即用的 B 端或 C 端应用框架。内部专题讨论提出的热插拔、可逆组件、异步事件和保护现场,确实对应全双工交互、具身动作撤销和跨天任务恢复的共同痛点;DeepSeek Harness 的公开子智能体和 Agent Teams 实现则提供了持久会话、冷恢复、先进先出邮箱、任务图和幂等重放的可观察参照。

我们先在现有 Agent Kernel 上做最小组合横向对比:持久会话与事件日志、稳定子智能体身份、先进先出消息入口、任务依赖图、可回放产物、权限与中断、现场调试和释放审计。沙盒至少验证六件事:组件热插拔是否保留上下文;工具调用被打断后是否能继续且不重复产生副作用;多路事件是否有明确顺序和幂等规则;循环依赖能否被发现并停止;Session/Loop 等有状态对象在故障后能否恢复或明确要求迁移;进程重启后消息、任务和责任链能否重放。通过后只复用有证据的组件,不全量切换协议。

合理性:这条实验线直接检验“长期任务 + 多会话组织 + 全双工交互”共同依赖的运行时边界,也能把 DSH 讨论中的风险转化为可比较的验收项。需要明确的是,公开 DSH/Cordis 材料尚未给出足以证明生产效果的系统实验;我们的结论只能是“值得验证的基础设施方向”,不能写成已经解决的工程能力。

以 Autonomous Research 作为第一个高价值场景

先围绕文献调研、竞品分析和实验复现做 research workflow:明确问题、主动检索、形成证据链、寻找反例、交叉核验、输出带依据的结果,并保存中间过程供后续任务继续使用。评价重点放在结论可复核、发现新信息、减少人工往返和跨任务复用,而不是报告字数或单一 benchmark 分数。

合理性:这是当前论文和产品信号最密集、价值也最容易被研究团队感知的场景;同时能把我们的 research agent、评测和 evolving 积累串成闭环,再将组织模式迁移到其他知识工作。

把 Omni / Proactive 作为入口,把后台工作接回同一条时间线

实时语音、视觉和屏幕交互不单独做成聊天 demo,而是服务于长期任务:用户可以随时询问进展、打断或改变目标,agent 可以在合适时机汇报、请求授权或提交待审结果。Omni 是交互入口,后台任务和多智能体组织才是持续价值来源。

合理性:全双工和实时交互已有密集论文与产品信号,但单纯低延迟问答的壁垒有限;把实时入口接到长期任务和可审阅产物上,才能与已有 Life-long、GUI 和 research 积累形成组合优势。

让 Self-evolving 变成受控的能力沉淀

从成功和失败任务中提炼可复用的工作方法、检查清单和反例,先在新的任务和环境中验证,再允许进入共享能力库;重要变化保留来源、版本和人工确认,不让 agent 仅凭自评结果修改自己的标准。重点观察它是否减少重复探索、提高跨任务迁移,而不是只提高自家 judge 分数。

合理性:Self-evolving 是长期差异化的来源,但也是最容易自我强化错误的方向。把它嵌入长期任务和组织工作流,既能获得持续反馈,又能通过 verifier 和 human checkpoint 控制风险。

共同的验收口径

所有方向用同一组高层问题验收:任务是否真的完成、能否跨天恢复、多人协作是否减少返工、产物和证据是否可审阅、失败能否定位和修正、下一次任务是否因此更快更好。评测报告必须同时给出 task/environment/model/harness/tools/judge/timeout/budget/credentials tuple,以及质量、成本、延迟、人工接管、失败损失和安全副作用;不能用一个没有运行条件的排行榜分数代表 agent 能力。这样可以避免每条线各自追逐孤立指标,也能把研究结果直接翻译为产品能力。

第二波调研补充:把“长期工作”拆成四个可验证闭环

第二波专项材料把原先容易混在一起的热点拆成四个闭环:

  1. 持久任务闭环:one-day/multi-day worker 需要 durable task、checkpoint、pause/resume、handoff 和 artifact-native state;不能用聊天摘要冒充长期运行。Life-long 的第一验收应是恢复后继续做对,而不是记忆命中率。
  2. 组织交付闭环:multi-agent organization 的最小单位是 planner → worker → verifier → human merge,并通过 task graph、shared blackboard、版本化 artifact 和 worker lifecycle 协作。Codex、Claude Code、Cursor 的公开产品形态共同验证了并行任务、隔离 workspace、后台运行和人类合并的需求;未公开的内部 topology 不应被推断。
  3. 研究演化闭环:autonomous research 从检索摘要走向 hypothesis、evidence graph、主动反驳、独立复现、claim checking 和可更新知识状态;self-evolving 则把 skill、rubric、reward tool 和环境变成候选演化对象。所有演化先进入 shadow registry,经 replay、held-out、反例和人工 gate 才能晋级。
  4. 可信自治闭环:身份、授权、供应链、审计、回滚、注入防护和 agent CI 是上述三条线的共同门槛。没有 principal/scope/TTL/budget/receipt,就不能把后台 worker、commerce 或跨 agent 委托扩展到高副作用场景。

这四个闭环解释了为什么“memory、multi-agent、research、evolving、security”不是五个平行项目:前者提供状态,后者提供组织、价值场景、能力增长和上线边界。

第三波调研补充:从数字工作扩展到交易、专业行业和物理世界

这些方向扩大了市场边界,但没有改变优先级:先用 research、coding 和企业内部流程验证长期任务、组织、证据和权限,再把同一套 contract/registry/replay 迁移到 commerce、regulated vertical 和 embodied pilot。

为什么这组组合值得押注

  1. 外部信号已经交叉验证:长程任务、research team、实时 agent 和商业 coding agent 分别来自论文、benchmark 与产品,不是单一实验室的孤立热点。
  2. 内部积累可以复用:memory、omni、GUI、research、evolving 和 Agent Kernel 已有项目入口,组合投入的边际收益高于再开一个独立 agent 题目。
  3. 方向之间会互相放大:长期任务提供反馈,多智能体提供并行和验证,research 提供高价值场景,omni 降低交互摩擦,evolving 把经验沉淀为能力。
  4. 风险可以分层管理:长期任务和研究工作先做可审阅的半自动交付;多智能体先限定在隔离、可回滚的工作区;主动行动和自我演化保留人工授权,不把未验证能力直接扩大到高副作用场景。

因此,我们的策略不是押注某个单独名词,而是先做出一个可跨天工作的 agent,再用多智能体组织、研究场景、实时入口和受控演化逐层增加价值。若长期任务样板无法稳定交付,其他方向即使在 benchmark 上领先,也很难形成真正的大动作。

1. Life-long Agent:长期记忆、长程运行与能力积累

为什么我认为它会成为主线

现在的 agent 大多仍是 session-bound:一次任务结束,经验、项目状态、未完成步骤和失败原因就被丢回数据库或聊天记录。Life-long Agent 不能只理解成“更好的个性化”,至少包含三种连续性:

  1. 任务连续性:一个任务可以暂停、恢复、换模型、换 agent 或交给人处理,而不是超时后从头开始。
  2. 状态连续性:跨 session 保留工作历史、文件 / 代码 / 研究产物、决策依据和未解决问题。
  3. 能力连续性:从过去任务抽取 skill、策略和失败经验,在新任务上复用,agent 随使用变强。

因此,Life-long 的主体不是“记住我喜欢什么”,而是“记得工作做到哪里,并能继续把它做完”。个性化只是其中一个较浅的应用。

可以把任务连续性粗略分成四个尺度:

尺度 典型形态 Life-long 的新增要求
单次长回合 数十步 GUI、coding 或 web 任务 记住中间状态,遇到错误能回退
多小时任务 长研究、复杂 coding、桌面生产力任务 context compact、阶段性产物、暂停 / 恢复
跨天任务 后台 issue、实验、报告和项目推进 durable task state、定期汇报、模型 / worker 交接
跨任务积累 多个项目和长期用户 / 团队工作 skill、失败模式、角色选择和组织记忆迁移

因此,long-horizon task running 不是 Life-long Agent 的一个边角功能,而是从“记忆”走向“持续工作”的中间层。

这条线的信号已经不是单纯的 long context:

可能出现的大动作

我预期会出现四类动作:

  1. 持久任务队列:用户给出目标后,agent 在后台运行数小时或数天,期间可暂停、恢复、询问和汇报,而不是每次交互都重新启动。
  2. 任务状态与记忆合一:agent 保存的不只是摘要,还包括已完成步骤、当前假设、产物位置、失败尝试、待验证事项和下一步计划。
  3. 团队 / 项目 memory:记忆属于项目、代码库、研究课题或组织,并被多个 agent 共享,而不是只属于个人账户。
  4. 能力沉淀:从长程任务中抽取 skill、工作流和反例,迁移到下一台电脑、下一份代码库或下一类研究任务。

关键分水岭

Life-long Agent 的真正分水岭不是 memory 容量,也不是一次能放多少 token,而是:

如果只做“聊天历史摘要 + 向量检索”,我认为很难形成下一轮大动作;更有潜力的是 memory + durable task state + action + feedback 的闭环。Long-horizon running 是 Life-long Agent 的主体,不是 memory 产品的附属功能。

我们应该怎么看

这是我们最应该持续投入的方向之一,但研究问题应从“memory 是否有效”升级为“agent 能否持续把长任务做完”。DuplexOmniAgent 已有 lifelong memory、memory decoding、context compact 和 native multimodal memory 的连续积累;ReinforceAgent 从外部 episodic memory 与 policy 联合优化切入;Plan Mode、GUI 和 AgentPlat 则可以提供真实的长程任务与跨环境执行载体。当前最有价值的判断不是追求一个漂亮的压缩倍数,而是验证:agent 是否能在跨 session、跨环境和跨 worker 的任务中恢复状态、减少重复探索、继续完成工作,并把结果沉淀成下一次可复用能力。

相关入口:projects/duplex-omni-agent/projects/duplex-omni-agent/design/lifelong-memory-roadmap.mdprojects/reinforce-agent/README.md

2. Omni / Realtime Agent:从“轮次对话”到“持续在场”

为什么现在可能出现产品级跃迁

Omni agent 的关键变化不是输入模态从文字增加到音频和视频,而是交互时间模型发生变化:用户不必等 agent 说完,agent 也不必等用户完全停下;它可以边听、边看、边思考、边调用工具,并在用户改变意图时及时调整。

近期信号非常密集:

可能出现的大动作

  1. 语音助手重新成为入口,但产品核心从问答转向持续陪伴、随时打断、边说边执行。
  2. 实时 agent 与后台 agent 合流:前台负责低延迟互动,后台负责搜索、规划、整理和长任务,结果持续回到同一条对话时间线。
  3. Omni agent 进入屏幕和环境:不只听语音,还持续看屏幕、摄像头、文档和周围环境,并主动采取操作。
  4. 实时交互出现独立评测与训练范式:timing、interrupt、correction 和 proactive response 可能成为新的模型竞争指标。

关键分水岭

Omni agent 是否能形成真正的产品跃迁,取决于它能否处理四件事:

因此,单纯把语音 tokenizer 接到 LLM 上不会自动得到 omni agent。真正有价值的是“连续感知 + 连续行动 + 后台任务”三者合在一起。

我们应该怎么看

这是近期最有可能出现大规模产品动作的方向。我们已有 DuplexOmniAgent、chunked-tool-call 和 duplex-sandbox 三条积累,适合把重点放在“agentic omni”而不是普通语音聊天:让实时模型能够看见工具、环境和长期任务,并在不中断用户体验的情况下推进工作。

相关入口:papers/reading-lists/duplex-omni-agent.mdprojects/duplex-omni-agent/projects/chunked-tool-call/

3. Autonomous Research Agent:从搜索工具到“发现式工作流”

为什么它可能成为最先产生高价值的 agent 场景

Autonomous research 的价值比较容易被组织感知:如果 agent 能够自己检索、比较、验证、写报告,并且明显减少研究人员的时间,它就不只是“更好用的聊天机器人”,而是一个新的工作单元。

近期信号包括:

可能出现的大动作

  1. 研究型 agent 产品化:面向投研、科研、法律、医学、工程和市场分析,输出有证据链的长报告。
  2. 从问答转向自主课题:用户给目标和约束,agent 自己拆问题、搜集资料、设计比较、运行代码或实验,再提交结果。
  3. 验证型 agent 团队:探索 agent、证据 agent、反驳 agent、编辑 agent 和总验证器形成固定组织,而不是一个 agent 反复自我反思。
  4. 研究过程成为产品资产:中间检索、冲突、假设、失败实验和证据质量会被保存下来,供下一次研究复用。

关键分水岭

Autonomous Research 的核心不是报告写得像不像,而是:

未来真正有影响力的系统可能不再以“回答准确率”作为唯一指标,而会评估研究结论的可复核性、证据质量、发现新信息的能力和研究成本。

我们应该怎么看

这是我们已有论文积累最完整、也最适合形成方向叙事的一条线。Quest、Apodex、DR Tulu、AutoEvolvingRewarding、AgentPlat 可以组合成“研究 agent 的数据、验证、评测和演化”主线。相比做一个泛化的 web agent,我们更应该关注:研究过程如何沉淀为可复用经验,评价标准如何随领域变化,agent 如何在发现未知信息时继续推进。

相关入口:papers/reading-lists/agent.mdprojects/auto-evolving-rewarding/

4. Self-evolving Agent:从“完成任务”到“持续变强”

为什么这是最值得关注的技术叙事

如果 agent 每次失败都只能等人重新写 prompt、增加数据或升级模型,它的能力上限仍由人工迭代速度决定。Self-evolving agent 的目标是让 agent 从轨迹、失败、环境反馈、工具使用和自我评价中持续改进。

这条线的论文已经形成连续谱:

可能出现的大动作

  1. Agent training loop 自动化:从采样、失败挖掘、反例生成、评价、数据筛选到再训练形成自动闭环。
  2. Verifier / reward agent 产品化:评价器不再只是分数接口,而是能主动检查、补充证据、提出下一步测试。
  3. Agent 自己改进工具和工作流:通过发现失败模式,主动调整检索策略、工具选择、计划模板或协作分工。
  4. 持续学习型组织:一个团队的 agent 共享失败经验与验证规则,整体能力随使用增长,而不是每次从单一 checkpoint 开始。

关键分水岭

Self-evolving 方向最容易被夸大。真正的演化必须满足:

目前很多工作仍是单环境、单次运行、单一 judge 或自报结果,因此我把“方向概率”评为高,但把“通用自我改进已解决”评为低。

我们应该怎么看

这是我们最适合形成差异化的方向之一。AutoEvolvingRewarding 已经把 Program、TestSuite、replay、shadow、provenance 和 promotion gate 组织成一个可复用框架;ReinforceAgent 提供跨环境 experience 迭代;PlanRL / GUI agent 则提供真实 executor 和失败样本。我们不应把目标写成“让 agent 自己变聪明”,而应聚焦于:如何让 agent 的失败变成可靠的新能力,而不是新的偏差。

相关入口:projects/auto-evolving-rewarding/README.mdprojects/reinforce-agent/README.mdpapers/reading-lists/auto-evolving-rewarding.md

5. Multi-agent Organization:商业产品已经进入“agent 组织”阶段

这不是简单的并行调用

多智能体的早期做法是把同一个 prompt 发给多个模型,再投票或拼接结果。现在的重点已经变成 如何组织一组有不同上下文、权限、工具和职责的 agent,让它们共同完成一个长期任务

一个真正的 agent organization 至少包含六个问题:

  1. 拆分:谁决定把任务拆成哪些子任务,子任务之间是独立、依赖还是竞争关系?
  2. 角色:不同 agent 是否拥有不同目标、工具、上下文和预算,而不是同一个模型重复工作?
  3. 协调:结果通过消息、共享文件、任务图、事件流还是结构化 artifact 传递?
  4. 生命周期:worker 是一次性调用、后台持续运行,还是可以暂停、恢复和再次唤醒?
  5. 合并:谁负责冲突解决、代码合并、事实核验和最终交付?
  6. 责任:出现错误时,能否定位是分派、执行、协作、验证还是最终决策出了问题?

因此,“多智能体”不是一个单一架构,而是一组组织模式:

组织模式 典型结构 适合的任务 真正的难点
并行 fan-out / fan-in 主 agent 拆题,多个 worker 并行,主 agent 汇总 搜索、代码探索、候选方案比较 重复劳动、结果冲突、汇总偏差
层级 manager-worker manager 分派、worker 执行,必要时继续拆分 复杂研究、长程 coding、跨应用任务 manager 是否能正确估计难度和依赖
specialist + verifier 执行 agent 产出,专职 agent 检查事实、测试或安全 deep research、代码修改、GUI 交付 verifier 是否独立、是否能发现“看起来完成”的错误
pipeline / staged team planner → researcher → implementer → reviewer → publisher 研究报告、软件交付、内容生产 中间 artifact 是否足够稳定,阶段边界是否清楚
background worker pool 用户继续交互,后台 agent 持续跑任务并回传结果 IDE、个人助理、长耗时研究 用户意图变化、取消、资源和状态持久化
shared workspace organization 多 agent 通过文件、issue、任务表和日志协作 coding、项目管理、长期研究 并发写冲突、状态陈旧、谁拥有最终版本

商业 coding agent 的公开形态

Codex、Claude Code、Cursor 的内部实现并不完全公开,但它们对用户暴露的产品形态已经足以说明行业方向。三者不是同一种“多智能体”:

产品 公开可见的组织形态 协作边界 我们对它的判断
OpenAI Codex 可同时启动多个 cloud coding task;任务在独立环境 / 分支或 worktree 中运行,完成后由用户 review、应用或合并结果。相关能力见 Codex overviewCodex appCodex launch 以“任务级并行 + 隔离执行 + 人类合并”为主;公开资料不能确认其内部是否采用显式角色型 subagent graph。 Codex 把多智能体首先做成 可持续运行的并行工作单元,而不是聊天窗口里的角色扮演。
Claude Code 公开支持 subagents,并提供实验性的 agent teams:主 agent 可以分派专门角色,团队成员共享任务进度并相互沟通。 以“主 agent / team lead + 专门 worker + 共享任务状态”为主,角色和上下文边界比一般并行调用更显式。 Claude Code 最接近 显式 agent organization:协调、角色、任务分配本身成为产品功能。
Cursor 公开提供 background / cloud agents 一类异步执行能力,可让多个 coding agent 在远程隔离环境中同时处理任务,再通过 branch / diff / PR 回到用户工作流。 以“远程后台任务 + 隔离 workspace + 结果审阅”为主,公开产品更强调任务吞吐和 IDE 集成,较少暴露内部团队消息语义。 Cursor 更接近 agent worker platform:多 agent 是持续产出代码和 PR 的工作池。

这里有一个重要判断:商业产品的 multi-agent 不是论文中常见的“多个 agent 互相聊天”。它们把多智能体嵌入真实工作流:每个 worker 有自己的上下文和工作区,结果以 diff、artifact、测试报告或任务状态交付,用户负责高价值的授权和合并。隔离、异步、可恢复和可审阅,比“角色数量”更重要。

近期研究信号

DSH / DeepSeek Harness 给出的更具体信号

DSH 的价值不应只概括为“能启动子智能体”。其公开实现把子智能体拆成持久会话、运行中激活和消息入口三个层次:会话可以在进程空闲或重启后重新激活;同一个子智能体通过先进先出消息入口接收后续工作;父子关系、释放顺序和结束通知被记录下来。详见 subagent subsystemcontinuation implementation

实验性的 Agent Teams 再向上增加负责人、命名成员、持久邮箱和共享任务图:消息先写入队列,目标确认后再标记已投递;恢复时重放未确认消息,并按消息编号去重;任务更新使用版本号,依赖关系要求保持无环。它更接近“可恢复的工作组织”,而不是多个模型互相聊天。公开默认限制是最多 8 个成员、每个成员最多 64 条待投递消息和 256 个未删除任务;因此不能把其中的 64 解读为并发 worker 数量。Agent Teams subsystem

这组设计把 2027 H1 的问题边界说得更清楚:长期智能体需要稳定身份、冷恢复、消息幂等和责任归属;多智能体组织需要任务图、邮箱和交付物;运行时需要明确哪些状态可以替换,哪些状态必须通过迁移或人工确认处理。它仍不能证明生产环境的成功率,也不能代替对事件时序、跨进程恢复、共享工作区写冲突和高副作用工具的实测。

组织记忆与工作关系图:从抽象概念变成工作状态

组织记忆不应被实现成“把所有聊天内容做向量检索”。它至少要记录以下对象:

对象 需要保留的事实 典型关系
项目与目标 范围、截止时间、成功条件、当前版本 包含任务、依赖项目、被谁授权
任务与工作者 状态、负责人、预算、重试、暂停原因 分派给、阻塞于、交接给、由谁验证
产物与证据 文件版本、代码变更、实验结果、来源、有效期 由任务产生、支持决定、被后续版本替代
决定与争议 采用方案、反对意见、批准人、适用范围 基于证据、否决方案、需要复审
权限与副作用 principal、范围、期限、审批、外部动作收据 授权给、继承自、已撤销、影响产物
失败与修复 失败阶段、根因、修复动作、是否复现 发生于任务、修复产物、转化为候选技能

这张图的价值在于支持实际工作,而不是增加一个可视化页面。最小查询应包括:当前最可信的项目状态;某个决定的证据和批准链;任务暂停后下一步应从哪个检查点继续;两个 worker 结果冲突的来源;某份文件或记忆是否已经过期;以及撤销某项授权后哪些后续动作必须停止。图中每条关系都要带时间、来源、权限和置信度,支持纠错、删除和审计。MemLensSynthetic ComputersWorkSpaceBench 提供了记忆、长期工作和工作空间的先导信号,但关系一致性、隐私隔离和跨项目迁移仍需自行评估。

可能出现的大动作

  1. IDE 内置 agent team:用户不再只开一个 coding agent,而是让 planner、repo explorer、implementer、test runner、reviewer 和 documenter 协同工作。
  2. 后台任务工作池:一个用户同时挂起多个 issue、实验、重构或研究任务;agent 在用户离线时继续推进,回来后交付可审阅结果。
  3. 研究组织模板化:针对事实核查、文献检索、实验设计、代码复现、反例搜索和写作审查形成可复用 team template。
  4. 跨 agent 的共享工作空间与组织记忆:任务表、文件、代码、证据和失败经验变成组织的公共状态,而不是每个 agent 私有上下文。
  5. 动态组建和动态裁撤:系统根据任务难度、剩余预算和证据冲突决定是否增加 specialist、verifier 或 reviewer,而不是固定开 N 个 agent。
  6. 从“代码生成”变成“交付流水线”:多 agent 负责从 issue 理解、计划、实现、测试、审查到 PR / release 的完整闭环,人的位置转向授权、取舍和最终验收。

这条线的真正瓶颈

多智能体最难的不是并行,而是 协调收益能否抵消协调成本。必须回答:

我们的判断与切入位置

这条线的概率应从“中高”上调为“高”。原因不是多智能体论文数量增加,而是 Codex、Claude Code、Cursor 已把多任务、subagent/team、后台 worker、隔离 workspace 和人类合并带进主流 coding 产品。2027 H1 很可能继续出现两类大动作:一类是 coding IDE 把 agent organization 做成默认工作流;另一类是 research / productivity agent 把相同组织模式迁移到非代码任务。

我们应重点研究的不是“如何再开更多 agent”,而是:

这与 Agent Kernel、AgentPlat、AutoEvolvingRewarding、Plan Mode、ReinforceAgent 和 DuplexOmniAgent 都有关,但重点应从“底层协议”上移到 agent organization as a product and research paradigm

6. Computer-use Generalist:从演示操作到真实工作流

为什么它会继续成为落地场

Computer-use 是 agent 最容易被用户直接感知的能力:它能否打开软件、阅读屏幕、操作网页、处理文件并完成跨应用任务。GUI 也提供了比纯文本环境更接近真实世界的反馈,因此很适合成为 agent training 和 autonomous work 的试验场。

本库已有 YouTube→GUI、AgentNet、OSWorld、OpenComputer、WindowsWorld、MobileWorld、GUI reward 和多评测能力地图等连续证据。YouTube MidTrain 与 AgentNet 的互补结果,以及子目标级 ICL 的正向结果,说明长程理解和动作精度需要不同数据来源。projects/yt2gui-long-horizon/README.mdfindings/youtube-midtrain-outperforms-agentnet-equal-data.mdfindings/subgoal-icl-outperforms-trajectory-icl.md

可能出现的大动作

我们的判断

这是“最容易落地、但最难稳定”的方向。我们应把 GUI 视为长期 agent 和 autonomous work 的实验场,而不是孤立的坐标预测任务。重点应放在长程任务、失败恢复、状态变化和跨应用工作流,单步点击精度只是基础能力。

7. Proactive Agent:从等待指令到理解何时该行动

为什么是一个强弱信号

传统 assistant 的边界是“用户问,我回答”;长期 agent 的边界是“我知道什么时候应该提醒、询问、准备或直接行动”。PROEVENT 等工作已经把 response timing、事件插入、更新和删除纳入 proactive agent benchmark;Interaction Models、GPT-Live 和 realtime agent 也都在强调后台工作和适时介入。papers/proevent.mdpapers/interaction-models.md

可能出现的大动作

为什么它还不是“确定主线”

Proactive agent 的技术难点之外,更大的障碍是信任:什么时候算“有帮助”,什么时候算“打扰”;错误行动由谁负责;用户是否能理解 agent 为什么此时介入。这个方向可能在产品上突然出现,但研究评价和安全边界仍不成熟。因此建议跟踪,不要把它当作唯一主线。

8. Meeting / Ambient / Artifact UX:从摘要到承诺与可接管行动

会议和主动 agent 的产品机会不只是“总结得更好”,而是把 meeting → commitment → task → follow-up 变成可审阅的长期状态。UX 专项扫描显示,full-duplex、meeting agent、task queue 和 artifact-native workspace 的交叉信号强于“完全自主陪伴”:用户更愿意接受低风险的候选行动、提醒、草稿和后台研究,而不是 agent 在没有可见理由时替自己做不可逆决定。

可能的大动作:会议后自动生成带负责人和期限的任务,后台 worker 跟进资料和草稿,在截止前主动询问或升级;实时语音/视觉入口可以随时查看进展、打断和授权。教育产品则把 tutor/coach 的长期 mastery state 与任务队列连接起来。

我们的做法与合理性:建立 research meeting-to-task 样板,事件、承诺、artifact、候选行动和过期时间全部可追溯;每个主动行动先显示触发理由、影响范围和撤销方式。统一测提醒收益、打扰成本、状态正确率、接管时间和用户修正,而不是只测 ASR 延迟或摘要质量。陪伴和未成年人场景暂不作为主线,先观察关系记忆删除、心理安全和责任边界。

9. Self-supervised / Open-ended Agent Learning:从任务奖励到能力发现

为什么值得关注

如果 agent 只能在已有任务和人工 reward 上学习,它很难获得开放世界中的探索和迁移能力。Self-supervised RL、temporal representation、goal-conditioned exploration、multi-agent goal reaching 和 emergent skill work 试图从轨迹中的时间关系、状态变化和可达性中学习,而不依赖每一步人工标注。papers/reading-lists/self-supervised-rl.md

近期这条线的弱信号包括:contrastive RL、temporal distance、self-supervised multi-agent goal reaching、recurrent depth / test-time compute,以及把 agent 经验转成可重用 skill 的工作。它们还没有统一产品形态,但可能为 Life-long Agent 和 Self-evolving Agent 提供更强的底层学习机制。

可能出现的大动作

我们的判断

这是中期研究突破点,不一定在 2027 H1 形成成熟产品。我们应该把它作为 Life-long / Evolving 的前沿储备,重点看是否能在真实 agent 环境中转化为更好的探索、失败恢复和跨任务迁移,而不是只在 toy environment 上报告 representation 指标。

10. Software Factory / Coding Agent:从写代码到软件交付

为什么应从 Computer-use 中单列

Coding agent 是 Life-long 和 Multi-agent 最早形成商业闭环的场景。产品单位不再是一次 patch,而是 issue → 计划 → 多文件修改 → 测试 → review → PR / release 的持续交付工作单元。它把长期记忆、后台 worker、artifact、verifier 和人类合并放进一个可观察流程。

近期信号

可能的大动作与我们的做法

2027 H1 很可能出现“agent software factory”:issue triage、实现、测试、review、文档和发布形成默认组织模板,并从代码扩展到数据管道、部署和运维。我们应以真实仓库或可复现项目做样板,验收跨天恢复、失败解释、测试覆盖、人工 review 时间和下一次任务的重复探索减少,而不是只看 SWE-bench pass rate。

11. Skills / Capability Store:经验成为可安装能力

为什么这是独立方向

Skill 正从 prompt 片段变成包含说明、脚本、资源、前置条件、权限、verifier、成功/失败案例和版本的能力包。它既是 Self-evolving 的产物,也是 Multi-agent 组织跨任务复用的公共资产。

近期信号

可能的大动作与我们的做法

可能出现组织级 skill registry、skill marketplace 和自动 skill authoring。我们应先建立 research、coding、GUI 三类小型 registry:每个 skill 固定适用场景、权限、输入输出、版本、测试轨迹和回滚方式;新 skill 先进入 shadow registry,经 held-out 任务和人工批准后才共享。否则“skill store”很容易退化为没有质量保障的 prompt library。

12. MCP / Tool Ecosystem Agent:工具网络成为平台层

方向与信号

当 agent 要从几十个工具中选择并组合动作,核心问题变成能力发现、schema 理解、成本/延迟权衡、失败恢复和副作用控制。MCP Atlas 让 agent 在大量真实 MCP server 和工具中自行选择;Toolathlon-VerifiedAutomation Bench 评估跨工具的验证型任务;Speculative Interaction Agents 则把工具调用建模成可取消、可修改的 DAG,并区分 read-only 与 side-effect。

MCP 官方规范和持续增长的 server 生态说明连接需求已成立,但协议本身不等于可靠性。2027 H1 可能出现工具目录、能力检索器、企业 connector、工具质量评分和副作用审批产品。我们应把工具定义成带权限、成本、幂等性、回滚、版本和 provenance 的 capability contract,并在真实研究/办公工具上评估“选择正确工具”和“工具失败后能否继续”。

13. Enterprise Workflow 与 Vertical Professional Agent:从聊天到业务交付

为什么会成为最先付费的场景

企业和专业行业有结构化数据、固定流程、审批节点和明确预算。agent 的产品形态会是带 connector、权限、SLA 和审计的工作队列,而不是开放式聊天。科研、软件研发、金融分析、法务文书、医疗信息整理、咨询和 IT 运维是较容易率先落地的垂直。

近期信号

我们的做法

不先做泛企业平台,先从研究组内部文献入库、实验复现、结果审阅、资源申请或工程分析中选择一个可验证 workflow,把领域资料、工具权限、verifier、人工审批和 provenance 固化为模板。验收看交付物、证据覆盖、人工复核时间、错误升级率和跨任务迁移,而不是行业版聊天体验。

14. Agent Reliability / QA / Observability:能做还要能证明做对

方向与信号

长程 agent 的主要产品风险是过程不可见、失败难定位、结果无法审计。CUADebug 提供失败轨迹的 root-cause、证据和 correction;OS-ThemisVAGENProRe 分别将 milestone verifier、主动环境 probe 和 reasoner/evaluator 协作引入 GUI agent;Agents' Last ExamAgentPlat 则把真实职业任务与统一 harness 推到前台。

可能的大动作与我们的做法

Agent 平台可能像软件工程一样引入 CI:每次模型、skill、工具或 prompt 更新,都在长程任务、失败回放、权限边界和副作用检查上做 release gate。我们应把 Agent Kernel 的事件流、checkpoint、权限和 artifact 统一成可 replay trace,至少提供结果、过程、副作用、证据四层评分,并报告成本、延迟、人工接管和失败类型。LLM judge 只能作为一层,不能替代 code oracle、环境 readback 和人工复核。

15. Trustworthy Autonomy / Security:代理权成为上线门槛

为什么不是附属安全功能

当 agent 能修改代码、发邮件、采购、写入企业系统或跨天运行时,问题变成“它代表谁、在什么范围内行动、如何撤销和追责”。Speculative Interaction Agents 的 commit gate、Apodex kernel 的权限/暂停/事件记录、OpenAI computer-use schema finding 和 Claude Computer Use 的隔离与人工确认都说明治理已进入运行时边界。

prompt injection、恶意 skill / connector、凭证盗用、数据外泄、越权和不可逆动作会同时影响 commerce、enterprise、GUI 和 multi-agent。2027 H1 可能出现 agent firewall、工具供应链扫描、权限策略、行动收据和第三方审计产品。

我们的做法

在 Agent Kernel 中把 principal、scope、TTL、预算、approval、commit、rollback、provenance 和 receipt 作为一等状态;按 read-only、write、external-send 和 financial/irreversible 分层。安全验收同时报告攻击成功率、误报率、任务损失、人工介入负担和回滚成功率,避免只测“拒绝了多少攻击”。

16. Agentic Commerce:从推荐到代表用户产生经济行为

为什么值得单列

购物、旅行、报销、企业耗材采购和售后是 agent 从“会使用工具”走向“代表我行动”的最直观场景。OpenAI/Stripe 的 Agentic Commerce Protocol、Visa Intelligent Commerce、Mastercard Agent Pay 和 Shopify 的 AI shopping 都把商品发现、商户能力、支付凭证和授权推到公开议程。

可能的大动作与我们的做法

平台可能把 agent mode、购物协议、支付 token、预算策略、退货和责任中心做成产品。短期更可能是低风险、可撤销、用户明确确认的流程,而不是完全自动付款。我们可以做模拟商店、旅行和企业采购 benchmark:agent 先产出候选比较表与价格/条款证据,只有满足预算和禁选项后才进入确认;把拒绝、升级人工、退款和网页 prompt injection 当作一等结果。

17. Artifact-native Workspace / Creative Agent:交付物成为界面

方向

Agent 的最终输出越来越不是一段文本,而是代码仓库、研究报告、表格、演示、视频、网页、3D 场景或设计稿。用户在 artifact 上评论、分支、测试、局部修改和合并,agent 的记忆围绕 artifact graph、版本和证据组织。

近期信号与我们的做法

PresentBenchSpreadsheetBench 2Vision2WebParametric CAD BenchWorkSpaceBench 都在从交付物而非聊天质量定义任务。Coding agent 的 branch、diff、test 和 PR 是最成熟的例子。我们应先把研究报告、代码仓库和实验结果定义为可回滚 artifact graph,重点测“人类接管后继续完成的时间”和“依赖/证据是否完整”,而不是首轮生成是否漂亮。

18. Agent Experience / Data Flywheel:经验数据成为护城河

方向与信号

下一轮 agent 竞争可能不在静态文本,而在完整 episode:环境状态、工具结果、成功/失败、修复、人工接管、验证标签和许可证/隐私 provenance。Watch and Learn 提供视频到 GUI 轨迹,OpenCUA 提供人工高质量轨迹,EvoCUA 提供成功/失败筛选与再训练,Synthetic Computers at Scale 提供月级电脑仿真,CUADebug 则证明失败本身可以成为修复数据。

我们的做法

以 Agent Kernel trace 作为统一 episode 格式,保存任务状态、工具、GUI 观测、artifact、验证结果和人工接管点,分成 success、near-miss、failure、repair 四类池。所有 skill 或 policy 变化都要在 held-out 环境验证,防止经验飞轮退化为自我循环。

19. Environment / World Model:可生成、可验证的工作世界

世界模型在 agent 领域短期不一定先表现为通用物理预测器,更可能表现为可交互、可回放、可生成并带 oracle 的网页、桌面、代码库、研究实验或整台工作电脑。GUI-GENESISCUA-GymSynthetic Computers at Scale 已展示环境、任务和 reward 一起扩展的路径。

2027 H1 可能出现 agent gym / work simulator 或 environment-generation-as-a-service。我们应先做任务级环境卡:状态、动作、可见性、oracle、版本和 sim-to-real 对照;明确“能生成”与“能迁移”是两件事,服务于研究、coding 和办公任务,再观察是否值得扩展到移动和机器人。

20. Agent Protocol、Identity 与 Marketplace:从内部组织走向开放委托

方向

MCP 偏向 agent 与工具/数据连接,A2A 偏向 agent 发现、委托和协作;identity、wallet 和 capability registry 则回答“这个 agent 以谁的身份行动、带什么预算、能否撤销”。MCP、Google A2A、Linux Foundation Agentic AI Foundation 和各类 agent marketplace 讨论说明生态层正在形成。

判断与我们的做法

短期不会出现无需信任的开放 agent 互联网,更可能先在同一企业、同一云或白名单 partner 内出现。我们应为 Agent Kernel 定义最小任务委托卡:能力、输入 artifact、预算、数据范围、截止时间、验收条件、返回 artifact、失败原因和责任主体;再用 MCP/A2A-like adapter 做暂停恢复、权限收回、幂等和审计测试。Marketplace 先作为内部 skill/agent registry,不急于开放交易。

21. Personal Event-driven / Meeting Agent:维护时间线并适时介入

Personal agent 的下一步不是单纯扩大偏好记忆,而是维护动态事件、承诺和任务。PROEVENT 将 Insert/Update/Delete、response timing 和多步事件成功纳入评测;Interaction ModelsGPT-LiveSpeculative Interaction Agents 则把后台工作、可取消行动和实时介入连接起来。会议、邮件、日历和团队协作产品已经有总结入口,下一步是跨会议追踪、主动准备、协调时间和请求授权。

我们应把 proactive action 做成“候选行动 + 触发理由 + 影响范围 + 过期时间”的可审阅队列,按个人、项目和团队分别授权;先在研究项目、实验和会议任务中测漏提醒成本、打扰成本、接管率和事件状态正确率,不直接将它放进高副作用个人事务。

22. Robotics / Embodied Agent 与 World Model:物理世界的高关注观察位

Google DeepMind Gemini Robotics、NVIDIA GR00T、Figure Helix 和 Physical Intelligence pi0 等公开路线说明视觉语言模型、动作策略、机器人数据和仿真正在合流;ERQAMADQA 等 benchmark 也开始测 embodied reasoning。它很可能在 2027 H1 产生新闻级发布,但通用产品概率低于软件 agent,受硬件碎片化、现实安全和 sim-to-real 限制。

我们的近期切入不应是重资产造机器人,而是研究 embodiment-agnostic 的任务层:视觉状态摘要、长程计划、技能调用、失败恢复、人工接管和安全停机;复用 GUI agent 的 trace、verifier 和 long-horizon 指标,在公开仿真环境中建立观察位。

23. Companion、Education 与 Multi-agent Economy:值得观察但不主押

长期陪伴、持续辅导和 agent 之间的谈判/竞价会随着 Life-long、Omni、Identity 和 Commerce 发展。PersonaPlexMoshiGPT-Live 说明关系连续性和实时人格交互有技术入口;教育产品可以复用长期课程和反馈闭环;agent economy 则需要协商、信誉、预算和反串谋机制。

这些方向有潜在大动作,但目前更可能以消费产品、受控试验、仿真 benchmark 或融资新闻出现,而非稳定的通用产品范式。我们只建立观察指标:记忆删除和纠错、未成年人/心理安全、学习迁移、协商效率、公平性和串谋率;不把“完全自治陪伴”或开放 agent 市场作为近期主线。

这些方向之间会怎样合流

我不认为明年会出现 25 条彼此独立的赛道。更可能的组合是:

             ┌────────────── organization memory ──────────────┐
             │                                                  │
Long-horizon task state ─── Multi-agent organization ─── Self-evolving loop
             │                    │                  │            │
             │                    │                  │            │
Life-long memory ─────── Omni / realtime ───── Computer-use ─────┘
             │                    │                  │
             └────────────── Autonomous research ───┘

具体来说:

我们的建议:关注顺序

第一优先级:形成主叙事

  1. Life-long Agent + Long-horizon Execution + Memory:这是最有长期壁垒、也最符合我们已有积累的方向;不能只做个性化 memory。
  2. Multi-agent Organization:这是把长期任务变成可扩展工作单元的组织方式,也是 Codex、Claude Code、Cursor 已经验证的产品形态;重点不是 agent 数量,而是分工、交接、验证和交付。
  3. Software Factory / Coding Agent:这是最成熟的长程交付样板,能把任务状态、组织、artifact 和可靠性放在同一条链上。
  4. Reliability + Permissioned Autonomy + Security:这是其它方向进入真实系统的前置门槛,不应作为最后补丁。
  5. Eval Contract + Agent CI / Observability:把 task、environment、harness、tools、judge、budget、trace、artifact、side effect 和人工接管固定下来,避免用无条件排行榜分数驱动路线。

第二优先级:作为高价值场景

  1. Autonomous Research + Vertical Professional Agent:以研究、实验复现和专业交付物作为第一批可验证场景。
  2. Computer-use / GUI + Enterprise Workflow:作为真实环境和执行层,承载 memory、planning、research、multi-agent 与 evolving 的实验。
  3. Agentic Commerce:先做可审阅、可撤销的采购/旅行/表单流程,验证 agent 产生外部经济行为的边界。

第三优先级:作为生态和交互支撑

  1. Omni + Proactive + Multimodal Memory:把实时入口和长期任务接到同一条时间线。
  2. Skills + MCP + Agent-to-Agent Protocol + Identity:把能力、工具、委托和授权变成可迁移的公共资产。
  3. Artifact-native Workspace + Agent Marketplace:以可编辑、可审阅、可回滚的产物承载协作和分发。

第四优先级:作为能力增长与观察位

  1. Experience/Data Flywheel + Environment/World Model:建设长期训练、回放和反事实评测的供给侧。
  2. Self-evolving + Open-ended Learning:关注跨任务迁移和真实指标,不把自生成分数当成能力增长。
  3. Robotics / Embodied Agent:建立任务层和仿真接口观察位,不立即重资产投入。
  4. Companion / Education / Multi-agent Economy:保留长期观察,重点看安全、学习迁移、公平和责任机制。

网络恢复后的增量判断(2026-08-20)

补搜材料已归并到 Life-longResearch/Self-evolvingCommerce/VerticalRobotics/EmbodiedUX/Companion/EducationBenchmark/ReliabilityOpen-source Protocol 等 domain 文件。新增的 Claude Code、Codex、A2A、MCP、UCP 和企业平台 release 共同指向一个更窄的近场竞争面:durable task runtime + protocol conformance + observable/permissioned autonomy。它们强化 Life-long、Multi-agent、Software Factory 和 Trust 的优先级,但不证明跨供应商生产互操作或真实采用率。

论文和 benchmark 侧新增的 PATH-Bench、Harness Continual Learning、OneDayAgent、MisKnow-Agent、ActBench、ForestBench、MAP-Graph 和 Demystifying Agent Skills 也把验收口径从“记住/调用/最终答对”推进到路径依赖、harness 遗忘、持续证据核验、行为安全、通信图、来源权限和 skill 选择精度。

因此主报告的下一步不应再扩张热点清单,而应把最小验证集中到:跨 3 次 pause/resume 的状态恢复、A2A/MCP/UCP 的版本锁定与 conformance、Agent CI 的注入/越权/副作用矩阵,以及 planner → worker → verifier → human merge 的贡献与返工记录。市场采用仍缺少独立预算、付费生产、ROI 和真实交易量数据,继续保留为观察项。

新增调研已归并到各 domain wave 文件,补充了 EU/FINRA/FDA/NMPA/CAC 的监管边界、Khanmigo 两年学校 RCT、JAMA 心理健康 RCT、ACL/CHI/IUI 2026 的 meeting/companion/education/导航证据,以及 Continual Harness、PLACEMEM、SPADE、FM-Bench、HarnessEval-W 等 2026 新研究。增量没有把主线扩成更多赛道,反而说明各 domain 的验收必须分开:regulated workflow 看日志/人工监督/风险文件,education 看 engagement/anti-leakage/far-transfer,robotics 看 remote takeover/sim-to-real/TCO,memory/evolving 看 retention/forgetting/security drift。企业 ROI、付费采用、真实交易、机器人维护和 companion 跨年安全仍没有独立公开数字。

最后的判断

我认为 2027 H1 最可能出现的“大动作”不是单个新模型类别,而是一个新的 agent 产品范式:

它记得长期工作历史,能让任务跨小时和跨天持续运行,通过语音、视觉和文本持续交互,会主动准备和执行任务,能够组织多个角色完成专业交付,在权限和证据边界内代表用户行动,并把每次失败转化为下一次更好的行为。

从这个角度看,Life-long、Multi-agent、Omni、Autonomous Research、Software Factory、Vertical Agent、Commerce、Trust 和 Evolving 不是彼此平行的 9 个选题,而是同一个“持续工作的智能体”在连续性、组织、交互、交付、经济行动、可信边界和学习上的展开。

我们的战略重点不应是追逐每一个新名词,而应判断:哪些方向正在从论文 demo 变成长期使用闭环,哪些方向已经有产品信号,哪些方向仍停留在漂亮但脆弱的 benchmark。当前最值得押注的组合是:

Life-long memory + durable task execution 作为核心资产,Software Factory / Autonomous Research / Vertical Workflow 作为高价值场景,Multi-agent Organization 作为工作组织方式,Reliability / Permission / Security 作为可信边界,Omni/Proactive 作为交互入口,Skills/MCP/A2A/Identity 作为生态层,Self-evolving + Experience Flywheel 作为持续增长机制,GUI/Computer-use/Artifact 作为真实行动和交付载体。

证据入口

近期论文、技术报告与产品研究

商业产品公开资料(用于架构形态判断)

这些资料只能证明产品对外暴露的工作方式,不能证明其未公开的内部模型拓扑;本报告因此把它们用于判断产品范式,不把实现细节当作事实。

扩展调研底稿

相关 benchmark

团队项目与内部证据

证据边界与后续观察

本文中的“高概率”表示公开信号已经跨越论文、产品或 benchmark 中的至少两类,不表示方向已经解决。当前仍需重点观察:

这些问题的答案,决定 2027 H1 的热点会停留在 demo,还是形成新的 agent 产品与研究平台。

来源:AgentTeam-Shared-Knowledge 私有仓库 · projects/agent-kernel/design/agent-direction-2027-h1.md · commit 8c002ca(2026-08-20)