projects/agent-kernel/design/agent-direction-2027-h1.md 的全文转载(未删减、未摘要),仅做排版适配以便手机阅读。文内相对链接已转换为可跳转的 GitHub 链接(私有仓库,需登录查看)。查看 GitHub 原文先读半页版:2027 H1 Agent 方向半页摘要。本文件保留完整证据、方向地图和专项底稿索引。
本文是趋势判断,不是技术路线图,也不是对单篇论文结果的确认。我们主要看了四类公开信息:论文和预印本,公司的产品发布和官方说明,开源项目与公开测试,以及团队对 DSH/Cordis 和商业编码智能体的专项调研。对每个方向,我们都问四个问题:现在已经能做什么?真实使用时会卡在哪里?有没有人在解决这个问题?明年上半年有没有可能出现产品、开源项目或重要研究进展?只有会议热度、单篇论文、单次演示或厂商自报结果的方向,不直接写成高概率主线。
判断顺序是“今天能做什么 → 用得更多后会遇到什么麻烦 → 哪些新方法正在补这个短板 → 明年上半年是否可能形成产品或研究突破”。因此,长程任务、多智能体、研究和实时交互在本文中首先是出发点;方向地图重点写它们结合后可能产生的跨会话状态、多会话组织、多模态记忆、环境预测和故障后继续工作的能力。“高概率”只表示证据较多且有落地机会,不表示问题已经解决或一定会按时发布。报告无法覆盖公司内部项目、突发的模型 / 价格 / 监管变化,以及可能突然升温的机器人、陪伴、消费交互和开放式自我演化;这些方向保留观察位,并与“现在应当投入”的主线分开。
| 等级 | 公开材料 | 可以支持什么 | 不能支持什么 |
|---|---|---|---|
| A | 正式 conference paper / proceedings / 已核验 benchmark card | 研究问题和受控结果存在 | 不等于生产采用或开放世界可靠 |
| B | Findings、正式 workshop/challenge、开源技术报告、官方产品/文档 | 方向扩散、产品形态和早期需求 | 不等于跨供应商互操作或真实成功率 |
| C | arXiv、OpenReview submission、匿名 workshop、厂商自报结果 | 研究假设、弱信号和待核方向 | 不能写成已解决结论 |
| D | 会议议题、征稿、新闻、融资或单次 demo | 注意力和潜在资源流向 | 不能证明方法有效或市场规模 |
主报告的“高概率”表示至少有两类信号交叉,且存在清晰的产品/采用路径;具体材料仍以各波次底稿为准。
这次调研最有说服力的不是某一篇论文,而是四组材料指向了同一个变化。第一,Codex、Claude Code Agent Teams 和 Cursor Cloud Agents 都开始把“后台任务、并行工作、隔离环境和人工合并”做成产品功能,说明用户需要的已经不是一次回答,而是一个可以交付结果的工作单元。第二,OneDayAgent、Synthetic Computers 和 SWE Marathon 等工作把任务时间拉到数小时、数天甚至更长,说明“任务能否持续运行”正在成为新的能力边界,但它们还没有证明开放环境下已经可靠。第三,GPT-Live、Seed 全双工 和 MemLens 等材料把实时交互和多模态历史带到前台,说明系统必须理解连续的语音、屏幕、文件和工具过程,而不只是处理一段文本。第四,DeepSeek Harness 持久子智能体 和 Agent Teams 开始解决持久会话、消息邮箱、任务依赖和恢复问题,说明真正的瓶颈正在从“模型会不会调用工具”转向“系统能不能在中断、协作和故障后继续工作”。
这些证据不能推出“通用自治已经实现”,也不能证明某一家产品内部一定采用某种多智能体架构;它们能支持的较强结论是:产品形态、研究任务和底层运行时正在围绕同一个问题收敛,即如何把模型变成可持续交付的工作系统。
| 近场主线 | 现在已经看得见什么 | 当前卡点 | 2027 H1 可能出现的升级 | 我们如何验证 |
|---|---|---|---|---|
| 长期智能体 | OpenClaw 等个人 harness 可以通过对话派发后台子任务;OneDayAgent、Synthetic Computers 把任务拉到小时和天级;DSH/Codex 已公开持久线程和恢复机制 | 状态仍常绑定当前会话;任务拆分、唤醒、失败处理和模型更换缺少稳定规则 | 消除“会话边界”,形成有稳定身份、检查点、工作记忆和可恢复执行的长期 worker | 同一任务跨天暂停、换模型、重启后,能否继续完成且不重复副作用 |
| 全双工智能体 | 豆包 Seed 全双工、GPT-Live 已展示持续倾听、自然停顿、打断和实时响应 | 目前仍以语音体验为主;情感支持、生活服务、屏幕和后台任务的结合尚未稳定 | 从“语音功能”变成更像电话的日常入口,扩展到低风险陪伴、提醒、查询和生活安排 | 在噪声、犹豫、抢话和改口时,能否自然接话、及时取消动作,并把后台结果带回当前交流 |
| 多智能体并行 | Codex MultiAgent V2、Claude Code Agent Teams、Cursor Cloud Agents 已支持并行或后台工作;NL2Repo-Bench 将完整代码仓库生成作为长程任务 | 并行是否真的提效取决于拆分、合并、冲突处理和验证;“64 个 agent”在 CDC 中只是公开 prompt 要求,非已核验运行事实 | 从固定 fan-out 变成按难度动态增减 worker,并引入角色分工、任务图、独立 verifier 和关键节点审批 | 与单 worker 对比总耗时、返工率、错误率、验证覆盖和人工合并时间,而不是只统计 agent 数量 |
OpenClaw 类个人智能体已经展示了通过对话派发子智能体、让系统在后台继续做事的产品形态,但任务拆分、唤醒和失败处理仍主要由模型临时决定。DeepSeek Harness 和 Codex MultiAgent V2 已公开持久会话、线程图、消息和恢复机制,OneDayAgent 与 Synthetic Computers 则把任务时间推向小时和天级。由此判断,明年最容易出现的升级是:session 不再是系统边界,智能体变成有稳定身份、任务状态和工作记忆的长期 worker。用户今天交代目标,明天回来仍能继续;中间可以暂停、换模型、增加专业 worker、修改目标或人工接管。关键验收不是记住多少,而是恢复后能否继续做对。
Seed 全双工 已把豆包语音从轮流说话推进到持续倾听、自然停顿和快速响应,GPT-Live 与 PersonaPlex 则把持续对话、声音和角色控制推到产品与研究前台。下一步用户最容易感知的变化,是更像电话的交互:能听懂犹豫和打断,知道何时接话,并在通话中完成查询、提醒、安排和简单操作,逐渐进入情感支持和生活便利场景。随后语音会和屏幕、摄像头、文件及后台任务合流。关于通信厂商围绕“豆包电话”讨论上行带宽扩容的说法,目前尚未找到稳定可核验的原始公开链接,暂不作为结论依据。
OpenAI 的 CDC 研究 prompt 公开提出动态分配研究路线和最多 64 个并发 agent,但公开材料没有证明这次任务实际运行了 64 个 agent 或持续了 8 小时。更可靠的信号来自 Codex MultiAgent V2、Claude Code Agent Teams、Cursor Cloud Agents 和 NL2Repo-Bench:多个 worker 已经可以并行搜索、编码、测试和验证。下一步不会只是“多开几个模型”,而是根据任务难度动态增加或裁撤 worker,让 planner、执行者、测试者和 verifier 使用不同上下文和权限,并通过任务图、消息和版本化产物协作。第一阶段是并行提效,第二阶段是形成可恢复、可审阅的工作组织。
这三条主线共同指向一个更具体的产品愿景:智能体的产品单位从一次对话变成一个可持续交付的工作过程。 用户给出目标后,系统建立跨天保存的任务;按需组织多个 worker;用语音、屏幕、文件和工具推进;留下产物、证据和责任记录;允许暂停、改目标、接管和审批;失败后从检查点继续,而不是重新开始。软件交付、研究分析和企业流程最可能首先出现这种“可暂停、可恢复、可审阅”的半自治系统。
组织记忆、多模态记忆、Agent World Model、自主研究、受控自我演化和可逆运行时仍然重要,但更适合作为三条主线的升级能力,而不是九个平行赛道。机器人、陪伴和开放式智能体经济可能带来新闻级发布,但目前不应与上述主线投入等量齐观。
当前被广泛讨论的长任务、记忆、多智能体、研究和实时交互,已经是三条近场主线的基础变量。下面的表格不再把这些内容当成彼此独立的赛道,而是列出它们规模化后会需要的支撑能力和可能出现的延伸机会:
| 下一阶方向 | 为什么可能在 2027 H1 升温 | 当前证据与不确定性 | 外部来源 |
|---|---|---|---|
| 智能体组织管理层 | 企业从少量试验走向多智能体部署后,需要统一登记、分派、授权、成本、绩效和撤销 | 企业平台、MCP/A2A 和编码智能体已提供早期接口;绩效与责任模型仍未统一 | Codex、Claude Code teams、Cursor Cloud Agents |
| 组织记忆与工作关系图 | 多天任务和多个 worker 会产生项目、目标、任务、负责人、产物、证据、决定、权限、依赖和失败记录;普通聊天记忆无法回答“谁负责、为何决定、从哪里继续” | 长期记忆、工作空间和跨 worker handoff 研究密集;下一步应从静态知识图升级为可查询、可更新、可撤销的工作关系,支持交接、依赖追踪、冲突解释、过期判断、责任回溯和权限传播;关系抽取、状态一致性和隐私边界仍未充分验证 | MemLens、Synthetic Computers at Scale、WorkSpaceBench |
| 可演化能力的生产与分发 | 技能、检查器、工作流和评价标准会成为可测试、可版本化、可回滚的能力资产 | SkillsBench、奖励/工具演化和注册表已出现;质量、安全和收益分配仍是空白 | SkillsBench、Anthropic skills、MCP Registry |
| 受控的智能体交易网络 | 购物、采购和服务调用需要身份、预算、期限、结算和争议处理,智能体将从“调用工具”转向“代表主体谈判” | Agentic Commerce Protocol、支付网络和智能体身份有产业信号;真实交易量和责任闭环尚未证明 | Agentic Commerce Protocol、Visa Intelligent Commerce、Mastercard Agent Pay |
| 可持续工作环境与训练世界 | 长期能力增长需要可生成、可重置、可验证的电脑、代码库、企业流程和研究环境 | 合成电脑、工作空间基准和环境生成研究提供弱到中等信号;迁移到真实业务仍不确定 | Synthetic Computers at Scale、GUI-GENESIS、CUA-Gym |
| 研究组织与知识生产闭环 | 研究智能体会从写报告转向维护问题、安排实验、反驳结论、更新知识图和决定停止 | Deep Research、AI Scientist、研究型多智能体已有模块;开放世界新发现能力仍未证实 | Quest、Apodex、Google AI co-scientist |
这张表中的方向比“再做一个更长上下文模型”更可能代表下一轮竞争,因为它们对应的是规模化使用之后才会出现的组织、经济和基础设施需求,而不是当前单个模型的能力展示。
下表描述三条近场主线目前所依赖的能力和场景成熟度,不等同于九个平行赛道,也不等同于 2027 H1 一定会出现的新增产品。
| 方向 | 2027 H1 延续概率 | 近期信号强度 | 作为基础的判断 |
|---|---|---|---|
| Life-long Agent / Long-horizon Execution | 高 | 高 | 不只是个性化;核心是记住工作、持续跑任务、跨任务积累能力 |
| Omni / Realtime Agent | 高 | 高 | 产品化最快,语音只是入口,核心是连续交互与主动行动 |
| Autonomous Research Agent | 高 | 高 | 研究和知识工作场景最容易率先出现高价值闭环 |
| Self-evolving Agent | 高 | 高 | 会从论文里的 reward / verifier 演化,走向持续改进产品 |
| Multi-agent Organization | 高 | 高 | 商业 coding agent 已进入并行任务、subagent/team、后台 agent 和隔离工作区阶段 |
| Computer-use Generalist | 高 | 高 | GUI、CLI、API、browser 和企业软件进入同一真实工作流 |
| Robotics / Embodied Agent | 中高 | 中高 | 新闻和研究信号密集,但真实部署仍受硬件和安全约束 |
| Proactive Agent | 中高 | 中 | 价值很大,但打扰、信任和责任边界仍是主要障碍 |
| Self-supervised / Open-ended Agent Learning | 中 | 中高 | 可能是研究突破点,短期不一定成为完整产品主题 |
下面逐条说明:为什么现在可能爆发、哪些公开信号支撑、可能出现什么“大动作”,以及我们应该如何理解自己的位置。
下面的表格不把 35 个名词当成 35 条赛道,而是将它们归并为 20 个可观察方向。前三列描述“现在已经具备的基础”和“明年可能发生的变化”,第四列给出判断理由,最后一列给出可追溯来源。概率含义是:高 = 至少有产品/产业与论文/benchmark 两类信号;中高 = 有明确先导信号但仍受部署条件约束;中 = 主要是研究或平台试点;观察 = 尚缺少可验证的规模化路径。
| 方向 | 当前基础 | 2027 H1 可能变化 | 判断理由 | 主要来源 |
|---|---|---|---|---|
| 智能体组织管理层 | Codex、Claude Code、Cursor 已提供并行任务、后台执行、隔离工作区或子智能体入口 | 从“创建一个智能体”升级为登记、分派、授权、计费、绩效和撤销一组智能体 | 智能体数量增加后,组织管理和责任归因会成为企业控制面;单纯增加 worker 数量不能解决协调成本 | Codex、Claude Code teams、Cursor Cloud Agents |
| 多会话通信与协作 | 前台对话、后台任务、子智能体和设备端已经分别出现,但会话之间通常缺少统一状态和事件语义 | 用事件总线连接用户会话、后台 worker、验证 worker 和设备端,支持顺序、取消、交接、权限继承和冲突处理;重启后还能按消息编号去重恢复 | 多智能体真正扩展后,瓶颈会从“能否调用多个模型”转向“多个会话能否组成可恢复系统”;DeepSeek Harness 的持久邮箱和任务图把这一问题具体化 | A2A、A2A samples/TCK、Claude Code teams、DeepSeek Harness Agent Teams |
| Life-long Agent:跨会话持续工作 | 长程任务、合成电脑和后台编码任务已经把运行时间从单轮扩展到小时级 | 任务跨会话、跨设备、跨模型和跨 worker 恢复,并把成功经验转为可复用能力 | Life-long 的关键不是偏好记忆,而是任务、状态和能力连续;恢复后能继续做对才是核心验收 | OneDayAgent、Synthetic Computers at Scale、SWE Marathon |
| 软件交付工厂 | 编码智能体已经能处理部分需求、修改代码、运行测试并返回变更 | 从单个编码任务扩展为需求分派、并行实现、测试、审查、发布和长期维护 | 代码和测试提供相对确定的验收条件,最容易形成可计量的后台工作单元 | SWE Marathon、PaperBench、Agents' Last Exam、Codex |
| 研究组织与知识生产 | Deep Research、研究型多智能体和自动实验系统已覆盖检索、写作、核验等局部环节 | 维护长期问题,提出假设,安排实验,寻找反例,更新知识图,并决定何时停止 | 研究交付物可由来源、实验和专业人员复核;但开放世界的新发现能力仍未被证明,因此是中高概率而非确定主线 | Quest、Apodex、Google AI co-scientist、Sakana AI Scientist |
| 企业与专业工作流 | CRM、ITSM、财务、法律、医疗和科研产品已把智能体连接到业务数据和审批流程 | 以可安装的工作流包提供任务状态、领域工具、证据、审核和责任收据 | 企业更容易购买有明确输入、输出、审批和成本的半自治流程,而不是通用员工替代品 | Microsoft Copilot Studio、Salesforce Agentforce、ServiceNow AI Agents |
| 全双工多模态智能体 | 实时语音、视觉输入、流式输出和可取消工具调用分别出现 | 同时处理语音、屏幕、图像和工具事件;用户可打断,后台任务不中断,系统能处理多路输入输出冲突 | 全双工的难点是事件调度、打断后的恢复和工具副作用,不是单纯降低语音延迟 | GPT-Live、Seed full-duplex、Speculative Interaction Agents |
| 能力包与技能供应链 | SkillsBench、技能仓库、插件和工具注册表已出现 | 技能、检查器、工作流和评价标准具备来源、权限、测试、版本、回滚和分发机制 | 技能数量增长后,选择质量、依赖风险和版本漂移会比“有没有技能”更重要 | SkillsBench、Anthropic skills、MCP Registry |
| 工具与智能体协议 | MCP 连接工具和资源,A2A 提供能力发现、异步任务和交付物交换 | 出现企业私有注册表、协议兼容测试、版本锁定和跨平台回放 | 协议本身不会解决身份、责任和任务验收;下一步竞争在可治理的互操作,而不是消息格式 | MCP specification、A2A、A2A TCK/ITK |
| 受控的智能体交易 | Agentic Commerce Protocol、支付网络和商户平台开始描述智能体购物和结账 | 先在预算、期限、商户白名单和人工确认下形成封闭采购/服务网络 | 交易需要身份、支付、争议和退款机制;因此受控交易比无限额自动购物更可能先落地 | Agentic Commerce Protocol、Visa Intelligent Commerce、Mastercard Agent Pay |
| 可持续工作环境与训练世界 | 合成电脑、工作空间基准、GUI 环境生成和研究模拟器开始出现 | 工作环境成为可生成、可重置、可验证、可注入失败并可回放的训练与部署资产 | 长期能力无法只靠模型和提示词获得,必须有稳定的环境、反馈和反事实样本 | Synthetic Computers at Scale、GUI-GENESIS、CUA-Gym |
| Agent World Model | 环境生成和工作空间模拟器可以提供任务与终态,但多数系统仍依赖即时观察和脚本验证 | 建立对电脑、代码库、业务流程或物理环境的可预测状态模型,支持动作后果预测、反事实规划和回放 | 没有环境状态模型,长期任务只能反复试错;世界模型是从“能操作环境”走向“理解环境如何变化”的关键一步 | WorldMemArena、GUI-GENESIS、NVIDIA Cosmos、Gemini Robotics |
| 可靠性、评测与持续集成 | 过程核验、失败定位、轨迹回放和长程 benchmark 正在增加 | 版本发布前检查恢复、权限、注入、副作用、成本、人工接管和交付物,而不只看最终答案 | 生产采购需要可解释的质量和损失边界;评测会从排行榜转向带运行条件的完整记录 | OS-Themis、VAGEN、CUADebug |
| 身份、权限与责任 | 企业平台已有连接器、凭证、审批和审计入口,安全研究集中于注入和越权 | 形成可委托、限时、限额、可撤销的智能体权限,以及行动收据和补偿机制 | 智能体能执行外部动作后,责任边界会成为上线和保险的前置条件 | OWASP Agentic AI threats、NIST AI RMF |
| 受控的能力演化 | 奖励演化、检查器生成、技能迁移和长期记忆研究分别发展 | 失败轨迹产生候选技能、检查器和评价标准,经回放、未见任务和人工审核后进入能力库 | 自我改进只有在可验证、可回滚和能避免旧任务退化时才有产品价值 | DR Tulu/RLER、OS-Themis、LaMer |
| 实时与主动交互 | 全双工语音、视觉交互和会议总结已经进入产品与研究 | 实时入口连接后台任务,智能体主动汇报进展、提出候选行动并等待授权 | 低延迟对话本身差异有限,真正的新价值是把持续交互接回长期任务和交付物 | GPT-Live、Speculative Interaction Agents、PROEVENT |
| 多模态长期状态 | 截图、视频、语音、文件和工具结果逐渐进入记忆研究 | 形成带时间、来源、权限和新鲜度的多模态项目状态,而不是简单摘要 | 多模态证据会直接影响电脑操作和研究判断,但压缩、删除和权限治理仍是难点 | MemLens、FocusMem |
| 可组合、可逆的 Agent Runtime | 事件流、插件、异步调度和组件替换已有框架先例,但通常要求重启或重新建立会话;DeepSeek Harness 已公开持久会话、激活恢复、先进先出邮箱和团队任务图 | 运行时组件在线插拔,异常时保护现场、局部回退和现场调试,支持异构智能体协作;同时明确会话、循环和工具副作用的恢复边界 | DSH/Cordis 讨论把全双工、具身和长周期任务中的动态组合问题提到前台;但会话状态回退、事件顺序、循环依赖和协议遵守仍未充分验证,不能把框架讨论当成效果证明 | DeepSeek Harness subagent、DeepSeek Harness Agent Teams、Cordis paper repository、A2A |
| 具身任务平台 | 视觉语言动作模型、仿真和机器人开发平台信号密集 | 先出现技能注册、仿真回放、远程接管和受控行业试点,而非通用家庭机器人 | 硬件、数据和安全使通用产品周期更长;软件侧应先做任务契约和验证接口 | Gemini Robotics、Gemini Robotics on-device、NVIDIA GR00T、Physical Intelligence π0 |
| 陪伴、教育与开放式社会智能 | 实时人格、长期辅导和多智能体社会模拟已有论文与消费产品信号 | 可能出现课程状态、关系记忆和社会协作的受控产品 | 责任、未成年人保护、心理安全和评价标准尚未稳定,暂列观察位 | PersonaPlex、GPT-Live、Character.AI Safety |
完整扩展调研底稿见:论文与 benchmark、商业产品与生态、开放式 horizon scan、会议/workshop 波次、市场采用波次、产品新闻波次、安全与协议波次、Life-long 波次、Multi-agent Organization 波次、Research/Evolving 波次、Commerce/Vertical 波次、Robotics/Embodied 波次、UX/Companion 波次、Benchmark/Reliability 波次、Open-source Protocol 波次。
把长期任务作为主线产品叙事,选择研究项目或软件交付作为第一批场景:用户给出目标后,agent 可以连续工作数小时到数天;中途留下可读的进展、产物、未决问题和下一步;用户回来后可以继续、改目标、接管或验收。第一阶段不追求覆盖所有个人事务,而要把“任务能否持续做完”做成清楚的样板。
合理性:它同时检验 Life-long 的三种连续性,也天然需要 multi-agent、research、omni 和 computer-use;相比单纯展示记忆召回,更容易证明真实生产力价值。Synthetic Computers at Scale、Kimi K3 和 Agents' Last Exam 已把小时到周级任务带进公开讨论,市场也开始把后台 coding task 当作产品单位。
围绕 coding 和 research 各做一套可复用组织模板:任务负责人负责拆解和汇总,专业 worker 负责独立产出,verifier 负责找冲突和检查完成度,用户在授权、方向变化和最终交付处做 checkpoint。每个 worker 都有清楚的任务边界,结果以代码、证据表、报告、测试结果或待办状态交付;需要时可以后台运行、暂停、恢复和交接。
合理性:Codex、Claude Code 和 Cursor 已从不同侧面验证了“并行任务 + 隔离工作区 + 异步运行 + 人类 review / merge”的产品需求。真正可迁移的能力是组织和交付,而不是 agent 数量;这也与 Apodex、Quest、DR Tulu 等研究中“执行者与验证者分工”的共同趋势一致。
DSH/Cordis 更接近面向智能体开发者和长程轨迹生产的底层运行时,而不是开箱即用的 B 端或 C 端应用框架。内部专题讨论提出的热插拔、可逆组件、异步事件和保护现场,确实对应全双工交互、具身动作撤销和跨天任务恢复的共同痛点;DeepSeek Harness 的公开子智能体和 Agent Teams 实现则提供了持久会话、冷恢复、先进先出邮箱、任务图和幂等重放的可观察参照。
我们先在现有 Agent Kernel 上做最小组合横向对比:持久会话与事件日志、稳定子智能体身份、先进先出消息入口、任务依赖图、可回放产物、权限与中断、现场调试和释放审计。沙盒至少验证六件事:组件热插拔是否保留上下文;工具调用被打断后是否能继续且不重复产生副作用;多路事件是否有明确顺序和幂等规则;循环依赖能否被发现并停止;Session/Loop 等有状态对象在故障后能否恢复或明确要求迁移;进程重启后消息、任务和责任链能否重放。通过后只复用有证据的组件,不全量切换协议。
合理性:这条实验线直接检验“长期任务 + 多会话组织 + 全双工交互”共同依赖的运行时边界,也能把 DSH 讨论中的风险转化为可比较的验收项。需要明确的是,公开 DSH/Cordis 材料尚未给出足以证明生产效果的系统实验;我们的结论只能是“值得验证的基础设施方向”,不能写成已经解决的工程能力。
先围绕文献调研、竞品分析和实验复现做 research workflow:明确问题、主动检索、形成证据链、寻找反例、交叉核验、输出带依据的结果,并保存中间过程供后续任务继续使用。评价重点放在结论可复核、发现新信息、减少人工往返和跨任务复用,而不是报告字数或单一 benchmark 分数。
合理性:这是当前论文和产品信号最密集、价值也最容易被研究团队感知的场景;同时能把我们的 research agent、评测和 evolving 积累串成闭环,再将组织模式迁移到其他知识工作。
实时语音、视觉和屏幕交互不单独做成聊天 demo,而是服务于长期任务:用户可以随时询问进展、打断或改变目标,agent 可以在合适时机汇报、请求授权或提交待审结果。Omni 是交互入口,后台任务和多智能体组织才是持续价值来源。
合理性:全双工和实时交互已有密集论文与产品信号,但单纯低延迟问答的壁垒有限;把实时入口接到长期任务和可审阅产物上,才能与已有 Life-long、GUI 和 research 积累形成组合优势。
从成功和失败任务中提炼可复用的工作方法、检查清单和反例,先在新的任务和环境中验证,再允许进入共享能力库;重要变化保留来源、版本和人工确认,不让 agent 仅凭自评结果修改自己的标准。重点观察它是否减少重复探索、提高跨任务迁移,而不是只提高自家 judge 分数。
合理性:Self-evolving 是长期差异化的来源,但也是最容易自我强化错误的方向。把它嵌入长期任务和组织工作流,既能获得持续反馈,又能通过 verifier 和 human checkpoint 控制风险。
所有方向用同一组高层问题验收:任务是否真的完成、能否跨天恢复、多人协作是否减少返工、产物和证据是否可审阅、失败能否定位和修正、下一次任务是否因此更快更好。评测报告必须同时给出 task/environment/model/harness/tools/judge/timeout/budget/credentials tuple,以及质量、成本、延迟、人工接管、失败损失和安全副作用;不能用一个没有运行条件的排行榜分数代表 agent 能力。这样可以避免每条线各自追逐孤立指标,也能把研究结果直接翻译为产品能力。
第二波专项材料把原先容易混在一起的热点拆成四个闭环:
planner → worker → verifier → human merge,并通过 task graph、shared blackboard、版本化 artifact 和 worker lifecycle 协作。Codex、Claude Code、Cursor 的公开产品形态共同验证了并行任务、隔离 workspace、后台运行和人类合并的需求;未公开的内部 topology 不应被推断。这四个闭环解释了为什么“memory、multi-agent、research、evolving、security”不是五个平行项目:前者提供状态,后者提供组织、价值场景、能力增长和上线边界。
server.json、发布/命名空间验证与 subregistry 边界;A2A 已公开 Agent Card、异步任务、artifact、TCK/ITK/Inspector 和 Linux Foundation 治理信号;skills/plugins 和开源 SDK 则把能力打包与 handoff 带入开发者工作流。2027 H1 更可能出现企业私有 registry、可信 connector、协议 conformance/replay 和 registry observability,而不是陌生 agent 自动组成开放互联网。我们的切入是 provider-neutral task contract、MCP/A2A/skill adapter、版本锁定、权限/副作用 gate 和 adoption ledger。这些方向扩大了市场边界,但没有改变优先级:先用 research、coding 和企业内部流程验证长期任务、组织、证据和权限,再把同一套 contract/registry/replay 迁移到 commerce、regulated vertical 和 embodied pilot。
因此,我们的策略不是押注某个单独名词,而是先做出一个可跨天工作的 agent,再用多智能体组织、研究场景、实时入口和受控演化逐层增加价值。若长期任务样板无法稳定交付,其他方向即使在 benchmark 上领先,也很难形成真正的大动作。
现在的 agent 大多仍是 session-bound:一次任务结束,经验、项目状态、未完成步骤和失败原因就被丢回数据库或聊天记录。Life-long Agent 不能只理解成“更好的个性化”,至少包含三种连续性:
因此,Life-long 的主体不是“记住我喜欢什么”,而是“记得工作做到哪里,并能继续把它做完”。个性化只是其中一个较浅的应用。
可以把任务连续性粗略分成四个尺度:
| 尺度 | 典型形态 | Life-long 的新增要求 |
|---|---|---|
| 单次长回合 | 数十步 GUI、coding 或 web 任务 | 记住中间状态,遇到错误能回退 |
| 多小时任务 | 长研究、复杂 coding、桌面生产力任务 | context compact、阶段性产物、暂停 / 恢复 |
| 跨天任务 | 后台 issue、实验、报告和项目推进 | durable task state、定期汇报、模型 / worker 交接 |
| 跨任务积累 | 多个项目和长期用户 / 团队工作 | skill、失败模式、角色选择和组织记忆迁移 |
因此,long-horizon task running 不是 Life-long Agent 的一个边角功能,而是从“记忆”走向“持续工作”的中间层。
这条线的信号已经不是单纯的 long context:
MemLens 将多模态长期记忆拆成 recall、时序、定位、视觉 fidelity 等相互独立的能力,并指出“拉长上下文”与普通 RAG 都不足以解决长期记忆问题。papers/memlens.mdFocusMem 把 GUI memory 分成内容、读取和信任三部分,说明 memory 不只是“存什么”,还包括“何时读、读出来是否可信”。结果有正向信号,但仍是单次运行、冻结模型和单一 judge,属于强方向信号而非定论。papers/focusmem.mdpapers/lclm-e2e-context-compression.md、papers/lloco-learning-long-contexts-offline.md、papers/memoryllm-mplus.mdSynthetic Computers at Scale 已把 agent 运行拉到约一个月工作量:平均 2272 turns、8.59 小时,并把成功轨迹抽成 occupation skills,再迁移到 held-out 电脑和 GDPVal 任务。papers/synthetic-computers-at-scale.mdpapers/kimi-k3-tech-report.mdCompactionRL 把摘要 / context compaction 纳入长程任务的 policy,而不是把它当作固定 preprocessing;TideRL 则把暂停、恢复、ready backlog 和任务驻留作为 agentic RL 的核心调度对象。papers/compactionrl.md、papers/tiderl.mdLaMer 用跨 episode 的 Meta-RL 让 agent 在同一 trial 中先探索、后利用;它说明长期适应不仅是保存记忆,也可以是在连续任务中改变策略。papers/lamer-meta-rl-language-agents.md我预期会出现四类动作:
Life-long Agent 的真正分水岭不是 memory 容量,也不是一次能放多少 token,而是:
如果只做“聊天历史摘要 + 向量检索”,我认为很难形成下一轮大动作;更有潜力的是 memory + durable task state + action + feedback 的闭环。Long-horizon running 是 Life-long Agent 的主体,不是 memory 产品的附属功能。
这是我们最应该持续投入的方向之一,但研究问题应从“memory 是否有效”升级为“agent 能否持续把长任务做完”。DuplexOmniAgent 已有 lifelong memory、memory decoding、context compact 和 native multimodal memory 的连续积累;ReinforceAgent 从外部 episodic memory 与 policy 联合优化切入;Plan Mode、GUI 和 AgentPlat 则可以提供真实的长程任务与跨环境执行载体。当前最有价值的判断不是追求一个漂亮的压缩倍数,而是验证:agent 是否能在跨 session、跨环境和跨 worker 的任务中恢复状态、减少重复探索、继续完成工作,并把结果沉淀成下一次可复用能力。
相关入口:projects/duplex-omni-agent/、projects/duplex-omni-agent/design/lifelong-memory-roadmap.md、projects/reinforce-agent/README.md。
Omni agent 的关键变化不是输入模态从文字增加到音频和视频,而是交互时间模型发生变化:用户不必等 agent 说完,agent 也不必等用户完全停下;它可以边听、边看、边思考、边调用工具,并在用户改变意图时及时调整。
近期信号非常密集:
papers/gpt-live.md、papers/interaction-models.mdpapers/seeduplex.md、papers/minicpmo-4-5.md、papers/qwen3-omni.md、papers/bayling-duplex.mdFull-Duplex-Bench 已把抢话、停顿、打断、工具调用和多步任务纳入评测,说明行业开始从“听起来像真人”转向“能不能在真实时间线上完成事情”。papers/full-duplex-bench.mdSpeculative Interaction Agents 研究异步用户输入、工具调用和 speculative action,说明实时 agent 的核心问题已经从 speech quality 转向 action timing 和 cancellation。papers/speculative-interaction-agents.mdOmni agent 是否能形成真正的产品跃迁,取决于它能否处理四件事:
因此,单纯把语音 tokenizer 接到 LLM 上不会自动得到 omni agent。真正有价值的是“连续感知 + 连续行动 + 后台任务”三者合在一起。
这是近期最有可能出现大规模产品动作的方向。我们已有 DuplexOmniAgent、chunked-tool-call 和 duplex-sandbox 三条积累,适合把重点放在“agentic omni”而不是普通语音聊天:让实时模型能够看见工具、环境和长期任务,并在不中断用户体验的情况下推进工作。
相关入口:papers/reading-lists/duplex-omni-agent.md、projects/duplex-omni-agent/、projects/chunked-tool-call/。
Autonomous research 的价值比较容易被组织感知:如果 agent 能够自己检索、比较、验证、写报告,并且明显减少研究人员的时间,它就不只是“更好用的聊天机器人”,而是一个新的工作单元。
近期信号包括:
papers/quest-deep-research-agent.mdpapers/apodex-1-tech-report.mdpapers/dr-tulu-rler.mdAutonomous Research 的核心不是报告写得像不像,而是:
未来真正有影响力的系统可能不再以“回答准确率”作为唯一指标,而会评估研究结论的可复核性、证据质量、发现新信息的能力和研究成本。
这是我们已有论文积累最完整、也最适合形成方向叙事的一条线。Quest、Apodex、DR Tulu、AutoEvolvingRewarding、AgentPlat 可以组合成“研究 agent 的数据、验证、评测和演化”主线。相比做一个泛化的 web agent,我们更应该关注:研究过程如何沉淀为可复用经验,评价标准如何随领域变化,agent 如何在发现未知信息时继续推进。
相关入口:papers/reading-lists/agent.md、projects/auto-evolving-rewarding/。
如果 agent 每次失败都只能等人重新写 prompt、增加数据或升级模型,它的能力上限仍由人工迭代速度决定。Self-evolving agent 的目标是让 agent 从轨迹、失败、环境反馈、工具使用和自我评价中持续改进。
这条线的论文已经形成连续谱:
papers/evocua.mdpapers/vagen.md、papers/prore.md、papers/os-themis.mdpapers/rlar.md、papers/dr-tulu-rler.mdpapers/self-rewarding.md、papers/meta-rewarding.md、papers/eureka.mdSelf-evolving 方向最容易被夸大。真正的演化必须满足:
目前很多工作仍是单环境、单次运行、单一 judge 或自报结果,因此我把“方向概率”评为高,但把“通用自我改进已解决”评为低。
这是我们最适合形成差异化的方向之一。AutoEvolvingRewarding 已经把 Program、TestSuite、replay、shadow、provenance 和 promotion gate 组织成一个可复用框架;ReinforceAgent 提供跨环境 experience 迭代;PlanRL / GUI agent 则提供真实 executor 和失败样本。我们不应把目标写成“让 agent 自己变聪明”,而应聚焦于:如何让 agent 的失败变成可靠的新能力,而不是新的偏差。
相关入口:projects/auto-evolving-rewarding/README.md、projects/reinforce-agent/README.md、papers/reading-lists/auto-evolving-rewarding.md。
多智能体的早期做法是把同一个 prompt 发给多个模型,再投票或拼接结果。现在的重点已经变成 如何组织一组有不同上下文、权限、工具和职责的 agent,让它们共同完成一个长期任务。
一个真正的 agent organization 至少包含六个问题:
因此,“多智能体”不是一个单一架构,而是一组组织模式:
| 组织模式 | 典型结构 | 适合的任务 | 真正的难点 |
|---|---|---|---|
| 并行 fan-out / fan-in | 主 agent 拆题,多个 worker 并行,主 agent 汇总 | 搜索、代码探索、候选方案比较 | 重复劳动、结果冲突、汇总偏差 |
| 层级 manager-worker | manager 分派、worker 执行,必要时继续拆分 | 复杂研究、长程 coding、跨应用任务 | manager 是否能正确估计难度和依赖 |
| specialist + verifier | 执行 agent 产出,专职 agent 检查事实、测试或安全 | deep research、代码修改、GUI 交付 | verifier 是否独立、是否能发现“看起来完成”的错误 |
| pipeline / staged team | planner → researcher → implementer → reviewer → publisher | 研究报告、软件交付、内容生产 | 中间 artifact 是否足够稳定,阶段边界是否清楚 |
| background worker pool | 用户继续交互,后台 agent 持续跑任务并回传结果 | IDE、个人助理、长耗时研究 | 用户意图变化、取消、资源和状态持久化 |
| shared workspace organization | 多 agent 通过文件、issue、任务表和日志协作 | coding、项目管理、长期研究 | 并发写冲突、状态陈旧、谁拥有最终版本 |
Codex、Claude Code、Cursor 的内部实现并不完全公开,但它们对用户暴露的产品形态已经足以说明行业方向。三者不是同一种“多智能体”:
| 产品 | 公开可见的组织形态 | 协作边界 | 我们对它的判断 |
|---|---|---|---|
| OpenAI Codex | 可同时启动多个 cloud coding task;任务在独立环境 / 分支或 worktree 中运行,完成后由用户 review、应用或合并结果。相关能力见 Codex overview、Codex app 和 Codex launch。 | 以“任务级并行 + 隔离执行 + 人类合并”为主;公开资料不能确认其内部是否采用显式角色型 subagent graph。 | Codex 把多智能体首先做成 可持续运行的并行工作单元,而不是聊天窗口里的角色扮演。 |
| Claude Code | 公开支持 subagents,并提供实验性的 agent teams:主 agent 可以分派专门角色,团队成员共享任务进度并相互沟通。 | 以“主 agent / team lead + 专门 worker + 共享任务状态”为主,角色和上下文边界比一般并行调用更显式。 | Claude Code 最接近 显式 agent organization:协调、角色、任务分配本身成为产品功能。 |
| Cursor | 公开提供 background / cloud agents 一类异步执行能力,可让多个 coding agent 在远程隔离环境中同时处理任务,再通过 branch / diff / PR 回到用户工作流。 | 以“远程后台任务 + 隔离 workspace + 结果审阅”为主,公开产品更强调任务吞吐和 IDE 集成,较少暴露内部团队消息语义。 | Cursor 更接近 agent worker platform:多 agent 是持续产出代码和 PR 的工作池。 |
这里有一个重要判断:商业产品的 multi-agent 不是论文中常见的“多个 agent 互相聊天”。它们把多智能体嵌入真实工作流:每个 worker 有自己的上下文和工作区,结果以 diff、artifact、测试报告或任务状态交付,用户负责高价值的授权和合并。隔离、异步、可恢复和可审阅,比“角色数量”更重要。
papers/apodex-1-tech-report.mdAgents' Last Exam 已把 Codex、Cursor、Claude Code 等商业 harness 放在同一组真实职业工作流中比较;公开失败分析显示瓶颈仍主要在 approach、任务完整性和领域理解,而不是简单的工具调用。这说明商业 multi-agent / harness 竞争最终要落到“能否完成复杂交付”,而非“能否启动更多 agent”。papers/agents-last-exam.mdpapers/quest-deep-research-agent.md、papers/dr-tulu-rler.mdpapers/prore.md、papers/vagen.md、papers/os-themis.mdSynthetic Computers at Scale 的月级仿真使用 setup agent、work agent、协作者和 skill 抽取闭环;它更接近“长期工作组织”,而非单任务 agent。papers/synthetic-computers-at-scale.mdSelf-Supervised Goal-Reaching ... Multi-Agent Cooperation 是弱信号:它提示多 agent 可能通过 goal-conditioned coordination 获得探索优势,但目前仍主要是研究环境结果,不能直接外推到 coding / research product。papers/self-supervised-multi-agent-goal-reaching.mdDSH 的价值不应只概括为“能启动子智能体”。其公开实现把子智能体拆成持久会话、运行中激活和消息入口三个层次:会话可以在进程空闲或重启后重新激活;同一个子智能体通过先进先出消息入口接收后续工作;父子关系、释放顺序和结束通知被记录下来。详见 subagent subsystem 和 continuation implementation。
实验性的 Agent Teams 再向上增加负责人、命名成员、持久邮箱和共享任务图:消息先写入队列,目标确认后再标记已投递;恢复时重放未确认消息,并按消息编号去重;任务更新使用版本号,依赖关系要求保持无环。它更接近“可恢复的工作组织”,而不是多个模型互相聊天。公开默认限制是最多 8 个成员、每个成员最多 64 条待投递消息和 256 个未删除任务;因此不能把其中的 64 解读为并发 worker 数量。Agent Teams subsystem
这组设计把 2027 H1 的问题边界说得更清楚:长期智能体需要稳定身份、冷恢复、消息幂等和责任归属;多智能体组织需要任务图、邮箱和交付物;运行时需要明确哪些状态可以替换,哪些状态必须通过迁移或人工确认处理。它仍不能证明生产环境的成功率,也不能代替对事件时序、跨进程恢复、共享工作区写冲突和高副作用工具的实测。
组织记忆不应被实现成“把所有聊天内容做向量检索”。它至少要记录以下对象:
| 对象 | 需要保留的事实 | 典型关系 |
|---|---|---|
| 项目与目标 | 范围、截止时间、成功条件、当前版本 | 包含任务、依赖项目、被谁授权 |
| 任务与工作者 | 状态、负责人、预算、重试、暂停原因 | 分派给、阻塞于、交接给、由谁验证 |
| 产物与证据 | 文件版本、代码变更、实验结果、来源、有效期 | 由任务产生、支持决定、被后续版本替代 |
| 决定与争议 | 采用方案、反对意见、批准人、适用范围 | 基于证据、否决方案、需要复审 |
| 权限与副作用 | principal、范围、期限、审批、外部动作收据 | 授权给、继承自、已撤销、影响产物 |
| 失败与修复 | 失败阶段、根因、修复动作、是否复现 | 发生于任务、修复产物、转化为候选技能 |
这张图的价值在于支持实际工作,而不是增加一个可视化页面。最小查询应包括:当前最可信的项目状态;某个决定的证据和批准链;任务暂停后下一步应从哪个检查点继续;两个 worker 结果冲突的来源;某份文件或记忆是否已经过期;以及撤销某项授权后哪些后续动作必须停止。图中每条关系都要带时间、来源、权限和置信度,支持纠错、删除和审计。MemLens、Synthetic Computers 和 WorkSpaceBench 提供了记忆、长期工作和工作空间的先导信号,但关系一致性、隐私隔离和跨项目迁移仍需自行评估。
多智能体最难的不是并行,而是 协调收益能否抵消协调成本。必须回答:
这条线的概率应从“中高”上调为“高”。原因不是多智能体论文数量增加,而是 Codex、Claude Code、Cursor 已把多任务、subagent/team、后台 worker、隔离 workspace 和人类合并带进主流 coding 产品。2027 H1 很可能继续出现两类大动作:一类是 coding IDE 把 agent organization 做成默认工作流;另一类是 research / productivity agent 把相同组织模式迁移到非代码任务。
我们应重点研究的不是“如何再开更多 agent”,而是:
这与 Agent Kernel、AgentPlat、AutoEvolvingRewarding、Plan Mode、ReinforceAgent 和 DuplexOmniAgent 都有关,但重点应从“底层协议”上移到 agent organization as a product and research paradigm。
Computer-use 是 agent 最容易被用户直接感知的能力:它能否打开软件、阅读屏幕、操作网页、处理文件并完成跨应用任务。GUI 也提供了比纯文本环境更接近真实世界的反馈,因此很适合成为 agent training 和 autonomous work 的试验场。
本库已有 YouTube→GUI、AgentNet、OSWorld、OpenComputer、WindowsWorld、MobileWorld、GUI reward 和多评测能力地图等连续证据。YouTube MidTrain 与 AgentNet 的互补结果,以及子目标级 ICL 的正向结果,说明长程理解和动作精度需要不同数据来源。projects/yt2gui-long-horizon/README.md、findings/youtube-midtrain-outperforms-agentnet-equal-data.md、findings/subgoal-icl-outperforms-trajectory-icl.md
这是“最容易落地、但最难稳定”的方向。我们应把 GUI 视为长期 agent 和 autonomous work 的实验场,而不是孤立的坐标预测任务。重点应放在长程任务、失败恢复、状态变化和跨应用工作流,单步点击精度只是基础能力。
传统 assistant 的边界是“用户问,我回答”;长期 agent 的边界是“我知道什么时候应该提醒、询问、准备或直接行动”。PROEVENT 等工作已经把 response timing、事件插入、更新和删除纳入 proactive agent benchmark;Interaction Models、GPT-Live 和 realtime agent 也都在强调后台工作和适时介入。papers/proevent.md、papers/interaction-models.md
Proactive agent 的技术难点之外,更大的障碍是信任:什么时候算“有帮助”,什么时候算“打扰”;错误行动由谁负责;用户是否能理解 agent 为什么此时介入。这个方向可能在产品上突然出现,但研究评价和安全边界仍不成熟。因此建议跟踪,不要把它当作唯一主线。
会议和主动 agent 的产品机会不只是“总结得更好”,而是把 meeting → commitment → task → follow-up 变成可审阅的长期状态。UX 专项扫描显示,full-duplex、meeting agent、task queue 和 artifact-native workspace 的交叉信号强于“完全自主陪伴”:用户更愿意接受低风险的候选行动、提醒、草稿和后台研究,而不是 agent 在没有可见理由时替自己做不可逆决定。
可能的大动作:会议后自动生成带负责人和期限的任务,后台 worker 跟进资料和草稿,在截止前主动询问或升级;实时语音/视觉入口可以随时查看进展、打断和授权。教育产品则把 tutor/coach 的长期 mastery state 与任务队列连接起来。
我们的做法与合理性:建立 research meeting-to-task 样板,事件、承诺、artifact、候选行动和过期时间全部可追溯;每个主动行动先显示触发理由、影响范围和撤销方式。统一测提醒收益、打扰成本、状态正确率、接管时间和用户修正,而不是只测 ASR 延迟或摘要质量。陪伴和未成年人场景暂不作为主线,先观察关系记忆删除、心理安全和责任边界。
如果 agent 只能在已有任务和人工 reward 上学习,它很难获得开放世界中的探索和迁移能力。Self-supervised RL、temporal representation、goal-conditioned exploration、multi-agent goal reaching 和 emergent skill work 试图从轨迹中的时间关系、状态变化和可达性中学习,而不依赖每一步人工标注。papers/reading-lists/self-supervised-rl.md
近期这条线的弱信号包括:contrastive RL、temporal distance、self-supervised multi-agent goal reaching、recurrent depth / test-time compute,以及把 agent 经验转成可重用 skill 的工作。它们还没有统一产品形态,但可能为 Life-long Agent 和 Self-evolving Agent 提供更强的底层学习机制。
这是中期研究突破点,不一定在 2027 H1 形成成熟产品。我们应该把它作为 Life-long / Evolving 的前沿储备,重点看是否能在真实 agent 环境中转化为更好的探索、失败恢复和跨任务迁移,而不是只在 toy environment 上报告 representation 指标。
Coding agent 是 Life-long 和 Multi-agent 最早形成商业闭环的场景。产品单位不再是一次 patch,而是 issue → 计划 → 多文件修改 → 测试 → review → PR / release 的持续交付工作单元。它把长期记忆、后台 worker、artifact、verifier 和人类合并放进一个可观察流程。
2027 H1 很可能出现“agent software factory”:issue triage、实现、测试、review、文档和发布形成默认组织模板,并从代码扩展到数据管道、部署和运维。我们应以真实仓库或可复现项目做样板,验收跨天恢复、失败解释、测试覆盖、人工 review 时间和下一次任务的重复探索减少,而不是只看 SWE-bench pass rate。
Skill 正从 prompt 片段变成包含说明、脚本、资源、前置条件、权限、verifier、成功/失败案例和版本的能力包。它既是 Self-evolving 的产物,也是 Multi-agent 组织跨任务复用的公共资产。
Synthetic Computers at Scale 从长程轨迹抽取 occupation skill 并迁移到 held-out 电脑和 GDPval;Watch and Learn、OpenCUA 和 EvoCUA 分别提供视频、人工轨迹和在线经验进化信号。可能出现组织级 skill registry、skill marketplace 和自动 skill authoring。我们应先建立 research、coding、GUI 三类小型 registry:每个 skill 固定适用场景、权限、输入输出、版本、测试轨迹和回滚方式;新 skill 先进入 shadow registry,经 held-out 任务和人工批准后才共享。否则“skill store”很容易退化为没有质量保障的 prompt library。
当 agent 要从几十个工具中选择并组合动作,核心问题变成能力发现、schema 理解、成本/延迟权衡、失败恢复和副作用控制。MCP Atlas 让 agent 在大量真实 MCP server 和工具中自行选择;Toolathlon-Verified 与 Automation Bench 评估跨工具的验证型任务;Speculative Interaction Agents 则把工具调用建模成可取消、可修改的 DAG,并区分 read-only 与 side-effect。
MCP 官方规范和持续增长的 server 生态说明连接需求已成立,但协议本身不等于可靠性。2027 H1 可能出现工具目录、能力检索器、企业 connector、工具质量评分和副作用审批产品。我们应把工具定义成带权限、成本、幂等性、回滚、版本和 provenance 的 capability contract,并在真实研究/办公工具上评估“选择正确工具”和“工具失败后能否继续”。
企业和专业行业有结构化数据、固定流程、审批节点和明确预算。agent 的产品形态会是带 connector、权限、SLA 和审计的工作队列,而不是开放式聊天。科研、软件研发、金融分析、法务文书、医疗信息整理、咨询和 IT 运维是较容易率先落地的垂直。
不先做泛企业平台,先从研究组内部文献入库、实验复现、结果审阅、资源申请或工程分析中选择一个可验证 workflow,把领域资料、工具权限、verifier、人工审批和 provenance 固化为模板。验收看交付物、证据覆盖、人工复核时间、错误升级率和跨任务迁移,而不是行业版聊天体验。
长程 agent 的主要产品风险是过程不可见、失败难定位、结果无法审计。CUADebug 提供失败轨迹的 root-cause、证据和 correction;OS-Themis、VAGEN、ProRe 分别将 milestone verifier、主动环境 probe 和 reasoner/evaluator 协作引入 GUI agent;Agents' Last Exam 和 AgentPlat 则把真实职业任务与统一 harness 推到前台。
Agent 平台可能像软件工程一样引入 CI:每次模型、skill、工具或 prompt 更新,都在长程任务、失败回放、权限边界和副作用检查上做 release gate。我们应把 Agent Kernel 的事件流、checkpoint、权限和 artifact 统一成可 replay trace,至少提供结果、过程、副作用、证据四层评分,并报告成本、延迟、人工接管和失败类型。LLM judge 只能作为一层,不能替代 code oracle、环境 readback 和人工复核。
当 agent 能修改代码、发邮件、采购、写入企业系统或跨天运行时,问题变成“它代表谁、在什么范围内行动、如何撤销和追责”。Speculative Interaction Agents 的 commit gate、Apodex kernel 的权限/暂停/事件记录、OpenAI computer-use schema finding 和 Claude Computer Use 的隔离与人工确认都说明治理已进入运行时边界。
prompt injection、恶意 skill / connector、凭证盗用、数据外泄、越权和不可逆动作会同时影响 commerce、enterprise、GUI 和 multi-agent。2027 H1 可能出现 agent firewall、工具供应链扫描、权限策略、行动收据和第三方审计产品。
在 Agent Kernel 中把 principal、scope、TTL、预算、approval、commit、rollback、provenance 和 receipt 作为一等状态;按 read-only、write、external-send 和 financial/irreversible 分层。安全验收同时报告攻击成功率、误报率、任务损失、人工介入负担和回滚成功率,避免只测“拒绝了多少攻击”。
购物、旅行、报销、企业耗材采购和售后是 agent 从“会使用工具”走向“代表我行动”的最直观场景。OpenAI/Stripe 的 Agentic Commerce Protocol、Visa Intelligent Commerce、Mastercard Agent Pay 和 Shopify 的 AI shopping 都把商品发现、商户能力、支付凭证和授权推到公开议程。
平台可能把 agent mode、购物协议、支付 token、预算策略、退货和责任中心做成产品。短期更可能是低风险、可撤销、用户明确确认的流程,而不是完全自动付款。我们可以做模拟商店、旅行和企业采购 benchmark:agent 先产出候选比较表与价格/条款证据,只有满足预算和禁选项后才进入确认;把拒绝、升级人工、退款和网页 prompt injection 当作一等结果。
Agent 的最终输出越来越不是一段文本,而是代码仓库、研究报告、表格、演示、视频、网页、3D 场景或设计稿。用户在 artifact 上评论、分支、测试、局部修改和合并,agent 的记忆围绕 artifact graph、版本和证据组织。
PresentBench、SpreadsheetBench 2、Vision2Web、Parametric CAD Bench 和 WorkSpaceBench 都在从交付物而非聊天质量定义任务。Coding agent 的 branch、diff、test 和 PR 是最成熟的例子。我们应先把研究报告、代码仓库和实验结果定义为可回滚 artifact graph,重点测“人类接管后继续完成的时间”和“依赖/证据是否完整”,而不是首轮生成是否漂亮。
下一轮 agent 竞争可能不在静态文本,而在完整 episode:环境状态、工具结果、成功/失败、修复、人工接管、验证标签和许可证/隐私 provenance。Watch and Learn 提供视频到 GUI 轨迹,OpenCUA 提供人工高质量轨迹,EvoCUA 提供成功/失败筛选与再训练,Synthetic Computers at Scale 提供月级电脑仿真,CUADebug 则证明失败本身可以成为修复数据。
以 Agent Kernel trace 作为统一 episode 格式,保存任务状态、工具、GUI 观测、artifact、验证结果和人工接管点,分成 success、near-miss、failure、repair 四类池。所有 skill 或 policy 变化都要在 held-out 环境验证,防止经验飞轮退化为自我循环。
世界模型在 agent 领域短期不一定先表现为通用物理预测器,更可能表现为可交互、可回放、可生成并带 oracle 的网页、桌面、代码库、研究实验或整台工作电脑。GUI-GENESIS、CUA-Gym 和 Synthetic Computers at Scale 已展示环境、任务和 reward 一起扩展的路径。
2027 H1 可能出现 agent gym / work simulator 或 environment-generation-as-a-service。我们应先做任务级环境卡:状态、动作、可见性、oracle、版本和 sim-to-real 对照;明确“能生成”与“能迁移”是两件事,服务于研究、coding 和办公任务,再观察是否值得扩展到移动和机器人。
MCP 偏向 agent 与工具/数据连接,A2A 偏向 agent 发现、委托和协作;identity、wallet 和 capability registry 则回答“这个 agent 以谁的身份行动、带什么预算、能否撤销”。MCP、Google A2A、Linux Foundation Agentic AI Foundation 和各类 agent marketplace 讨论说明生态层正在形成。
短期不会出现无需信任的开放 agent 互联网,更可能先在同一企业、同一云或白名单 partner 内出现。我们应为 Agent Kernel 定义最小任务委托卡:能力、输入 artifact、预算、数据范围、截止时间、验收条件、返回 artifact、失败原因和责任主体;再用 MCP/A2A-like adapter 做暂停恢复、权限收回、幂等和审计测试。Marketplace 先作为内部 skill/agent registry,不急于开放交易。
Personal agent 的下一步不是单纯扩大偏好记忆,而是维护动态事件、承诺和任务。PROEVENT 将 Insert/Update/Delete、response timing 和多步事件成功纳入评测;Interaction Models、GPT-Live 和 Speculative Interaction Agents 则把后台工作、可取消行动和实时介入连接起来。会议、邮件、日历和团队协作产品已经有总结入口,下一步是跨会议追踪、主动准备、协调时间和请求授权。
我们应把 proactive action 做成“候选行动 + 触发理由 + 影响范围 + 过期时间”的可审阅队列,按个人、项目和团队分别授权;先在研究项目、实验和会议任务中测漏提醒成本、打扰成本、接管率和事件状态正确率,不直接将它放进高副作用个人事务。
Google DeepMind Gemini Robotics、NVIDIA GR00T、Figure Helix 和 Physical Intelligence pi0 等公开路线说明视觉语言模型、动作策略、机器人数据和仿真正在合流;ERQA、MADQA 等 benchmark 也开始测 embodied reasoning。它很可能在 2027 H1 产生新闻级发布,但通用产品概率低于软件 agent,受硬件碎片化、现实安全和 sim-to-real 限制。
我们的近期切入不应是重资产造机器人,而是研究 embodiment-agnostic 的任务层:视觉状态摘要、长程计划、技能调用、失败恢复、人工接管和安全停机;复用 GUI agent 的 trace、verifier 和 long-horizon 指标,在公开仿真环境中建立观察位。
长期陪伴、持续辅导和 agent 之间的谈判/竞价会随着 Life-long、Omni、Identity 和 Commerce 发展。PersonaPlex、Moshi、GPT-Live 说明关系连续性和实时人格交互有技术入口;教育产品可以复用长期课程和反馈闭环;agent economy 则需要协商、信誉、预算和反串谋机制。
这些方向有潜在大动作,但目前更可能以消费产品、受控试验、仿真 benchmark 或融资新闻出现,而非稳定的通用产品范式。我们只建立观察指标:记忆删除和纠错、未成年人/心理安全、学习迁移、协商效率、公平性和串谋率;不把“完全自治陪伴”或开放 agent 市场作为近期主线。
我不认为明年会出现 25 条彼此独立的赛道。更可能的组合是:
┌────────────── organization memory ──────────────┐
│ │
Long-horizon task state ─── Multi-agent organization ─── Self-evolving loop
│ │ │ │
│ │ │ │
Life-long memory ─────── Omni / realtime ───── Computer-use ─────┘
│ │ │
└────────────── Autonomous research ───┘
具体来说:
补搜材料已归并到 Life-long、Research/Self-evolving、Commerce/Vertical、Robotics/Embodied、UX/Companion/Education、Benchmark/Reliability 和 Open-source Protocol 等 domain 文件。新增的 Claude Code、Codex、A2A、MCP、UCP 和企业平台 release 共同指向一个更窄的近场竞争面:durable task runtime + protocol conformance + observable/permissioned autonomy。它们强化 Life-long、Multi-agent、Software Factory 和 Trust 的优先级,但不证明跨供应商生产互操作或真实采用率。
论文和 benchmark 侧新增的 PATH-Bench、Harness Continual Learning、OneDayAgent、MisKnow-Agent、ActBench、ForestBench、MAP-Graph 和 Demystifying Agent Skills 也把验收口径从“记住/调用/最终答对”推进到路径依赖、harness 遗忘、持续证据核验、行为安全、通信图、来源权限和 skill 选择精度。
因此主报告的下一步不应再扩张热点清单,而应把最小验证集中到:跨 3 次 pause/resume 的状态恢复、A2A/MCP/UCP 的版本锁定与 conformance、Agent CI 的注入/越权/副作用矩阵,以及 planner → worker → verifier → human merge 的贡献与返工记录。市场采用仍缺少独立预算、付费生产、ROI 和真实交易量数据,继续保留为观察项。
新增调研已归并到各 domain wave 文件,补充了 EU/FINRA/FDA/NMPA/CAC 的监管边界、Khanmigo 两年学校 RCT、JAMA 心理健康 RCT、ACL/CHI/IUI 2026 的 meeting/companion/education/导航证据,以及 Continual Harness、PLACEMEM、SPADE、FM-Bench、HarnessEval-W 等 2026 新研究。增量没有把主线扩成更多赛道,反而说明各 domain 的验收必须分开:regulated workflow 看日志/人工监督/风险文件,education 看 engagement/anti-leakage/far-transfer,robotics 看 remote takeover/sim-to-real/TCO,memory/evolving 看 retention/forgetting/security drift。企业 ROI、付费采用、真实交易、机器人维护和 companion 跨年安全仍没有独立公开数字。
我认为 2027 H1 最可能出现的“大动作”不是单个新模型类别,而是一个新的 agent 产品范式:
它记得长期工作历史,能让任务跨小时和跨天持续运行,通过语音、视觉和文本持续交互,会主动准备和执行任务,能够组织多个角色完成专业交付,在权限和证据边界内代表用户行动,并把每次失败转化为下一次更好的行为。
从这个角度看,Life-long、Multi-agent、Omni、Autonomous Research、Software Factory、Vertical Agent、Commerce、Trust 和 Evolving 不是彼此平行的 9 个选题,而是同一个“持续工作的智能体”在连续性、组织、交互、交付、经济行动、可信边界和学习上的展开。
我们的战略重点不应是追逐每一个新名词,而应判断:哪些方向正在从论文 demo 变成长期使用闭环,哪些方向已经有产品信号,哪些方向仍停留在漂亮但脆弱的 benchmark。当前最值得押注的组合是:
Life-long memory + durable task execution 作为核心资产,Software Factory / Autonomous Research / Vertical Workflow 作为高价值场景,Multi-agent Organization 作为工作组织方式,Reliability / Permission / Security 作为可信边界,Omni/Proactive 作为交互入口,Skills/MCP/A2A/Identity 作为生态层,Self-evolving + Experience Flywheel 作为持续增长机制,GUI/Computer-use/Artifact 作为真实行动和交付载体。
这些资料只能证明产品对外暴露的工作方式,不能证明其未公开的内部模型拓扑;本报告因此把它们用于判断产品范式,不把实现细节当作事实。
本文中的“高概率”表示公开信号已经跨越论文、产品或 benchmark 中的至少两类,不表示方向已经解决。当前仍需重点观察:
这些问题的答案,决定 2027 H1 的热点会停留在 demo,还是形成新的 agent 产品与研究平台。