人类设定战略,Claude 执行工作:Anthropic 的高效人机协作团队实战

人类设定战略,Claude 执行工作:从'单人游戏'到'多人游戏'的团队重构

Posted by iceyao on Wednesday, July 8, 2026

一、引言:工作方式正在从"单人游戏"变成"多人游戏"

原文链接:Lessons from building effective human-agent teams

来源:Claude Blog / Anthropic · 作者:Kristen Swanson(Anthropic 教育团队)

发布时间:2026 年 6 月 24 日

过去一年,大多数人用 AI 的姿势其实是"单人游戏":一个人对着一个聊天窗口,或者一个人配一个 agent,把某个孤立任务跑完就结束了。上下文困在个人窗口里,别人看不到,agent 也带不走。

Anthropic 这篇文章想说的是:随着 Claude Tag 这类工具落地,玩法正在切换到"多人游戏"——人类和智能体在同一个工作空间里协作,共同服务于团队目标。这里最关键的一句分工是:

人类设定战略,Claude 执行工作。

从单人游戏到多人游戏

这张封面图的重点不在左右两个场景本身,而在中间那个箭头。右边不是"人更多 + agent 更多"的简单堆叠,而是共享名册、共享工作产物、共享目标——人和 agent 出现在同一份线程里,任何人都能接续别人的工作。这是本文所有做法的地基。

值得先说清楚一个态度:这篇文章几乎没有讲任何"新技术"。它讲的全是团队协作的老常识,只不过把这些常识放到"有 agent 参与"的语境里,重新校准了一遍权重。如果你正在公司里推动 AI 落地,它的价值不在于给你一个新框架,而在于帮你判断哪些基本功现在不能再省


二、什么是"多人智能体":它和普通 agent 差在哪

文章先给了一个定义:多人智能体(multiplayer agents)是能同时与多个不同人类协作的 AI。它和我们熟悉的"个人 agent"有三点本质差异。

多人智能体的三项关键能力

  • 持久记忆:它有自己的记忆和技能,记住团队目标并据此调整执行,而不是每开一个会话就失忆。
  • 独立凭证:它拥有不绑定于任何人的凭证,在安全、可预测的护栏内运作——换个人来协作,它不需要"重新认主"。
  • 持续广泛访问:它了解组织如何运作,并能直接执行任务;它"生活在工作真正发生的地方"(在 Anthropic 就是 Slack 等团队协作工具里),而不是一个孤立的聊天框。

反过来看普通 agent:依附于某一个人、借用主人的凭证、上下文随会话消失、只服务单人单任务。它最大的问题不是能力弱,而是换个人协作就得从头再来,团队上下文被反复撕裂

但文章紧接着给了一句冷静的提醒,值得抄下来贴在墙上:

技术基础只是前提,成功还需要特定的工作方式和共享规范

也就是说,“记忆 + 凭证 + 访问"这三件事只是把门打开。真正决定协作效果的,是接下来的四条洞察。


三、四条核心洞察

这四条洞察不是并列的清单,而是层层递进的关系:先给上下文,再给角色,再给目标,最后才谈把多大的自主权交出去。

四条洞察逐级抬高智能体的自主度

3.1 公开工作,给智能体足够的上下文

这一条贡献了全文最锋利的一句判断:

对智能体而言,如果没有被写下来且可访问,它就不存在。(If it’s not written down and accessible, it doesn’t exist.)

agent 完全从团队可搜索的文本里建立理解——Slack、代码、文档、会议记录。私信、走廊里的对话、权限受限的文档,对它而言等于不存在。这带来一个反直觉的结论:透明度不再只是文化偏好,而是 agent 能否工作的硬前提

Anthropic 的具体做法很值得借鉴,尤其是关于权限的那一条:

  • 在公司层面选定少数几个安全边界,为它们创建匹配的工作空间和文档分享设置——而不是逐个文档、逐个频道去决定权限。这既扩大了 agent 的访问范围,又消掉了"逐项分享"带来的决策疲劳
  • 新沟通频道默认对组织内部公开,确保决策真正落到频道、文档、会议记录里。
  • 写文档时先想一句:agent 能不能找到它?(在 Anthropic,agent 已经成为团队文档的主要消费者。)

回报是实打实的:agent 能读到会议里"这事先搁置"的决策,从而不再建议已经被否掉的任务;能借鉴别的团队跑通的模式;能以远超人类的速度扫完海量文本,捞出人类会漏掉的相关工作

当然,敏感交互仍然可以私密——给 @Claude 发私信,或用 Claude.ai / Claude Cowork 就行。透明是默认值,不是绝对值。

3.2 每个人和每个 agent 都有明确角色和称手工具

人机团队共享一份名册、一套工作产物、一个工作空间。不同 agent 承担不同角色:一个做数据分析,一个持有并执行设计标准,一个负责研究综合。项目启动时,人类和 agent 先把角色分清楚;复杂 agent 甚至会衍生出子 agent 去处理特定任务。

这里的反常识判断是:

没有清晰角色,人们最终会在旁边各自跑一堆个人 AI,重复劳动并撕裂团队上下文

指标追踪就是最典型的例子——与其十个人各问各的 AI 得到十个略有出入的数字,不如让一个多人智能体做一次,所有人看到同一组数字

落地动作:

  • 人和 agent 商定各自职责,达成一致的任务集。
  • 人和 agent 在同一共享线程里工作,任何人都能接续别人手里的活。
  • 给每个角色配称手工具(数据分析要 BigQuery,QA 要 Playwright MCP)。
  • 把 agent 的角色和范围写成描述——一个工程团队开始用"名册"来编码人和 agent 的角色,并用**技能文件(skill files)**定义 agent 角色,让专业化变得可复制:全公司能快速搭出同类型 agent。项目一复杂就加人,比如新增一个"发布经理 agent"专门管软件发布。

3.3 设定北极星,让智能体更主动

最有价值的 agent 会主动建议新项目和新工作流——但这种主动性不是凭空来的,它出现在那些"已经拿到丰富上下文 + 清晰角色,并被给了一颗北极星"的团队里。

北极星是宏大、影响面广的目标,帮团队判断"哪些任务才是对的任务”。这里有一条边界必须守住:

在 Anthropic,北极星永远由人类设定,并根植于业务使命与目标。

流程是:把北极星书面写清楚 → 分享给 agent → 人类明确指定哪些 agent 可以主动建议新工作流。注意最后一步——并不是每个 agent 都有足够的技能和信任去成功地"提建议",所以主动权要点名授予,而不是默认放开。

一个内部工具团队的案例很有画面感:他们的北极星是"让产品引导更有帮助",某个 agent 就主动建议修改引导流程里的错误提示文案,而这些改动在次周可量化地提升了引导成功率

配套动作里还有一条容易被忽视:在日历上保护高质量的人类时间,让会议聚焦在最重要的工作上。agent 接管了大量执行,人类省下的时间不该被杂事填满,而该投到"设定方向"上。

3.4 随时间建立信任

这是四条里最需要耐心的一条。文章给了一个亮眼的数据:

工程师已经成功派遣团队智能体独立处理 500 个 bug 修复——但绝非一开始就如此。

agent 就像新同事:需要多轮反馈循环,才能把"这个任务到底怎么做最好"的隐性知识外化出来。而且模型升级后要重新测试任务——提示词可能得重写,过去有用的护栏,反而可能约束住更聪明的新模型去尝试更有创造性的方案。

那么信任靠什么建立?核心是可验证 + 反思 + 上报这一套闭环。

信任建立的闭环与关键数据

文章反复强调验证机制的价值:

最好的长运行 agent,有多种方式在人类查看之前先验证自己的工作。代码有测试,技术文档可以套评分标准和风格指南。当人类设定标准、并确保所有工作都可核查时,质量才能长期保持而不偏离原意。

这就引出了"执行者—验证者"(Doer-Verifier)的 agent 架构:一个 agent 做任务,另一个 agent 检查它的工作。

一个接手"积压任务成堆的新团队"的工程负责人,把这套闭环走了一遍完整版:

  1. 拉几名人类 + 几个 agent 一起梳理和排序积压。
  2. 一组 agent 读完所有积压项、判断是否已有人在处理、给无人认领的项打复杂度分。
  3. 另一组 agent 筛出中低复杂度的项,直接创建代码变更。
  4. 初期人类审查每一个决策,标记需要人工介入的;随后教会 agent 主动把带硬性权衡的决策上报给人类,确保人类始终在环(human in the loop)
  5. 每周要求 agent 写一份含**“经验与失误”(lessons & missteps)**的周报,让它记录踩过的坑、避免重复犯错。

随着 agent 越来越独立,负责人还教它们把人类注意力当作稀缺资源:批量提问、一次性回答;重复关键上下文帮人快速跟上;限制每次呈现给人类的事项数量。有些团队甚至设一个专职 agent,唯一职责就是决定"如何批处理沟通、只把最重要的上报";也有人设护栏限制 agent 每天的工作量,好让人类能有意义地参与、保留关键技能、审查量可持续

信任是这样一格一格挣出来的:追踪每个 agent 在哪类任务上"赢得了自主权",重复成功之后,再按任务类型扩大它的范围。


四、五个值得对团队问一遍的问题

文章末尾给了一份自查清单,很适合直接拿去开会。如果这五个问题里有任何一个答不上来,那大概率就是你团队人机协作卡住的地方:

  1. agent 和人类所需的所有信息与访问权限,是否都公开且广泛可搜索
  2. 你能不能写下团队名册(含人类和 agent),并说清每个成员负责什么?
  3. 团队里每个人、每个 agent 是否都有称手工具
  4. 你是否有评分标准或测试来验证关键工作产物?
  5. 团队是否有一颗人人可参照的清晰北极星

五、结语:这些习惯并不新,agent 只是放大了它们的重要性

如果只带走一句话,就是全文的收尾金句:

这些模式没有一个是新的——至少对人类而言不是。清晰的北极星、明确的角色、扎实的文档、共享的质量标准、从错误中学习的空间——这些是我们几十年来就知道的健康团队习惯。智能体只是让"不跳过这些基本功"变得更加重要。

这些习惯并不新,agent 放大了它们的重要性

这也解释了一个看似反直觉、其实很朴素的观察:

从智能体身上获益最多的团队,正是那些最有意识地践行这些基本原则的团队。

很多人期待 agent 能"绕过"团队协作里那些麻烦的基本功——文档、角色、标准、复盘。这篇文章给出的答案恰恰相反:agent 不是这些基本功的替代品,而是它们的放大器。你把文档写扎实,agent 的产出就更准;你把上下文藏在私信里,agent 就直接"失明"。过去人类可以靠默契、走廊对话、脑内记忆来打补丁,现在这些补丁对 agent 全部失效。

所以,与其急着问"我该给团队接哪个 agent",不如先回到那五个问题:上下文公开了吗、角色写清了吗、工具配齐了吗、产物可验证吗、北极星立起来了吗。把这几件老掉牙的事做扎实,多人智能体才真正有地方发力——人类设定战略,Claude 执行工作,这句分工才立得住。

「真诚赞赏,手留余香」

爱折腾的工程师

真诚赞赏,手留余香

使用微信扫描二维码完成支付