CodexQA

Industry & PracticeTechniques & Tutorials

人机 Agent 团队课:从单人助手到多人协作

CodexQA 团队9 min read

Anthropic 公开课把 Agent 从单人聊天改成多人协作:四条原则、上线前五问、前两周清单,以及技能、子 Agent 和 MCP 三条开发课怎么接上。

In this piece

人机 Agent 团队课:从单人助手到多人协作

Anthropic 把和 Claude 一起干活,从「一个人加一个聊天窗口」改写成「人和 Agent 在同一工作区里共事」。公开课不在第三方训练营里,入口是 Claude Academy。和 Agent 直接相关的,分成两条线:一条教团队怎么协作,一条教开发者怎么把 Agent 做出来。下面按公开课大纲和可直接阅读的课文整理,不代替登录后的测验和动画练习。

先分清两条线

协作线的合集是 Building effective human-agent teams。核心课 Building effective human-agent teams(beta) 共 5 课、1 个测验,约 45 分钟,面向已经在单人使用 AI、准备带团队跨到多人协作的负责人,不要求工程背景。课是按 2026-06-24 的文章 Building effective human-agent teams 做的,作者是 Anthropic 教育团队的 Kristen Swanson。

开发线的合集是 Build with Claude。和 Agent 直接相关的课与材料:

课或材料规模学完能做什么
Introduction to agent skills6 课,约 1 小时写 SKILL.md,控制触发和工具,和 CLAUDE.md、子 Agent、hooks、MCP 分工,再分发给团队
Introduction to subagents4 课,约 45 分钟用独立上下文做子任务,规定输出格式、障碍报告和工具范围
Introduction to Model Context Protocol10 课、1 个测验,约 1 小时用 Python SDK 做 MCP 的 tools、resources、prompts
Model Context Protocol: Advanced topics11 课、1 个测验,约 1.5 小时MCP 的进阶用法
Claude Code 10112 课、1 个测验,约 1.5 小时终端里的 Agent 工作流,其中一课专门讲子 Agent
Claude Code in action9 课、1 个测验,约 1 小时长时间无人值守会话:转向、配置、自动化、核验
What is Claude Managed Agents?约 4 分钟用 API 定义工具、环境和成功标准,做出可上线的 Agent
Building effective agents工程长文Agent 为什么是多轮的:调工具、改状态、按中间结果调整
Effective context engineering for AI agents工程长文给 Agent 持续、够用、不过载的上下文

评测不在这套协作课里。方法论文是 Demystifying evals for AI agents,站点上已有中文整理,这里不重复。

多人 Agent 和聊天机器人差在哪

文章把多人 Agent(multiplayer agents)定义成同时和多名人类一起工作的模型。它仍然有记忆(memory)和技能(skills),但还有两件聊天机器人通常没有的东西:不绑在某个人身上的凭证(credentials),以及待在工作发生的地方,Anthropic 内部是 Slack 这类协作工具。Claude Tag 是文中点名的产品入口。

要在团队频道里干活,技术底子是三件:持久记忆,用来记住目标并按目标执行;与人解绑的凭证,用来待在可预期的护栏里;持续、宽口径的信息权限,用来理解组织并替团队做事。文章同时说,只有技术底子不够,团队还得有共同的干活方式。

四条原则

课的学习目标收成四条:角色清楚、北极星写下来、逐步放权、信息权限给对。第 3 课用一个虚构的健康追踪应用团队 Lantern 演示。负责人 Ravi 先写下一句可度量的目标:下周一发布,且首周 80% 的新用户走完引导。再让 Agent 根据近几周对话提议岗位,人来决定每个岗位归谁。Agent 起草上线材料,人做判断和定稿,Agent 再发出最终版本。因为 Agent 知道目标,引导完成率在发布第二天下降时,它会自己做出流失分析,拿到站会上讨论。

第 3 课的练习把发布周的四类活分开派人:晨间提及摘要、内测反馈主题、给内测用户的回复、周五做不做的决定。每一类可以是人手工做、Agent 起草而人决定,或 Agent 单独负责。课要说明的是:合适的负责人取决于这件活本身;共享目标会让 Agent 主动补活,但需要判断的决定仍留在人手里。

1. 公开干活,给足上下文

Agent 的理解全部来自团队让它搜得到的文字:Slack、代码、文档、会议记录。私聊、走廊对话和权限收得很死的文档,对它等于不存在。课和文章用的原句是:没写下来、又访问不到,就不存在。

Anthropic 的做法不是逐份文档决定 Agent 能不能看,而是先划少量、清晰的安全边界,边界内部对人机都开放。这样减少「这个频道该不该公开、这份文档能不能给这个 Agent」的日常判断。好处也被写明:读过会议决定的 Agent 不会再提已经被降级的项目;能读到别的团队规格的 Agent,会推荐已经在别处做成的模式;它读文字比人快,会把人会漏掉的相关工作翻出来。

敏感对话仍然可以私密进行:给 Claude Tag 发私信,或使用 Claude.ai 和个人连接器。那种对话不应默认进团队上下文。

2. 人和 Agent 都有角色,以及干这活所需的工具

一个名册、一套产物、一个工作区。不同 Agent 可以有不同角色:一个做数据分析,一个守设计标准,一个做研究综合。项目开始时,人先和 Agent 商量角色怎么分。角色清楚之后,一个 Agent 还可以拉起另一个具备对应记忆和权限的 Agent。数据分析可能要 BigQuery,做 QA 可能要 Playwright MCP。没有角色时,人会在旁边各开各的个人 AI,工作重复,上下文裂开。指标跟踪是文中的反例:一个多人 Agent 算一次,所有人看同一组数字。

工程团队把角色写进技能文件(skill files),同类 Agent 就能被别人快速再起一个。项目变复杂时再加角色,例如专门的发布经理 Agent。人仍然待在同一条线程里,但只占必须由人做判断的位置。

3. 人来写北极星,Agent 才好主动

北极星(north star)是一句有雄心、可度量、能帮团队判断哪条工作流值得做的目标。人讨论、写下来,并根在公司使命和业务目标上,再明确哪些 Agent 可以主动建议新工作流。不是每个 Agent 都有这个权限。文中例子:内部工具团队的北极星是「让产品引导更有帮助」,一个 Agent 主动改了引导报错文案,下一周引导成功率有可测量的提升。人的高密度时间应留在日历上,会议只讨论最重要的决定。

4. 按已证明的可靠程度逐步放权

文中提到有工程团队后来让 Agent 独立处理约 500 个缺陷修复,但不是一开始就这样。新同事需要多轮反馈才能把隐性做法说清楚,Agent 也一样。人要试不同任务,弄清它能做什么、目标该怎么描述、需要哪些技能文件、什么样的提示有效。模型一换,还要重测:旧提示和旧护栏可能挡住更强模型的合理做法。

长时间运行的 Agent,最好在人看之前就有多种核验。代码靠测试;技术文档可以靠量表和风格指南。人定标准,并保证交给 Agent 的活都能被检验。常见结构是执行者-核验者(Doer-Verifier):一个 Agent 做,另一个 Agent 查。积压清理的例子是:一组 Agent 通读条目、看有没有人在做、给无主条目打复杂度;另一组只拿中低复杂度的条目改代码。起初人复查每条决定,再教 Agent 把真正困难的权衡直接交给人。每周让 Agent 汇总「教训和失误」,避免重复。Agent 更独立之后,还要教它把人的注意力当稀缺资源:问题攒成一批问,重复关键上下文,限制每个人一次要看的事项数量。也可以单设一个 Agent,只负责决定哪些话值得升级给人;或限制 Agent 每天的产出量,让人的复核可持续,也让人自己的技能不至于停用。

上多人协作之前的五问

第 4 课把准备度收成五句,没有总分,回答也不会被课程保存。

  1. 人和 Agent 需要的信息是开放、可搜索的,而不是躺在私有文档和私信里。
  2. 谁拥有什么可以写下来,包括 Agent。
  3. 每个队友,无论是人还是 Agent,都有干这活所需的工具和权限。没有权限的 Agent 会把活做薄、猜测,或做错。
  4. Agent 的关键产出,可以在人看到之前用量表、测试或第二个 Agent 检查。
  5. 有一句写下来的北极星,团队里谁都能指到。

课给的用法是:先标出团队最不同意的那一问,再把习惯上私有、其实可以有意公开的东西点出来。配套提示是从打分最低的项开始,每项先问两个关于现状的短问题,然后给出两周计划:每项一个具体改动、谁负责、怎样算做成。

前两周怎么起

第 5 课的清单是:尽快开始,但从小处开始。

  1. 选一个协作空间、三到五个人、一个 Agent。先找信任高、手头有共同项目的小组。
  2. 配一个多人 Agent。课里点名的两条路是 Claude Tag,以及 Claude Managed Agents API。
  3. 默认把团队的工作方式公开、共享。会上或私信里做出的决定,当天另有人写回公共处。
  4. 写名册,Agent 也算在内。每件重复发生的活只有一个负责人。可以让 Agent 先根据它读到的内容提议,再由人决定。
  5. 把北极星写下来,放在 Agent 读得到的地方。人定目标,Agent 帮着往目标走。
  6. 先给一件看得见的活。全团队共享的晨间简报适合起步。头几天由人审阅并反馈。
  7. 给每件交给 Agent 的活一份「怎样算通过」的量表。课认为这是最快建立信任的办法。
  8. 按任务种类逐步加信任。同一类任务连续做好几次,再放宽这一类能做的范围。
  9. 同一件事解释第二次时,写成给 Agent 的指令。工程团队接着去上技能课。
  10. 每周复盘。人和 Agent 都说哪里有效、哪里要改,并让 Agent 把这些记下来,供以后的 Agent 使用。

开发课怎么接上这四条

协作课把「教 Agent 你们的做法」指到技能课。公开大纲里,技能(skills)是 Claude Code 在请求匹配时自动读到的 Markdown 指令,用来停止每次提示都粘贴同一段要求。6 课的路径是:说明技能是什么、放在哪、如何匹配请求;写出带合法前置信息的 SKILL.md 并确认加载;写能稳定触发的描述,并用 allowed-tools 预批准工具,而不是把 Claude 限制成只能用这些工具;用渐进披露、参考文件和可执行脚本组织大技能,脚本应被运行而不是被读进上下文;再在技能、CLAUDE.md、子 Agent、hooks、MCP 之间选型;最后通过仓库、插件、企业托管设置和自定义子 Agent 分发,并用技能校验器和 claude --debug 查触发、加载、优先级冲突和运行时问题。

公开课文里的分工可以记成五行:

  • CLAUDE.md 每次对话都加载,适合始终生效的项目标准。
  • 技能按请求加载,适合只在某类任务才需要的做法。技能把知识加进当前对话。
  • 子 Agent 在单独上下文里干活,做完只把摘要带回主会话,适合会把主上下文撑满的委派。内置的 Explorer、Plan、Verify 不能使用技能;自定义子 Agent 只有在你明确列出技能时才会在启动时加载它们,不是主会话那种按需加载。
  • hooks 由事件触发,例如保存文件或调用工具。技能由你正在请求的事情触发。
  • MCP 服务器提供外部工具和集成,和技能不是一类东西。

子 Agent 课的四项目标是:解释独立上下文、输入如何进去、摘要如何回来;用 /agents 做代码评审、文档生成这类自定义子 Agent;用结构化输出、障碍报告和有限工具把子 Agent 做稳;知道什么时候该用,以及常见反模式。Claude Code 101 里的子 Agent 课补充了一个操作:运行 /agents,选创建,再定范围、目的、可用工具。

建议的学习顺序

还在单人使用、先要带团队的人:先上 45 分钟的人机团队课,做完五问和两周清单,再看 Claude Tag 的 10 分钟实践教程 Best practices for using Claude Tag。需要理解模型边界时,补 AI capabilities and limitations。

要自己做 Agent 的工程团队:Claude Code 101 或 Claude Code in action 打底,接着技能课和子 Agent 课,再用 MCP 入门把外部系统接上。要上生产环境时看 Managed Agents 的 4 分钟教程和快速开始,并用 Building effective agents 决定是简单工作流还是真正的多轮 Agent。上下文怎么喂,读上下文工程那篇,不要把「给足信息」理解成把所有文档塞进一次提示。

Frontier Deployed Engineer 的驻留不是这套公开课,不能自学报名。它是组织提名的 4 天集训加 12 周真实项目,和这里的 Academy 课程不是同一个入口。

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction