How we built our multi-agent research system

mp.weixin.qq.com

副标题:Anthropic -- 范式转移,从模型智能到系统智能

Anthropic 发现,在他们的内部研究评估中,一个以 Claude Opus 4 为主智能体、Claude Sonnet 4 为子智能体的多智能体系统,其性能比单智能体的 Claude Opus 4 高出 90.2%。当智能达到一定阈值,多智能体系统就成为扩展性能的重要方式(Once intelligence reaches a threshold, multi-agent systems become a vital way to scale performance. )

就像人类社会意义,在过去相当漫长的时间里,人类的单体智能并未有显著式的增长,但人类社会在信息时代的整体能力却在指数级提升。一方面是因为计算机/更强大工具的出现,另一方面也是人类协作与群体智慧的结果。

这就是为什么,我和越来越多人关注多智能体系统,随着单个 LLM 的能力增长逐渐放缓,Multi-Agent 无疑会成为新的研究热点。本篇博客旨在回答三个问题:

本篇博客主要源自 Anthropic 在前段时间发布的《How we built our multi-agent research system》[1],我很早就有写这博客的想法,但总感觉流于翻译,反复阅读尝试基于此和个人的理解撰写一篇关于多智能体系统的博客。没有结合代码一起来,就当一个简单的入门 intro 吧~ 欢迎批评指正。

1. What is Multi Agent System?

一个多智能体系统是由多个能够自主行动的智能体(Agent)组成的计算系统。这些智能体在一个共享的环境中进行交互,彼此之间可以通信、协作、竞争或协商,从而解决单个智能体难以或无法解决的复杂问题。

对于绝大部分普通用户(包括最初的我)很容易偏颇的认为,所谓的 Multi Agent System 不过是 prompt engineering,给不同的 Agent 设置不同的角色扮演就变成了多智能体系统。实则不然,高级的 Prompt Engineering 是构建多智能体系统的必要条件。比如:

但是,一个真正健壮、高效的多智能体系统,还包含了远超 Prompt Engineering 的“系统工程”设计:比如系统架构设计,用编排者-工作者(orchestrator-worker)模式,还是评估器-优化器(Evaluator-optimizer)(一些 Agent 负责生成结果,另一些 Agent 负责评估和反馈),还是更复杂的层级结构?这需要根据任务类型进行权衡,是软件架构层面的思考。再比如工具设计与开发,单 Agent 主要由四个关键组件构成,Agent 使用的工具(API,MCP Tool)对性能有显著影响。例如,工具是否能被 Agent 正确理解,工具被正确调用率如何?除此之外还有状态管理(持久化 memory 与异常恢复),成本控制等等。

image.png

我们对多智能体系统的认知,有时会陷入与对“管理”相似的误区。

外行视角下的管理,似乎只是开会与分配任务,容易产生“其本质不过是上传下达”的简化认知。同样,对多智能体系统的初步理解,也可能停留在“将一个大 Prompt 拆分为几个小 Prompt”的表层操作上。

然而,无论是管理人类团队还是构建多智能体系统,核心挑战都是从“依赖个体超级能力”转向“设计一个能让平凡个体创造超级结果的系统”。