从 Prompt 到图:Graph Engineering 如何重写 AI 编程的规则
posts posts 2026-08-01T22:40:00+08:00Anthropic Claude Code 负责人 Boris Cherny 说:别再写代码了,去构建一个能自我编写的图。本文从 Agent 到 Loop 到 Graph 的演进路径,拆解 Graph Engineering 如何改写 AI 编程的方式。视频精读Graph Engineering, AI Agent, Claude, Anthropic, MCP, 智能体, AI编程, Boris Cherny那句话
「你不再应该写代码了。你应该构建一个能自我编写的图。」
(“You’re not supposed to write code anymore. You’re supposed to build a graph that writes itself.")
说这话的是 Boris Cherny,Anthropic Claude Code 团队负责人。在一段约 28 分钟的视频里——后来被 @Mahaximus_ 转发到 X 并发酵——他把过去两年 AI 编程圈里一层窗户纸捅破了:大多数人用 AI 写代码的方式,本质上是在给模型写 Prompt(提示词)——像给一位天赋异禀的实习生反复口述需求,但每次对话开始时他都得从零理解上下文。
阅读目标:读完本文,你应该能回答三个问题——Agent、Agentic Loop、Graph 三级台阶各解决什么问题;一张能学习的图由哪四个组件构成;自己的第一个图该从哪个任务下笔。
Anthropic 内部在做另一件事。他们不写提示词,而是搭图(Graph):一个由多个智能体(Agent)节点组成的系统,有记忆,能从错误中学习,每一次运行都比上一次更聪明。传统智能体执行一次任务就结束;智能图是一个不断进化的系统。
Claude Code 本身就是用这种方式构建出来的。
从 Agent 到 Loop 再到 Graph
要理解图工程,得先回到它之前的两个台阶。
第一级:单次 Agent。 2023 年 AutoGPT 大火时,多数人对「自主智能体」的想象就是这一个循环:接收指令、调用模型、执行动作、返回结果、结束。这是大多数开发者停留的地方:能跑,但不积累。今天帮你修好的那个 bug,明天它会换一种方式再犯一遍。
第二级:Agentic Loop(智能体循环)。 给 Agent 装上循环,让它在「规划 → 行动 → 观察 → 修正」里多转几圈,直到任务收敛。这是从「执行命令」到「解决问题」的升级。Anthropic 官方博客《Building Effective AI Agents》对 Agent 的定义就落在这里:一个由 LLM(大语言模型)驱动的循环,模型动态地指导自己的流程和工具使用,每一步都从环境中拿到「地面真相」(ground truth)——工具调用的返回、代码执行的结果——再决定下一步。与之相对,工作流(Workflow)是通过预定义代码路径编排模型和工具的系统,控制权在程序里,不在模型手里。
单个循环的一次运行,大致长这样:
任务: 给仓库补单元测试,覆盖率到 80%
├─ 规划 → 拆出待测模块清单
├─ 行动 → 生成测试、运行、拿到失败用例 ← 地面真相
├─ 观察 → 失败集中在边界条件断言(记忆: 无,下次从零再来)
└─ 修正 → 重写断言,再跑一轮,直到收敛或放弃第三级:Graph。 这是 Boris Cherny 那句话的指向。当一个循环学会了保留记忆,当多个循环以明确的结构互相连接、互相校验、互相委派,系统就有了拓扑。图工程要做的,就是把这些智能体连接成一个能自己运行、验证、改进的整体。
三级台阶对应三个层次:写命令、造机器、设计一个能自己造出机器的系统。绝大多数人还在第一层和第二层之间打磨提示词技巧,第三层是真正的分水岭。
一张会学习的图,里面装了什么
一个能学习的图,由四个组件构成。
记忆(Memory)。 没有记忆的智能体永远停留在第一天。图的记忆是结构化的:哪些方案试过、哪些失败了、失败的原因是什么,都被写进节点可以读取的状态里。这让「从错误中学习」从口号变成工程事实——系统的下一次决策,建立在上一次的失败分析之上。
验证循环(Verification Loop)。 单个 Agent 最危险的地方是「自信地跑偏」。图结构允许你把生成和检查拆给不同的节点:一个节点写代码,另一个节点审查代码,两者的判断互相独立。错误在被放大之前就被另一双眼睛截住。任何一个节点给出坏结果,都有下游节点兜底。
自我改进(Self-Improvement)。 传统 Agent 的性能曲线是平的,跑一万次和跑一次没区别;智能图的曲线是向上的,每次运行都在变得更聪明。改进可以发生在提示词层、工具选择层,甚至是图结构本身——哪些节点该并联、哪条路径该加一道检查,都可以成为系统自己调整的对象。
编排(Orchestration)。 节点之间谁给谁派活、结果如何汇合、什么时候停下来问人——这些连线的规则,就是图工程里真正的「代码」。
这四样东西拼在一起,回答了一个所有写过 Agent 的人都遇到过的问题:为什么 Demo 惊艳,上了生产就拉胯?因为你交付的是一个聪明瞬间,而生产环境需要的是一个可靠的连续体。
五种积木:Anthropic 官方工作流模式
图听起来抽象,但它的零件一点也不神秘。Anthropic 官方博客归纳的五种工作流模式,就是搭建图时的基础语法(以下为官方资料,非视频内容):
提示链(Prompt Chaining):把任务拆成顺序步骤,每个 LLM 处理上一步的输出,中间放程序化检查点。适合边界清晰的流水线——比如先生成、再翻译、最后润色。
路由(Routing):先对输入分类,再导向各自的专门处理流程。不同类型的请求走不同的分支,每条分支可以用更聚焦的提示词——官方给的例子是客服工单:简单的交给便宜快速的模型,疑难的交由更强的模型。图的路由节点就是这种模式的实现。
并行化(Parallelization):多个 LLM 同时开工,程序化地聚合结果。两种变体——分片(Sectioning,把任务切块并行处理)和投票(Voting,同一任务多跑几遍取共识)。投票机制是「验证循环」最朴素的实现——图中每个检查节点本质上就是一组投票器。
编排器—工作者(Orchestrator-Workers):一个中央 LLM 动态分解任务、把子任务委派给工作者 LLM、最后综合结果。子任务不是预先写死的,而是根据具体输入现场决定。官方特别指出,这类模式适合编码场景——一次涉及多个文件的复杂改动,谁也没法提前穷举所有改动路径。图的编排节点正是这种模式的直接映射。
评估器—优化器(Evaluator-Optimizer):一个 LLM 生成响应,另一个 LLM 负责评估和反馈,两者在循环中反复迭代,直到结果达标。这是图中「自我改进」组件的原子实现。
把这五种模式看成乐高零件,图工程突然变得具体了:一张生产级的智能体图,无非是用路由决定入口、用编排器—工作者做任务分解、用并行化加速、用评估器—优化器收口,再用提示链把它们串成有向拓扑。
官方还反复强调一条原则:从最简方案开始,只在复杂度真正带来回报时才增加复杂度。一张为了复杂而复杂的图,比一个朴素的 Agent 更难调试,也更难信任。
MCP:图的神经系统
节点有了,结构有了,还缺一层:这些智能体怎么摸到真实世界?
这就是模型上下文协议(Model Context Protocol,MCP)要补上的。在被一并传播的课程大纲里,「如何构建 MCP」被放在「Graph Engineering」之前整整一节课——先有通信层,再谈组网。
没有标准化接口的图是一团浆糊:每个节点都用自己发明的方式调数据库、读文件、发请求,换一个工具就要重写一片节点。MCP 把「模型与外部世界对话」这件事抽象成统一协议,让图里的任意节点以一致的方式接入代码仓库、终端、浏览器或内部系统。效果类似于当年 USB 之于外设——图的节点从此可以热插拔。
MCP 还改变了图的可演化性。当接口是标准的,往图里加一个新能力的成本,从「改造半个系统」降到「挂载一个新节点」。一张能低成本扩张的图,才谈得上持续进化。
同一个任务,两个物种
把差异拉到具体场景里,对比会更清楚。
假设需求是:「给这个仓库补上遗漏的单元测试,把覆盖率提到 80%。」
传统 Agent 的做法:它扫一遍代码库,生成一批测试,跑一次,把结果交给你。三个测试挂了,它不知道,或者知道了但下一轮对话开始时已经忘干净。下次提类似需求,它从第一张草稿重新来过。
智能图的做法:路由节点判断任务类型,编排器把仓库拆成若干模块分派给工作者节点并行生成测试,执行节点跑测试并回收失败信息,评估节点对照覆盖率目标和失败日志给出反馈,优化节点据此让不合格的部分回炉。整个过程里,「哪个模块的哪种断言最容易写错」被记进了共享记忆。下周你提一个相似需求,系统的起点是上次结束的位置。
前者交付结果,后者积累能力。这是工具和团队的区别——会开复盘会的那种。
你的第一张图,从哪里下笔
综合视频的思路和官方的三条原则(保持简单、让规划步骤透明、设计好智能体与计算机之间的接口),上手路径大致如下:
先从一个循环开始,别从一张图开始。 挑一个你每周都要重复的真实任务,用单个带循环的 Agent 把它跑通。这一步的目标不是自动化,而是搞清楚这个任务的「地面真相」长什么样——哪些信号能告诉系统「做对了」。
给循环加记忆。 让每次运行留下结构化的记录:输入、决策、结果、失败原因。哪怕最初只是一个追加写入的日志文件,系统的性质已经变了——它开始有历史。
把验证拆出去。 当循环稳定后,引入第二个角色专司检查。生成与判断分离,是图结构的胚胎。从这里开始,你拥有的已经是两个节点和一条边。
用标准协议接工具。 通过 MCP 接入文件系统、终端或代码托管平台,避免为每个工具写一次性胶水代码。
最后才是扩展拓扑。 路由、并行、编排委派——在真实痛点的驱动下逐一引入,每一步都问一句:这个新增复杂度换来的回报是什么?
这条路线的核心和视频传达的信息一致:图工程是长在真实任务上的手艺,模板抄不走。
常见误区与排查
照着上面的路线动手时,有几个反复出现的坑:
- 第一张图就画五六个节点。 排查方法:把图拆到只剩两个节点(生成 + 检查)跑一遍,跑通了再加节点。官方「从最简方案开始」的原则在这里就是调试工具。
- 循环转了十几轮仍不收敛。 通常是「地面真相」信号太弱——系统拿不到能判断对错的反馈。排查方法:先问「这个任务里,什么信号能证明做对了」,答不出来就先补测试、编译或规则校验,再谈自动化。
- 记忆记了但没人用。 只写不读的记忆等于没有。排查方法:检查每个决策节点能否读到历史记录;读不到,就把记忆接入决策路径,或者干脆删掉。
- 把编排写死在提示词里。 谁给谁派活、何时停下问人,这类规则属于代码层,写进提示词会随模型发挥漂移。排查方法:把编排规则移到程序逻辑里,提示词只保留任务描述。
读完自测
不看正文回答下面四个问题,检验心智模型是否立住了:
- 工作流和智能体的分界线是什么?控制权在哪一侧?
- 五种官方工作流模式里,哪一种最适合「涉及多文件、无法预先穷举改动路径」的编码任务?
- 验证循环和投票(Voting)机制是什么关系?
- 你的第一张图为什么应该从单个带循环的 Agent 开始,而不是直接搭多节点?
答案都能在文中找到:「从 Agent 到 Loop 再到 Graph」与「五种积木」两节对应前两题,「一张会学习的图」一节对应第三题,「你的第一张图,从哪里下笔」的第一步对应第四题。
尾声:从「写代码」到「写写代码的东西」
Boris Cherny 那句话点破的,是程序员这个职业的创作对象正在上移。
过去几十年,我们的作品是代码——确定性的、逐行的、可评审的指令集。图工程要求我们把创作对象上移一层:你构建的是一套会生成代码、检验代码、修正自身生成策略的系统。你的产出物从「答案」变成了「产生答案的机制」。
编译器把程序员从机器码里解放出来,没人再说「真正的程序员都手写汇编」;高级框架把我们从内存管理里解放出来,也没人怀念手动 malloc 的年代。抽象层每上移一次,都会带来同一类焦虑——「那我们还能干什么」——和同一个答案:去设计上一层的东西。
图的节点会写更多代码,但图的形状、记忆的结构、验证的严格程度、何时该停下来问人——这些决策在很长一段时间里,仍然需要一个理解全局的人来做出。提示词工程师的时代确实在落幕,接棒的是一个对系统设计能力要求更高的时代。
别再打磨那句 Prompt 了。去画你的第一张图。
谁该看原视频
这篇文章把视频的要点重新组织过,但有一样东西文字带不走:现场感。Boris 讲话的节奏、展开每个概念时的停顿,以及推文发酵后讨论的语境,看原视频和读摘要是两种体验。
值得看原视频的读者:
- 想听 Boris 原话、而不只是二手转述的人;
- 正在评估「要不要把工作流升级成图结构」、需要判断依据的工程师;
- 对 Anthropic 内部如何理解 Agent 演进路径感兴趣的观察者。
读这篇文章就够的读者:
- 只想快速建立「Agent → Loop → Graph」心智模型的人;
- 想弄清五种工作流模式和 MCP 各自在图里扮演什么角色的人;
- 想先判断这个方向值不值得自己花 28 分钟的人。
要不要点开原视频,最后只取决于一个问题:你缺的是结论,还是那个说话的人。
进阶方向
- 动手搭一张真图:用 Claude Code 的 subagent 加 hook(钩子)就能起步——一个 md 文件定义一个专职节点,hook 在节点收尾时强制跑测试,不需要额外框架。
- 读 LangGraph 文档:它把「状态图」作为核心抽象,是本文三级台阶里第三级的成熟实现,适合理解图的状态管理和分支控制。
- 重读《Building Effective AI Agents》的附录:官方给出了 coding agent 的高层流程图,可以和本文的五种积木对照,看生产系统如何把它们组合起来。
资料说明:本文中 Boris Cherny 的引言、Agent 与 Smart Graph 的对比框架、课程大纲来自 X 平台传播的原视频及推文内容;五种工作流模式、Agent 与 Workflow 的定义、三条设计原则引自 Anthropic 官方博客《Building Effective AI Agents》;场景对比与上手路径为基于上述资料的推演与延展,非视频原话。
时间点说明:手头资料只有转写要点,未含原视频时间戳,故关键论点按内容顺序展开,未标注具体 mm:ss 位置;想看对应段落的读者,直接回看原视频即可。
参考文献
- Anthropic 官方博客《Building Effective AI Agents》:https://www.anthropic.com/engineering/building-effective-agents (五种工作流模式、Agent 与 Workflow 定义、三条设计原则的出处)
- Model Context Protocol 官方文档:https://modelcontextprotocol.io (MCP 协议规范与接入方式)
- Boris Cherny 关于 Graph Engineering 的原视频及讨论:见 X 平台 @Mahaximus_ 转发线程
参与讨论
使用 GitHub 登录。欢迎补充事实、异议与实践。
讨论暂时无法加载。