Nick Saraev 的 AI Agent 无代码大师班:三大平台、核心循环与提示词架构
posts posts 2026-04-29T15:01:00+08:00Nick Saraev《AI Agents Full Course 2026》(YouTube EsTrWCV0Ph4,494K 观看)据字幕重建:这是一门明确的无代码课——不写 Python,而是教你用 Codex / Claude Code / Antigravity 三大 agent 平台。核心是 Observe→Think→Act 的智能体循环与'完成的定义'、会自改的 agents.md、多智能体 MCP 编排与子智能体互审。开场用 5 个各带 Chrome 浏览器的 agent 跑真实获客 demo。视频精读AI Agent, Claude Code, Codex, Antigravity, MCP, Agent Skills, 无代码Nick Saraev 教了 2000 多人怎么用 AI agent 干活,自己用 agent 跑着一门年入 400 万美元的生意。他的《AI Agents Full Course 2026》在 YouTube 上有 494K 观看,时长约 2 小时 13 分——但这不是你想象的那种课。
开场他就划了三条边界:你不需要编程经验,他自己也没有 CS 学位;三个 agent 平台(Codex、Claude Code、Antigravity)随便从哪个入手,终点一样;而且他自称"到目前为止我没在 YouTube 上看到有人讲我这门课里的大部分东西"。
他的核心判断是:当前的 AI agent,单看智力未必比人强,一次做对的能力也比人差。它们真正的强项是并行。 同一个任务,你可以同时开很多个 agent 实例,各试各的路子,靠速度和数量堆出更好的结果。所以这门课不谈怎么把单个 agent 调聪明,谈的是用什么提示词结构,把多个 agent 编排成一支队伍。
YouTube 原片 | 频道 @nicksaraev
一、开场 demo:5 个各带浏览器的 agent 同时干活
课程一上来就是一个"几个月前还会被当成天方夜谭"的 demo。
场景是获客。他手上有一批会议来的 leads——有网站、LinkedIn、名字,唯独缺邮箱。搁一年前这批线索基本作废。现在,他让 Claude Code 同时开出一堆 Chrome 浏览器,每个浏览器里一个子 agent,各自去一个网站,动态找到联系表单、填名字和邮箱、再写一段随对象微调的外联话术。这些 agent 之间还通过一个共享聊天室互通消息、分工。原本一个 agent 要干好几小时的活,一群 agent 并行——几分钟铺完。
这个 demo 就是全片的目标态:把工作拆散到多个浏览器实例,每个子 agent 一块独立工作区。后面讲的所有技巧,都是为了搭出这种编排。
Nick 也顺手画了条红线:这种并行填表的自动化,本质是在绕过目标站点的反爬与反欺诈校验,可能被滥用于骚扰或欺诈。他明确只当演示看,不进课程教学范围。
二、核心:每个 agent 都在跑的三步循环
先别管平台,所有 agent 骨子里都在跑同一个循环,由三步组成:
- 观察(Observe):读进所有上下文——文件、之前的工具调用、系统提示、你给的 agents.md / claude.md / gemini.md、上一步的联网 research,乃至多模态数据。
- 思考(Think / Reason):基于全部上下文和你的高层目标,想下一步做什么、怎么规划。现在主流平台都有一个可点开的推理步骤——这点被很多人低估,因为它带来可解释性、可问责性和可操控性(你能中途看它在想什么、叫停、或者塞新资源进去)。
- 行动(Act):调用工具、编辑文件、或者跑一条命令行。
行动拿到结果后,把结果喂回观察步,循环再来一遍——每转一圈,上下文就更大一点。转个三四圈,模型会撞到一个大多数人漏掉、所以老是失望的东西——完成的定义(definition of done):一组约束和技术规格,告诉模型"到此可以不用再循环了"。一旦满足,它就切到"任务完成"路线,吐一段格式化的最终回答。
这三步每一步都能单独优化——观察、思考、行动各有各的改法,全片接下来就逐个展开。
三、agent 不等于那个大模型
第二个判断:agent ≠ LLM。大模型只是里面的推理引擎,负责理解语言、做决策。但它就像两万年前一个手里攥着长矛的人——没有房子、火堆、社会分工、车这些"周边基础设施",光有智能,能干的事很有限。
给 agent 装上"基础设施",它才成其为 agent:
- 工具:像人一样能读文件、跑代码、搜网页、调 API、改文件。
- 推理循环:就是上一节那个 observe → think → act。
- 记忆:agents.md / claude.md / gemini.md、对话历史、自动记忆文件、以及 skills。
所以"chatbot vs agent"的区别很干脆:chatbot 大致就是那个 LLM;agent 是 LLM 再加上工具、推理循环和记忆。Nick 现场用 Codex 演示了一遍——让它研究"男性肌酸补充",并给了个明确的完成定义:“凑够 10+ 篇实证来源就返回一份结构化报告”。模型于是观察 →(“用户要研究,我有联网工具”)思考 → 行动(搜索、汇编)→ 再观察,循环两三圈,58 秒后交出结构化证据报告。
四、三大平台:各自最擅长什么
课程真正动手的部分,是带你注册并跑通三大 agent 平台,各自搭一个"给 Nick 做个人主页"的小 demo。Nick 反复强调一句克制的话:这三家的智能差距其实很小(2%–5%),都在整个互联网上训练,能力差异更多是谁训练得更晚,而且每代都会重置——你完全可以只挑一个用。 但如果要区分,各有脾气:
| 平台(模型) | 归属 | 最擅长 | 短板 |
|---|---|---|---|
| Codex(GPT-5.4 系) | OpenAI | 后端编程、数学、测试驱动开发(给完成定义就自主跑到底);生态和文档最全 | 可解释性一般 |
| Claude Code | Anthropic | 推理最可解释、最适合编排与 agentic 工作流(能实时看/叫停/操控)、质量稳定 | 慢(除非 fast 模式,很烧额度);前端/设计偏弱 |
| Antigravity(Gemini 3.1 Pro) | 前端/设计最强、多模态最强(能理解视频)、出字快 | 最不可解释、质量不稳定(有些天直接拉胯) |
Nick 的用法:要干净前端找 Gemini,要可控编排找 Claude,要后端/数学/TDD 找 Codex。收费上他点了一句:Claude Code 要付费(约 $17–20/月),但他自己在 agent 平台上拿到过 100–200 倍回报,建议真想学就先付了、第一个月想办法把钱赚回来。
他也承认在自己的 design-taste 加持下,Gemini 出的站最"性感"、GPT 出的偏"笨重"。但他一再强调别把这些 2%–5% 的差异太当真——“它们就是在整个互联网上训练的星系级大脑,差异更多来自训练时间的新旧”。
五、agents.md:会自我进化的系统提示词
这是 Nick 眼里投产比最高的设计模式。每个平台都有一个会被自动拼到每次对话最前面的文件——Codex 叫 agents.md、Claude Code 叫 claude.md、Antigravity 叫 gemini.md(名字不同,机制一样)。
它真正的威力不在"静态模板一段提示词",而在把它做成会自改的元提示词:让 agent 在你纠正它、或它犯错时,自动把一条新规则追加到文件底部的"已学规则"区。Nick 给的格式大致是这样:
开始任何任务前先读完本文件;文件底部有一个会增长的"已学规则"区。
当用户纠正你、或你犯错时,立刻往"已学规则"区追加一条新规则,
按序号写成祈使句,格式:[类别] 永远/绝不 做 X,因为 Y。
── 已学规则 ──
1. 【前端】绝不默认深色模式,因为用户不喜欢。现场的例子:他让 Antigravity 建个主页,结果给了个漂亮但深色模式的站;他说"别再搞深色模式了",agent 没有只改这次,而是把"绝不做深色模式(用户偏好)“写进了 gemini.md。下次再建站,这条规则已经在提示词最顶上,它再也不会犯。规则越攒越多,agent 犯的不合你偏好的错就越来越少——第五次可能几乎归零。
层级也讲清了:最顶上是全局 agents/claude/gemini.md(对所有项目生效,Claude 存在 ~/.claude/),然后拼本地项目的 .md,再往下是 skills,最后才是你这次的行内提示词。好处是把一大堆上下文和功能压进很少的 token——账单按 token 算,上下文越长模型质量越容易掉。
六、Agent Skills:把工作流标准化成一段规程
Skill 是把大模型的"灵活/发散"收成"确定性直线"的办法——同一个任务每次都照同一套标准操作规程来做。三家都支持(Codex skills、Gemini skills、Claude Code skills),规格几乎一样:一个带 --- frontmatter 的文件,里头写 name、description,可选 tools / license / metadata。Nick 说他自己通常只写 name + description + 偶尔几个可用工具。
他拿 Anthropic 官方的 “algorithmic art” skill 现场演示:把整个 skill.md 喂进模型、存成 skill 再 run,模型就照着规程生成了一批粒子算法艺术,还能实时调粒子数、噪声、湍流。要点是——skill 让同一件事每次都做得一样,并把一大段上下文折进很少的 token。
七、进阶:用提示词架构编排多个 agent
课程后半程是 Nick 说"YouTube 上没人讲过"的那部分——都是用提示词编排多个 agent,不涉及写框架。每个技巧一句话讲清机制:
- 多智能体 MCP 编排:把 Codex、Gemini、Claude 都注册成 MCP 服务器,让最上面那个编排模型把大任务拆成子任务、按各家强项分派——前端给 Gemini、后端和测试给 Codex,最后回编排者整合。代价是多烧 token,换的是复杂项目上的质量。
- 视频转动作(video-to-action):给 agent 一个 YouTube 链接,用带视频理解能力的模型(比如 Gemini)先把画面逐帧读成"第 1 步做什么、第 2 步做什么"的结构化指令,再让 agent 照着用浏览器等工具执行。
- 随机化多智能体共识:同一句话用略有差异的提示词开出多个 agent 并行跑,再统计它们输出的分布——取众数、取中位,把"多数一致的"当可靠结论、“少数派的"当可留意的发散想法。理由很直白:单个 agent 只采样了答案空间的一小块,多开几个等于把搜索范围铺得更开。
- 智能体聊天室:给一群 agent 一个共享上下文(比如一个
chat.json),让它们各带一个人设——系统思考者、务实派、专挑边角案例的、用户代言人、唱反调的——轮流发言、互相质疑,最后再综合一轮。答案经得起一轮群架,盲区就少了。 - 子智能体互审回路:写东西的 agent 出初稿,另一个不带它思路的 agent 拿全新上下文来审——看正确性、边界、可简化处、安全问题,有毛病再交第三个去修,修完复查,没毛病才放行。Nick 用一段限流器代码演示了"实现 → 审 → 修 → 复核"的完整一圈。
- 提示词契约(prompt contract):把含糊需求拆成目标、约束、输出格式、失败条件四段写清楚再开工;配套的"反向提示”(reverse prompting)是反过来让模型先问你 5 个澄清问题,把没说的偏好挖出来,再生成契约。
- 上下文冰山(iceberg technique):别把整个代码库或整份大文档一次性塞进上下文。提示词里只放"水面之上"的全局/项目规则和当前任务,其余留给工具按需去读——要用哪个文件才 read 哪个。原因很实在:上下文越长,模型质量越容易掉,token 账单也越高。
- 模型路由(model routing):同一种活按难度分给不同档位的模型——简单的分类丢给便宜的小模型、调研给中档、最关键的架构与综合判断才用最贵的。Nick 拿获客链路举例:便宜模型去批量抓线索、中档补全资料、强模型写外联话术,最后可选再让更强的模型审一遍。
这些合起来就是开场那个"5 个浏览器 agent 并行获客"demo 背后的东西:单个 agent 没那么强,但把一群 agent 用提示词架构编排起来(分工、辩论、互审、共识),整体质量就上一个台阶。
八、这门课不是在教什么
这门课最容易被当成编程课来读,几个走样点如下:
- 这不是 Python / LangChain / CrewAI 编程课。 没有
ReActAgent、AgentMemory、RAGAgent、SupervisorAgent这些类。Nick 开场就说"不需要编程”,这是无代码课。 - 课程结构不是"ReAct→Tool Use→Memory→Multi-Agent→生产部署"。 真实主线是:无代码定位 + 开场 demo → observe/think/act 循环 → 三大平台对比 → self-modifying agents.md → skills → 提示词编排多 agent 的进阶技巧。
- “记忆"不是向量数据库那一套。 视频里的"记忆"就是 agents.md、对话历史、自动记忆文件和 skills。
- Multi-Agent 不是 Supervisor/Crew 代码模式。 视频讲的是 MCP 编排、智能体聊天室、子智能体互审、随机化共识——全是提示词层面的编排。
九、给不同读者的建议
想用 agent 干活的非程序员:别被"agent"吓到。先挑一个平台(差距很小),把那个 observe → think → act 循环记住,然后重点练一件事:给任务写清楚完成的定义。很多人对 agent 失望,排查下来往往就是没写清"做到什么算完”。
做自动化/获客/运营的:直接看 self-modifying agents.md——这是投产比最高的一招,让 agent 越用越懂你的偏好。再往上,开场那个"多浏览器并行"是靠把任务拆散 + 子 agent 各自工作区 + 共享聊天室实现的。
程序员:这门课的价值不在代码(它没代码),在编排思路——MCP 把多个 agent 注册成服务、子 agent 互审、随机化共识。把这些当提示词架构的模式库看。
不适合谁:想要现成 Python / LangChain agent 框架代码的人——这门课不给代码,给的是"怎么用现成平台把 agent 编排起来"的方法。
谁该去看原片:想跟着一步步注册、跑通三大平台 demo 的人。视频前半段就是带着你逐个平台实操,这部分文字还原不了手把手的过程,适合直接刷原片。
资源与参考
- 视频原片:Nick Saraev《AI Agents Full Course 2026》(YouTube EsTrWCV0Ph4)
- 作者与社区:Nick Saraev 个人站(无代码 AI 自动化)/ Maker School
- 三大平台官方入口:OpenAI Codex、Anthropic Claude Code、Google Antigravity
- 进阶阅读(站内相关):AI Agent 概念讲清楚(Jeff Su) / 25 分钟从零到 Agent
本文信息来源:基于 YouTube 原片英文自动字幕逐段核对写成(yt-dlp 取字幕后清洗,约 1477 句)。自动字幕在个别专有名词和数字上可能有听写误差(如 GPT 版本号、Claude Code 价格按字幕如实转录)。
参与讨论
使用 GitHub 登录。欢迎补充事实、异议与实践。
讨论暂时无法加载。