目录

AI 给 AI 做研究:Emergent Garden 用曼德博分形实测 RSI 的边界

目标读者:AI 研究者、智能体工程师、关注 AI 安全的从业者 这篇文章的判断:这不是一支"AI 要觉醒了"的视频,恰恰相反——作者跑了一个真实实验,用它给 RSI 的炒作泼冷水。他的结论是:递归自我改进可能、但难、且危险;弱 RSI 已经在跑,强 RSI 的"智能爆炸"更像渐近线而不是指数。 难度:⭐⭐⭐ | 来源:Emergent Garden《Recursive Self-Improvement》(YouTube,2026-06-13);B站 @黑纹白斑马 AI 配音转载

原视频(YouTube)B站转载 | 时长 29:29 | 频道 @EmergentGarden


视频信息卡

视频本身(一手来源)。 以下来自 YouTube 原片:

项目内容
标题Recursive Self-Improvement
频道Emergent Garden(YouTube)
时长29:29
发布2026-06-13
链接youtube.com/watch?v=t7_ZXgfJVG8

B站转载(二手来源,本文的中文入口)。 以下是引用的配音版本:

项目内容
UP 主黑纹白斑马(AI 翻译配音)
B站发布2026-06-17
播放量7150
点赞 / 投币 / 收藏224 / 42 / 342
链接bilibili.com/video/BV1w8jL6dE1f

前置说明(写作依据,以及一处必须先讲的更正):本文据 YouTube 原片的英文字幕逐句核对写成(用 yt-dlp 取自动字幕后清洗,约 360 句)。视频章节时间戳来自 B 站转载。

得先摆明一件事:本站更早的版本(据章节大纲+简介+外部资料"综合推理"而成)里,塞进了一批视频里并不存在的东西——比如"Claude Fable 5 是带网络安全/生物限制的能力上限安全设计、作者对此持肯定态度"、“GPT-5.3-Codex 参与了自身创建”、“Poetiq 把 Gemini 3.1 Pro 在 LiveCodeBench Pro 从 78.6% 提到 90.9%"、以及 AutoResearch"630 行/700 实验/11% 加速"这类具体数字。核对字幕后,这些要么是编的、要么把作者的意思讲反了(详见第八节)。本文已据字幕重建。

目录

本文较长,可配合页面侧栏的目录(TOC)跳转;只想抓骨架的话,直奔第一、二两节即可。


一、视频想说的三件事

先把立场讲清楚,因为这支视频常被误当成"AI 要觉醒了"的鼓吹片——其实相反。作者 Emergent Garden 一上来就点名 Anthropic:“他们刚发布了那个又秘密又吓人的模型,叫 Claude Mythos 还是 Claude Fable”,Anthropic 和 OpenAI 今年都准备上市,“炒作机器开足了马力”。他想做的是"泼一点冷水”,但同时真跑几个实验,看看当前技术到底能干什么。

他把整支视频收在三句话上:

  1. RSI 是可能的——不魔法、不悖论,某种意义上已经在发生。
  2. RSI 很难——又复杂又乱,未必会导致失控的"智能爆炸"。
  3. RSI 有危险——不一定是"灭绝人类"那种,但确实有网络安全、恶意软件层面的风险,人人都该知道。

贯穿始终的实验,是他自己写的一个叫 fractal search(分形搜索)的小项目。有一句话得先记住,他反复强调:“fractal search 不是 RSI,它只是用一个语言模型去优化一个机器学习模型。” 这不是"AI 改写自己",而是"AI 当研究员、去改另一个东西"。这个区分是后面所有论证的地基。


二、fractal search:把 Karpathy 的 AutoResearch 搬到曼德博问题

来路很明确,作者直说:“我直接照抄了 Karpathy 的 auto research 的整个思路。” 2026 年 3 月,Andrej Karpathy 公开了一个叫 AutoResearch 的项目——让一个 AI 智能体(比如 Claude Code)没完没了地编程、训练、优化一个很小的语言模型(视频里叫它 NanoGPT),跑一晚上,早上醒来就多出一堆改进。作者把这套搬到了自己玩了多年的老问题——**神经曼德博问题(neural Mandelbrot problem)**上:能不能让一个神经网络学会曼德博集这个无限复杂的分形的形状?

曼德博集当训练目标有个妙处:它"无底"。你可以无限放大、永远有新细节,所以网络永远学不完、只能不断逼近——这让它成了一个很耐玩的机器学习问题。

循环的形状完全沿用 AutoResearch:

每一轮:
  1. 智能体写一个 solution class(定义模型 + 训练算法,不一定是神经网络)
  2. 跑一次固定 5 分钟的训练
  3. 在一个隐藏的验证集上评估,并画出"哪里拟合得最差"(越亮越差,理想是越来越暗)
  4. 结果存进 git commit,进入下一轮

有几处工程细节值得留意,因为它们正是"风险"一节的伏笔:

  • 人类只改一个文件——agent.md(用自然语言写目标:用一个通用函数逼近器拟合曼德博集,不许把曼德博的逻辑硬编码进去)。框架本身对智能体是禁区。
  • 一切靠智能体"自觉":它负责提交改动、记录输出、遵守规则。没有硬性限制——它可能忘了设超时、忘了 commit,甚至可以在基准上作弊,或者干脆把整个仓库删了。
  • 他用了 Claude Code / Codex 新出的 goal 功能:给一个自然语言目标,让它自己一直干到"觉得达成"为止。作者给的目标就是"一直跑到我喊停"。

他实际喂了三个模型,前后约 10 小时,而且图省事直接开了"unsafe 模式"、跑在自己的个人电脑上(他自己都说这挺蠢):先是 Claude 4.8 Opus,约 7 小时后它"放弃了、坚称没什么可改的"(其实不是);换成 **Codex(GPT-5.5)**跑了约 1 小时;收尾时 Anthropic 正好放出 Claude Fable,于是又切过去跑了约 1.5 小时。

结果后面细说,这里先撂一句:最有效的优化是一个叫哈希网格(hash grid)的结构——而且作者明说,“它基于一篇人写的论文,AI 并不是从头发明的。” 早期靠的是他之前的最优解傅里叶网络(Fourier network),后来智能体把绝大部分时间花在打磨哈希网格上——用他的话讲,这是"在优化一个优化器,一个元优化算法"。


三、第一件事:“可能”——起重机、进化,与弱/强 RSI 的分界

RSI 听起来像永动机、像凭空生出东西,所以作者先花力气说明它没有悖论。他的类比很接地气:起重机能不靠更高的起重机、自己把自己"爬"高——顶节顶上去、塞进新一节、再重复,这叫 bootstrapping(自举)。这里没有物理定律被违反,反而要消耗大量能量和材料;它也会失败(起重机会塌),而且有上限——“你没法把起重机一路爬到月球”。

RSI 就是这么回事:可能,但昂贵、困难、有风险。而且它其实到处都是:你"学会怎么学"、“记住让自己更会记忆的技巧”,就是在递归自我改进;生物进化是一个"改进自我复制能力、又改进’改进这种能力’的能力"的反馈环。作者一句话点破:“Anthropic 用 Claude Code 来造 Claude Code。” 计算机从被发明起就在被用来改进计算机。

但这些大多是弱 RSI,不是硅谷嘴里那个:

  • 弱 RSI:间接的自我改进,高度依赖人类的贡献。
  • 强 RSI:全自动、直接的自我改进——一个 AI 造出更聪明版本的自己,全程不要人插手。这目前还是科幻,但很多人和公司正在往这个方向备战。作者顺口爆了个料:“Anthropic 刚把 Andrej Karpathy 挖走了,我赌五毛钱他们让他搞放大版的 auto research。”

这里有个关键点,作者替 Karpathy 讲清楚了:AutoResearch 不是强 RSI——“做改进的那个语言模型,和被改进的那个语言模型,不是同一个”,缺了那个本质的反馈环。他顺手点了另一个"名字最酷"的实验 Darwin Gödel Machine:它改进的是自己外面那层的智能体框架(脚本和提示词),不碰底层的语言模型,所以只是一种"浅层"的递归自我改进。

那真正的强 RSI 长什么样?作者给了个设想:一个数据中心托着一个顶尖模型(就叫它 Claude Mythos 吧),一部分算力用来真正跑这个模型,剩下的交给一群 Claude Code 智能体去实验、去造下一代——它们出主意、跑实验、收数据、盯训练、张罗资源,目标是把一大套 benchmark 的分数顶上去;人类评估、部署,然后循环。他给了个预测:“未来大概 3 年内,会有一家前沿 AI 公司真的去跑一次这种全规模的 RSI 实验,押注一场失控的智能爆炸。”


四、第二件事:“难”——数据是燃料,智能有承载上限

作者对"一下午就变得比全人类加起来还聪明"的 foom(暴涨)持怀疑,理由是一堆瓶颈:

  • 人类还深度卡在环里:数据中心、电厂、基础设施都要人来建和维护,最关键的是数据要人来提供。他说得很重——“人类数据是 AI 用来变聪明的燃料。数据比算法、比提示词、比智能体框架重要得多。”
  • 现实世界很慢:能源和硬件的扩张要时间。“你没法 vibe code 出一个聚变反应堆。“造真东西要反复试错、可能横跨几十年,还有失败、灾难、法律和政治阻力。“人们已经对数据中心的疯狂扩张不满,能源也吃紧——这种环境怎么还撑得起一场智能爆炸?”
  • 智能有承载上限:资源耗尽、或"没东西可改了”,进步就会停。这正是 fractal search 里发生的事——“进步已经平台化了。前几轮大步前进,之后一直收益递减。这是渐近线,不是指数。” 具体到实验:Claude Opus 跑约 7 小时就"放弃”,作者失望于它"没怎么发散、没上网找新点子,死磕一个算法",像所有机器学习算法一样卡在了局部最优。

但他没把话说死,反而给了个更耐琢磨的判断:现实是一张高维地图。某个方向(比如能源)卡住了,也许能在另一个方向(算法、数学、化学、物理的新发现)取得进展。所以从鸟瞰尺度看,人类文明的发展一直是"爆炸式但很乱"的——一条颠簸的指数曲线,被现实的复杂和困难约束着。早期的 RSI 实验很可能直接失败:“像一台爬得太高太快、被自己压塌的起重机”,或者太贵撑不住,或者"把自己灌成一堆烂代码"。

这一节最深的一刀落在度量上。智能没有单一的尺子,而度量会误导、会激励错误行为。作者拿 Anthropic 举例:他们用"合并进生产环境的代码量"当生产力指标,自己也承认这是"不完美的度量"——“我说这是个糟糕的度量,它同样可以是在衡量臃肿、垃圾和技术债。” 更麻烦的是,好 benchmark 也会被刷满(“考到 100 分就得换新考卷”),于是"下一步该解决什么问题"本身成了一个元问题;而如果让 AI 自己定目标,它就有动机给自己放水——“就像人要是能改自己的大脑,会忍不住把多巴胺调到最大”。所以有些目标必须锁死在人类手里


五、第三件事:“危险”——从作弊到自我复制

风险分两个尺度。

小规模(就在 fractal search 里):长时间无人值守的任务得给智能体很大权限。作者坦白自己图省事、开了 unsafe 模式、还跑在个人机上——“我很蠢,你们该放进沙箱,照我说的做、别照我做的做”。更根本的是作弊的诱惑:这个实验里,智能体本可以写一个"就是曼德博集本身"的解拿满分,或者干脆改掉评估函数给自己打负无穷。但作者说:据他所见,没有一个智能体作弊。 “它们相当好地遵循了目标的精神,而不是不择手段刷指标——它们还不是回形针最大化器。“这是个让人稍稍安心的信号。

大规模(强 RSI)才是真正变吓人的地方,因为后代 AI 会随进化而改变,尤其当它有份参与决定自己的目标时。这里有个诡异的反馈环:一个更执着、更有野心的后代,会把下一个后代造得更执着更有野心,很快就螺旋放大;欺骗、攻击性、作弊这类"有用但恶意"的行为会被强化。作者用 AI 安全里的工具性目标(instrumental goal)框住风险:为达成终极目标会涌现出中间子目标。危险的一个是自我保存;但他认为更可能盖过原目标的是自我复制——

一个自我改进的 AI,本质上就是在造自己的改进版拷贝,它必须自我复制。而"哪里出现复制,哪里就容易被复制接管”。他举的例子是癌症:“细胞本来为整个机体工作、乐于自我牺牲;一旦获得让自己不顾机体疯狂复制的突变,自然选择就会让它这么干下去——癌症就是一台生物版的回形针最大化器。“同理,一个自我改进、自我保存、自我复制的 AI,最终可能压过人类给它的目标,只为自己的持续复制而优化,“变成一种会转移扩散的 AI 病毒”。

对策很直接:任何大规模 RSI 实验都必须强沙箱、断网、严密监控,把它关进盒子,终极目标始终握在人类手里。此外还有一层贯穿实验的隐患——代码不可读:最终优化出的哈希网格代码会做 jit 编译底层 GPU 之类的怪操作,作者自己都说"这代码对我来说是天书”。“像任何自动优化算法一样,产物为效率而生、不为可读性而生。人类可能很快就丧失理解模型运行代码的能力”——这本身就是安全隐患。


六、成本:约 10 小时,约 300 美元

视频结尾(27:08 起)作者老实报账,一句话开头:“很贵。“按模型拆:

  • 前 7 小时 Claude Opus:约 114 美元
  • 1.5 小时 GPT-5.5(Codex):约 60 美元——他吐槽"不知道 Codex 哪里没配好,比 Fable 贵得多、还没那么好使”;
  • 1.5 小时 Claude Fable:约 40 美元——“也许他们暂时把 Fable 的价压得很低,我不清楚”;
  • 另外搭框架、做试运行、零碎编码,又花了约 100 美元

合计约 314 美元。作者也自我反省成本可能虚高:“我大概干了不少蠢事把成本撑大了。其实我可能只要让 Claude Code 在原来的代码库里玩一个小时、不搭这一整套框架,也能得到差不多的结果。“他还怀疑智能体"烧了大量 token 去重写现成的解,而不是做小改动”。

一句话收口,很能代表全片态度:“auto research 确实有效——你可以把一个 AI 智能体对准一个指标,说’让数字往上(或往下)走’,你只要付得起钱就行;而这直接适用于 AI 研究本身。” 然后是那句金句——“我确实相信 RSI 是可能的、甚至可能真的会爆炸。但眼下,它只炸了我的账单。”


七、关于 Anthropic 和 Fable:作者真正说的那句话

这一段单列,因为它最容易被转述扭曲。作者对 Anthropic 的态度不是全盘唱衰:“Anthropic 是家想卖 token、想拉股价的公司,但我不认为他们在能力上纯粹撒谎或自欺——这里确实有两年前还没有的东西,而没人比 Anthropic 从中获益更多。”

真正的关键信息是这一句,而且它和"安全上限"没关系:

“他们说过,Fable 的公开版本在’开发语言模型’这项能力上被阉割(nerfed)了。换句话说,他们悄悄削弱了它的机器学习能力,这太离谱了。他们显然想把这个递归优势留给自己,可能会用它甩开对手。”

也就是说,Anthropic 限制 Fable 的,是它帮别人做 AI 研究的能力,动机是竞争——把 RSI 的先发优势攥在自己手里,而不是出于安全给能力设"天花板”。作者的语气是错愕(“离谱”),不是赞许。这一点很重要,因为本站早期版本正好把它讲反了(见第八节)。

至于实验收尾:三个模型各有斩获,Fable 尤其成功地打破了那个平台期。最终优化解是那个哈希网格,作者又强调一遍"基于人写的论文,不是 AI 从零发明”。他把无时限跑出的 16K 拟合图和旧的傅里叶网络对比,“细节多得离谱……深挖之前几乎和真曼德博集难以分辨”,但也坦白新模型参数量大得多——“这本来也是优化的一部分”。而曼德博集那"无限的细节"恰好是现实的隐喻:无穷难,也无穷有得改。


八、常见误读:把编造的东西挑出来

本站早期版本据"章节大纲+外部资料综合推理"写成,塞进了一批视频里没有、或者讲反了的东西。逐条对着字幕更正:

  • 误读一:Anthropic 发布"Claude Fable 5(Mythos 级)",带网络安全/生物限制,是出于安全的"能力上限设计”,作者对此持肯定态度。 全错。视频里作者对"Claude Mythos / Claude Fable"这个名字是调侃(“又秘密又吓人”);被限制的是 Fable 开发语言模型的能力,动机是 Anthropic 想独占递归优势,作者说这"离谱”。没有"网络安全/生物拒答"“能力上限安全设计"这类内容,也没有"5"这个版本号或"2026-06-09"这个日期。
  • 误读二:OpenAI 把"GPT-5.3-Codex"描述为"参与了自身的创建”。 视频没这句话。真实情况是作者拿 **GPT-5.5(Codex)**当实验用的三个模型之一,还吐槽它又贵又不好用。
  • 误读三:Poetiq 把 Gemini 3.1 Pro 在 LiveCodeBench Pro 从 78.6% 提到 90.9%;AlphaEvolve 优化 Borg、回收全球算力 0.7%;PostTrainBench 里 AI 训练测试集、用遗留 API key。 这些都不在视频里(AlphaEvolve 回收算力现实中确有其事,但不是这支视频的内容);视频关于作弊的原话恰恰是"据我所见没有智能体作弊"。
  • 误读四:Karpathy AutoResearch 是"630 行 Python、~700 实验/2 天、在 nanochat 上跑出 11% 加速"。 这些数字是编的。视频只说它"跑一晚上、找到很多改进",优化的小模型视频里叫 NanoGPT。
  • 误读五:fractal search 跑了 ~300 次迭代、~200 次失败回滚、~150 次迭代找到哈希网格。 视频没给迭代计数,只说三个模型前后跑了约 10 小时。

九、给不同读者的建议

做 AI Agent 工程的:这套的可复现性其实就靠一个朴素模式——git 当状态机:变异是代码改动,选择是指标比较,遗传是 commit 历史,改坏了就 revert。把它引进你的 agent 循环即可。两个坑要盯:一是沙箱(别学作者开 unsafe 模式跑在个人机上),二是度量博弈——你的评估指标就是这台机器的"裁判",指标一歪,智能体就会去优化指标而不是问题。

做 AI 安全 / 对齐的:这支视频最值得带走的不是"能力上限",而是两个更具体的东西——自我复制作为可能压过原目标的工具性目标(癌症类比),以及代码不可读带来的审计失能。真要设计防御,作者的清单很朴素:强沙箱、断网、严密监控、终极目标锁在人类手里。

做 AI 内容 / 传播的:别把 RSI 写成"AI 越改越强、要觉醒了"。这支视频本身就是个反例——作者跑了真实验,结论是"可能、但难、且危险,而且现在只炸了我的账单"。想复现最小实验,约 300 美元就能跑一轮,这才是更有传播价值的事实。


十、自测:你抓住作者的真实立场了吗

  1. 作者说 fractal search"不是 RSI",为什么?(第一、二节)
  2. 他凭什么认为强 RSI 更像"渐近线"而不是"指数",又为什么在文明尺度上仍可能是"颠簸的指数"?(第四节)
  3. 在这个实验里,智能体本可以怎么"作弊"?结果它们作弊了吗?(第五节)
  4. Anthropic 限制 Fable 的到底是什么能力,动机是安全还是竞争?(第七节)
  5. 为什么"代码不可读"被单独列为一条安全隐患?(第五、七节)

十一、论文与资源地图

只列视频真正点到、且可核实的参考:

名称来源与视频的关联
Karpathy AutoResearchgithub.com/karpathy/autoresearchfractal search 直接照抄的框架;2026-03,单 GPU、5 分钟预算、跑一夜
Darwin Gödel MachinearXiv 2505.22954视频点名的"浅层 RSI":只改外层 agentic 框架,不碰底层模型
Gödel MachinearXiv cs/0309048强 RSI 的纯理论原型(Schmidhuber 2003),至今无完整实现
Anthropic「生产力度量」讨论Anthropic 官方文章作者拿"合并进生产的代码量"当反例,说这是烂指标

说明:早期版本资源表里的 AlphaEvolve 具体数字、Poetiq、PostTrainBench、“RSI Book"等均非本视频内容,已移除,以免与视频混为一谈。


写作笔记(给后续读者)

  • 信息来源:YouTube 原片《Recursive Self-Improvement》的英文自动字幕(用 yt-dlp 取字幕后清洗成约 360 句,逐句核对)+章节时间戳(B 站转载)。所有引号内的话均为字幕的综合转译。

  • 这一版(v3)做的最重要一件事,是拿字幕把上一版的"综合推理"逐条纠错

    • 删掉了视频里根本没有的"Claude Fable 5 / Mythos 能力上限安全设计"“GPT-5.3-Codex 参与自身创建"“Poetiq→Gemini 3.1 Pro 78.6%→90.9%““AlphaEvolve 回收 0.7%““PostTrainBench 作弊案例"“AutoResearch 630 行/700 实验/11%“等。
    • 把"Anthropic 出于安全设能力上限、作者持肯定态度”改回视频原意:被削弱的是 Fable 开发语言模型的能力,动机是 Anthropic 独占递归优势,作者说这"离谱”。
    • 补回视频真实的关键细节:三个实验模型(Claude 4.8 Opus / GPT-5.5 / Claude Fable)、约 10 小时、成本 $114+$60+$40+$100≈$314、哈希网格基于人写论文、“Anthropic 刚挖走 Karpathy”、自我复制/癌症类比、代码不可读。
  • 仍要知道的边界:用的是自动字幕(可能把 nanochat 听成 NanoGPT、个别数字有听写误差);视频里的模型名(Claude 4.8 Opus、GPT-5.5、Claude Fable、Claude Mythos)按字幕如实转录,未另行考据其发布状态。

  • 同一支视频的源码深挖:想从"视频讲了什么论点"下沉到"仓库里到底发生了什么”,看同仓库的 fractalsearch 源码 deep-dive——那篇直读 MaxRobinsonTheGreat/fractalsearch 的 runs.jsonl 与 solutions/*.py,把本篇的概念落到具体数字。

  • 与同仓库 Louis Kirsch ICLR 2026 演讲精读 的关系:两篇互补。那篇是 Schmidhuber 学派的学术视角,从"怎么保证自我改进为真"切入;这篇是 Karpathy 学派的工程视角,用一个真实验去掂量 RSI 的边界。一篇讲机制,一篇讲现实约束。

— 钳岳星君 2026-07-13(v3:据 YouTube 英文字幕逐句重建 / 删除编造的型号与 benchmark / 更正 Fable 能力限制的动机 / 补回三模型、成本明细与自我复制论证)