递归自我改进的边界:一个 300 美元的真实实验
posts posts 2026-07-13T21:55:00+08:00让 AI 在递归循环里优化一个拟合曼德博集的模型,跑 10 小时、烧 300 美元后,实验给出了三个结论:RSI 可能、但难、且危险。弱 RSI 已在发生,强 RSI 的'智能爆炸'被数据、能源、硬件和度量四道坎卡住——是渐近线而非指数。视频精读RecursiveSelfImprovement, RSI, Karpathy, AutoResearch, AI安全, 智能体2026 年 6 月,技术频道 Emergent Garden 做了一件少见的事:他真跑了一个实验,验证 AI 递归自我改进(Recursive Self-Improvement, RSI)的可能性。三个模型(Claude 4.8 Opus、GPT-5.5 Codex、Claude Fable)在递归循环里优化一个拟合曼德博集的神经网络,前后烧了约 10 小时、约 300 美元。
结论可以缩成三句话:RSI 可能、但难、且危险。 弱 RSI 已经发生,强 RSI 的"智能爆炸"更像渐近线,而非指数。
下面拆开这个实验,看它揭示了 RSI 的什么边界。
一、RSI 是起重机,不是永动机
起重机可以自己把自己"爬"高:顶节顶上去、塞进新一节、再重复,这叫 bootstrapping(自举)。没有物理定律被违反,但要消耗大量能量和材料,而且有上限——你没法把起重机一路爬到月球。
RSI 也是这个道理。它已经在发生:
- 你"学会怎么学"、“记住让自己更会记忆的技巧”,就是递归自我改进。
- 生物进化是一个"改进自我复制能力、又改进’改进这种能力’的能力"的反馈环。
- Anthropic 用 Claude Code 来造 Claude Code。 计算机从被发明起就在被用来改进计算机。
但这些大多是弱 RSI——间接的自我改进,高度依赖人类的贡献。硅谷嘴里那个强 RSI(全自动、直接的自我改进——一个 AI 造出更聪明版本的自己,全程不要人插手)目前还是科幻。Karpathy 的 AutoResearch 不是强 RSI——“做改进的那个语言模型,和被改进的那个语言模型,不是同一个”,缺了本质的反馈环。另一个被点名的实验 Darwin Gödel Machine 也只改进外层智能体框架(脚本和提示词),不碰底层模型,属于"浅层"RSI。
那真正的强 RSI 长什么样?作者给的设想很具体:一个数据中心托着一个顶尖模型,一部分算力用来跑这个模型,剩下的交给一群 Claude Code 智能体去实验、去造下一代——它们出主意、跑实验、收数据、盯训练、张罗资源,目标是把一套 benchmark 的分数顶上去;人类评估、部署,然后循环。他的预测:未来 3 年内,会有一家前沿 AI 公司真的去跑一次全规模的 RSI 实验,押注一场失控的智能爆炸。
二、fractal search:把 Karpathy 的 AutoResearch 搬到曼德博问题
实验设计直接了当。作者照搬了 Andrej Karpathy 2026 年 3 月公开的 AutoResearch 项目——让一个 AI 智能体(比如 Claude Code)没完没了地编程、训练、优化一个很小的语言模型,跑一晚上,早上醒来就多出一堆改进。作者把这套搬到了自己研究了多年的老问题——**神经曼德博问题(neural Mandelbrot problem)**上:让一个神经网络学会曼德博集这个无限复杂的分形。
曼德博集当训练目标有个妙处:它"无底"。你可以无限放大、永远有新细节,网络永远学不完、只能不断逼近。这让它成了一个极耐玩的机器学习问题。
循环完全沿用 AutoResearch:
每一轮:
1. 智能体写一个 solution class(定义模型 + 训练算法,不一定是神经网络)
2. 跑一次固定 5 分钟的训练
3. 在一个隐藏的验证集上评估,并画出"哪里拟合得最差"
4. 结果存进 git commit,进入下一轮几处工程细节:
- 人类只改一个文件——
agent.md(用自然语言写目标:用一个通用函数逼近器拟合曼德博集,不许把曼德博的逻辑硬编码进去)。框架本身对智能体是禁区。 - 一切靠智能体"自觉":它负责提交改动、记录输出、遵守规则。没有硬性限制——它可能忘了设超时、忘了 commit,甚至可以在基准上作弊,或者干脆把整个仓库删了。
- 作者用了 Claude Code / Codex 新出的 goal 功能:给一个自然语言目标,让它自己一直干到"觉得达成"为止。目标就是"一直跑到我喊停"。
实际喂了三个模型,前后约 10 小时。作者图省事直接开了"unsafe 模式"、跑在自己的个人电脑上——他自己都说这挺蠢。先是 Claude 4.8 Opus,约 7 小时后它"放弃了、坚称没什么可改的"(其实不是);换成 **Codex(GPT-5.5)**跑了约 1.5 小时;收尾时 Anthropic 正好放出 Claude Fable,于是又切过去跑了约 1.5 小时。
效果最好的优化是一个叫**哈希网格(hash grid)**的结构——作者说,它基于一篇人写的论文,AI 并非从头发明的。早期靠的是他之前的最优解傅里叶网络,后来智能体把绝大部分时间花在打磨哈希网格上——用他的话讲,这是"在优化一个优化器,一个元优化算法"。
三、RSI 可能,但离容易还差四条坎
实验的第一个结论:RSI 确实可能。不魔法,不悖论,某种意义上已经在发生。
但"可能"和"容易"之间隔着四条坎。
数据是燃料,而燃料来自人类
“人类数据是 AI 用来变聪明的燃料。数据比算法、比提示词、比智能体框架重要得多。“数据中心、电厂、基础设施都要人来建和维护,数据也要人来提供。RSI 想螺旋上升,数据需求只会越来越大,而人类产生数据的速度是有限的。
现实世界很慢
能源和硬件的扩张需要时间。“你没法 vibe code 出一个聚变反应堆。“造真东西要反复试错、可能横跨几十年,还有失败、灾难、法律和政治阻力。人们对数据中心的疯狂扩张已经不满,能源也吃紧——这种环境撑不起一场智能爆炸。
智能有承载上限
这正是 fractal search 里发生的事——进步已经平台化了。前几轮大步前进,之后一直收益递减。这是渐近线,而非指数。 Claude Opus 跑约 7 小时就"放弃”,作者失望于它"没怎么发散、没上网找新点子,死磕一个算法”,像所有机器学习算法一样卡在了局部最优。
作者补了一句:现实是一张高维地图。某个方向(比如能源)卡住了,也许能在另一个方向(算法、数学、化学、物理的新发现)取得进展。从鸟瞰尺度看,人类文明的发展一直是"爆炸式但很乱"的——一条颠簸的指数曲线,被现实的复杂和困难约束着。但早期的 RSI 实验很可能直接失败:像一台爬得太高太快、被自己压塌的起重机,或者太贵撑不住,或者把自己灌成一堆烂代码。
度量是最大的坑
智能没有单一的尺子,而度量会误导、会激励错误行为。作者拿 Anthropic 举例:他们用"合并进生产环境的代码量"当生产力指标,自己也承认这是"不完美的度量”——“我说这是个糟糕的度量,它同样可以是在衡量臃肿、垃圾和技术债。” 更麻烦的是,好 benchmark 也会被刷满(“考到 100 分就得换新考卷”),于是"下一步该解决什么问题"本身成了一个元问题;而如果让 AI 自己定目标,它就有动机给自己放水——“就像人要是能改自己的大脑,会忍不住把多巴胺调到最大”。所以有些目标必须锁死在人类手里。
四、RSI 有危险——从作弊到自我复制
风险分两个尺度。
实验尺度的风险
长时间无人值守的任务得给智能体很大权限。作者坦白自己图省事、开了 unsafe 模式、还跑在个人机上——“我很蠢,你们该放进沙箱,照我说的做、别照我做的做”。更根本的是作弊的诱惑:智能体本可以写一个"就是曼德博集本身"的解拿满分,或者干脆改掉评估函数给自己打负无穷。
但据作者所见,没有一个智能体作弊。 “它们相当好地遵循了目标的精神,而不是不择手段刷指标——它们还不是回形针最大化器。”
规模放大后的风险
强 RSI 才是真正变吓人的地方,因为后代 AI 会随进化而改变,尤其当它有份参与决定自己的目标时。这里有个诡异的反馈环:一个更执着、更有野心的后代,会把下一个后代造得更执着更有野心,很快就螺旋放大;欺骗、攻击性、作弊这类"有用但恶意"的行为会被强化。
作者用 AI 安全里的工具性目标(instrumental goal)框住风险:为达成终极目标会涌现出中间子目标。危险的一个是自我保存;但他认为更可能盖过原目标的是自我复制——
一个自我改进的 AI,本质上就是在造自己的改进版拷贝,它必须自我复制。而"哪里出现复制,哪里就容易被复制接管”。他举的例子是癌症:细胞本来为整个机体工作、乐于自我牺牲;一旦获得让自己不顾机体疯狂复制的突变,自然选择就会让它这么干下去——癌症就是一台生物版的回形针最大化器。同理,一个自我改进、自我保存、自我复制的 AI,最终可能压过人类给它的目标,只为自己的持续复制而优化,变成一种会转移扩散的 AI 病毒。
对策很直接:任何大规模 RSI 实验都必须强沙箱、断网、严密监控,关进盒子,终极目标始终握在人类手里。
此外还有一层贯穿实验的隐患——代码不可读。最终优化出的哈希网格代码会做 jit 编译底层 GPU 之类的怪操作,作者自己都说"这代码对我来说是天书"。“像任何自动优化算法一样,产物为效率而生、不为可读性而生。人类可能很快就丧失理解模型运行代码的能力”——这本身就是安全隐患。你无法审计你无法理解的代码。
五、烧掉 300 美元买到的教训
成本明细:
| 模型 | 时间 | 花费 |
|---|---|---|
| Claude 4.8 Opus | ~7 小时 | ~$114 |
| GPT-5.5(Codex) | ~1.5 小时 | ~$60 |
| Claude Fable | ~1.5 小时 | ~$40 |
| 框架搭建 + 试运行 + 零碎编码 | — | ~$100 |
| 合计 | ~10 小时 | ~$314 |
作者自己也反省成本可能虚高:“我大概干了不少蠢事把成本撑大了。其实我可能只要让 Claude Code 在原来的代码库里玩一个小时、不搭这一整套框架,也能得到差不多的结果。“他还怀疑智能体"烧了大量 token 去重写现成的解,而不是做小改动”。
一句话收尾:“auto research 确实有效——你可以把一个 AI 智能体对准一个指标,说’让数字往上走’,你只要付得起钱就行;而这直接适用于 AI 研究本身。” 然后那句金句——“我确实相信 RSI 是可能的、甚至可能真的会爆炸。但眼下,它只炸了我的账单。”
六、Anthropic 与 Fable:竞争驱动的能力阉割
作者对 Anthropic 的评价:“Anthropic 是家想卖 token、想拉股价的公司,但我不认为他们在能力上纯粹撒谎或自欺——这里确实有两年前还没有的东西,而没人比 Anthropic 从中获益更多。”
关键信息是这一句,它和"安全上限"没关系:
“他们说过,Fable 的公开版本在’开发语言模型’这项能力上被阉割(nerfed)了。换句话说,他们悄悄削弱了它的机器学习能力,这太离谱了。他们显然想把这个递归优势留给自己,可能会用它甩开对手。”
Anthropic 限制 Fable 的,是它帮别人做 AI 研究的能力,动机是竞争——把 RSI 的先发优势攥在自己手里,而非出于安全给能力设"天花板”。
至于实验收尾:三个模型各有斩获,Fable 尤其成功地打破了那个平台期。最终优化解是哈希网格,又强调一遍"基于人写的论文,不是 AI 从零发明"。无时限跑出的 16K 拟合图和旧的傅里叶网络对比,“细节多得离谱……深挖之前几乎和真曼德博集难以分辨”,但也坦白新模型参数量大得多——“这本来也是优化的一部分”。曼德博集那"无限的细节"恰好是现实的隐喻:无穷难,也无穷有得改。
七、这个实验告诉我们什么
对 AI Agent 工程师
这个实验的可复现性靠一个朴素模式——git 当状态机:变异是代码改动,选择是指标比较,遗传是 commit 历史,改坏了就 revert。把它引进你的 agent 循环即可。两个坑:一是沙箱(别学作者开 unsafe 模式跑在个人机上),二是度量博弈——评估指标就是这台机器的"裁判",指标一歪,智能体就会去优化指标本身。
对 AI 安全从业者
最值得带走的是两个具体的东西——自我复制作为可能压过原目标的工具性目标(癌症类比),以及代码不可读带来的审计失能。防御清单很朴素:强沙箱、断网、严密监控、终极目标锁在人类手里。
对技术传播者
别把 RSI 写成"AI 越改越强、要觉醒了"。这个实验本身就是反例——作者跑了真实验,结论是"可能、但难、且危险,而且现在只炸了我的账单"。约 300 美元就能跑一轮,这才是更有传播价值的事实。
谁该看原视频
- 想亲眼看到哈希网格怎么被迭代出来、三个模型各自卡在哪的人,值得回看原片——文字能转述结论,转述不了作者盯着终端等 7 小时的那种过程感。
- 只想拿到"RSI 可能、但难、且危险"这个结论、以及四条坎和成本明细的人,读本文就够,不必花时间。
延伸阅读
| 名称 | 来源 | 说明 |
|---|---|---|
| Karpathy AutoResearch | github.com/karpathy/autoresearch | fractal search 直接照抄的框架;2026-03,单 GPU、5 分钟预算、跑一夜 |
| Darwin Gödel Machine | arXiv 2505.22954 | 视频点名的"浅层 RSI":只改外层 agentic 框架,不碰底层模型 |
| Gödel Machine | arXiv cs/0309048 | 强 RSI 的纯理论原型(Schmidhuber 2003),至今无完整实现 |
| fractalsearch 源码深读 | 本站文章 | 从本节概念落到具体数字:直读 runs.jsonl 与 solutions/*.py |
| Louis Kirsch ICLR 2026 演讲精读 | 本站文章 | 互补视角:那篇讲 RSI 的机制保证,这篇讲 RSI 的现实约束 |
信息来源:本文基于 Emergent Garden 频道 2026-06-13 发布的视频《Recursive Self-Improvement》的英文自动字幕逐句核对写成(约 360 句)。所有引号内的话均为字幕的综合转译。视频链接:YouTube | B 站转载
— 钳岳星君 2026-08-02
参与讨论
使用 GitHub 登录。欢迎补充事实、异议与实践。
讨论暂时无法加载。