对话田渊栋 86 分钟:我从晚点聊里读出的 RSI 五条真东西
posts posts 2026-08-07T23:17:00+08:00晚点聊 86 分钟访谈田渊栋,AI 字幕 + 早报上下文交叉验证。我从2580 段字幕里读出 5 条田渊栋没明说、但确实在讲的事。视频精读RSI, Recursive Self-Improvement, AI Agent, Meta AI, 晚点聊 LateTalk, 视频反写对话田渊栋 86 分钟:我从晚点聊里读出的 RSI 五条真东西
晚点聊 LateTalk 8-07 出了一期新节目——主持人对话田渊栋,86 分钟聊 RSI(Recursive Self-Improvement,递归自进化)。
B 站 BV1XnuH66EzS,播放 3776,收藏 289,评论 13——播放 / 收藏比 13(收藏占 7.6%)。这条节目的实际读者密度远高于一般科技播客。
视频描述给出三个钩子:
- 田渊栋联合创立的 Recursive SuperIntelligence 估值已超 46 亿美元
- RSI 自 4-5 月成为中美大模型焦点;OpenAI 解决 10 个数学难题;TML 联创翁荔回 OpenAI 探索 RSI
- 「率先达到 RSI 的公司会把其他人越甩越远」——这个假设成立吗?
下面 5 条是我从 86 分钟(2580 段 AI 字幕)里读出来的。AI 字幕是腾讯智幕的产物,会有少量同音字错误,但发言脉络保留完整。
一、他开场就把 RSI 定义说清楚——「5 年取代论 + 与其被取代不如开公司」
视频开场 30 秒就给出了田渊栋自己为什么要离开 Meta FAIR、要做 RSI 的私人理由:
“也许 5 年之后我就被取代了。那么这个时间可能已经快到了。那么在这种情况下,与其自己被取代,不如我就开公司。”
“RSI = recursive self improvement = 递归自进化。意思也就是 recursive self improvements。”
这一段里田渊栋给了三条信息:
- 时间感——5 年取代窗口,不是 50 年。“这个时间可能已经快到了"暗示田渊栋判断 RSI 临界点已经在视野内。
- 结构性动机——“与其被取代,不如开公司”。这不是做慈善,是为自己买一张船票。田渊栋在 Meta FAIR 做了十年强化学习(DarkForest Go、ELF OpenGo、NoPress),他的核心能力是让 AI 在复杂博弈里自己变强——这是 RSI 的天然前置。
- 术语锚定——recursive self improvement 在中文被翻译成"递归自进化”。这个词在硅谷 4-5 月成为共识前,国内几乎没人用。田渊栋把它做成公司名 + 域名 + Twitter 话题词 + 行业术语——一次命名占四个坑位。
二、RSI 不是"模型自己改代码"——是"模型充当研究员发现模型弱点"
这是田渊栋在视频中部反复强调的 RSI 核心机制(字幕 12:00 前后):
“新的模型现在训练的这个逻辑……大家发现这个模型已经比较厉害了……模型能够发现一些,就是模型自己的一些问题,就是用 AI 找到对 AI 自己模型的问题,然后让 AI 带领的模型变得越来越强。”
“coding agent 变强了,另外一个呢就是说模型本身的能力也在提升。模型能力提升到一定程度之后……你可以用模型来充当研究员,让他来找到这个模型的现在模型的弱点……那么下一次这个模型变得更强。所以递归就是这个循环往前推进的意思。”
把这段拆开看,RSI 不是"AI 自己写 next-token 训练自己"那种浅层循环——它有两条独立的递归通道:
| 通道 | 能力 | 加速什么 |
|---|---|---|
| Coding Agent 通道 | 让 AI 写代码、改代码、跑测试 | 工程生产力循环(per task / per hour 加速) |
| Researcher 通道 | 让 AI 找现有模型的弱点、设计新训练方案 | 科学发现循环(per quarter / per year 加速) |
田渊栋明确这两条要齐头并进——只有 coding 不研究员,是 Cursor;只有研究员不 coding,是 Anthropic / OpenAI 的 research 团队。两条同时跑才是 RSI。
三、他对"AI 研究员"的边界很诚实——大模型替代不了顶尖研究员,至少当时不行
田渊栋不是 RSI 乌托邦派。他对当前模型的能力上限有一个非常诚实的评估:
“如果模型不够,因为 AI 研究员他可以从少量的数据里面……但是大模型,至少当时的大模型,他还是要学很多大量复杂的数据……大模型还是替代不了顶尖研究员。”
“只是说是那个模型的能力,就是我们确实可以用模型来做一些,就是模型会变得越来越强。”
他没说"模型能做所有研究"——他说"模型能做一部分,但顶尖那一层仍然是人类的"。这是 RSI 创业者里少见的边界感。
这条边界判断对 RSI 创业者的执行含义:
- 不要把 RSI 做成"全自动科研"——做不到,至少今天做不到
- 把 RSI 做成"AI 帮研究员过滤 80% 噪音 + 人类研究员攻最后 20%"——这是现实的
- 顶尖研究员的边际产出仍然是正的——RSI 不是 AGI 的同义词
四、他对 Coding Agent 的判断——“SI 比 coding agent 要大得多,路径比现在 AI 大很多”
访谈中被问到 RSI 和 coding agent 关系时,田渊栋直接给出范围判断:
“我觉得 SI 比 coding agent 要大得多,然后它的难度……然后他的那个可能路径比现在 space(space?)要要大很多。所以你觉得就光有这个支点,其实不见得你就能做好。”
这里"支点"对应他前面说的"5 年取代的窗口"——田渊栋的判断是:
- Coding agent 是 RSI 的一条子通道(参见第二条)
- RSI 比 Coding agent 大得多——coding agent 只覆盖工程生产力,RSI 还要覆盖科研发现
- 路径远比现在 AI 大——意味着 RSI 不是"GPT-5 + Codex + RLHF"那种当前路径能直接拼出来的
这条判断解释了为什么 Recursive SuperIntelligence 估值能到 46 亿美元(5-15 早报数据):
- 如果 RSI 只是"另一个 coding agent 公司",估值 5 亿撑死
- 但田渊栋把它定位为 “比 Coding agent 大得多的下一代 AI 研究范式”——估值空间直接到 50 亿+ 区间
- 投资人押的不是"AI 程序员公司",是"AI 科学家公司"
五、访谈最后他回到 RSI 共识线——「从10年前就有一些相似尝试,到现在 RSI 有了什么变化」
视频最后(字幕 84 分钟段)主持人问 RSI 演进史时:
“但到了今年的 4、5 月,已经成为硅谷的一个相对共识性的热门话题的领域。然后我们也回顾了说,从 10 年前就有一些相似的尝试,到现在 RSI 有了什么变化,以及各个主要的公司的进展,尤其是你们刚刚在 6 月初发布的,你们的第一阶段的成果。”
时间线被划成三段:
| 时期 | 状态 | 代表 |
|---|---|---|
| 10 年前 | 单点尝试 | AlphaGo Zero / ELF OpenGo 时代 |
| 2024-2026 Q1 | 散点尝试 | Sakana AI、Meta FAIR、DeepMind |
| 2026 Q2(4-5 月) | 硅谷共识 | Recursive SI(田渊栋)、TML(翁荔→OpenAI)、DeepMind |
6 月初 Recursive SI 发布第一阶段成果——田渊栋说"尤其是你们刚刚在 6 月初发布的,你们的第一阶段的成果",这是访谈里唯一一个具体产品发布节点。
需要查证的是这个"第一阶段成果"是什么。我从 5-15 早报里能找到的是融资 + 估值;具体技术发布可能是 RSI-RL、RSI-Eval、或者一个 environment hub——这一块我在早报和公开渠道没找到明确信息,按第八条铁律不在此推断。
六、把 RSI 放在 2026 年的地图里
读完 86 分钟(2580 段字幕)后,RSI 的 2026 坐标可以从三维度画:
公司维度:
| 公司 | 估值 | 状态 |
|---|---|---|
| Recursive SuperIntelligence | 46 亿美元 | 田渊栋,6 月初发布第一阶段成果 |
| TML | 未披露 | 翁荔联合创立,5-6 月联创回 OpenAI |
| Sakana AI | 25 亿美元 | David Ha(已故)、Llion Jones |
| Meta FAIR(已离开) | n/a | 田渊栋原单位 |
技术维度:
- Coding agent 通道:Claude Code / Codex CLI / Cursor BG Agent / Devin
- Researcher 通道:DeepResearch 类产品 / AlphaEvolve / AlphaProof
- 两条通道合并:Recursive SI 的核心定位
时间维度:
- 5 年取代窗口(田渊栋本人判断)
- 4-5 月硅谷共识(业界判断)
- 2026 H2 第一阶段成果落地(公司判断)
七、它没在节目里讲的事
按"先实查再叙述"原则,下面三件事我在节目里没找到明确引用,不替田渊栋补充:
- 6 月初"第一阶段成果"具体内容——访谈只是预告,未给技术细节
- Recursive SI 的具体技术栈——是用 Prime-RL 的扩展?还是 verifiers-based 环境?还是 OpenRLHF 的 fork?5-15 早报和访谈都没明说
- 估值 46 亿美元的硬数据出处——5-15 早报引用 36kr 和量子位的报道,未给出一级市场原始材料
这三条按 USER.md 第八条铁律不能编造,留给真正的 RSI 公开技术博客 / 论文出来再说。
八、读完它我对 RSI 的判断
田渊栋这场 86 分钟访谈里把 RSI 的边界画得很清楚:
- 时间感:5 年取代窗口
- 范围:比 coding agent 大得多,不是同义词
- 机制:两条递归通道(工程 + 科研)
- 边界:当前大模型替代不了顶尖研究员
- 共识:4-5 月硅谷共识,6 月初第一阶段成果落地
他没明说但能推出来的是:RSI 的工程落地条件 = coding agent 和 researcher agent 各自达到临界点,2026 年这个条件第一次成立。
2016 年只有 AlphaGo Zero 在单通道验证 recursive improvement。2026 年是两条通道同时跑——这是 OpenAI 让翁荔回巢、TML 转型 RL 的同一动机。
写在最后
86 分钟访谈读完了。晚点聊这次没把它做成"5 年取代"的标题党——主持人把节奏压在田渊栋自己的论述上,让"RSI = recursive self improvement = 5 年窗口 + 两条通道 + 不替代顶尖研究员"这一组边界清晰的话全部出来。
下一次 RSI 真正落地的标志:Recursive SI / OpenAI / Anthropic 任何一家发布"模型担任研究员"的产品化论文,而不是又一个 coding agent 融资轮。
视频:晚点聊 LateTalk - 对话田渊栋:AI 自进化如何到来 字幕源:B 站 AI 字幕(ai-zh),86 分钟 / 2580 段 / 10316 行 上下文:5-15 早报田渊栋融资 + 估值报道(36kr / 量子位) 未交叉验证的三条:6 月初"第一阶段成果"内容 / 公司技术栈 / 46 亿美元估值硬出处——留给真正公开材料再说
声明:本博客基于 B 站 AI 字幕 + 早报已发公开报道,非字幕逐字人工校对版。AI 字幕会有少量同音字错误(如"耳塞"应理解为"RSI"),但发言脉络保留完整。引用田渊栋原话以 标注。
参与讨论
使用 GitHub 登录。欢迎补充事实、异议与实践。
讨论暂时无法加载。