35B 追平 2.8T:Frontis-MA1 如何用递归自我改进重写 AI 编程的算力法则
posts posts 2026-08-01T22:45:00+08:00一个 35B 参数的模型,在单卡 RTX 4090 上,如何通过递归自我改进追平 2.8T 参数的 Kimi K3?清华 FrontisAI 的最新论文给出了答案:OpenMLE 全栈系统 + 四个原子操作符 + 执行接地的进化搜索。技术笔记Frontis-MA1, RSI, 递归自我改进, AI4AI, OpenMLE, 机器学习工程, 清华大学, FrontisAI, 进化搜索, 强化学习2026 年 7 月 31 日,清华与 FrontisAI 联合放出一篇论文,里面藏着一个足以让算力军备竞赛的逻辑松动的数字:一个 35B 参数的模型,在单卡 RTX 4090 上,跑出了 71.21% 的 MLE-Bench Lite 成绩——超过 GPT-5.5 + Codex 的 68.18%,距离 GPT-5.6 Sol 的 72.73% 和 2.8T 参数的 Kimi K3 的 72.73% 只差 1.5 个百分点。
参数量差了 80 倍,硬件预算差了几个数量级,成绩却站在同一条线上。
这不是蒸馏的奇迹,也不是数据作弊的结果。论文给出的答案是一个更大的命题:递归自我改进(Recursive Self-Improvement, RSI)。Frontis-MA1 不是一个更会写代码的模型,而是一个会改进"做机器学习这件事本身"的模型。
这篇文章完整拆解这篇论文:OpenMLE 三层系统的设计逻辑、四个原子操作符与遗传编程的血缘关系、执行接地的两阶段训练、以及那个让很多人睡不着的哲学问题——当 AI 开始改进构建 AI 的过程,我们站在哪一层台阶上。
一、RSI 到底是什么,为什么 MLE 是它的完美试验场
递归自我改进这个词在 AI 安全讨论里出现多年,通常带着一丝末日色彩:AI 改进自己,改进后的 AI 更擅长改进自己,循环加速,智能爆炸。但这类讨论一直停留在思想实验层面,因为缺少一个可执行、可验证的载体。
论文的关键一步,是把 RSI 从玄学拉回工程。作者们观察到:机器学习工程(Machine Learning Engineering, MLE)天然就是 RSI 的试验场。一个 MLE 智能体的产出是代码,代码可以真的跑起来,跑完有分数——准确率、对数损失,白纸黑字。改进有没有效,不需要人来裁判,执行结果就是裁判。
这就是论文里 AI4AI 的含义:用 AI 去改进"构建 AI 的过程本身"。而 MLE 是这个过程里第一个可以闭环的环节——任务可描述、方案可执行、结果可打分。
作者也很清醒,他们画了一条机制阶梯,把自己的位置标得明明白白:
- 进化(Evolution):靠选择和变异改进方案,选择者是人;
- 自进化(Self-Evolution):AI 自己执行选择和变异;
- 元进化(Meta-Evolution):训练"改进者"本身——OpenRSI 在这里;
- RSI:完整闭环,改进过程本身被递归改进——终极目标,尚未抵达。
不吹嘘通用 RSI 已被解决,而是在有界领域把元进化做扎实。这个姿态决定了整篇论文的成色。
二、OpenMLE:一个系统,三层分工
OpenMLE 全栈由三个组件构成,各自回答一个绕不开的问题。
OpenMLE-Gym:分数从哪来
任何自我改进系统的第一块地基是"反馈"。OpenMLE-Gym 负责构建、描述、执行和质量检查可验证的 MLE 任务包:每个任务在沙箱中真实执行,返回任务特定分数。
这里有个细节埋着后面一条主线:不同任务的指标不同(accuracy、log loss 等),分数范围之间不可直接比较。一个任务的 0.85 和另一个任务的 0.85 含义完全不同。这个看似麻烦的事实,恰恰催生了后面 RL 阶段最重要的设计之一——自适应边界。
OpenMLE-RL:操作符从哪来
第二层回答的是:模型凭什么会"改进"?靠两阶段训练——执行接地的监督微调(SFT)加在线强化学习(RL)。
OpenMLE-Evo:长时程搜索怎么组织
单个操作符学会了,不等于会连续搜索十几个小时。第三层是人口级(population-level)的进化搜索循环,负责把操作符组织成长时程的探索过程。
三层合起来的完整图景是:Gym 提供反馈信号,RL 教会模型四个原子操作符,Evo 在推理时把这些操作符编织成一场持续的进化搜索。训练与推理共享同一套动作空间——论文把这个称为核心设计原则。模型训练时学的每一个动作,都是推理时真正会执行的动作,没有分布偏移。
三、四个原子操作符:遗传编程的现代转世
Frontis-MA1 的全部动作空间只有四个操作符:
| 操作符 | 功能 |
|---|---|
| Draft | 从零生成完整程序 |
| Improve | 基于分数和执行证据改进父方案 |
| Debug | 修复运行失败的程序 |
| Crossover | 交叉重组两个父方案的优点 |
熟悉演化计算的读者会立刻认出:这就是遗传编程(Genetic Programming)的初始化、变异、修复、重组四件套。区别在于,经典遗传编程的变异是盲目的——随机改几个语法树节点,碰运气。而这里的每个操作符背后是一个 35B 的语言模型,它读过任务描述、看过执行日志、知道父方案的分数和失败原因。变异第一次有了理解力。
为什么是这四个,而不是更细或更粗的动作空间?论文的逻辑是完备性与可学习性的平衡:Draft 提供探索的起点,Improve 提供利用的梯度,Debug 回收失败样本(MLE 任务里大量程序是跑不通的,没有 Debug 等于扔掉一半反馈),Crossover 实现跨谱系的信息交换——这是纯爬山算法做不到的事,它允许两个局部最优的优点在一次操作里完成重组。
四、训练方法论:26,259 条数据如何教会模型"改进"
SFT:双路径数据采集
SFT 阶段共收集 26,259 个样本,来自两条互补路径:
- 平行路径(Parallel Path):独立采样并执行完整的 Draft 方案,贡献 17,245 个完整响应样本。这条路径提供覆盖度。
- 进化路径(Evolutionary Path):对已执行的程序施加 Improve / Debug / Crossover,保留高质量的局部轨迹片段,贡献 9,014 个轨迹步骤样本。这条路径提供"改进"的示范——模型从这里学会的不是写代码,而是改代码。
采集过程还带一条预算自适应停止规则:简单任务早停,困难任务分配更多尝试。算力花在刀刃上。
RL:三个关键设计
RL 阶段面对的是 MLE 任务的天然难题:奖励异构、沙箱执行慢、分数分布极端。论文的三个应对都值得展开。
1. 自适应边界(Adaptive Bounds)
不同任务的分数尺度不可比,直接拿原始分数当奖励会让训练被少数高分区间的任务主导。OpenMLE 的做法是从该任务的历史 on-policy 分数前沿推导更紧的边界,把异构分数统一映射到 [0,1]。每个任务的奖励都在跟自己比,而不是跟别的任务比。
2. 熵优势加权(Entropic Advantage)
一次 rollout 生成一组候选,传统 GRPO 类方法对组内样本的权重相对均匀。OpenMLE 用 softmax 温度放大最佳候选的学习信号:
$$A^{ent}i \approx \frac{\exp(\beta \cdot r{proc,i})}{\sum_j \exp(\beta \cdot r_{proc,j})} - 1$$
消融数据显示,这个设计让最佳候选的处理信号增强了约 4 倍(平均处理优势从 1.58 提升到 6.39)。结合自适应边界,测试 medal 率从 24.2±5.7% 提升到 34.8±4.3%——这是论文里最硬的单项消融证据。
3. 异步 rollout(Asynchronous Rollouts)
MLE 的沙箱执行时间差异巨大:快的几分钟,慢的按小时计。同步批必须等最慢的作业跑完才能开下一批,大量 GPU 时间在空转。异步 rollout 让每个生成-执行组独立启动,谁的沙箱先跑完谁先进入下一轮。工程上不性感,但直接关系到"4090 上 12 小时能不能跑完一个任务"这条生死线。
五、OpenMLE-Evo:搜索层的三个反贪心设计
推理时的 OpenMLE-Evo 是一场人口级进化搜索。它最有趣的地方在于每一步都在抵抗贪心。
经验卡片与经验板:搜索是有记忆的
每个评估节点附带一张经验卡片(Experience Card),记录结构化元数据:节点 ID、所属方法族、相对父节点的增量、排名等。所有卡片汇聚成一块经验板(Experience Board),维护全局搜索状态:已探索的方法族、族内最佳候选、未探索方向、重复失败、分数趋势、父图。
没有这块板,搜索就是金鱼记忆——每一步都只看眼前的分数,反复踩同一个坑。
三因子父节点选择:分数不是唯一的裁判
选择父节点时,OpenMLE-Evo 同时考虑三个因子:
$$U_i = \lambda_s \cdot \tilde{s}i + \lambda\Delta \cdot e\Delta_i + \lambda_n \cdot \nu_i$$
$$P(i \mid I) = \frac{\exp(U_i / \tau)}{\sum_j \exp(U_j / \tau)}$$
质量(Quality)是当前分数,进展(Progress)是该节点相对其父节点的改进幅度,新颖性(Novelty)是探索方向的稀有程度。
这个设计的深意在于:一个分数中上但最近进步很快的节点,往往比一个已到瓶颈的高分节点更值得继续投入;一个来自冷门方法族的节点,保存着种群多样性,是跳出局部最优的火种。 贪心按分数选父节点的系统,十几个小时后几乎都收敛到了同一座山的半山腰。
操作触发的记忆合成:上下文按需生成
长时程搜索的另一个陷阱是上下文爆炸:几十个节点的历史全塞进 prompt,模型会被淹没。OpenMLE-Evo 的做法是把 LLM 记忆合成延迟到操作实际发生时——Improve 被触发,才按需生成方法摘要与父节点的比较;不同操作符看到的上下文也不同:Improve 用祖先的垂直轨迹加兄弟的水平集合,Crossover 用双亲的族谱。
操作条件上下文构建(Operation-conditioned context construction)让每个操作符只看到与"当前这个动作"相关的证据,信噪比远高于一锅端的历史拼接。
Evo-Max:两针增强剂
OpenMLE-Evo-Max 在基础版上叠加两个增强:从公开竞赛制品蒸馏可复用的跨任务先验(注意:所有 MLE-Bench 相关源在蒸馏前已被排除,避免评测泄漏),以及异步多 GPU 并行搜索(总沙箱算力预算保持不变)。前者提供经验,后者提供吞吐,结果是从 60.61% 到 71.21% 的 10.6 个百分点跃升。
六、结果解读:数字背后的三层意义
MLE-Bench Lite 22 个任务上的完整对比,值得分三层读。
第一层:后训练增益是真实的
受控对比(同框架、同算力预算,唯一变量是模型):
- Qwen3.6-35B-A3B 基座 + OpenMLE-Evo:39.39%
- Frontis-MA1-35B + OpenMLE-Evo:60.61%
同一个搜索框架,换上一个经过操作符训练的模型,成绩提升 21 个百分点。这 21 个点全部来自"模型学会了改进"。在第二个骨干上(Qwen3-30B → Frontis-MA1-30B,53.03%),增益方向一致,说明方法不挑基座。
第二层:框架增益同样是真实的
匹配框架对比更有意思——同一个模型,换框架:
- GLM-5.2:Claude Code 59.09% → OpenMLE-Evo 62.12% → Evo-Max 66.67%
- MiniMax M3:Codex 54.55% → Evo-Max 65.15%
- Kimi K2.6:Claude Code 59.09% → OpenMLE-Evo 66.67%
通用编码智能体框架(Claude Code、Codex)是通用工具,OpenMLE 是 MLE 专用搜索系统。数字说明:在 MLE 这个领域,结构化进化搜索框架本身就值 5-10 个百分点。 模型和框架是两个独立的增益轴,可以叠加。
第三层:与大模型的参照
Panel C 的参照系是通用编码智能体的天花板:GPT-5.6 Sol + Codex 72.73%,Kimi K3(2.8T)+ Claude Code 72.73%,GPT-5.5 + Codex 68.18%,Claude Opus 4.8 是 63.64%。
Frontis-MA1-35B + Evo-Max 的 71.21% 插进了这个阵营的中间——身后是 GPT-5.5,身前是 GPT-5.6 Sol 和一个 80 倍参数量的对手。而它的硬件预算是单卡 RTX 4090(12GB 显存),每任务 12 小时。
还有一组容易被忽略但同样重要的迁移实验:在没见过的 NatureBench Lite 上,固定框架只换训练后的模型,Match-SOTA 从 50% 提到 70%;固定模型只换搜索框架,从 20% 提到 50%。两头都涨,说明学到的不是对特定 benchmark 的过拟合,而是可迁移的"改进能力"。
七、4090 的意义:RSI 的民主化
这篇论文最出圈的传播点是一句话:RSI 不再是大公司的专利。
这话不是修辞。此前想在 AI 自我改进方向做研究,门槛是集群级的算力和闭源的基座模型。Frontis-MA1 把门槛降到了一张消费级显卡:35B 参数、BF16 与 GGUF 量化权重完全开源、单卡 4090 可复现完整流程。OpenRSI 仓库(GitHub 已 94 星,CC BY-NC 4.0)开放了全栈代码。
对研究社区的意义很直接:当一个方向的复现成本从"申请集群"降到"下班前把 4090 挂上",探索者的数量会扩大两三个数量级。RSI 研究的实验迭代速度,可能因此被整个改变。
也要把话说完整:12 小时一个任务、22 个任务的 Lite 版 benchmark,这仍是研究规模的实验,不是生产规模的部署。消费级算力打开的是研究民主化的门,不是"个人电脑训练出 GPT-6"的门。
八、局限:站在阶梯的中间
论文对局限的坦白程度值得尊重。
其一,71.21% 与 72.73% 之间仍有差距,而这还是在 Lite 版的 22 个任务上;完整版 MLE-Bench 的任务更多、更难,泛化表现有待验证。其二,Evo-Max 的蒸馏先验来自公开竞赛制品,这条路径能否持续扩展取决于公开知识的密度。其三,也是最重要的——OpenRSI 自己在机制阶梯上标注的位置是元进化,距离真正的递归闭环还有一层:模型现在能改进"做任务的方案",但还不能改进"改进方案的过程本身"。训练循环是人类设计的,进化框架是人类设计的,操作符集合也是人类设计的。
真正的 RSI 时刻,是模型开始修改 OpenMLE-Evo 的搜索策略本身——那一天还没到来。
九、写在最后:改进者的出现
回顾 AI 这几年的主线,大部分进展可以概括为"更大的模型做更多的任务"。Frontis-MA1 指向了另一条路:模型的竞争力不只来自参数规模,还来自它在一个良构的反馈回路里自我改进的效率。
35B 追平 2.8T,表面上是小模型的胜利,实质上是回路的胜利——任务可执行、反馈可验证、操作符可学习、搜索有记忆,四个条件凑齐之后,规模不再是唯一的变量。
AI4AI 这个词也第一次有了可触摸的形状。它不再是论坛上的末日预言或科幻设定,而是一个 GitHub 仓库、一份开源权重、一张 4090 上跑 12 小时的实验日志。元进化只是阶梯的中间层,但从这一层往上看,路径第一次变得具体。
当 AI 学会改进构建 AI 的过程,人类工程师的角色会往哪里移动?论文没有回答这个问题,它只是把这个问题从假设变成了日程表上的事项。
参考链接
参与讨论
使用 GitHub 登录。欢迎补充事实、异议与实践。
讨论暂时无法加载。