独家对话罗福莉:AI 范式已然巨变,从 Pre-train 时代全面转向 Post-train 时代
posts posts 2026-04-26T11:50:00+08:00基于罗福莉 2026 年 3 月 3.5 小时访谈、36kr 整理稿与相关公开资料,梳理大模型竞争为何从 Pre-train 转向 Post-train,以及 Agent 框架、RL Scaling、算力重配与组织敏捷性为何一起成为新主线。视频精读LLM, AI Agent, OpenClaw, DeepSeek罗福莉是小米大模型团队负责人,此前供职阿里达摩院和 DeepSeek。2026 年 3 月,她与科技主笔张小珺进行了一场 3.5 小时的深度对话,话题覆盖大模型竞争格局、Agent 时代的核心技术栈、组织变革和个人认知冲击。这是她第一次接受长时间技术访谈。B 站发布了完整视频,36kr 在 4 月底发布了整理稿。
这场访谈有一个贯穿始终的判断:大模型竞争的胜负手,正在从"模型多聪明"整体搬到"任务能不能做完"。下面五条主线是理解这场对话的坐标,本文按它们依次展开:
| 主线 | 变化 | 落点 |
|---|---|---|
| 范式 | Pre-train 代差收敛,重心转向 Post-train | RL Scaling 从"答得好"到"任务完成得好" |
| 资源 | 瓶颈迁移,卡比例从 3:5:1 变 3:1:1 | 算力从"堆基座"挪到"堆任务闭环" |
| 组织 | 做后训练更需要跨界,环境比经验更重要 | 平权、少分层、快速排障 |
| 生态 | 框架层不是外挂,是决定体验上限的一环 | OpenClaw 是压力测试器 |
| 时间 | 1T 参数是入场券,工作系统先被改写 | 人负责判断,Agent 负责执行 |
这篇是精读,不是转写稿的复述。想听第一手原话、对技术细节穷根究底的人,值得把 B 站那期 3.5 小时原片看一遍;时间有限、只想要主线判断的,读这篇就够了。访谈原文按章节展开——第一章谈 OpenClaw 时刻,之后依次是框架本质、中层模型与范式迁移——本文按主题重排成五条主线,方便对照。
引用时要注意材料分层:带引号的是访谈原话;标了"36kr 整理"或"转述"的是媒体归纳,不是逐字引述;剩下的延伸判断,是作者基于后续公开资料的理解,不作为访谈内容。
竞争为什么从 Pre-train 转向 Post-train
访谈里有一句关键判断:Anthropic 的路径是正确的,这是当下共识。
这句话说的不是站队,是认知变了。Claude 的优势是模型、框架、后训练和上下文工程(Context Engineering)一起作用的结果,不能简单归因于"模型更强"。上下文工程不同于 Prompt Engineering——后者关注如何写好提示词,前者关注的是整个上下文组装管线:检索到的文档、对话历史、工具输出、系统指令和长期记忆如何高效地送入模型的上下文窗口。
过去有人把这些 Context 工程看成结构限制或成本妥协;现在回头看,它更像是在为 Agent 场景里的整体任务完成度服务。
访谈中还有另一句配套的话:现在大家在 Pre-train 上的代差是基本没有的,或者说非常接近。
36kr 把这层意思进一步展开成"中美模型代差只有 2 到 3 个月"。不管你更接受哪种说法,结论都差不多:只把基座模型继续做大,已经很难单独构成决定性优势。Chat 时代主要比谁更聪明,Agent 时代开始比谁更能把任务做完,后者更依赖 Post-train、RL Scaling、框架适配、长上下文管理和错误恢复。
罗福莉对后训练重要性的表述也很直接:
现在至少跟 23 年要去追平 Pre-train 的差距一样,大家很 all in,要去做好 Agent 的 Post-train。更具体说,是在 Agent 上怎么做好 RL 的 scaling。
RL Scaling:从"回答得好"到"任务完成得好"
RL Scaling(Reinforcement Learning Scaling,强化学习扩展)在这里指的不再是传统的 RLHF 对齐。Chat 时代的 RL 主要让模型学会"回答得更好"——输出符合人类偏好、减少幻觉、保持安全。Agent 时代的 RL Scaling 要解决的问题完全不同:用更大的算力、更多样化的奖励信号和更复杂的环境来训练模型完成多步任务。
Agent 场景下的 RL Scaling 要让模型学会调用工具、做长程规划、从错误中恢复、在多步执行中保持一致性。Scaling 的对象变了——不再只是模型参数量,而是训练环境的复杂度和反馈信号的密度。这也是为什么后训练不再是收尾环节,而变成了决定 Agent 是否可用的主环节。
两代 RL 的差别,可以浓缩成一张对照:
Chat 时代 RL(RLHF) → 优化"回答得好":人类偏好 / 降幻觉 / 安全对齐
Agent 时代 RL Scaling → 优化"任务完成得好":工具调用 / 长程规划 / 错误恢复 / 多步一致
Scaling 对象 : 环境复杂度 × 反馈信号密度(不再只是参数量)
系统重心 : "Rollout 推理引擎为核心" → "Agent 为核心"(带工具/记忆/状态)
MiMo 的 Post-train ≈ SFT → 大规模 Agent RL → MOPD(多教师在线策略蒸馏)这种转变在 MiMo-V2.5 的技术报告里也有体现。其 Post-train 路径是 SFT + 大规模 Agent RL + Multi-Teacher On-Policy Distillation(MOPD,多教师在线策略蒸馏),重点放在 Agent 场景下的强化学习,而不是传统的指令微调。
任务变成了长程、多步、可失败、可恢复的执行过程。系统也不再只有一个 Rollout 推理引擎,而是一个带工具、带记忆、带状态的 Agent 系统。团队随之面对另一类问题:把模型放进真实环境后,怎样让它持续做对。
访谈原话里有一句概括:系统从"以 Rollout 推理引擎为核心",转变为"以 Agent 为核心"的一个更复杂系统。
卡怎么分,反映的是瓶颈怎么迁移
访谈里有一组具体的数字:卡的配置变化。罗福莉提到,Chat 时代研究、Pre-train、Post-train 的用卡比例可能是 3:5:1;到了 Agent 时代,更合理的比例会变成 3:1:1,顶尖团队的 Pre-train 与 Post-train 甚至会接近 1:1。
| 时代 | 研究 | Pre-train | Post-train |
|---|---|---|---|
| Chat 时代 | 3 | 5 | 1 |
| Agent 时代 | 3 | 1 | 1 |
这不等于 Pre-train 失去价值,是瓶颈换了位置。旧范式里,更强的基座模型能直接带来更强体验,所以 Pre-train 吃掉绝大多数卡是合理的。新范式里,如果模型不能稳定地跑长程任务、理解复杂上下文、在多步执行里自我修正,它的能力就很难真正转成生产力,Post-train 的地位自然会上来。
36kr 还补充了一个观察:Agent 一旦进入研究流程,一个 idea 从写代码到设计评估,可能从一两周压缩到一两个小时。速度上来了,卡不一定更宽松,反而可能更紧,因为并行验证的量会跟着上去。
组织也得跟着换
技术路线一变,组织通常也得跟着改。罗福莉的判断是,做后训练需要更多背景的人一起上手,让预训练的人参与后训练,会带来新的视角。放到 Agent 场景里,这很自然:模型行为、上下文编排、工具调用、RL 反馈、评估标准和系统基础设施,本来就缠在一起,只让某个单一小组包办,容易做出局部最优。
访谈后半段提到 MiMo 团队时,她给出另一层判断:环境比经验更重要。MiMo 团队约 100 人,内部不设小组、不设职级,甚至没有明确的 deadline。雷军在 2026 年 3 月的发布会上介绍过这支 Core Team:平均年龄 25 岁,清北毕业生占比超过 60%。她不太迷信既有"大模型经验",更看重人在好环境里能否快速学会新范式里的工作方式——她甚至更青睐大二大三的本科生,认为他们在新范式面前"思想还没有被禁锢"。平权组织、较少职级分层、快速调试和联合排障——范式切换期,适应速度比静态履历更值钱。
OpenClaw 暴露了什么
如果把 OpenClaw 只当成一个具体产品,这场访谈就会被读窄。放在访谈的语境里看,它更像一个压力测试器。
OpenClaw 是一个开源的本地优先个人 AI 助手平台,以 TypeScript 为核心。截至 2026 年 9 月,GitHub Stars 已超过 38 万,Fork 数超过 8 万,仍在快速增长。它支持 WhatsApp、Telegram、Slack、Discord、Google Chat、Signal、iMessage 等多种消息渠道,通过本地 Gateway 控制平面统一管理会话、渠道、工具和事件。生态方面,ClawHub 技能市场积累了大量社区 Skills,迭代速度极快。
罗福莉看重的不是最表面的交互层,是那层厚重的中间层:记忆系统、消息通道、心跳任务、定时任务、Workflow、Multi-Agent 逻辑,以及如何把模型自己拿不到的环境信息补进去。这些组件决定了模型能力能在多大程度上被转化为实际的任务完成度。
开源在这里就不只是"能不能白用",是"能不能改框架本身"。黑盒产品最多让人感受到效果,开源框架则允许用户直接改 memory、改 workflow、改 Multi-Agent 逻辑,甚至借助更强模型回头重写框架。36kr 还记录过一个观察:当 Opus 这类顶尖模型先把框架改好之后,再切回 Sonnet、国内模型,甚至 MiMo 自己的模型,体验也会被明显拉升。框架层不只是在放大顶尖模型,也可能在抬高中层模型的有效上限。
罗福莉不认同"模型变强后 Agent 框架就不重要了"的说法。原因很现实:成本。不可能所有场景都用最顶尖模型,Agent 和模型会同时进化,达到同一水平所需的模型会越来越小。她预判,一个激活 10B 参数的模型,过一年可能做到今天 Opus 级别的水平,而且成本极低——有转述称,10B 模型"一两块钱就有百万 token 上下文",够十几个小时的对话。框架层的精巧编排,不会因为模型变强而消失。
视频大纲里专门留了"群体智能提升 Agent 框架"这一章。按现有材料看,群体智能现在更像框架演化的加速器。很多人同时用、同时改,几小时就能迭代一轮,这会显著提升速度,也可能改善部分场景的成本效率。但至少从这场访谈和 36kr 的整理看,还没有足够证据证明 Multi-Agent 已经系统性抬高了任务完成率上限。
1T 之后,真正的问题是什么
访谈里还有一句:我们不会在 1T 水平上走太久。
这句话经常被转述,也容易被转述错。结合视频简介和 36kr 的整理,1T 参数级基座模型是 Agent 时代接近顶尖水平的一张入场券。它说的不是"1T tokens 就够了",也不是"做到 1T 就稳了"。
后续公开资料能提供具体的侧面印证。小米在 2026 年 4 月 27 日同时发布了这两款模型并一并开源。根据 VentureBeat 的报道和 HuggingFace 模型卡:
| 规格 | MiMo-V2.5 | MiMo-V2.5-Pro |
|---|---|---|
| 总参数 | 310B | 1.02T |
| 活跃参数 | 15B | 42B |
| 架构 | MoE(256 路由专家,每 Token 激活 8 个) | MoE(384 路由专家,每 Token 激活 8 个) |
| 最大上下文 | 1M Tokens | 1M Tokens |
| 模态 | 文本 + 图像 + 视频 + 音频 | 文本 |
| 许可证 | MIT | MIT |
MiMo-V2.5-Pro 在 ClawEval(Agent 任务基准)上以 63.8% 的成功率领先开源领域,每条轨迹仅消耗约 70K Tokens,比 Claude Opus 4.6、Gemini 3.1 Pro、GPT-5.4 少 40% 到 60%。带队研发的正是罗福莉本人。
读这组数字,得先分清它测的是什么。ClawEval 测的是"给定一个任务,模型能不能在一条长轨迹里做完",成功率和 Token 消耗分别对应"完成度"和"成本"——它主打的是 Agent 场景的经济性,不是单轮问答的聪明程度。所以数字变化更可能反映的是"模型在长上下文里保持一致性、少走弯路"这一层,而不是"模型懂得更多";反过来,也不该从"每轨迹少用 40% 到 60% Token"直接推出"模型全面更强"——那只是说明它在压低无效探索上做得更好。
这不能反向证明访谈原话,但罗福莉在访谈里强调的方向——后训练重点放在 Agent RL、1T 参数级模型作为入场券——后来确实落到了产品发布里。
后面的难题更现实:到底继续 Scaling 参数量,还是 Scaling 其他维度;用什么芯片;怎样把长上下文、低成本和高速度同时保住。Agent 任务不是多塞点上下文就结束,而是要在很长的执行链条里保持一致性、理解深层要求、恢复失败状态、控制成本。如果 1M 上下文很贵、很慢、很难用,那它就只是纸面参数。
这些数字落到真实任务上,小米官方发布时给过两个记录。
最典型的是 MiMo-V2.5-Pro 从零实现一个 SysY 编译器——这是北大《编译原理》课程项目,本科生通常要写几周,它用 4.3 小时、672 次工具调用完成,在隐藏测试集拿到 233/233 满分。中途不是没有波折:首次编译只通过 137 个测试点(冷启动通过率 59%),到第 512 轮,一次重构让两个测试点回退,模型自己诊断、恢复、继续推进。
另一个是只凭一句"构建一个视频编辑器 Web 应用",它自主工作 11.5 小时、调用工具 1,868 次,交付了 8,192 行带多轨时间线、裁剪、交叉淡化、音频混合和导出流程的可运行应用。这类耗时数小时到十几小时、过程中会出错也要能恢复的任务,正是罗福莉说的"长程、多步、可失败、可恢复"——后训练和框架层打磨的就是这件事。
为什么工作系统会先被改写
“AGI 两年内到来"这个判断容易吸引注意,但从工程和产业角度看,更该盯住的是另一层:工作系统会先变,生活方式未必先变。36kr 的整理里提到,罗福莉认为 AGI 进程大概已经走到 20% 左右,今年至少能走到 60% 到 70%;先被改写的是工作,因为工作直接对应生产力价值,生活场景的改造还更依赖机器人、硬件和物理世界能力。
这带来两个变化。第一,人和 Agent 的交互层级会上移。人不再主要负责指出"这行代码错了”,而是更多负责补限制条件、澄清需求、给出业务逻辑、判断优先级。第二,很多高价值信息并不在预训练数据里。企业内部流程、团队经验、业务规则、技能清单和长期上下文,往往没法靠互联网语料自动补齐,Skills、Memory、长上下文和 Agent 框架因此一起变得更重要。
每天在否认昨天的自己
访谈后半段有一句话,比 AGI 时间表更能代表 2026 年 AI 行业的真实气氛:每天在否认昨天的自己。
罗福莉提到,她原本以为自己的工作已经足够有创造力、足够不会被 Skill 化、Workflow 化,但后来发现 AI 竟然也能逼近这类工作,甚至可能进一步参与模型训练本身。这种冲击比"某个模型跑分更高"深得多,因为它直接碰到研究者对自身不可替代性的判断。
“环境比经验更重要"和"每天在否认昨天的自己"放在同一场访谈里看,意思就很清楚了:前一句在说组织怎么应对范式切换,后一句在说个人怎么承受范式切换。2026 年 AI 行业的一种真实气氛,就是昨天有效的方法今天可能就不够了,新的方法还在快速形成。
从这场访谈能带走的
这场访谈真正的价值,不是罗福莉给出了几个断言,而是给团队和个人各留了一套可执行的判断顺序。按她对范式的理解,落地时值得先想四个问题:
- 衡量标准先换。 不要只测聊天能力,要测长程任务完成度。单轮问答和静态 Benchmark 很难说明 Agent 在真实任务里的稳定性、错误恢复能力、上下文利用率和工具调用质量;评估系统建不起来,后面所有优化都看不清效果。
- 把 Harness、Memory 和评估系统当基础设施,而不是外挂。 模型不会直接裸奔进生产环境,框架怎么喂上下文、怎么存状态、怎么做约束、怎么评估失败,决定了体验上限——这也是为什么她强调框架层不会因模型变强而消失。
- 重排预算,别把 Post-train 当收尾。 卡比例从 3:5:1 挪到 3:1:1,真正要重估的不是"往哪栏放卡”,而是"什么地方值得烧卡";长任务闭环里,无效探索和错误恢复的算力成本,往往比堆参数更值得算。
- 让团队更跨界,而不是更分层。 Pre-train、Post-train、Infra、产品和评估在 Agent 时代越来越难被彻底切开,让不同背景的人更早进入同一个问题空间,通常比竖着一个更精细的职级表更有效。
适用边界也要说清楚:这套判断更多指向"做 Agent 产品、做后训练"的团队。如果只是把模型当 API 调用的应用方,最先该接住的是前两条——把评估和框架层立起来;再往下要不要动组织、动预算,取决于团队是否真的在自研模型与后训练。
参考材料
想验证本文的可核实部分,下一步可以直接点开下面的一手来源——尤其是 VentureBeat 的 MiMo-V2.5 评测与 OpenClaw 仓库,数字都能当场对上:
参与讨论
使用 GitHub 登录。欢迎补充事实、异议与实践。
讨论暂时无法加载。