目录

中国 AI 模型是否追上了美国前沿?Kimi-K3 深度解读

原文:Have Chinese AI Models Caught Up to the US Frontier?(作者 Zito / scaling01,2026-07-19)

译者按:MoonshotAI(月之暗面)发布 Kimi-K3 时,国内同行振奋、海外也热闹了一周。但 scaling01 这篇长文给出了一份冷静的反向论证——把 Artificial Analysis Intelligence Index(AAI)与 EpochAI Capability Index(ECI)两套评测对照读后,结论是:表层 benchmark 上 Kimi-K3 已经逼近甚至超过美国前沿;可一旦换用更严谨的 ECI,中美之间的真实差距仍在 4 到 5 个月以上,前看差距更是接近一年。“追上"二字,言之过早。

2026 年 7 月 16 日,中国创业公司 MoonshotAI(月之暗面)正式发布 Kimi-K3——一款 2.8T 参数的开源权重旗舰。

它是迄今规模最大的开源权重模型:体量接近 DeepSeek-V4 的两倍,也是第一款参数超过原始 GPT-4(1.8T)的开源权重模型——一年半前,正是 GPT-4 掀起了本轮 AI 狂热。

规模与表现一起到位,“中国 AI 模型到底落后美国前沿多少"这个老问题又被摆回桌面。


谈中美差距之前,先用 Kimi-K3 发布一天后的 benchmark 数据,给它画一张位置图。

MoonshotAI 自报的 35 项 benchmark 中,Kimi-K3 以 30 项压过 Opus 4.8,19 项压过 GPT-5.6-Sol,12 项压过 Claude Fable 5。

第三方评测 Artificial Analysis Intelligence Index 上,Kimi-K3 位列第三,仅在 Fable 5 与 GPT-5.6-Sol 之后;相比此前的中国旗舰——GLM-5.2、Kimi-K2.6、Qwen3.7-Max、DeepSeek-V4-Pro——是一次清晰的跃迁。

另一项 WebDev Arena(要求模型生成美观网页)则直接把 Kimi-K3 推上榜首,Fable 等一并压过。

还有最后一个值得单独拎出来的领域——GPU kernel 优化,对应指标 KernelBench。模型要跑得快、跑得省,硬件利用率必须榨到极致:每个浪费掉的时钟周期,最终都体现在更低的 token/s、更高的延迟、更低的 GPU 吞吐、更低的营收上。

这件事不仅在生产环境关键,研究阶段同样如此。每个新架构想法都要靠实验验证,而裸跑 PyTorch 没法发挥硬件能力,必须有优化 kernel 才能提速。能帮研究员写 kernel 的模型价值巨大,既省时间也省钱——Kimi-K3 在这块与 Fable 5 并列前沿。

参照系:

  • GPT-5.6-Sol 比 Kimi-K3 早 7 天发布
  • Fable 5 比 Kimi-K3 早 37 天发布
  • Opus 4.8 比 Kimi-K3 早 49 天发布

单看这些 benchmark,似乎可以宣告 Kimi-K3 追上了美国前沿。

那这事就这么结了?

未必。

要下这个判断,得先深看 benchmark:到底在测什么?为什么要测?


中美 AI 差距为何重要

围绕这个话题,市面上已有大量文章和场景推演。

简短版是:AI 在软件工程上的能力正以指数级增长——这是我们度量最充分的领域,但几乎可以肯定同样的趋势对数学等其他领域同样成立。

具体到软件工程,AI 模型完成任务的"时间跨度”(time-horizon)大约每 4 个月翻一倍。所谓时间跨度,是模型有 50% 概率完成某项任务时,人类完成同一任务所需的时间。可把它当作任务难度的代理变量——人类花得越久,任务越难。

按代码行数或其他表层指标排编程任务难度,本身就不靠谱;而用时间跨度的好处是经济含义清晰——容易映射到成本与产能。

把这条趋势再外推 2–3 年,AI 将能完成人类需要几个月到几年才能完成的工作。

即便这条规律只对编程有效,掌握"超人级程序员"本身就是巨大的战略优势——而谁能拥有它,谁就掌握主动权。

这正是我们关心差距的原因——差距是一国追平另一国能力所需的时间,而它决定未来由谁主导。

聚焦中美,是因为经验上看,最强模型、最多 AI 研究、最大算力集中度都来自这两家。欧洲理论上不缺资金和人才,但迄今没有展现任何认真竞争的意愿。

截至目前,美国明显领先中国,这一点毫无争议。但 Kimi-K3 的 benchmark 让事情不再那么明朗。


如何度量差距

“差距"指一家实验室追上另一家实验室能力水平所需的时间。

这个定义本身很棘手——它把几件必须区分的事藏在了一起:

  • 能力是分领域的。 一个模型可能追上了另一个模型的编程能力,但在其他领域或综合维度上仍落后。
  • 差距有前看与后看之分。 前看差距问:“落后者还要多久才能达到当前 SOTA?” 后看差距问:“前沿实验室是在多久之前达到落后者现在的水平?” 通常大家说的"差距"指后看——前看是预测题,不确定性更高,因为它依赖你对算力、人才、新 AI 自身加速能力以及这些变量增速的假设。

估算差距还有一个麻烦:可观测的进展是离散的,因为各家每隔几周到几个月才发一次新模型;进步并非沿平滑曲线发生;不同模型的得分也不太可能恰好相同,无法直接用发布间隔去度量。面对这种模糊,常见三种处理方式:选前沿上最接近的相邻模型做高估或低估,或者对数据拟合平滑回归线再比较。

我倾向第三种——它对称、更贴近底层大趋势,也便于观察差距扩大还是缩小。缺点是依赖回归模型选择,并且会掩盖两端的趋势突变,这反过来对 Kimi-K3 不利。但过去 5 年里,可识别的趋势突变顶多一两次:第一次是 2024 年 Q3 reasoning 模型出现,与规模无关;第二次是 2025 年 11 月 Opus 4.5 发布后智能体模型起飞,同样与规模无关。Kimi-K3 体量只是 DeepSeek-V4-Pro 不到两倍,要单凭规模打破既有趋势,多少令人意外。

为公允起见,本文给两套数字:一套是相邻模型、刻画瞬时差距的高估-低估区间;另一套是拟合回归线给出的趋势估计。

下面先快速过一遍 benchmark,再看趋势与差距。


benchmark 选择如何改变答案

MoonshotAI 公开了 35 项 benchmark,其中 8 项编程、12 项智能体、3 项"推理"与知识、12 项视觉。

看这套清单的构成,几个值得注意的点:

  • 没有长上下文 benchmark
  • 没有网络、生物、化学或任何安全相关 benchmark
  • 没有严肃的数学 benchmark——只有 MathVision、GPQA-D 与 HLE
  • 没有纯粹推理 benchmark——GPQA-D 与 HLE 被归入"推理"与知识类别,但本质上仍是带点数学的知识类目
  • 视觉与智能体 benchmark 占主导,35 项里有 24 项
  • 编程 benchmark 里倒是有一些我视为高信号的——覆盖面广、时间跨度长,比如 ProgramBench 与 SWE-Marathon
  • 没有衡量推理/词元效率的 benchmark

这些结果撑不起"Kimi-K3 整体优于 Opus 4.8 与 GPT-5.6-Sol"的结论。无论如何,都不能说 Kimi-K3 比 Fable 5 强——大多数项目它都输给 Fable。

但我们可以说:Kimi-K3 的编程能力,已经能与当前美国前沿模型并驾齐驱。


接着看另一份公开结果——Artificial Analysis Index(后文简称 AAI)。

AAI 是当下最流行的指数之一,但同样有问题,不该用来评估模型通用强度。原因有几条:

  • 第一,构成严重偏向智能体与短时间跨度编程任务,二者占 AAI 权重 58%。(我们不应该人为挑选权重或 benchmark)
  • 第二,每项 benchmark 的难度与信息增益完全被忽略。

AAI 也不是全无用处。它的排名与用户体验相关度颇高,因为它聚焦经济上有用的任务。所以我更愿意把它定位为"日常实用性指数”,而非通用能力或智力指数。

这也是为什么我称它为"Artificial Analysis Index”,而不是官方的"Artificial Analysis Intelligence Index"。


到这里,就该请出 EpochAI 的 Capability Index(ECI) 了。

ECI 想解决上述问题——用项目反应理论(Item Response Theory)把整体潜在通用能力度量到同一尺度。

项目反应理论里,受试者答对一道题的概率,取决于他的能力与题目的难度。

ECI 把这套思路搬到 benchmark 上。它假设:只要知道模型的潜在能力、benchmark 的难度与斜率,就能预测该模型在某项上的得分。

对每项 benchmark,ECI 估计两个参数:

  • 难度参数:达到 50% 得分所需的模型能力
  • 斜率参数:得分对能力变化的敏感度——也即对相近能力模型的区分能力

最后,用一个统计模型同时拟合所有 benchmark,反向优化出每个模型的潜在能力值,让其对所有观测得分的预测最准。

与 AAI 不同,ECI 降低了对人工设定 benchmark 权重的依赖,也不要求所有模型跑过同一套 benchmark——最关键的是,它考虑了每项 benchmark 的难度与区分度。

Anthropic 最近也采用了这套度量方式。

他们的图表同时呈现不同 benchmark 的难度,比如 GPQA Diamond、SWE-Bench-Verified 等。举个例子,最左侧 GPQA-Diamond 那条柱告诉我们:Anthropic ECI 略低于 130 的模型,能在 GPQA-Diamond 上拿到 50% 得分。按这套尺度和 Claude 3 Opus 的潜在能力,可预测它在 GPQA-D 上略低于 50%。实测也确实如此——Opus 3 实际得分 50.4%,略高于预期。

这正是 ECI 的优雅之处:让我们在共享尺度上推断潜在能力,比人工挑选并加权指数更少偏倚。


Artificial Analysis 给出的差距

讲完这些常见陷阱之后,进入本文更有意思的部分——度量差距。

起点是 Artificial Analysis Index——它给 Kimi-K3 提供了分数,也有其他模型详尽的历史分数。

由于指数取值夹在 0–100 之间,我用 sigmoid 拟合。

相邻模型落后区间对后看差距的估计为 1.22–1.61 个月,插值中心估计 1.48 个月。

更大尺度趋势表明差距约 2.89 个月。未来的中国模型发布会告诉我们 Kimi-K3 是真正的趋势突破,还是离群点。

按这套外推,若动态不变,中国模型将于 2027 年末在该指数上超过美国。

但只看两国各自的前沿模型,会掩盖各家实验室单独的演进节奏。

下面是美国(Anthropic、Google、OpenAI)与中国(阿里、DeepSeek、MoonshotAI、Z AI)各家实验室的趋势:

  • OpenAI 与 Anthropic 几乎同轨
  • Google 已落后中国模型,自身趋势也不乐观
  • 中国前沿实验室中,Moonshot 轨迹最陡——若趋势成立,将于 2027 年 2 月超过 Anthropic

前文已论述过为何不该只看 AAI、为何 ECI 更优。

然而,我们没有 Kimi-K3 的 ECI 分数。


估算 Kimi-K3 的 ECI

关于 Kimi-K3 的 ECI,社区有几组估计:

  • 我的社区投票结果是 158–159
  • 我个人此前估计 156–157
  • Teortaxes 估计 157–158

但我们不必全靠直觉,也不想被人指"先入为主"。

幸运的是,AAI 与 ECI 高度相关,这让推断更可靠。

不过有问题。如图所示,线性模型先在 Claude-2/3 这种极弱模型上高估,到 x=[10–30] 区间低估,再到更强模型又高估。

线性模型讲不通。原因是 AAI 分数夹在 0–100,更适合 sigmoid 建模;ECI 则是线性、无界的。

要把两套模型对接,我们对 AAI 分数做 logit 变换(即 sigmoid 的反函数),把它"解压"到线性空间。

重新拟合的模型形式如下——可以直接把 AAI 分数转换为 ECI 分数。

效果干净不少,误差指标也证实:logit-线性模型把平均绝对误差降低 37.2%。

这个模型给出 Kimi-K3 的 ECI 估计为 158.33,bootstrap 80% 置信区间 [154.49, 162.02]


写到这段时,我们实际上从 EpochAI 拿到了 Kimi-K3 的初步结果。

Kimi-K3 在 FrontierMath 上不具竞争力,仍落后于 GPT-5.2-Pro——一款已发布 7 个月的模型。

有了 Epoch 的新数据,先前那套估计就显得多此一举——直接拿 EpochAI 与 Moonshot 提供的 benchmark 算 ECI 就行:AIME 2024-2025、GPQA-D、FrontierMath 1-3 / 4、SimpleQA Verified、Chess Puzzles、PostTrainBench、APEX-Agents、HLE。

不过这套 AAI–ECI 转换公式以后还用得上。

直接算出的初步 ECI 分数为 155.53,90% 置信区间 [153.87, 158.21]。后文分析用这组数字。

这落在我们基于相关性给出的置信区间内,只是略低于预期。要注意:随更多 benchmark 进来,分数还会调整;但这个估计应该比纯相关性方法更准。


估算 Mythos Preview 的 ECI

先把房间里的大象摆出来。

我们没有 Mythos Preview 的 ECI 值。Mythos Preview 于 2026 年 4 月 7 日作为 Glasswing Project 一部分发布。

Mythos Preview 完成的具体日期不明,但从 system card 可知,Anthropic 员工在 2026 年 2 月 24 日就能用上。不过这是否就是 system card 中那个 Mythos Preview,我们不能确定;其他模型内部可用时间也不清楚,所以本文取官方发布日期 4 月 7 日。

Anthropic 只给了自家版本的 ECI(AECI),但可以换算,比如:

我们给出的 Mythos Preview ECI 为 161,90% 置信区间 [158, 166]。

这与 Fable 5 的真实 ECI 160([158, 165])非常接近。我认为公允——考虑到 Fable 5 很可能是一个从 Mythos Preview 蒸馏出来、加上额外安全训练的小模型,两项都会略压低其得分。


ECI 给出的中美差距

先看中美 AI 模型的整体前沿趋势。

按我们的"差距方法论",Mythos Preview 不会改变经验上的后看差距估计——因为 Kimi-K3 离它还很远。

Kimi-K3 当前落在 GPT-5.3-Codex 与 GPT-5.4-Pro 之间,得出相邻模型落后区间 4.37–5.29 个月,线性插值中心估计 5.27 个月——因为 Kimi-K3 更靠近 GPT-5.3-Codex。

按拟合的前沿模型趋势线,后看差距当前为 6.08 个月,且没有交叉或追赶情景。

趋势线进一步预测:中国模型将于 2027 年 3 月 7 日追上 Mythos Preview 161 分——意味着前看差距为 11 个月。固定 Mythos 分数与发布日期,中国趋势线逐点的 90% 置信带到达 ECI 161 的时间窗口为 2026 年 12 月 28 日至 2027 年 6 月 18 日,换算成 lag 是 8.72–14.38 个月。


只看按国家的整体前沿趋势线,会忽略个别实验室可能更陡的上升节奏,所以也单独看一下。

Anthropic 当前趋势线最陡——每年 ECI 增长 25 分;其后 Z-AI(16.2)、OpenAI(14.3)、Moonshot(13.8)。

即便排除 Mythos Preview,Anthropic 的进步速度仍最快——每年 18.1 ECI。

值得注意:在这种情景下,中国模型同样不会追上美国。

下面是中国两家(Moonshot、Z-AI)追上 Mythos Preview ECI 分数的前看差距:

  • Moonshot:2026 年 12 月 23 日;中心差距 8.57 个月。 90% 穿越区间:2026 年 11 月 7 日 至 2027 年 2 月 22 日——即 Mythos Preview 发布后 7.05–10.57 个月。
  • Z AI:2026 年 12 月 31 日;中心差距 8.83 个月。 90% 穿越区间:2026 年 10 月 24 日 至 2027 年 4 月 21 日——即 Mythos Preview 发布后 6.60–12.48 个月。

结论

总结一下:基于 ECI,Kimi-K3(当前中国前沿)相对美国前沿的后看差距约为 4.37–5.29 个月

前看差距——即中国模型首次达到 Mythos-Preview 等价水平所需时间——在 Z-AI 这一最陡但也最不确定的趋势假设下,估计在 6.6 至 12.48 个月之间。但中心估计分别为 8.57 与 8.83 个月

一句话:中国模型既没有追上美国前沿,按当前外推也看不到追上的时间表。


希望本文对你有用。喜欢的话,请在 Substack 与 Twitter 点赞、分享、关注。


附录:关于蒸馏与差距的进一步思考

  • Kimi-K3 是一个 2.8T 参数模型,在一些高度特定的 benchmark 上确实胜过 Opus 4.8 与 GPT-5.6-Sol。但这些 benchmark 不考虑模型规模与推理/词元效率。 从 Cursor CEO Michael Truell 那里我们得知,Opus 与 GPT 模型的体量与 Cursor 新发布的 1.5T 模型相近——这大概指的是 Opus 4.8 与 GPT-5.4;GPT-5.5 与 GPT-5.6 看起来更大,估计接近 3T。这意味着 Kimi-K3 在某些 benchmark 上击败 Opus 4.8,从架构角度看谈不上惊艳。它的推理效率总体上也仍弱于美国模型。这是我认为前看与后看 ECI 差距都被低估的众多原因之一——模型规模、推理效率、真实部署成本与总算力都没有纳入考量(其中大部分数字并未公开)。设想中美进入全面竞争甚至全面对抗的极端情形:拥有 100 万颗最新 Blackwell GPU 与只能拿到更旧的 Hopper GPU(吞吐更低)相比,能部署的实例数与推理速度都会有本质区别——内存与算力直接决定可服务的规模与速度。另一个理由是美国实验室的安全测试比中国实验室完备得多,这可能再加一个月差距。最后,差距被低估的另一个原因在于:大多数 benchmark 并不代表真实任务,也没在成本与时间约束内尝试榨出模型的极限性能。

  • Mythos 据传是一个 10T 参数模型。 同时我们也从多家美国实验室得知,它们在自研更大的 10T 模型——SpaceX AI、OpenAI、Meta 都在做。中国模型现在可能追上了上一代美国模型,但美国实验室已经进入下一代。我猜我们对 Kimi-K3 所谓"追上"的观感,很大程度上源于 OpenAI、Anthropic 等前沿实验室在按兵不动——因为它们的前沿模型涉及网络与 CBRN 能力,面临不确定的监管与法律风险。再设想一下,如果 Anthropic 与 OpenAI 真的发布了它们的新前沿模型 Fable 5.1 与 GPT-6(两者很可能已经完成训练),那么"追上"的讨论根本不会出现——这些新一代 10T 模型会是完全不同的存在。

  • 追赶永远比开拓新前沿容易——大方向已由前者定下。

  • AAI 测试的能力在公开渠道高度可见,又适合 RL hill-climbing,自然成为蒸馏与刷榜的目标。

  • 从前沿模型蒸馏。

  • 选择偏差——我们只看到两家增长最快的中国实验室,而它们的激进赌注恰好奏效。

  • 也可能只是观测窗口的运气——样本模型数量并不算多。

上述"追上"的故事似乎只适用于 AAI,不适用于 ECI。我个人认为是以上几点的综合作用。

我认为这只是特定领域与任务上呈现出的某种"追上"。至于为什么会"追上",仍是值得追问的问题——它能告诉我们能力演进的未来轨迹。

  • 也可能只是观测窗口的运气——样本模型数量并不算多。

  • 虽不能由此证明蒸馏就是原因,但最近 UK AISI 的结果与 ECI 结果至少指向蒸馏与窄任务 hill-climbing 的方向。 具体看 UK AISI 的网络靶场:GLM-5.2 只与 Opus 4.5 持平,尽管它在许多 Moonshot 自报的编程 benchmark 上接近 Opus 4.8。UK AISI 的网络靶场很可能是我们目前最好的 benchmark——任务极难,模型要消耗 1 亿 token,被推到极限。MirrorCode 把这件事推到极致:单模型最多用 10 亿 token。

  • 另一个奇怪的现象:至今没看到中国模型在科学突破上的身影。 如果它们真和前沿美国模型一样强,为什么没有解决此前悬而未决的数学、物理与其他问题?

  • 我们应该把中国模型放到网络与 CBRN 任务上评测。 这些恰恰是前沿实验室会"故意藏拙"(sandbag)并施加安全过滤的领域——没有"通用越狱"就不可能蒸馏到这些能力。对中国模型的安全测试与训练,至少没有像美国模型那样大规模展开。如果中国模型大规模蒸馏,那么这些模型在网络与 CBRN 任务上应该也会更弱——毕竟它们没有同等程度的安全测试与训练。至少 GLM-5.2 在 UK AISI 网络靶场的最新结果似乎正支持这一点,ExploitBench 与 ExploitGym 上也有较弱旁证。