月之暗面 A1 轮投资亲历:叶奇意的中国 AI 十年人才图谱
posts posts 2026-07-28T00:00:00Z叶奇意的中国 AI 十年人才图谱:月之暗面 A 轮投资亲历,美团龙珠视角下的两代 AI 迁徙与 AGI 信仰。视频精读月之暗面, 美团龙珠, Kimi K3, AI 投资本文基于 B 站视频 《对话叶奇意:“寻找"月之暗面杨植麟、中国两代 AI、十年人才迁徙,与 AGI 信仰》(硅谷101,2026-07-28)的视频内容、弹幕记录与公开资料整理。因无法获取完整字幕,嘉宾具体表述基于视频简介、弹幕线索与公开资料还原,不虚构原话。涉及 Kimi K3 的技术数据来自 GitHub 官方仓库。
视频信息卡
| 项目 | 内容 |
|---|---|
| 标题 | 对话叶奇意:“寻找"月之暗面杨植麟、中国两代 AI、十年人才迁徙,与 AGI 信仰 |
| 频道 | 硅谷101(57.2 万粉丝) |
| 嘉宾 | 叶奇意 Kiwi,Ailoha! 创始人,前美团龙珠 |
| 时长 | 70 分 24 秒 |
| 发布时间 | 2026-07-28 15:49:07 |
| 播放 / 弹幕 / 评论 | 104,199 / 191 / 234 |
| 点赞 / 投币 / 收藏 / 转发 | 2,019 / 669 / 1,807 / 396 |
| 链接 | BV1wK3i6NEdQ |
这期视频的切口
2026 年 7 月,Kimi K3 发布,月之暗面再次被推到全球 AI 竞争的中心。硅谷101 在这个时间点找来叶奇意 Kiwi 做了一期 70 分钟的长访谈。Kiwi 在 AI 行业自述"打杂了十年”,亲历了上一代"AI 四小龙"的兴起,后在美团龙珠主导推动月之暗面 A1 轮投资。
节目没有围着 K3 本身打转,镜头对准的是更长的一条线索:杨植麟、唐杰、创新工场 AI 工程院,以及上一轮 AI 创业留下的人才与经验,如何在大模型时代重新汇合,最后催生了月之暗面。主持人提问风格直接——“24 年那轮为什么没有跟"这条获赞 59 的评论说明,观众认可的是这种带刺的追问。
但投资人访谈有天然的信息边界。获赞 61 的评论点得很准:“投资人说话都像机关枪一样突突突,刚开始接触的时候会让人感觉很专业,但时间长了会发现他们一大段表述里的观点通常都并不锐利,而且长时间保持注意力听突突突,真的很疲惫。“带着"长访谈信息密度偏低"的预期去看这期视频,收获会更大。
带着这个预期,这期视频有三块值得读:A1 轮投资的亲历叙述,看的是故事而非判断;中国 AI 十年人才迁徙的脉络,是地图而非导航;算力差距下中国 AI 出路的讨论,价值在把问题问准,而不在给出答案。想从 70 分钟的投资人访谈里要到 K3 级别的技术深度,方向本身就偏了。
嘉宾其人:横跨两个 AI 时代
Kiwi 的职业轨迹横跨中国 AI 的两个阶段:计算机视觉主导的"AI 四小龙"时代,和随后的大模型时代。
CV 时代的亲历者。 商汤、旷视、依图、云从四家公司在 2014 到 2019 年间先后崛起,以 CV 技术为核心,一度代表中国 AI 的最高水平:商汤的 SenseTime 一度是全球估值最高的 AI 独角兽,旷视的 Face++ 在人脸识别领域名噪一时,依图在医疗影像和金融领域布局广泛,云从在安防和航空场景深耕。
这些公司的商业化路径并不顺利。安防市场高度依赖政府订单,竞争激烈导致毛利持续下滑;金融场景的 AI 渗透率受限于合规和数据安全要求,落地速度远低于预期。到 2022 年底 ChatGPT 发布时,四小龙大多陷入增长瓶颈,甚至面临上市后估值缩水的尴尬。
这十年的经历给了 Kiwi 两样东西:对中国 AI 创业生态的系统性认知,以及对 AI 人才网络的深度覆盖。后来在美团龙珠,她主导推动了月之暗面 A1 轮投资;现在她创办了 Ailoha!,继续留在 AI 牌桌上。弹幕中有人提到她曾在新加坡 CNBC 和央视财经连线(31:46 位置),说明她在商业科技领域有较长的公众表达经历。这条从 AI 一线到投资再到创业的轨迹,本身也反映了中国 AI 人才的一种典型迁徙路径。
弹幕里"挖过去的人现在都财富自由了吧”(09:04 位置)这句看似随意的感慨,触及了一个真实现象:上一代 AI 公司的核心成员正在向新一代大模型公司大规模流动。这种流动已经超越个人选择,变成一场行业级别的资源重新配置。
Kimi K3:投资故事的技术前提
讨论月之暗面的投资逻辑,绕不开 K3 的技术分量。2026 年 7 月发布的 Kimi K3 是月之暗面迄今最强的模型,总参数 2.8T,也是全球首个开源到 3T 量级的模型。
架构规格
根据 GitHub 公开信息,K3 的核心规格:
| 维度 | 数值 |
|---|---|
| 架构 | Mixture-of-Experts (MoE) |
| 总参数 | 2.8T |
| 激活参数 | 104B |
| 层数 | 93(1 层 Dense + 69 层 KDA + 24 层 Gated MLA) |
| 注意力头数 | 96 |
| 专家数 | 896(每 token 选 16 个 + 2 个共享专家) |
| 上下文窗口 | 1,048,576 tokens(1M) |
| 视觉编码器 | MoonViT-V2(401M 参数) |
| 量化 | MXFP4 权重 / MXFP8 激活值(量化感知训练) |
| 词汇表 | 160K |
架构创新集中在两点。第一是 Kimi Delta Attention(KDA),一种全新的注意力机制,配合 Attention Residuals(AttnRes)使用。93 层中有 69 层使用 KDA,其余 24 层使用 Gated MLA(Multi-Head Latent Attention)。第二是 Stable LatentMoE 框架,把 MoE 的稀疏性推到新水平——896 个专家中每次只激活 16 个,激活比例仅 1.8%(稀疏度约 98%)。根据 GitHub 描述,这两项创新合计带来约 2.5 倍的整体扩展效率提升;相比上一代 Kimi K2,K3 用更少的计算资源达到更高性能。
MXFP4 量化是另一个容易被忽略的细节。K3 从 SFT 阶段就开始做量化感知训练,部署时可以用 4 bit 权重和 8 bit 激活值运行,大幅降低推理的硬件门槛。对一个 2.8T 参数的模型来说,能跑和跑得起是两个完全不同的问题。
Benchmark 表现
K3 在多个维度上与全球顶尖闭源模型正面竞争:
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | GLM-5.2 |
|---|---|---|---|---|
| SWE-Marathon | 42.0 | 35.0 | 39.0 | 13.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | — |
| ProgramBench | 77.8 | 76.8 | 77.6 | 63.7 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 67.3 |
| GPQA Diamond | 93.5 | 92.6 | 94.1 | 91.2 |
| Terminal-Bench 2.1 | 88.3 | 88.0 | 88.8 | 82.7 |
| Agents’ Last Exam | 28.3 | 25.7 | 29.6 | 20.4 |
| AutomationBench | 30.8 | 29.1 | 29.7 | 12.9 |
SWE-Marathon 上的表现值得展开。它测试模型在长时间、多步骤软件工程任务中的持续表现,要求模型像真实工程师一样在大型代码库中工作。K3 的 42.0 分领先 Claude Fable 5(Anthropic 的旗舰模型)七个百分点,领先 GPT-5.6 Sol(OpenAI 的编程专用模型)三个百分点。FrontierSWE 上 K3 拿到 81.2,低于 Claude Fable 5 的 86.6,但远超 GPT-5.6 Sol 的 71.3。Agents’ Last Exam 是测试智能体能力的综合 benchmark,K3 的 28.3 分仅次于 GPT-5.6 Sol 的 29.6,超过 Claude Fable 5 的 25.7。
表中其余几项覆盖不同能力面:GPQA Diamond 是研究生级科学问答,衡量知识推理;BrowseComp 测真实网页上的信息检索;Terminal-Bench 测命令执行;ProgramBench 与 AutomationBench 分别测代码生成和自动化任务。整体看,K3 的领先集中在代码、终端与自动化这类工程能力上;纯知识推理(GPQA)和通用智能体(Agents’ Last Exam)则与 GPT-5.6 Sol 互有胜负。
算力约束的痕迹
K3 技术报告中有一处脚注容易被忽略:SWE-Marathon 的评测"基于 H20 校准的分支”。H20 是英伟达为应对美国出口管制而面向中国市场推出的降配版 GPU。原始 SWE-Marathon 的 Docker 镜像和性能门槛按 H100 设计,月之暗面不得不为 H20 重新校准 GPU 任务的 Docker 镜像、性能门槛和参考基准——脚注特别说明"correctness and anti-cheat validators remain unchanged”,即正确性和反作弊验证器保持不变。
这不是月之暗面的个例,中国所有 AI 公司都在这个约束下工作。算力差距不仅影响训练成本,还影响从发布到开源之间的商业化窗口——弹幕(61:16)精准地指出:“K3 如果算力足够的话,从发布到开源之间的这些时间既可以赚到钱又可以拿到优质的数据又是一个好的 marketing。”
从 K2 到 K3:转折叙事
弹幕中有一条容易被忽略但信息量很大的评论——“K2 是一切的转折点”(26:37)。它把月之暗面的发展分成两个阶段:K2 之前是一家"有潜力的中国 AI 公司”,K2 之后是全球前沿竞争者。K2 thinking 模型(弹幕 26:53 提到"特别是 K2 thinking 非常惊艳")让市场第一次意识到月之暗面有和硅谷头部公司正面较量的技术能力。K3 则把这个认知从"有潜力"升级到"已经到了"。从 K2 到 K3——从一个有竞争力的模型到全球首个开源 3T 模型——月之暗面用了大约一年时间。
弹幕中"当年 deepseek 不是跟 4o 分数差不多吗"(00:26)和"GPT 出来都没五年"(00:00)两条评论放在一起看,颇有意味。从 GPT-4 发布到 K3 开源,不到五年时间里,中国 AI 公司从"追赶者"变成了"开源前沿的设定者"。这种角色转换的速度,是理解月之暗面投资故事的关键背景。
DeepSeek 是绕不开的参照系。 弹幕多次提到它——“DeepSeek 是去年的,现在真没感觉了”(00:10)、“deepseek:?"(00:23)、“所以 ds 现在哪”(08:51)。这些弹幕反映了一个市场心理:DeepSeek 在 2025 年初的爆发(尤其 R1 模型)曾引发"DeepSeek 时刻"的讨论,但随着 K3 等模型发布,市场注意力快速转移。视频简介也提到"继去年的’DeepSeek 时刻’之后”,说明它是这期对话的重要背景;从弹幕"你们现在把握不住他了"(17:54)可以推测,讨论涉及人才争夺和投资时机,但 Kiwi 的具体表述无法获取,这里不展开。
两条路线在这里分岔:DeepSeek 以极致工程效率和极低训练成本著称,用"小算力做大模型"的路线震惊硅谷;月之暗面则更重产品化和用户体验,从长文本处理切入,逐步扩展到通用大模型。两条路的共同点在于,都在算力受限的条件下找到了各自的突破口。
A1 轮:没有产品时的投资逻辑
视频中最有价值的部分,是 Kiwi 对月之暗面 A1 轮投资决策的亲历叙述。投资发生时,月之暗面没有产品,胜算不明朗。
时间线
从弹幕和评论可以拼出一条时间线。A1 轮由美团龙珠领投,时间大约在 2023 年。2024 年的另一轮融资中美团龙珠没有继续跟投——获赞 59 的评论直接追问"24 年那轮为什么没有跟"。弹幕(23:41)提到"24 年可能在发展闪购,跟阿里开战",暗示美团内部当时有更高优先级的战略任务——闪购业务与阿里在本地生活领域的直接竞争,可能影响了资源分配和投资优先级。“错失 100 亿"这条弹幕(24:00 位置)折射出事后视角的巨大落差:月之暗面后续估值飙升之快,让 A1 轮的投资回报成了一个戏剧性的数字。
投资逻辑的核心
视频简介给出了 Kiwi 叙述的投资逻辑:Kimi 不是突然出现的成功故事。杨植麟、唐杰、创新工场 AI 工程院,以及上一轮 AI 创业留下的人才、经验与技术理想,共同构成一条延续多年的脉络,美团龙珠的 A1 轮押的就是这条脉络的汇合。
杨植麟的身份值得展开。他毕业于清华大学,在自然语言处理领域有深厚的学术积累,是 Transformer-XL 和 XLNet 的核心作者——这两篇论文在 2019 年前后是 NLP 领域最有影响力的工作之一。唐杰是清华大学教授,在知识图谱和社交网络分析领域有深厚积累。这两个人加上创新工场 AI 工程院的孵化体系,构成了一条从学术研究到工程落地的完整链条。
这个逻辑在 2023 年并不显然。当时大模型领域的共识还停留在"算力即正义"阶段,对人才和经验的权重评估,远低于对 GPU 数量的评估。美团龙珠押"人才脉络"而非"押产品”,本身就是一种逆共识的选择。
评论区的争议
这个逻辑成立吗?从结果倒推当然成立——月之暗面确实成了中国大模型领域的头部公司。但获赞 24 的评论提出一个尖锐的逆命题:“合理猜测投中 Kimi 只是一次幸运事件。“获赞 28 的评论更进一步:“只能当八卦听,判断和结论基本没法听。”
投资决策的真实逻辑往往介于"深思熟虑"和"幸运赌注"之间。即使投资人自己讲述的决策过程是理性的、有逻辑的,事后归因偏差(hindsight bias)也会让人高估当初判断的确定性。2024 年美团龙珠没有继续跟投这一点,本身也说明这条脉络的判断并非一直坚定。
获赞 75 的评论指向另一个争议焦点:“这个投资人被骂过,Kimi 之前不搞技术疯狂投流就是她整的。“这条评论涉及月之暗面发展历程中一个备受争议的阶段——产品初期通过大规模投放获取用户的策略。无论 Kiwi 在其中扮演什么具体角色,这个质疑反映了市场对"重营销 vs 重技术"路线的真实焦虑。
获赞 14 的评论给出了更平衡的评价:“嘉宾很谦虚,虽然在技术上她可能并不占优势,但表达和沟通能力以及对于 AGI 的大方向的把握很有独到之处。“这个评价更接近投资人访谈的真实价值——不在于技术判断的精确性,而在于对行业方向的感知和对人才网络的覆盖。
十年人才迁徙:两代 AI 四小龙
视频标题中的"十年人才迁徙"是理解整期内容的钥匙。上一代"AI 四小龙"的兴衰在前文已经讲过,这里把重心放在"人"的流动上。
上一代的遗产没有贬值
四小龙的八到十年并没有白费。在这些公司、创新工场 AI 工程院、微软亚洲研究院(MSRA)等机构之间,流动着大批 AI 研究者和工程师。弹幕在 40:13 位置提到 MSRA,说明这家机构在人才网络中的枢纽地位得到了广泛认可——MSRA 是微软 1998 年在北京设立的研究院,二十多年间培养了大量后来成为中国 AI 行业中坚力量的研究者。
这些人积累了三样东西:从 0 到 1 做 AI 产品的经验、对技术商业化陷阱的切身体会、对 AI 能力边界的直觉判断。这些经验在大模型时代直接适用,因为大模型也正在经历从技术突破到产品化再到商业化的完整周期。它们的价值有多大,取决于你怎么看 AI 创业的核心壁垒。如果壁垒是算力和数据这类硬资源,人才迁移的价值就有限——人换了公司,但没有换走算力和数据;如果壁垒是对 AI 能力边界的理解、对产品化路径的经验、对团队协作的磨合,那么这十年的积累确实构成了基础设施。在算力受限的语境下,经验丰富的人能更高效地调度有限资源,这些隐形能力往往比一台机器更难得。
第二代:大模型新格局
大模型时代到来后,新一代头部公司的轮廓逐渐清晰。弹幕(获赞 18)给出的版本是:Kimi(月之暗面)、DeepSeek、GLM(智谱 AI)、Qwen(阿里通义千问)。Minimax 被评价为"可以坐小孩那桌了”——这个残酷但直白的判断,反映了用户层面对第二代 AI 公司的分化已经有了清晰认知。
这四家公司代表不同的技术路线和组织形态:月之暗面是创业公司,以长文本处理起家,逐渐扩展到通用大模型;DeepSeek 以极致工程效率著称,用相对较少的算力做出令人惊讶的模型;智谱 AI(GLM)源自清华大学,有深厚学术积累;Qwen 是阿里云的产品,代表大厂内部的 AI 努力。
弹幕(获赞 20)的概括虽然粗糙但有直觉:“清华出了 Kimi + 智谱 AI,北大跟了王虹 + 邓煜。“这反映了高校体系在中国 AI 格局中的核心地位——清华和北大的 AI 研究,在相当程度上决定了中国大模型领域的人才供给。
人才的汇合
视频的核心论点可以浓缩为一句话:上一代公司的起伏没有让积累消失,它们正在大模型时代重新汇合。技术壁垒不全是技术性的——技术可以通过论文学习、通过开源代码复现,但有一类壁垒是隐性的:对技术商业化节奏的把控、对团队能力边界的判断、对什么时候该坚持什么时候该转向的直觉。这些隐性知识只能通过亲身经历获得,而上一代 AI 公司恰好提供了一个大规模的"亲身经历"训练场。
弹幕(26:53)的一条评论值得注意:“果然场内和场外的人感受是不一样的。“这暗示视频中也讨论了"局中人"和"局外人"对同一个行业机会的判断差异:身处上一代 AI 公司内部的人,对大模型时代的到来可能有更敏锐的感知——他们经历过 AI 技术从实验室到产品的完整周期,知道什么样的技术突破值得 all in。
算力差距下的中国 AI 牌面
视频直接讨论了算力差距下的中国 AI 出路。这个问题绕不开,因为它决定了前面聊的人才、投资和技术路线能走多远。
硬约束:H20 vs H100
美国对中国的芯片出口管制始于 2022 年 10 月,经过多次升级后,英伟达面向中国市场能出口的最高端 GPU 是 H20。H20 的算力约为 H100 的 15%-20%(具体取决于计算精度和工作负载类型),这意味着在相同预算下,中国 AI 公司能获得的计算能力远低于美国同行。K3 技术报告把 SWE-Marathon 的评测环境从 H100 重新校准到 H20,就是这种差距落在具体产品上的一个注脚。
数据质量的结构性差距
弹幕(56:21)提到"英语高质量开放内容像 wiki 比中文多很多”,指向一个长期存在的结构性问题:中文互联网的高质量开放内容确实少于英文。Wikipedia 的英文条目数远超中文,arXiv 上的英文论文占绝对多数,Stack Overflow 和 GitHub 的技术讨论也以英文为主。这意味着以中文为主要训练语料的模型,在某些知识密集型任务上可能天然处于劣势。
有弹幕(56:08)尖锐地反问:“就是找不到原因,把锅推到了数据上,总不能说自己能力不行吧?“这个反驳有道理——把性能差距完全归因于数据质量,是偷懒的解释。但数据质量差距客观存在,它和算力差距构成中国 AI 公司面对的两个独立维度的挑战。弹幕(55:57)也提出一个关键疑问:“这个质量是指的什么?"——数据质量的准确定义本身就是模糊的:是准确性、多样性、时效性,还是标注质量?不同维度的差距,需要不同的应对策略。
架构创新作为第三条路
除了算力和数据,还有第三条路径:架构和算法创新。K3 的 KDA 机制是典型案例,配合 Stable LatentMoE 实现了约 2.5 倍的整体扩展效率提升——这笔账靠的是更好的算法设计,而不是更强的硬件。
弹幕(59:28)也强调工程能力:“能去引导模型的软件工程是极为重要的,重要性不亚于模型本身。“在算力受限的条件下,高质量的工程能力——训练框架优化、数据管线设计、推理效率提升——可以放大每块 GPU 的产出。MXFP4 量化感知训练也是这类工程创新的一部分:通过从 SFT 阶段就引入量化,K3 部署时的显存占用和推理成本大幅降低,让更多开发者不需要顶级数据中心资源也能实际部署一个 2.8T 参数的模型。
开源策略
K3 选择完全开源权重,是一张明确的竞争牌。全球首个开源 3T 级别模型,意味着任何研究者都可以下载、分析、复现和改进,把月之暗面放到全球 AI 开源讨论的中心位置。弹幕中关于开源的讨论也很活跃。“K3 全量版本没开源吧?“这条弹幕(00:28)指出了一个需要澄清的技术细节——K3 确实开源了完整权重(在 Kimi K3 License 下),但训练代码和部分工具链并未完全开源。这是商业开源的常见做法,需要在开放度和商业保护之间取得平衡。
AGI 信仰与"一等公民”
视频结尾(约 68-70 分钟)转向一个更本质的讨论。弹幕密度在这个段落急剧上升,说明触动了观众的真实焦虑。
代码能力等于未来的识字能力吗
讨论的核心命题是:在 AI 时代,编程能力是否等同于工业时代的识字能力——一种基础的通用读写能力?
弹幕记录了两种对立的观点。“代码能力就是识字一样的未来的基础能力”(68:48)——这个类比的力量在于:不识字的人在工业时代无法充分使用报纸、合同、说明书等基础设施,那么不懂代码的人在 AI 时代是否也无法充分发挥模型的能力?
“这个壁垒可以逐步降低,但无法消失”(68:48)——这是一个更温和的判断。工具会变得更易用(就像语音交互正在降低编程门槛),但"会用"和"用好"之间的差距不会消失。
“不会啊,不识字的人现在可以用语音交互了”(69:24)——这是对前一种观点的直接反驳。AI 自然语言界面正在扮演类似"语音朗读"的角色,让不编程的人也能使用复杂工具。
真正的张力
弹幕(69:04)的总结点中了核心:“所谓二等公民是如何拉进距离。“问题不在谁能用上 AI,而在谁能在 AI 时代真正发挥模型的全部能力。
一个有十年工程经验的人使用 AI 编程助手,和一个没有技术背景的人用同一个工具,两者的产出差距不是在缩小,而是在扩大。模型越强,这种差距越明显——就像一本书越深奥,识字的人和识字多的人之间的理解落差就越大。
弹幕(69:10)的例子很生动:“像我这种十几年的飞机设计师就是 AI 的一等公民。哈哈。"——有专业领域深度的人,能更好地判断 AI 输出的质量,更准确地引导模型的方向。专业知识加上 AI 工具,产生的价值远大于单独的任何一项。
但弹幕(69:48)也提出一个挑战:“但是模型的能力只支持得了所有人是一等公民吗?"——如果模型的推理能力和知识广度足够强,是否可能让每个人都成为"一等公民”?还是一等公民的存在必然以二等公民为前提?这个问题在 AGI 讨论中具有根本意义。
AGI 与竞争的重新定义
这个视角把公司间竞争重新定义成技术路线的探索(43:26)。在追求 AGI 的共同目标下,Kimi、DeepSeek、Claude、GPT 各自代表不同的路径假设。对算力受限的中国公司来说,更靠架构创新、开源生态和工程效率的路线,可能演化出与硅谷不同的 AGI 路径。如果通往 AGI 的路不止一条,算力差距反而会逼出更高效的算法。
观众的真实判断
以下几条高赞评论构成了一种集体画像:
- 对制作质量的认可(获赞 113):“up 到底什么背景,视频出的也快,时间还长质量也高。up 还全球到处飞,B 站能有几个 up 主这样的。”
- 对嘉宾深度的质疑(获赞 28):“只能当八卦听,判断和结论基本没法听。”
- 对投资逻辑的追问(获赞 75):“这个投资人被骂过,Kimi 之前不搞技术疯狂投流就是她整的。”
- 对提问风格的认可(获赞 59):“24 年那轮为什么没有跟,还是喜欢这种略带一些尖锐的提问。”
- 对行业格局的判断(获赞 18):“现在国内四巨头应该是 Kimi、DeepSeek、GLM 还有 Qwen。”
- 对表达方式的评价(获赞 14):“语速快,信息多,主持人几乎没说几句,抛出一个线头就开始竹筒倒豆子……英文夹得太多了,有些真没必要。”
谁该看这期视频
适合看原视频的人:对中国 AI 创投生态有直接利益关系的从业者;想了解美团龙珠投资决策过程的投资人;关注中国 AI 人才流动趋势的研究者;对 Kimi K3 发布后的行业讨论感兴趣的读者。
读本文就够的人:只想了解 K3 技术参数的读者(直接看规格表和 benchmark 对比);对投资八卦感兴趣但不想花 70 分钟的人;想快速了解新一代"AI 四小龙"格局的读者。
Takeaway
K3 是全球首个开源 3T 级别模型,在 H20 降配 GPU 上达到了与 Claude Fable 5、GPT-5.6 Sol 正面竞争的水平。 SWE-Marathon 42.0 分领先 Claude Fable 5 七个百分点;KDA + Stable LatentMoE 带来约 2.5 倍扩展效率提升,MXFP4 量化感知训练降低部署门槛。算法创新可以在一定程度上弥补硬件差距。
A1 轮投资的逻辑是"押人才脉络"而非"押产品”。 月之暗面投资时没有产品,美团龙珠押的是杨植麟(Transformer-XL 核心作者)、唐杰(清华教授)、创新工场 AI 工程院所代表的人才网络。但 2024 年没有继续跟投,说明这条脉络的判断并非一直坚定;“深思熟虑"和"运气成分"的比例,可能永远无法精确拆解。
两代 AI 四小龙之间存在真实的传承关系。 上一代(商汤/旷视/依图/云从)培养的人才和经验,在 Kimi、DeepSeek、GLM、Qwen 等新公司中重新聚合,清华体系和 MSRA 是两个关键人才枢纽。新一代用户层面的共识已经形成:Kimi、DeepSeek、GLM、Qwen 是当前中国 AI 的第一梯队。
算力差距是硬约束但不是死局。 H20 替代 H100、中文高质量开放数据少于英文、开源策略作为竞争手段——中国 AI 公司在硬件受限条件下找到了多条路径。KDA 的约 2.5 倍效率提升和 MXFP4 量化训练是两条最具体的补偿机制;开源 3T 模型的策略本身就是一种竞争手段——把前沿能力开放,换取全球开发者生态的关注和反馈。
“一等公民"问题没有标准答案,但有一个确定的方向:模型越强,使用者的能力差距就越明显。 十年飞机设计师和零技术背景的人使用同一个 AI 工具,产出差距会随模型能力提升而扩大而非缩小。代码能力是否等同于 AI 时代的"识字能力”,取决于对工具终局的判断;但"会用"和"用好"之间的鸿沟,不会因为界面变得更友好而消失。
参与讨论
使用 GitHub 登录。欢迎补充事实、异议与实践。
讨论暂时无法加载。