跳到正文

目录

AI 最前沿的人,已经不聊模型了:李继刚 × 归藏 × 橘子 93 分钟对谈精读(视频精读)

素材与边界:本文基于该视频的 YouTube 自动字幕整理。字幕链路是「中文语音 → 英文语音识别 → 机翻回中文」,属于二次转写,无法逐字引用原话——文中凡涉及讲者观点,均为大意转述,不使用直接引语;个别语句标注「转写大意」提醒读者措辞可能与原话有出入。视频本身没有章节,本文的分节与全部时间点由作者按内容逻辑标注。补充事实来自 ColaOS 官方页面、Anthropic 水印相关报道、微信小微灰度测试报道等公开来源,文末附清单。

维度数据
频道易论AI
标题AI最前沿的人,已经不聊模型了
发布2026-09-01
时长92 分 59 秒
嘉宾李继刚(提示词工程)、归藏(AI 领域独立观察者)、橘子(ColaOS 创始人)
观看1.8 万+(截至 2026-09-06)
链接YouTube

「一句话总览」:这场对话的标题没有夸张——三个每天和 Agent 一起工作的人,93 分钟里没有评价过任何一个模型的参数、跑分或发布节奏。他们聊的全是模型之外的东西:交付的差距、Skill 的经济学、入口的路线之争、上下文的保养,以及一张还没成形的新网络。

阅读目标:读完本文,你应能——

  • 说清「模型能力与业务之间的差距」这条主线,以及弥合它的三条路径(前 5% 用户的自动化、培训、FDE)各自的适用场景;
  • 复述「卖 Skill 给个人用户是伪生意」的两条论据,以及 Skill 对 Agent 产品的真实价值;
  • 区分 Agent+X 与 X+Agent 两条路线,并举出各自的代表产品与束缚;
  • 掌握一套上下文管理方法(索引、边界、项目区与认知区分离),以及「上下文过载」的代价;
  • 判断自己该不该花 93 分钟去看原片。

一、开场之问:过去半年,你更新了什么认知

对话从主持人抛出的一个问题开始:过去六个月,有没有哪个认知被更新了?(01:21)

第一位作答的讲者给出了整场对话的第一条主线:以前大家比产品功能,列对比表,现在他的感受变了——功能本身不重要,决定企业最终结果的不是产品,是服务(01:29)。同一个 Agent 产品,交给不同的人,产出差异大到像是两个东西;这个差距,就是模型能力与你实际业务之间的那道缝。填这道缝的活儿,就是 FDE(Forward Deployed Engineer,前沿部署工程师)在做的事。他进一步收了一句(转写大意):应该是服务驱动能力,而不是能力驱动服务。

这个判断有一层容易被忽略的含义:它把「AI 落地难」从技术问题重新定义成了交付问题。给一家全员采购了账号的公司交付产品,并不自动等于好结果——这和买飞书、企微不一样,飞书装完就能聊天,Agent 装完,用得好不好取决于每个人。产品公司如果还停留在「交付即结束」的思路里,这道缝就会一直存在(02:32)。

话题随即转到国内大厂(03:59)。讲者的批评是:国内厂商习惯把运营和用户教育当成砸钱推广能解决的问题,但国外软件厂商的做法是「边建边教」——在交付产品的同时交付使用方法和实践。你不能指望花钱请来的推广方替你建生态、建服务、建内容,这些得先自己建好,然后才轮到别人帮你放大(05:15)。

成本被点名为另一道坎(05:43)。讲者以国内某大厂 AI 助手为例(转写无法确认具体产品名):靠充足的免费额度,让用户从完全不懂到「似懂非懂」几乎零成本,等用户基数上来,超级用户自然会涌现,生态随之改善。这被总结为一条用户教育的现实路径——先找到一个所有人都能复现的真实场景,把最佳实践压缩成一句话就能触发的东西。他举的例子是自动领外卖优惠券:需求巨大,每天用得上,用户念一遍「咒语」就拿到结果(07:01)。听起来不高级,但教育用户这件事,从来是从土办法开始的。

二、FDE 的真伪,与三条路径

围绕 FDE 有一段很有价值的辨析(09:01)。对话转述了另一位从业者的观察:不少国内公司把旧的外包服务重新包装成 FDE,本质还是把脏活外包出去。对此的回应是:很多人把概念当筐,什么沾边的都往里装。判别标准很清楚:Agent 产品进了你的工作流,不同人用出天差地别的结果,帮你把这个差距抹平的角色才是 FDE;而「带一个团队进来,替你开发一个你做不出来的功能,然后走人」,团队一走,员工用系统的水平参差不齐,差距原样还在——那是外包,不是 FDE(10:00)。

接着对话把弥合差距的手段收拢成三条路径(11:26):其一,指望不上全员,就让用得最好的前 5% 用户把自动化沉淀下来给其余人用;其二,培训,无法训练所有人但聊胜于无;其三,FDE,没时间培训、也没内生化能力时,买一项进场提炼最佳实践的服务。三条路径解决的是同一个问题,差别只在谁出力、出多少力。

Palantir 被当作 FDE 模式的标尺(12:38):先做企业内部培训(讲者转述其培训转化率约 75%),再派驻前向部署工程师,其中一部分人甚至持有客户公司股份;考核标准不是销售额,而是能否「成功退出」——人走了以后,客户还能不能用他们留下的框架继续运转。毛利率高、收入多为经常性。零一万物(01.AI)被提到正在走类似的路:放弃通用大模型的执念,转向 B2B 垂直服务,选的客户行业相当出人意料——家禽业。

为什么是家禽业?这里出现了整场对话最反直觉的判断之一(14:43):越传统的行业,AI 越容易出成果。理由是链条短、反馈快、飞轮容易转起来;反而是内容、影视这类看起来最该被生成式 AI 改造的行业,内部流程复杂,AI 的渗透反而不如预期。「越传统,越容易见效,也越容易让客户为价值付费」(转写大意)。

三、卖 Skill 给个人,为什么是伪生意

这段的发言者是全场最接近 Skill 生意的人。Skill 指 Anthropic 的 Agent Skills 机制——把一套工作方法连同说明文件打包,让 Claude 按需加载执行;橘子创办的 ColaOS 团队在 GitHub 上开源过配套 Claude Code 的 Skills 组件,主持人也把「怎么赚钱」的问题直接抛给了他。他的答案:向 2C 用户卖 Skill,账算不平(21:03)。两条论据:其一,使用 Skill 本身消耗 token,一旦收费,用户连试用的门槛都过不去,传播速度归零;其二,Skill 的架构没有保密性——下载即开源,你无法靠它建立排他。这跟传统软件卖授权的逻辑完全相反。

那 Skill 的价值在哪?讲者给了一个产品视角的答案(21:57):Skill 是让用户快速感知 Agent 能力的载体。用户用一条高质量 Skill 出了成果,他归因的对象是你的 Agent 产品本身,而不是那条 Skill——普通用户分不清、也不在乎这层分离。所以对平台来说,正确动作是吸引顶级创作者做 Skill 市场,把优质 Skill 推到台前,替产品完成能力演示。

随后是一段学习成本的现实观察(23:25):有人昨天用了一条功能强大的 Skill,因为要求他完成的步骤越来越繁琐,最终放弃了。讲者补了一刀(转写大意):Skill 本质上是一段没有界面的软件。没有人真的需要那么多 Skill,关键是清楚自己需要什么——「我只要一份 PPT」听起来简单,真实需求往往复杂得多。

另一个嘉宾的观点把话题推向更深处(24:05):别人的 Skill 再厉害,也进不了你的工作流。Skill 更像一个模板,让你看到这个东西能做什么;真正要用进自己的工作里,必须按自己的场景改造。这和上文的 FDE 讨论形成了呼应——个人工作流里的「最后一公里」,同样需要一次本地化的服务,只不过提供者是你自己。

商业模式上,讲者提到 Skill 的变现更接近开源软件的路子:授权加赞助,可以并行(24:34)。

四、Agent+X 还是 X+Agent:入口的路线之争

这是整场对话结构最完整的一段辩论(35:42)。问题的起点是社区里的一句口号「Agent + LLM > LLM」,讲者把它翻译成了一个架构选择:以 Agent 为中心把功能打包进来(Agent+X),还是在既有软件里嵌入 Agent(X+Agent)

Agent+X 的形态:对话发生在 Agent 里,接上飞书就直接在 Agent 里发消息、定截止时间,不用打开那个软件;要 Word 文档就说一声,文档生成出来,全程不碰 Office(36:00)。X+Agent 的形态:Office 里弹出右侧对话框,做图表时顺手聊两句(36:51)——微信的「小微」被点名为典型代表,这与其 2026 年 6 月开始的灰度测试形态一致:在微信主界面右滑调出 AI 窗口,调用小程序生态完成任务(37:30)。

讲者的态度是明确站边的(42:16):X+Agent 是在现有架构上嫁接 AI,嫁接物与原有体系格格不入;Agent-native 让 Agent 做入口,一旦习惯了「说要一份 PPT」的交互,就回不去「打开软件再排版」的操作了。

但对话没有回避 Agent+X 路线的四重束缚(38:35):存量应用改不动,小程序这类形态要背着历史包袱进化;用户没准备好;推理成本压垮免费模式——以前的互联网产品靠广告补贴服务器成本,现在每一次调用都有 token 账单,无缝集成免费提供变得算不过来账;旧组织结构支撑不了新范式所需的 AI 能力密度。

中间插着一个值得单独记住的思想实验(39:55):三五年后,当模型的意图理解足够好,手机为什么还需要解锁和一个个 App?一块能对话的屏幕,调用各种 API 和技能,任务就完成了。但讲者随即自己戳破了浪漫化想象——人的记忆力跟不上。今天让 Agent 订了票,明天就忘了;Obsidian 里几千条笔记,必须亲眼看到才想得起来。所以对话的结论是:聊天可以完成一切,但你仍然需要一块能看见的「仓库」——仪表盘、目录、动态生成的界面(41:30)。纯对话入口不会消灭 UI,只是 UI 从静态变成了按需生成的。

五、上下文的保养:三个病例与一辆汽车

如果只能从这场对话里带走一个可操作的主题,我会选上下文管理。这段从三个医疗案例开始(1:09:25):

  • 一位用户患病十年、看过至少十位医生,从未有人完整听完他的陈述;他把十三年的感受和经历讲给 Claude,模型推断出可能的疾病并推荐了特定药物,拿去给医生确认属实,服药后痊愈,体重恢复了五到十磅;
  • 一位讲者长期头昏、失眠、跑步想吐,因母亲有甲减而先入为主;日常聊天的 AI 根据症状描述建议查铁指标,检出值已在缺铁性贫血临界,补铁后好转;
  • 对话中还有讲者提到,自己的女友患慢性病,医生一律开激素类药调节;AI 在掌握「体重正常」这个前提后提出可能是胰岛素抵抗,胰岛素释放试验显示其餐后胰岛素水平高达常人五到八倍——空腹血糖一直正常,所以历年体检从未发现。

三个案例指向同一种能力结构:上下文理解 + 专业推理。医生只有十到二十分钟,AI 记得你一整年的日常;这正是访谈中反复出现的判断——医疗的瓶颈很多时候不在诊断智能,而在倾听的容量。

然后是阴暗面。一位讲者发现(1:14:34):往 AI 里灌了太多过去的上下文之后,即使明确指示它做新的东西,它仍会把人拉回以前的平均水平。这个观察引出了整场对话传播最广的那句比喻(转写大意):上下文环境像一辆需要保养的汽车,而不是一栋永久的房子。你不能指望产品替你整理背景信息,尤其在你的工作内容不断扩展的时候。

保养的方法论也随之展开(1:15:19):建立索引,不让它读不该读的内容;每次会话先给边界和约束,明确本次讨论的背景与历史;按项目隔离上下文——项目信息放在项目区(客观),认知放在认知区(主观),逐层提取,互不污染。概括成一句:提供更多背景并不一定更好,顶层设计要指定「什么时候不读」。

上下文还带来一个商业层面的推论(1:17:20):在一个 Agent 里持续积累上下文后,换用新 Agent 会极其难受——功能一样不少,但「功能太多,上下文不够」。所以讲者选择不断迭代自己的 Agent,而不是追新。这实际上预言了一种新的转换成本:迁移成本从数据变成了上下文

最后是回音室的警告(1:21:14)。最荒诞的案例出自讲者见闻:有人宣称他的 Agent 开发出了一套解决模型幻觉的新框架——讲者的评价是,这个结论本身就是一次巨大的幻觉:人和自己的 Agent 互相吹捧,封闭成环。破茧的办法有两条朴素得不像 AI 时代的建议:把做的事发到网上,没多少人看就是泡沫的信号;去读 AI 之外的书,消费 AI 之外的信息(1:22:02)。

六、下一张网络:一半节点不是人

对话后半段最富想象力的部分,是关于社交网络的重构(43:25)。微信的壁垒从来是关系链;如果每个人拥有一个积累了自己全部上下文的智能体,对话的类型就从「人与人」扩展出「人与 AI」「AI 与 AI」。讲者描了一个场景:我对自己的 AI 说一句「提醒橘子明天下午聊事情」,我的 AI 与他的 AI 协调出时间并发出邀请——这件事已经在最初那张人与人的网络之外了。下一张社交网络,一半节点不是人

现实则骨感得多。尝试过让两个 Claude 互相对话的产品,用户觉得太抽象,学不会(45:28);人们对自己 AI 生成的文本接受度高,对别人 AI 生成的文本接受度很低,中间需要一层「AI 翻译」替你提炼要点(46:27)。讲者把这个现象接到一个更大的判断上(46:53,转写大意):归根结底,人们还是更喜欢人话——大家觉得 GPT-4.6 好,是因为它说话像人;后来的版本越来越不像,评价就掉下去了。

这段还嵌着 2026 年 8 月的一桩现实争议:Anthropic 自 8 月 2 日起在 Claude 新模型输出中嵌入隐形水印(token 选择层的统计偏置,为满足欧盟 AI 法案透明度要求)。官方口径是水印不改变输出质量,而对话中提到(47:14,转写大意):一位相关人员发文演示水印「不会改变你的文案」,结果网友比对发现加水印前后的文本差异遍布全文——「你的意思是没改变?每个字都变了」。在法律、合同这类严肃场景,增删一个词,整份文件的性质都会变。水印事件在对话中被当成一个论据:语言的排列背后是心理模型,「措辞无关紧要」这个前提本身就不成立

顺着「未来的网络长什么样」,对话扫过几个更远的点:AI 灵魂伴侣平台的两个前提(掌握你全部上下文、存在跨平台发现网络),前者在随模型和记忆架构进步,后者远未成形(1:01:00);匹配式相亲在讲者看来弄反了因果——人与人是先相遇、再长出彼此的了解,而不是先比对爱好相似度(1:02:10);但他仍然押注:一旦人人都有上下文充足的 Agent,连接问题总会有人解决,新网络会自然涌现(1:02:52)。

七、现实的摩擦力:为什么 AI 编程一枝独秀

对话中段的一段「泄气」陈述,信息量反而最大(15:16)。一位以内容起家的讲者谈到自己一年的转变:去年做内容,今年用内容推动产品;产品不赚钱,但能落地的事情明显变多了。真正让他磕碰的不是技术:和平台方合作的产品从想法到上线花了两个月;把一笔钱转进对公账户,因为对方是新公司、新流程,又花了两个月;一份合同签了八遍、盖了八次章,一百二十页里没有一页是对的(18:24);开票一天、财务一天、签约一天——生产力工具解决了 A,而 B 到 Z 还长着旧世界的样子。

由此引出一个尖锐的解释(18:57,转写大意):AI 编程之所以突飞猛进,一半原因是编程这件事不依赖分销、支付、政企关系这些外部环节——代码写完,产品即成品。作为对照,海外 SaaS 生态把财务、收款、会计后端自动化到了极致(Stripe、Mercury 被点名),可一旦离开那层生态,摩擦力就回来了。大公司采购入驻流程拖半年、等流程走完项目已经不在了的案例,也在这段(25:16)。

同一段落里还有对软件业的一记重判断(27:30,转写大意):软件行业已经死了——SaaS 的本质本来就不是软件而是服务,AI 不过是把这层窗户纸捅破:AI 是用 token 计价的服务,不是装完即用的软件。手机上的 App 会越来越少,App Store 生态不再繁荣。

一个容易被略过但很关键的中间观点:基础设施没有为这个时代做好准备(28:50)。互联网 2.0 的高度封闭平台「可以让你发内容,但不让你发产品」;大量被 AI 解放出来的生产力(抖音上的编程爱好者)做出来的东西没有地方发布——讲者提到那个著名的笑话:有人把自己做的网页分享给朋友,发出去的链接是 127.0.0.1——本机地址,别人根本打不开。GitHub 是例外,被讲者称为「建立在人与人协作机制上的平台」;但 AI 一次提交三万到五万行、一次改三十个文件,人类无法 review,讲者判断代码协作平台会出现基于 AI 提交的新范式(30:04)。而 Git 本身获得了新生命(32:00):Agent 与 Agent 之间没有天然的沟通方式,Git 的 issue 和 PR 成了它们之间的通用语——协议成熟、无需上下文、所有模型都能理解。有讲者的项目已经是用户反馈进 GitHub issue、AI Agent 监控、修复、发布、推送的全自动流水线(32:45)。

八、价格分化与红皇后:模型层最后的热闹

尽管标题说「不聊模型」,对话末段还是回到了模型层——用一种生意人的方式(1:22:23)。

一位讲者讲了场赌局:半年前与朋友赌模型价格涨跌,他赌前沿模型必然越来越贵(GPU 稀缺),结果价格一路狂降,输了 100 美元;前不久某主流模型 API 一夜涨了十来倍(转写无法确认具体型号;同期行业背景是 2026 年大模型集体结束低价时代,豆包等推出付费订阅),朋友又把 100 美元还了回来。他的结论:这个行业有周期,别用单边行情外推未来。

更结构性的判断是两条产品线(1:24:42):开源及主流模型的价格持续指数级下降,能满足约 90% 的需求(讲者以 Llama 为例,称其免费导致依赖官方 API 定价的中间站无利可图、大量消失);前沿智能模型的定价持续走高。跑分差五到十分,价格差五十到一百倍——看评测觉得是智商税,真用起来又觉得值。讲者举的例子(转写大意):同一篇文稿、同一个提示词,便宜模型与 GPT-4.6 之间的产出差距是「天壤之别」。

倒数第二个大判断关于竞争结构(1:28:02):如果推理引擎与模型解耦——引擎固定、模型 API 随便换——模型厂商就陷入「红皇后效应」:必须拼命奔跑才能留在原地,因为用户转换成本为零,昨天三千万用户、今天归零只在一次性价比反转之间。所以理性的模型厂商会把推理引擎与模型联合训练,让你离开它的引擎就掉性能,以此锁定用户。与之配套的观察是 DeepSeek 的缓存命中(1:29:30):对话场景 96%、其自研推理引擎内 100% 的命中率(转写数字,讲者称之为「黑魔法」)——缓存命中与否的价差可达十到一百倍。讲者同时留了一个存疑观点:把缓存与模型优化推到极致以压成本,可能正是某家模型输出质量变得平庸的原因(1:30:13)——这是个人推断,原文未提供证据。

收尾的两句话值得原样复述(转写大意):其一,你围绕模型构建的一切,都必须与大模型的演进同向,否则就是给自己埋雷(1:30:29);其二,未来每种产品的差异化会越来越大,走向哪里取决于每个产品创作者的审美——你验证过再好的方法,讲给一百个人,也只有十个会听,最终每个人和自己的 Agent 长成不同的样子(1:32:25)。

九、两个世界:对话里最冷静的一段

对话中段有一次清醒的停顿(51:07)。讲者们意识到:他们这个圈子聊 Agent、效率、生产力,而另一个世界里的大多数人根本没有用 AI 工作的需求——工作太简单,或者干脆不需要工作。两个世界互相假装对方不存在,「你只能看到你能看到的东西」。

大众那一侧正在发生什么?讲者称 AI 短剧的渗透人数已达八亿量级(52:33,转写数字,未找到权威口径,仅录讲者说法),外加一段坦诚的亲身体验:一位讲者刷到一部短剧,一集一集停不下来,同时「大脑分裂成两半」,一半在点下一集,一半在旁观自己被剧情机制牵引(52:56)。他对短剧的判断是生产侧的:剧情仍像小学生写的,但「每一集给人满足感、可以日更、还能维持复杂长篇结构」的生产效率已经封顶——世界观仍由人类构建,产能已是最强(54:01)。60 分内容大量涌现之后,80 分、90 分内容会跟着涌现。

这段还有一个好用的思维框架(58:08):三个世界叠加——原子的物理世界、比特的互联网世界、token 的模型世界。AI 的技术借助互联网世界落地(短剧、小说),又在和物理世界融合(无人机送救援物资、AlphaFold 与制药)。讲者提到美国临床医生在播客里的预判:随着基因编辑与蛋白质设计技术的积累,未来三到五年可能出现一批疾病治愈或延缓的集中兑现(59:27,讲者转述,时间表无法核验);连实验鼠都因为 AI 实验室变多而涨价了。

十、谁该去看原视频

  • 该看:在做 Agent 产品、AI 服务化生意或企业 AI 转型的从业者——FDE 三条路径、Palantir 的「成功退出」考核、Skill 市场的价值归因,都是能直接拿去对照自己业务的镜子;每天重度使用 AI 的个人——上下文保养方法论(索引、边界、项目区/认知区分离)值得听原始语境的展开。
  • 读本文就够:只想知道「Skill 能不能卖」「Agent 入口之争谁会赢」「上下文该不该无限喂」这三个问题答案的读者;对闲聊节奏敏感的读者——原片是茶馆式对谈,信息密度不均匀,时间戳索引在下面。
  • 不必看:想听模型评测、跑分对比、发布节奏的读者——正如标题所说,这场对话几乎不聊这些。

附:关键论点时间点索引

时间点论点
01:29功能不重要,服务才重要;差距由 FDE 填补
05:43成本是关键障碍;免费额度换用户成长
07:01外卖优惠券:一句话触发的最佳实践教育
09:01真 FDE vs 外包:走后差距是否还在
11:26弥合差距的三条路径:5% 用户 / 培训 / FDE
12:38Palantir 模式:培训转化、驻场持股、以退出为成功标准
14:43越传统的行业,AI 越容易出成果(家禽业案例)
18:24八份合同、八次盖章、一百二十页全错:现实摩擦
18:57AI 编程快的隐因:不依赖分销与支付
21:03卖 Skill 给个人的两条死结:token 成本、下载即开源
23:25Skill 是没有界面的软件;没人需要那么多
24:05别人的 Skill 进不了你的工作流
27:30软件已死:AI 是按 token 计价的服务
28:50平台可发内容不可发产品;127.0.0.1 笑话
32:00Git 是 Agent 之间的通用语
35:42Agent+X vs X+Agent 路线之争
37:30微信小微:X+Agent 的代表
39:55手机思想实验:一块屏与对话;人的记忆跟不上
43:25下一张社交网络,一半节点不是人
47:14Claude 水印争议:每个字都变了
48:18《她》式助手 vs「更好的锤子」;智能真的出现了
52:33AI 短剧渗透率八亿量级(讲者说法)
52:56短剧亲测:大脑分裂成两半的体验
58:08原子、比特、token 三世界叠加
1:09:25医疗三案例:上下文理解 + 专业推理
1:14:34上下文过载:被拉回以前的平均水平
1:15:19上下文保养方法论:索引、边界、项目区/认知区
1:21:14「解决幻觉的框架」本身就是幻觉:回音室警告
1:22:55价格赌局:100 美元输而复得
1:24:42两条产品线:主流指数降价,前沿持续走高
1:28:02红皇后效应:解耦即零转换成本
1:29:30DeepSeek 缓存黑魔法:96% / 100% 命中率
1:32:25产品差异化走向创作者的审美

参考资料

参与讨论

使用 GitHub 登录。欢迎补充事实、异议与实践。