跳到正文

目录

把 Claude Code 变成电影工作室:Machina 的六阶段 AI 短片生产线

来源:X @EXM7777(Machina),原帖链接,发布时间 2026-07-28

一、这篇文章真正在讲什么

Machina 用一句话概括他做出来的东西:把 Claude Code 改造成一个能运转的电影工作室,并把整套系统——skills、prompts、loops、六阶段管线——毫无保留地公开。

六阶段不是抽象口号,而是有具体技术栈对应:

阶段主体工具
1. 萃取风格契约人 + 视觉模型Gemini 3.1 Pro
2. 批量出帧人 + 多扩散模型Higgsfield 多模型 + Nano Banana + Soul Cinema + GPT-Images-2
3. 写分镜AgentFable 5 Medium
4. 动起来Agent + 视频模型Seedance 2.0(图生视频)
5. 并行舰队Claude Code 子代理Higgsfield CLI
6. 剪辑 + 配乐 + 升频人 + Agent + ffmpegffmpeg + 升频器

如果把这六步压成一张工作流地图:

这张图最关键的地方不在“六步很多”,而在每一步都留下了可复用工件:风格契约、角色参考表、镜头模板、生成日志、剪辑清单。Machina 真正公开的,不是某条神奇 prompt,而是这些工件之间怎样接力。

“harness(驾驭框架)”不同部分承担不同任务:skills 管模型选型,subagents 管吞吐,bash 管剪辑,工程化的 loops 管所有需要重复的事。文章结尾那句话值得抄一遍:

cheap generation didn’t make good video easy… it moved the entire job into taste

便宜生成没让做好视频变容易——它把整份工作挪进了品味。这句话定义了接下来所有技术选择的方向。


二、为什么循环本身就是产品

专业镜头过去是一场赌博:每试一次都烧真钱、占真档期,所以没人敢实验,所有东西长得都一样。

AI 视频把这个循环压扁了:描述一个镜头,几分钟生成,看了之后改三个词,重新生成。试错成本降到了足够低,什么都试一遍反而成了策略。

但压扁的循环只有在你放手让 Agent 替你跑的时候才划算。一个 20 镜头的片子,每个镜头试 50 轮,就是 1000 次决策——人按 1000 次“重新生成”按钮,累到不想看,片子还是一团糊。

所以这套系统把工作切成两半:

  • 人负责品味:哪个镜头感觉对、哪条活下来、这部电影到底想是什么
  • Agent 负责吞吐:写提示词、提交生成、轮询任务、重试失败、组装剪辑

Machina 给这个新技能取了个名字:loop engineering(循环工程)。它不是写脚本,不是写批处理,而是把“要 Agent 重复跑到满足条件为止的任务”当成一个工程对象来设计。

这个片子用了三层嵌套循环:

层级循环内容退出条件
镜头循环生成 → 看 → 改一个变量 → 重生成镜头赢得自己的位置
舰队循环走完镜头清单,空闲槽就提交,收集赢家全部镜头交付
会话循环记录每一次生成下一部片子的起点

三层循环的退出条件都能写成可检查的谓词:镜头循环问“这一镜有没有凑够一条过线的候选”,舰队循环问“镜头清单还剩几个待交付的空位”,会话循环问“这一夜沉淀出的日志能不能当下一部的起点”。退出条件一旦可检查,Agent 该停该走就落在状态判断上,碰运气不再是方案。

如果借 Anthropic 常用那套 agent 工作流词汇来理解,这三层循环分别很像 evaluator-optimizer、orchestrator-workers 和带工件沉淀的长期记忆。Machina 这篇帖子的价值,在于它把这三层循环同时放进一个内容生产场景里,而不是只在代码生成或客服自动化里讨论。

把循环设计一次,Agent 替你跑一整夜——这就是“用模型”和“运营工作室”的分界。

文章给出一句冷静的事实校准:

nobody has shown a watchable film made by an agent start to finish with no human involved, and the system below doesn’t pretend to be one

到今天为止,没人端出一部“Agent 从头到尾无人参与还能看”的片子。下面这套系统也不装这个样。它是“Agent 计划、提示、重试,人挑选、导演”的协作结构。


三、引擎:同一个平台,两扇门

一个完整制作流程要碰图像模型、视频模型、音乐生成、升频(把成片拉到 4K 的那一关)——本来意味着五份订阅、五个浏览器标签、五个渲染队列、五个会丢文件的角落。

Higgsfield 把几乎所有模型放在同一个表面、一套登录、一个积分池之后,整个平台就是为 Agent 用法设计的——这恰好是这套系统需要的,因为 Agent 不会同时驱动五套登录。

进这套引擎有两条路:

适合谁怎么走
Supercomputer(简单的门)不在终端生活的人平台内置 Agent,自己规划制作、自己挑模型、自己剪片;你说想要什么,剩下路由它管;skill 机制和 Claude Code 一样
CLI(控制的那扇门)已经在跑 Claude Code 或其他 harness 的人让所有模型都能从你已有的 Agent 调;什么先生成、何时生成、用哪个模型、什么顺序,全归你的 Agent 管

对新人不熟 AI 视频、不知道一个好镜头要试多少轮的人,Supercomputer 跑测试不花钱——规划、测试、重做都 0 积分,只在最终渲染视频时扣积分,免费档够覆盖整个探索期。

CLI 三条命令搭起来:

npm install -g @higgsfield/cli
higgsfield auth login
npx skills add higgsfield-ai/skills

按 Higgsfield Skills 仓库的 README,官方也提供 npx skills add higgsfield-ai/skillsgh skill install 和 setup 脚本等安装路径,安装过程中会顺带处理 CLI 与认证。Machina 保留拆开的三步,更适合已经决定走 CLI-first 的人——你能清楚地区分哪一步在装命令行、哪一步在做登录、哪一步在把技能接进自己的 Agent harness。

skill 包教 Claude Code 什么时候该调哪个模型、怎么保持角色一致性、怎么提交和轮询任务。装完之后,终端就是你的工作室。


四、六个值得偷的具体规则

六阶段里藏了一组具体到能立刻抄走的规则。挑六条最值钱的。

规则一:从电影里萃取品味,别凭想象描述情绪

让 AI 视频有品味的最快办法,是别再凭想象描述“氛围”,而是去萃取已经打动过几百万人镜头里的参数。

四个常备资料源:

  • frameset.app——按镜头、灯光、运动搜电影和视频静帧
  • shotdeck.com / fancaps.net——几乎任何电影的逐帧静帧
  • savee.com / cosmos.so——意象与情绪板
  • eyecannndy.com——转场和摄影机技法

挑 5 到 10 个承载你想要“那个感觉”的镜头,喂给 Gemini 3.1 Pro 这样的视觉模型,让它把每个镜头的参数写到极致——镜头质感、灯光方向与来源、配色、颗粒、对比度、人物调度、氛围、年代标记。

输出一份 Machina 称为 style contract(风格契约) 的东西:一段锁死的视觉语言段落,每个图像和视频提示词里都原样粘贴,让所有生成都往同一部片子上拉。

直接说“cinematic(电影感)”是 AI 视频里被浪费最多的一个词——模型见过一千万张打了这个标签的图,这个词已经没意义。能落地的是“具体的强化配对”:

motivated warm lighting, 35mm grain, shallow depth of field, lifted blacks

动机明确的暖光、35mm 颗粒、浅景深、抬黑。这一段话决定下游所有素材长成什么样。

规则二:先出帧,再谈动

永远不要从想象中直接生成视频。先批量出静帧,帧对了再让赢家动起来——一帧的成本是片段的几分之一、耗时是几秒到几分钟,所以全部探索都在便宜那一层完成。

帧那一关的标准动作:

  • 用同一个分镜简报,绑同一份风格契约,并行跑几个扩散模型;在同一个表面做这件事很轻:同一段提示词,五个模型,并排比
  • 每个节拍多出几帧:不同构图、不同场景瞬间、不同天气
  • 赢家精修:Nano Banana 干外科手术式修改与一致性打磨,Soul Cinema 干摄影质感的人物形象,GPT-Images-2 干高密度美术指导
  • 锁必须保持一致的东西:每个角色一张参考表(正面、四分之三、侧面、分开放,因为网格会让视频模型把不同格读成不同的人);每套衣服或状态切换单独一张表;每个地点多角度一张表

Supercomputer 在这一关也能替你干活——同一个简报自己跨模型跑、自己看输出、自己迭代,不用你守着。

三条“比任何工具选择都更重要”的帧规则:

  • 物体比脸更能承情绪——脸在每次生成之间会漂移,物体不会。所以当一个情节落点可以交给一面撕破的帆或一根断桨而不是一个表情,把活儿给物体
  • 一个正常场景里的一件不可能事——是让人停下拇指的构图
  • 给角色一个代价——一个走路的人是“素材”,一个一瘸一拐走向某处的人是“故事”

帧只是半份活。一张不动的漂亮帧,依然是废片。

规则三:每镜头一个动词

写提示词这事,工作量天然适合外包。Machina 用 Fable 5 Medium 做编剧:吃节拍表加风格契约,把每个镜头的提示词都按同一个锁死模板写——场景上下文、参考、调度、摄影、声音、风格锁定,每次顺序一致。

锁死模板的意义:跨镜头的一致性来自重复的参考图和重复的语言,绝不是来自 seed 或运气。

五条提示词规则,每条都值得偷:

  • 每镜头一个动词——he turns 能生成,he turns, walks forward, reaches out and speaks 直接垮掉
  • 五个小动作比一个形容词好——blank stare, slow blink, sips coffee, looks up 读起来是一个人;he looks confused 读起来是图库照片
  • 主体运动和摄影机运动永远分两句写——一个分句同时管两件事,就是大家怪“模型不行”的抖动废片的来源
  • 纯文本生成提示词 120 到 280 词,从参考图动起来的提示词不超过 80 词——再长文字就开始和图打架,人物开始漂
  • 约束用正面表达——stable picture, sharp clarity 有效;no blur, no shaking 被忽略

规则四:让画面动起来的三段式语法

每一张关键帧(stage 2 锁下来的那张静图)丢给 Seedance 2.0 做图生视频,转成 3 到 5 秒的独立镜头。一分钟片子是 12 到 16 个这种镜头拼出来的——这本来就是所有真电影的剪法:剪辑师剪的是镜头,不是连续素材。

镜头独立还是一致性保险:身份漂移在连续场景超过 30 秒之后才会出现,独立节拍永远不会到那一步。

Machina 前两次动起来都败在同一个地方:人物站在原地像僵尸,镜头从旁边慢慢划过——技术上动了,视觉上什么都没动。

修法是一套语法,三段,每个图生视频提示词都这么写:

  1. 一个明确命名的摄影机运动
  2. 一个场景内事件——五秒之内有事情发生
  3. 一句明确的 no frozen figures

同一张关键帧,两条提示词:

A:slow dolly in, cinematic
B:slow dolly in as the sail tears loose and the crew scrambles to catch it

A 给一张慢慢漂移的静图。B 给一部电影。

两个进阶动作技巧:

  • 链接镜头(chain shots)——镜头 N 的最后一帧变成镜头 N+1 的参考帧,连续性不用重新加载角色表就自动续上
  • 单次生成内做时间码剪辑——一段提示词里写 [0-4s] wide and static, [4-8s] push-in as tension builds, [8-12s] close-up at the peak, [12-15s] the reveal,你在一次生成里就把剪辑做了

一条好镜头只是样本,一部片子要 60 条——这是产能问题。

规则五:舰队这一关,Claude Code 才真的挣到“工作室”这个词

一个总指挥 session 拥有整份镜头清单。它按镜头族——生物、水、内景、动作——派出子代理,每个子代理从风格契约出发写自己的提示词,从 CLI 提交自己的生成,轮询自己的任务,回传赢家。

因为每个模型都能从同一个终端调,舰队能跨模型并行覆盖整份镜头清单,而你去做别的事。

舰队生死系于一条不性感的规矩:尊重并发上限。视频模型有同时运行任务数的天花板,Agent 检查活跃任务,只在有空槽时提交。带节流的 Agent 跑一整夜能跑完;朴素循环一小时就撞限速挂掉。限速是这个模型送给你的免费容量信号——它同时能消化多少请求,你就在这个数字以内排队,而不是靠盲目堆并发硬闯。

舰队的迭代纪律:每个镜头 3 到 4 个候选,每轮只改一个变量——摄影机、灯光、或速度,从不整体重写。一次失败改了五件事,等于没失败。

Agent 把每次生成都记下来:提示词、模型、结果、留下还是砍掉。你的制作变成一份数据库,第二部片子从第一部学到的所有东西开始。

规则六:剪辑是文本,不是时间线

组装这一步比想象的小得多:

  • 先做音乐——按剪辑的情绪弧线分乐章给配乐下需求,不按心情下(起、高峰、低谷、解决),一次生成,然后把片子剪到配乐长度
  • 剪辑本身是一个文本文件——一行一个片段,带时长和音频标志,ffmpeg 读这个文件直接渲染出片

那个文件的每一行就是镜头名、保留秒数、音频标志——Machina 最近那份剪辑清单里,17-scylla-deck 这条声音标志是 mute,因为生成出来的那声喊和配乐打架;两行之后的 sea ambience 保持 live,因为它在卖场景气氛。

每段音频在和配乐打架的地方静音、在加真实感的地方保留——整份剪辑可复现、可秒改,不用时间线软件,不用剪辑师。

三个升频与分辨率规则:

  • 最后一次性升频,对完整成片,不要对单条镜头
  • 探索期 720p,留下的片段升 1080p,最终母版才出 4K——在“能回答你问题”的最低分辨率停下来
  • 不愿意自己跑 ffmpeg 和升频的人,supercomputer 同样能接:把赢的片段丢给它,它自己拼、自己渲 4K 母版

最后一轮剪辑只做一件事:任何会让你想看手机的镜头,删掉——不管花了多少钱。

五、把一个镜头任务走一遍:最小示例

如果把文中的方法压到一个最小例子,可以拿那条“帆被扯裂,船员冲过去抓住”的镜头来走一遍。

1. 风格契约先锁死

先从目标电影里挑 5 到 10 张参考帧,让视觉模型把暖光方向、颗粒、色彩、镜头压缩感写成一段固定描述。这里的产物不是“灵感”,而是一段后面每次都要重复粘贴的风格契约。

2. 用同一份简报跨模型批量出帧

把“风暴中的甲板、断裂的帆、船员扑上去抓住”的分镜简报,同时丢给几个图像模型,先只比较构图、情绪和物体关系,不急着生成视频。赢下来的那一帧,才有资格进入下一关。

3. Agent 把镜头意图写成可执行提示词

这一镜只保留一个主动作:帆裂开,船员扑过去。主体运动和相机运动分开写,例如 slow dolly in 单独一段,the sail tears loose and the crew scrambles to catch it 单独一段,避免一个分句同时指挥两件事。

4. Seedance 2.0 负责把关键帧动起来

官方 Skills 的 quick reference 也把 image-to-video 默认路径写成 seedance_2_0 + --start-image。这说明 Machina 的阶段四不是个人癖好,而是当前这类工作流里相当合理的默认选择:先有参考帧,再让它在 3 到 5 秒里完成一个明确事件。

5. 子代理舰队只在空槽出现时提交任务

总控 session 盯着并发上限;内景、水面、角色动作这些镜头族由不同子代理各自提交、轮询、记日志。这里真正贵的不是算力,而是没有节流时整夜排队撞上限后全盘停住。

6. 文本剪辑把赢家变成片子

最后被保留下来的,不是“这个模型今天表现不错”,而是 17-scylla-deck 这条片段留几秒、保不保现场声、和下一镜怎么接。到这一步,视频工作流已经从生成问题变成了编辑问题。

这个示例想说明的事情很简单:六阶段看起来长,但每一阶段都在替下一阶段降本。真正贵的是直接跳到视频生成,然后在最贵的一层里找构图、找风格、找故事。

六、这系统真正能产什么

片子只是 demo,系统才是资产。

同一套六阶段流程能产出产品广告、批量 UGC、品牌片、发布视频——管线里没有任何一处“知道自己是在做电影”。

常驻系统赢在速度:你的赛道里某个瞬间爆发的窗口以小时计,一个手上有风格契约、有锁好角色的舰队、有生成流水线的操作者,能在所有人还在开标签页的时候就把东西发出去。

整套搭建,压缩成六步:

  1. 用视觉模型从真实电影里萃取一份风格契约
  2. 跨多个扩散模型批量出帧,精修,把角色和地点锁进参考表
  3. Fable 5 Medium 用一个锁死模板写完每个镜头的提示词
  4. Seedance 2.0 把关键帧做成独立的 3-5 秒镜头:摄影机运动 + 场景事件 + no frozen figures
  5. 子代理通过 Higgsfield CLI 并行跑生成,带节流,带日志
  6. 配乐、用 ffmpeg 从文本文件剪出来,最后做一次升频

跳过 stage 1,后面五步产出的是“漂亮的无主素材”。

这套系统的第一部片子花了一个通宵。你的第一部,从你装好 CLI 的那个晚上开始。

或者直接试 Higgsfield Supercomputer 的免费版(Higgsfield AI 是本文赞助方,但这个东西真的强)——它能从规划镜头、写提示词、选模型一路自主跑到成片。

所有人都能租到同一批模型,片子最后好不好,取决于你有没有把品味、参考、重试和取舍写成一套可复用流程——模型名字反而不是关键。

七、下一步与进阶阅读

如果你想把这篇帖子里的方法真的搬进自己的工作流,最稳的顺序不是一次做完六阶段,而是按下面三步推进。

第一步:只做 stage 1 + stage 2 + stage 4

先验证你能不能稳定产出“可剪辑的单镜头”。这一步还不需要子代理舰队,也不需要文本剪辑,只看风格契约、关键帧筛选和单镜头事件有没有跑通。

第二步:把镜头模板和日志固化

当你已经能稳定做出几个镜头,再把提示词模板、角色参考表和生成日志固定下来。没有这一步,后面的自动化只会更快地制造混乱。

第三步:最后再上并行舰队

只有当你已经知道“好镜头长什么样”“失败一般死在哪”,子代理并行才会真正省时间。否则你只是把试错速度放大了。

谁该直接去读原文

如果你要的是 Machina 原帖里逐条的 prompt、seed、参数和实际样片,直接去 X 看原文(链接见文首)——本文把六阶段整理成了能照做的规则,但贴不出他原帖的每一帧。如果你只想拿一套能落地的流水线思路,读到这里就够了。

把这套范式带回自己的工作流

真正可迁移的,不是某个模型名,而是下面三条设计原则:

  • 先把任务切成人负责判断、Agent 负责吞吐的两半
  • 先为循环写退出条件、并发上限和日志格式,再谈自动化规模
  • 约束尽量用正面语言表达,让模型和人都知道“要什么”,而不是只知道“别做什么”

进阶阅读

收束

三件事值得记住。

第一,品味进去,片子出来。 模型不会替你把品味也租来。真正拉开距离的,是你有没有把风格契约、参考表、节拍表这些工件写进一套可复用的流程。

第二,把循环当成工程对象来设计。 不是所有事都该跑成 while 循环,但只要你发现一件事需要重复跑到某个条件满足——多模型选最佳、多版本挑赢家、多角度试构图——它就是 loop engineering 的候选。设计循环时至少问三个问题:退出条件是什么?并发上限在哪?这一轮日志怎么变成下一轮的起点?

第三,约束用正面语言写。 stable picture, sharp clarityno blur, no shaking 有用得多。每镜头一个动词、主体运动和摄影机运动分两句、120 到 280 词的长度——这些规则同样适用于写给人看的需求文档:明确说什么,比明确说不要什么,更容易产出你想要的结果。

最后一句留着:便宜生成没让好内容变容易,它把整份工作挪进了品味。 谁能把品味结构化,谁就能跑赢这一轮。


说明:本文翻译基于 Machina @EXM7777 2026-07-28 X 长文(原帖链接),文章提及的 Higgsfield AI 是本文赞助方,但工具本身确实强。

参与讨论

使用 GitHub 登录。欢迎补充事实、异议与实践。