目录

ViMax:港大DDS实验室的多智能体端到端视频生成方案

先给判断

当前 AI 视频生成的痛点在于"生成出来没法用"——短片段、一致性差、没有叙事结构。ViMax 尝试用多智能体协作解决这个问题:让多个 AI 角色各自负责创作链条的一环,最终产出有叙事结构的完整视频。

这个方向有价值,但项目较新,成熟度有待验证。如果你在做视频生成的 AI 应用研究,ViMax 值得关注;如果只是需要快速生成短视频,现成方案可能更实用。

系统地图

输入:创意想法 / 小说 / 剧本
        │
        ▼
┌─────────────────────────────────────────────────────────────────┐
│                      ViMax 多智能体系统                          │
│                                                                  │
│   Director ──► Screenwriter ──► Producer ──► Video Generator    │
│   (导演)         (编剧)          (制片)         (视频生成器)       │
│                                                                  │
│   Agents: [                                                  ]  │
│   - 角色生成器                                                 │
│   - 分镜规划器                                                 │
│   - 场景管理器                                                 │
│   - 视频合成器                                                 │
└─────────────────────────────────────────────────────────────────┘
        │
        ▼
输出:完整视频故事(含叙事结构)

核心能力

1. Idea2Video(想法到视频)

用户输入一个创意想法,系统自动完成:

  • 故事生成与结构化
  • 角色设计(外貌、服装、性格)
  • 分镜规划
  • 视频生成

2. Novel2Video(小说到视频)

输入完整小说,系统:

  • 智能压缩叙事(长文本→核心情节)
  • 角色跟踪与一致性管理
  • 分集视频生成
  • 场景视觉适配

3. Script2Video(剧本到视频)

用户直接编写剧本,ViMax:

  • 解析剧本格式
  • 规划分镜
  • 生成对应视频内容
  • 控制视觉风格

4. AutoCameo(照片到视频)

上传人物照片,系统生成视频:

  • 角色动作生成
  • 口型同步(推测)
  • 表情控制

技术架构

目录结构

ViMax/
├── agents/           # 智能体定义
│   ├── director.py
│   ├── screenwriter.py
│   └── producer.py
├── pipelines/       # 处理流程
├── interfaces/      # 用户接口
├── configs/         # 配置文件
├── main_idea2video.py
├── main_script2video.py
└── tools/           # 辅助工具

多智能体协作流程

  1. Director Agent:理解创意,确定视频风格、时长、叙事节奏
  2. Screenwriter Agent:将创意转化为剧本/分镜描述
  3. Producer Agent:规划资源、角色、分镜优先级
  4. Video Generator:调用底层视频生成模型,产出最终视频

依赖

  • Python 3.12
  • uv(包管理)
  • 视频生成模型(未在 README 中明确指定)

快速开始

# 克隆仓库
git clone https://github.com/HKUDS/ViMax.git
cd ViMax

# 安装依赖
uv sync

# Idea2Video 模式
python main_idea2video.py --idea "一个关于友情和冒险的故事"

# Script2Video 模式
python main_script2video.py --script ./my_script.txt

已知限制

  1. 视频时长:当前 AI 视频生成普遍只能生成短片段(秒级)
  2. 一致性:跨镜头角色/场景一致性仍是技术挑战
  3. 叙事深度:自动生成的叙事可能缺乏情感深度
  4. 成熟度:项目较新,生产环境使用需谨慎

与同类项目比较

能力ViMaxRunwayPikaSora
多智能体协作
端到端叙事部分部分部分
开源
剧本输入部分
小说适配

适用边界

该用:

  • 做 AI 视频生成的学术研究
  • 需要从剧本/小说自动生成视频原型的场景
  • 构建 AI 视频创作工具

不该用:

  • 需要生产级、高质量的商业视频
  • 对生成速度有严格要求的实时场景
  • 需要精确控制视频每个画面的场景

结论

ViMax 的思路是把创作流程拆成多个 AI 角色协作——这是它和单模型视频生成最大的区别。

这个方向值得关注,因为它尝试解决 AI 视频生成最棘手的问题——叙事结构和跨镜头一致性。但同时,项目较新,README 中很多功能描述较为概略,实际效果需要实测。

如果你在研究 AI 视频生成,ViMax 的架构值得参考;如果你只是需要快速生成视频,现成工具可能更实用。


仓库信息:https://github.com/HKUDS/ViMax | Stars: 5,101 | License: MIT | 语言: Python