ViMax:港大DDS实验室的多智能体端到端视频生成方案
posts posts 2026-05-19T20:25:00+08:00ViMax是香港大学DDS实验室推出的代理原生视频生成系统,通过Director、Screenwriter、Producer、Video Generator四个智能体协作,将创意想法或剧本端到端转化为完整视频故事。技术笔记AI视频生成, 多智能体系统, 港大DDS, 视频创作, 开源研究目录
先给判断
当前 AI 视频生成的痛点在于"生成出来没法用"——短片段、一致性差、没有叙事结构。ViMax 尝试用多智能体协作解决这个问题:让多个 AI 角色各自负责创作链条的一环,最终产出有叙事结构的完整视频。
这个方向有价值,但项目较新,成熟度有待验证。如果你在做视频生成的 AI 应用研究,ViMax 值得关注;如果只是需要快速生成短视频,现成方案可能更实用。
系统地图
输入:创意想法 / 小说 / 剧本
│
▼
┌─────────────────────────────────────────────────────────────────┐
│ ViMax 多智能体系统 │
│ │
│ Director ──► Screenwriter ──► Producer ──► Video Generator │
│ (导演) (编剧) (制片) (视频生成器) │
│ │
│ Agents: [ ] │
│ - 角色生成器 │
│ - 分镜规划器 │
│ - 场景管理器 │
│ - 视频合成器 │
└─────────────────────────────────────────────────────────────────┘
│
▼
输出:完整视频故事(含叙事结构)核心能力
1. Idea2Video(想法到视频)
用户输入一个创意想法,系统自动完成:
- 故事生成与结构化
- 角色设计(外貌、服装、性格)
- 分镜规划
- 视频生成
2. Novel2Video(小说到视频)
输入完整小说,系统:
- 智能压缩叙事(长文本→核心情节)
- 角色跟踪与一致性管理
- 分集视频生成
- 场景视觉适配
3. Script2Video(剧本到视频)
用户直接编写剧本,ViMax:
- 解析剧本格式
- 规划分镜
- 生成对应视频内容
- 控制视觉风格
4. AutoCameo(照片到视频)
上传人物照片,系统生成视频:
- 角色动作生成
- 口型同步(推测)
- 表情控制
技术架构
目录结构
ViMax/
├── agents/ # 智能体定义
│ ├── director.py
│ ├── screenwriter.py
│ └── producer.py
├── pipelines/ # 处理流程
├── interfaces/ # 用户接口
├── configs/ # 配置文件
├── main_idea2video.py
├── main_script2video.py
└── tools/ # 辅助工具多智能体协作流程
- Director Agent:理解创意,确定视频风格、时长、叙事节奏
- Screenwriter Agent:将创意转化为剧本/分镜描述
- Producer Agent:规划资源、角色、分镜优先级
- Video Generator:调用底层视频生成模型,产出最终视频
依赖
- Python 3.12
- uv(包管理)
- 视频生成模型(未在 README 中明确指定)
快速开始
# 克隆仓库
git clone https://github.com/HKUDS/ViMax.git
cd ViMax
# 安装依赖
uv sync
# Idea2Video 模式
python main_idea2video.py --idea "一个关于友情和冒险的故事"
# Script2Video 模式
python main_script2video.py --script ./my_script.txt已知限制
- 视频时长:当前 AI 视频生成普遍只能生成短片段(秒级)
- 一致性:跨镜头角色/场景一致性仍是技术挑战
- 叙事深度:自动生成的叙事可能缺乏情感深度
- 成熟度:项目较新,生产环境使用需谨慎
与同类项目比较
| 能力 | ViMax | Runway | Pika | Sora |
|---|---|---|---|---|
| 多智能体协作 | ✅ | ❌ | ❌ | ❌ |
| 端到端叙事 | ✅ | 部分 | 部分 | 部分 |
| 开源 | ✅ | ❌ | ❌ | ❌ |
| 剧本输入 | ✅ | ❌ | ❌ | 部分 |
| 小说适配 | ✅ | ❌ | ❌ | ❌ |
适用边界
该用:
- 做 AI 视频生成的学术研究
- 需要从剧本/小说自动生成视频原型的场景
- 构建 AI 视频创作工具
不该用:
- 需要生产级、高质量的商业视频
- 对生成速度有严格要求的实时场景
- 需要精确控制视频每个画面的场景
结论
ViMax 的思路是把创作流程拆成多个 AI 角色协作——这是它和单模型视频生成最大的区别。
这个方向值得关注,因为它尝试解决 AI 视频生成最棘手的问题——叙事结构和跨镜头一致性。但同时,项目较新,README 中很多功能描述较为概略,实际效果需要实测。
如果你在研究 AI 视频生成,ViMax 的架构值得参考;如果你只是需要快速生成视频,现成工具可能更实用。
仓库信息:https://github.com/HKUDS/ViMax | Stars: 5,101 | License: MIT | 语言: Python