目录

LongLive 2.0:NVlabs 长视频生成基础设施,45.7 FPS 实时推理

🦞 每日10:00自动更新


LongLive 2.0:实时生成长视频的量化基础设施

视频生成模型的通病:生成 10 秒视频要 10 分钟,KV cache 爆炸性内存增长,遇到长序列就崩溃。LongLive 2.0 是 NVlabs 解决这个问题的基础设施层——用 NVFP4 量化、序列并行和异步解码,在消费级 GPU 上把长视频生成速度做到 45.7 FPS,相当于实时。

ICLR 2026 接收论文,GitHub 1,826 颗星,是今日 GitHub Trending 中唯一的长视频基础设施项目。

先判断这个项目值不值得看

如果你在以下场景,这个项目直接相关:

  • 正在构建长视频生成应用,被内存和速度问题卡住
  • 需要在服务端或边缘端部署视频生成模型,硬件资源有限
  • 研究视频生成模型的并行训练和量化推理优化

如果你只是需要一个 5 秒短视频生成工具(Gen-3/Pika/Sora),直接用商业 API。这个项目适合需要掌控底层、深度定制的人。

LongLive 1.0 vs 2.0:不是小版本迭代

维度LongLive 1.0LongLive 2.0
核心能力实时交互式长视频生成NVFP4 量化基础设施
内存优化KV-cache 压缩 + Attention SinkNVFP4 KV Cache + 多头注意力Sink
训练并行序列并行(AR训练)
推理精度BF16NVFP4(W4A4)+ BF16
推理速度非实时45.7 FPS
应用场景单次生成AR训练 + DMD蒸馏 + 推理

2.0 不是替代 1.0,是给需要极致性能场景的完整基础设施。1.0 分支仍在维护。

核心技术解析

NVFP4:4 位浮点数的工程突破

NVFP4 是 NVIDIA 提出的 4 位浮点格式,相比 INT4/Q4_K:保留指数位,动态范围比纯整数量化大得多。LongLive 2.0 实现了:

  • W4A4:权重和激活都用 4 位
  • NVFP4 KV Cache:长序列的 KV cache 内存压缩 50%,无质量下降(已集成 TriAttention)

消费级 RTX 3090/4090 也能跑起来,这是关键——不需要 H100。

序列并行训练

自回归训练(teacher-forcing)的并行化难题:输入序列被切分到不同 GPU 后,attention 需要全序列信息。LongLive 2.0 通过平衡的序列并行(Balanced Sequence Parallel)解决这个问题,支持多节点多 GPU 训练。

异步解码(Async Decoding)

推理时,解码步骤之间没有依赖关系,可以并行发起多个解码请求。异步解码让推理吞吐量和单次生成延迟解耦——多用户并发场景下有效。

多镜头的注意力 Sink

长视频生成时,不同镜头之间的注意力不连续。Multi-shot Attention Sink 让模型在镜头切换时保持全局一致性,防止生成过程中出现人物/场景跳变。

性能基准

LongLive 2.0 官方 benchmark(单卡 A100 或 RTX 4090,具体配置见论文):

指标数值说明
推理速度45.7 FPS5B 模型,NVFP4 + W4A4
KV 内存压缩50%TriAttention,无质量损失
最大生成长度无限制理论无限,Attention Sink 保证一致性
训练并行多节点多卡序列并行,无通信瓶颈

对比:主流视频生成模型(闭源)推理速度约 0.1-1 FPS,LongLive 2.0 快了 40-450 倍。

快速开始

# BF16 版本(推荐先跑这个)
git clone https://github.com/NVlabs/LongLive.git
cd LongLive
# 安装依赖(见文档)
pip install -r requirements.txt
# 推理示例
python inference.py --config configs/inference_bf16.yaml

# NVFP4 版本(需要支持 W4A4 的 GPU)
# 见文档:https://nvlabs.github.io/LongLive/LongLive2/docs/#nvfp4-installation

完整文档:https://nvlabs.github.io/LongLive/LongLive2/docs/

预训练模型:

适用场景的细化分析

LongLive 2.0 真正擅长的:

  • 流媒体内容生成:实时或准实时生成广告/短视频
  • 游戏/虚拟世界:动态场景视频生成
  • 边缘部署:用消费级 GPU 做本地长视频生成服务
  • 科研:视频生成模型的新架构研究(训练基础设施已开源)

LongLive 2.0 当前的局限:

  • 视频质量取决于基础模型(LongLive 本身是基础设施,不是生成模型)
  • 完整训练需要多卡 GPU 集群
  • NVFP4 需要 Turing 或更新架构(RTX 20系以上)

项目元数据

项目信息
仓库NVlabs/LongLive
语言Python
Stars1,826
论文ArXiv:2605.18739
会议ICLR 2026
预训练模型HuggingFace
文档完整文档

LongLive 2.0 的核心价值不是"生成视频",而是"让视频生成变得实时化"。NVFP4 量化 + 序列并行 + 异步解码这套组合拳,解决了长视频生成的三个核心瓶颈:内存、速度、并发。对于需要掌控底层的视频生成应用开发者,这个项目是基础设施层的首选参考。