https://github.com/bytedance/LatentSync
- 总 Star 数量
- 5.9k
- 最近更新时间
- 2025-06-20
- 开源时间
- 2024-12-11
项目描述
LatentSync 是一个基于音频条件潜空间扩散模型的端到端口型同步框架。它利用 Whisper 提取音频嵌入,通过交叉注意力机制直接建模复杂音视频关联,无需中间运动表示。支持生成 512×512 分辨率视频,提供 Gradio 界面和命令行推理,并可进行数据处理和训练。适用于对口型视频生成,在保持视觉质量的同时实现精准唇音同步。