Live Avatar:阿里巴巴联合高校开源的实时音频驱动数字人生成系统

在人工智能与数字内容创作飞速发展的当下,数字人技术正逐渐成为行业焦点。Live Avatar 作为一项前沿技术,由阿里巴巴联合多所高校共同研发,旨在通过实时音频驱动生成无限时长的数字人视频,为虚拟互动、内容创作等领域带来全新突破。

一、项目概述

Live Avatar 是一个算法与系统协同设计的框架,能够实现实时、流式、无限长度的交互式数字人视频生成。它依托 140 亿参数的扩散模型,在 5 张 H800 GPU 上实现 20FPS 的实时流式生成,并支持长达 10000 秒以上的连续视频生成。这一技术不仅在生成速度上表现出色,还通过创新机制解决了长时生成中的稳定性问题,为数字人技术的广泛应用奠定了坚实基础。

二、核心功能

(一)实时音视频驱动

Live Avatar 能够通过麦克风捕捉用户的语音,并实时驱动数字人的口型和表情动作,实现低延迟的面对面交互。这种实时响应能力让用户在与数字人互动时能够获得流畅自然的体验,仿佛与真人对话一般。

(二)无限时长稳定生成

该系统支持长达10000 秒以上的连续视频生成,过程中数字人的面容、肤色、风格等特征保持一致,避免了长时生成中常见的身份漂移和画质下降问题。这一特性使得 Live Avatar 在需要长时间稳定输出的场景中具有显著优势,如电商直播、新闻播报等。

(三)高保真画质

基于140 亿参数的扩散模型,Live Avatar 能够生成细节丰富、清晰自然的数字人画面。其生成的视频在画质上接近真实人物,为用户带来高质量的视觉体验。

(四)流式生成

采用流式处理技术,Live Avatar 支持实时视频流的连续扩展。这种技术使得系统能够根据输入的音频流逐帧生成视频,适用于直播等实时应用场景。

三、技术揭秘

(一)扩散模型优化

Live Avatar 的技术基石是经过深度优化的 140 亿参数扩散模型。通过创新的 Distribution Matching Distillation(分布匹配蒸馏)技术,该模型将原本需要多步迭代的双向扩散模型转化为高效的 4 步流式扩散模型,极大地加速了生成过程。同时,Timestep-forcing Pipeline Parallelism(时间步强制流水线并行)技术的应用,将复杂的去噪阶段解耦并分配至多个计算设备,实现了近乎线性的加速效果,为大规模并行计算奠定了基础。

(二)无限时长生成机制

为解决长时生成中的稳定性难题,Live Avatar 引入了多项关键技术:

1. 滚动 RoPE(Relative Positional Encoding):通过动态调整参考帧的相对位置编码,确保生成帧与参考帧之间的空间关系始终稳定,从而有效杜绝身份漂移的发生。

2. 自适应注意力池(Adaptive Attention Sink):将初始参考帧替换为生成帧,消除导致分布漂移的持续性干扰因素,保持生成帧在统计分布上的高度一致性。

3. 历史干扰机制:向 KV 缓存注入少量噪声,模拟推理过程中的微小误差,引导模型在提取信息时依赖历史帧,在提取稳定细节时参考当前帧,从而有效避免误差的累积,保障生成的连贯性。

(三)实时交互技术

Live Avatar 结合麦克风和摄像头输入,通过音频和视频信号实时驱动数字人模型,实现低延迟的交互响应。在优化生成速度和延迟方面,该系统达到了 20FPS 的实时生成速度,首帧延迟仅为 2.89 秒,确保了流畅的交互体验。

四、应用场景

(一)电商直播

Live Avatar 能实现 7×24 小时不间断产品展示与讲解。数字人主播可以根据输入的音频内容实时生成对应的口型和表情,为观众带来生动的购物体验,同时降低人力成本,提升直播效率。

(二)新闻播报

该模型支持自动生成虚拟主播播报新闻。通过输入新闻文本生成对应的音频,再利用Live Avatar 生成虚拟主播的视频,能够快速生成多语言视频,提高新闻的时效性和传播范围。

(三)娱乐直播

在娱乐领域,虚拟偶像可以通过Live Avatar 实时互动表演。例如举办线上演唱会等活动,观众可以通过麦克风与虚拟偶像互动,增强参与感和娱乐性。

(四)智能客服

数字人客服可实时回答用户问题。通过语音识别和自然语言处理技术获取用户问题,Live Avatar 生成对应的数字人回答视频,为用户提供 24 小时不间断的视觉化服务,提升用户体验。

(五)银行柜员

虚拟金融顾问可以利用Live Avatar 提供标准化的业务咨询。在银行大厅或在线平台上,数字人柜员能够根据用户的语音指令实时生成对应的业务办理指导视频,辅助人工服务,提升银行的运营效率。

五、快速使用

(一)环境搭建

1. 创建环境

使用以下命令创建 Python 环境并激活:

conda create -n liveavatar python=3.10 -yconda activate liveavatar

2. 安装 CUDA 依赖(可选)

如果需要使用 GPU 加速,可以安装 CUDA 相关依赖:

conda install nvidia/label/cuda-12.4.1::cuda -yconda install -c nvidia/label/cuda-12.4.1 cudatoolkit -y

3. 安装PyTorch 和 Flash Attention

pip install torch==2.8.0 torchvision==0.23.0 --index-url https://download.pytorch.org/whl/cu128pip install flash-attn==2.8.3 --no-build-isolation

4. 安装 Python 依赖

pip install -r requirements.txt

5. 安装 FFMPEG

apt-get update && apt-get install -y ffmpeg

(二)模型下载

从以下链接下载预训练模型,并将它们放置在`./ckpt/` 目录下:

WanS2V-14B:https://huggingface.co/Wan-AI/Wan2.2-S2V-14B

liveAvatar:https://huggingface.co/Quark-Vision/Live-Avatar

下载命令示例:

pip install "huggingface_hub[cli]"huggingface-cli download Wan-AI/Wan2.2-S2V-14B --local-dir ./ckpt/Wan2.2-S2V-14Bhuggingface-cli download Quark-Vision/Live-Avatar --local-dir ./ckpt/LiveAvatar

(三)实时推理

1. 多GPU 实时推理:在至少 80GB VRAM 的 GPU 上运行以下命令进行实时推理:

bash infinite_inference_multi_gpu.sh

也可以通过运行以下命令启动Gradio Web UI:

bash gradio_multi_gpu.sh

2. 单GPU 推理:在单个 80GB VRAM 的 GPU 上运行以下命令:

bash infinite_inference_single_gpu.sh

同样可以通过运行以下命令启动Gradio Web UI:

bash gradio_single_gpu.sh

如果在Gradio Web UI 中多次运行后遇到 OOM 错误,可以尝试降低分辨率(`size` 参数)作为临时解决方案。

六、结语

Live Avatar 作为一项创新的数字人生成技术,凭借其强大的实时音视频驱动能力、无限时长稳定生成特性以及高保真画质,为数字人技术的广泛应用提供了新的可能性。无论是在电商直播、新闻播报还是娱乐互动等领域,Live Avatar 都展现出巨大的应用潜力。

项目地址

项目官网:https://liveavatar.github.io/

GitHub 仓库:https://github.com/Alibaba-Quark/LiveAvatar

Hugging Face 模型库:https://huggingface.co/Quark-Vision/Live-Avatar


点亮“关注”,设为“星标”,精彩不迷路!与你携手探索AI的无限可能,精彩内容持续更新!🚀

举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询