腾讯混元发布并开源语音数字人模型HunyuanVideo - Avatar,助力视频创作

AA1FCxZj

2025年5月28日,腾讯混元发布并开源语音数字人模型HunyuanVideo-Avatar,该模型由腾讯混元视频大模型与腾讯音乐天琴实验室MuseV技术联合研发,为视频创作者带来新的视频生成能力,能根据用户上传的人物图像与音频,生成自然生动的视频。

模型发布及研发背景

2025年5月28日,腾讯混元发布并开源语音数字人模型HunyuanVideo-Avatar。此模型由腾讯混元视频大模型(HunyuanVideo)及腾讯音乐天琴实验室MuseV技术联合研发。

模型功能特点

HunyuanVideo-Avatar支持头肩、半身与全身景别,以及多风格、多物种与双人场景。面向视频创作者,它提供高一致性、高动态性的视频生成能力。用户上传人物图像与音频后,该模型会自动理解图片与音频,例如人物所在环境、音频蕴含的情感等,让图中人物自然地说话或唱歌,生成包含自然表情、唇形同步及全身动作的视频。