输入关键词搜索 AI 工具、分类,或直接跳转页面
TANGO Model 是由东京大学与CyberAgent AI Lab联合开发的AI音频驱动手势生成项目,核心定位是实现语音信号到自然人物手势动作的精准转换与视频重现。其核心功能包括基于层次化音频-运动嵌入的语音特征提取、扩散插值动作生成、已有视频的手势动作替换适配,主要面向视频创作者、虚拟现实内容开发者、数字人制作团队等用户群体,可应用于短视频手势生成、虚拟主播动作驱动、AR交互角色动作制作、影视预演动作参考等多个场景,帮助用户降低手动K帧制作手势动作的成本,提升数字内容中人物动作的自然度与匹配度。
打开TANGO Model官方网站,在首页浏览项目介绍与功能说明,了解该技术的适用场景与输出效果,确认符合自身使用需求后,找到功能入口进入操作界面。
根据自身需求选择处理模式,可选择仅音频生成动作,也可选择音频加原有视频的手势替换模式,按照页面提示上传对应的音频或视频素材,注意素材格式需符合页面标注的支持范围。
在参数设置区域选择合适的动作风格,调整手势幅度、动作频率等可选参数,确认参数设置无误后,提交处理请求,系统会自动进入任务队列开始处理。
等待处理完成,处理时长根据素材长度与排队任务量有所不同,过程中可关闭页面,后续通过任务编号可查询处理进度,完成后会提供预览选项。
预览生成的效果,确认动作与语音匹配度、融合效果符合预期后,选择需要的导出格式下载结果,若效果不符合需求可调整参数重新提交生成。
看完教程,直接上手试试
访问 TANGO Model 官网