输入关键词搜索 AI 工具、分类,或直接跳转页面
JoyHallo是专注于数字人视频生成的技术项目,核心定位为面向多场景的普通话数字人生成解决方案。项目基于29小时真实场景普通话视频数据集训练,可实现音频驱动的唇部动作同步生成,支持医疗等垂直领域话术的数字人内容输出,同时具备跨语言视频生成能力。目标用户覆盖内容创作者、医疗科普机构、在线教育从业者、企业宣传部门等群体,可应用于科普视频制作、在线课程录制、品牌宣传内容产出、多语言跨境内容制作等多个场景。
访问JoyHallo项目主页,在下载专区获取最新版本的模型权重、开源代码包与配套的部署说明文档,根据设备环境配置对应的Python依赖库与运行框架。
准备待生成的音频文件,支持普通话或英语的WAV、MP3格式,若有专业领域内容可提前整理相关话术文本作为辅助输入。
运行模型预处理模块,上传音频文件后系统自动完成音频特征提取,可根据需求选择预设的数字人形象,也可上传自定义的数字人模型文件。
设置生成参数,可分别调整唇部同步精度、表情丰富度、姿态动作幅度等选项,若有特定场景需求可选择对应训练风格的微调模型。
启动生成任务,待任务完成后可预览输出的数字人视频,支持导出MP4格式文件,若效果不符合预期可调整参数重新生成。
看完教程,直接上手试试
访问 JoyHallo 官网