输入关键词搜索 AI 工具、分类,或直接跳转页面
FLOAT是由深度脑AI研究团队推出的音频驱动人像视频生成技术演示站点,核心定位为基于流匹配生成模型的专业说话人视频生成工具。站点核心功能包括音频驱动的人像视频生成、情感增强运动渲染、多风格运动模式适配,可实现时间一致性的人脸运动合成。目标用户覆盖AI视频研发人员、数字内容创作者、虚拟人开发从业者等,适用于虚拟人直播内容生成、短视频口播素材制作、数字人互动场景开发、学术研究效果验证等多种场景,帮助用户降低说话人视频的制作门槛,提升动态内容生成效率。
访问FLOAT官方站点,在首页功能区找到上传入口,先上传清晰的正面人像静态图片,要求人脸无遮挡、光线均匀,便于系统提取人脸特征参数。
上传需要匹配的语音音频文件,支持常见的MP3、WAV等格式,音频长度建议控制在30秒到5分钟之间,避免过长导致生成等待时间过久。
根据需求选择对应的生成参数,可选择是否开启情感增强功能,以及匹配的运动风格类型,有特殊需求的用户还可添加自定义帧约束条件。
确认参数无误后点击生成按钮,系统会自动处理音频与图像特征,实时显示生成进度,用户可等待处理完成,期间无需关闭页面。
生成完成后可在线预览输出的视频效果,确认符合需求后即可下载视频文件,若效果不满意可调整参数后重新提交生成任务。
看完教程,直接上手试试
访问 FLOAT 官网