输入关键词搜索 AI 工具、分类,或直接跳转页面

dxli94.github.io
BLIP-Diffusion是一个支持多模态控制的主题驱动图像生成模型站点,核心定位为降低主题定制图像生成的技术门槛。站点提供零样本主题生成能力,用户无需大量训练即可基于单张参考图生成同主题衍生内容;支持高效微调功能,少量样本即可实现个性化主题的定向优化;还兼容ControlNet、prompt-to-prompt等主流生成工具,扩展更多创作可能性。主要面向AI图像研究者、数字内容创作者、设计从业者等用户,适用于产品概念设计、IP形象衍生、艺术创作实验、学术研究验证等多个场景。

jasonppy.github.io
VoiceCraft是基于令牌填充技术的神经编解码器语言模型工具站,核心定位为面向音频创作、语音处理相关从业者与爱好者的语音编辑与生成服务平台。核心功能包含零样本语音克隆、上下文感知语音编辑、多场景语音生成三类,支持用户上传短语音样本快速复刻对应音色,也可针对已有录音精准修改局部内容,无需重新录制完整音频。目标用户覆盖音频内容创作者、播客主播、有声读物制作人、视频剪辑师、AI语音研发人员等群体,适用于有声读物内容纠错、播客口误修正、视频旁白音色统一、小语种语音素材生成、虚拟角色语音定制等多种场景,帮助用户降低音频内容制作的时间与人力成本。

x-dyna.github.io
X-Dyna是专注于零样本人类图像动画生成的技术展示与试用平台,核心依托扩散模型实现静态人像的动态效果生成。平台支持用户上传单张人像图片与驱动视频,即可将视频中的面部表情、肢体动作迁移到静态人像上,生成连贯的动态视频;内置Dynamics-Adapter模块可保留人像原有外观特征,同时实现动作的自然迁移;支持表情局部精准控制,可单独调整面部表情参数。平台面向AI生成内容创作者、数字媒体设计师、动画制作从业者、学术研究人员等群体,适用于数字人内容制作、短视频特效创作、虚拟形象动态化、学术技术验证等多种场景。

id-animator.github.io
ID-Animator是面向AI生成领域的零样本人类视频生成工具,核心定位是基于单张人脸参考图实现个性化人物视频生成,无需额外模型训练即可保留目标人物身份特征。其核心功能包括单图身份特征提取、视频生成过程身份一致性保持、适配现有扩散视频生成框架的兼容性支持。目标用户覆盖AI视频创作者、计算机视觉研发人员、数字内容制作团队、数字人开发从业者等,可应用于短视频内容制作、虚拟数字人生成、影视角色预演、学术研究验证等多种场景,帮助用户在降低训练成本的同时,生成人物身份匹配度较高的动态视频内容。

github.com
StyleTTS 2是一款开源文本转语音(TTS)模型项目,核心定位为通过语音语言模型与扩散技术实现高自然度语音合成。其核心功能包括无参考语音的风格自适应生成、端到端对抗训练提升语音自然度、多场景零样本语音合成。目标用户覆盖AI语音研发人员、音视频内容创作者、有声读物制作团队、语音交互产品开发者等。可用于有声读物批量制作、虚拟数字人语音生成、智能客服语音系统搭建、多语言语音内容生产等场景,为语音合成相关开发与创作提供可落地的技术方案。

cyberhost.github.io
CyberHost是一个端到端音频驱动的人体动画生成框架,核心定位是为音频内容匹配符合逻辑的人体全身动态效果。其核心功能包括基于区域码本注意力机制的人体动作生成,可保障手部动作完整性与人物身份一致性;采用双U-Net架构作为基础结构,配合运动帧策略实现动画的时间延续性;支持零样本音频驱动人体视频生成,无需针对特定人物提前训练即可输出自然动态。目标用户覆盖计算机视觉研究人员、动画制作从业者、数字内容创作者、人机交互开发人员等,可应用于虚拟人直播动作生成、短视频数字人内容制作、元宇宙虚拟形象驱动、动画前期动作预演等多种场景。