输入关键词搜索 AI 工具、分类,或直接跳转页面
3d-avatar-diffusion.microsoft.com
RODIN Diffusion是微软推出的AI 3D数字化身生成系统,核心定位是通过扩散模型技术降低3D数字化身的制作门槛。核心功能包括支持文本/图像输入生成3D数字化身、生成结果支持360度无死角查看、可输出神经辐射场格式的3D模型,目标用户覆盖3D创作者、游戏开发人员、虚拟内容制作从业者、元宇宙项目开发者等群体,可应用于游戏角色制作、虚拟偶像打造、元宇宙数字身份生成、影视虚拟角色预演等多种场景,能有效缩短传统3D建模的周期,为3D内容创作提供新的实现路径。

dangeng.github.io
Visual Anagrams是一款基于预训练扩散模型的视觉错觉生成工具,核心定位是通过零样本算法生成多视角视错觉作品。支持旋转、翻转、颜色反转、拼图重排等多种图像变换操作,可将普通图像生成为不同视角下呈现不同内容的视错觉作品。目标用户涵盖创意设计从业者、视错觉研究人员、艺术创作者、教育工作者以及普通兴趣爱好者,可用于艺术创作、科普展示、广告创意设计、教学演示等多个场景。

ella-diffusion.github.io
ELLA(Efficient Large Language Model Adapter)是面向文本生成图像领域的技术适配工具,核心定位为轻量级的大语言模型适配组件,可对接现有基于CLIP的扩散模型,为其赋予大语言模型的语义理解能力。核心功能包含时间感知语义连接器(TSC)模块,可根据采样时间步动态调整语义特征输出,同时支持长文本提示解析,能够处理包含多对象、多属性、复杂关系的提示内容,还可实现对原有扩散模型U-Net结构的冻结适配,无需重新训练基础模型。该工具面向AIGC算法研发人员、文本生成图像模型开发者、AI艺术创作者、学术研究人员等群体,适用于优化现有文生图模型的提示跟随效果、提升长文本提示的图像生成准确率、开展文生图语义对齐相关的学术研究等场景。

anydoor.dev
AnyDoor AI是基于扩散模型打造的图像生成与编辑工具,核心定位是实现零样本物体-场景的高保真合成。其核心功能包括目标物体背景自动分割、物体身份特征精准提取、自定义场景位置嵌入,无需针对单个物体调整参数即可完成无缝合成。目标用户覆盖电商运营、平面设计师、内容创作者、摄影从业者、服装从业者等群体,可应用于商品图场景替换、海报元素合成、服装上身效果预览、创意图像创作、老照片元素修复等多个场景,帮助用户降低图像合成的操作门槛。

aipromptstudio.com
AI Prompt Studio是聚焦AI图像生成场景的Prompt管理优化工具,核心面向使用扩散类图像生成模型的创作人群,提供Prompt全生命周期管理、关键词质量分析、图像库集中存储对比三大核心功能。用户可通过该工具统一整理不同平台的生成提示词,分析提示词组成对图像效果的影响,批量管理生成的图像文件并标注相关元数据,适用于AI绘画创作、商业视觉设计、AI内容生产团队协作等多种场景,帮助用户减少提示词零散管理的繁琐步骤,提升AI图像生成的输出稳定性。

res-adapter.github.io
ResAdapter是专为Stable Diffusion等扩散模型打造的分辨率适配工具,核心定位是解决扩散模型固定分辨率生成的限制,支持在不改变原有模型风格域的前提下生成任意分辨率、任意宽高比的图像。核心功能包括动态分辨率适配、风格一致性保持、推理效率优化,无需对原有扩散模型进行重训练即可快速适配。该工具面向AI图像生成从业者、数字艺术家、游戏美术设计师、内容创作者等群体,适用于批量生成不同尺寸的商用设计素材、定制个性化壁纸、制作多规格营销海报、适配不同平台的内容配图等场景,可降低多尺寸图像生成的时间成本。

shangchenzhou.com
Upscale-A-Video是一款基于扩散模型的视频超分辨率处理工具,核心定位是为低分辨率视频提供清晰度增强服务,同时兼顾画面保真度与时间流畅度。其核心功能包括:支持文本提示引导纹理生成,用户可输入描述自定义修复后的画面风格与细节;内置双重时间一致性保障机制,避免放大后画面出现抖动、闪烁问题;提供噪声水平调节选项,可根据原始视频质量调整生成权重,平衡还原度与创意生成效果。该工具面向视频创作者、AI内容开发者、多媒体处理从业者等群体,适用于老视频修复、AI生成视频清晰度提升、低清素材二次加工等场景。

hohonu-vicml.github.io
TrailBlazer是一款基于扩散模型的轨迹可控视频生成工具,核心定位是帮助用户在无需额外训练模型的前提下,通过轨迹引导实现定制化视频生成。核心功能包括:其一,边界框轨迹引导,用户仅需绘制简单的边界框即可控制视频中主体的移动路径;其二,时空注意力地图编辑,支持对视频的空间布局和时间序列上的注意力权重进行调整;其三,关键帧+提示词联动控制,可同时通过关键帧边界框和文本提示设置主体的轨迹与外观特征。该工具面向AI视频创作者、动画设计师、内容运营人员、学术研究人员等群体,适用于创意短视频制作、动画分镜生成、动态广告设计、视频生成技术研究等多种场景,可降低轨迹可控视频的制作门槛。

enriccorona.github.io
VLOGGER是基于扩散模型的AI人物视频生成工具,核心定位是通过单张人物图像结合文本、音频驱动,生成可控的人物讲话视频。核心功能包括单图驱动的3D人体运动生成、时序可控的视频扩散渲染、面部与肢体动作联合调控三个模块。目标用户覆盖视频创作者、多媒体内容开发者、数字人从业者、高校AI研究人员等群体,可用于短视频内容生产、数字人直播素材制作、学术研究效果验证、虚拟形象内容产出等场景,无需针对单个人物单独训练模型,即可输出包含完整人体姿态的长时长生成视频。

mshu1.github.io
DreamWalk是一款基于扩散指引技术的文本感知图像生成工具,核心定位是为用户提供无需微调扩散模型即可实现的图像风格、内容细粒度控制能力。平台支持多风格插值调整、空间变化引导函数设置、跨扩散模型适配三大核心功能,面向AI图像创作者、平面设计师、数字艺术爱好者等用户群体,可满足艺术创作风格调整、商业设计内容定制、学术研究模型效果验证等多场景使用需求,用户无需修改扩散模型内部结构即可实现精准的图像生成控制。

ip-adapter.github.io
IP-Adapter是面向文本到图像扩散模型的轻量化适配工具,核心为预训练扩散模型提供图像提示支持,助力多模态图像生成任务。其核心功能包括解耦交叉注意力机制设计、多类可控生成工具兼容、多模态提示融合生成三类,目标用户覆盖AI图像生成研究者、AIGC应用开发者、视觉创意设计师、计算机视觉方向学生等群体,可应用于定制化图像生成、多模态创意落地、扩散模型功能扩展、批量图像风格迁移等场景,帮助用户在现有文本生成图像模型的基础上,低成本接入图像参考能力,提升生成结果的匹配度。
loopyavatar.github.io
Loopy model是专注于音频驱动肖像视频生成的AI工具站点,核心基于端到端的音频驱动视频扩散模型架构,可实现音频与面部动作的精准匹配。核心功能包括支持用户上传肖像图片与对应音频文件生成同步口型与面部表情的动态视频,内置跨剪辑与内部剪辑时间模块保障长视频动作连贯性,无需手动设置空间运动模板即可输出自然的动态肖像效果。面向的目标用户包含AI内容创作者、数字人开发从业者、短视频制作人员、动画设计人员等,适用于数字人主播视频制作、虚拟角色配音动效生成、个人纪念动态肖像制作、教学类口播视频批量生产等多种场景。

sliders.baulab.info
Concept Sliders 是聚焦于扩散模型生成图像精细化控制的技术服务平台,核心定位为AI图像创作的参数调节工具。平台支持通过文本描述或图像对训练专属概念滑块,可在不改动图像整体结构的前提下,对人物特征、环境光影、风格元素等属性做定向调节,还支持滑块叠加使用实现多属性同步调整。目标用户覆盖AI视觉创作者、数字艺术家、游戏美术设计师、广告内容制作人员等,可应用于AI绘画效果微调、商业设计稿属性调整、概念创意迭代、影视前期概念图优化等场景,帮助用户降低AI生成图像的反复调试成本,提升创作精准度。
trajectorycrafter.github.io
TrajectoryCrafter 是基于扩散模型技术打造的相机轨迹重定向工具,核心定位是为视频创作、影视制作相关从业者提供相机运动的二次设计能力。核心功能包括单目视频相机轨迹提取、自定义轨迹参数重定向、渲染输出适配多格式、批量视频处理、轨迹预览调试、效果参数微调,面向影视后期制作人员、VR内容创作者、短视频创作者、独立动画制作者、高校影视相关专业师生、游戏CG开发者等用户群体,可应用于影视片段镜头语言优化、VR内容沉浸感提升、短视频运镜效果升级、动画预演镜头设计、数字孪生场景动态视角生成等多种场景,帮助用户在不重新拍摄素材的前提下调整视频的相机运动逻辑,丰富视频的视觉表达空间。