输入关键词搜索 AI 工具、分类,或直接跳转页面
phantom-video.github.io
Phantom是专注于主体一致性的跨模态视频生成工具,核心定位是为用户提供基于参考图像的高保真视频内容生成服务。核心功能包括单图/多图参考驱动的视频生成、主体身份特征精准保留、多模态交互生成、高清视频细节输出。目标用户覆盖内容创作者、广告制作人员、VR内容开发者、新媒体运营者等。可应用于短视频内容创作、广告片素材制作、虚拟场景人物动态生成、数字人视频输出等多种场景,帮助用户降低视频制作的人力和时间成本。

unified-io-2.allenai.org
Unified-IO 2是艾伦人工智能研究所推出的多模态生成模型演示平台,核心定位是为用户提供统一模态的AI能力体验入口。平台支持图像、文本、音频、动作四类模态的混合输入与输出,单个Transformer架构可实现跨模态语义的统一处理;内置经过120余个数据集微调的预训练模型,可直接适配多类多模态任务需求;平台同时提供基准测试结果查询功能,方便用户直观了解模型在各任务场景下的性能表现。目标用户覆盖AI研究人员、多模态应用开发者、高校相关专业师生、内容创作从业者等,可用于跨模态任务原型验证、模型性能对比分析、多模态应用效果测试、学术研究参考等场景。

muvi-v2m.github.io
MuVi是一款专注于视频到音乐生成的AI框架类工具,核心定位是实现视频内容与生成音乐的多维度匹配。它支持通过分析视频的画面内容、叙事节奏、情绪表达提取对应特征,生成适配视频的原创音乐,同时支持用户自定义音乐风格与流派,还搭载了对比性音乐-视觉预训练模块,保障音乐节拍与视频关键节点的同步性。目标用户覆盖视频创作者、内容运营人员、短视频从业者、影视制作人员、音乐爱好者及AI技术研究人员,可用于短视频BGM制作、Vlog配乐生成、宣传片背景音创作、个人创作素材生成等多个场景,为音视频内容融合提供技术支持。
dreamllm.github.io
DreamLLM是专注于多模态大语言模型研发的开源学习框架,核心定位是打破传统多模态模型的技术瓶颈,实现理解与创作能力的协同提升。核心功能包括原生多模态空间采样生成、无外部特征依赖的语义理解、跨模态联合分布建模三类,支持研究人员快速复现多模态生成实验,也可供AI开发人员搭建跨模态内容生成系统。目标用户覆盖AI领域研究学者、大模型开发工程师、高校计算机相关专业师生等群体,适用于多模态模型技术研发、跨模态内容生成工具开发、大模型相关学术实验验证等场景。

junzhan2000.github.io
AnyGPT是一款面向多模态交互需求的统一大语言模型工具站,核心定位是通过离散表示技术实现语音、文本、图像、音乐等多模态的统一处理,无需改动现有大语言模型架构与训练范式即可完成稳定训练。核心功能包含多模态任意组合交互、多模态指令数据集支持、新模态无缝接入能力。目标用户覆盖AI研究人员、多模态应用开发者、内容创作者、高校计算机专业师生等群体,可用于多模态对话系统开发、跨模态内容生成、多模态模型学术研究、多模态交互产品原型测试等场景,为不同模态的统一处理提供可落地的技术方案。