输入关键词搜索 AI 工具、分类,或直接跳转页面

captum.ai
Captum是面向PyTorch生态的开源模型可解释性工具库,专注于帮助开发人员和研究者理解深度神经网络预测结果的生成逻辑,支持多种数据类型的模型解释工作。核心功能涵盖特征归因、神经元 attribution和模型比较,适配图像、文本、表格等主流数据类型的深度学习模型。目标用户包括AI算法研究者、深度学习开发工程师、高校AI方向师生,适合用于模型调试、论文实验验证、算法改进以及模型透明度提升等场景。

huiyu-gao.github.io
VisFusion是一款基于计算机视觉与深度学习技术的在线3D场景重建工具,核心定位是帮助用户从普通视频数据中快速生成高精度三维环境模型。其核心功能包括视频帧自动特征提取、多视角点云融合建模、模型纹理自动映射,支持主流视频格式上传,无需专业三维扫描设备即可完成场景还原。目标用户覆盖计算机视觉研究人员、三维建模从业者、AR/VR内容开发者、建筑测绘人员等,可应用于数字孪生场景搭建、文化遗产三维存档、虚拟场景内容制作、室内外空间测绘等多个场景,降低了3D场景建模的技术门槛。

flatten-video-editing.github.io
FLATTEN是一款面向文本到视频编辑场景的光流引导注意力插件,核心定位为解决扩散模型视频编辑过程中的帧间一致性问题。其核心功能包括光流引导的注意力机制适配、无训练集成适配、帧间编辑一致性优化三类,无需额外训练即可对接现有基于扩散的文本到视频编辑方法,帮助研究人员、视频创作者提升编辑后视频的帧间连贯性,降低画面闪烁、元素偏移等问题出现概率,适用于学术研究验证、创意视频制作、短视频二次编辑等多种场景。

wandb.ai
Wandb(Weights & Biases)是面向机器学习领域的协作开发平台,核心定位为帮助开发者与团队实现机器学习全流程的管理与优化。平台支持实验全链路追踪、模型训练过程可视化、跨成员项目协作三类核心功能,目标用户覆盖机器学习研究员、算法工程师、高校AI方向师生、企业AI团队、深度学习竞赛参与者等群体,可满足实验参数对比、模型性能调优、团队项目迭代、训练过程复盘、模型成果落地等多场景需求,适配TensorFlow、PyTorch、Hugging Face等主流机器学习框架,降低ML项目管理的复杂度。

boximator.github.io
Boximator是由Jiawei Wang、Yuchen Zhang等开发者推出的智能视频合成工具,核心定位是为用户提供可控性更强的AI视频生成服务。核心功能包括盒子约束运动控制、文本提示视频生成、自定义运动轨迹调整三类,支持用户通过划定物体框选范围、搭配文本描述的方式,精准控制视频内物体的运动路径、呈现形态。目标用户覆盖视频创作者、AI技术研究者、动画设计人员、内容运营从业者等群体,适用场景包括短视频内容制作、动画概念demo输出、AI生成视频技术实验、创意广告素材产出等,能够帮助用户降低视频创作的操作门槛,提升运动控制的精准度。

poplarml.com
PoplarML是聚焦机器学习生产化部署的服务平台,核心目标是降低机器学习模型落地生产的工程门槛,帮助用户快速完成模型从研发到可用服务的转化。平台核心功能包含多框架兼容的一键GPU部署、自动扩缩容的流量适配机制、标准化REST API调用接口,同时支持实时推理服务运维监控。目标用户覆盖算法研发人员、后端开发工程师、AI项目运维人员、中小团队AI业务负责人,可应用于计算机视觉模型上线、自然语言处理服务部署、个性化推荐系统落地、AI原型产品快速验证等多个场景,无需用户深度掌握GPU集群调度、服务运维等底层技术即可完成生产级ML系统搭建。
bizgen-msra.github.io
BizGen是微软亚洲研究院推出的文章级视觉文本渲染模型工具,核心定位为面向信息可视化领域的深度学习渲染工具,可实现多语言文本的高精度视觉还原、信息图表自动排版适配、长文本分块渲染优化、渲染效果实时预览调整、自定义风格样式匹配五大核心功能,服务于学术研究人员、可视化开发者、内容创作者、设计师、教育工作者等群体,可应用于学术论文图表制作、商业报告可视化呈现、科普内容图文排版、多语言宣传物料设计、数据报告自动生成等场景,帮助用户提升信息可视化内容的制作效率与呈现效果。