输入关键词搜索 AI 工具、分类,或直接跳转页面
sound-of-pixels.csail.mit.edu
PixelPlayer是由麻省理工学院CSAIL实验室开发的音视觉联合分析系统,核心定位是通过无标注视频训练,实现图像区域声源定位与多源音频分离。核心功能包括音视频同步学习、像素级声源定位、多类别音频分离三个模块,无需人工标注数据即可完成模型训练。面向计算机视觉研究人员、音频处理从业者、多媒体内容创作者、高校相关专业学生等群体,适用于音视频分离实验、老旧音轨修复、多乐器演奏内容拆分、视频声源定位分析、多模态学习研究等场景,可帮助用户将单声道音频按不同声源类型拆分,同时定位视频中每个发声区域对应的音频波形。