输入关键词搜索 AI 工具、分类,或直接跳转页面
hertz-dev是Standard Intelligence推出的开源音频变换器基础模型站点,核心定位为面向音频处理领域的开源技术研究平台,提供85亿参数规模的全双工仅音频变换器模型能力。核心功能包括音频编码转换服务,可将16kHz单声道语音转换为8Hz低比特率潜在表示;支持模型微调工具集,方便研究人员基于现有模型适配特定场景;提供完整的技术文档与开源协作社区,助力跨模态音频学习技术落地。目标用户覆盖AI音频领域研究人员、语音技术开发工程师、跨模态学习相关科研团队,适用于低带宽语音传输场景开发、音频特征提取研究、多模态大模型音频模块搭建等多元场景。
访问https://si.inc/hertz-dev站点,在首页浏览模型基本介绍与技术参数,确认模型能力是否符合自身研发需求,若需使用更多功能可点击注册按钮完成账号创建。
若需了解模型详细使用方法,可导航至文档板块,按照自身研发方向查阅对应的模型架构说明、调用指南或微调教程,也可下载离线版文档留存查阅。
若需测试音频编码能力,可在工具板块上传单声道16kHz的音频文件,点击开始处理按钮等待系统完成编码,处理完成后可下载输出的潜在表示数据查看效果。
若需进行模型微调,可进入微调工具板块,上传自定义的音频数据集,按照引导设置微调参数后启动训练任务,训练过程中可实时查看进度,完成后可导出微调后的模型文件。
若需集成至自有产品,可进入API申请页面提交应用场景说明,审核通过后获取调用密钥,按照文档示例完成接口接入,即可批量调用模型的音频处理能力。
看完教程,直接上手试试
访问 hertz-dev 官网