输入关键词搜索 AI 工具、分类,或直接跳转页面
AudioConvert是依托AI技术的音频转文本处理网站,核心定位为提供高精度音频语音转文字服务。网站支持多种音频格式导入转换,可识别不同口音的语音内容,支持输出文本编辑与导出,还能对转换后的文本做基础内容整理,适合需要处理音频内容的用户使用,可用于会议记录整理、采访内容转写、课程录音转文字、播客字幕提取等多种场景。
按 语音生成与转换领域热度与收录质量排序,功能定位与 AudioConvert 相近,可按定价与平台筛选对比。

microsoft.ai
MAI是微软推出的人工智能服务平台,核心定位是为开发者、创作者及企业用户提供AI技术能力支持。平台搭载语音合成、多模态交互、AI内容生成等核心能力,可满足虚拟助手开发、有声内容制作、无障碍服务搭建、企业应用智能化升级等多元需求。用户无需从零搭建AI模型,借助平台提供的预训练模型与开放接口,即可快速将AI能力集成到自身业务场景中,降低AI技术落地的门槛,适配不同规模的开发与应用需求。

qwen3tts.com
Qwen3 TTS是阿里云推出的AI语音合成服务平台,核心定位是为用户提供低延迟的文本转语音能力。平台主打97毫秒级处理速度,支持10种语言及中国部分方言,内置17种不同风格的预置音色,可输出还原度较高的人声效果。目标用户覆盖内容创作者、应用开发者、有声读物制作人员等群体,适用于短视频配音、智能客服话术生成、多语言有声内容制作、语音交互产品原型测试等多种场景,无需复杂配置即可快速获取语音合成结果。

aligenie.com
天猫精灵开放平台是阿里巴巴推出的智能语音交互技术开放服务平台,核心定位是向开发者和硬件厂商提供成熟的语音交互技术能力与生态接入支持。平台开放语音识别、自然语言理解、对话管理、语音合成等核心技术,支持硬件设备接入语音交互功能,也支持开发者定制专属语音技能。目标用户覆盖智能硬件厂商、应用开发者、智能家居品牌、车载设备服务商、商业场景运营方等群体,可应用于智能家居设备语音控制、车载语音交互系统开发、线下场景智能语音服务搭建、智能办公设备功能升级等多个场景,帮助合作方降低语音交互技术研发成本,快速落地智能语音相关产品与服务。

peiyin.xunfei.cn
讯飞智作是科大讯飞推出的AI配音与内容创作平台,核心定位是为用户提供低门槛的多场景音频内容生产服务。核心功能包括AI多音色配音、智能文稿改写、音频后期一键处理,支持多语种、多方言语音生成,可导出多种格式的音频文件。目标用户覆盖内容创作者、教育从业者、广告制作人员、企业运营人员等群体,适用于短视频旁白制作、有声读物录制、商业广告配音、课件音频生成、宣传播报音频制作等多种场景,帮助用户提升音频内容的生产效率,降低专业配音的成本门槛。

moyin.com
Magic Audio Workshop是专注于AI语音生成与音频处理的在线工具平台,支持多语种拟人声语音合成、音频剪辑优化、字幕与语音同步匹配等核心功能。主要面向短视频创作者、有声书制作者、教育课程开发者、广告策划人员等内容创作群体,可满足短视频旁白录制、有声读物批量制作、课程音频配音、商业广告配音、多语种内容译配等多元场景的音频制作需求,无需专业录音设备即可完成标准化的语音内容产出。

chattts.site
ChatTTS是面向开发者与内容创作者的开源文本转语音项目,专注于生成符合真实对话场景的自然语音内容。核心功能包括中英双语语音生成、自定义语音音色调整、批量文本处理,同时开放完整模型源码供开发者进行二次开发。目标用户涵盖内容创作者、AI产品开发者、有声读物制作人、短视频运营者、课程开发者以及学术研究人员,适用于短视频配音、有声书制作、对话式AI产品语音输出、课程音频生成、多角色语音对话制作等多种使用场景,可满足不同用户对自然对话语音生成的多样化需求。

icnpy.com
刺鸟配音是专注于在线智能配音服务的综合音视频处理平台,核心定位是为不同用户提供文本转语音及配套内容创作工具。平台核心功能包括多音色智能配音、多语种语音合成、配套音视频编辑与内容生成工具,支持普通话、方言、外语等多类语音输出,还附带智能写作、文案提取、音频剪辑等辅助功能。目标用户覆盖内容创作者、企事业单位宣传人员、教育工作者、电商从业者等群体,可用于短视频旁白制作、有声书录制、广告配音、课件语音生成、公益宣传音频制作等多个场景,降低配音制作的技术门槛。

fish.audio
Fish Audio是专注于AI语音生成服务的在线工具平台,核心定位为提供高还原度的文本转语音与声音克隆服务。平台支持多语言语音合成、精细化情绪参数调节、百万级预制声库调用三大核心功能,面向内容创作者、有声读物制作人员、跨境电商从业者、短视频运营者等用户群体,可应用于有声书配音、短视频旁白制作、多语言客服语音生成、个性化语音内容定制等多个场景,满足不同领域的语音内容生产需求。

elevenlabs.io
ElevenLabs是专注于人工智能语音技术的知名平台,核心为用户提供高质量的语音生成、声音克隆及实时语音交互服务。平台支持29种语言的语音输出,生成的语音自然度高,能够还原不同音色的情绪细节与发音特点,同时支持高精度声音复刻,可基于少量音频样本生成相似度较高的定制音色,还具备低延迟实时语音对话能力。服务面向内容创作者、音频从业者、游戏开发者、教育工作者等群体,可广泛应用于视频配音、播客制作、有声书录制、游戏角色配音、多语言内容本地化、AI客服搭建等各类专业音频场景。

elsaspeak.com
ELSA Speak是一款基于人工智能技术的英语发音与口语练习平台,核心定位为帮助用户纠正英语发音问题,提升口语表达流畅度。平台依托语音识别技术分析用户发音细节,提供针对性的发音练习内容与即时反馈,可匹配不同英语水平用户的练习需求。核心功能包括AI发音测评、个性化练习计划、场景化口语模拟、词汇发音训练、流利度提升练习等,适合需要提升英语口语发音的各类用户,可用于日常碎片化练习、备考口语考试、职场商务口语准备等多种场景。

repairit.wondershare.com
Wondershare Repairit是万兴推出的AI驱动在线数据修复平台,核心定位为各类损坏的音视频、图片和文档提供修复服务,支持修复不同存储设备上的受损数据,适配多种损坏场景。平台支持批量修复多类型损坏文件,可处理不同程度的文件损坏问题,也可针对特定设备提取修复数据。该平台面向需要修复损坏媒体文件和文档的个人用户、内容创作者、办公人员等,适用于恢复误损坏的拍摄素材、修复存储故障导致的坏文件、抢救误操作损坏的办公文档等场景。
myvocal.ai
MyVocal是专注于AI声音克隆与音乐创作的在线工具,核心定位为普通用户提供低门槛的声音定制与音频创作能力。核心功能包括60秒快速声音克隆、AI翻唱生成、语音内容转语音创作、多场景声音适配导出、音调自定义调整,目标用户覆盖音乐爱好者、内容创作者、自媒体从业者、有声书制作人员、普通个人用户等,可用于制作个人专属翻唱作品、为短视频配音、生成个性化有声内容、制作专属语音祝福等场景,无需专业音频设备即可完成声音相关创作。

kokorottsai.com
Kokoro TTS是基于StyleTTS 2架构开发的AI文本转语音工具,依托8200万参数模型提供高拟真度的自然语音合成服务。核心功能包括多风格语音生成、多语言混合合成、长文本分段处理、自定义发音规则设置,适合内容创作者、教育工作者、有声读物制作人员、无障碍内容开发者等群体使用,可应用于短视频配音、有声书录制、课程音频制作、无障碍内容播报等多个场景,帮助用户便捷将文本内容转化为符合需求的音频文件。

funaudiollm.github.io
CosyVoice 2是阿里巴巴通义实验室SpeechLab团队研发的语音合成模型官方展示站点,核心定位是为开发者和研究人员提供高自然度、低延迟的语音合成技术参考与体验入口。核心功能包括零样本语音克隆、多语言多音色合成、流式实时语音生成,支持中文、英文、日语等多语种语音输出。目标用户覆盖语音技术研发人员、AI应用开发者、内容创作从业者、多模态产品设计师等群体,适用于AI助手交互、有声书制作、短视频配音、实时客服对话、虚拟人语音定制等多种场景,可帮助不同需求的用户快速了解该模型的技术特性与实际应用效果。

replicastudios.com
Replicastudios是基于人工智能技术打造的AI语音演员服务平台,核心为用户提供高自然表现力的文本转语音解决方案。平台内置覆盖多语种、多风格的AI语音演员库,支持用户自定义调整语音情绪、语速、停顿等参数,还可满足多格式音频导出需求。目标用户涵盖游戏开发者、动画制作团队、有声内容创作者、广告策划人员、播客制作者以及教育内容开发人员等,可应用于游戏角色配音、动画旁白录制、有声书制作、商业广告语音合成、播客内容生成、教育课程语音配音等多个场景,帮助用户在无需聘请真人配音演员的情况下完成专业级语音内容制作。

data-baker.com
标贝科技是专注于智能语音交互与AI数据服务的人工智能企业,核心为开发者、企业用户提供全链路语音技术解决方案,覆盖语音合成、声音定制、AI数据集服务等方向。核心功能包括多场景语音合成能力输出,支持在线、离线多部署方式;个性化声音定制服务,可实现声音复刻、专属音库开发;多维度AI数据集供应,满足语音识别、语义理解等模型训练需求。目标用户覆盖AI应用开发者、智能硬件厂商、内容创作机构、车载服务企业等,可应用于智能设备交互、有声内容制作、公共服务播报、虚拟人配音等多类场景,帮助用户降低语音技术落地门槛,提升产品交互体验。

streamlabs.com
Streamlabs Podcast Editor是面向播客创作者、内容博主的在线音视频编辑工具,核心定位是降低播客二次创作的门槛。核心功能包括基于文本的音视频剪辑、自动字幕生成与编辑、社交媒体适配导出,适配新手到进阶创作者的编辑需求。目标用户覆盖独立播客主、访谈内容创作者、企业新媒体运营者等群体,可应用于播客后期粗剪、访谈高光片段提取、短视频二次创作、跨平台内容分发等多个场景,用户无需专业剪辑软件基础,即可完成从长内容到短片段的加工流程。

yuedu.data-baker.com
标贝悦读是专注于语音合成场景的在线AI配音工具,核心定位是为用户提供自然流畅的多音色文本转语音服务。平台内置上千种不同风格的AI发音人,支持多音字校准、多音字标注、多场景音效匹配等功能,同时可适配不同长度文本的配音需求,满足有声书制作、短视频配音、广告播报、课件音频制作等多场景使用需求,目标用户覆盖内容创作者、教育工作者、电商运营人员、企业宣传人员等多个群体,无需专业配音设备,在网页端即可完成从文本到音频的全流程制作。

voicemod.net
Voicemod是一款面向全球用户的实时变声与语音合成工具,核心功能覆盖实时语音变调、多场景音效适配、文本转语音生成,支持在直播、游戏开黑、线上会议、内容创作等多场景中使用,能够满足普通娱乐用户、内容创作者、线上办公人群、游戏玩家等不同群体的语音自定义需求,用户可通过简单的参数调整获得多种类型的音色效果,无需复杂的音频专业知识即可完成语音效果定制。

inworld.ai
Inworld AI是专注于低延迟实时语音智能体开发的人工智能服务平台,核心面向需要部署交互式语音服务的企业与开发者群体。平台主打低于200ms的实时语音交互响应能力,支持自定义语音克隆功能,部署成本较同类方案更低,可支撑大规模商业化场景落地。用户可借助该平台快速搭建客服语音助手、虚拟角色互动系统、智能设备语音交互模块等,满足游戏、电商、IoT、教育等多领域的智能语音交互需求,降低语音类AI应用的开发与运维门槛。
whisperweb.art
Whisper Web是一款基于浏览器运行的AI语音识别工具,依托OpenAI的Whisper模型提供服务,无需向服务端上传音频数据即可完成识别处理。核心功能包含多语言实时转录、本地离线处理、多格式音频文件识别,面向需要语音转文字的内容创作者、跨国办公人员、语言学习者、媒体从业者等用户群体,可适用于会议记录整理、访谈内容转写、外语听力材料转录、播客内容字幕生成等多种场景,全程在本地浏览器环境完成运算,降低数据泄露风险。

lovo.ai
LOVO AI是一款专注于文本转语音的AI音频生产工具,核心定位为多语言AI语音生成服务平台,支持500余种不同音色、100余种语言及方言的语音合成,同时提供语音克隆、音频后期编辑、多角色对话生成等配套功能。目标用户覆盖内容创作者、教育从业者、跨境电商运营者、有声书制作团队、游戏开发者以及企业营销宣传人员等,可应用于短视频旁白配音、在线课程语音制作、多语种产品介绍音频生成、有声读物录制、游戏角色配音、企业宣传片语音制作等多种场景,帮助用户降低音频内容生产的人力和时间成本。

f5tts.net
F5 TTS是一款人工智能驱动的在线文本转语音平台,为用户提供免费的文本生成语音、语音克隆、多语言语音合成等服务。核心功能支持长文本批量转换、自定义语音参数、原音色克隆等,面向内容创作者、教育工作者、跨境从业者、音频制作人员等用户,可满足自媒体配音、课件制作、多语言内容本地化、有声书制作等多种场景的语音生成需求。

deepgram.partnerlinks.io
Deepgram是面向开发者的语音AI开发平台,提供多类语音相关API接口,支持各类场景下的语音AI能力快速集成。平台核心功能包含高精度语音转文字API、自然语音生成、语音意图识别、多语言支持、自定义模型训练等,可帮助开发者降低语音AI能力的开发门槛。目标用户覆盖移动应用开发者、SaaS产品开发团队、AI初创公司、语音交互产品研发人员、内容处理企业等,适合用于开发语音笔记应用、智能客服系统、语音内容检索工具、实时字幕生成系统、语音交互智能硬件等多种产品场景。