输入关键词搜索 AI 工具、分类,或直接跳转页面

hamming.ai
Hamming是专注于AI语音代理与大语言模型应用全生命周期测试的服务平台,核心覆盖从开发迭代到生产运营的全流程质量保障需求。平台支持自动化多角色并发语音呼叫测试,可模拟真实通话场景定位语音代理的响应异常;提供提示词全链路管理与优化能力,辅助用户生成适配业务场景的提示词方案;还具备生产环境主动监控功能,可对AI应用的实际运行表现进行持续跟踪评分。目标用户包括AI语音代理开发团队、大语言模型应用开发者、企业AI产品测试人员、呼叫中心AI解决方案服务商等,可应用于语音机器人上线前压力测试、提示词效果验证、生产环境AI服务质量巡检、LLM应用版本迭代效果对比等多个场景。

alibaba-nlp.github.io
WebWalker是由阿里巴巴集团通义实验室开发的多智能体框架,核心定位是评估大型语言模型在网页遍历任务中的表现,可模拟人类浏览网页的行为逻辑,通过探索与评估相结合的范式系统提取高质量网页数据,支持深入挖掘多层级网页信息,可帮助研究人员优化大模型信息检索能力,适用场景包括大模型开放域问答能力优化、多步骤信息检索场景模拟、网页数据结构化提取研究等,目标用户覆盖大模型研发人员、自然语言处理研究者、信息检索领域从业者等群体。

getmaxim.ai
Maxim是一款端到端的AI评估与可观测性平台,面向开发和部署AI应用程序的团队提供全流程支持。平台可以帮助开发团队检测AI应用中的幻觉问题,追踪生成结果的事实准确性,对大语言模型应用的输出进行系统性评估,同时提供全链路运行数据观测能力。核心功能涵盖AI应用评估、可观测性追踪、数据集管理、实验对比、自定义指标配置等。目标用户包括AI应用开发团队、大语言模型落地团队、MLOps工程师、AI产品经理、企业AI研发部门等。适合在大语言模型应用上线前测试、已部署应用性能监控、不同模型输出效果对比、AI生成内容合规检查等场景使用。