输入关键词搜索 AI 工具、分类,或直接跳转页面

arize.com
Arize AI是面向AI全生命周期的AI应用可观测性与评估平台,覆盖从模型开发到生产部署的全流程监测与优化需求。平台支持多类型AI模型的性能追踪、漂移检测、根因定位与质量评估,帮助开发与运维团队及时发现生产环境中AI模型出现的问题,优化模型表现。核心功能包含模型漂移监测、性能指标追踪、根因诊断、数据分片分析、LLM评估等,主要面向AI开发团队、机器学习工程师、MLOps运维人员,适用于生产模型监控、新模型上线评估、大语言应用质量管控等场景。

getmaxim.ai
Maxim是一款端到端的AI评估与可观测性平台,面向开发和部署AI应用程序的团队提供全流程支持。平台可以帮助开发团队检测AI应用中的幻觉问题,追踪生成结果的事实准确性,对大语言模型应用的输出进行系统性评估,同时提供全链路运行数据观测能力。核心功能涵盖AI应用评估、可观测性追踪、数据集管理、实验对比、自定义指标配置等。目标用户包括AI应用开发团队、大语言模型落地团队、MLOps工程师、AI产品经理、企业AI研发部门等。适合在大语言模型应用上线前测试、已部署应用性能监控、不同模型输出效果对比、AI生成内容合规检查等场景使用。

evalsone.com
EvalsOne是面向生成式AI开发场景的评估优化平台,为生成式AI应用提供全流程的评估服务。平台支持自定义评估指标配置,可完成多模型输出对比,自动生成评估报告,还支持数据集导入与管理,帮助开发团队系统性验证生成式AI应用的输出质量,定位性能问题。核心服务覆盖模型选型、应用上线前质量验证、迭代版本效果对比等开发环节,目标用户包括生成式AI应用开发团队、大模型微调工程师、AI产品测试人员以及独立AI开发者,适用于大语言模型应用开发、多模态AI项目验证、生成式AI产品上线前合规性检查等多种场景。