输入关键词搜索 AI 工具、分类,或直接跳转页面

promptfoo.dev
Promptfoo是专注于大语言模型Prompt质量评估与测试的开源工具,核心定位是帮助开发者降低LLM应用的落地风险,提升Prompt的稳定性与有效性。核心功能包括自定义测试用例创建、多维度评估指标配置、Web可视化结果对比,同时支持与现有测试流程、CI/CD pipeline无缝集成。目标用户覆盖LLM应用开发者、AI产品经理、Prompt工程师、算法测试人员等,可应用于对话机器人Prompt调优、RAG系统检索效果验证、AI生成内容合规性检测、多模型输出效果横向对比等多个场景,帮助用户在LLM应用迭代过程中快速定位Prompt的缺陷,减少线上异常问题的出现。

jackhopkins.github.io
Factorio学习环境(Factorio Learning Environment, FLE)是基于游戏《Factorio》构建的大语言模型能力评估框架,核心定位为AI研究领域的开放式智能体测试工具。核心功能包括支持结构化任务与开放式任务两类评估协议、可自定义难度梯度的任务配置、标准化的能力评估指标体系。目标用户覆盖AI研究人员、大语言模型开发团队、高校人工智能方向师生、智能体研发从业者、游戏AI爱好者、开源AI项目贡献者。使用场景包括LLM长期规划能力验证、程序合成效果测试、资源分配优化算法评估、智能体多步骤决策能力 benchmark 搭建、复杂开放式领域智能体训练数据集构建等,为大语言模型在复杂任务场景下的能力评估提供标准化测试载体。

confident-ai.com
Confident AI 是面向大语言模型应用开发者的开源评估基础设施平台,核心定位是为LLM应用的性能验证与生产落地提供全链路支持。平台支持用户自定义测试用例完成LLM输出评估,内置多维度开源性能指标可量化模型表现,同时提供版本差异跟踪与全链路监控能力。目标用户覆盖LLM应用开发工程师、算法研究员、AI产品经理等群体,可应用于LLM应用原型验证、迭代优化、上线前性能校验、生产环境稳定性监测等多种场景,帮助开发者明确模型优化方向,降低LLM投产的不确定性。

langwatch.ai
LangWatch是面向大型语言模型应用全生命周期的监控、评估与优化平台,核心服务于AI应用开发团队、企业算法部门等用户群体。平台支持LLM应用全链路的运行数据采集,可针对生成内容的准确性、合规性等维度开展自动化评估,还能基于DSPy框架实现提示词与模型组合的智能寻优。开发者可在LLM应用开发迭代阶段用其验证生成效果,上线后用其监控异常输出,还能在版本迭代时快速完成效果对比,助力AI团队降低LLM应用的开发与运维成本,加快产品落地进度。

evidentlyai.com
Evidently AI是专注于机器学习模型全生命周期监控与评估的开源工具平台,核心定位为ML从业者提供数据质量校验、漂移检测、模型性能评估等一站式可观测能力。其核心功能包括支持结构化数据模型与大语言模型应用的多场景评估,内置百余种预设指标与可视化报告模板,可无缝对接本地Python开发环境与云端生产部署链路。目标用户覆盖机器学习工程师、数据科学家、AI产品运维人员、大语言模型应用开发者、科研机构AI研究人员以及企业AI团队。可应用于模型上线前的验证测试、生产环境实时监控告警、大语言模型RAG系统效果迭代、模型合规性审计、团队模型实验效果对比等多个场景。