输入关键词搜索 AI 工具、分类,或直接跳转页面
Promptfoo是专注于大语言模型Prompt质量评估与测试的开源工具,核心定位是帮助开发者降低LLM应用的落地风险,提升Prompt的稳定性与有效性。核心功能包括自定义测试用例创建、多维度评估指标配置、Web可视化结果对比,同时支持与现有测试流程、CI/CD pipeline无缝集成。目标用户覆盖LLM应用开发者、AI产品经理、Prompt工程师、算法测试人员等,可应用于对话机器人Prompt调优、RAG系统检索效果验证、AI生成内容合规性检测、多模型输出效果横向对比等多个场景,帮助用户在LLM应用迭代过程中快速定位Prompt的缺陷,减少线上异常问题的出现。
在本地环境通过npm或pip安装promptfoo工具包,安装完成后在终端运行promptfoo init命令,按照引导选择对应的大模型服务商,填写API密钥等基础配置信息,初始化测试项目。
在生成的promptfooconfig.yaml配置文件中,填写需要测试的Prompt内容,支持直接写Prompt文本或引用外部的Prompt文件,同时配置要对比的多个Prompt版本或多个大模型信息。
编写测试用例,可在配置文件的tests字段下逐条添加输入内容与预期规则,也可导入CSV、JSON格式的批量测试数据集,根据测试需求选择对应的评估指标组合。
在终端运行promptfoo eval命令,系统会自动调用大模型运行所有测试用例,根据配置的评估指标计算得分,过程中可实时查看测试进度,等待所有用例运行完成。
运行promptfoo view命令启动本地Web服务,在浏览器打开生成的本地地址即可查看可视化测试报告,对比不同Prompt与模型的输出效果,导出测试数据用于后续优化。
看完教程,直接上手试试
访问 Promptfoo 官网