输入关键词搜索 AI 工具、分类,或直接跳转页面
FlagEval是北京智源人工智能研究院推出的AI模型评测平台,核心定位是为大语言模型、多模态模型提供统一标准的评测服务。平台支持多维度模型性能对比、专项领域定制化评测、评测报告自动生成三大核心功能,面向AI研究者、算法工程师、行业产品经理等群体,可应用于模型研发迭代、选型采购、学术研究性能验证等场景,助力AI技术落地与行业生态建设。
访问FlagEval官方网站,点击首页注册按钮,使用邮箱或机构认证信息完成账号注册,验证通过后登录平台进入主界面。
根据待评测模型的类型,在左侧导航栏选择对应的评测任务入口,如大语言模型评测或多模态模型评测。
按照页面指引完成模型接入,开源模型可通过上传模型文件或绑定代码仓库完成部署,闭源模型只需填写API调用密钥与参数配置。
选择评测数据集,可直接使用平台提供的通用基准或专项评测集,也可上传自定义私有测试集,确认后提交评测任务。
等待评测任务完成,在任务中心查看可视化评测结果,下载完整评测报告,还可将结果与平台公开的其他模型性能数据进行对比。
看完教程,直接上手试试
访问 FlagEval 官网