输入关键词搜索 AI 工具、分类,或直接跳转页面
MATHVERSE是由香港中文大学发起的多模态大语言模型数学能力评估项目,核心定位为提供标准化的视觉数学问题评测基准,帮助开发者测试模型处理含图表类数学题的能力。平台提供包含不同难度、不同题型的视觉数学测试数据集,支持模型输出结果的自动化比对与多维度评分,还可生成可视化的能力短板分析报告。目标用户覆盖大模型研发人员、AI性能评测从业者、高校人工智能方向研究人员、数学教育科技开发者等,可用于多模态大模型迭代优化、学术研究实验验证、数学类AI产品能力测试等场景。
访问MATHVERSE官方网站,在首页导航栏找到“Dataset”板块,浏览测试集的题型、难度、覆盖知识点等基本信息,确认该评测基准符合自身使用需求。
点击数据集下载入口,按照页面提示填写相关使用申请信息,提交后获取公开测试集的下载权限,将测试集文件保存到本地。
使用下载的测试集对待评测的多模态大语言模型进行测试,整理模型的答题结果,按照平台要求的格式生成统一的结果文件。
回到网站找到“Evaluation”板块,上传整理好的模型答题结果文件,选择需要的评测维度和比对基准,提交评测请求等待系统处理。
评测完成后在个人中心查看完整的评测报告,可在线浏览各维度得分、错误分析、横向对比数据,也可将报告导出到本地保存使用。
看完教程,直接上手试试
访问 MATHVERSE 官网