
MATHVERSE是由香港中文大学发起的多模态大语言模型数学能力评估项目,核心定位为提供标准化的视觉数学问题评测基准,帮助开发者测试模型处理含图表类数学题的能力。平台提供包含不同难度、不同题型的视觉数学测试数据集,支持模型输出结果的自动化比对与多维度评分,还可生成可视化的能力短板分析报告。目标用户覆盖大模型研发人员、AI性能评测从业者、高校人工智能方向研究人员、数学教育科技开发者等,可用于多模态大模型迭代优化、学术研究实验验证、数学类AI产品能力测试等场景。
- 运营状态
- 正常运营
- 地址
- mathverse-cuhk.github.io
- 定价模式
- 免费
- 支持平台
- Web 网页
- 是否开源
- 闭源
- 适合人群
- 多模态大模型研发人员、AI评测领域从业者、高校人工智能方向研究者、数学教育科技产品开发者
- 收录时间
- 2026/6/14
- 访问量
- 0 次
编辑点评
这是一个聚焦多模态大模型视觉数学能力评测的学术类项目平台,和通用的大模型评测工具不同,它专门针对含图表、图像信息的数学问题场景,填补了现有评测基准在跨模态数学推理能力测试上的空白。平台提供的测试集覆盖了从基础几何题到复杂高等数学图表题的多个难度层级,不仅有标准化的评分体系,还公开了多个主流模型的测试基线数据,对于从事多模态大模型研发、AI推理能力研究的人员来说,是很有参考价值的评测工具。目前平台的所有公开测试集都可免费申请用于非商业研究,同时支持用户自定义扩充测试集,适配不同细分研究场景的需求,对于相关领域的学术研究和产品开发都能提供有效的数据支撑。
核心功能
使用指南
- 1
访问MATHVERSE官方网站,在首页导航栏找到“Dataset”板块,浏览测试集的题型、难度、覆盖知识点等基本信息,确认该评测基准符合自身使用需求。
- 2
点击数据集下载入口,按照页面提示填写相关使用申请信息,提交后获取公开测试集的下载权限,将测试集文件保存到本地。
- 3
使用下载的测试集对待评测的多模态大语言模型进行测试,整理模型的答题结果,按照平台要求的格式生成统一的结果文件。
- 4
回到网站找到“Evaluation”板块,上传整理好的模型答题结果文件,选择需要的评测维度和比对基准,提交评测请求等待系统处理。
- 5
评测完成后在个人中心查看完整的评测报告,可在线浏览各维度得分、错误分析、横向对比数据,也可将报告导出到本地保存使用。
优势与不足
优点5 项
"测试集分类精细,覆盖不同难度、不同题型的视觉数学问题,可适配不同能力层级模型的评测需求"
"评测维度全面,不仅判断答案正确性,还对图表解析、逻辑推导等环节进行评分,结果参考性强"
"公开主流多模态模型的基线测试结果,方便用户做横向对比,无需重复测试已有公开模型"
"支持用户自定义上传测试题目,可生成专属评测基准,满足细分研究场景的个性化需求"
"非商业研究场景可免费使用公开测试集,学术友好度较高"
不足4 项
"网站界面仅支持英文,对不熟悉英文的国内用户使用存在一定门槛"
"自定义评测功能需要用户自行适配结果上传格式,没有提供配套的测试调用SDK,使用成本较高"
"公开测试集中高等数学阶段的题型占比相对较少,针对前沿学术研究的覆盖度有待提升"
"暂不支持在线直接调用模型进行测试,需要用户本地完成测试后再上传结果,流程不够便捷"
定价说明
该项目面向非商业学术研究场景提供免费版本,免费版本可下载全部公开测试集,使用基础的自动评测、结果比对、报告生成功能,无使用次数限制,仅需要在使用时标注项目来源。目前无商业付费版本,商业场景使用需要提前联系项目团队申请授权,根据具体使用场景和需求协商授权方式,建议非商业研究的用户直接使用免费版本即可满足评测需求。
价格和授权政策可能变化,请以官网最新信息为准
适合人群与场景
- 多模态大模型研发人员
模型能力测试场景
- AI评测领域从业者
基准测试搭建场景
- 高校人工智能方向研究者
学术实验验证场景
- 数学教育科技产品开发者
智能解题产品测试场景
- 计算机视觉方向研究者
图表语义理解研究场景
- 自然语言处理方向研究者
多模态推理研究场景
- 科技企业AI技术团队
模型选型对比场景
常见问题
深度了解
随着多模态大语言模型的快速发展,针对模型跨模态推理能力的评测需求不断提升,尤其是处理含图表信息的数学问题的能力,成为衡量多模态模型综合推理能力的重要指标。MATHVERSE作为专注于视觉数学能力的评测基准,为相关领域的研发和研究人员提供了标准化的测试工具。平台的测试集覆盖几何、代数、统计、微积分等多个数学领域,包含几何图形题、函数图像题、统计图表题、实物场景数学题等多种题型,难度从基础教育阶段延伸到高等教育阶段,可适配不同能力层级的多模态模型评测需求。用户使用MATHVERSE可快速完成模型视觉数学能力的全方位评测,不仅能获得整体正确率数据,还能得到图表识别、知识点应用、逻辑推导等细分维度的得分,清晰定位模型的能力短板,为模型迭代优化提供方向。同时平台公开多个主流多模态模型的基线测试结果,方便用户进行横向对比,了解待测试模型在同类产品中的能力位置。对于从事多模态大模型研发、AI推理能力研究、数学教育科技产品开发的人员来说,MATHVERSE是实用的评测工具,目前非商业研究场景可免费申请使用公开测试集,还支持自定义扩充测试题目,满足不同细分研究场景的需求。
Ready to try
准备好体验 MATHVERSE 了吗?
点击下方按钮在新标签页打开官网,开始探索它的全部功能。
相关工具
InternThinker
免费InternThinker是上海人工智能实验室研发的强推理AI模型服务平台,核心定位是为用户提供具备长思维链路、自我纠错能力的通用推理服务。平台核心功能包括复杂数学问题求解、多场景代码编写调试、逻辑推理谜题解答三类,可支持用户完成从学术科研到工程开发等多领域的推理类任务。其目标用户覆盖科研人员、开发工程师、在校学生、行业分析师等群体,适用于科研项目数据验证、代码项目逻辑调试、课程作业难题拆解、商业决策逻辑推演等多元场景,能够辅助用户提升复杂问题的处理效率。
AutoGLM沉思
免费AutoGLM沉思是智谱AI推出的面向学术研究与复杂推理场景的AI深度思考工具,核心定位是为用户提供长链路、高精度的逻辑推演服务。核心功能包括分步骤深度推理演算、多维度论点交叉验证、研究思路自动溯源复盘,支持用户上传文献、研究问题、方案框架等素材,工具会模拟人类深度思考的路径逐步推导结论。目标用户覆盖科研人员、高校学生、行业分析师、方案策划人员等,可应用于学术论文论证、复杂问题拆解、行业报告逻辑校验、商业方案可行性推演等场景,帮助用户梳理思考脉络,降低逻辑疏漏的概率。

星火科研助手
免费星火科研助手是科大讯飞联合中科院文献情报中心推出的AI科研辅助平台,依托认知智能大模型与海量科技文献资源,面向科研全流程提供智能化支持。核心功能包括多源文献检索与汇总、长文档分模块精准解读、学术写作辅助与格式规范校验,同时支持文献综述生成、引用格式自动匹配等实用功能。目标用户覆盖高校学生、科研院所研究人员、企业研发从业者等群体,可应用于课题立项前期的文献调研、论文撰写过程中的内容打磨、海量文献批量研读等多个科研场景,帮助科研人员降低信息梳理成本,提升科研工作的推进效率。

OpenCompass司南
免费OpenCompass司南是由上海人工智能实验室联合多家机构发起的开源大语言模型评测平台,核心定位为提供中立、可复现的大模型能力评测服务。平台支持超100个主流基准数据集,覆盖知识推理、数学计算、代码生成、语言理解、多模态处理等二十余个能力维度,可满足不同场景下的模型性能核验需求。平台面向大模型研发团队、AI领域研究者、企业技术选型人员、高校相关专业学生等群体,可用于模型研发过程中的能力迭代验证、学术研究中的性能对比、企业落地场景下的模型选型参考等多个场景,同时所有评测流程与数据完全开源,支持用户自定义评测任务配置。
Kaggle
免费Kaggle是谷歌旗下的数据科学与机器学习社区平台,核心定位为连接全球数据从业者,提供竞赛、学习、协作一体化服务。核心功能包括数据科学竞赛举办、公开数据集共享、在线代码运行环境支持。目标用户覆盖学生、数据分析师、算法工程师、高校科研人员等群体,可满足竞赛练手、项目数据集获取、算法模型打磨、专业技能学习、同行业协作交流等多场景需求,用户可在平台内完成从数据获取、模型开发到成果验证的全流程数据科学工作。

OpenCompass 2.0 Large Language Model Leaderboard
OpenCompass 2.0 Large Language Model Leaderboard是面向大语言模型领域的专业性能评估平台,核心定位是提供中立、多维度的大模型能力评测结果展示。平台支持全球主流大语言模型的多维度能力评估,覆盖语言理解、知识储备、逻辑推理、数学计算、代码开发等多个技能维度,可生成模型综合排名与单项能力得分对比,支持不同模型的横向能力对标。目标用户包含大模型研发人员、AI领域研究者、企业技术选型负责人、AI应用开发者、高校计算机专业师生等群体,可用于大模型研发效果验证、学术研究性能参照、企业落地模型选型、AI应用开发模型匹配等多种场景,为大模型相关的研发、选型、研究工作提供客观的数据参考。
知网研学AI
免费知网研学AI是中国知网旗下面向学术研究场景的智能化辅助平台,依托知网海量学术文献资源库与大语言模型技术,为用户提供文献解析、内容生成、知识问答等学术相关服务。核心功能包括文献智能解读、学术内容辅助创作、专业知识精准检索,主要面向高校师生、科研人员、学术编辑等群体,可应用于文献精读、论文撰写、课题调研、学术笔记整理等多种学术研究场景,帮助用户降低学术信息获取与内容生产的门槛。
觅果·Migo
免费觅果·Migo是上海人工智能实验室推出的AI驱动学术研究与学习创新平台,核心定位是为学术、教育、办公等领域用户提供智能化知识处理服务。平台具备多模态智能问答、网页辅读、文献结构化阅读、化学科研辅助等核心功能,支持云端多端同步访问,还搭配浏览器插件实现全网页场景的智能服务。目标用户覆盖科研人员、在校学生、教育工作者、化学领域从业者、办公人员、内容创作者等,可应用于文献精读、学术写作、课程学习、实验数据分析、办公文档处理、网页内容整理等多种场景,帮助用户降低信息处理成本,提升知识获取与内容产出的效率。
你是 MATHVERSE 的开发者或团队吗?
认领后可编辑工具信息、获取真实点击数据,并在页面上展示官方认证徽章。
访问第三方工具时,请注意账号、隐私与支付安全

用户评论
0· 0 条