输入关键词搜索 AI 工具、分类,或直接跳转页面
MMStar是面向大型视觉语言模型多模态能力评估的基准测试集平台,核心定位是为多模态模型研发领域提供标准化、低偏差的能力评测方案。平台包含1500个经过人工筛选的视觉语言样本,覆盖6类核心能力与18个细分评估维度,同时提供传统准确率之外的两套新增评估指标,可帮助研究者识别模型数据泄露风险、量化多模态训练带来的实际性能增益。其目标用户涵盖AI领域研究人员、多模态模型开发团队、高校人工智能相关专业师生,可应用于模型迭代效果验证、学术研究实验评测、模型公开能力对比等多种场景。
访问MMStar官方网站,在首页导航栏找到“资源下载”板块,下载完整的测试样本集与标注文件,确认样本的使用规范与授权范围。
根据研究需求筛选对应维度的测试样本,使用待评估的多模态模型完成所有样本的推理,按照平台要求的格式整理推理结果文件。
进入网站的“在线评测”板块,上传整理好的模型推理结果文件,填写模型基础信息与相关实验参数,提交评测请求。
等待系统完成自动计算,期间可在“我的任务”板块查看评测进度,通常15分钟内即可生成完整的评测报告。
下载评测报告,查看准确率、数据泄露风险值、多模态增益等核心指标,以及各细分维度的能力得分,可与平台公开的基准模型结果做对比分析。
看完教程,直接上手试试
访问 MMStar 官网