输入关键词搜索 AI 工具、分类,或直接跳转页面

mmstar-benchmark.github.io
MMStar是面向大型视觉语言模型多模态能力评估的基准测试集平台,核心定位是为多模态模型研发领域提供标准化、低偏差的能力评测方案。平台包含1500个经过人工筛选的视觉语言样本,覆盖6类核心能力与18个细分评估维度,同时提供传统准确率之外的两套新增评估指标,可帮助研究者识别模型数据泄露风险、量化多模态训练带来的实际性能增益。其目标用户涵盖AI领域研究人员、多模态模型开发团队、高校人工智能相关专业师生,可应用于模型迭代效果验证、学术研究实验评测、模型公开能力对比等多种场景。