输入关键词搜索 AI 工具、分类,或直接跳转页面
OpenCompass司南是由上海人工智能实验室联合多家机构发起的开源大语言模型评测平台,核心定位为提供中立、可复现的大模型能力评测服务。平台支持超100个主流基准数据集,覆盖知识推理、数学计算、代码生成、语言理解、多模态处理等二十余个能力维度,可满足不同场景下的模型性能核验需求。平台面向大模型研发团队、AI领域研究者、企业技术选型人员、高校相关专业学生等群体,可用于模型研发过程中的能力迭代验证、学术研究中的性能对比、企业落地场景下的模型选型参考等多个场景,同时所有评测流程与数据完全开源,支持用户自定义评测任务配置。
访问https://rank.opencompass.org.cn进入平台主页,无需注册即可查看公开的模型排行榜与基础评测数据,可通过顶部导航栏快速切换不同维度的榜单分类,浏览各模型的基础性能信息。
若需要使用自定义评测或对比功能,点击右上角注册按钮,通过邮箱完成账号注册与验证,登录后可解锁所有功能权限,个人用户无需资质审核即可使用基础服务,企业团队可申请专属团队空间。
开展模型评测时,可选择平台预设的评测方案,也可自定义选择评测数据集、待评测模型、运行参数,确认配置后提交评测任务,系统会自动调度资源执行,用户可在个人中心实时查看任务进度。
任务完成后,在个人中心的任务列表中查看评测报告,可切换不同数据可视化形式查看结果,也可选择多个模型生成对比分析报告,所有数据支持CSV、PDF等格式导出。
若需要复现公开评测结果,可进入对应模型的评测详情页,下载完整的复现包与说明文档,按照文档指引在本地环境中运行,遇到问题可查阅社区文档或提交issue寻求协助。
看完教程,直接上手试试
访问 OpenCompass司南 官网