OpenCompass司南是由上海人工智能实验室联合多家机构发起的开源大语言模型评测平台,核心定位为提供中立、可复现的大模型能力评测服务。平台支持超100个主流基准数据集,覆盖知识推理、数学计算、代码生成、语言理解、多模态处理等二十余个能力维度,可满足不同场景下的模型性能核验需求。平台面向大模型研发团队、AI领域研究者、企业技术选型人员、高校相关专业学生等群体,可用于模型研发过程中的能力迭代验证、学术研究中的性能对比、企业落地场景下的模型选型参考等多个场景,同时所有评测流程与数据完全开源,支持用户自定义评测任务配置。
- 运营状态
- 正常运营
- 地址
- rank.opencompass.org.cn
- 定价模式
- 基础功能免费
- 支持平台
- Web 网页
- 是否开源
- 开源
- 适合人群
- 大模型研发团队、AI领域研究者、企业技术负责人、高校人工智能专业学生
- 收录时间
- 2026/6/13
- 访问量
- 0 次
编辑点评
这是一个专注于大语言模型评测的开源平台,不同于商业机构发布的带有倾向性的模型榜单,该平台的所有评测流程、数据集、计算逻辑完全公开,所有结果都支持第三方复现,中立性是其核心特点。平台覆盖的评测维度非常全面,不仅包含通用的语言理解、知识问答维度,还针对垂直场景设置了医疗、法律、代码等专项评测数据集,无论是做通用大模型研发还是垂直领域模型适配,都能找到对应的评测基准。平台还支持高度自定义的评测配置,用户可以上传自己的业务数据集,对不同模型进行针对性测试,解决了通用评测结果与实际业务场景匹配度低的问题。对于需要选型大模型的企业来说,这个平台的对比分析功能可以直观呈现不同模型在多个维度的差异,减少选型过程中的盲目性,对于研究人员来说,开源的评测框架也可以直接复用,减少重复开发的成本。
核心功能
使用指南
- 1
访问https://rank.opencompass.org.cn进入平台主页,无需注册即可查看公开的模型排行榜与基础评测数据,可通过顶部导航栏快速切换不同维度的榜单分类,浏览各模型的基础性能信息。
- 2
若需要使用自定义评测或对比功能,点击右上角注册按钮,通过邮箱完成账号注册与验证,登录后可解锁所有功能权限,个人用户无需资质审核即可使用基础服务,企业团队可申请专属团队空间。
- 3
开展模型评测时,可选择平台预设的评测方案,也可自定义选择评测数据集、待评测模型、运行参数,确认配置后提交评测任务,系统会自动调度资源执行,用户可在个人中心实时查看任务进度。
- 4
任务完成后,在个人中心的任务列表中查看评测报告,可切换不同数据可视化形式查看结果,也可选择多个模型生成对比分析报告,所有数据支持CSV、PDF等格式导出。
- 5
若需要复现公开评测结果,可进入对应模型的评测详情页,下载完整的复现包与说明文档,按照文档指引在本地环境中运行,遇到问题可查阅社区文档或提交issue寻求协助。
优势与不足
优点5 项
"所有评测流程与数据完全开源,支持第三方自主复现,评测结果中立性较强"
"覆盖超100个基准数据集,包含二十余个能力维度,评测覆盖范围较广"
"支持自定义评测配置,可上传私有数据集调整评测参数,适配个性化评测需求"
"提供多模型对比分析功能,可生成可视化对比报告,方便选型与研究使用"
"配套完善的开源工具库与社区支持,用户可贡献新的评测资源,参与平台迭代"
不足4 项
"部分高复杂度评测任务运行时间较长,资源紧张时需要排队等待调度"
"自定义评测功能需要用户具备一定的大模型相关技术基础,上手门槛较高"
"部分垂直领域的专项评测数据集数量较少,难以满足非常细分的行业评测需求"
"闭源商用模型的评测依赖厂商提供的API接口,若厂商调整接口可能影响旧评测结果的复现性"
定价说明
平台基础功能完全免费,未注册用户可查看所有公开榜单与评测报告,注册个人用户可免费使用公共评测资源、提交自定义评测任务、使用多模型对比功能,免费版用户提交的公共资源评测任务有每日3次的数量限制,单任务最大支持1000条样本数据。付费版分为团队版与企业定制版,团队版每月费用为2999元,可提升每日任务提交上限至20次,单任务最大支持10万条样本,同时提供100G的私有数据集存储空间,适合中小团队的模型研发与选型需求。企业定制版根据实际需求报价,可提供专属计算资源集群、私有部署服务、定制化评测指标开发、专属技术支持,适合有大量评测需求或者数据安全要求较高的大型企业与研究机构。
价格和授权政策可能变化,请以官网最新信息为准
适合人群与场景
- 大模型研发团队
模型迭代阶段的性能验证
- AI领域研究者
学术研究中的模型性能对比
- 企业技术负责人
AI落地场景的模型选型
- 高校人工智能专业学生
大模型相关课程学习
- AI产品经理
不同模型能力边界调研
- 开源AI社区贡献者
评测方法与数据集迭代
- 行业解决方案服务商
垂直场景模型适配验证
- 科技行业分析师
大模型产业发展研究
常见问题
深度了解
在大模型产业快速发展的当下,如何客观评估不同大模型的能力、选择适配业务场景的模型,是很多研发团队、企业与研究者面临的共性问题。OpenCompass司南作为开源大模型评测平台,为用户提供了中立、可复现的评测服务,有效解决了大模型性能评估的痛点。平台目前覆盖超100个主流基准数据集,包含知识推理、数学计算、代码生成、语言理解、多模态处理等二十余个能力维度,无论是通用大模型的整体能力评估,还是垂直领域模型的专项能力测试,都能找到对应的评测基准。平台的公开性能排行榜动态更新,用户可按照模型类型、评测维度、发布时间筛选,所有榜单数据均支持下载,方便用于研究报告与选型方案。针对个性化评测需求,平台支持用户上传私有数据集、调整评测参数、自定义prompt模板,生成专属评测报告,还可同时选择多个模型生成可视化对比分析,直观呈现不同模型的能力差异。所有评测流程与工具完全开源,用户可下载复现包在本地验证结果,也可参与社区贡献,共同迭代评测体系。对于大模型研发团队,可通过平台的评测结果验证模型迭代效果,对比同类型模型的优劣;对于企业技术选型人员,可基于真实业务数据测试不同模型的适配性,降低选型风险;对于AI领域研究者,可复用开源评测框架,减少重复开发成本,专注于研究本身。随着大模型技术的持续发展,OpenCompass司南也会不断扩充评测维度与数据集,为产业提供更全面的大模型评测服务。
Ready to try
准备好体验 OpenCompass司南 了吗?
点击下方按钮在新标签页打开官网,开始探索它的全部功能。
相关工具

OpenCompass 2.0 Large Language Model Leaderboard
OpenCompass 2.0 Large Language Model Leaderboard是面向大语言模型领域的专业性能评估平台,核心定位是提供中立、多维度的大模型能力评测结果展示。平台支持全球主流大语言模型的多维度能力评估,覆盖语言理解、知识储备、逻辑推理、数学计算、代码开发等多个技能维度,可生成模型综合排名与单项能力得分对比,支持不同模型的横向能力对标。目标用户包含大模型研发人员、AI领域研究者、企业技术选型负责人、AI应用开发者、高校计算机专业师生等群体,可用于大模型研发效果验证、学术研究性能参照、企业落地模型选型、AI应用开发模型匹配等多种场景,为大模型相关的研发、选型、研究工作提供客观的数据参考。
InternThinker
免费InternThinker是上海人工智能实验室研发的强推理AI模型服务平台,核心定位是为用户提供具备长思维链路、自我纠错能力的通用推理服务。平台核心功能包括复杂数学问题求解、多场景代码编写调试、逻辑推理谜题解答三类,可支持用户完成从学术科研到工程开发等多领域的推理类任务。其目标用户覆盖科研人员、开发工程师、在校学生、行业分析师等群体,适用于科研项目数据验证、代码项目逻辑调试、课程作业难题拆解、商业决策逻辑推演等多元场景,能够辅助用户提升复杂问题的处理效率。
AutoGLM沉思
免费AutoGLM沉思是智谱AI推出的面向学术研究与复杂推理场景的AI深度思考工具,核心定位是为用户提供长链路、高精度的逻辑推演服务。核心功能包括分步骤深度推理演算、多维度论点交叉验证、研究思路自动溯源复盘,支持用户上传文献、研究问题、方案框架等素材,工具会模拟人类深度思考的路径逐步推导结论。目标用户覆盖科研人员、高校学生、行业分析师、方案策划人员等,可应用于学术论文论证、复杂问题拆解、行业报告逻辑校验、商业方案可行性推演等场景,帮助用户梳理思考脉络,降低逻辑疏漏的概率。
知网研学AI
免费知网研学AI是中国知网旗下面向学术研究场景的智能化辅助平台,依托知网海量学术文献资源库与大语言模型技术,为用户提供文献解析、内容生成、知识问答等学术相关服务。核心功能包括文献智能解读、学术内容辅助创作、专业知识精准检索,主要面向高校师生、科研人员、学术编辑等群体,可应用于文献精读、论文撰写、课题调研、学术笔记整理等多种学术研究场景,帮助用户降低学术信息获取与内容生产的门槛。

星火科研助手
免费星火科研助手是科大讯飞联合中科院文献情报中心推出的AI科研辅助平台,依托认知智能大模型与海量科技文献资源,面向科研全流程提供智能化支持。核心功能包括多源文献检索与汇总、长文档分模块精准解读、学术写作辅助与格式规范校验,同时支持文献综述生成、引用格式自动匹配等实用功能。目标用户覆盖高校学生、科研院所研究人员、企业研发从业者等群体,可应用于课题立项前期的文献调研、论文撰写过程中的内容打磨、海量文献批量研读等多个科研场景,帮助科研人员降低信息梳理成本,提升科研工作的推进效率。
Kaggle
免费Kaggle是谷歌旗下的数据科学与机器学习社区平台,核心定位为连接全球数据从业者,提供竞赛、学习、协作一体化服务。核心功能包括数据科学竞赛举办、公开数据集共享、在线代码运行环境支持。目标用户覆盖学生、数据分析师、算法工程师、高校科研人员等群体,可满足竞赛练手、项目数据集获取、算法模型打磨、专业技能学习、同行业协作交流等多场景需求,用户可在平台内完成从数据获取、模型开发到成果验证的全流程数据科学工作。
觅果·Migo
免费觅果·Migo是上海人工智能实验室推出的AI驱动学术研究与学习创新平台,核心定位是为学术、教育、办公等领域用户提供智能化知识处理服务。平台具备多模态智能问答、网页辅读、文献结构化阅读、化学科研辅助等核心功能,支持云端多端同步访问,还搭配浏览器插件实现全网页场景的智能服务。目标用户覆盖科研人员、在校学生、教育工作者、化学领域从业者、办公人员、内容创作者等,可应用于文献精读、学术写作、课程学习、实验数据分析、办公文档处理、网页内容整理等多种场景,帮助用户降低信息处理成本,提升知识获取与内容产出的效率。
AMiner
免费AMiner是面向学术领域的智能科研服务平台,依托人工智能技术为科研人员提供学术文献检索、学者画像分析、研究趋势挖掘等服务。核心功能包括多语种文献跨库检索、学者影响力多维度评估、前沿领域研究动态追踪。目标用户覆盖高校学生、科研工作者、高校科研管理部门、企业研发人员等群体,可应用于文献调研、学者合作匹配、科研项目申报、学科建设规划等多个场景,助力科研工作者提升信息获取效率,降低学术调研的时间成本。
你是 OpenCompass司南 的开发者或团队吗?
认领后可编辑工具信息、获取真实点击数据,并在页面上展示官方认证徽章。
访问第三方工具时,请注意账号、隐私与支付安全

用户评论
0· 0 条