输入关键词搜索 AI 工具、分类,或直接跳转页面
OpenCompass 2.0 Large Language Model Leaderboard是面向大语言模型领域的专业性能评估平台,核心定位是提供中立、多维度的大模型能力评测结果展示。平台支持全球主流大语言模型的多维度能力评估,覆盖语言理解、知识储备、逻辑推理、数学计算、代码开发等多个技能维度,可生成模型综合排名与单项能力得分对比,支持不同模型的横向能力对标。目标用户包含大模型研发人员、AI领域研究者、企业技术选型负责人、AI应用开发者、高校计算机专业师生等群体,可用于大模型研发效果验证、学术研究性能参照、企业落地模型选型、AI应用开发模型匹配等多种场景,为大模型相关的研发、选型、研究工作提供客观的数据参考。
访问平台首页https://rank.opencompass.org.cn/leaderboard-llm,可直接查看默认的大语言模型综合排行榜,了解当前收录的主流模型的综合得分排名情况。
若需要查看特定维度的模型表现,可点击排行榜上方的维度筛选按钮,选择语言、推理、数学、代码等对应维度,排行榜将自动按照该维度得分重新排序。
若需要对比多个模型的能力差异,可勾选每个模型条目前方的复选框,选择完成后点击页面顶部的“对比”按钮,即可查看多模型的维度得分对比图表。
若需要查看垂直场景的评测结果,可点击页面导航栏的“专项评测”选项,选择医疗、法律、金融等对应垂直领域,查看该场景下的专属排行榜。
若需要了解评测的具体规则,可点击页面底部的“评测方法论”入口,查看完整的评测数据集、评分规则、测试流程说明,也可下载相关评测工具资源。