
Humanity's Last Exam 是面向大型语言模型学术能力评估的多模态基准测试平台,由全球多领域专家联合开发。核心功能包括覆盖100余个学科的标准化试题库、支持多模态模型的统一测试流程、自动化生成详细学术能力评估报告。目标用户覆盖AI模型研发团队、高校人工智能研究人员、AI行业评测机构、科技企业算法开发部门等,可用于大模型学术能力摸底测试、不同模型学术能力横向对比、模型迭代效果验证、AI学术评测相关研究等场景,为人工智能技术在学术领域的性能优化提供参考依据。
- 运营状态
- 正常运营
- 地址
- lastexam.ai
- 定价模式
- 平台提供免费版与付费版两种使用方案,免费
- 是否开源
- 闭源
- 适合人群
- AI大模型研发团队、高校人工智能方向研究员、AI评测机构、科技企业算法部门
- 收录时间
- 2026/6/14
- 访问量
- 0 次
编辑点评
这一平台的核心价值在于填补了高难度、跨学科大模型学术基准评测的空白,区别于常规的基础能力测试,它的试题全部由各领域一线专家命制,难度触及学术研究级别的复杂问题,能够测试出大模型在知识深度、推理能力上的真实上限,而非仅考察记忆类的浅层次知识点。封闭式的试题设计也规避了现有很多基准测试存在的试题泄露问题,测试结果的参考价值更高。对于需要真实了解大模型学术能力的研发人员和研究者来说,这个测试能够提供更有说服力的性能数据,帮助用户避免被表面的高分表现误导,更精准地定位模型的优化方向。目前平台已经积累了多个主流大模型的测试数据,用户在完成测试后可以获取到更丰富的横向对比维度,无论是做模型研发还是相关学术研究,都能从中获得有用的参考信息。
核心功能
使用指南
- 1
访问https://lastexam.ai进入平台首页,在导航栏选择评测入口,根据自身需求选择完整测试或自定义测试模式,查看平台的测试规则与提交要求。
- 2
若选择自定义测试,在学科列表中勾选需要评测的学科,设置试题难度范围,确认后生成专属测试子集,获取试题的统一格式说明。
- 3
按照平台提供的接口文档,将待测试的大模型接入平台测试系统,或下载试题包后使用模型批量生成回答,再按照指定格式整理回答文件。
- 4
将模型回答文件上传至平台,确认提交后等待系统自动判分,评测过程中可在个人中心查看测试进度,预计数小时内完成全部判分。
- 5
评测完成后在个人中心查看完整评估报告,可按需导出报告数据,也可选择是否将测试结果匿名纳入平台的模型性能排行榜。
优势与不足
优点4 项
"试题覆盖100余个学科,题源来自全球多机构专家,学科覆盖广度与试题专业度较高"
"采用封闭式试题设计,避免试题被纳入模型训练集,评测结果的客观性更强"
"支持自定义测试子集,可针对特定学科做定向评测,适配垂直类大模型的评测需求"
"自动生成多维度评估报告,明确标注模型知识盲区,为模型优化提供具体方向"
不足3 项
"试题整体难度较高,针对入门级小模型的区分度较低,不适合低参数模型的能力评估"
"目前仅支持英文试题,非英文母语模型的测试结果可能受语言理解能力干扰"
"免费版仅支持最多3个学科的测试,完整全学科测试需要付费使用,成本较高"
定价说明
平台提供免费版与付费版两种使用方案,免费版支持用户选择最多3个学科的试题进行测试,可获取基础的得分报告,不支持数据导出和横向对比功能,适合个人研究者或学生做小范围测试使用。付费版分为学术研究授权与商业使用授权两类,学术研究授权价格为每年299美元,支持全学科测试、完整报告导出、匿名参与排行榜功能,适合高校及非盈利研究机构使用;商业使用授权价格为每年999美元,支持自定义试题上传、多次测试数据对比、专属技术支持,适合企业研发团队使用。
价格和授权政策可能变化,请以官网最新信息为准
适合人群与场景
- AI大模型研发团队
大模型学术能力评测
- 高校人工智能方向研究员
AI学术性能相关研究
- AI评测机构
大模型性能横向对比
- 科技企业算法部门
模型迭代效果验证
- 学术期刊审稿人
AI相关论文性能佐证
- 垂直领域AI产品开发者
领域专项能力评估
- AI行业分析师
大模型技术发展趋势研究
- 计算机专业学生
大模型评测相关课程作业
常见问题
深度了解
在大模型技术快速发展的当下,如何客观评估大模型的学术能力是很多研发团队和研究人员关注的重点,Humanity's Last Exam作为专业的多模态学术基准测试平台,为行业提供了可信度较高的评测方案。该平台的试题由来自全球50个国家超500个机构的近1000名各领域专家共同命制,总题量达3000道,覆盖数学、物理、计算机、人文社科等100余个细分学科,难度从本科延伸至尖端研究级别,能够全面考察大模型在不同学术领域的知识储备与推理能力。
平台采用封闭式试题管理机制,试题不会公开在网络环境中,避免被纳入模型训练数据集,保障测试结果的客观性。同时支持完整全学科测试与自定义测试子集两种模式,用户可根据自身需求选择对应测试方案,无论是全维度评估通用大模型的学术能力,还是定向测试垂直领域大模型的特定学科表现,都能适配。测试完成后系统会自动生成多维度评估报告,包含各学科得分率、知识盲区标注、同类型模型横向对比等数据,为模型迭代优化提供具体的数据支撑。
目前Humanity's Last Exam已经被多个全球知名AI研发团队、高校研究机构采用,其测试数据常被用于AI相关学术论文的性能佐证,是大模型学术能力评测领域的重要参考工具。
Ready to try
准备好体验 Humanity's Last Exam 了吗?
点击下方按钮在新标签页打开官网,开始探索它的全部功能。
相关工具

OpenCompass司南
免费OpenCompass司南是由上海人工智能实验室联合多家机构发起的开源大语言模型评测平台,核心定位为提供中立、可复现的大模型能力评测服务。平台支持超100个主流基准数据集,覆盖知识推理、数学计算、代码生成、语言理解、多模态处理等二十余个能力维度,可满足不同场景下的模型性能核验需求。平台面向大模型研发团队、AI领域研究者、企业技术选型人员、高校相关专业学生等群体,可用于模型研发过程中的能力迭代验证、学术研究中的性能对比、企业落地场景下的模型选型参考等多个场景,同时所有评测流程与数据完全开源,支持用户自定义评测任务配置。

OpenCompass 2.0 Large Language Model Leaderboard
OpenCompass 2.0 Large Language Model Leaderboard是面向大语言模型领域的专业性能评估平台,核心定位是提供中立、多维度的大模型能力评测结果展示。平台支持全球主流大语言模型的多维度能力评估,覆盖语言理解、知识储备、逻辑推理、数学计算、代码开发等多个技能维度,可生成模型综合排名与单项能力得分对比,支持不同模型的横向能力对标。目标用户包含大模型研发人员、AI领域研究者、企业技术选型负责人、AI应用开发者、高校计算机专业师生等群体,可用于大模型研发效果验证、学术研究性能参照、企业落地模型选型、AI应用开发模型匹配等多种场景,为大模型相关的研发、选型、研究工作提供客观的数据参考。
InternThinker
免费InternThinker是上海人工智能实验室研发的强推理AI模型服务平台,核心定位是为用户提供具备长思维链路、自我纠错能力的通用推理服务。平台核心功能包括复杂数学问题求解、多场景代码编写调试、逻辑推理谜题解答三类,可支持用户完成从学术科研到工程开发等多领域的推理类任务。其目标用户覆盖科研人员、开发工程师、在校学生、行业分析师等群体,适用于科研项目数据验证、代码项目逻辑调试、课程作业难题拆解、商业决策逻辑推演等多元场景,能够辅助用户提升复杂问题的处理效率。
AutoGLM沉思
免费AutoGLM沉思是智谱AI推出的面向学术研究与复杂推理场景的AI深度思考工具,核心定位是为用户提供长链路、高精度的逻辑推演服务。核心功能包括分步骤深度推理演算、多维度论点交叉验证、研究思路自动溯源复盘,支持用户上传文献、研究问题、方案框架等素材,工具会模拟人类深度思考的路径逐步推导结论。目标用户覆盖科研人员、高校学生、行业分析师、方案策划人员等,可应用于学术论文论证、复杂问题拆解、行业报告逻辑校验、商业方案可行性推演等场景,帮助用户梳理思考脉络,降低逻辑疏漏的概率。
知网研学AI
免费知网研学AI是中国知网旗下面向学术研究场景的智能化辅助平台,依托知网海量学术文献资源库与大语言模型技术,为用户提供文献解析、内容生成、知识问答等学术相关服务。核心功能包括文献智能解读、学术内容辅助创作、专业知识精准检索,主要面向高校师生、科研人员、学术编辑等群体,可应用于文献精读、论文撰写、课题调研、学术笔记整理等多种学术研究场景,帮助用户降低学术信息获取与内容生产的门槛。
Kaggle
免费Kaggle是谷歌旗下的数据科学与机器学习社区平台,核心定位为连接全球数据从业者,提供竞赛、学习、协作一体化服务。核心功能包括数据科学竞赛举办、公开数据集共享、在线代码运行环境支持。目标用户覆盖学生、数据分析师、算法工程师、高校科研人员等群体,可满足竞赛练手、项目数据集获取、算法模型打磨、专业技能学习、同行业协作交流等多场景需求,用户可在平台内完成从数据获取、模型开发到成果验证的全流程数据科学工作。

星火科研助手
免费星火科研助手是科大讯飞联合中科院文献情报中心推出的AI科研辅助平台,依托认知智能大模型与海量科技文献资源,面向科研全流程提供智能化支持。核心功能包括多源文献检索与汇总、长文档分模块精准解读、学术写作辅助与格式规范校验,同时支持文献综述生成、引用格式自动匹配等实用功能。目标用户覆盖高校学生、科研院所研究人员、企业研发从业者等群体,可应用于课题立项前期的文献调研、论文撰写过程中的内容打磨、海量文献批量研读等多个科研场景,帮助科研人员降低信息梳理成本,提升科研工作的推进效率。
觅果·Migo
免费觅果·Migo是上海人工智能实验室推出的AI驱动学术研究与学习创新平台,核心定位是为学术、教育、办公等领域用户提供智能化知识处理服务。平台具备多模态智能问答、网页辅读、文献结构化阅读、化学科研辅助等核心功能,支持云端多端同步访问,还搭配浏览器插件实现全网页场景的智能服务。目标用户覆盖科研人员、在校学生、教育工作者、化学领域从业者、办公人员、内容创作者等,可应用于文献精读、学术写作、课程学习、实验数据分析、办公文档处理、网页内容整理等多种场景,帮助用户降低信息处理成本,提升知识获取与内容产出的效率。
你是 Humanity's Last Exam 的开发者或团队吗?
认领后可编辑工具信息、获取真实点击数据,并在页面上展示官方认证徽章。
访问第三方工具时,请注意账号、隐私与支付安全
用户评论
0· 0 条