输入关键词搜索 AI 工具、分类,或直接跳转页面
Humanity's Last Exam 是面向大型语言模型学术能力评估的多模态基准测试平台,由全球多领域专家联合开发。核心功能包括覆盖100余个学科的标准化试题库、支持多模态模型的统一测试流程、自动化生成详细学术能力评估报告。目标用户覆盖AI模型研发团队、高校人工智能研究人员、AI行业评测机构、科技企业算法开发部门等,可用于大模型学术能力摸底测试、不同模型学术能力横向对比、模型迭代效果验证、AI学术评测相关研究等场景,为人工智能技术在学术领域的性能优化提供参考依据。
访问https://lastexam.ai进入平台首页,在导航栏选择评测入口,根据自身需求选择完整测试或自定义测试模式,查看平台的测试规则与提交要求。
若选择自定义测试,在学科列表中勾选需要评测的学科,设置试题难度范围,确认后生成专属测试子集,获取试题的统一格式说明。
按照平台提供的接口文档,将待测试的大模型接入平台测试系统,或下载试题包后使用模型批量生成回答,再按照指定格式整理回答文件。
将模型回答文件上传至平台,确认提交后等待系统自动判分,评测过程中可在个人中心查看测试进度,预计数小时内完成全部判分。
评测完成后在个人中心查看完整评估报告,可按需导出报告数据,也可选择是否将测试结果匿名纳入平台的模型性能排行榜。
看完教程,直接上手试试
访问 Humanity's Last Exam 官网