输入关键词搜索 AI 工具、分类,或直接跳转页面

epochai.org
FrontierMath是专注于人工智能数学推理能力评估的基准测试平台,由60余位数学家联合打造,核心用于衡量大语言模型等AI系统解决前沿复杂数学问题的能力上限。平台覆盖代数几何、数论、拓扑学、Zermelo-Fraenkel集合论等现代数学全领域问题,所有测试题均为未公开发表的原创内容,可规避训练数据泄露导致的测试结果失真问题。其目标用户包括AI研发团队、数学研究人员、高校AI相关专业师生,适用于AI数学推理能力迭代测试、前沿数学问题研究辅助、AI大模型能力横向对比评估等场景。
gorilla.cs.berkeley.edu
Berkeley Function-Calling Leaderboard是由加州大学伯克利分校Gorilla团队开发的大语言模型函数调用能力专业评估平台,核心定位是为AI研发领域提供标准化的函数调用性能基准。平台支持多维度模型性能对比、真实场景测试数据集下载、测试场景自定义配置、动态排名更新、能力维度细分评分五大核心功能,面向大语言模型研发人员、AI工具开发者、学术研究人员、AI产品经理、编程工具使用者、AI教育从业者等群体,可用于模型选型参考、研发效果验证、学术研究基准参考、产品技术选型等场景,帮助相关从业者客观了解不同大模型在工具调用、函数执行场景下的实际表现。

mathverse-cuhk.github.io
MATHVERSE是由香港中文大学发起的多模态大语言模型数学能力评估项目,核心定位为提供标准化的视觉数学问题评测基准,帮助开发者测试模型处理含图表类数学题的能力。平台提供包含不同难度、不同题型的视觉数学测试数据集,支持模型输出结果的自动化比对与多维度评分,还可生成可视化的能力短板分析报告。目标用户覆盖大模型研发人员、AI性能评测从业者、高校人工智能方向研究人员、数学教育科技开发者等,可用于多模态大模型迭代优化、学术研究实验验证、数学类AI产品能力测试等场景。