输入关键词搜索 AI 工具、分类,或直接跳转页面
gorilla.cs.berkeley.edu
Berkeley Function-Calling Leaderboard是由加州大学伯克利分校Gorilla团队开发的大语言模型函数调用能力专业评估平台,核心定位是为AI研发领域提供标准化的函数调用性能基准。平台支持多维度模型性能对比、真实场景测试数据集下载、测试场景自定义配置、动态排名更新、能力维度细分评分五大核心功能,面向大语言模型研发人员、AI工具开发者、学术研究人员、AI产品经理、编程工具使用者、AI教育从业者等群体,可用于模型选型参考、研发效果验证、学术研究基准参考、产品技术选型等场景,帮助相关从业者客观了解不同大模型在工具调用、函数执行场景下的实际表现。

mathverse-cuhk.github.io
MATHVERSE是由香港中文大学发起的多模态大语言模型数学能力评估项目,核心定位为提供标准化的视觉数学问题评测基准,帮助开发者测试模型处理含图表类数学题的能力。平台提供包含不同难度、不同题型的视觉数学测试数据集,支持模型输出结果的自动化比对与多维度评分,还可生成可视化的能力短板分析报告。目标用户覆盖大模型研发人员、AI性能评测从业者、高校人工智能方向研究人员、数学教育科技开发者等,可用于多模态大模型迭代优化、学术研究实验验证、数学类AI产品能力测试等场景。