输入关键词搜索 AI 工具、分类,或直接跳转页面
Berkeley Function-Calling Leaderboard是由加州大学伯克利分校Gorilla团队开发的大语言模型函数调用能力专业评估平台,核心定位是为AI研发领域提供标准化的函数调用性能基准。平台支持多维度模型性能对比、真实场景测试数据集下载、测试场景自定义配置、动态排名更新、能力维度细分评分五大核心功能,面向大语言模型研发人员、AI工具开发者、学术研究人员、AI产品经理、编程工具使用者、AI教育从业者等群体,可用于模型选型参考、研发效果验证、学术研究基准参考、产品技术选型等场景,帮助相关从业者客观了解不同大模型在工具调用、函数执行场景下的实际表现。
访问平台首页:通过官方URL进入排行榜主页面,页面顶部会显示平台的测试标准说明、更新时间等基础信息,可先阅读了解测试的基本规则与评估维度,明确排行榜的评估逻辑。
查看综合排名:页面核心区域展示所有参与测试模型的综合得分排名,默认按综合得分从高到低排序,可点击表头的不同维度名称,切换按对应维度的得分排序,快速定位符合需求的模型。
查看模型详情:点击任意模型的名称即可进入该模型的详情页面,查看其在各个细分测试维度的具体得分、不同场景下的通过率、测试用例的具体表现案例,全面了解模型的能力特点。
下载测试资源:点击页面顶部的「Dataset」按钮,进入数据集下载页面,可选择下载完整测试集、细分场景测试集、原始测试结果等不同类型的资源,按需选择对应版本下载即可。
提交模型测试:若需要测试自研模型,点击页面的「Submit Model」按钮,按照页面提示的接口规范准备模型调用信息,填写相关基础资料后提交申请,测试完成后会通过预留邮箱接收测试报告。
看完教程,直接上手试试
访问 Berkeley Function-Calling Leaderboard 官网