
Berkeley Function-Calling Leaderboard是由加州大学伯克利分校Gorilla团队开发的大语言模型函数调用能力专业评估平台,核心定位是为AI研发领域提供标准化的函数调用性能基准。平台支持多维度模型性能对比、真实场景测试数据集下载、测试场景自定义配置、动态排名更新、能力维度细分评分五大核心功能,面向大语言模型研发人员、AI工具开发者、学术研究人员、AI产品经理、编程工具使用者、AI教育从业者等群体,可用于模型选型参考、研发效果验证、学术研究基准参考、产品技术选型等场景,帮助相关从业者客观了解不同大模型在工具调用、函数执行场景下的实际表现。
- 运营状态
- 正常运营
- 地址
- gorilla.cs.berkeley.edu
- 定价模式
- 免费
- 支持平台
- Web 网页
- 是否开源
- 闭源
- 适合人群
- 大语言模型研发人员、AI学术研究人员、AI工具开发者、AI产品经理
- 收录时间
- 2026/6/14
- 访问量
- 0 次
编辑点评
这是由出色高校计算机团队开发的垂直领域评估基准平台,区别于通用大模型综合性能排行榜,它聚焦于函数调用这一细分能力,所有测试用例均来自真实开发场景,评估维度覆盖了从基础参数匹配到复杂多轮调用的全场景需求,测试标准公开透明,所有测试数据均可免费下载复用。对于关注大模型工具调用能力的从业者而言,这个平台的参考价值高于通用排行榜,其细分维度的评分能够帮助用户精准匹配不同应用场景的模型需求,同时开放的测试数据集也为相关研究提供了标准化的基准,避免了不同团队自行构建测试集带来的结果不可比问题。平台的更新频率较高,能够及时反映新模型的性能表现,是AI研发和落地过程中值得参考的标准化评估资源。
核心功能
使用指南
- 1
访问平台首页:通过官方URL进入排行榜主页面,页面顶部会显示平台的测试标准说明、更新时间等基础信息,可先阅读了解测试的基本规则与评估维度,明确排行榜的评估逻辑。
- 2
查看综合排名:页面核心区域展示所有参与测试模型的综合得分排名,默认按综合得分从高到低排序,可点击表头的不同维度名称,切换按对应维度的得分排序,快速定位符合需求的模型。
- 3
查看模型详情:点击任意模型的名称即可进入该模型的详情页面,查看其在各个细分测试维度的具体得分、不同场景下的通过率、测试用例的具体表现案例,全面了解模型的能力特点。
- 4
下载测试资源:点击页面顶部的「Dataset」按钮,进入数据集下载页面,可选择下载完整测试集、细分场景测试集、原始测试结果等不同类型的资源,按需选择对应版本下载即可。
- 5
提交模型测试:若需要测试自研模型,点击页面的「Submit Model」按钮,按照页面提示的接口规范准备模型调用信息,填写相关基础资料后提交申请,测试完成后会通过预留邮箱接收测试报告。
优势与不足
优点5 项
"评估维度聚焦函数调用细分场景,测试标准贴合真实开发需求,参考性强"
"所有测试数据集、原始测试结果完全公开,支持免费下载复用"
"支持自定义模型提交测试,自研模型团队可便捷获取标准化评估报告"
"测试结果包含多维度细分评分,可精准定位不同模型的能力优势与短板"
"更新频率稳定,新发布的主流模型会被及时纳入测试范围,结果时效性强"
不足4 项
"仅支持英文函数调用场景测试,暂未覆盖中文语境下的函数调用需求"
"页面无多语言版本,对非英语使用者的友好度不足"
"自定义测试提交的审核周期较长,通常需要3-7个工作日才能完成测试"
"暂不支持用户上传自定义测试用例进行定向模型评估"
定价说明
该平台所有公开功能均面向用户免费开放,无付费版本。免费版支持无限制查看所有公开模型的排名、详情得分,可免费下载全部测试数据集,也可免费提交自研模型的测试申请,无功能使用限制,也无使用次数限制。适合所有需要评估大语言模型函数调用能力的用户使用,无需支付任何费用即可获取全部公开资源与服务。
价格和授权政策可能变化,请以官网最新信息为准
适合人群与场景
- 大语言模型研发人员
模型性能评估场景
- AI学术研究人员
函数调用能力研究场景
- AI工具开发者
模型选型场景
- AI产品经理
产品技术选型场景
- AI教育从业者
大模型能力教学场景
- 企业技术负责人
AI技术落地选型场景
- 开源模型贡献者
模型优化效果验证场景
- AI领域爱好者
大模型能力了解场景
常见问题
深度了解
Berkeley Function-Calling Leaderboard作为专注于大语言模型函数调用能力的评估平台,为AI研发领域提供了标准化的性能基准。当前大模型在工具调用、AI代理、自动化工作流等场景的应用越来越广泛,函数调用能力是影响这类应用落地效果的核心指标,而通用大模型排行榜无法精准反映模型在这一细分场景的表现,该平台的出现填补了这一空白。平台的测试用例全部来自真实开发场景,覆盖API调用、多轮工具调用、参数校验、错误处理等10余种常见的函数调用场景,评估维度包含函数名称匹配准确率、参数格式正确率、上下文连贯性等多个细分项,测试结果能够真实反映模型在实际应用中的表现。平台支持用户按参数规模、模型厂商、测试场景等维度筛选对比不同模型的表现,所有测试数据和用例均采用开源协议开放下载,用户可以基于数据集开展自定义测试、模型训练等工作。同时平台支持自研模型提交测试,研发团队可以获取标准化的评估报告,帮助优化模型性能。平台每两周更新一次内容,及时纳入新发布的大模型,更新测试用例库,保证结果的时效性,是大模型研发、AI应用落地、学术研究过程中值得参考的垂直评估资源。
Ready to try
准备好体验 Berkeley Function-Calling Leaderboard 了吗?
点击下方按钮在新标签页打开官网,开始探索它的全部功能。
相关工具

通义千问
免费通义千问是阿里巴巴推出的大语言模型,核心定位是面向多场景的智能交互与内容生成工具。它支持文本内容创作与润色,可根据用户需求生成不同风格的文案、报告、脚本等内容,也能对现有文本进行优化调整;具备多模态理解能力,可识别图片、音频等多类型输入内容并给出对应的分析结果;同时提供开放的调用接口,支持开发者接入到自有产品中实现功能拓展。目标用户覆盖普通互联网用户、内容创作者、企业办公人员、技术开发者等群体,可用于日常信息查询、内容产出、办公效率提升、个性化产品开发等多个场景。

GPT4o (Omni)
免费该页面是发布在Medium平台的技术分析文章,核心定位为深度解析GPT-4o (Omni)多模态大模型的功能特性与应用价值。文章梳理了模型在文本生成、图像理解、音频交互三类场景的落地表现,同时对比了前代模型的能力差异。目标用户涵盖AI技术爱好者、产品开发者、行业研究者等群体,适合需要了解GPT-4o核心能力、评估其商业化落地可能性的读者阅读,也可作为技术选型、功能设计时的参考资料。
Qwen2.5-Turbo
免费Qwen2.5-Turbo是阿里巴巴开发团队推出的长文本处理能力突出的大语言模型页面,核心定位为兼顾长短文本处理效率与成本优势的AI大模型服务入口。核心功能包括最高支持1M Token超长上下文处理、长短文本双场景高准确率输出、低使用成本的推理服务调用,目标用户覆盖内容创作者、学术研究者、企业开发者、法律从业者、金融分析人员等群体,可应用于长文档摘要生成、多轮对话交互、代码开发辅助、政策文件解读、行业报告分析等多个场景,满足不同用户对大语言模型的多元使用需求。

GLM-4-32B
免费GLM-4-32B是智谱AI推出的高性能生成式语言模型服务平台,核心定位是为不同用户群体提供高效的自然语言处理能力支持。平台支持超长文本理解、多轮对话交互、多模态内容生成、代码辅助开发、结构化信息抽取五类核心功能,可满足学术研究、商业落地、个人创作等多场景需求,目标用户覆盖自然语言处理领域研究者、企业技术开发人员、内容创作者、程序员、教育工作者等群体,可广泛应用于论文文献分析、智能客服搭建、文案脚本创作、程序代码调试、教学内容设计等多个场景。

Moonshot AI
免费Moonshot AI(月之暗面AI)是国内专注于通用人工智能技术研发的大语言模型服务平台,核心定位为面向个人及企业用户提供高效的自然语言交互与智能生产力支持。平台核心功能包括长上下文理解处理、多模态内容生成、定制化行业解决方案,支持个人用户完成知识检索、内容创作、日常事务规划,也可为企业用户提供模型微调、API接入等服务,适配内容生产、客户服务、研发辅助等多个场景的智能化需求。

零一万物
免费零一万物是由李开复博士创办的AI公司,推出了Yi系列大语言模型。Yi-Lightning等模型在多项基准测试中表现突出,以高性价比和中文能力著称。提供开源模型和企业级API,支持长文本理解、多轮对话、代码编写等能力,是国内AI大模型领域的重要参与者。

天工
免费天工是昆仑万维基于自研双千亿级大语言模型打造的人工智能服务平台,核心定位为面向多领域用户提供通用智能辅助服务。平台覆盖生成创作、知识问答、规划决策、语言理解、代码开发、逻辑推理六大核心能力,适配数百种细分使用场景。目标用户涵盖内容创作者、企业运营人员、程序员、学生、职场人士、科研工作者等群体,可满足文案撰写、问题查询、方案制定、多语言处理、代码调试、逻辑推演等多类需求,帮助用户提升任务处理效率,降低复杂事务的处理门槛。

AndesGPT
免费AndesGPT安第斯大模型是OPPO推出的个性专属大模型与智能体平台,基于端云协同架构设计,可适配多设备场景使用。平台具备多模态对话交互、个性化记忆体系、端云协同调度、智能体开发支持等核心能力,面向普通消费者、智能设备用户、应用开发者、AI研究人员等群体,可满足日常信息查询、设备智能操控、个性化服务定制、AI应用开发等多场景需求,适配手机、平板、智能穿戴等多款OPPO生态设备。
你是 Berkeley Function-Calling Leaderboard 的开发者或团队吗?
认领后可编辑工具信息、获取真实点击数据,并在页面上展示官方认证徽章。
访问第三方工具时,请注意账号、隐私与支付安全
用户评论
0· 0 条