输入关键词搜索 AI 工具、分类,或直接跳转页面
LLM Arena是专注于大语言模型第三方测评分析的工具平台,核心定位是为用户提供中立、可量化的大模型对比参考。平台支持盲测对比不同大模型的输出效果,可整理公开各主流大模型的定价明细,同时标注不同模型的接口参数、功能差异并生成结构化对比报告。面向AI开发者、产品经理、AI领域研究者、企业技术选型人员、AI创业从业者、高校相关专业师生等用户,可应用于大模型技术选型、输出效果验证、调用成本核算、参数适配调研、功能适配评估等场景,帮助用户直观了解不同大语言模型的实际表现差异,为技术选型和应用开发提供参考依据。
访问LLM Arena官网首页,可直接浏览平台已公开的大模型榜单、测评结果、定价汇总等基础信息,无需注册即可查看公开内容。
若需要进行自定义对比测试,点击右上角注册按钮,使用邮箱完成账号注册并登录,普通用户注册即可使用基础对比功能。
进入盲测对比页面,在模型选择栏勾选需要对比的大模型,在输入框内填写测试用的Prompt内容,也可选择平台提供的公开测试数据集。
点击提交按钮等待模型返回结果,查看无标识的模型输出内容,可自行对结果进行评分,也可切换查看功能对比、定价对比、参数对比等其他维度的信息。
完成测评后可选择生成并导出对比报告,也可将测评结果保存到个人账号中,后续可随时查看历史测评记录,调整测试参数再次进行对比。
看完教程,直接上手试试
访问 LLM Arena 官网