输入关键词搜索 AI 工具、分类,或直接跳转页面
zerobench.github.io
ZeroBench是聚焦多模态大模型视觉理解能力的专业基准测试平台,核心定位为多模态模型研发领域的评估工具。平台搭载经学术团队严格校验的高难度测试数据集,支持完整的模型性能分层评估,同时提供推理过程拆解分析功能。目标用户覆盖人工智能领域研究人员、多模态模型开发团队、高校计算机相关专业师生,可应用于模型迭代效果验证、学术论文实验支撑、多模态技术路线对比等场景,帮助使用者清晰识别不同模型在复杂视觉理解任务上的能力差异。

confident-ai.com
Confident AI 是面向大语言模型应用开发者的开源评估基础设施平台,核心定位是为LLM应用的性能验证与生产落地提供全链路支持。平台支持用户自定义测试用例完成LLM输出评估,内置多维度开源性能指标可量化模型表现,同时提供版本差异跟踪与全链路监控能力。目标用户覆盖LLM应用开发工程师、算法研究员、AI产品经理等群体,可应用于LLM应用原型验证、迭代优化、上线前性能校验、生产环境稳定性监测等多种场景,帮助开发者明确模型优化方向,降低LLM投产的不确定性。

manot.ai
Manot是专注于计算机视觉模型性能优化的洞察管理平台,核心定位是帮助开发者与产品相关人员定位模型运行问题,提升模型落地效果。平台核心功能包含模型失败案例自动归因、数据分布偏差检测、性能迭代效果追踪三类,能够为计算机视觉算法工程师、AI产品经理、算法测试人员等群体提供服务,适用于自动驾驶感知模型迭代、安防视频识别模型优化、零售商品识别模型调优、医疗影像分析模型效果校验等多个场景,帮助团队减少人工排查问题的时间成本,提升模型优化的针对性。