输入关键词搜索 AI 工具、分类,或直接跳转页面

mmstar-benchmark.github.io
MMStar是面向大型视觉语言模型多模态能力评估的基准测试集平台,核心定位是为多模态模型研发领域提供标准化、低偏差的能力评测方案。平台包含1500个经过人工筛选的视觉语言样本,覆盖6类核心能力与18个细分评估维度,同时提供传统准确率之外的两套新增评估指标,可帮助研究者识别模型数据泄露风险、量化多模态训练带来的实际性能增益。其目标用户涵盖AI领域研究人员、多模态模型开发团队、高校人工智能相关专业师生,可应用于模型迭代效果验证、学术研究实验评测、模型公开能力对比等多种场景。
atla-ai.com
Selene API是Atla AI推出的人工智能评估模型服务平台,核心定位是为AI应用开发者提供专业的模型效果评估能力。平台搭载LLM-as-a-Judge技术,可对各类AI应用输出内容进行多维度评分,同时生成可落地的优化反馈意见,还支持自定义评估规则适配不同业务场景。目标用户覆盖AI产品开发者、算法工程师、AI产品经理、AI安全研究人员等群体,可应用于AI模型上线前效果校验、迭代版本效果对比、AI生成内容合规性检测、模型回答质量日常巡检等多个场景,帮助开发者降低人工评估成本,提升AI应用的落地质量。

openlayer.com
Openlayer是面向AI模型全生命周期的评估与监控平台,核心定位是为AI开发团队提供模型从研发到上线后的全流程质量管控能力。平台支持大语言模型、文本分类、表格分类、表格回归等多类模型的测试评估,可自动识别模型输出偏差、性能衰减等问题,同时提供生产环境可观测能力,实时推送异常告警。该工具主要面向AI算法工程师、大语言模型开发人员、产品经理及AI项目运维人员,可用于模型上线前的迭代测试、上线后的效果监控、prompt优化效果验证、模型版本迭代效果对比等场景,帮助团队降低模型上线风险,提升模型交付质量。

appen.com
Appen是专注于人工智能训练数据服务的企业平台,核心定位是为AI研发团队提供全链路数据解决方案,助力AI模型性能提升。平台核心功能包括多模态数据标注服务、全球范围定制化数据采集、多语言本地化数据处理三类。目标用户覆盖人工智能研发企业、自动驾驶技术团队、智能语音开发厂商、大语言模型训练团队等。使用场景包含自动驾驶场景下的图像、点云数据标注,智能语音助手的语料采集与转写标注,大语言模型的预训练数据清洗、对齐标注,跨境AI产品的多语言文本数据处理等环节。

vchitect.intern-ai.org.cn
Vchitect 2.0(筑梦2.0)是由上海人工智能实验室推出的视频生成服务平台,核心定位为面向内容创作群体的视频生成与模型评估工具。平台核心功能包括文本/图像驱动的短视频生成、多尺寸视频定制输出、长视频生成模型性能评估。目标用户覆盖内容创作者、视频制作从业者、AI模型研发人员、设计人员等群体,可用于短视频内容创作、静态素材动态化处理、AI视频模型效果对比测试等场景,帮助用户提升视频制作效率,为视频模型研发提供数据参考。