输入关键词搜索 AI 工具、分类,或直接跳转页面

mammoth-vl.github.io
MAmmoTH-VL是面向多模态推理领域的学术研究与应用支撑平台,核心面向多模态大模型研发人员、数学教育相关从业者、AI研究学者等群体。平台搭载基于指令调优优化的多模态大语言模型,可支撑多模态数学题解析、跨模态推理任务评测、推理过程可解释性分析三类核心需求。用户可通过平台体验模型对图文结合数学题的解答过程,也可获取开源数据集用于相关模型训练,还能借助基准测试结果对比不同多模态模型的推理能力,适合学术研究、教育工具开发、多模态模型迭代等场景使用。

llava-vl.github.io
LLaVA-Video是专注于视频领域的大型多模态模型项目,核心定位为通过指令调优提升视频理解与推理能力。核心功能包括构建高质量视频指令调优数据集LLaVA-Video-178K,覆盖多类视频理解任务;支持开放式问答、多项选择问答、细粒度视频描述等多场景推理;提供模型基准测试结果与训练方案参考。目标用户覆盖AI研究人员、多模态模型开发者、视频内容分析从业者等,可用于学术研究实验、视频分析工具开发、多模态模型迭代优化等场景,为视频方向的多模态技术落地提供数据与模型参考。