输入关键词搜索 AI 工具、分类,或直接跳转页面

boheumd.github.io
MA-LMM是面向长期视频理解场景的大规模多模态模型项目官网,核心定位为突破大语言模型上下文与GPU内存限制,实现长时序视频的高效分析处理。核心功能包括在线流式视频处理、跨时长记忆库调度、现有多模态大模型无缝适配三类,支持用户在长视频问答、智能字幕生成、视频内容检索等任务中调用相关能力。目标用户覆盖计算机视觉研究人员、视频平台技术开发人员、AI应用开发者等群体,可满足学术实验验证、工业级视频分析功能落地、多模态应用功能迭代等多场景使用需求。

jinxxian.github.io
Vista-LLaMA是专注于视频语言理解领域的技术展示与模型介绍站点,核心展示专为视频文本生成任务优化的大语言模型方案。站点支持模型技术原理拆解、基准测试结果查询、相关论文资源下载三类核心功能,面向人工智能领域的研究人员、算法工程师、高校计算机相关专业师生,可用于视频理解技术调研、多模态模型研发参考、学术论文写作资料补充等场景,帮助用户系统了解该模型在视频问答、长视频内容总结等任务中的技术优势与应用思路。