输入关键词搜索 AI 工具、分类,或直接跳转页面

metamotivo.metademolab.com
Meta Motivo是Meta FAIR推出的早期行为基础模型演示站点,核心定位是为相关领域研究者、开发者提供无监督强化学习训练的虚拟人形代理模型功能演示与资源获取入口。站点支持模型能力在线交互测试、预训练模型及训练代码下载、零样本任务效果展示三类核心功能,面向人工智能领域研究者、强化学习开发者、机器人研发从业者、高校相关专业师生等群体,可用于行为基础模型技术验证、人形机器人控制逻辑参考、相关技术研究复现、学术课题实验支撑等场景,帮助用户直观理解该模型在复杂全身任务控制上的技术特性。

glee-vision.github.io
GLEE是一个面向图像与视频处理场景的通用对象基础模型服务平台,核心定位是为各类对象感知任务提供统一的技术支持。平台可实现多模态输入的对象定位与识别功能,支持零样本迁移适配不同任务场景,还具备多数据源联合训练的通用对象表示能力。目标用户覆盖计算机视觉领域的科研人员、AI应用开发工程师、内容生产行业的视频处理从业者、安防领域的智能分析从业者等,可应用于视频内容结构化标注、图像对象检测、多场景智能识别、零样本任务迁移等多种场景。
ggg0919.github.io
Cantor是面向多模态链式思维推理研究的开源技术框架,核心定位是结合视觉感知与大语言模型逻辑推理能力,解决复杂视觉推理任务。核心功能包括视觉上下文感知对齐、多模态链式思维生成、推理性能自动评估、零样本推理适配、实验结果可视化。目标用户覆盖人工智能研究者、计算机视觉方向学生、多模态大模型开发人员、AI应用落地工程师、算法竞赛参与者。使用场景包括多模态推理算法性能测试、学术研究中基线模型对比、零样本视觉推理任务开发、大语言模型多模态能力验证、相关教学课程实验演示。

yangchris11.github.io
SAMURAI是基于Segment Anything Model 2(SAM 2)开发的视觉对象跟踪模型项目官网,核心定位是为视觉跟踪领域提供无需微调的零样本目标跟踪解决方案。核心功能包括运动感知记忆选择机制、时间运动线索融合、多基准数据集效果验证等,支持用户快速了解模型架构、复现跟踪效果、下载相关测试资源。目标用户覆盖计算机视觉领域研究人员、AI算法开发工程师、智能监控系统开发者、自动驾驶感知模块研发人员等,可用于学术研究对比、工业级视觉跟踪系统搭建、复杂动态场景跟踪方案选型等场景,帮助用户降低视觉跟踪模型的开发和适配成本。

ok-robot.github.io
OK-Robot是一个面向机器人操作领域的开放模块化框架,核心定位是实现任意家居环境下基于自然语言指令的零样本物品搬运任务。该框架采用多模块协同的设计思路,内置3D VoxelMap开放词汇导航、AnyGrasp与LangSam联合开放词汇抓取、智能放置原语三大核心功能,无需针对特定环境预先训练即可实现指令的零样本泛化。目标用户覆盖机器人研发人员、高校人工智能方向研究人员、智能家居开发团队等群体,可应用于家用服务机器人功能研发、机器人泛化能力学术研究、工业柔性搬运场景原型测试等多种场景,为降低机器人语言交互落地门槛提供技术支撑。

xiaoyushi97.github.io
Motion-I2V是专注于图像到视频生成的技术框架展示站点,核心面向AI生成内容领域的研究者与开发者,提供可控且一致性更高的图像转视频方案。其核心功能包括两阶段式图像转视频生成,支持大运动与视角变化场景下的稳定输出;可配置的稀疏轨迹控制功能,允许用户自定义运动路径与作用区域;零样本视频到视频转换能力,无需额外训练即可完成视频风格或内容调整。适合AIGC从业者验证视频生成效果、计算机视觉研究者对比算法性能、内容创作者尝试静态素材动态化的各类场景。

ai.meta.com
SAM 2(Segment Anything Model 2)是Meta推出的视觉分割领域模型项目页面,核心定位为面向全球开发者、研究者的实时图像与视频对象分割技术资源平台。其核心功能包括提供SAM 2模型的完整技术文档、开源代码下载入口,以及配套的SA-V大规模视频分割数据集。目标用户覆盖计算机视觉研究者、AI应用开发者、多媒体内容创作人员等群体,可应用于视频内容智能剪辑、自动驾驶感知模块训练、医疗影像病灶标注、工业缺陷视觉检测等多个场景。页面采用开放科学的发布模式,所有相关资源均在开源许可下开放,无需额外申请即可获取核心技术资料。

directai.io
Computer Vision with DirectAI是主打零样本能力的计算机视觉模型构建平台,核心依托大语言模型技术,支持用户通过自然语言描述自定义计算机视觉任务模型,无需准备训练数据即可完成模型搭建。平台核心功能包括零样本视觉模型生成、多场景模型快速部署、实时效果迭代调整,面向计算机视觉应用开发人员、企业AI业务落地团队、科研机构研究人员等群体,适用于安防监测、工业质检、内容审核、零售客流分析等多个需要快速落地视觉AI能力的场景,帮助用户降低AI模型开发的时间与人力成本。

rf-inversion.github.io
RF-Inversion是由德克萨斯大学奥斯汀分校与谷歌研究人员联合开发的图像生成与编辑技术展示平台,核心基于随机微分方程(SDE)实现图像反转与编辑操作,无需额外模型训练、潜在空间优化、提示词调整或复杂注意力处理器即可完成相关任务。平台核心功能包括零样本图像反转、笔画转图像合成、语义图像编辑三类,主要面向计算机视觉研究人员、AI图像技术开发者、数字内容创作者、高校图像处理相关专业学生等群体,可应用于学术研究效果复现、创意图像内容生成、图像属性定向调整、手绘内容数字化转换等多种场景。

mmlab-ntu.com
RERENDER A VIDEO是由南洋理工大学MMLab团队开发的零样本文本引导视频到视频翻译框架,核心定位是将图像扩散模型的能力迁移至视频生成领域,无需重新训练即可实现风格统一的视频转换。核心功能包括关键帧一致性生成、全视频时序对齐传播、主流图像扩散模型兼容适配三大模块。目标用户覆盖视频创作者、AI视觉研究者、设计从业者、动画制作人员、高校相关专业师生等群体,可应用于短视频风格迁移、实验原型验证、概念视频制作、动画初稿生成、学术研究对比测试等多个场景,在保障视频时序连贯性的同时降低视频风格化改造的技术门槛。