输入关键词搜索 AI 工具、分类,或直接跳转页面
SpatialVLM是谷歌DeepMind研发的空间视觉语言模型展示站点,核心定位是呈现可实现定量空间关系理解与推理的多模态模型能力。平台支持空间视觉问答测试、空间推理路径可视化、机器人控制场景效果演示三类核心功能,面向AI研究者、机器人开发工程师、多模态模型学习者、计算机视觉领域从业者,可用于空间推理类模型性能验证、机器人导航逻辑预测试、多模态模型训练方向参考等场景,帮助用户直观了解空间视觉语言模型的技术特点与落地可能性。
进入站点首页后,可先浏览核心介绍板块,了解SpatialVLM的基本定位、技术背景和主要应用方向,对模型的核心能力建立基础认知。
若需体验空间VQA功能,可点击对应板块的上传按钮,上传本地的空间布局图像,输入要查询的空间问题后提交,等待模型返回推理结果。
查看推理结果时,可点击“显示推理路径”按钮,查看模型完成该次推理的全流程步骤,点击各个步骤可查看对应的特征提取详情。
若需了解机器人落地场景,可进入机器人演示板块,选择对应的模拟场景,调整场景参数后查看模型生成的控制指令逻辑和执行效果。
如需获取技术资料,可进入资源下载板块,选择所需的数据集样本、技术论文或实验基准数据,点击对应按钮即可下载相关资源。
看完教程,直接上手试试
访问 SpatialVLM 官网