输入关键词搜索 AI 工具、分类,或直接跳转页面

craftjarvis.github.io
ROCKET-1是专注于开放世界具身决策场景的视觉-语言模型,核心定位是打通视觉语言大模型与具身策略模型的通信链路,提升智能体在开放交互环境中的任务完成能力。核心功能包括视觉-时间上下文提示协议构建、多帧观测对象分割引导、长序列复杂任务推理调度三类,主要面向人工智能研究人员、具身智能开发人员、开放世界游戏AI开发人员等群体,可应用于虚拟世界智能体训练、机器人具身决策算法验证、复杂开放环境任务推理研究等场景,为具身智能领域的视觉语言融合方案提供可参考的实现路径。