输入关键词搜索 AI 工具、分类,或直接跳转页面

video-language-planning.github.io
Video Language Planning(简称VLP)是面向机器人任务规划领域的算法展示与技术说明站点,核心定位是展示基于视觉语言模型与文本到视频模型结合的长期任务视觉规划方案。站点核心功能包括算法原理的可视化讲解、不同应用场景的实验结果展示、可复现的技术实现文档开放,目标用户覆盖机器人研发人员、多模态AI研究者、高校自动化相关专业师生,可用于机器人任务规划算法调研、多模态模型落地机器人场景的技术参考、相关领域学术研究的案例参考等场景。

openaisora.video
OpenAI Sora是OpenAI开发的文本生成视频AI模型服务平台,核心能力是根据用户输入的文本描述生成时长最长一分钟的高清视频内容。平台支持用户输入详细的场景、动作、风格描述,生成符合需求的视频素材,也可提供参考图生成匹配视频。目标用户包括内容创作者、影视从业者、新媒体运营人员、产品设计师等,适用于创意内容初稿生成、广告短视频制作、概念视频预览、产品展示视频创作等多种场景。

guoyww.github.io
SparseCtrl是面向文本到视频生成场景开发的控制增强技术项目,核心定位是降低视频生成的结构控制门槛,无需改动预训练文本到视频模型即可实现精准内容引导。其核心功能包括多类型稀疏信号支持,可适配草图、深度图、单张RGB图像等不同输入形式;轻量条件编码机制,通过独立编码器处理稀疏控制信号,不破坏原有模型的生成能力;多场景适配能力,支持故事板转视频、关键帧动画生成、帧插值等不同创作需求。目标用户覆盖AI视频创作者、动画制作人员、影视前期策划人员、AI技术研究者等群体,可应用于短视频内容制作、动画分镜落地、影视概念片生成、学术技术验证等多个场景。