
DriveVLM是清华大学MARS实验室推出的自动驾驶研发系统,核心定位是将视觉语言模型能力融入自动驾驶流程,提升复杂场景下的感知与决策表现。该系统具备场景语义描述、多维度场景分析、分层驾驶规划三类核心功能,同时推出混合架构的DriveVLM-Dual版本,平衡大模型推理能力与传统自动驾驶系统的空间计算、实时响应优势。目标用户覆盖自动驾驶领域研究人员、高校相关专业师生、自动驾驶企业技术研发团队,可用于自动驾驶算法迭代、长尾场景处理方案验证、大模型在自动驾驶领域的落地研究等场景,相关实验成果已在nuScenes、SUP-AD公开数据集以及量产实车环境中完成验证。
- 运营状态
- 正常运营
- 地址
- tsinghua-mars-lab.github.io
- 定价模式
- 基础功能免费
- 支持平台
- Web 网页
- 是否开源
- 开源
- 适合人群
- 自动驾驶领域科研人员、高校车辆工程/计算机专业师生、自动驾驶企业算法研发团队、自动驾驶测试工程师
- 收录时间
- 2026/6/14
- 访问量
- 0 次
编辑点评
这是由国内出色高校实验室推出的自动驾驶前沿研究项目,核心特色是将大语言模型与计算机视觉能力结合,为自动驾驶场景理解提供新的技术路径。和传统纯规则驱动的自动驾驶系统不同,该项目借助视觉语言模型的语义理解能力,能更好地处理交通场景中的模糊信息与长尾场景,比如无标识路口的行人意图判断、临时施工路段的规则适配等传统方案处理效果不佳的场景。平台同时提供了纯大模型架构与混合架构两个版本,既满足学术研究中对大模型自动驾驶方案的探索需求,也兼顾了产业端对系统实时性、可靠性的要求,相关实验结果已经在公开数据集和实车环境中完成验证,可复用性较强。对于想要探索大模型在自动驾驶领域落地的研究人员和技术团队来说,该项目提供了完整的参考框架与可复现的方案,能够降低相关技术的研发门槛。
核心功能
使用指南
- 1
访问DriveVLM官方网站,在首页导航栏找到“文档”板块,查阅系统架构介绍、环境配置要求相关内容,了解不同版本系统的适用场景与依赖条件,明确自身的使用需求。
- 2
在“下载”板块获取对应版本的系统代码、预训练模型文件以及测试数据集样本,按照文档指引在本地服务器或测试设备上完成开发环境的搭建与部署。
- 3
使用平台提供的示例测试脚本,加载nuScenes或SUP-AD数据集的样本数据运行系统,查看场景描述、分析、规划各环节的输出结果,验证系统运行是否正常。
- 4
若需要测试自定义场景,可按照平台规定的格式上传自有道路测试数据,调整模型推理参数,运行系统并导出各环节的处理结果,评估系统在目标场景下的表现。
- 5
若进行实车部署,参考平台提供的硬件适配文档,对接车辆的传感器与控制接口,完成系统联调后在封闭测试场地开展测试,逐步扩展到公开道路测试场景。
优势与不足
优点4 项
"将视觉语言模型与自动驾驶流程深度结合,提供了复杂长尾场景理解的新方案"
"同时推出纯大模型与混合架构两个版本,分别适配学术研究与产业落地需求"
"公开预训练模型、测试脚本与数据集验证结果,支持用户快速复现实验效果"
"提供量产车部署适配方案,相关技术已在实车环境中完成可行性验证"
不足3 项
"系统部署对算力要求较高,普通消费级显卡难以满足实车实时推理需求"
"文档内容偏学术化,缺少工程落地的详细实操指引,新手使用者上手门槛较高"
"当前版本仅支持预设的几类常见自动驾驶数据集,自定义数据集的适配需要自行完成格式改造"
定价说明
DriveVLM所有核心代码、预训练模型、文档资料均面向公众免费开放,无功能使用限制,用户可自由下载用于非商业性质的研究、学习场景。若用于商业落地场景,需联系清华大学MARS实验室获取商用授权,授权费用根据应用场景、使用范围单独评估。建议学术研究用户直接使用免费开放版本即可满足需求,有商业化落地需求的企业可提前与实验室团队沟通授权相关事宜。
价格和授权政策可能变化,请以官网最新信息为准
适合人群与场景
- 自动驾驶领域科研人员
算法创新研究场景
- 高校车辆工程/计算机专业师生
课程实践/课题研究场景
- 自动驾驶企业算法研发团队
方案迭代验证场景
- 自动驾驶测试工程师
实车场景测试场景
- 智能交通领域研究人员
车路协同方案研究场景
- 自动驾驶初创企业技术团队
原型系统搭建场景
- 车载域控制器研发团队
算法适配落地场景
常见问题
深度了解
随着自动驾驶技术的发展,复杂长尾场景的理解与决策一直是行业的核心难点,DriveVLM的出现为这类问题的解决提供了新的技术路径。该系统将视觉语言模型的强大语义理解能力融入自动驾驶流程,通过场景描述、场景分析、分层规划的模块化架构,把视觉感知信息转化为结构化的语义结果,再基于语义信息输出可追溯的驾驶决策,有效提升了对施工路段、临时交通管制、非机动化参与者违规通行等复杂场景的处理能力。针对纯大模型方案空间推理能力不足、算力需求高的问题,DriveVLM还推出了混合架构版本DriveVLM-Dual,结合传统自动驾驶系统在空间计算、实时响应上的优势,既保留大模型的语义理解能力,又满足实车部署对精度和速度的要求。目前DriveVLM的所有代码、预训练模型、实验资料均已开源,用户可直接下载使用,相关实验结果在nuScenes、SUP-AD公开数据集上表现优异,且已完成量产实车部署验证,不管是学术领域的大模型自动驾驶研究,还是产业端的自动驾驶方案迭代,都可以借助该系统获得参考。对于想要探索大模型与自动驾驶结合方向的从业者来说,DriveVLM提供了完整的可落地参考框架,能够降低相关技术的研发门槛,加速技术从实验室向产业端的转化。
Ready to try
准备好体验 DriveVLM 了吗?
点击下方按钮在新标签页打开官网,开始探索它的全部功能。
相关工具

GLM 5
GLM 5是智谱AI推出的大参数规模通用大语言模型,面向智能体开发、复杂推理任务、生成式内容创作等场景提供AI服务。核心能力覆盖多模态信息处理、长文本上下文理解、复杂逻辑推理、智能体工具调用等,支持开发者进行模型微调、应用部署,也满足普通用户进行日常AI对话、内容生成需求。用户可在平台直接调用模型接口,也可在线体验模型对话能力,适配从个人内容创作到企业级AI应用开发的多种使用场景。

Stable Diffusion
免费Stable Diffusion是由Stability AI推出的开源AI图像生成模型,在文生图领域处于行业前列,拥有广泛的开发者生态。其核心功能包括自定义模型微调、多维度生成控制、多格式输出适配,可满足不同创作需求。面向AI绘画爱好者、商业设计从业者、算法研发人员等群体,适用于创意概念稿绘制、批量素材生产、算法技术研究、艺术风格探索等多种场景,为用户提供高自由度的图像生成能力。
ModelScope魔搭社区
ModelScope魔搭社区是阿里云联合多家AI机构共同打造的AI模型开源共享平台,核心定位为AI开发者、研究人员及产业从业者提供模型资源、开发工具与交流协作空间。平台目前收录覆盖多模态、自然语言处理、计算机视觉、语音等多个领域的预训练模型,支持在线推理调试与训练微调,同时提供低代码开发组件,帮助用户快速搭建AI应用。该平台面向高校AI专业学生、算法研究人员、企业AI开发团队以及AI应用创作者,可用于学术研究中的模型对比验证、企业AI产品的功能快速迭代、个人AI创意项目的原型开发等场景。

DeepSeek R1 Online
DeepSeek R1 Online是一个提供开源高级推理AI模型在线访问服务的平台,用户无需本地部署即可直接调用DeepSeek R1模型进行推理计算。平台支持多类型文本推理任务,涵盖逻辑推导、代码分析、学术问题解答、创意内容生成等多种场景,能够为需要使用该模型的用户提供便捷的在线访问通道,降低模型使用门槛。核心功能包括在线模型交互、多模态推理支持、结果导出、上下文对话管理、参数自定义调整等,适合科研人员、开发者、学生、内容创作者等不同用户群体在多种推理需求场景下使用。

Llama 3
Llama 3是Meta公司推出的新一代开源大型语言模型官方介绍站点,核心定位为向开发者、研究人员及相关从业者公开Llama 3的技术参数、性能表现与落地应用路径。站点核心功能包括Llama 3全系列模型的技术规格公示、多场景落地案例展示、模型接入与授权使用指南公示,同时同步后续模型迭代规划。该站点面向AI开发从业者、科研机构研究人员、企业技术负责人等群体,可用于查询模型适配方案、了解模型性能边界、获取商用授权相关信息,为不同主体基于Llama 3开展二次开发、落地行业应用提供官方参考依据。

mindspore.cn
mindspore.cn是华为开源自研AI框架MindSpore的官方站点,面向AI领域开发者提供框架下载、开发文档、教程资源、社区交流等一站式服务。核心功能包括全场景统一部署支持,可实现一次训练后在端、边、云多环境快速部署推理;内置通用自动微分与分布式并行训练能力,降低大模型训练的开发门槛;配套完善的生态工具链,覆盖数据处理、模型调优、推理部署全流程。目标用户涵盖数据科学家、算法工程师、高校AI专业师生、企业AI研发团队、AI开源贡献者等,可应用于计算机视觉模型开发、自然语言处理应用构建、大模型训练与推理落地、AI学术研究实验等多种场景。

腾讯云 TI-ONE 训练平台
腾讯云 TI-ONE 训练平台是面向大语言模型开发的云原生训练平台,依托腾讯云基础设施,接入开源MoE模型Hunyuan-Large,提供模型训练、微调、部署全流程能力。核心功能包含大模型分布式训练、定制化微调、模型部署推理、数据处理工具、训练监控等服务,目标用户为AI算法研发人员、大模型创业团队、互联网企业AI部门、高校AI实验室等,适合开展大规模大模型训练、行业定制模型微调、大模型产品落地开发等场景。
Hugging Face
免费Hugging Face是一个开源AI模型平台与机器学习社区,核心定位是为AI开发人员、研究人员及相关从业者提供一站式AI开发资源与协作空间。平台核心功能包括预训练模型库下载调用、模型在线推理测试、数据集共享管理,同时支持模型训练、部署等全流程开发需求。目标用户覆盖AI领域研究人员、企业开发团队、高校相关专业学生、AI应用创业者等群体,可用于自然语言处理、计算机视觉、语音识别等多领域AI项目的快速开发、学术研究成果复现、AI应用原型搭建等场景,帮助用户降低AI开发的技术门槛,提升项目推进效率。
你是 DriveVLM 的开发者或团队吗?
认领后可编辑工具信息、获取真实点击数据,并在页面上展示官方认证徽章。
访问第三方工具时,请注意账号、隐私与支付安全

用户评论