图像轨迹表示:自动驾驶VLA突破规模化困境的关键设计
在自动驾驶端到端方案成为主流的这两年里,一个越来越尴尬的现象是:“视觉语言动作模型”听起来很热,但真正能让人感受到“大模型级能力跃迁”的成果并不多。问题往往不在于模型本身不够大,而在于驾驶决策这种数据,天然不适合用大语言模型熟悉的文本输出去表达。
ECCV 2026 相关公开信息中出现了 DriveTeach-VLA,来自北航与清华团队,核心思路是“用图像轨迹打通驾驶场景与基模预训练”。如果只看标题,很容易把它归结为某一种轨迹预测改进;但如果把“图像轨迹”当作一种连接层来理解,你就会发现它其实在回答一个更本质的问题:自驾 VLA 到底应该怎样设计动作表示,才能把规模化这条路真正走通。
这篇文章会从四个角度展开:先讲清楚自动驾驶 VLA 的规模化困境到底卡在哪里;再拆解 DriveTeach-VLA 中“图像轨迹”这个设计为什么是一个好的接口;然后分析它对数据、表示和训练三个层面的影响;最后落到实际工程团队可以参考的实践路径与注意事项。
1. 自动驾驶 VLA 的“规模化困境”
VLA 是 Vision-Language-Action 的缩写,翻译过来就是视觉语言动作模型。在自动驾驶里,它的输入通常是多视角图像,输出是自车的未来轨迹或者转向、加速等控制信号。和早期端到端模型最大的区别在于,VLA 引入了语言模型作为推理大脑,让车辆不仅会“看”,还能“想”。
这个思路听起来很合理,但放到真实研发中会遇到三个非常具体的困境。
1.1 优质决策数据严重稀缺
视觉语言模型之所以能迅速发展,是因为互联网上有海量的图文、视频数据。而自动驾驶的决策数据不同,车辆必须实际行驶在真实道路上,并且需要记录下当时完整的环境上下文、驾驶员操作、路况变化,才能形成一条可用的训练样本。
更麻烦的是,原始视频并不是直接可用的决策数据。很多团队还需要在视频上做车道线标注、动静态障碍物标注、行为意图标注,然后再生成轨迹标签。一条高质量决策样本的成本,往往比纯感知标注高出一个数量级。这样积累出来的数据集,规模通常只有几十万到几百万条,和大语言模型动辄数万亿 token 的规模完全不在一个量级。
1.2 输出空间与预训练能力不对齐
VLA 的常见做法,是把环境信息转化为自然语言描述,让大模型给出决策文本,再把文本解码成轨迹。这里有一个容易被忽视的错位:大语言模型的预训练建立在“文本预测”之上,它最擅长的是理解语义和推理;而驾驶轨迹本质上是一个时空物理量,需要用连续坐标或路径点来表达。
当你把轨迹硬编码成自然语言时,相当于让大模型通过一个非常狭窄的通道输出驾驶行为。那些在预训练阶段学习到的丰富视觉规律、空间关系、时间一致性,很难被充分释放出来。这也是很多 VLA 在公开集上看起来不错,但一上环仿真就露馅的原因。
1.3 训练链路过长,误差传导失控
传统 VLA 的训练链路通常是“感知-语言描述-推理-轨迹解码”四段式。感知环节的噪声会被语言描述放大,语言推理的错误会直接传导到轨迹输出。整条链路中的任何一个环节出现偏差,最终规划结果都会不稳定。
DriveTeach-VLA 之所以值得关注,是因为它尝试从表示层解决这些困境,而不是继续在模型结构上做简单堆叠。
2. 看懂 DriveTeach-VLA 之前,先理解三个概念
在讨论具体方案之前,有必要把几个基础概念讲清楚,否则很容易被标题里的几个热词带偏。
2.1 从端到端到 VLA
早期端到端自动驾驶模型,比如常见的“感知-预测-规划”一体化网络,通常直接用图像回归轨迹坐标。这种做法的优势是简洁,但缺点是缺乏推理能力,遇到长尾场景很难泛化。
VLA 的改进是引入语言模型作为推理模块。车辆把周围环境翻译成场景描述,再由大模型根据交通规则、风险偏好、目标导向生成决策文本,最后转换为具体轨迹。这个方向在 2024 年到 2025 年间出现了大量变体,有的侧重场景描述生成,有的侧重闭环规划,有的侧重多模态融合。
2.2 基础模型预训练
基础模型预训练,指在大规模数据上训练一个通用模型,然后迁移到下游任务。它有两个显著特征:一是规模效应,数据量和参数量增加时,模型能力会平滑提升;二是任务统一,预训练目标往往简单且自监督,不需要大量人工标注。
在视觉领域,典型的预训练任务包括图像掩码重建、对比学习、视频帧预测;在语言领域,典型任务是下一 token 预测。这些任务看似简单,却能让模型学到大量泛化知识。
2.3 图像轨迹:一个被低估的表示层
轨迹通常被表示为一组二维或三维坐标点,比如在车辆坐标系下的未来 3 秒路径。DriveTeach-VLA 提出的“图像轨迹”,本质上就是把轨迹从抽象坐标转成图像上的视觉覆盖层。
你可以理解为:把车辆未来 3 秒要走的路径,直接以一条标线形式画在当前帧的图像上。这条标线不是给人看的,而是给模型看的。它让轨迹在空间上和图像像素对齐,从而可以被视觉编码器直接处理。
这个转变看起来很小,但牵动的是整个模型的设计逻辑。
3. DriveTeach-VLA 的定位与核心创新
从公开信息来看,DriveTeach-VLA 研究来自北航与清华团队,被 ECCV 2026 接收。由于论文可能尚未完全公开,本文不做跑分式评测,而是从技术路线和标题传递的方法论线索出发进行分析。
标题里最有信息量的词是“打通”。它不是简单地提出一个新的轨迹预测头,而是试图把驾驶场景与基础模型预训练之间那道墙拆掉。
3.1 场景侧:驾驶数据有什么特征
驾驶场景是一个高度结构化、强时间因果、强空间约束的场景。车辆必须遵守交通规则,必须避开障碍物,必须保持乘坐舒适性。这些约束在传统感知数据里很难直接体现,但一条轨迹标签可以:轨迹的形态本身就包含了避障、换道、跟车等行为信息。
3.2 基模侧:预训练模型需要什么输入
基础模型预训练需要的是“任务简单、规模巨大、标注宽松”的数据。越接近模型预训练时的数据分布,迁移效果越好。视觉基础模型已经学习过海量图像中物体的边缘、形状、遮挡、运动模式;如果驾驶轨迹也能以视觉模式出现,模型就能用已经学到的视觉能力去处理驾驶决策。
这正是 DriveTeach-VLA 的切入点:用图像轨迹作为统一表示,让驾驶场景变成基础模型熟悉的视觉任务。
4. 核心机制拆解:图像轨迹如何打通驾驶场景与基模预训练
接下来进入技术机制部分。我会把“图像轨迹”这条链路拆成四个环节:轨迹如何变成图像、如何自动生成标签、如何设计预训练任务、以及如何接入下游微调。
4.1 从物理轨迹到图像轨迹
车辆记录的轨迹通常是自车坐标系下的坐标点,例如时间序列上的 (x, y, heading)。要把这些点画到图像上,需要经过一次坐标系变换:自车坐标到相机坐标,再到像素坐标。
单目相机标定后,可以得到内参矩阵 K 和外参矩阵 [R|t]。自车坐标系下的点 P_vehicle 先变换到相机坐标系,再投影到像素平面:
实际代码里一般不会手写矩阵乘法,而是用现成的几何库。关键是理解:这一步把连续物理坐标转成了离散视觉覆盖层,让轨迹和图像共享同一个像素坐标系。
4.2 轨迹标签的自动生成
传统 VLA 需要人工标注轨迹,因为需要知道“合理轨迹”到底是什么。但 DriveTeach-VLA 的思路可以做到无需人工标注。车辆上普遍安装有惯性测量单元和全球导航卫星系统,可以记录历史位置和姿态。只要把历史轨迹叠加到当前图像上,就得到一份“过去是怎么走的”自监督数据。
未来轨迹同样可以从真实行驶录像中提取:车队在采数据时,司机本身就是在执行一次驾驶行为,车辆最终走出来的路径就是一条可用的未来轨迹。这意味着,大量没有经过人工标注的普通行车录像,都可以变成训练数据。
这是一种数据层面的“解锁”。它不要求你拥有高精地图,也不要求你聘请大量标注员,只要车辆在跑,就在产生训练样本。
4.3 构建图像轨迹训练样本
为了更具体地理解这个过程,下面给出一个概念性的数据样本结构。需要说明的是,这不是论文官方代码,而是从“图像轨迹”思路延伸出的最小实现逻辑。
在代码里,history_trajectory 是过去 1 秒的轨迹点投影到像素坐标系后的结果,future_trajectory 是未来 3 秒的轨迹点,future_trajectory_mask 是把未来轨迹渲染成图像后的二值掩码。模型看到的是当前帧图像和历史轨迹,预测目标是未来轨迹掩码。
4.4 预训练任务设计
传统 VLA 的预训练目标和下游驾驶任务往往是分开的。DriveTeach-VLA 的思路是让预训练任务本身就和驾驶相关:给定历史帧图像和历史轨迹,让模型预测未来轨迹。
这个任务有几个好处。第一,它不需要文本标签,所有训练数据都来自车辆自带的定位和录像。第二,它和基础模型的视觉预训练天然兼容,模型本来就会做掩码预测、未来帧预测这类任务。第三,它保留了时间维度,模型可以从历史状态中推理出未来状态,这正是驾驶规划最核心的能力。
到了下游微调阶段,只需要增加一个轻量的轨迹解码头,把预训练阶段学到的视觉轨迹知识迁移到实际规划任务即可。
5. 规模化认知升级:数据、表示、训练三个层面
如果说“图像轨迹”是一个接口设计,那么它的价值最终要体现在“能不能规模化”上。我把规模化拆成三个层面来分析。
5.1 数据层面:规模来源变了
传统 VLA 的数据规模受限于人工标注能力和高精地图覆盖范围。DriveTeach-VLA 的思路下,轨迹可以直接从行车记录中自动提取,数据规模的天花板被显著提升。
| 维度 | 传统 VLA | DriveTeach-VLA 思路 |
|---|---|---|
| 轨迹标签来源 | 人工标注或高精地图生成 | 车辆定位系统自动提取 |
| 对高精地图依赖 | 强 | 弱 |
| 可扩展数据来源 | 标注车队录像 | 全部历史行车录像 |
| 单样本成本 | 高 | 低 |
这意味着,当别人还在为一个城市的数据标注付费时,采用这种思路的团队已经在用所有运营车辆的录像做预训练了。
5.2 表示层面:与视觉基模对齐
基础模型预训练学到的最核心能力,是对视觉输入的层次化理解。自动驾驶轨迹以图像轨迹形式出现后,输入和输出都是视觉域,整个模型可以作为一个视觉模型来优化,而不是在视觉和语言之间来回转换。
这种“同域映射”带来的直接收益是训练更稳定。模型不再需要学习“从图像到文本再到坐标”的多级离散化映射,而是学习“从图像到图像”的连续视觉变换。这和图像分割、视频预测、光流估计等基础任务更加接近,也更容易复用已有的预训练权重。
5.3 训练层面:可以沿用基础模型的稳定策略
基础模型预训练已经积累了大量稳定的训练技巧,比如掩码重建、对比学习、梯度累积、混合精度训练。这些技巧在文本和图像任务上被验证过,但当动作空间变成文本坐标时,很多技巧并不直接适用。
DriveTeach-VLA 把轨迹变成图像掩码后,训练目标就变成了一个标准的视觉回归或视觉分类任务。团队可以直接套用视觉预训练中成熟的学习率调度、损失函数设计和数据增强策略,而不是为动作头单独设计一套复杂的训练方案。
6. 对工程团队的落地启发
如果你是做自动驾驶 VLA、端到端规划,或者机器人操作的研发工程师,可以从 DriveTeach-VLA 的思路里抽取三个可以立刻实践的点。
6.1 把轨迹输出从坐标改成视觉掩码
如果你现在的模型还在用全连接层直接回归轨迹坐标,可以尝试加一个视觉轨迹解码头。具体做法是:在骨干网络之上增加一个反卷积或上采样分支,输出与输入图像分辨率一致的轨迹掩码,再从掩码中提取轨迹坐标。
这样做的好处是,轨迹生成过程可以被更强的视觉特征约束,而不是只依赖最后的全局特征向量。
6.2 构造“历史帧+轨迹掩码”的预训练任务
即使你暂时不做 VLA,只是想提升现有端到端模型的规划能力,也可以试试下面这个自监督预训练思路。下面的代码是概念性伪代码,用于展示任务设计逻辑。
这个任务的关键是:历史轨迹不是作为额外 token 输入,而是以掩码形式叠加到图像上,让模型直接看到“车是从哪里开过来的”。模型需要在理解画面内容的同时,结合历史行驶路径,推断接下来怎么走。
6.3 评估协议加入视觉轨迹指标
很多团队评估轨迹预测时只比较 L2 误差和碰撞率。但如果你换成了图像轨迹表示,建议增加一个掩码级别的指标,否则无法判断视觉轨迹解码器是否真的学到了空间结构。
这里计算的是预测轨迹区域和真实轨迹区域的重叠程度。IoU 越高,说明模型对“轨迹落在哪里”的空间判断越准确。相比直接比较坐标点的欧氏距离,这种评估方式更能反映视觉轨迹表示的稳定性。
6.4 常见的坑与规避方式
把轨迹画到图像上并不是没有代价。最容易遇到的坑有三个:
第一个坑是轨迹遮挡关键场景信息。如果轨迹线条太粗、颜色太显眼,模型可能只盯着轨迹线看,而忽略车道线、行人、红绿灯等关键信息。建议在渲染轨迹时使用较细的线条,并加入透明度扰动,甚至刻意遮挡部分轨迹段,迫使模型从场景中学习。
第二个坑是轨迹渲染风格单一导致过拟合。如果所有训练数据的轨迹都是同一种颜色、同一种线性绘制方式,模型可能只是学会了“识别这条线”,而不是“理解这条线代表什么未来行为”。建议在渲染阶段引入随机颜色、线型、抖动甚至残缺,让模型学到轨迹的抽象语义。
第三个坑是训练和推理时的输入分布不一致。预训练时你可能把历史轨迹叠加在图像上输入,但推理时车辆还没有实际看到未来的轨迹,模型只能看到历史轨迹和场景。这里要时刻注意,历史轨迹和未来轨迹的渲染方式、时间范围在训练和推理时保持一致,不能在训练时泄露未来信息。
7. 挑战与开放问题
DriveTeach-VLA 指出了自动驾驶 VLA 规模化的一条可行路径,但并不意味着问题已经全部解决。有几个关键挑战仍然值得持续关注。
7.1 闭环安全性如何保证
图像轨迹预训练擅长让模型学习泛化的视觉轨迹概念,但“泛化”和“安全”之间还是有距离。视觉轨迹预训练模型本质上是在做预测,而自动驾驶要求的是一个能在安全边界内稳定执行的规划器。
从预训练模型到在线规划器,中间还需要一层安全校验机制,比如规则约束、安全距离校验、紧急制动兜底。未来一个值得关注的方向是:能否在视觉轨迹预训练框架中直接加入安全约束损失,而不是把安全设计放在模型之外。
7.2 预测任务与规划任务的边界
图像轨迹预测解决的是“车会怎么走”,但没有完全解决“车应该怎么走”。真实驾驶场景中有大量规则性和社会性约束,比如红绿灯、交警手势、其他车辆意图博弈。这些信息很难只通过视觉轨迹学习和预测来覆盖。
更稳妥的判断是,DriveTeach-VLA 提出的“图像轨迹”更适合作为 VLA 的底层表示层,而不是替代所有推理模块。在实际项目中,它最有可能与文本推理、规则引擎并行工作,而不是取代它们。
7.3 评估标准尚未统一
目前各家 VLA 采用的评估协议差别很大,有的看开环 L2,有的看闭环驾驶分数,有的看语言指令执行成功率。不同的评估方式会得出完全相反的结论。DriveTeach-VLA 如果希望真正推动规模化路线被社区接受,需要在论文公开时提供清晰的评测协议和消融实验,尤其是“图像轨迹表示”和“传统坐标表示”之间的对照。
7.4 数据噪声的影响
从车辆定位系统自动提取轨迹,虽然省去了人工标注,但也引入了噪声。定位漂移、时间戳同步误差、传感器标定误差都会体现在轨迹掩码上。模型如果在大规模数据上学习了这些噪声模式,可能会降低规划精度。实际落地时,至少需要一个过滤环节,把定位跳变明显、时间戳错乱、相机标定偏差过大的样本剔除掉。
8. 总结与下一步关注方向
DriveTeach-VLA 最有价值的贡献,不是提出一个新的轨迹预测网络,而是提供了一种“表示设计”的思路:让驾驶行为的表达方式,与视觉基础模型已经熟悉的输入方式对齐。用图像轨迹替代文本坐标,看似只是输出空间的变化,实际上改变了数据获取成本、模型训练方式和规模化的天花板。
如果你正在做自动驾驶 VLA,完全可以先把轨迹输出从坐标回归改成视觉掩码预测,再构造一个不需要人工标注的自监督预训练任务。跑通之后再逐步叠加语言推理、安全校验和闭环评估。
从研究方向上看,接下来值得关注三个问题:第一,图像轨迹表示能否统一覆盖自车规划、他车轨迹预测、行人意图预测等多种任务;第二,视觉轨迹预训练和语言推理在同一个模型中如何更好融合;第三,这种表示方法能否迁移到机器人操作等其他具身智能领域。
自动驾驶 VLA 的规模化竞赛刚刚开始,真正拉开差距的,可能不是谁的 GPU 更多,而是谁能先把驾驶任务翻译成基础模型真正擅长的语言。DriveTeach-VLA 给出的答案是:让轨迹先变成图像,再谈规模。