自动驾驶_规控_基于AR(自回归模型)的轨迹优化

发布时间:2026/8/11 22:27:52
自动驾驶_规控_基于AR(自回归模型)的轨迹优化 生成式模型介绍我们本身就活在生成之中生成其实并不是一个陌生或遥远的概念。我们说出的每一句话都是大脑在瞬间生成的产物我们看到的每一张图像本质上也是现实世界通过光线、结构与规律生成给我们的感知结果。从这个角度看生成模型并不是凭空发明的新事物而是人类在用机器去模拟一种早已存在于自然与认知中的能力。正因如此生成模型的意义远不止造图写文章这么简单——它的核心价值在于辅助人类完成数据的生成过程让机器具备与人类相似的、创造性地产出信息的能力。从数学的角度理解生成模型如果抛开具体的技术实现从数学本质来看生成模型要做的事情其实很纯粹学习一个概率分布 p(x)。这个分布描述的是生成某个具体结果 x 的可能性有多大。举一个直观的例子p(海水是蓝色的) —— 概率较高符合我们对世界的普遍认知p(海水是黄色的) —— 概率较低虽然并非完全不可能比如浑浊的近海但明显不符合常规经验。一个训练良好的生成模型就是要准确地捕捉到这种合理性的分布规律——让符合常识、符合数据规律的结果拥有更高的生成概率而让不合理的结果自然地被赋予更低的概率。生成模型的三大核心目标综合以上的思考我们可以将生成模型的目标清晰地归纳为三点1. 高效的采样能力模型应当能够较快地从学到的分布中采样出结果而不是耗费大量时间和算力才能生成一个样本。2. 采样结果符合预期生成出来的样本应当大概率落在合理的区间内——即符合真实数据分布规律的结果被赋予更高概率而不合理、不自然的结果则应当被赋予更低概率。3. 具备无监督学习与特征提取能力模型不应依赖大量人工标注数据而应能够从海量的无标注原始数据中自主学习到数据背后的深层特征与规律。自回归模型AR让过去预测未来拆解一下回归和自回归Regression本身是统计学里的概念指的是用一个或多个变量去预测另一个变量。比如经典的线性回归是用房屋面积地段等特征变量去预测房价这个目标变量——这里预测用的变量和被预测的变量是不同的东西。而**自回归Auto-Regression**的特殊之处就在于这个Auto自字它不是用外部的、别的变量去预测目标而是用这个变量自己过去时刻的值去预测它自己未来时刻的值。自回归模型AutoRegressive Model, AR遵循一个朴素而深刻的逻辑当前时刻的结果往往与此前发生的事情紧密相关。这类模型不依赖复杂精巧的特征工程而是直接利用数据自身在过去的表现来预测未来走势是时间序列分析中一种简洁却极为有效的方法。具体来说自回归模型的核心机制是每一步的生成都建立在前一步已生成结果的基础上。这个过程很像人类说话的方式——语言是一个字、一个词逐步蹦出来的每说出下一个词都是在综合之前已经说过的所有内容之后做出的选择。模型正是以这种链式、递进的方式一步步地完成整个序列的生成。GPT自回归模型AR模型 代表作GPT 其特点为 Decoder-Only 基本原理 从左往右学习的模型 只能利用上文或者下文的信息 AR模型通常用于生成式任务 在长文本的生成能力很强 比如自然语言生成NLG 领域的任务 摘要、 翻译或抽象问答GPT采用了Transformer的Decoder模块 但是GPT的Decoder Block模块与Transformer的Decoder模块相比, 做了一些改进:GPT中取消了第二个encoder-decoder attention子层,只保留MaskedMulti-HeadAttention层,和FeedForward层。 对比于经典的Transformer架构,解码器模块采用了6个Decoder Block、 GPT的架构中采用了12 个Decoder Block.GPT的训练包括两阶段过程:• 无监督的预训练语言模型• 有监督的下游任务fine-tunning无监督的预训练语言模型给定句子U [u1, u2, ..., un], GPT训练语言模型时的目标是最大化下面的似然函数:L_1(U) Sum(Log(P(u(i) | u(i-k),...,u(i-1);Θ))上述公式具体来说是要预测每个词u(i)的概率 这个概率是基于它前面u(i-k)到u(i−1)个词 以及模型Θ。这里的k表示上文的窗口大小 理论上来讲k取的越大 模型所能获取的上文信息越充足 模型的能力越强。GPT训练过程GPT是一个单向语言模型,模型对输入U 进行特征嵌入得到transformer 第一层的输入h_0再经过多层transformer特征编码 使用最后一层的输出即可得到当前预测的概率分布计算过程如下h_0 U x W_embedding W_positional_embeddingWp代表单词的位置编码,形状是[max_seq_len, embedding_dim]We的形状是[vocab_size, embedding_dim].得到输入张量h_0后, 要将h_0传入GPT的Decoder Block中, 依次得到h(t)最后通过得到的h(t)来预测下一个单词:ht​ transformer_block(h(l−1)) l∈ [1,t]P(u) softmax(ht * We)AR在自动驾驶中的应用AR模型架构输入部分 动静态信息 属性信息网络编码部分 信息编码自回归模型计算部分 next token predictiontoken解码部分 还原下一步预测结果信息接入在大语言模型中 每个 token 通常对应一个单词或词组 并以一个整数 ID 表示 随后通过 Embedding 层映射为连续的特征向量。 相比之下 自动驾驶场景中的 token 承载了更为丰富的语义信息 包括空间位置、 时间位置、 几何形状以及语义属性等。 具体而言 每个 token 由 4 个 sub-tensor 构成 这些 sub-tensor 通过一个由 MLP 与 Embedding 层组成的网络进行编码 最终融合为统一的特征向量 并输入到后续的 Transformer blocks 中进行建模AR模型优缺点优点介绍训练目标极其清晰——每一步就是个分类问题 预测下一个token是啥天然适合语言任务学习训练扩展性好——模型变大、 数据变多 效果就变好 scaling law在这条路上被验证得明明白白缺点介绍误差累积多模态表达能力弱长期规划能力有限参考自动驾驶之心