news 2026/10/8 8:25:50

世界模型加持,深度强化学习交通信号控制训练提速|论文导读

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
世界模型加持,深度强化学习交通信号控制训练提速|论文导读

1. 引言

期刊简称:IEEE ITS Magazine

导读:世界模型,能解决深度强化学习交通控制训练数据难获取的问题吗?

城市路口信号灯配时不合理,早晚高峰堵车让人心累。这项研究把「世界模型」引入深度强化学习交通信号控制,用数据驱动的方式直接生成训练数据,绕开耗时且难标定的微观交通仿真。仿真/实验显示,加入世界模型后,多路口网络场景下各算法的平均排队长度、平均旅行时间和平均等待时间均显著下降,训练收敛也更快。

2. 基本信息

项目内容
论文原题名Boosting the Training of Deep Reinforcement Learning Traffic Control by Using the World Model
中文译题利用世界模型提升深度强化学习交通控制的训练效果
刊载期刊IEEE Intelligent Transportation Systems Magazine(IEEE ITS Magazine)
全部作者Pengbo Wang、Yisheng Lv、Jingwei Ge、Li Li
作者所属单位清华大学自动化系;中国科学院自动化研究所多模态人工智能系统国家重点实验室;清华大学北京信息科学与技术国家研究中心
论文关键词深度强化学习;交通信号控制;世界模型;数据效率;交通流预测;SUMO仿真
发表时间2024年8月20日在线发表;2025年5/6月刊,卷号17,文章号58–66
DOI10.1109/MITS.2024.3440069

3. 研究动机与背景

  1. 缓解深度强化学习训练数据难以获取的痛点。传统DRL需要大量交互数据才能学到最优策略,而在真实交通场景中,长时间观测记录车流、车辆行为等信息成本高、难度大,数据效率成为制约瓶颈。

  2. 让仿真数据生成更高效、更易标定。许多DRL交通控制方法依赖微观交通仿真生成训练数据,但微观仿真既耗时又难以根据实地数据标定,生成的仿真结果可能有偏,难以支撑训练出好的DRL模型。

  3. 同时考虑真实数据与仿真数据的融合利用。本文希望既能利用有限的实地数据,又能借助仿真平台补充样本,让世界模型在两类数据上学习交通流动态与信号控制的影响,从而提升训练效率与控制效果。

4. 核心创新点

  1. 用世界模型替代微观交通仿真生成训练数据。通过数据驱动的方式直接生成车流、车辆行为等充足数据,无需繁琐的微观仿真参数标定。

  2. 联合建模交通流动态与信号控制影响。世界模型不仅学习交通流本身的演化,还学习信号控制策略对交通模式的影响,从而更准确地模拟环境反馈。

  3. 方法层面的巧思:环境—记忆—控制三部分结构。借鉴人脑的感知、记忆与决策机制,将世界模型拆分为环境部分、记忆部分和控制部分,分别负责感知、记录与决策。

  4. 评估维度上的新意:多算法、多场景对比。在单路口与多路口网络两类数据集上,对DQN、PPO、SAC、CoLight、MASAC等多种算法逐一验证世界模型的增益,并给出训练曲线与收敛速度分析。

5. 论文摘要

深度强化学习(DRL)交通控制因被视为缓解拥堵的有力工具而日益受到关注,但传统DRL模型需要大量交互数据,这些数据在实地测试和仿真测试中都难以收集。为克服这些挑战,本文采用世界模型来更好地训练用于交通控制的DRL模型。所提出的世界模型能够基于有限的实地与仿真数据,快速学习交通流动态以及信号控制的影响;随后,DRL控制模型可以转而基于世界模型生成的训练数据来建立。实验结果表明,使用世界模型的DRL交通控制能够取得明显更优的信号控制策略,为优化城市交通提供了一种有前景的解决方案。

关键数字:在多路口网络数据集上,CoLight+WM相较CoLight,平均排队长度从16.7降至15.2(降低约9%),平均旅行时间从294.1秒降至269.8秒(降低约8.3%),平均等待时间从134.6降至120.4(降低约10.5%);MASAC+WM相较MASAC,平均排队长度从14.7降至12.1(降低约17.7%),平均旅行时间从240.4秒降至193.4秒(降低约19.6%),平均等待时间从119.5降至81.3(降低约32%)。

6. 研究方法

6.1 方法总起:世界模型驱动的交通信号控制框架

本文构建了一个模仿人脑连贯思考与决策过程的世界模型,整体分为环境部分、记忆部分与控制部分。环境部分作为感官输入,感知复杂动态环境;记忆部分记录并管理过去、现在与预测的世界状态及其代价或奖励;控制部分负责与环境交互,利用整合的数据、记忆与预测信息做出决策。研究对象为城市路网中的信号灯控制,边界设定在单路口与多路口网络两类场景。

真实环境数据

世界模型(LSTM)

SUMO微观仿真数据

生成训练数据

DRL控制模型

信号控制动作

SUMO环境反馈

6.2 环境部分:SUMO仿真平台

环境部分指模拟交通网络与信号控制的虚拟环境。本文利用开源微观仿真平台SUMO构建模拟真实交通信号控制环境的平台,能够精确建模交通网络、定义路网拓扑、指定不同路口的交通需求,并模拟车辆行为与路口交通交互,评估信号控制策略对交通模式的影响,为评估各类交通管理方案提供平台。

6.3 记忆部分:LSTM预测网络

记忆部分的核心是一个基于LSTM的预测网络,它利用带时间信息的神经网络持续获取数据。该网络接收过去N个时刻的观测序列,通过LSTM单元提取时序特征,输出对下一时刻状态的预测。预测网络不断将新生成的数据与原始数据集整合,作为DRL算法的输入,从而加速样本获取并提升样本利用率。

6.4 控制部分:DRL算法训练

控制部分直接负责与环境交互。本文在单路口数据集上对比DQN、PPO、SAC三种算法,在多路口网络数据集上对比CoLight、MASAC两种算法,分别考察加入世界模型(+WM)前后的控制效果。训练过程中,世界模型与DRL控制模型都持续由SUMO生成的新数据更新。

6.5 实验/仿真设置

实验使用两类数据集:单路口交通流数据集与多路口网络交通流数据集。评估指标包括平均排队长度(ANQ)、平均旅行时间(ATT)与平均等待时间(AWT)。对比基线为不使用世界模型的各DRL算法。训练过程中记录奖励随回合数的变化曲线,用于分析收敛速度。

7. 实验结果

7.1 发现1:单路口场景增益有限

在单路口数据集上,加入世界模型后各DRL算法的ANQ与AWT并未出现显著改善。原因在于单路口场景下,DRL算法本身已能有效控制信号灯,额外增加的样本数据对控制效果的提升并不明显。DQN+WM的ANQ从13.2降至12.8,SAC+WM从12.8降至12.7,改善幅度都很小。

算法ANQ (veh)AWT (s/veh)
DQN13.24.6*
DQN + WM12.8*4.6*
PPO18.47.2
PPO + WM17.9*7*
SAC12.84.9
SAC + WM12.7*4.7*

表注:最优值以粗体加星号标记;veh表示车辆数,WM表示使用世界模型。单路口场景下世界模型带来的增益有限。

7.2 发现2:多路口网络场景显著改善

在多路口网络数据集上,加入世界模型后各算法的ANQ、ATT与AWT均显著下降。随着路口数量增加,DRL算法需要大量样本数据训练,而样本获取速度却在下降;世界模型恰好弥补了这一短板。MASAC+WM的AWT从119.5降至81.3,降幅约32%,改善最为明显。需要诚实说明:并非每项指标在所有算法上都达到最优,但整体趋势一致向好。

算法ANQ (veh)ATT (s)AWT (s/veh)
CoLight16.7294.1134.6
CoLight + WM15.2*269.8*120.4*
MASAC14.7240.4119.5
MASAC + WM12.1*193.4*81.3*

表注:最优值以粗体加星号标记;veh表示车辆数,WM表示使用世界模型。多路口网络场景下世界模型带来显著改善。

7.3 发现3:训练收敛速度加快

从训练曲线(图4)可以看出,加入世界模型后,不同RL算法获得了更多路况信息预测数据,奖励随回合数的收敛速度明显快于仅使用DRL算法。世界模型帮助DRL获得更多数据、更好地控制信号灯,并更快取得更好的控制结果。这是因为模型能更好地提取交通特征信息,学习更优的价值与策略函数,从而显著加速样本获取并提升样本利用率。

7.4 发现4:作者也考虑的代价与成本

作者在文中也坦诚讨论了世界模型的代价维度:世界模型本身需要训练,其建模精度直接影响生成数据的质量;当前实现采用简单的LSTM模型,虽然已足够提升控制性能与样本利用效率,但仍有进一步提升建模精度的空间。此外,世界模型利用历史序列观测信息预测智能体当前状态,并结合非相邻智能体之间的信息,以提升交通流更复杂时模型训练的鲁棒性。

8. 结语

研究解决的问题与意义:本文提出基于世界模型的交通信号控制方法,有效加速了控制部分样本数据的获取并提升了样本利用率,从而加快模型训练并增强控制效果。研究边界在于:当前世界模型采用简单的LSTM实现,建模精度仍有提升空间。

研究局限与未来方向:证据来源为SUMO仿真实验,未覆盖真实路测场景;作者指出未来将分析如何提升世界模型的建模精度,并探索利用世界模型增强交通数据生成、向控制模块输送多样且精细的数据,最终改善控制效果。总体而言,本文为世界模型在交通控制中的应用提供了有价值的探索,但结论不宜过度夸大。

—— 点赞 / 分享 / 在看 ——

欢迎关注本公众号,持续获取智能交通与AI前沿论文导读。想加入读者交流群、与作者和同行深入讨论?欢迎在后台留言「加群」。

往期推荐:

  • 深度强化学习在单路口信号控制中的模型对比
  • 多智能体强化学习如何协调城市路网信号灯
  • 基于注意力机制的动脉路信号控制新方法
  • 交通流预测与信号控制的联合优化思路
  • 从DQN到MASAC:交通信号控制的强化学习演进
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/8 8:25:00

Unsloth 微调 构建自己的大模型 没有GPU也能微调

这次我们使用unsloth框架来微调模型,将模型微调成一个垂直领域的模型先说问题This environment is externally managed ╰─> To install Python packages system-wide, try apt installpython3-xyz, where xyz is the package you are trying toinstall.从 Pyth…

作者头像 李华
网站建设 2026/10/8 8:22:34

C语言阶段总结

这篇语法笔记包含一些基础的c语言知识点头文件、导入库stdio.h 是标准输入库,我们常用的 printf 和 scanf 函数就来自这个库。stdlib.h可引入动态内存分配malloc数值类型转换。math.h可导入一些类似绝对值计算等成型数学函数计算的语句。string.h可导入一些有关字符…

作者头像 李华
网站建设 2026/10/8 8:22:24

pi agent编程智能体完全指南:从任务闭环到子代理实践

1. 为什么说 pi 是编程智能体的“手感天花板”最近圈子里突然多了个高频词——“pi agent”。我一开始以为是圆周率的梗,后来发现是个能真正跑起来的开源智能体框架,而且它的名字起的非常有讲究:圆周率 pi 无限不循环,恰好暗合这种…

作者头像 李华
网站建设 2026/10/8 8:22:14

为什么需要固态变压器SST

传统变压器与固态变压器区别:为什么要发展固态变压器? 1、数据中心功率密度快速提升 英伟达B200等芯片功耗突破1000W ,单机柜功率从传统的10-20kW向50kW甚至100kW演进 ,传统供电方案体积过大且效率遭遇瓶颈。直流供电趋势&#xf…

作者头像 李华
网站建设 2026/10/8 8:19:24

ponytail插件实战:用依赖图与自动化整理终结混乱代码库

最近在给一个维护了两年的项目做结构化整理,越改越崩溃:工具函数散在三个文件夹里,import 顺序乱得没法看,还有一堆没人敢删的“可能以后会用到”的文件。后来我在社区里发现一个叫 ponytail 的插件,名字很有意思&…

作者头像 李华
网站建设 2026/10/8 8:18:55

90天小白程序员转型AI大模型开发:收藏这份学习路线

本文提供了一份为期90天的程序员转型AI大模型开发的学习路线,旨在帮助学习方向不明确和感到困惑的程序员找到正确的学习目标。文章涵盖了从大模型基础认知到核心技术模块、开发基础能力、应用场景开发、项目落地流程以及面试求职冲刺等六大模块,详细介绍…

作者头像 李华