1. 引言
期刊简称:IEEE ITS Magazine
导读:世界模型,能解决深度强化学习交通控制训练数据难获取的问题吗?
城市路口信号灯配时不合理,早晚高峰堵车让人心累。这项研究把「世界模型」引入深度强化学习交通信号控制,用数据驱动的方式直接生成训练数据,绕开耗时且难标定的微观交通仿真。仿真/实验显示,加入世界模型后,多路口网络场景下各算法的平均排队长度、平均旅行时间和平均等待时间均显著下降,训练收敛也更快。
2. 基本信息
| 项目 | 内容 |
|---|---|
| 论文原题名 | Boosting the Training of Deep Reinforcement Learning Traffic Control by Using the World Model |
| 中文译题 | 利用世界模型提升深度强化学习交通控制的训练效果 |
| 刊载期刊 | IEEE Intelligent Transportation Systems Magazine(IEEE ITS Magazine) |
| 全部作者 | Pengbo Wang、Yisheng Lv、Jingwei Ge、Li Li |
| 作者所属单位 | 清华大学自动化系;中国科学院自动化研究所多模态人工智能系统国家重点实验室;清华大学北京信息科学与技术国家研究中心 |
| 论文关键词 | 深度强化学习;交通信号控制;世界模型;数据效率;交通流预测;SUMO仿真 |
| 发表时间 | 2024年8月20日在线发表;2025年5/6月刊,卷号17,文章号58–66 |
| DOI | 10.1109/MITS.2024.3440069 |
3. 研究动机与背景
缓解深度强化学习训练数据难以获取的痛点。传统DRL需要大量交互数据才能学到最优策略,而在真实交通场景中,长时间观测记录车流、车辆行为等信息成本高、难度大,数据效率成为制约瓶颈。
让仿真数据生成更高效、更易标定。许多DRL交通控制方法依赖微观交通仿真生成训练数据,但微观仿真既耗时又难以根据实地数据标定,生成的仿真结果可能有偏,难以支撑训练出好的DRL模型。
同时考虑真实数据与仿真数据的融合利用。本文希望既能利用有限的实地数据,又能借助仿真平台补充样本,让世界模型在两类数据上学习交通流动态与信号控制的影响,从而提升训练效率与控制效果。
4. 核心创新点
用世界模型替代微观交通仿真生成训练数据。通过数据驱动的方式直接生成车流、车辆行为等充足数据,无需繁琐的微观仿真参数标定。
联合建模交通流动态与信号控制影响。世界模型不仅学习交通流本身的演化,还学习信号控制策略对交通模式的影响,从而更准确地模拟环境反馈。
方法层面的巧思:环境—记忆—控制三部分结构。借鉴人脑的感知、记忆与决策机制,将世界模型拆分为环境部分、记忆部分和控制部分,分别负责感知、记录与决策。
评估维度上的新意:多算法、多场景对比。在单路口与多路口网络两类数据集上,对DQN、PPO、SAC、CoLight、MASAC等多种算法逐一验证世界模型的增益,并给出训练曲线与收敛速度分析。
5. 论文摘要
深度强化学习(DRL)交通控制因被视为缓解拥堵的有力工具而日益受到关注,但传统DRL模型需要大量交互数据,这些数据在实地测试和仿真测试中都难以收集。为克服这些挑战,本文采用世界模型来更好地训练用于交通控制的DRL模型。所提出的世界模型能够基于有限的实地与仿真数据,快速学习交通流动态以及信号控制的影响;随后,DRL控制模型可以转而基于世界模型生成的训练数据来建立。实验结果表明,使用世界模型的DRL交通控制能够取得明显更优的信号控制策略,为优化城市交通提供了一种有前景的解决方案。
关键数字:在多路口网络数据集上,CoLight+WM相较CoLight,平均排队长度从16.7降至15.2(降低约9%),平均旅行时间从294.1秒降至269.8秒(降低约8.3%),平均等待时间从134.6降至120.4(降低约10.5%);MASAC+WM相较MASAC,平均排队长度从14.7降至12.1(降低约17.7%),平均旅行时间从240.4秒降至193.4秒(降低约19.6%),平均等待时间从119.5降至81.3(降低约32%)。
6. 研究方法
6.1 方法总起:世界模型驱动的交通信号控制框架
本文构建了一个模仿人脑连贯思考与决策过程的世界模型,整体分为环境部分、记忆部分与控制部分。环境部分作为感官输入,感知复杂动态环境;记忆部分记录并管理过去、现在与预测的世界状态及其代价或奖励;控制部分负责与环境交互,利用整合的数据、记忆与预测信息做出决策。研究对象为城市路网中的信号灯控制,边界设定在单路口与多路口网络两类场景。
6.2 环境部分:SUMO仿真平台
环境部分指模拟交通网络与信号控制的虚拟环境。本文利用开源微观仿真平台SUMO构建模拟真实交通信号控制环境的平台,能够精确建模交通网络、定义路网拓扑、指定不同路口的交通需求,并模拟车辆行为与路口交通交互,评估信号控制策略对交通模式的影响,为评估各类交通管理方案提供平台。
6.3 记忆部分:LSTM预测网络
记忆部分的核心是一个基于LSTM的预测网络,它利用带时间信息的神经网络持续获取数据。该网络接收过去N个时刻的观测序列,通过LSTM单元提取时序特征,输出对下一时刻状态的预测。预测网络不断将新生成的数据与原始数据集整合,作为DRL算法的输入,从而加速样本获取并提升样本利用率。
6.4 控制部分:DRL算法训练
控制部分直接负责与环境交互。本文在单路口数据集上对比DQN、PPO、SAC三种算法,在多路口网络数据集上对比CoLight、MASAC两种算法,分别考察加入世界模型(+WM)前后的控制效果。训练过程中,世界模型与DRL控制模型都持续由SUMO生成的新数据更新。
6.5 实验/仿真设置
实验使用两类数据集:单路口交通流数据集与多路口网络交通流数据集。评估指标包括平均排队长度(ANQ)、平均旅行时间(ATT)与平均等待时间(AWT)。对比基线为不使用世界模型的各DRL算法。训练过程中记录奖励随回合数的变化曲线,用于分析收敛速度。
7. 实验结果
7.1 发现1:单路口场景增益有限
在单路口数据集上,加入世界模型后各DRL算法的ANQ与AWT并未出现显著改善。原因在于单路口场景下,DRL算法本身已能有效控制信号灯,额外增加的样本数据对控制效果的提升并不明显。DQN+WM的ANQ从13.2降至12.8,SAC+WM从12.8降至12.7,改善幅度都很小。
| 算法 | ANQ (veh) | AWT (s/veh) |
|---|---|---|
| DQN | 13.2 | 4.6* |
| DQN + WM | 12.8* | 4.6* |
| PPO | 18.4 | 7.2 |
| PPO + WM | 17.9* | 7* |
| SAC | 12.8 | 4.9 |
| SAC + WM | 12.7* | 4.7* |
表注:最优值以粗体加星号标记;veh表示车辆数,WM表示使用世界模型。单路口场景下世界模型带来的增益有限。
7.2 发现2:多路口网络场景显著改善
在多路口网络数据集上,加入世界模型后各算法的ANQ、ATT与AWT均显著下降。随着路口数量增加,DRL算法需要大量样本数据训练,而样本获取速度却在下降;世界模型恰好弥补了这一短板。MASAC+WM的AWT从119.5降至81.3,降幅约32%,改善最为明显。需要诚实说明:并非每项指标在所有算法上都达到最优,但整体趋势一致向好。
| 算法 | ANQ (veh) | ATT (s) | AWT (s/veh) |
|---|---|---|---|
| CoLight | 16.7 | 294.1 | 134.6 |
| CoLight + WM | 15.2* | 269.8* | 120.4* |
| MASAC | 14.7 | 240.4 | 119.5 |
| MASAC + WM | 12.1* | 193.4* | 81.3* |
表注:最优值以粗体加星号标记;veh表示车辆数,WM表示使用世界模型。多路口网络场景下世界模型带来显著改善。
7.3 发现3:训练收敛速度加快
从训练曲线(图4)可以看出,加入世界模型后,不同RL算法获得了更多路况信息预测数据,奖励随回合数的收敛速度明显快于仅使用DRL算法。世界模型帮助DRL获得更多数据、更好地控制信号灯,并更快取得更好的控制结果。这是因为模型能更好地提取交通特征信息,学习更优的价值与策略函数,从而显著加速样本获取并提升样本利用率。
7.4 发现4:作者也考虑的代价与成本
作者在文中也坦诚讨论了世界模型的代价维度:世界模型本身需要训练,其建模精度直接影响生成数据的质量;当前实现采用简单的LSTM模型,虽然已足够提升控制性能与样本利用效率,但仍有进一步提升建模精度的空间。此外,世界模型利用历史序列观测信息预测智能体当前状态,并结合非相邻智能体之间的信息,以提升交通流更复杂时模型训练的鲁棒性。
8. 结语
研究解决的问题与意义:本文提出基于世界模型的交通信号控制方法,有效加速了控制部分样本数据的获取并提升了样本利用率,从而加快模型训练并增强控制效果。研究边界在于:当前世界模型采用简单的LSTM实现,建模精度仍有提升空间。
研究局限与未来方向:证据来源为SUMO仿真实验,未覆盖真实路测场景;作者指出未来将分析如何提升世界模型的建模精度,并探索利用世界模型增强交通数据生成、向控制模块输送多样且精细的数据,最终改善控制效果。总体而言,本文为世界模型在交通控制中的应用提供了有价值的探索,但结论不宜过度夸大。
—— 点赞 / 分享 / 在看 ——
欢迎关注本公众号,持续获取智能交通与AI前沿论文导读。想加入读者交流群、与作者和同行深入讨论?欢迎在后台留言「加群」。
往期推荐:
- 深度强化学习在单路口信号控制中的模型对比
- 多智能体强化学习如何协调城市路网信号灯
- 基于注意力机制的动脉路信号控制新方法
- 交通流预测与信号控制的联合优化思路
- 从DQN到MASAC:交通信号控制的强化学习演进