news 2026/9/29 9:51:45

RL-07-赵-不基于模型2-计算Q/ActionValue-TD算法04:Q-Learning02【On-policy:行为策略=目标策略】【Off-policy:行为策略≠目标策略】

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
RL-07-赵-不基于模型2-计算Q/ActionValue-TD算法04:Q-Learning02【On-policy:行为策略=目标策略】【Off-policy:行为策略≠目标策略】

RL-赵-(七)-不基于模型5:Q-Learning【TD算法】【离线】【基于RM算法在无模型条件下求解贝尔曼最优公式->直接计算出最优ActionValue->直接更新目标π】【无需PE与PI迭代】



二、Off-policy、On-policy


在深入研究Q-learning之前,我们首先介绍两个重要的概念,首先,在TD learning task中存在两个策略:

  • 第一个是behav
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/29 9:50:22

CentOS 7部署Zabbix 5.0 LTS监控系统:从零到一的完整教程

在运维和网络工程这个行当里,踩过的坑多了之后,你会发现一件很有意思的事:很多刚入职的同事或者正在学监控系统的同学,卡住他们的往往不是Zabbix本身多难用,而是从零到一部署这套东西的过程中,各种细节没对…

作者头像 李华
网站建设 2026/9/29 9:46:23

轨道紧固件缺陷检测数据集VOC+YOLO格式611张6类别

数据集格式:Pascal VOC格式YOLO格式(不包含分割路径的txt文件,仅仅包含jpg图片以及对应的VOC格式xml文件和yolo格式txt文件)图片数量(jpg文件个数):611标注数量(xml文件个数):611标注数量(txt文件个数):611标注类别数&…

作者头像 李华
网站建设 2026/9/29 9:41:02

GNSS电离层延迟估计全解析:从物理机制到RTKLIB工程实践

做GNSS定位的朋友应该都遇到过这种情况:明明是晴天、卫星数也足够,固定解却突然“飘”出去几米,或者单点定位精度肉眼可见地变差。如果恰好又赶上太阳活动活跃的年份,这种情况会更频繁,甚至连续几天都没法达到厘米级。…

作者头像 李华
网站建设 2026/9/29 9:40:14

模型压缩与优化实战:剪枝、量化、蒸馏与部署全流程解析

如果你平时也在做模型训练和部署,应该有过这种体会:模型在验证集上跑得挺好,一到真实环境就发现体积大、推理慢、显存吃紧,甚至是线上机器根本带不动。我这次要分享的项目“Model-Optimizer”就是专门解决这一串问题的——按我的理…

作者头像 李华