首页/新闻资讯/正文详情

RL-赵-(七)-不基于模型2-计算Q/ActionValue-TD算法01:Sarsa04【例子:只关注从一个特定的状态到达目标的一个策略或者路径,而不是要求每一个状态都达到最优策略】

发布时间:2026/9/27 22:29:12 来源:云帆数科 栏目:资讯中心
RL-赵-(七)-不基于模型2-计算Q/ActionValue-TD算法01:Sarsa04【例子:只关注从一个特定的状态到达目标的一个策略或者路径,而不是要求每一个状态都达到最优策略】
2、Sarsa案例举个例子 任务的目标是找到一条较好的路径从一个特定的starting state到target state。这个任务和之前的任务不同之前的任务是需要对每个state找到最优的策略但在这个例子其实我们不关注每一个状态我只关注从一个特定的状态然后到达目标的这样一个策略或者是路径。所以要能区分开来我们是要找这样从一个特定状态出发到达目标的最优策略问题还是找所有的这个状态它的最优的策略。每个episode从top-left state开始在target state终止In the future, pay attention to what the task is.任务设定rtarget0,rforbiddenrboundary−10,rother−1r_{target}0,r_{forbidden}r_{boundary}-10,r_{other}-1rtarget​0,rforbidden​rboundary​−10,rother​−1,学习率α0.1\alpha0.1α0.1ϵ\epsilonϵ的值是0.1。进行了500次探索500个episode。右图的横坐标表示一共有500个episode第0个episode是在左边慢慢地我不断地根据改进的策略重新采集得到的下一个episode。右图的上图表示每一个episode得到的total rewards。可以看在最开始的时候 reward的是比较负的因为最开始的策略是比较不好的 它可能是往墙上撞或者是进到forbidden area会有很多的负的reward进来。随着策略的不断改善 大家看reward也会变得越来越大。但是在这里边并没有超过0因为你到达目标这样应该是正数 为什么不是0呢就是因为这里边是ε-greedy的策略它或多或少还是会有负数的reward进来。右图的下图代表这个episode length。在最开始的时候 大家可以看到这个episode的长度是比较长的因为最开始的策略可能是不好的它可能走了很久它才瞎猫碰到死耗子刚好就碰到了target area。但是随着不断的改进可以看我再从最开始的好几百步我才能到达目标变为可以用几十步就可以到达目标了。结果左边的图表示Sarsa找到的最终策略。可以看到并不是所有的state拥有最优策略【比如cell(1,3)、cell(2,3)都没达到最优状态】。右边的图表示总的reward和每个episode的长度。the metric of total reward per episode will be frequently used。下面我们通过一个例子来例证Sarsa在这个例子当中我们考虑这样一个任务 什么任务呢我从一个特定的状态出发然后我要找到从这个状态到达目标状态的一个路径 注意这个任务是和我们到目前为止所介绍的所有的任务就网格世界的任务是不一样的因为之前所有的网格世界的任务是干嘛是要找出来每一个状态它的最优的策略但在这里边其实我们不关注每一个状态我只关注从一个特定的状态然后到达目标的这样一个策略或者是路径这个在实际当中是非常常见的然后在我们这个例子当中这个特定的状态是左上角的这样一个状态所以未来我希望大家在学习课程的时候你能够区分开来我们是要找这样从一个特定状态出发的这样一个情况还是要找所有的这个状态它的最优的策略这个就是我用Sarsa最后找到的一个最优的策略这个最优策略是从一个初始的不好的策略开始所得到的然后初始的状态是从左上角出发如果沿着这个策略沿着概率比较大的这个方向大家可以看到还是能够到达这个目标的说明这个已经达到了我们的目的但是很多其它的这个状态正像我刚才说的其实它还没有达到最优的策略那有没有可能就是它刚好找的这条路径它也能达到目标但不是最短的或者是不是最优的呢最优的恰好是在那些没有探索的地方呢这是有可能的所以这个问题就是你是想找到所有的状态它的最优的策略还是只想找到一个可行的路径就可以如果你想找到所有的最优的策略那你就必须要去探索所有的state action pair实际上我们在这个任务当中我们只进行了500次的探索 就是有一共有500个episode我们来看一下这个图大家就会更明白是怎么回事然后这个图也是我们这个课程当中第一次介绍这个图所以我稍微着重介绍一下 这个图是什么呢它的横坐标代表episode index就是我这里边一共有500个episode我最开始的episode是在左边慢慢地我不断地根据这个改进的策略然后我重新采集得到的这个episode 这个是横坐标然后纵坐标 第一个图代表是沿着每一个episode的我所得到的total reward大家可以看在最开始的时候 reward的是比较负的为什么呢因为最开始的策略是比较不好的 它可能是往墙上撞或者是进到forbidden area会有很多的负的reward进来随着策略的不断改善 大家看reward也会变得越来越大但是在这里边并没有超过0因为你到达目标这样应该是正数 为什么不是0呢就是因为这里边是ε-greedy的策略它或多或少还是会有负数的reward进来然后第二个图是代表这个episode length也就是在最开始的时候 大家可以看这个episode的长度是比较长的因为最开始的策略可能是不好的它可能走了很久它才瞎猫碰到死耗子刚好就碰到了target area 但是随着不断的改进大家可以看我再从最开始的好几百步我才能到达目标最开始沿着这个策略我就可以用几十步就可以到达目标了

相关推荐

太好了---拼多多每个账号注册会送2块钱
太好了---拼多多每个账号注册会送2块钱

这样以后买2块钱一根的数据线就不用花钱了至于美团和京东10块钱话费我就不要了,太多了。。。。。。。。。 · 2026/9/27 22:29:12

VScode 插件 package.json 中 Contribution 字段配置详解:从 settings.json 骨架到 TaoToken 统一 Key 接入
VScode 插件 package.json 中 Contribution 字段配置详解:从 settings.json 骨架到 TaoToken 统一 Key 接入

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 22:29:12

别再说不懂AI了!一文看懂AI应用分类与TaoToken统一接入配置
别再说不懂AI了!一文看懂AI应用分类与TaoToken统一接入配置

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 22:29:12

用 C++ 写 Web 服务实战(五):SSL/TLS、HTTP/2 与生产环境部署
用 C++ 写 Web 服务实战(五):SSL/TLS、HTTP/2 与生产环境部署

用 C 写 Web 服务实战(五):SSL/TLS、HTTP/2 与生产环境部署 前四篇我们从零搭起了 Web 应用,走完了路由、中间件、文件上传、WebSocket 实时通信和服务端推送。到这为止,你的 C 服务在功能层面已经完整了。但功能完整… · 2026/9/27 23:01:32

ViT 不是和 Transformer 并列的东西:真正该对比的是 CNN 和 Transformer 两套看图方式
ViT 不是和 Transformer 并列的东西:真正该对比的是 CNN 和 Transformer 两套看图方式

摘要:本文先纠正一个常见误区——ViT 并不是和 Transformer 并列的独立架构,它就是 Transformer 在视觉任务上的落地版本。真正值得对比的是 CNN 和 Transformer 这两套“看图方式”:CNN 靠局部窗口层层堆叠扩大视野,省参数、适合… · 2026/9/27 23:01:32

SpringBoot新手最容易忽略的7个细节
SpringBoot新手最容易忽略的7个细节

很多新手跑通第一个接口就以为掌握了SpringBoot,结果上线后才发现坑一个比一个深。框架帮你做了太多默认决策,你不问为什么,它就默认你懂。可这些默认值,恰恰是生产事故的源头。启动类的位置,决定了包扫描的边界Spring… · 2026/9/27 23:01:32

pastel 0.12.0 Windows x64 下载:颜色查看与格式转换示例
pastel 0.12.0 Windows x64 下载:颜色查看与格式转换示例

pastel 0.12.0 Windows x64 下载 官方发行页 本文整理 pastel 0.12.0 的 Windows x64 MSVC 压缩包。备用入口经草料提示页进入夸克,点击“继续访问”后查看文件;实际登录与下载要求以页面为准。 下载文件 文件名:pastel-v0.12.0-x86_64-p… · 2026/9/27 23:01:32

Yolov8训练使用蔬菜检测数据集 蔬菜12类检测 voc yolo 并实现可视化及评估 土豆鸡蛋辣椒胡萝卜黄瓜数据集进行检测
Yolov8训练使用蔬菜检测数据集 蔬菜12类检测 voc yolo 并实现可视化及评估 土豆鸡蛋辣椒胡萝卜黄瓜数据集进行检测

使用Yolov8训练使用蔬菜检测数据集 7400张 蔬菜12类检测 带标注 voc yolo 并实现可视化及评估 蔬菜检测数据集 7400张 蔬菜12类检测 带标注 voc yolo 分类名: (图片张数,标注个数) cabbage: (2097, 2842) potato: (961,3224) onion: (3028&am… · 2026/9/27 23:01:32

Java面试中JVM调优问题,这样回答直接拿offer
Java面试中JVM调优问题,这样回答直接拿offer

面试官推了推眼镜,抛出那个让无数Java程序员心跳加速的问题:“你们线上JVM是怎么调优的?”有人开始背参数,有人直接说“用默认的”,有人把Xmx和Xms念了一遍就没了下文。这个问题之所以难,不是因为它有多深奥… · 2026/9/27 23:01:26

MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现

简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01

汕头网站建设制作厂家避坑指南:5大注意事项救急
汕头网站建设制作厂家避坑指南:5大注意事项救急

汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01

多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习

简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01

MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现

简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01

汕头网站建设制作厂家避坑指南:5大注意事项救急
汕头网站建设制作厂家避坑指南:5大注意事项救急

汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01

多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习

简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码