首页/新闻资讯/正文详情

RL-赵-(七)-不基于模型2-时序差分/TD算法02:计算出给定π下的State Value【求解出State Value➜PE➜PI➜找最优π】

发布时间:2026/9/24 2:44:51 来源:云帆数科 栏目:资讯中心
RL-赵-(七)-不基于模型2-时序差分/TD算法02:计算出给定π下的State Value【求解出State Value➜PE➜PI➜找最优π】
二、TD learning of state valuesTD learning既可以指一大类的强化学习算法,也可以指一个具体的estimating state values的算法。TD算法是基于数据,也就是不基于模型来实现强化学习。1、TD算法描述TD算法要求的data/experience如下:给定π ππ产生的( s 0 , r 1 , s 1 , … , s t , r t + 1 , s t + 1 , … ) o r { ( s t , r t + 1 , s t + 1 ) } t (s_0,r_1,s_1,\ldots,s_t,r_{t+1},s_{t+1},\ldots)\mathrm{~or~}\{(s_t,r_{t+1},s_{t+1})\}_t(s0​,r1​,s1​,…,st​,rt+1​,st+1​,…)or{(st​,rt+1​,st+1​)}t​TD算法如下:{ v t + 1 ( s t ) = v t ( s t ) − α t ( s t ) [ v t ( s t ) − [ r t + 1 + γ v t ( s t + 1 ) ] ] v t + 1 ( s ) = v t ( s ) , ∀ s ≠ s t \color{red}{ \left \{\begin{array} {l}v_{t+1}(s_t)=v_t(s_t)-\alpha_t(s_t)\Big[v_t(s_t)-[r_{t+1}+\gamma v_t(s_{t+1})]\Big]\\[1ex] \\v_{t+1}(s)=v_t(s),\quad\forall s\neq s_t \end{array} \right.}⎩⎨⎧​vt+1​(st​)=vt​(st​)−αt​(st​)[vt​(st​)−[rt+1​+γvt​(st+1​)]]vt+1​(s)=vt​(s),∀s=st​​其中:t = 0 , 1 , 2 , . . . t=0,1,2,...t=0,1,2,...,这里的v t ( s t ) v_t(s_t)vt​(st​)是v π ( s t ) v_\pi(s_t)vπ​(st​)的estimated state value,s ss是state space,α t ( s t ) \alpha_t(s_t)αt​(st​)是在t tt时刻s t s_tst​的学习率。在t tt时刻,只有visited states t s_tst​的值被更新,而unvisited statess ≠ s t s\neq s_ts=st​的 values 保持不变。在等式 (2) 中的更新过程在后面的内容中将被省略2、TD算法详细解析对TD算法进行一些标注:v t + 1 ( s t ) ⏟ newestimate = v t ( s t ) ⏟ currentestimate − α t ( s t ) [ v t ( s t ) − [ r t + 1 + γ v t ( s t + 1 ) ⏟ υ ˉ t TDtarget v ˉ t ] ] ⏞ TDerror δ t \color{red}{ \underbrace{v_{t+1}(s_t)}_{\text{new estimate}} =\underbrace{v_t(s_t)}_{\text{current estimate}} - \alpha_t(s_t)[\overbrace{v_t(s_t)-[\underbrace{r_{t+1}+\gamma v_t(s_{t+1})}_{\bar{\upsilon}_t}^{\text{TD target }\bar{v}_t}]]}^{\text{TD error}\ \delta_t}}newestimatevt+1​(st​)​​=currentestimatevt​(st​)​​−αt​(st​)[vt​(st​)−[TDtargetvˉt​rt+1​+γvt​(st+1​)​​]]​TDerrorδt​​其中:v ˉ t ≐ r t + 1 + γ v ( s t + 1 ) \bar{v}_t\doteq r_{t+1}+\gamma v(s_{t+1})vˉt​≐rt+1​+γv(st+1​)被称为TD target。δ t ≐ v ( s t ) − [ r t + 1 + γ v ( s t + 1 ) ] = v ( s t ) − v ˉ t \begin{aligned}\delta_t\doteq v(s_t)-[r_{t+1}+\gamma v(s_{t+1})]=v(s_t)-\bar{v}_t\end{aligned}δt​≐v(s

相关推荐

Play Framework 2.6 JPA 迁移指南:废弃 API 移除、JPAApi 注入与异步化改造
Play Framework 2.6 JPA 迁移指南:废弃 API 移除、JPAApi 注入与异步化改造

后端Web框架 【免费下载链接】playframework The Community Maintained High Velocity Web Framework For Java and Scala. 项目地址: https://gitcode.com/gh_mirrors/pl/playframework 点击查看 免费下载 本篇技术指南以 Play Framework 2.6 官方 JPA 迁移文档&a… · 2026/9/24 2:44:51

STM32烧录报错Contents mismatch?五大排查步骤详解
STM32烧录报错Contents mismatch?五大排查步骤详解

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/24 2:44:38

Mockery 全局配置指南:掌控不存在方法 Mock、未使用期望与内部类参数映射
Mockery 全局配置指南:掌控不存在方法 Mock、未使用期望与内部类参数映射

示例工程数据库教程后端 【免费下载链接】sql-server-samples Azure Data SQL Samples - Official Microsoft GitHub Repository containing code samples for SQL Server, Azure SQL, Azure Synapse, and Azure SQL Edge 项目地址: https://gitcode.com/gh_mirrors… · 2026/9/24 2:44:20

PM2 守护进程管理实战指南:jaywcjlove/reference 备忘清单深度解析
PM2 守护进程管理实战指南:jaywcjlove/reference 备忘清单深度解析

文档知识库教程开发工具 【免费下载链接】reference 为开发人员分享快速参考备忘清单(速查表) 项目地址: https://gitcode.com/jaywcjlove/reference 点击查看 免费下载 PM2 是一个广受欢迎的 Node.js 进程守护(daemon)管理器,用… · 2026/9/24 7:47:55

Hadoop SequenceFile 小文件合并实战指南
Hadoop SequenceFile 小文件合并实战指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/24 7:47:55

loop-engineering 的 GitHub Actions 复合动作(loop-action)使用指南:在 CI 中为自治 Agent 循环接入熔断器、就绪审计与工作树沙箱
loop-engineering 的 GitHub Actions 复合动作(loop-action)使用指南:在 CI 中为自治 Agent 循环接入熔断器、就绪审计与工作树沙箱

人工智能AI AgentAgent 工作流CLI研发协作AI 技能MCP 服务 【免费下载链接】loop-engineering Practical patterns, starters & CLI tools for loop engineering with AI coding agents. Design systems that prompt and orchestrate agents (inspired by Addy Osmani and … · 2026/9/24 7:47:55

骑行。流量很猛,车轮很慢。互联网思维别硬套
骑行。流量很猛,车轮很慢。互联网思维别硬套

骑行。流量很猛,车轮很慢。互联网思维别硬套 互联网思维讲究快。今天上线。明天迭代。后天冲榜。骑行圈不这样。骑友出门看天气。看路线。看体力。看车况。一趟长途要准备很久。骑到半路爆胎,只能蹲路边补。互联网那套快打法,在这里没用。你催… · 2026/9/24 7:47:49

I2C为什么必须开漏输出:物理层设计核心原理
I2C为什么必须开漏输出:物理层设计核心原理

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/24 7:47:43

数字后端的 Corner:把芯片放进“最坏情况“里验证
数字后端的 Corner:把芯片放进“最坏情况“里验证

景芯SoC训练营|后端时序系列|约6分钟打开 signoff 用的时序库目录,你会看到类似这样的文件名:ss_0p99v_125c.lib、ff_1p21v_m40c.lib。同一颗芯片,为什么要准备这么多套时序数据?这正是 corner(工艺角)要回… · 2026/9/24 7:47:42

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程
基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为… · 2026/9/24 0:00:13

1D-CNN时间序列建模实战:从Conv1d原理到工业落地
1D-CNN时间序列建模实战:从Conv1d原理到工业落地

简介:面向时间序列数据建模的一维卷积神经网络完整实现,适合深度学习入门者及需要快速验证时序模型的研究者,能够从音频、文本、传感器或股价等序列中挖掘局部特征与时间依赖。压缩包体积很小,只有3KB,内含3个Python脚… · 2026/9/24 0:00:26

柔软的L:汉语语流中被忽视的舌肌张力控制
柔软的L:汉语语流中被忽视的舌肌张力控制

1. 这个“L”不是字母表里的L,而是舌尖上的L最近在几个方言群和语音教学社群里,反复看到有人发一句:“也说字母L:柔软的长舌”。初看以为是英语发音课笔记,点开才发现全是方言爱好者、播音系学生、语言康复师甚至戏曲演… · 2026/9/24 0:00:44

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码