首页/新闻资讯/正文详情

第 3 课:第一个 MuJoCo Agent——Random Agent

发布时间:2026/9/26 8:15:53 来源:云帆数科 栏目:资讯中心
第 3 课:第一个 MuJoCo Agent——Random Agent
一、本节目标本节仍然不训练算法。目标是把上一节的环境测试整理成完整的 Agent–Environment Loop。对应代码lesson01/01_random_agent.py完成后应能解释Random Agent 的 Policy 是什么Observation 和 Action 的实际类型与 shapereset()和step()返回的数据怎样流动为什么“Agent 能行动”不等于“Agent 在学习”。二、先看完整代码import gymnasium as gym env gym.make( InvertedPendulum-v5, render_modehuman ) observation, info env.reset() print(初始 observation:) print(observation) print(\nobservation space:) print(env.observation_space) print(\naction space:) print(env.action_space) for step in range(1000): action env.action_space.sample() observation, reward, terminated, truncated, info env.step(action) print( fstep{step}, faction{action}, freward{reward} ) if terminated or truncated: print(Episode finished!) observation, info env.reset() env.close()运行cd lesson01 python3 01_random_agent.py三、什么是 Random Agent代码中决定动作的是action env.action_space.sample()因此它的 Policy 是每一步都从合法 Action space 随机采样。它确实有选择动作的方法所以可以说它有一个随机 Policy但是它没有根据经验更新任何参数因此不会学习。四、逐行理解重要代码1.observation, info env.reset()这行使用 Python 的“序列解包”右侧返回两个对象左侧使用两个变量接收。当前环境的一次初始输出可能类似[-0.003, 0.008, 0.001, -0.005]它是 NumPy arrayshape (4,) dtype float64四个元素的准确物理意义应以环境文档为准。当前学习重点是理解Agent 每一步接收一个长度为 4 的连续数值向量。2. 打印 Observation spaceprint(env.observation_space)实测形式是Box(-inf, inf, (4,), float64)逐项解释Box连续数值空间-inf, inf各维没有有限上下界(4,)shape 为一维长度 4float64元素类型。3. 打印 Action spaceprint(env.action_space)该环境的形式是Box(-3.0, 3.0, (1,), float32)Action 是一个 shape 为(1,)的数组而不是离散整数0/1/2。例如action [1.42]4. f-stringfstep{step}, action{action}, reward{reward}字符串前面的f表示 f-string。花括号中的变量会被替换成当前值。如果step3、action[1.2]打印结果会包含step3, action[1.2]5. 为什么需要 resetif terminated or truncated: observation, info env.reset()episode 已结束后旧 episode 的状态不应继续使用。reset()返回下一局的初始 Observation。五、一次循环的数据流假设当前 Observation 为o_to_t ↓ 随机 Policyaction_space.sample() ↓ a_t ↓ env.step(a_t) ↓ o_(t1), r_t, terminated, truncated, info变量覆盖需要特别注意observation, reward, terminated, truncated, info env.step(action)执行后变量observation不再保存旧 Observation而是保存新的 Observation。六、运行现象怎样回到理论Random Agent 往往很快失去平衡因为动作与当前 Observation 没有合理关系。这说明有 Agent–Environment Loop ≠ 有学习 ≠ 能解决任务当前程序只证明环境能够接收 Action环境能够返回 Observation 和 Rewardepisode 结束后能够重新开始。七、建议实验实验 1打印 shape在 reset 后增加print(observation.shape , observation.shape)在采样动作后增加print(action.shape , action.shape)观察(4,)和(1,)的区别。实验 2缩短运行把range(1000)改成range(20)确认这只改变总步数。八、常见错误把 Action space 当成离散动作该 MuJoCo 环境使用连续BoxAction不能直接照搬后续SimpleMoveEnv的0/1/2动作。把 Random Agent 叫作训练算法它有 Policy但没有更新过程所以不是学习算法。把总循环 step 当作 episode step外层step从 0 数到 999中间 reset 后它不会重新变成 0。九、本节复盘Observation shape(4,) Action shape(1,) Policy随机采样合法动作 学习没有 episode 结束reset真正的强化学习算法会替换“随机选择动作”这一部分但算法必须和环境的动作空间匹配。

相关推荐

STM32F091RC-NUCLEO 开发板 RT-Thread BSP 使用指南:快速上手与外设驱动配置
STM32F091RC-NUCLEO 开发板 RT-Thread BSP 使用指南:快速上手与外设驱动配置

操作系统嵌入式物联网嵌入式OSRTOS 【免费下载链接】rt-thread RT-Thread is an open source IoT Real-Time Operating System (RTOS). https://rt-thread.github.io/rt-thread/ 项目地址: https://gitcode.com/gh_mirrors/rt/rt-thread 点击查看 免费下载 NUCLEO-… · 2026/9/26 8:15:53

ESPnet2 中文普通话 ASR 实战:基于 zh_openslr38 语料库的 Conformer 与 HuBERT SSLR 基线复现指南
ESPnet2 中文普通话 ASR 实战:基于 zh_openslr38 语料库的 Conformer 与 HuBERT SSLR 基线复现指南

人工智能语音音频深度学习NLP 【免费下载链接】espnet End-to-End Speech Processing Toolkit 项目地址: https://gitcode.com/gh_mirrors/es/espnet 点击查看 免费下载 本文以 ESPnet 仓库中的 zh_openslr38 配方 README 为核心,系统讲解如何基于开源的… · 2026/9/26 8:15:47

WorkBuddy十大核心技能实战:从项目初始化到MCP服务构建的效率提升指南
WorkBuddy十大核心技能实战:从项目初始化到MCP服务构建的效率提升指南

1. 为什么 WorkBuddy 的技能体系值得认真对待WorkBuddy 这类工具型产品,最怕的就是“装完就吃灰”。我见过太多人兴冲冲地装好,打开界面点两下,然后就没有然后了。问题不在于工具本身,而在于没有把它的技能模块和日常真实的工作流… · 2026/9/26 8:15:41

开关电源PCB降辐射实战:环路面积、地缝合与滤波布局
开关电源PCB降辐射实战:环路面积、地缝合与滤波布局

做开关电源的兄弟,多半都有这样一段经历:原理图该仿真的仿真了,板子画得也算用心,结果送实验室一跑预扫,辐射超标,回来只能抱着近场探头在板子上扫热区。干这行久了,我越来越觉得,电… · 2026/9/26 8:45:25

Origin 2025b正版安装与科研绘图配置指南
Origin 2025b正版安装与科研绘图配置指南

1. 先说清楚:Origin不是“破解软件”,而是科研绘图领域的专业工具OriginLab公司开发的Origin,是全球高校、研究所和工业研发实验室中广泛使用的科学数据分析与可视化平台。它不是Photoshop或Excel的替代品,而是一个专为实验数据处… · 2026/9/26 8:45:25

OpenClaw部署门槛高?上门安装是智商税还是真省事?
OpenClaw部署门槛高?上门安装是智商税还是真省事?

这段时间身边陆续有朋友问我:OpenClaw 上门安装这门生意到底靠不靠谱?说实话,我一开始看到有人在网上挂“OpenClaw 部署服务,上门安装,跑通为止”的链接时,第一反应是这东西也有人付费?但当我实… · 2026/9/26 8:45:25

AI漫剧剧本征集实战:从投稿到签约的完整制作流程与避坑指南
AI漫剧剧本征集实战:从投稿到签约的完整制作流程与避坑指南

1. 从一纸征集令看AI漫剧的行业风口河南广播电视新媒体放出的这则AI漫剧剧本征集令,奖金、证书、签约三件套摆在一起,对内容创作者来说吸引力相当直接。我注意到这个消息在圈子里传开之后,不少做短剧的朋友都在讨论——不是讨论要不要参加&am… · 2026/9/26 8:45:18

硅基之路:中国计算机与IT产业七十年奋斗史
硅基之路:中国计算机与IT产业七十年奋斗史

从一台每秒运算30次的笨重机器,到登顶全球超级计算之巅;从一间不到20人的实验室,到万亿级数字产业生态——这不仅是一部技术史,更是一个民族在数字时代的觉醒录。 ‍ 一、萌芽与奠基(1950s—1960s)&#xf… · 2026/9/26 8:45:18

INT8量化本质:不是类型转换,而是计算范式重构
INT8量化本质:不是类型转换,而是计算范式重构

1. 项目概述:为什么INT8量化不是“把浮点数砍成整数”那么简单你手头有个7B参数的Qwen2.5模型,想在树莓派5上跑起来——它有4GB内存、双核Cortex-A76,但一加载FP16模型就直接OOM;或者你在RK3588开发板上部署YOLOv8,推理… · 2026/9/26 8:45:18

数据库课后习题答案别硬背:当测试用例集刷,效率翻倍
数据库课后习题答案别硬背:当测试用例集刷,效率翻倍

简介:万常选版《数据库原理与设计》课后习题答案资源,覆盖第2至6章及第9章,适合正在学习关系模型、数据库建模、关系数据理论与模式求精的本科生、自学者作为复习与自测材料。压缩包共7个文件,含3个doc参考答案、2个sql示例脚本、… · 2026/9/26 0:00:21

OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置
OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 0:00:40

向下兼容与向上兼容:接口设计中的兼容性策略与工程实践
向下兼容与向上兼容:接口设计中的兼容性策略与工程实践

一次版本升级事故,是很多团队绕不过去的坎。线上环境里,服务端明明已经上线了新版接口,老的移动端还在照着旧文档传参数。请求一到网关,校验直接拒绝,用户操作失败,客服群炸了锅,开发群里开始互… · 2026/9/26 0:00:46

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码