2026年秋江苏开放大学强化学习060733形考作业1答案

试题列表
单选题
题型:单选题客观题分值5分难度:简单得分:5
1
强化学习智能体的组成成分()。
A
只有策略和模型
B
只有策略和价值函数
C
可能有策略、价值函数、模型中的一个或多个成分
D
都包含策略、价值函数和模型
学生答案:C
老师点评:
题型:单选题客观题分值5分难度:简单得分:5
2
在最优控制理论中,贝尔曼方程的作用是什么?
A
预测环境的变化趋势
B
确定初始状态的策略
C
描述动态规划中递归地求解最优值函数的方法
D
计算每个状态的即时奖励
学生答案:C
老师点评:
题型:单选题客观题分值5分难度:简单得分:5
3
下列选项关于⻢尔可夫过程与MDP的对⽐说法错误的是( )
A
⻢尔可夫过程反映的是客观规律,MDP反映的是具体问题
B
⻢尔可夫过程体现宏观性质,MDP体现主观操作
C
⼯程中很多实际问题适合被定义为⻢尔可夫过程⽽⾮MDP
D
MDP关注的是如何对⼀个具体的问题采取措施,使得获得的效果最好
学生答案:C
老师点评:
题型:单选题客观题分值5分难度:简单得分:5
4
以下对有模型强化学习和免模型强化学习说法正确的是()
A
免模型强化学习是指对环境只进行虚拟环境建模并与虚拟环境交互来学习到最优策略。
B
目前,大部分深度强化学习方法都采用了有模型强化学习。
C
针对是否需要对真实环境建模,强化学习可以分为有模型强化学习和免模型强化学习。
D
有模型强化学习不需要进行真实环境建模,用数据驱动学习。
学生答案:C
老师点评:
题型:单选题客观题分值5分难度:一般得分:5
5
下列关于动态规划思想的说法中,不正确的⼀项是( )
A
动态规划要将⼤的问题拆分成若⼲个⽐较⼩的问题,分别求解这些⼩问题,再⽤这些⼩问题的结果
来解决⼤问题
B
三连棋游戏不同的状态虽然很多,但是状态的转移其实是有⽅向性的
C
动态规划将问题在时间维度上进⾏拆分,称为时间差分,即利⽤下⼀时刻状态的价值计算当前时刻
状态的价值,直到计算出所有状态的价值
D
对于三连棋游戏,可以按照从前往后的顺序依次找出各种状态的价值
学生答案:D
老师点评:
题型:单选题客观题分值5分难度:简单得分:5
6
在多臂老虎机问题中,采用 ε-贪心策略时,概率 ε 通常表示什么?
A
随机探索其他动作的概率
B
选择当前估计价值最高动作的概率
C
获得最大奖励的概率
D
更新动作价值的学习率
学生答案:A
老师点评:
题型:单选题客观题分值5分难度:简单得分:5
7
马尔可夫性质强调,系统下一时刻的状态主要取决于什么?
A
从初始时刻开始的全部历史状态
B
智能体过去获得的全部奖励
C
所有可能采取的动作
D
当前状态
学生答案:D
老师点评:
题型:单选题客观题分值5分难度:简单得分:5
8
强化学习中的策略的含义是()
A
策略把输入的状态变为价值。
B
策略是智能体的动作模型,它决定了智能体的动作。
C
我们不能把策略看做是一个函数。
D
策略只有随机的形式。
学生答案:B
老师点评:
题型:单选题客观题分值5分难度:中等得分:5
9
在三连棋游戏中,位于状态s0,采⽤策略,然后有1/3的概率会达到获胜的状态,有2/3的概
率到达中间状态s1;之后这个中间状态在该策略下会有3/4的概率到达获胜的状态, 1/4的概率到达平局
的状态,若获胜的价值为1,平局价值为0,则该策略下状态s0的价值image.png为( )
A
5/6
B
1/2
C
1/3
D
2/3
学生答案:A
老师点评:
题型:单选题客观题分值5分难度:简单得分:5
10
下列关于epsilon-greedy策略的说法正确的是( )
A
每次游戏中产⽣服从0到1之间均匀分布的随机数
B
每次游戏中产⽣服从0到10之间正态分布的随机数
C
每次游戏中产⽣服从0到10之间均匀分布的随机数
D
每次游戏中产⽣服从0到1之间正态分布的随机数
学生答案:A
老师点评:
题型:单选题客观题分值5分难度:简单得分:5
11
关于多臂⽼⻁机问题的描述,下列说法错误的是( )
A
⽬标是在有限的摇动次数中获得更多的硬币奖励
B
每个摇臂的中奖概率不完全相同
C
多臂⽼⻁机问题可以转化为⼀个⾮退化的MDP问题
D
每个摇臂的中奖概率是未知的
学生答案:C
老师点评:
题型:单选题客观题分值5分难度:简单得分:5
12
对于强化学习中模型的理解是()。
A
模型中的奖励函数是指我们在当前状态采取了某个动作,可以得到多大的奖励。
B
马尔可夫决策过程中可以有模型,也可以没有模型。
C
模型决定了下一步要采取的动作。
D
它由状态、动作、状态转移概率和奖励函数几个部分组成。
学生答案:A
老师点评:
题型:单选题客观题分值5分难度:简单得分:5
13
价值函数可以这样理解()。
A
价值函数的值是对当下及时奖励评价。
B
有一种价值函数:Q 函数。Q 函数里面包含两个变量:状态和动作。
C
价值函数就是评估动作好坏的函数。
学生答案:B
老师点评:
多选题
题型:多选题客观题分值5分难度:简单得分:5
1
在最优控制中,动态规划算法的应用前提包括:
A
可以处理无限状态空间
B
奖励函数明确
C
环境模型已知
D
无需环境反馈
E
状态空间有限且离散
学生答案:B;C;E
老师点评:
题型:多选题客观题分值5分难度:简单得分:5
2
马尔可夫决策过程通常包含哪些基本要素?
A
奖励函数
B
动作集合
C
监督学习标签
D
状态转移概率
E
状态集合
学生答案:A;B;D;E
老师点评:
题型:多选题客观题分值5分难度:简单得分:5
3
基于策略和基于价值的强化学习方法的区别有()
A
基于价值迭代的方法只能应用在不连续的、离散的环境下(如围棋或某些游戏领域)。
B
在基于价值的强化学习方法中,智能体不需要制定显式的策略,它维护一个价值表格或价值函数,并通过这个价值表格或价值函数来选取价值最大的动作。
C
基于价值的强化学习算法有Q 学习(Q-learning)、Sarsa等,而基于策略的强化学习算法有策略梯度算法等。
D
在基于策略的强化学习方法中,智能体会制定一套动作策略(确定在给定状态下需要采取何种动作),并根据这个策略进行操作。
学生答案:A;B;C;D
老师点评:
题型:多选题客观题分值5分难度:简单得分:5
4
在多臂老虎机问题中,探索与利用的权衡可以通过哪些策略实现?
A
Thompson Sampling
B
Q-learning
C
Upper Confidence Bound (UCB)
D
ε-greedy
E
Sarsa
学生答案:A;C;D
老师点评:
题型:多选题客观题分值5分难度:简单得分:5
5
关于探索(Exploration)与利用(Exploitation),下列说法正确的有:
A
利用是选择当前估计价值较高的动作
B
探索是尝试当前了解较少的动作
C
探索与利用之间不需要进行权衡
D
只进行利用可能错过潜在的更优动作
E
只进行探索通常难以充分利用已有经验
学生答案:A;B;D;E
老师点评:
简答题
题型:简答题主观题分值10分难度:简单得分:10
1
什么是多臂老虎机问题?为什么在解决该问题时需要平衡探索与利用?

答案

资源下载
下载价格10
点点赞赏,手留余香 给TA打赏

评论0

请先
  • u******* 下载了资源 2025年春江苏开放大学运动康复学050586(5.采访登山运动员登山运动所需的准备工作)答案
  • u******* 下载了资源 2026年春江苏开放大学运动康复学050586(5.采访登山运动员登山运动所需的准备工作)
  • d******* 下载了资源 2024年春江苏开放大学美术课程标准与教材研究060617实践作业——教学设计
  • d******* 下载了资源 2024年春江苏开放大学美术课程标准与教材研究060617实践作业——教学设计
  • 游客 下载了资源 2026年秋江苏开放大学维修电工实训050105第1次形考作业
  • 1******* 投稿收入增加4块钱
  • 游客 购买了资源 2026年秋江苏开放大学维修电工实训050105第1次形考作业
  • u******* 登录了本站
  • u******* 登录了本站
  • u******* 登录了本站
  • u******* 登录了本站
  • d******* 登录了本站
  • 游客 下载了资源 2023上半年教师资格证考试《高中生物》题(解析)精选
  • u******* 登录了本站
  • u******* 登录了本站
  • u******* 加入了本站
点击浏览器地址栏的⭐图标收藏本页
需要托管,代写作业(含实训)可以扫码加微信
显示验证码

社交账号快速登录

微信扫一扫关注
如已关注,请回复“登录”二字获取验证码