
524
|
第
18
章
18.1 学习优化奖励
在强化学习中,软件智能体在环境中进行观察并采取行动,作为回报,它会获得奖励。
它的目标是学会以一种可以随时间推移最大化其预期回报的方式来采取行动。如果你不
介意拟人化,则可以把正面奖励视为愉悦,把负面奖励视为痛苦(在这种情况下,“奖
励”一词有点误导)。简而言之,该智能体在环境中行动,并通过反复试错来学习,以
最大限度地提高其愉悦并最大限度地减少其痛苦。
这是一个相当广泛的设定,可以应用于各种各样的任务。以下是一些示例(见图 18-1):
a. 该智能体可以是控制机器人的程序。在这种情况下,环境就是现实世界,智能体通
过一组传感器(例如摄像头和触摸传感器)来观察环境,其动作包括发送信号以激
活电动马达。它可能被编程为在到达目的地时获得正奖励,而在浪费时间或走错方
向时获得负奖励。
b. 该智能体可以是控制 Ms.Pac-Man 的程序。在这种情况下,环境是 Atari 游戏的模
拟,动作是 9 个可能的操纵杆位置(左上、下、中心等),观察结果是屏幕截图,而
奖励是游戏点数。
c. 类似地,智能体可以是玩棋盘游戏(例如围棋)的程序。
d. 智能体不必控制物理(或虚拟)移动的事物。例如,它可以是一个智能恒温器,只
要温度接近目标温度并节省能源,它就会获得正回报;而当人们需要调节温度时,
它就会获得负回报,因此智能体商必须学会预测人类的需求。
e. 智能体可以观察股市价格并决定每秒要买卖多少。奖励显然是金钱的盈利或者损失。
图 18-1 :强化学习示例:(a)机器人技术;(