제7장. 강화 학습 트랜스포머
이 작품은 AI를 사용하여 번역되었습니다. 여러분의 피드백과 의견을 환영합니다: translation-feedback@oreilly.com
강화 학습 (RL)은 환경으로부터의 피드백을 통해 순차적인 결정을 내리는 데 기반을 둔 패러다임입니다. 생각해 보면, 상호 작용을 통한 학습은 새로운 개념이 아닙니다. 사실, 여러분은 평생 동안 RL의 기본 원리에 익숙해져 왔습니다. 이는 명시적인 교사가 없어도 주변 환경과 상호 작용하며 종종 배우기 때문입니다. 예를 들어, 어린 시절 여러분은 주변 환경이 어떻게 반응하는지 알아보기 위해 물건을 만지거나 입에 넣곤 했을 것입니다. 집 고양이에게 긁혀서 울게 되는 것과 같은 결과를 바탕으로, 다음에 무엇을 해야 할지 배웠습니다. 이러한 경험을 통해 여러분은 고양이 꼬리를 다시는 잡아당기지 않는 것과 같은 향후 행동을 위한 “정책”을 개발했습니다.
이러한 학습 과정은 RL 에이전트가 작동하는 방식을 반영합니다. 따라서 이 장에서는 환경으로부터 학습하는 것에 대한 여러분의 자연스러운 이해를 바탕으로, 주요 RL 개념들을 논의하며 이를 확장해 나갈 것입니다. 구체적으로, 온라인 학습과 오프라인 학습의 차이, 모델 기반 접근법과 모델 프리 접근법, 온-폴리시(on-policy)와 오프-폴리시(off-policy) RL의 차이 등을 포함하여 전통적인 RL 알고리즘에 대한 입문적인 개요를 제공할 것입니다.
이러한 기초 개념에 대한 기본적인 이해를 바탕으로, 결정 트랜스포머(decision transformer), 온라인 결정 트랜스포머(online decision transformer), 효율적인 확률적 트랜스포머 기반 세계 모델(efficient stochastic transformer-based world models)과 같은 RL 트랜스포머의 최신 아키텍처를 탐구하게 될 것입니다.
강화 학습 시작하기
일반적으로 환경과의 상호작용은 마르코프 결정 과정 (MDP)의 틀 안에서 이루어집니다. MDP는 결과가 부분적으로는 무작위적이고 부분적으로는 의사결정자의 통제하에 있는 환경에서 의사결정을 모델링하는 데 사용되는 수학적 프레임워크로, 상태, 행동, 전이 확률 및 보상으로 특징지어집니다. 작동 방식은 다음과 같습니다. 에이전트가 행동을 선택합니다 를 선택합니다 환경의 현재 상태에 따라. 그 후 에이전트는 보상이라는 형태로 피드백을 받게 된다 . 이 피드백에 따라 에이전트는 자신의 상황을 새로운 상태 . 그림 7-1은 이러한 상호작용을 보여줍니다.
그림 7-1. 에이전트가 환경과 상호작용하는 방식을 보여주는흐름도 .
수학적으로 이는 다음과 같이 표현할 수 있습니다:
마르코프 과정
미래 상태가 그 이전의 사건 시퀀스가 ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access