강화학습과 마르코프 결정 과정( MDP, Markov Decision process) 관계 요약
마르코프 결정 과정 (MDP, Markov Decision Process)는 주어진 어떤 환경에서의 의사 결정을 모델링할 수 있는 수학적 프레임워크를 제공한다고 한다. 마르코프 결정 과정(이하 MDP)는 다음과 같은 4가지 요소가 있다. 1. 상태 (State) : S 가능한 상태들의 유한 집함. 2. 행동 (Action) : A 행동들의 유한 집합. 3. 상태 전이(State transition) : P(r,s'|s,a) 상태 전이 함수. 4. 보상(Reward) : R 보상 함수. 위 네가지 요소르 보면, openai gym으로 강화학습 환경 을 만들었을때의 그것과 유사한점이 있어 보인다. Agent -------- action ---------v ^-- observation , reward -- Enviroment -------------------------------------------------------------- 강화학습 MDP -------------------------------------------------------------- action 행동(Action) reward ...