openai gym Atari게임 환경의 v0, v4, Deterministic, NoFrameskip, ram, max_episode_steps의 의미와 차이
강화 학습(reinforcement learning) 환경으로 많이 사용되는 openai gym의 게임이름 뒤에 붙는 v0, v4, Deterministic, NoFrameskip, ram의 의미와 차이는 다음과 같다. 1. v0 25% 확률로 새로 입력 받은 action을 무시하고 이전 action을 반복한다. repeat_action_probability : 0.25 2. -v4 v0와 다르게 받은 입력을 그대로 사용한다. repeat_action_probability : 0 3. Deterministic 고정된 frameskip을 사용한다. space_invaders인 경우는 frameskip=3이고, 그 외는 frameskip=4이다. 만약 Deterministic, noFrameskip 이 없을 경우는 게임 환경마다 다르지만, 랜덤으로 2~4 프레임이 스킵 된다. 4. noFrameskip 프레임 스킵을 사용하지 않는다. 5. ram (210,160,3)형태의 이미지 대신 128바이트의 observation/state 데이터를 만들어 반환한다. ram이 없는 경우는 210x160x3의 이미지가 observaion/state로 반환된다. 6. max_episode_steps 에피소드의 최대 steps를 나타낸다. 강화 학습 중 더이상 게임을 하지 않고 게임이 중단된다면, max_episode_steps를 조정할 필요가 있다. max_episode_steps는 gym\envs\__init__.py를 직접 수정하던가 아니면 아래처럼 게임 환경을 만들고 수정할 수도 있다. import gym env = gym.make('SpaceInvaders-v0') env.max_episode_steps = 100000#원하는 steps를 설정 ...