
CAST: 모델 기반 강화학습을 위한 교번 상태가치 목표와 확장된 정책 경사
CAST: Alternating State-Value Targets and Expanded Policy Gradients for Model-Based Reinforcement Learning
Pietro Noah Crestaz, Mohamed Yassine Kabouri, Nicolas Mansard, Andrea Del Prete
모델 기반 강화학습(MBRL)은 환경 모델을 학습해 행동 선택에 활용하며, 샘플 효율성이 높아 로봇공학에 적합하다. 학습된 정책에 온라인 플래닝을 결합하면 행동 선택을 더욱 개선할 수 있으나, 기존 방법들은 플래너가 유도하는 행동의 가치 대신 정책 자체의 가치만 학습하는 경향이 있었다. 저자들은 CAST(Critic with Alternating State-value Target)를 제안하며, 실제 플래너 유도 전이(transition)와 현재 정책하의 상상된 전이를 결합한 목표로 행동가치가 아닌 상태가치(state-value) 크리틱을 학습한다. 이 구조는 플래너 행동의 강점을 활용하는 동시에 학습 중인 정책으로 가치 추정치를 정규화하는 교번 과정에 해당한다. DeepMind Control Suite와 HumanoidBench Suite에서 최신 기법들과 비교 평가했으며, 실제 Unitree Go2 사족보행 로봇의 동적 물구나무서기 동작으로의 전이에도 성공했다.








