본문으로 건너뛰기

GLOSSARY

행동 복제

Behavior Cloning고급

행동 복제란 전문가의 시연(demonstration)에서 수집한 상태-행동 쌍을 지도 학습으로 학습하여 정책(policy)을 직접 도출하는 모방 학습(imitation learning)의 한 방법이다. 보상 함수를 수작업으로 설계하기 어려운 태스크에서, 전문가 데이터만으로 초기 정책을 빠르게 구축할 수 있다는 점에서 실용적으로 쓰인다. 로봇 조작(manipulation), 자율주행, 게임 에이전트 등 다양한 분야에서 초기 정책 학습 또는 오프라인 사전 학습 단계에 활용된다. 예를 들어, 사람이 텔레오퍼레이션으로 시연한 로봇팔 집기 동작을 녹화한 뒤, 각 시점의 관절 상태와 행동을 입출력 쌍으로 삼아 신경망을 훈련하는 방식이 대표적이다. 그러나 학습 분포와 배포 분포의 불일치(distributional shift)로 인해 오차가 누적되는 복합 오차(compounding error) 문제가 발생할 수 있으며, 이를 완화하기 위해 DAgger(Dataset Aggregation)와 같은 온-폴리시 데이터 수집 기법이 제안되어 있다. 역강화학습(Inverse Reinforcement Learning)이 전문가 데이터로부터 보상 함수를 역추정한 뒤 정책을 유도하는 것과 달리, 행동 복제는 보상 함수 추정 단계 없이 정책을 직접 학습한다.