본문으로 건너뛰기

GLOSSARY

도메인 랜덤화

Domain Randomization고급

도메인 랜덤화(Domain Randomization)란 시뮬레이션 환경의 물리 파라미터(마찰 계수, 질량, 관절 댐핑 등)와 시각적 속성(조명, 텍스처, 카메라 위치 등)을 학습 중 무작위로 변화시켜, 정책 네트워크가 실제 환경의 변동성을 포괄하도록 훈련하는 기법이다. 시뮬레이션과 현실 사이의 간극(reality gap)으로 인해 시뮬레이션에서 학습한 정책이 실제 로봇에 그대로 이전되지 않는 문제를 완화하기 위해 고안되었다. 무작위화 범위가 충분히 넓으면 학습된 정책은 실제 환경을 시뮬레이션 분포의 한 샘플로 간주할 수 있게 되어, 추가적인 실제 데이터 수집 없이도 정책 전이가 가능해진다. OpenAI의 Dactyl 프로젝트에서는 수백 가지 파라미터를 무작위화한 시뮬레이션으로 학습한 정책을 별도의 파인튜닝 없이 실제 로봇 손(Shadow Hand)에 직접 적용해 루빅스 큐브 조작에 성공하였다. 도메인 적응(Domain Adaptation)이 실제 환경의 데이터를 활용해 도메인 간 분포 차이를 줄이는 방식인 데 반해, 도메인 랜덤화는 실제 데이터 없이 시뮬레이션만으로 진행한다는 점에서 구분된다.