PrefPI: 분포 외 행동으로의 선호도 기반 유도
PrefPI: Preference-Guided Steering into Out-of-Distribution Behaviors
Seungeun Rho, Wontaek Kim, Danfei Xu, Sehoon Ha
PrefPI(Preference-Guided Policy Iteration)는 사전학습된 생성형 로봇 정책을 자체 생성 궤적에 대한 상대적 선호도만으로 조정하는 반복 프레임워크다. 기존 선호도 학습 방법이 이미 정책에 표현된 행동 모드를 강화하는 데 집중했다면, PrefPI는 초기 정책에서 거의 관찰되지 않는 분포 외(out-of-distribution) 행동 영역으로 유도하는 것을 목표로 한다. 선호 궤적을 조건부 분포로 정의하고, 분류자 없는 유도(CFG, classifier-free guidance)로 암묵적 선호 신호를 증폭하는 선호 조건부 생성 모델링으로 문제를 재구성한다. 확산 정책(diffusion policy)과 PI0.5 흐름 매칭(flow-matching) 시각-언어-행동 모델(VLA)에 적용한 실험에서 시뮬레이션과 실기 환경 모두 제한된 피드백으로 유의미한 행동 변화를 달성한다. 실기 실험에서는 선호도 레이블 궤적 150개만으로 물체 이송 높이가 10.7 cm에서 19.8 cm로 증가하는 결과를 보였다.







