본문으로 건너뛰기

TAG

#학습 정책

이 태그가 붙은 기사를 모았습니다. 태그는 AI 분류 단계에서 자동으로 붙고, 검수를 통과한 항목만 노출됩니다.

1건
Vitaly Gariev / Unsplash
ROS Discourse

제안: 로봇 정책 견고성 수치에 비섭동(no-perturbation) 기준 조건을 함께 보고하자

로봇 학습 정책(learned policy)의 견고성(resilience) 평가에서 현재 관행은 섭동(perturbation) 조건 하의 실패율만 단일 수치로 보고하는 경우가 많다. 저자는 시뮬레이션 환경에서 19개 섭동 패밀리와 8개 정책 어댑터를 대상으로 동일 시드를 반복 실행한 결과, 비섭동 조건에서도 패밀리마다 다른 비율의 기저 실패율이 존재함을 확인했다. 시도 횟수 50회 기준으로 이 기저 실패율을 차감하면 대부분의 패밀리에서 측정된 섭동 효과가 사라져, 현재 보고되는 견고성 수치가 과제 설정 자체의 기저 난이도까지 함께 측정하고 있음을 시사한다. 저자는 ①섭동 조건의 실패율, ②동일 시드·과제에서의 비섭동 실패율, ③각각의 시도 횟수, ④양측 신뢰구간을 함께 보고하는 관례를 제안한다. 이 방법론을 구현한 오픈소스(Apache-2.0) 평가 도구 Provael도 함께 공개되어 있다.

큐레이터시뮬레이션 환경에서만 검증된 결과이므로 실제 하드웨어에서 기저 실패율이 동일한 분포를 보이는지는 별도 확인이 필요하다. 패밀리당 50회 시도라는 규모를 감안하면, 저자가 제안하는 신뢰구간이 실제로 얼마나 좁게 추정되는지도 쟁점이 될 수 있다.