
디코더가 적을수록 인코더가 강해진다: 새로운 시점 합성을 통한 기하학적 표현 학습
Less Decoder is More Encoder: Geometric Representation Learning from Novel View Synthesis
Keerthi Kaashyap, Dennis Anthony, Akshay Krishnan, Nhi Ngoc Nguyen, Jeremy Collins 외 3명
이 논문은 새로운 시점 합성(Novel View Synthesis, NVS) 기반 인코더의 기하학적 표현 능력이 낮은 원인을 구조적 측면에서 분석한다. 문제는 지도 신호 부족이 아니라, 공간 표현력이 높은 디코더가 인코더의 표현 능력을 희석시키고 저수준 픽셀 공간 목표가 특징 학습을 방해하는 설계 선택에 있음을 밝혔다. 저자들은 포즈 조건부 로컬 디코더(pose-conditioned local decoder)와 잠재 공간(latent space) 재구성 목표를 결합한 자기지도 인코더-디코더 트랜스포머 SNAP을 제안한다. SNAP은 시각적 위치 추정, 포즈 추정, 점 대응, 깊이 추정, 로봇 조작 등 5가지 과제에서 기하학 감독 방법 및 자기지도 방법과 경쟁력 있는 성능을 나타냈다. 또한 SNAP의 패치 특징은 카메고 시점 변화 시 표준 2D 표현이 실패하는 상황에서도 성능 저하가 완만하게 나타나는 창발적 시점 불변성(emergent viewpoint invariance)을 보였다.















