
SpatialCrafter: 생성적 3D 프록시를 활용한 단일 이미지 세계 모델링
SpatialCrafter: Single Image World Modeling with Generative 3D Proxies
Chuan Fang, Lingteng Qiu, Yixun Liang, Rui Chen, Kunming Luo 외 6명
SpatialCrafter는 단일 이미지에서 탐색 가능한 3D 장면을 생성하는 2단계 프레임워크로, 글로벌 3D 프록시(proxy)를 활용해 기존 비디오 확산 모델(VDM)의 기하학적 불일치와 장기 드리프트 문제를 완화한다. 1단계에서는 Point-anchored Sparse Structure(PaSS) Flow 모듈이 공간적으로 정렬된 기하학적 일관성 있는 3D 프록시를 예측하고, 2단계에서는 VDM 기반 Generative Deferred Refiner가 프록시 위에 고주파 포토리얼리스틱 세부 묘사를 합성한다. 프록시와 사전 학습된 VDM의 통합을 위해 Parallel Geometry Injection과 Proxy-Aware Corruption 학습 전략을 도입하여, 프록시 아티팩트에 대한 견고성을 높이면서 기존 생성 모델의 성능을 유지한다. 연구팀은 이 과제에 적합한 데이터셋이 없어 11만 5천 개 장면으로 구성된 대규모 하이브리드 데이터셋을 새롭게 구축했다. 합성 및 실세계 데이터셋 실험에서 급격한 카메라 움직임과 극단적인 시점 변화에도 기존 방법 대비 우수한 3D 일관성을 보인다.







